中級 11 分ニュース

自宅でKimi K3を動かす:必要なハードウェアの実情(2.8T パラメータ)

端的な回答

Kimi K3はデスクトップPCでは動作しません。ネイティブ形式の重みは1.56 TBあり、公開されている最小のGGUF量子化版(Unsloth、動的1ビット)でも594 GBを占め、推奨メモリ容量は610 GBです。512 GBのMac Studioでも、RTX 5090単体でも足りません。試すには、MoonshotのAPIか、Ollamaのkimi-k3:cloudを利用してください。ローカルで使う場合は、より小さなモデルを選んでください。

Kimi K3の重みは2026年7月末から公開されています。「ollama kimi k3」「kimi k3 lmstudio」「kimi k3 on 5090」といった検索語から、多くの読者が自宅にインストールできるかを知りたがっていることが分かります。このガイドでは、MoonshotとUnslothが公表した数値を紹介し、お使いのマシンで何を読み込めるかを計算したうえで、代わりに取れる方法を示します。

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み

#Kimi K3 のローカル実行:Moonshotが実際に公開したもの

MoonshotのHugging Faceのページでは、Kimi K3は2.8兆パラメータのオープンウェイト・マルチモーダルモデルとして説明されており、コンテキストウィンドウは100万トークンです。これはMixture-of-Experts(MoE)アーキテクチャを採用しており、896のエクスパートのうち、各トークンごとに16個が選択され、アクティブなパラメータ数は1,040億です。重みはMXFP4(重み)で配布され、アクティベーションはMXFP8を使用しています。また、教師ありファインチューニングの段階から量子化を意識した学習が適用されています。コードと重みのライセンスは「Kimi K3 License」です。商用利用の前に必ずこのテキストをお読みください。これは標準的なMITライセンスやApacheライセンスではありません。専門メディアによると、このモデルは2026年7月27日頃にHugging Faceに公開されました。

総パラメータ数/アクティブパラメータ数
合計2.8T、104Mdアクティブトークン(Moonshot)
エキスパート
896 のエキスパート、トークンごとに 16 個が選択され、さらに 2 個の共有エキスパートがあります。
公開フォーマット
MXFP4 は重みに、MXFP8 は活性化に適用されます。これは GGUF ではありません。
コンテキスト
1,048,576トークン。重みを保持するメモリに加えて、KVキャッシュ用のメモリも必要です。
推奨されるエンジン
vLLM、SGLang、TokenSpeed。llama.cppではコミュニティが提供するGGUFを使用します。
i
アクティブなパラメータ数とメモリに常駐するパラメータ数は別
各トークンの処理で稼働するのは1,040億パラメータだけですが、ルーターはどのエキスパートでも選べるため、すべての重みに常にアクセスできる必要があります。必要なハードウェアを決めるのは、計算能力ではなくメモリです。この仕組みは当サイトのMoEガイドで詳しく説明しています。

#モデルの重みが実際に占める容量

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

2 つの数値が流通しており、区別が必要です。一部の記事では、2.8 T のパラメータを半バイトで乗算して「約 1.4 TB」と推定しています。ファイルサイズの測定値はそれより高く、Unsloth と Runpod はネイティブバージョンについて 1.56 TB を示しています。これは、エキスパート以外のレイヤー(アテンション、ルーター、共有エキスパート)がより高い精度で保持されるためです。Runpod によると、非量子化の BF16 は約 5.6 TB に達します。したがって、1.4 TB と報告していたこのガイドのバージョンは、約 10 % 低すぎました。

Kimi K3の公表サイズ(出典:Unsloth、Runpod)
フォーマットサイズ推奨される総メモリ容量測定された忠実度
ネイティブMXFP4 / UD-Q8_K_XL1.56 TB1.6 TB損失なし
Unsloth UD-Q2_K_XL(動的2ビット量子化)861.3 GB880 GBトップ1の一致率は約90%です
Unsloth UD-IQ2_XXS711.1 GB726 GBトップ1一致率84.1%
Unsloth UD-IQ1_M648.9 GB665 GBtop-1 一致率 81.2 %
Unsloth UD-IQ1_S(動的 1 ビット量子化)594 GB610 GBトップ1の一致率は78.9%です
BF16 (理論値)約5.6テラバイト現実的な範囲外参考

この表は、旧バージョンに存在した誤解を否定しています。Q2は「常にテラバイトオーダー」ではありません。Unslothは確かに900 GB未満のGGUFを提供しています。しかし、594 GBは32 GBのRTX 5090のメモリにほぼ15倍の差があり、品質の差も実在します。Unslothの測定セットにおいて、動的1ビットは、元のモデルの選択を78.9%のケースでしか再現していません。ビットが品質に与える影響を理解するには、私たちの量子化ガイドをご覧ください。

#ハードウェア:推奨されるものと実現可能なもの

Moonshotはモデルの仕様ページに最小構成を公開していません。vLLM、SGLang、TokenSpeedのレシピや同社のAPIへの参照に留まっています。ネイティブセルフホスティングに関する文書化された参考値はRunpodから来ており、288 GBのGPU B300を8基備えたノード1つ(合計約2.3 TB)、または2ノードに分散配置されたB200 16基です。このページが以前引用していた「64基以上のアクセラレーター」という数値は、参照した一次情報源のいずれにも存在しないため、削除されました。

UnslothのGGUFを使う場合、同社のドキュメントが示す目安は単純です。RAMとVRAMの合計容量が量子化済みモデルのサイズとおおむね等しくなる必要があります。そうでなければ、モデルは動作してもディスクを使うようになり、大幅に遅くなります。Unslothは、モデルがB200のメモリに収まる場合、生成速度は約20トークン/秒とも述べています。これは供給元がデータセンター向けハードウェアで示した処理速度であり、家庭用マシンに適用できる測定値ではありません。

#Macではどうでしょうか?噂ではなく計算で考える

このページが報告していた「MacBook Pro M1 Maxで1トークンあたり16秒」という数値について、検証可能なソースは特定できませんでした。そのため、事実として引用していません。ソースが明確に示している内容は以下の通りです。Kingy AIは、スタートポイント(1.56 TBのチェックポイント)ですでに512 GBのMac Studioの容量を超えており、1ビット版の553.2 GiBのファイルも、負荷がかかり始める前にこのマシンの容量を超えると指摘しています。128 GBのMacは、推奨される610 GBの約5分の1の容量です。

一方で、規模の目安は自分で推定できます。メモリが不足すると、各トークンはSSDからアクティブ化するエキスパートを読み戻します。1040億パラメータを約4ビットで計算すると、トークンあたり約50 GBの読み取りが必要です。3 GB/sのSSDではトークンあたり約17秒、7 GB/sでは約7秒となります。これは理論的な上限の計算であり、実測値ではありませんが、「ディスク上での実行」に関する報告が秒間トークン数ではなく、トークンあたり秒数で語られる理由を説明しています。

!
「動く」とはどういうことか
トークンあたり10秒の場合、300トークンの回答には約50分かかります。さらに、常に有効なK3の推論モードは、回答前に思考トークンを追加します。技術的には負荷が大きく、実用的には使用できません。

#Ollama、LM Studio、llama.cpp:各ツールが提供する機能

Ollama
公式ライブラリに掲載されているのは、kimi-k3:cloudという一つのバリエーションだけです。モデルは利用者のマシンではなく、Ollamaのサーバー上で実行されます。ollama run kimi-k3:cloudコマンドで、いつものインターフェースを使ってモデルを試せますが、リモートサービスとしてのプライバシー面と課金面の制約があります。
LM Studio
ローカルのGGUFファイルを読み込みます。K3の場合、Unslothのファイルを数百GBダウンロードし、それに見合うメモリを用意する必要があります。一般消費者向けのマシンでは実行できません。
llama.cpp
Unsloth の GGUF が対象とするエンジンです。これらの GGUF は、視覚入力をサポートする llama.cpp の派生ブランチを前提としています。このエンジンはエキスパートの CPU へのオフロードと分割ファイルに対応しており、数百 GB の RAM を備えたワークステーションで動かすための現実的な選択肢です。
vLLM および SGLang
MoonshotがネイティブフォーマットでのマルチGPUサービスに推奨する2つのエンジン。
お使いのマシンでKimi K3は動くか
マシン利用可能なメモリ判定
RTX 5090(32 GB)+ 64 GB RAM約96GB不可能:1ビットでも6倍も不足しています
Mac mini または MacBook、16GB から 64GB16〜64GBローカルでは実行できません。APIまたはクラウドでのみ利用可能です
Mac Studio 128〜256 GB128 から 256 GB610GBが推奨されているため不十分です
Mac Studio 512 GB512GBコンテキスト用のメモリを含めなくても、1ビット版のファイルサイズに届かない
768 GB〜1 TB の RAM と GPU を搭載したワークステーション600から900GB1〜2 ビットの GGUF なら実行可能、生成速度は控えめ
8台のB300 GPU(約2.3TB)2.3 TBネイティブ形式について文書に記載された構成

#Kimi K3 を試すための現実的なオプション

  1. 01
    1. Moonshotの公式API
    モデル名はplatform.kimi.aiのkimi-k3で、OpenAIおよびAnthropicと互換性のあるAPIを提供しています。品質を評価する最も迅速な方法であり、reasoning_effortはlow、high、またはmaxのいずれかで設定できます。
  2. 02
    2. Ollama クラウド
    ollama run kimi-k3:cloud utilise vos habitudes Ollama avec l'inférence déportée. La page de la bibliothèque affiche les tarifs par million de tokens : vérifiez-les avant d'automatiser. Notre guide sur Ollama Cloud détaille les limites.
  3. 03
    3. GPUのレンタル
    vLLMを使い、テストに必要な時間だけマルチGPUノードを時間単位で借りる。まず、RunpodのFAQに示されている費用対効果の計算(時間あたりの費用を、継続して維持できるトークン/秒で割る)を行ってください。
  4. 04
    4. 大容量RAMを備えたワークステーション
    すでに700 GBのメモリがある場合に限り、品質の低下と低いスループットを受け入れたうえで、GGUF UD-IQ1_Sとllama.cppを使用します。

#オープンウェイトだからといって、自宅で実行できるとは限らない

オープンウェイトは、ダウンロード、監査、ファインチューニング、そしてライセンスによっては再配布する権利を保証します。ただし、実際に動かせることまでは保証しません。24GBのグラフィックカードで動かせる300億パラメータのモデルなら、実質的に自分のものと言えます。一方、クラスターでしか読み込めない2.8兆パラメータのモデルは、実際にはサービスのままです。Kimi K3は、監査可能性の面でも、すでにクラスターを持つ組織にとっても朗報ですが、個人が自宅でできることを変えるものではありません。

#お使いのハードウェアで実際に読み込める代替モデル

QuelLLMカタログでは、コンテキスト分を除いたQ4での必要メモリ容量を、DeepSeek V4 Flash 284Bは約170 GB、GLM 5.2 753B-A40Bは約437 GB、Kimi K3は約1,624 GBと推定しています。日常的に使うなら、300億~700億パラメータのQ4モデルが、品質と実用上の実現しやすさのバランスでは依然として最良です。

DeepSeek V4 Flash 284B
カタログによると、Q4では約170 GB。大容量メモリを搭載したMac Studioやワークステーションで実行可能です。詳しくは専用ガイドをご覧ください。
GLM 5.2 753B-A40B
Q4で約437 GB。十分な装備を備えたワークステーションで利用できるモデルの中では、K3に最も近い規模です。
Kimi K2.5 および K2.7
Q4で約600 GB:K3より小さいものの、依然としてワークステーション級の設備が必要です。
300億から700億パラメータのモデル
24GB〜32GBのGPUまたは64GBのMacでは、実際の使用に適した選択です。VRAM計算ツールが正確な値を提供します。

#結論:Kimi K3のローカル実行は、ほぼ選択肢にならない

元の重みは1.56 TB、量子化版は594〜861 GB、最小の量子化版でも必要なメモリは610 GBです。Kimi K3はサーバー向けのモデルです。評価するには、APIまたはkimi-k3:cloudを使用してください。自宅で実際に使うには、コンテキスト用の余裕を残したうえで、手元のメモリに収まるモデルを選んでください。

FAQ
OllamaでKimi K3をインストールできますか?+
ローカルでは利用できません。Ollamaのライブラリはkimi-k3:cloudのみを提供しており、これは遠隔サーバー上で実行されるため、あなたのマシン上で実行されません。実際に自宅でモデルをロードするには、llama.cppを使用した数百GB規模のGGUFファイルが必要であり、これは一般的なPC(非常に高性能であっても)では実現できません。
Kimi K3はRTX 5090で動作しますか?+
いいえ。RTX 5090のVRAMは32 GBですが、Unslothの最小のGGUFでもファイルサイズは594 GBで、合計610 GBのメモリが必要です。128 GBのシステムRAMを追加しても必要量には遠く及ばず、ディスクへのオフロードを行うと生成は実用になりません。
Mac miniまたはMac StudioでKimi K3を実行できますか?+
実用上は動作しません。Mac Studioはユニファイドメモリが512 GBですが、1ビットのファイルサイズは553.2 GiBで、コンテキストを考慮する前からメモリ容量を上回ります。Mac miniではさらに不足します。こうしたマシンでは、より小さなモデルを選ぶか、モデルAPIまたは Ollama cloudを利用してください。
LM StudioはKimi K3をロードできますか?+
理論上は可能です。LM StudioはGGUFファイルを読み込め、Unslothはこの形式のモデルを公開しています。実際には十分なメモリが必要で、1ビット版でも最低610 GB必要です。一般的なPCではモデルを読み込めないため、より小さなモデルを選ぶのが適切です。
Kimi K3にはどの量子化方式を選ぶべきですか?+
Unslothは、サイズと品質のバランスが取れた選択肢としてUD-IQ1_S(594 GB)を推奨しています。Unslothの測定では、元のモデルとのtop-1一致率は78.9%です。2ビットのUD-Q2_K_XL(861 GB)では、約90%に上がります。いずれの場合も、すでに600 GBを超えるメモリを搭載したワークステーションが必要です。
Kimi K3は、アクティブなパラメータが1,040億しかないのに、なぜこれほど大きいのですか?+
ルーターは896個のエキスパートのどれでも有効にできるためです。各トークンで計算を行うのは16個だけですが、すべてのエキスパートをメモリ上で利用可能な状態に保つ必要があります。トークンあたりの計算コストはほどほどです。サーバー用ハードウェアが必要になる理由は、計算能力ではなくメモリ容量です。

#さらに詳しく

このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。