自宅でKimi K3を動かす:必要なハードウェアの実情(2.8T パラメータ)
Kimi K3はデスクトップPCでは動作しません。ネイティブ形式の重みは1.56 TBあり、公開されている最小のGGUF量子化版(Unsloth、動的1ビット)でも594 GBを占め、推奨メモリ容量は610 GBです。512 GBのMac Studioでも、RTX 5090単体でも足りません。試すには、MoonshotのAPIか、Ollamaのkimi-k3:cloudを利用してください。ローカルで使う場合は、より小さなモデルを選んでください。
Kimi K3の重みは2026年7月末から公開されています。「ollama kimi k3」「kimi k3 lmstudio」「kimi k3 on 5090」といった検索語から、多くの読者が自宅にインストールできるかを知りたがっていることが分かります。このガイドでは、MoonshotとUnslothが公表した数値を紹介し、お使いのマシンで何を読み込めるかを計算したうえで、代わりに取れる方法を示します。
#Kimi K3 のローカル実行:Moonshotが実際に公開したもの
MoonshotのHugging Faceのページでは、Kimi K3は2.8兆パラメータのオープンウェイト・マルチモーダルモデルとして説明されており、コンテキストウィンドウは100万トークンです。これはMixture-of-Experts(MoE)アーキテクチャを採用しており、896のエクスパートのうち、各トークンごとに16個が選択され、アクティブなパラメータ数は1,040億です。重みはMXFP4(重み)で配布され、アクティベーションはMXFP8を使用しています。また、教師ありファインチューニングの段階から量子化を意識した学習が適用されています。コードと重みのライセンスは「Kimi K3 License」です。商用利用の前に必ずこのテキストをお読みください。これは標準的なMITライセンスやApacheライセンスではありません。専門メディアによると、このモデルは2026年7月27日頃にHugging Faceに公開されました。
- 総パラメータ数/アクティブパラメータ数
- 合計2.8T、104Mdアクティブトークン(Moonshot)
- エキスパート
- 896 のエキスパート、トークンごとに 16 個が選択され、さらに 2 個の共有エキスパートがあります。
- 公開フォーマット
- MXFP4 は重みに、MXFP8 は活性化に適用されます。これは GGUF ではありません。
- コンテキスト
- 1,048,576トークン。重みを保持するメモリに加えて、KVキャッシュ用のメモリも必要です。
- 推奨されるエンジン
- vLLM、SGLang、TokenSpeed。llama.cppではコミュニティが提供するGGUFを使用します。
#モデルの重みが実際に占める容量
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
2 つの数値が流通しており、区別が必要です。一部の記事では、2.8 T のパラメータを半バイトで乗算して「約 1.4 TB」と推定しています。ファイルサイズの測定値はそれより高く、Unsloth と Runpod はネイティブバージョンについて 1.56 TB を示しています。これは、エキスパート以外のレイヤー(アテンション、ルーター、共有エキスパート)がより高い精度で保持されるためです。Runpod によると、非量子化の BF16 は約 5.6 TB に達します。したがって、1.4 TB と報告していたこのガイドのバージョンは、約 10 % 低すぎました。
| フォーマット | サイズ | 推奨される総メモリ容量 | 測定された忠実度 |
|---|---|---|---|
| ネイティブMXFP4 / UD-Q8_K_XL | 1.56 TB | 1.6 TB | 損失なし |
| Unsloth UD-Q2_K_XL(動的2ビット量子化) | 861.3 GB | 880 GB | トップ1の一致率は約90%です |
| Unsloth UD-IQ2_XXS | 711.1 GB | 726 GB | トップ1一致率84.1% |
| Unsloth UD-IQ1_M | 648.9 GB | 665 GB | top-1 一致率 81.2 % |
| Unsloth UD-IQ1_S(動的 1 ビット量子化) | 594 GB | 610 GB | トップ1の一致率は78.9%です |
| BF16 (理論値) | 約5.6テラバイト | 現実的な範囲外 | 参考 |
この表は、旧バージョンに存在した誤解を否定しています。Q2は「常にテラバイトオーダー」ではありません。Unslothは確かに900 GB未満のGGUFを提供しています。しかし、594 GBは32 GBのRTX 5090のメモリにほぼ15倍の差があり、品質の差も実在します。Unslothの測定セットにおいて、動的1ビットは、元のモデルの選択を78.9%のケースでしか再現していません。ビットが品質に与える影響を理解するには、私たちの量子化ガイドをご覧ください。
#ハードウェア:推奨されるものと実現可能なもの
Moonshotはモデルの仕様ページに最小構成を公開していません。vLLM、SGLang、TokenSpeedのレシピや同社のAPIへの参照に留まっています。ネイティブセルフホスティングに関する文書化された参考値はRunpodから来ており、288 GBのGPU B300を8基備えたノード1つ(合計約2.3 TB)、または2ノードに分散配置されたB200 16基です。このページが以前引用していた「64基以上のアクセラレーター」という数値は、参照した一次情報源のいずれにも存在しないため、削除されました。
UnslothのGGUFを使う場合、同社のドキュメントが示す目安は単純です。RAMとVRAMの合計容量が量子化済みモデルのサイズとおおむね等しくなる必要があります。そうでなければ、モデルは動作してもディスクを使うようになり、大幅に遅くなります。Unslothは、モデルがB200のメモリに収まる場合、生成速度は約20トークン/秒とも述べています。これは供給元がデータセンター向けハードウェアで示した処理速度であり、家庭用マシンに適用できる測定値ではありません。
#Macではどうでしょうか?噂ではなく計算で考える
このページが報告していた「MacBook Pro M1 Maxで1トークンあたり16秒」という数値について、検証可能なソースは特定できませんでした。そのため、事実として引用していません。ソースが明確に示している内容は以下の通りです。Kingy AIは、スタートポイント(1.56 TBのチェックポイント)ですでに512 GBのMac Studioの容量を超えており、1ビット版の553.2 GiBのファイルも、負荷がかかり始める前にこのマシンの容量を超えると指摘しています。128 GBのMacは、推奨される610 GBの約5分の1の容量です。
一方で、規模の目安は自分で推定できます。メモリが不足すると、各トークンはSSDからアクティブ化するエキスパートを読み戻します。1040億パラメータを約4ビットで計算すると、トークンあたり約50 GBの読み取りが必要です。3 GB/sのSSDではトークンあたり約17秒、7 GB/sでは約7秒となります。これは理論的な上限の計算であり、実測値ではありませんが、「ディスク上での実行」に関する報告が秒間トークン数ではなく、トークンあたり秒数で語られる理由を説明しています。
#Ollama、LM Studio、llama.cpp:各ツールが提供する機能
- Ollama
- 公式ライブラリに掲載されているのは、kimi-k3:cloudという一つのバリエーションだけです。モデルは利用者のマシンではなく、Ollamaのサーバー上で実行されます。ollama run kimi-k3:cloudコマンドで、いつものインターフェースを使ってモデルを試せますが、リモートサービスとしてのプライバシー面と課金面の制約があります。
- LM Studio
- ローカルのGGUFファイルを読み込みます。K3の場合、Unslothのファイルを数百GBダウンロードし、それに見合うメモリを用意する必要があります。一般消費者向けのマシンでは実行できません。
- llama.cpp
- Unsloth の GGUF が対象とするエンジンです。これらの GGUF は、視覚入力をサポートする llama.cpp の派生ブランチを前提としています。このエンジンはエキスパートの CPU へのオフロードと分割ファイルに対応しており、数百 GB の RAM を備えたワークステーションで動かすための現実的な選択肢です。
- vLLM および SGLang
- MoonshotがネイティブフォーマットでのマルチGPUサービスに推奨する2つのエンジン。
| マシン | 利用可能なメモリ | 判定 |
|---|---|---|
| RTX 5090(32 GB)+ 64 GB RAM | 約96GB | 不可能:1ビットでも6倍も不足しています |
| Mac mini または MacBook、16GB から 64GB | 16〜64GB | ローカルでは実行できません。APIまたはクラウドでのみ利用可能です |
| Mac Studio 128〜256 GB | 128 から 256 GB | 610GBが推奨されているため不十分です |
| Mac Studio 512 GB | 512GB | コンテキスト用のメモリを含めなくても、1ビット版のファイルサイズに届かない |
| 768 GB〜1 TB の RAM と GPU を搭載したワークステーション | 600から900GB | 1〜2 ビットの GGUF なら実行可能、生成速度は控えめ |
| 8台のB300 GPU(約2.3TB) | 2.3 TB | ネイティブ形式について文書に記載された構成 |
#Kimi K3 を試すための現実的なオプション
- 011. Moonshotの公式APIモデル名はplatform.kimi.aiのkimi-k3で、OpenAIおよびAnthropicと互換性のあるAPIを提供しています。品質を評価する最も迅速な方法であり、reasoning_effortはlow、high、またはmaxのいずれかで設定できます。
- 022. Ollama クラウドollama run kimi-k3:cloud utilise vos habitudes Ollama avec l'inférence déportée. La page de la bibliothèque affiche les tarifs par million de tokens : vérifiez-les avant d'automatiser. Notre guide sur Ollama Cloud détaille les limites.
- 033. GPUのレンタルvLLMを使い、テストに必要な時間だけマルチGPUノードを時間単位で借りる。まず、RunpodのFAQに示されている費用対効果の計算(時間あたりの費用を、継続して維持できるトークン/秒で割る)を行ってください。
- 044. 大容量RAMを備えたワークステーションすでに700 GBのメモリがある場合に限り、品質の低下と低いスループットを受け入れたうえで、GGUF UD-IQ1_Sとllama.cppを使用します。
#オープンウェイトだからといって、自宅で実行できるとは限らない
オープンウェイトは、ダウンロード、監査、ファインチューニング、そしてライセンスによっては再配布する権利を保証します。ただし、実際に動かせることまでは保証しません。24GBのグラフィックカードで動かせる300億パラメータのモデルなら、実質的に自分のものと言えます。一方、クラスターでしか読み込めない2.8兆パラメータのモデルは、実際にはサービスのままです。Kimi K3は、監査可能性の面でも、すでにクラスターを持つ組織にとっても朗報ですが、個人が自宅でできることを変えるものではありません。
#お使いのハードウェアで実際に読み込める代替モデル
QuelLLMカタログでは、コンテキスト分を除いたQ4での必要メモリ容量を、DeepSeek V4 Flash 284Bは約170 GB、GLM 5.2 753B-A40Bは約437 GB、Kimi K3は約1,624 GBと推定しています。日常的に使うなら、300億~700億パラメータのQ4モデルが、品質と実用上の実現しやすさのバランスでは依然として最良です。
- DeepSeek V4 Flash 284B
- カタログによると、Q4では約170 GB。大容量メモリを搭載したMac Studioやワークステーションで実行可能です。詳しくは専用ガイドをご覧ください。
- GLM 5.2 753B-A40B
- Q4で約437 GB。十分な装備を備えたワークステーションで利用できるモデルの中では、K3に最も近い規模です。
- Kimi K2.5 および K2.7
- Q4で約600 GB:K3より小さいものの、依然としてワークステーション級の設備が必要です。
- 300億から700億パラメータのモデル
- 24GB〜32GBのGPUまたは64GBのMacでは、実際の使用に適した選択です。VRAM計算ツールが正確な値を提供します。
#結論:Kimi K3のローカル実行は、ほぼ選択肢にならない
元の重みは1.56 TB、量子化版は594〜861 GB、最小の量子化版でも必要なメモリは610 GBです。Kimi K3はサーバー向けのモデルです。評価するには、APIまたはkimi-k3:cloudを使用してください。自宅で実際に使うには、コンテキスト用の余裕を残したうえで、手元のメモリに収まるモデルを選んでください。
OllamaでKimi K3をインストールできますか?+
Kimi K3はRTX 5090で動作しますか?+
Mac miniまたはMac StudioでKimi K3を実行できますか?+
LM StudioはKimi K3をロードできますか?+
Kimi K3にはどの量子化方式を選ぶべきですか?+
Kimi K3は、アクティブなパラメータが1,040億しかないのに、なぜこれほど大きいのですか?+
#さらに詳しく
- DeepSeek V4 Flash 284B:Mac Studioで動く初のフロンティアモデル
- GLM-5.2をローカルで使う:OllamaとLM Studio
- 量子化の選択(Q4、Q5、Q8、FP16)
- MoE の解説:なぜ 30B-A3B は小型モデルのように動作するのか
- Ollama Cloud:価格、レビュー、制限
- VRAM計算機
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。