DeepSeek V4 Proのローカル実行:VRAM、ハードウェア、 インストール
DeepSeek V4 Pro は、2026 年 4 月 24 日のリリース時点で、世界で最も強力なオープンウェイトモデルです。MoE アーキテクチャで 1.6 兆パラメータ(トークンあたり 490 億のアクティブパラメータ)、MIT ライセンス、コンテキスト 1M トークン、ハイブリッドアテンション CSA+HCA、そして 3 つの推論モードを備えています。公開されたベンチマークでは、GPT-5 や Claude 4.7 と互角の性能を示しています。クラウドサーバーも API もトークン制限も不要です。本ガイドでは、ローカルでの活用方法と必要なハードウェアについて詳しく説明します。
#DeepSeek V4 Proの概要
- 公開日
- 2026年4月24日 — DeepSeek-AI が HuggingFace に公開、重みは MIT ライセンス、論文は同時に公開されました。
- アーキテクチャ
- デンス型 Mixture-of-Experts。総パラメータ数は 1.6T、トークンごとに有効になるパラメータ数は 49B。エキスパートは 256 個で、top-8 ルーティングを使用。
- アテンション
- CSA(Compressed Sparse Attention)とHCA(Hybrid Constrained Attention)のハイブリッド構成。この規模では初の実装。
- コンテキスト
- 100万トークンのネイティブサポート(RoPEの拡張とflash attention v3を採用)
- 事前学習
- 32T以上のトークン、Muonオプティマイザー(AdamWを置き換える)、FP4+FP8の混合精度(知られている中で最も効率的な学習)。
- 思考モード
- 3段階:なし / High / Max。Maxモードは、AIMEとGPQAでo4に近い性能を発揮します。
- ライセンス
- MIT — 商用利用、再配布、改変が制限なく許可されます。Llamaのライセンスよりも自由度が高いです。
#1. CSA+HCAアーキテクチャとMoE 1.6T
DeepSeek V4 Proは、過去12ヶ月間にそれぞれ個別に公開された3つの主要なイノベーションを積み重ねており、これらがトリリオン規模で初めて組み合わされています。
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
- MoE 1.6T / 49B アクティブ
- レイヤーごとに256のエクスパート、トップ8ルーティング。各トークンに対して、計算に参加するのは490億パラメータのみです。そのため、総サイズにもかかわらず、50Bのデンスモデルと同等の速度を実現します。
- CSA — Compressed Sparse Attention
- 低ランク分解により KV キャッシュの古いキー/値を圧縮します。128k 超のコンテキストでは、アテンションメモリを 4 分の 1 に削減します。
- HCA — Hybrid Constrained Attention(ハイブリッド制約付きアテンション)
- レイヤーに応じて、ローカルアテンション(4kのスライディングウィンドウ)とグローバルアテンション(スパース)を組み合わせます。長いコンテキストでは、デンスアテンションに比べてスループットが2倍になります。
- mHC — multi-Head Compressor
- ヘッド間の圧縮機構 — 測定できる品質低下を生じさせずに、活性化データが使うVRAMを削減します。
- Muonオプティマイザー
- AdamWの後継であり、非常に大きなモデルの事前学習において1.8倍速く収束する。DeepSeek ではV3.5から採用されている。
- FP4+FP8によるトレーニング
- アテンション層にFP4、MLPにFP8を使う混合方式です。FP8のみの場合と比べて学習時のメモリ使用量を45%削減し、独自のスケーリング方式によって品質を維持しています。
#2. 3つのthinkingモード(Non / High / Max)
DeepSeek V4 Pro の思考機能は明示的で、オンとオフを切り替えられます。競合するプロプライエタリモデルの、不透明な動作モードとは異なります。
- 「Non」モード(デフォルト)
- 思考過程(chain-of-thought)を表示せずに直接回答します。遅延は最小限です(8トークン/秒で約2〜5秒)。チャット、翻訳、簡単なテキスト生成向けです。
- Highモード
- 応答前に200〜2000トークンの思考を挿入します。数学、コード、分析の品質が+30〜40%向上します。Ollama での /think フラグまたはAPIのthinking_modeヘッダーで有効になります。
- Maxモード
- 徹底した推論(最大 16k トークンの思考連鎖)。AIME 2025 では o4 の性能に迫る結果(87 % 対 o4 の 91 %)。コストが高い:ローカルでは 1 リクエストあたり 10〜30 分かかります。
#3. 量子化設定別の必要ハードウェア
| Quantization | モデルの VRAM | + KV 32k | 利用可能なハードウェア構成 |
|---|---|---|---|
| FP16(基準) | 3 200 GB | ~3 350 GB | データセンター:H100 80GB × 16台、またはH200 141GB × 8台。ローカルでの実行は現実的ではありません。 |
| Q8_0 | 1 700 GB | ~1,800 GB | 8× H200 141GB クラスタ。~250 k$ のハードウェア費用。 |
| Q5_K_M | 1 150 GB | ~1 230 GB | 512GBのMac Studio 3台で構成するクラスター、またはH200 141GB 4基。 |
| Q4_K_M | 960 GB | ~1 040 GB | 8台のA100 80GBクラスタ、または2台のMac Studio 512GBをネットワークスワームで接続 |
| IQ3_M(圧縮済み) | 720 GB | ~800GB | Single Mac Studio 512 + 部分的なSSDオフロード。遅いが可能 |
| IQ2_XS(極端) | 480 GB | ~560 GB | 512 GBのMac Studio単体。品質は大幅に低下します。 |
#4. ローカルインストール
インフラストラクチャに応じて3つの方法があります:マルチマシン・スワームにはllama.cpp、均質なGPUクラスタにはvLLM、Mac StudioのスワームにはMLX-distributed。
#オプションA — llama.cppの分散実行(複数マシン構成に推奨)
#オプション B — H100/H200 クラスタ上で vLLM を使用
#選択肢C — Ollama(移植版が利用可能になったら)
2026年4月25日現在、OllamaにはDeepSeek V4 Proがまだ統合されていません(コミュニティによるQ4_K_M量子化版は今週末にリリースされます)。進捗はollama.com/libraryで確認してください。
#5. GPT-5、Claude 4.7、Gemini 3 とのベンチマーク比較
| Benchmark | DeepSeek V4 Pro Max | GPT-5 | Claude 4.7 Opus | Gemini 3 Ultra |
|---|---|---|---|---|
| MMLU-Pro | 84.2 | 85.1 | 84.7 | 83.9 |
| GPQA Diamond | 78.5 | 76.8 | 79.2 | 77.1 |
| AIME 2025 | 87.0 | 82.4 | 85.6 | 80.2 |
| LiveCodeBench v5 | 79.8 | 78.2 | 75.4 | 76.1 |
| SWE-bench Verified | 59.4 | 62.1 | 63.8 | 55.7 |
| LongBench v2 (1M) | 72.6 | — | 68.4 | 70.2 |
| Humanity's Last Exam | 26.8 | 23.4 | 25.1 | 22.9 |
#6. 100万トークンのコンテキストを活用
HCAにより、1Mのコンテキストにネイティブ対応しています(YaRNによる拡張ではありません)。世界で1Mのコンテキストを提供するオープンウェイトモデルは3~4種類しかなく、この水準の情報想起能力を実現しているのは、このモデルだけです。
- Needle-in-Haystack 1M
- コンテキスト全体での情報検索成功率は98%(同等の条件でGemini 1.5 Proは76%)。
- ユースケース 1 — コードベース全体
- Linuxカーネルのnet/*(約800kトークン)を一度に読み込み、ファイル間のリファクタリングを単一のリクエストで実行。
- ユースケース2 — 法律調査
- 民法 + 最近の判決(約 600k トークン)をコンテキストに含め、判例の抽出を一度のパスで実行。
- 活用例3 — 会計分析
- 10年分の貸借対照表と注記(約40万トークン)、複数の会計年度にまたがる異常の検出。
- コンテキスト長100万トークン時の KV キャッシュの VRAM 使用量
- KV Q4 かつ CSAが有効な場合:約280GB。1Mで圧縮なしの場合:約2TB(実用的ではありません)。
#7. 最適なユースケース
- 科学的研究
- 数学、理論物理学、計算化学。MaxモードはAIME/Putnamの一部ベンチマークでo4を上回ります
- セキュリティ/主権
- 銀行、防衛、医療、政府分野:100%自社ホスティングの境界モデル、MITライセンス、検証可能。LLaMA 4以外に同等の製品は存在せず(ライセンスがより制限的です)。
- 長いタスクをこなす複雑なエージェント
- 1Mのコンテキスト、Max推論、49Bのアクティブパラメータにより、より小規模なデンスモデルよりも優れたエージェントとして機能し、GPT-5ほどの推論コストもかかりません。
- エンタープライズ規模のRAG
- 数百万トークンの知識ベース(コードベース、社内ドキュメント、ISO規格)。コンテキストを活用し、retrievalなしで直接検索。
#制限と代替案
- 個人には手が届かないほど高額なハードウェア
- Q4でも最低960 GBのVRAMが必要で、中古のクラスターでも約80,000ユーロかかります。個人には手の届かない規模です。
- J+1時点でのツールingが未熟です
- コミュニティによるGGUF量子化版は作成中で、vLLMにはdevブランチが必要です。MLX-distributedはまだ実験段階です。安定するまで約2週間待つこと。
- カーボンフットプリント
- 8× H200 クラスタの 24/7 稼働 = 年間約 45 MWh。API の利用(より効率的に償却可能)と比較検討してください。
- より導入しやすい代替モデル
- DeepSeek V4 Flash 284B(Q4で170 GB、Mac Studioのメモリに収まる)· DeepSeek V3.2 671B(Q2で240 GB、Mac Studio 512で実行可能)· Llama 4 Behemoth(品質が近い)。
#FAQ
DeepSeek V4 Pro は本当に GPT-5 よりも優れているのでしょうか?+
DeepSeek V4 Proの正確なライセンスは何ですか?+
有効になるのが490億パラメータだけなのに、なぜ総パラメータ数は1.6兆もあるのですか?+
DeepSeek V4 ProをMac Studio Ultra 512GB単体で実行することは可能ですか?+
3つのthinkingモードの違いは何ですか?+
Ollama / vLLM / APIでのthinkingモードを有効にする方法+
DeepSeek V4 Proは画像を扱えますか(マルチモーダル対応)?+
蒸留モデル(70B、32B、14B)は登場する予定ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。