上級 16 分DeepSeek

DeepSeek V4 Proのローカル実行:VRAM、ハードウェア、 インストール

DeepSeek V4 Pro は、2026 年 4 月 24 日のリリース時点で、世界で最も強力なオープンウェイトモデルです。MoE アーキテクチャで 1.6 兆パラメータ(トークンあたり 490 億のアクティブパラメータ)、MIT ライセンス、コンテキスト 1M トークン、ハイブリッドアテンション CSA+HCA、そして 3 つの推論モードを備えています。公開されたベンチマークでは、GPT-5 や Claude 4.7 と互角の性能を示しています。クラウドサーバーも API もトークン制限も不要です。本ガイドでは、ローカルでの活用方法と必要なハードウェアについて詳しく説明します。

著者 Mohamed Meguedmi·更新 2026-04-25·Windows・macOS・Linuxでテスト済み

#DeepSeek V4 Proの概要

公開日
2026年4月24日 — DeepSeek-AI が HuggingFace に公開、重みは MIT ライセンス、論文は同時に公開されました。
アーキテクチャ
デンス型 Mixture-of-Experts。総パラメータ数は 1.6T、トークンごとに有効になるパラメータ数は 49B。エキスパートは 256 個で、top-8 ルーティングを使用。
アテンション
CSA(Compressed Sparse Attention)とHCA(Hybrid Constrained Attention)のハイブリッド構成。この規模では初の実装。
コンテキスト
100万トークンのネイティブサポート(RoPEの拡張とflash attention v3を採用)
事前学習
32T以上のトークン、Muonオプティマイザー(AdamWを置き換える)、FP4+FP8の混合精度(知られている中で最も効率的な学習)。
思考モード
3段階:なし / High / Max。Maxモードは、AIMEとGPQAでo4に近い性能を発揮します。
ライセンス
MIT — 商用利用、再配布、改変が制限なく許可されます。Llamaのライセンスよりも自由度が高いです。
→
なぜこれが大きな出来事なのか
DeepSeek V4 Proは、すべての公開ベンチマークでGPT-4oを上回った初のオープンウェイトモデルで、発表された学習コストは1,200万ドルです(GPT-4は約8,000万ドル)。MITライセンスで公開されており、国家、銀行、病院はクラウドプロバイダーとの合意なしに自前でホスティングできます。これはAI主権におけるパラダイムシフトです。

#1. CSA+HCAアーキテクチャとMoE 1.6T

DeepSeek V4 Proは、過去12ヶ月間にそれぞれ個別に公開された3つの主要なイノベーションを積み重ねており、これらがトリリオン規模で初めて組み合わされています。

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応
MoE 1.6T / 49B アクティブ
レイヤーごとに256のエクスパート、トップ8ルーティング。各トークンに対して、計算に参加するのは490億パラメータのみです。そのため、総サイズにもかかわらず、50Bのデンスモデルと同等の速度を実現します。
CSA — Compressed Sparse Attention
低ランク分解により KV キャッシュの古いキー/値を圧縮します。128k 超のコンテキストでは、アテンションメモリを 4 分の 1 に削減します。
HCA — Hybrid Constrained Attention(ハイブリッド制約付きアテンション)
レイヤーに応じて、ローカルアテンション(4kのスライディングウィンドウ)とグローバルアテンション(スパース)を組み合わせます。長いコンテキストでは、デンスアテンションに比べてスループットが2倍になります。
mHC — multi-Head Compressor
ヘッド間の圧縮機構 — 測定できる品質低下を生じさせずに、活性化データが使うVRAMを削減します。
Muonオプティマイザー
AdamWの後継であり、非常に大きなモデルの事前学習において1.8倍速く収束する。DeepSeek ではV3.5から採用されている。
FP4+FP8によるトレーニング
アテンション層にFP4、MLPにFP8を使う混合方式です。FP8のみの場合と比べて学習時のメモリ使用量を45%削減し、独自のスケーリング方式によって品質を維持しています。
i
実際の利用にどのような違いがあるか
総パラメータ数が同等(1.6T)の場合、DeepSeek V4 Proは推論速度において同等のDenseモデルの約3倍速く、長いコンテキストではVRAM消費量が4分の1に抑えられます。これにより、8×H100 80 GBのクラスタでのQ4ローカル実行を検討できるようになります(TPUポッドのレンタルに代わる選択肢です)。

#2. 3つのthinkingモード(Non / High / Max)

DeepSeek V4 Pro の思考機能は明示的で、オンとオフを切り替えられます。競合するプロプライエタリモデルの、不透明な動作モードとは異なります。

「Non」モード(デフォルト)
思考過程(chain-of-thought)を表示せずに直接回答します。遅延は最小限です(8トークン/秒で約2〜5秒)。チャット、翻訳、簡単なテキスト生成向けです。
Highモード
応答前に200〜2000トークンの思考を挿入します。数学、コード、分析の品質が+30〜40%向上します。Ollama での /think フラグまたはAPIのthinking_modeヘッダーで有効になります。
Maxモード
徹底した推論(最大 16k トークンの思考連鎖)。AIME 2025 では o4 の性能に迫る結果(87 % 対 o4 の 91 %)。コストが高い:ローカルでは 1 リクエストあたり 10〜30 分かかります。
Ollamaでthinkingモードを有効にする(V4 Flashの場合。Proも同じ手順)
# Mode High
ollama run deepseek-v4 "Résous : x² + 5x - 14 = 0 /think"

# Mode Max
ollama run deepseek-v4 "Démontre la conjecture de Collatz pour n<100 /think_max"

#3. 量子化設定別の必要ハードウェア

必要な総VRAM(モデル+KVキャッシュ32kトークン)
Quantizationモデルの VRAM+ KV 32k利用可能なハードウェア構成
FP16(基準)3 200 GB~3 350 GBデータセンター:H100 80GB × 16台、またはH200 141GB × 8台。ローカルでの実行は現実的ではありません。
Q8_01 700 GB~1,800 GB8× H200 141GB クラスタ。~250 k$ のハードウェア費用。
Q5_K_M1 150 GB~1 230 GB512GBのMac Studio 3台で構成するクラスター、またはH200 141GB 4基。
Q4_K_M960 GB~1 040 GB8台のA100 80GBクラスタ、または2台のMac Studio 512GBをネットワークスワームで接続
IQ3_M(圧縮済み)720 GB~800GBSingle Mac Studio 512 + 部分的なSSDオフロード。遅いが可能
IQ2_XS(極端)480 GB~560 GB512 GBのMac Studio単体。品質は大幅に低下します。
!
ローカル運用の現実
DeepSeek V4 Pro Q4 は依然として 960 GB です。これはデータセンター向けのモデルで、個人用のマシン向けではありません。2026 年に最先端のモデルを 1 台のマシンでローカル実行したいなら、DeepSeek V4 Flash(Q4 で 170 GB)を検討するか、今後数週間で登場する Pro→70B の蒸留モデルを待ってください。

#4. ローカルインストール

インフラストラクチャに応じて3つの方法があります:マルチマシン・スワームにはllama.cpp、均質なGPUクラスタにはvLLM、Mac StudioのスワームにはMLX-distributed。

#オプションA — llama.cppの分散実行(複数マシン構成に推奨)

swarmを2台のMac Studio 512GBでセットアップ
# Sur chaque machine
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 GGML_RPC=1 GGML_CUDA=0

# Téléchargement modèle (split GGUF, ~960 Go)
huggingface-cli download deepseek-ai/DeepSeek-V4-Pro-GGUF \
  --include "*Q4_K_M*.gguf" --local-dir ./models

# Machine 1 (rpc-server, écoute sur :50052)
./build/bin/rpc-server -H 0.0.0.0 -p 50052

# Machine 2 (rpc-server également)
./build/bin/rpc-server -H 0.0.0.0 -p 50052

# Coordinator (peut être l'une des deux)
./build/bin/llama-cli \
  -m ./models/DeepSeek-V4-Pro-Q4_K_M-00001-of-00020.gguf \
  --rpc 192.168.1.10:50052,192.168.1.11:50052 \
  -ngl 99 -fa -c 32768 \
  -ctk q8_0 -ctv q8_0

#オプション B — H100/H200 クラスタ上で vLLM を使用

vLLM 8× H200 141GB
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Pro \
  --tensor-parallel-size 8 \
  --pipeline-parallel-size 1 \
  --max-model-len 1000000 \
  --quantization fp8 \
  --enable-prefix-caching \
  --port 8000

# Endpoint OpenAI-compatible sur :8000
curl http://localhost:8000/v1/chat/completions -d '{...}'

#選択肢C — Ollama(移植版が利用可能になったら)

2026年4月25日現在、OllamaにはDeepSeek V4 Proがまだ統合されていません(コミュニティによるQ4_K_M量子化版は今週末にリリースされます)。進捗はollama.com/libraryで確認してください。

→
実際の電気代
8× H200 クラスタを用いた推論 DeepSeek V4 Pro Q8:約5.2 kW。8時間のセッションでは電気代が約6.30 €(FR 2026)です。API DeepSeek が約0.28 $/Mトークン出力のコストを課す場合、月間50Mトークン以上を出力するようになると、ローカル環境が経済的に利益を上げ始めます。

#5. GPT-5、Claude 4.7、Gemini 3 とのベンチマーク比較

DeepSeek が発表したスコア(2026年4月24日付の論文)、公開ベンチマーク(標準)
BenchmarkDeepSeek V4 Pro MaxGPT-5Claude 4.7 OpusGemini 3 Ultra
MMLU-Pro84.285.184.783.9
GPQA Diamond78.576.879.277.1
AIME 202587.082.485.680.2
LiveCodeBench v579.878.275.476.1
SWE-bench Verified59.462.163.855.7
LongBench v2 (1M)72.6—68.470.2
Humanity's Last Exam26.823.425.122.9
i
独立したベンチマークが今後公開されます
これらの数値はDeepSeekが発表したものです。独立したベンチマーク(LMSYS Arena、ARC-AGI、HLE)は2~4週間以内に公開されます。確認のため、今後の動向に注目してください。モデルは10日以内にChatbot Arenaのトップ5に入ると予想されています。

#6. 100万トークンのコンテキストを活用

HCAにより、1Mのコンテキストにネイティブ対応しています(YaRNによる拡張ではありません)。世界で1Mのコンテキストを提供するオープンウェイトモデルは3~4種類しかなく、この水準の情報想起能力を実現しているのは、このモデルだけです。

Needle-in-Haystack 1M
コンテキスト全体での情報検索成功率は98%(同等の条件でGemini 1.5 Proは76%)。
ユースケース 1 — コードベース全体
Linuxカーネルのnet/*(約800kトークン)を一度に読み込み、ファイル間のリファクタリングを単一のリクエストで実行。
ユースケース2 — 法律調査
民法 + 最近の判決(約 600k トークン)をコンテキストに含め、判例の抽出を一度のパスで実行。
活用例3 — 会計分析
10年分の貸借対照表と注記(約40万トークン)、複数の会計年度にまたがる異常の検出。
コンテキスト長100万トークン時の KV キャッシュの VRAM 使用量
KV Q4 かつ CSAが有効な場合:約280GB。1Mで圧縮なしの場合:約2TB(実用的ではありません)。

#7. 最適なユースケース

科学的研究
数学、理論物理学、計算化学。MaxモードはAIME/Putnamの一部ベンチマークでo4を上回ります
セキュリティ/主権
銀行、防衛、医療、政府分野:100%自社ホスティングの境界モデル、MITライセンス、検証可能。LLaMA 4以外に同等の製品は存在せず(ライセンスがより制限的です)。
長いタスクをこなす複雑なエージェント
1Mのコンテキスト、Max推論、49Bのアクティブパラメータにより、より小規模なデンスモデルよりも優れたエージェントとして機能し、GPT-5ほどの推論コストもかかりません。
エンタープライズ規模のRAG
数百万トークンの知識ベース(コードベース、社内ドキュメント、ISO規格)。コンテキストを活用し、retrievalなしで直接検索。

#制限と代替案

個人には手が届かないほど高額なハードウェア
Q4でも最低960 GBのVRAMが必要で、中古のクラスターでも約80,000ユーロかかります。個人には手の届かない規模です。
J+1時点でのツールingが未熟です
コミュニティによるGGUF量子化版は作成中で、vLLMにはdevブランチが必要です。MLX-distributedはまだ実験段階です。安定するまで約2週間待つこと。
カーボンフットプリント
8× H200 クラスタの 24/7 稼働 = 年間約 45 MWh。API の利用(より効率的に償却可能)と比較検討してください。
より導入しやすい代替モデル
DeepSeek V4 Flash 284B(Q4で170 GB、Mac Studioのメモリに収まる)· DeepSeek V3.2 671B(Q2で240 GB、Mac Studio 512で実行可能)· Llama 4 Behemoth(品質が近い)。

#FAQ

DeepSeek V4 Pro は本当に GPT-5 よりも優れているのでしょうか?+
DeepSeek が公開したベンチマークでは、全体的に同等で、場合によっては優れている(AIME、GPQA、コード)。SWE-bench(完全なコード生成)では劣る。独立したベンチマークである Chatbot Arena(10日以内)が最終的に判断を下すでしょう。いずれにせよ、これはオープンウェイトで初めて本気で質問できるモデルです。
DeepSeek V4 Proの正確なライセンスは何ですか?+
純粋なMITライセンスで、最も許容範囲の広いライセンスです。商用利用、再配布、フォーク、改変、クローズドな製品への組み込みはすべて、制限や厳格な帰属表示条項なしで許可されています。Llama(無料利用には月間アクティブユーザー数が7億人を超えることを要求)やApache 2.0(出典の明記を要求)よりも自由度が高いとされています。
有効になるのが490億パラメータだけなのに、なぜ総パラメータ数は1.6兆もあるのですか?+
これがMoEの工夫です。多数の専門化したエキスパート(各層256個)を保持しつつ、トークンごとに有効にするのは8個だけです(うち1個は共有)。各エキスパートが専門化することで品質を高めながら、1.6Tのデンスモデルと同等の推論コストをかけずに済みます。必要なメモリ量は1.6Tモデル相当のままですが、計算コストは49Bモデル相当です。
DeepSeek V4 ProをMac Studio Ultra 512GB単体で実行することは可能ですか?+
いいえ、Q4 では不可能です(960 GB 必要)。IQ2_XS(約 480 GB)なら可能ですが、品質は低下し、速度は 1〜2 tok/s です。単一マシンで実用的にするには、70B/100B の蒸留版を待つか、V4 Flash 284B バリアント(Q4 で 170 GB)を選ぶ必要があります。
3つのthinkingモードの違いは何ですか?+
非 = 明示的な推論なし、遅延が最小限、品質 ~Mistral Large。高 = 200〜2000トークンの思考連鎖後に回答、数学/コード/分析において+30〜40%の品質向上。最大 = 最大16kトークンの推論、品質は~o4ですが、遅い(ローカルクラスタでの10〜30分のリクエスト)。
Ollama / vLLM / APIでのthinkingモードを有効にする方法+
Ollama:プロンプトの末尾に /think または /think_max を付けます。vLLM:ヘッダー X-Thinking-Mode: high|max を使用します。DeepSeek公式API:JSONボディの thinking_mode フィールドを使用します。応答内の <think>...</think> タグが思考の連鎖(chain-of-thought)の範囲を示します。
DeepSeek V4 Proは画像を扱えますか(マルチモーダル対応)?+
いいえ、V4 Pro はテキスト専用です。同じアーキテクチャをベースに視覚エンコーダーを組み込んだ VL(Vision-Language)版が、2026 年 5 月末に登場する予定と発表されています。現時点で画像を扱えるオープンウェイトモデルなら、Qwen3.5-VL または Llama 4 Vision です。
蒸留モデル(70B、32B、14B)は登場する予定ですか?+
DeepSeekは論文で、Llama-3.3-70BとQwen-2.5-32Bのベースモデルへの蒸留版を4~6週間以内にリリースすると明言しています。前例として、DeepSeek-R1は6つのバージョン(1.5B~70B)に蒸留され、その一部は元のモデルを上回っています。驚くようなモデルの登場に期待してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。