DeepSeek V4 Pro と Flash の比較:ローカル環境でどちらが適していますか ?
DeepSeek V4 Pro と DeepSeek V4 Flash は、同じ日に、同じ MIT ライセンスの下で、同じ MoE アーキテクチャを採用してリリースされました。それでも、パラメータ数は 1.6T 対 284B、Q4 で必要な VRAM は 960 GB 対 170 GB、必要なハードウェアは H200 クラスタ対 Mac Studio と、大きく異なります。どちらを選ぶかは、品質ではなくハードウェアと用途の問題です。ローカル実行での DeepSeek V4 Pro と Flash の選択に役立つこの比較記事では、960 GB を無駄にダウンロードする前に判断できます。
#Pro と Flash:本質的な違い
両モデルの主要な仕様は共通しています。CSA+HCAのハイブリッドアテンションを備えたMoEアーキテクチャ、ネイティブで100万トークンのコンテキスト、3つの思考モード(Non / High / Max)、制約の少ないMITライセンス、Muon+FP4による事前学習です。違いは一つの数値、つまりエキスパートプールのサイズにあります。
- V4 Pro
- 総パラメータ数1.6T、トークンごとのアクティブパラメータ数49B。256個のエキスパートから上位8個を選択します。最先端モデルの完全版です。
- V4 Flash
- 総パラメータ数284B、トークンごとに有効になるパラメータ数13B、64のエキスパートから上位8つを選択。同じアーキテクチャを小規模にまとめたものです。
- 同じもの
- 語彙、トークナイザー、チャットテンプレート、思考モード、コンテキスト長(1M)、MITライセンス、llama.cpp / vLLM用のインストールスクリプト
- 実際に異なる点
- VRAMの総容量、生成速度(トークン/秒)、非常に難度の高い推論ベンチマーク(AIME、GPQA Max)のスコア。日常的なタスクでは、差は予想より小さくなります。
#1. バージョン別のVRAM必要容量
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
これが、ほぼすべてを決める基準です。以下は、読み込み済みモデルと32kトークン分のKVキャッシュ(1Mではありません)を合わせたVRAM総使用量で測定したしきい値です:
#DeepSeek V4 Pro 1.6T
- Q8_0
- 約1,800 GB。H200 141GBを8基搭載したクラスターが必須です。単一マシンでローカル実行する構成はありません。
- Q5_K_M
- 約1,230 GB。swarm RPCで連携させた512 GBのMac Studio 3台、またはH200 4基。
- Q4_K_M(推奨)
- 約1,040GB。A100 80GBを8台でテンソル並列処理、またはMac Studio 512GBを2台でllama.cppのネットワークスウォームを使用。
- IQ3_M
- 約800GB。Single Mac Studio 512GB + 部分的なSSDオフロード。非常に遅い(約2〜4トーク/秒)で品質が低下します。
- IQ2_XS
- 約560GB。Mac Studio 512GB単体。品質が大幅に低下するため、非推奨です。
#DeepSeek V4 Flash 284B
- FP16
- 約570GB。H100/H200クラスター、またはMac Studio 512とNVIDIAワークステーションをスワーム構成で使用。
- Q8_0
- 約 305 GB。Mac Studio M3 Ultra 512 GB オンリー、または 4× RTX 6000 Ada 48GB。
- Q5_K_M
- 約 210 GB。Mac Studio Ultra 256 GB(容量ぎりぎり)、または RTX 4090 24GB × 3 枚+オフロード。
- Q4_K_M(推奨)
- ≈170GB。Mac Studio M2 Ultra 192GB単体、2台のA6000 48GB、または4台のRTX 4090 24GB。
- IQ3_M
- 約130 GB。RTX 4090 24 GBを2枚+システムRAMへのオフロード、またはMac Studio 128 GB。
#2. バージョンごとの実際のGPUコスト
以下の数値は、2026 年 5 月の価格を基準とした購入時のハードウェア予算であり、電気代は含まれていません。
#V4 Pro(Q4で約1,040 GB)を動かすには
- 8台×H200 141GB クラスタ
- ハードウェアとサーバーで約280,000 €、設置まで含めると約320,000 €。FP8をネイティブに利用する、vLLMの「きちんとした」構成です。
- 中古のA100 80GBを8基搭載したクラスター
- ハードウェアは約90,000ユーロ、シャーシを含めると約110,000ユーロ。640 GB の VRAM でテンソル並列処理を行います。より手頃ですが、速度は遅くなります。
- Swarm 2× Mac Studio M3 Ultra 512 GB
- 2026年5月の価格で約28,000ユーロ(M3 Ultraは新品の販売が終了。M5 Ultra 512 GBは2026年10月末に発表)。Pro Q4をローカルで動かす最も安価な方法です。生成速度は控えめですが(5〜8トークン/秒)、10 GbE経由のllama.cpp RPCで実際に動作します。
- 同等構成のクラウドレンタル
- Lambda/CrusoeでH200を8基利用すると、約60 €/時。累計約5,500時間を超えると、購入と比べて費用面で有利になります。
#V4 Flash を動作させるために(Q4 約170 GB)
- Mac Studio M2 Ultra 192GB
- リカバリー済みで約4,200€(新品販売は停止)。一人で最短のルートです。
- Mac Studio M3 Ultra 256GB
- Appleでは新品の販売が終了しています(256 GB構成があるM5 Ultraに置き換えられました)。中古品を探す必要があり、価格は変動します。長いコンテキストやthinking Maxモードで使う際に、より余裕があります。
- 4× RTX 4090 24GB ワークステーション
- 中古GPU(RTX 4090、価格は変動)+約4,500ユーロ(筐体・電源・CPU)。CUDAのみで構成でき、vLLMも利用可能です。
- 2× RTX 6000 Ada 48GB
- 価格は要確認(プロ向けカードのため価格追跡の対象外)。4090を4枚使うより構成がすっきりし、騒音も少なくなります。
- 同等構成のクラウドレンタル
- Hyperstack/Lambdaで4×A100 80GBを使用した場合、約4€/h。累計で約1,600時間以上経過するとMac Studioよりも経済的になります。
#3. レイテンシとスループットの比較
以下は、thinkingモードをNonに設定し、コンテキスト8k、プロンプト500トークン、生成1,000トークンで測定した数値です。測定値はDeepSeekの論文と2026年5月のコミュニティベンチマークに基づいています。
#V4 Pro Q4_K_M
- クラスタ 8× H200 (vLLM FP8)
- TTFT ~0.8秒 · 38トークン/秒 · 1000トークンは約27秒で完了
- 8× A100 80GB クラスタ (vLLM Q4)
- TTFT:約1.4秒 · 生成速度:22トークン/秒 · 1000トークンに約47秒。
- Swarm 2× Mac Studio M3 Ultra 512 (llama.cpp RPC)
- TTFTは約6秒・スループットは6トークン/秒・1000トークンの生成に約3分。RPCのネットワーク通信による性能低下が支配的です。
#V4 Flash Q4_K_M
- Mac Studio M3 Ultra 256GB(MLX)
- TTFT ~0.4秒 · 28トーク/秒 · 1000トークは約36秒で完了。ソロ利用の最適ポイント。
- Mac Studio M2 Ultra 192 GB (llama.cpp)
- TTFT~0.6秒 · 14トークン/秒 · 1000トークンは約72秒で完了。
- 4× RTX 4090 24GB (vLLM)
- TTFT 約0.3秒 · 生成速度52 tok/s · 1000トークンを約19秒で生成。ローカルで最も高速。
- 2× A6000 48GB (vLLM)
- TTFT 約0.4秒 · 生成スループット38トークン/秒 · 1000トークンを約26秒で生成。
#4. ハードウェアに応じた決定木
5つの質問で、1つの結論に。上から順に読み、最初の答えが見つかったところで止めてください。
- 01GPU予算が200,000 €を超え、妥協のない最先端の性能が必要ですか?→ DeepSeek V4 Pro Q4 を H200 × 8 または A100 × 8 のクラスターで実行。銀行、研究所、主権国家の行政機関向けです。Pro を選ぶことが合理的なのは、このシナリオだけです。
- 02Mac Studio M3 Ultra 512GBを2台お持ち、または導入予定で(価格は変動するため要確認)、5〜8 tok/sを許容できますか?→ llama.cpp RPCを使えば、V4 Pro Q4を実行できます。夜間のバッチ処理専用とし、対話的な用途には決して使わないでください。それ以外の場合は、次のステップに進んでください。
- 03ハイエンドのMac Studio Ultraをお持ちですか(現在はメモリ容量の選択肢が異なります。価格は要確認)?→ MLXまたはllama.cppでV4 Flash Q4を実行。世代に応じて12〜28トークン/秒。2026年の個人利用では最高の体験です。
- 04NVIDIAのGPUを2〜4台お持ちで、合計VRAMが80GBを超えていますか?→ V4 Flash Q4 で vLLM(推奨)または llama.cpp を使用。Mac Studio に比べて処理速度は高いものの、騒音・電力消費・サイズが大きくなります。
- 05VRAMが80GB未満(例:RTX 4090単体など)ですか?→ Q4ではProもFlashも動かせません。予定されているFlash→32Bの蒸留モデルを検討するか、それまでの間はDeepSeek V3.5 32B / Qwen3.6 35B-A3Bを代わりに使ってください。
#5. 用途に応じた選び方
公開ベンチマークだけでは、すべては分かりません。ここでは、用途別に率直な見方を示します。
- 汎用チャットアシスタント、翻訳、要約
- Flashで十分です。これらの用途ではProとの差は2〜4ポイントで、実際の使用では違いを感じません。生成速度を優先してください。
- コード(生成、リファクタリング、デバッグ)
- HighモードのFlashは、Pro Nonに非常に近い性能です。複雑なデバッグではPro Maxが優位ですが、回答ごとに10分待つ必要があります。
- 数学、証明、AIME/GPQA
- Pro Maxは難易度によってFlash Maxに対して8から15ポイントの優位性を示します。これはProが実際に価値を発揮する使用シーンです。
- 長い文書(20万トークン超)の分析
- 技術的同等性(両方とも1Mトークンを処理可能)。差異はCSA注意の部分にあり、両方で同じです。KVキャッシュのVRAM使用量に応じて選択してください。
- ツール呼び出しをサポートするエージェント
- Flashで十分です。ツール呼び出しを制御するのは、チャットテンプレートとInstructのファインチューニングであり、モデルのサイズではありません。
- ローカルでのファインチューニング(LoRA)
- FlashはH100を2基使えば現実的に対応できます。ProをローカルでLoRA学習するのは現実的ではなく、学習用クラスターが必要です。
#ヒントと落とし穴
- KVキャッシュの量子化
- 両モデルにおいて、--cache-type-k q8_0 --cache-type-v q8_0(llama.cpp)または--kv-cache-dtype fp8(vLLM)により、KVメモリは2倍に減少し、品質の損失はほぼないため、64k以上のコンテキストを扱う場合に必須です。
- Flash Attention が必須です
- -fa(llama.cpp)または --enable-flash-attn(vLLM)を有効にしてください。無効のままだと、スループットが 30% 低下し、コンテキスト長が 32k を超えるとメモリ使用量が急増します。
- デフォルトのthinkingモード
- どちらのモデルでも、Maxモードをデフォルトで有効にしたままにしないでください。ループに陥ったエージェントは、何時間も思考を続けることがあります。/thinkまたは/think_maxで明示的に切り替えてください。
- Pro でのマルチ-GPU:パイプライン並列を避ける
- H200クラスタでは、8基のGPUでテンソル並列処理を行います。パイプライン並列処理は層間の遅延を増やし、1.6TのMoEではこの遅延が支配的になります。vLLMは--tensor-parallel-size 8を指定すると、これを自動的に処理します。
- Swarm Mac Studio:10 GbE 以上が必要
- llama.cppのRPCは多数の中間テンソルを転送します。1 GbEでは、Proの生成速度が1トークン/秒未満に落ちます。10 GbEスイッチとSFP+ケーブルを用意してください。
- チャットテンプレートは厳密に同一
- ProとFlashは同じ形式を使います。一方で動くスクリプトはもう一方でも動くため、アプリケーションコードを書き直さずにA/Bテストを行うのに便利です。
#さらに詳しく
使用するバージョンを選んだら、導入には以下のガイドを参照してください。
- DeepSeek V4 Pro 1.6T : アーキテクチャ、インストール、ベンチマーク
- Pro を選ぶと決めた方に向けた、クラスターへのインストールガイドです。
- DeepSeek V4 Flash 284B:Mac Studioに収まる最初のフロンティアモデル
- Mac Studio Ultraでのインストール手順と詳細なベンチマーク。
- Mac Studio(M2/M3/M4 Ultra、64–512 GB)で使えるLLMは?
- 予算に合ったMac Studioの構成を見極めるために。
- llama.cppによるマルチGPUセットアップ
- 毎秒のトークン数を落とさずに、ローカル環境でNVIDIA GPUを2〜4基接続するための定番ガイドです。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。