上級 12 分DeepSeek

DeepSeek V4 Pro と Flash の比較:ローカル環境でどちらが適していますか ?

DeepSeek V4 Pro と DeepSeek V4 Flash は、同じ日に、同じ MIT ライセンスの下で、同じ MoE アーキテクチャを採用してリリースされました。それでも、パラメータ数は 1.6T 対 284B、Q4 で必要な VRAM は 960 GB 対 170 GB、必要なハードウェアは H200 クラスタ対 Mac Studio と、大きく異なります。どちらを選ぶかは、品質ではなくハードウェアと用途の問題です。ローカル実行での DeepSeek V4 Pro と Flash の選択に役立つこの比較記事では、960 GB を無駄にダウンロードする前に判断できます。

著者 Mohamed Meguedmi·更新 2026-06-03·Windows・macOS・Linuxでテスト済み

#Pro と Flash:本質的な違い

両モデルの主要な仕様は共通しています。CSA+HCAのハイブリッドアテンションを備えたMoEアーキテクチャ、ネイティブで100万トークンのコンテキスト、3つの思考モード(Non / High / Max)、制約の少ないMITライセンス、Muon+FP4による事前学習です。違いは一つの数値、つまりエキスパートプールのサイズにあります。

V4 Pro
総パラメータ数1.6T、トークンごとのアクティブパラメータ数49B。256個のエキスパートから上位8個を選択します。最先端モデルの完全版です。
V4 Flash
総パラメータ数284B、トークンごとに有効になるパラメータ数13B、64のエキスパートから上位8つを選択。同じアーキテクチャを小規模にまとめたものです。
同じもの
語彙、トークナイザー、チャットテンプレート、思考モード、コンテキスト長(1M)、MITライセンス、llama.cpp / vLLM用のインストールスクリプト
実際に異なる点
VRAMの総容量、生成速度(トークン/秒)、非常に難度の高い推論ベンチマーク(AIME、GPQA Max)のスコア。日常的なタスクでは、差は予想より小さくなります。
i
すぐに判断するための目安
Flash ≈ トータルパラメータが6倍、アクティブパラメータが4倍少ないですが、公開ベンチマークでは5〜12点の低下しかありません(カテゴリによって異なります)。ほとんどのローカル用途において、Flashはデフォルトとして最適な選択です — Proはクラスタの特別なケースです

#1. バージョン別のVRAM必要容量

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

これが、ほぼすべてを決める基準です。以下は、読み込み済みモデルと32kトークン分のKVキャッシュ(1Mではありません)を合わせたVRAM総使用量で測定したしきい値です:

#DeepSeek V4 Pro 1.6T

Q8_0
約1,800 GB。H200 141GBを8基搭載したクラスターが必須です。単一マシンでローカル実行する構成はありません。
Q5_K_M
約1,230 GB。swarm RPCで連携させた512 GBのMac Studio 3台、またはH200 4基。
Q4_K_M(推奨)
約1,040GB。A100 80GBを8台でテンソル並列処理、またはMac Studio 512GBを2台でllama.cppのネットワークスウォームを使用。
IQ3_M
約800GB。Single Mac Studio 512GB + 部分的なSSDオフロード。非常に遅い(約2〜4トーク/秒)で品質が低下します。
IQ2_XS
約560GB。Mac Studio 512GB単体。品質が大幅に低下するため、非推奨です。

#DeepSeek V4 Flash 284B

FP16
約570GB。H100/H200クラスター、またはMac Studio 512とNVIDIAワークステーションをスワーム構成で使用。
Q8_0
約 305 GB。Mac Studio M3 Ultra 512 GB オンリー、または 4× RTX 6000 Ada 48GB。
Q5_K_M
約 210 GB。Mac Studio Ultra 256 GB(容量ぎりぎり)、または RTX 4090 24GB × 3 枚+オフロード。
Q4_K_M(推奨)
≈170GB。Mac Studio M2 Ultra 192GB単体、2台のA6000 48GB、または4台のRTX 4090 24GB。
IQ3_M
約130 GB。RTX 4090 24 GBを2枚+システムRAMへのオフロード、またはMac Studio 128 GB。
→
実用的な目安:ユニファイドメモリ192 GBまたはVRAM約96 GB
192GBのMac Studio、または合計約96〜192GBのメモリを備えた業務用GPUを2〜4基搭載する構成から、Flash Q4は快適に動作します。この水準では、Proを目指すのをやめることになります。専用クラスタを借りるのでなければ、単一マシンでProを動かすのは無理です。

#2. バージョンごとの実際のGPUコスト

以下の数値は、2026 年 5 月の価格を基準とした購入時のハードウェア予算であり、電気代は含まれていません。

#V4 Pro(Q4で約1,040 GB)を動かすには

8台×H200 141GB クラスタ
ハードウェアとサーバーで約280,000 €、設置まで含めると約320,000 €。FP8をネイティブに利用する、vLLMの「きちんとした」構成です。
中古のA100 80GBを8基搭載したクラスター
ハードウェアは約90,000ユーロ、シャーシを含めると約110,000ユーロ。640 GB の VRAM でテンソル並列処理を行います。より手頃ですが、速度は遅くなります。
Swarm 2× Mac Studio M3 Ultra 512 GB
2026年5月の価格で約28,000ユーロ(M3 Ultraは新品の販売が終了。M5 Ultra 512 GBは2026年10月末に発表)。Pro Q4をローカルで動かす最も安価な方法です。生成速度は控えめですが(5〜8トークン/秒)、10 GbE経由のllama.cpp RPCで実際に動作します。
同等構成のクラウドレンタル
Lambda/CrusoeでH200を8基利用すると、約60 €/時。累計約5,500時間を超えると、購入と比べて費用面で有利になります。

#V4 Flash を動作させるために(Q4 約170 GB)

Mac Studio M2 Ultra 192GB
リカバリー済みで約4,200€(新品販売は停止)。一人で最短のルートです。
Mac Studio M3 Ultra 256GB
Appleでは新品の販売が終了しています(256 GB構成があるM5 Ultraに置き換えられました)。中古品を探す必要があり、価格は変動します。長いコンテキストやthinking Maxモードで使う際に、より余裕があります。
4× RTX 4090 24GB ワークステーション
中古GPU(RTX 4090、価格は変動)+約4,500ユーロ(筐体・電源・CPU)。CUDAのみで構成でき、vLLMも利用可能です。
2× RTX 6000 Ada 48GB
価格は要確認(プロ向けカードのため価格追跡の対象外)。4090を4枚使うより構成がすっきりし、騒音も少なくなります。
同等構成のクラウドレンタル
Hyperstack/Lambdaで4×A100 80GBを使用した場合、約4€/h。累計で約1,600時間以上経過するとMac Studioよりも経済的になります。
!
コストと品質のバランスでは、Flashが圧倒的に有利です。
ハイエンドのMac Studioでは、Flash Q4が約12トークン/秒で動作します(Appleのメモリ容量の選択肢は変わっているため、構成を確認してください)。Pro Q4を同じ速度で動かすには、32万ユーロのH200クラスタが必要です。ローカル実行にかける予算が現実的な範囲(3万ユーロ未満)であれば、計算上、Flashが唯一の実行可能な選択肢です。

#3. レイテンシとスループットの比較

以下は、thinkingモードをNonに設定し、コンテキスト8k、プロンプト500トークン、生成1,000トークンで測定した数値です。測定値はDeepSeekの論文と2026年5月のコミュニティベンチマークに基づいています。

#V4 Pro Q4_K_M

クラスタ 8× H200 (vLLM FP8)
TTFT ~0.8秒 · 38トークン/秒 · 1000トークンは約27秒で完了
8× A100 80GB クラスタ (vLLM Q4)
TTFT:約1.4秒 · 生成速度:22トークン/秒 · 1000トークンに約47秒。
Swarm 2× Mac Studio M3 Ultra 512 (llama.cpp RPC)
TTFTは約6秒・スループットは6トークン/秒・1000トークンの生成に約3分。RPCのネットワーク通信による性能低下が支配的です。

#V4 Flash Q4_K_M

Mac Studio M3 Ultra 256GB(MLX)
TTFT ~0.4秒 · 28トーク/秒 · 1000トークは約36秒で完了。ソロ利用の最適ポイント。
Mac Studio M2 Ultra 192 GB (llama.cpp)
TTFT~0.6秒 · 14トークン/秒 · 1000トークンは約72秒で完了。
4× RTX 4090 24GB (vLLM)
TTFT 約0.3秒 · 生成速度52 tok/s · 1000トークンを約19秒で生成。ローカルで最も高速。
2× A6000 48GB (vLLM)
TTFT 約0.4秒 · 生成スループット38トークン/秒 · 1000トークンを約26秒で生成。
i
thinkingモードで状況は一変する
上記の数値は、thinking設定が「Non」の場合のものです。Highモードでは、回答前の思考時間がさらに5〜20秒かかります。Maxモードでは3〜30分を見込んでください。処理速度を大きく低下させるのは、このモードです。MaxモードでProとFlashを比較すると、待ち時間の差は非常に大きくなります(クラスタ上のPro Maxは5分未満に収まりますが、Mac上のFlash Maxは20分を超えることがよくあります)。

#4. ハードウェアに応じた決定木

5つの質問で、1つの結論に。上から順に読み、最初の答えが見つかったところで止めてください。

  1. 01
    GPU予算が200,000 €を超え、妥協のない最先端の性能が必要ですか?
    → DeepSeek V4 Pro Q4 を H200 × 8 または A100 × 8 のクラスターで実行。銀行、研究所、主権国家の行政機関向けです。Pro を選ぶことが合理的なのは、このシナリオだけです。
  2. 02
    Mac Studio M3 Ultra 512GBを2台お持ち、または導入予定で(価格は変動するため要確認)、5〜8 tok/sを許容できますか?
    → llama.cpp RPCを使えば、V4 Pro Q4を実行できます。夜間のバッチ処理専用とし、対話的な用途には決して使わないでください。それ以外の場合は、次のステップに進んでください。
  3. 03
    ハイエンドのMac Studio Ultraをお持ちですか(現在はメモリ容量の選択肢が異なります。価格は要確認)?
    → MLXまたはllama.cppでV4 Flash Q4を実行。世代に応じて12〜28トークン/秒。2026年の個人利用では最高の体験です。
  4. 04
    NVIDIAのGPUを2〜4台お持ちで、合計VRAMが80GBを超えていますか?
    → V4 Flash Q4 で vLLM(推奨)または llama.cpp を使用。Mac Studio に比べて処理速度は高いものの、騒音・電力消費・サイズが大きくなります。
  5. 05
    VRAMが80GB未満(例:RTX 4090単体など)ですか?
    → Q4ではProもFlashも動かせません。予定されているFlash→32Bの蒸留モデルを検討するか、それまでの間はDeepSeek V3.5 32B / Qwen3.6 35B-A3Bを代わりに使ってください。
→
決定的な基準:インタラクティブかバッチか
リアルタイムでチャットしたい場合は、トークン/秒で表される処理速度を確認してください。800ページのPDFを夜間に分析したい場合は、Maxモードでの品質を確認してください。対話用途のFlash > 夜間バッチ処理のPro > 対話用途のPro(ただし、クラスターを用意する予算がある場合を除く)。

#5. 用途に応じた選び方

公開ベンチマークだけでは、すべては分かりません。ここでは、用途別に率直な見方を示します。

汎用チャットアシスタント、翻訳、要約
Flashで十分です。これらの用途ではProとの差は2〜4ポイントで、実際の使用では違いを感じません。生成速度を優先してください。
コード(生成、リファクタリング、デバッグ)
HighモードのFlashは、Pro Nonに非常に近い性能です。複雑なデバッグではPro Maxが優位ですが、回答ごとに10分待つ必要があります。
数学、証明、AIME/GPQA
Pro Maxは難易度によってFlash Maxに対して8から15ポイントの優位性を示します。これはProが実際に価値を発揮する使用シーンです。
長い文書(20万トークン超)の分析
技術的同等性(両方とも1Mトークンを処理可能)。差異はCSA注意の部分にあり、両方で同じです。KVキャッシュのVRAM使用量に応じて選択してください。
ツール呼び出しをサポートするエージェント
Flashで十分です。ツール呼び出しを制御するのは、チャットテンプレートとInstructのファインチューニングであり、モデルのサイズではありません。
ローカルでのファインチューニング(LoRA)
FlashはH100を2基使えば現実的に対応できます。ProをローカルでLoRA学習するのは現実的ではなく、学習用クラスターが必要です。
!
「最高のモデルが欲しい」という考えの落とし穴
多くの人は「とにかくProがいい」と考え、メールを生成するために320,000ユーロをつぎ込んでから後悔します。処理したいリクエストがNonモードで収まるなら、使わない能力の99%にお金を払っていることになります。まずFlashから始め、Flash Maxが本当に対応できないケースを測定してください。その一覧が費用差に見合う場合に限り、Proを検討してください。

#ヒントと落とし穴

KVキャッシュの量子化
両モデルにおいて、--cache-type-k q8_0 --cache-type-v q8_0(llama.cpp)または--kv-cache-dtype fp8(vLLM)により、KVメモリは2倍に減少し、品質の損失はほぼないため、64k以上のコンテキストを扱う場合に必須です。
Flash Attention が必須です
-fa(llama.cpp)または --enable-flash-attn(vLLM)を有効にしてください。無効のままだと、スループットが 30% 低下し、コンテキスト長が 32k を超えるとメモリ使用量が急増します。
デフォルトのthinkingモード
どちらのモデルでも、Maxモードをデフォルトで有効にしたままにしないでください。ループに陥ったエージェントは、何時間も思考を続けることがあります。/thinkまたは/think_maxで明示的に切り替えてください。
Pro でのマルチ-GPU:パイプライン並列を避ける
H200クラスタでは、8基のGPUでテンソル並列処理を行います。パイプライン並列処理は層間の遅延を増やし、1.6TのMoEではこの遅延が支配的になります。vLLMは--tensor-parallel-size 8を指定すると、これを自動的に処理します。
Swarm Mac Studio:10 GbE 以上が必要
llama.cppのRPCは多数の中間テンソルを転送します。1 GbEでは、Proの生成速度が1トークン/秒未満に落ちます。10 GbEスイッチとSFP+ケーブルを用意してください。
チャットテンプレートは厳密に同一
ProとFlashは同じ形式を使います。一方で動くスクリプトはもう一方でも動くため、アプリケーションコードを書き直さずにA/Bテストを行うのに便利です。

#さらに詳しく

使用するバージョンを選んだら、導入には以下のガイドを参照してください。

DeepSeek V4 Pro 1.6T : アーキテクチャ、インストール、ベンチマーク
Pro を選ぶと決めた方に向けた、クラスターへのインストールガイドです。
DeepSeek V4 Flash 284B:Mac Studioに収まる最初のフロンティアモデル
Mac Studio Ultraでのインストール手順と詳細なベンチマーク。
Mac Studio(M2/M3/M4 Ultra、64–512 GB)で使えるLLMは?
予算に合ったMac Studioの構成を見極めるために。
llama.cppによるマルチGPUセットアップ
毎秒のトークン数を落とさずに、ローカル環境でNVIDIA GPUを2〜4基接続するための定番ガイドです。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。