DeepSeek V4 Flash 284B : Macに搭載可能な1つ目のFrontier Studio
DeepSeek V4 Flash 284Bは、2026年4月24日にV4 Proと同時にリリースされました。「efficient」版に当たり、MoE構成で総パラメータ数は2840億(トークンあたりのアクティブパラメータ数は130億)、MITライセンス、コンテキスト長は100万トークンです。CSA+HCAアーキテクチャと3つのthinkingモードもProと同じです。何より、1台のワークステーションに収まる初のフロンティアクラスモデルです。Q4では170 GBなので、256 GBのMac Studio M3 Ultraで十分です。このガイドでは、インストール方法と実力を解説します。
#DeepSeek V4 Flashの概要
- 公開日
- 2026年4月24日、V4 Proと同時にリリース。HuggingFaceで公開:deepseek-ai/DeepSeek-V4-Flash。
- アーキテクチャ
- MoEで総パラメータ数は284B、トークンごとに13Bがアクティブになります。各層に128のエキスパートがあり、top-8ルーティングを使用します。Base版とInstruct版が利用可能です。
- Proから受け継いだ技術革新
- CSA+HCAアテンション、mHC、Muonオプティマイザ、FP4+FP8混合精度学習。
- コンテキスト
- ネイティブで1,000,000トークンに対応(Proと同じ)。
- 思考モード
- 3段階:Non / High / Max — プロンプトで切り替え可能
- ライセンス
- Proと同じMITライセンスです。商用利用の制限も、地域による制限もありません。
#1. なぜこれが大きな出来事なのか
2026年4月24日以前、フロンティアモデルをローカルで実行するには、8万ユーロ以上のGPUクラスタを用意するか、70Bモデルの低い品質を受け入れる必要がありました。DeepSeek V4 Flashはこの状況を変えます。Q4で170 GBのモデルが、中古なら4,000〜8,000ユーロの構成に収まります。
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
- Mac Studio M3 Ultra 256GB
- 2026年9月まではカタログ価格が7,299ユーロでしたが、現在は中古品のみです(Apple では256 GBの M5 Ultra が後継となっています)。モデル170 GB+コンテキスト30 GBでも、メモリに余裕を持って収まります。Q4では約10〜12トークン/秒です。
- 2× RTX 5090 32 GB(64 GB VRAM)
- 約11,400ユーロ。容量不足で、約110 GB足りません。CPU オフロードを使えば実行できますが、低速です(3〜5トークン/秒)。
- 4× RTX A6000 48 GB (192 GB VRAM)
- 中古で約12,000ユーロ。余裕を持ってメモリに収まり、約18〜25トークン/秒。
- ワークステーション 2× Mac Studio Max 64 GB
- 単体では不十分です。llama.cpp RPC swarmと4台のMac Studioを組み合わせれば可能で、約5トークン/秒です。
#2. アーキテクチャ(V4の効率重視の派生版)
V4 Flash は V4 Pro の比例縮小版です:約 5.7 倍少ない専門家、約 3.8 倍少ないアクティブパラメータを持ちながらも、CSA+HCA + Muon + FP4/FP8 という構造がそのまま保持されています。この一貫性が、V4 Flash が Pro の品質を継承しつつも、コストを大きく削減できるようにしています。
- 層ごとのエキスパート
- 128(Pro は 256)です。トップ8ルーティングは同じです。
- アクティブなパラメータ
- 13B(Proは49B)。総パラメータ数が同等の場合、推論速度は約3.8倍。
- レイヤー
- 61層(Pro:76層)。推論の深さを保つため、層数の削減は控えめです。
- アテンションヘッド
- Proと同じです(CSA+HCAの設定も同一)。長いコンテキストでの品質を保つため、アテンションは削減していません。
- 事前学習
- 「効率的な推論」を目指す:18Tトークン(Proは32T)。数学とコード向けに最適化したデータの組み合わせを使用。
#3. 量子化ごとのハードウェア
| Quantization | モデルの VRAM | + KV 32k | 推奨構成 |
|---|---|---|---|
| FP16(基準) | 568 GB | ~620GB | DC:H200 141 GB × 4。ローカルでの実行は現実的ではありません。 |
| Q8_0 | 305GB | ~340GB | Mac Studio M3 Ultra 512 GB、またはRTX 4090 24GBを8枚。 |
| Q5_K_M | 205 GB | ~235 GB | Mac Studio Ultra 256 GBではぎりぎり、RTX A6000 48GBを4枚搭載すれば余裕があります。 |
| Q4_K_M | 170GB | ~200GB | Mac Studio Ultra 256GB、4× RTX 4090 24GB、2× RTX 6000 Ada 48GB |
| IQ3_M(圧縮済み) | 130GB | ~160 GB | Mac Studio M2 Ultra 192 GB、4× RTX 4090(少量をシステム RAM にオフロード)。 |
| IQ2_XS(極端) | 85 GB | ~115 GB | RTX 5090+64 GBのDDR5メモリへのオフロード、またはRTX 4090×2。 |
#4. Mac Studio Ultra 256/512 GBの設定
#5. NVIDIAマルチGPU設定
#オプションA — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)
#オプション B — llama.cpp による部分オフロード
#6. ベンチマークおよびトークン/秒の測定値
| Benchmark | V4 Flash | V4 Pro | Llama 4 Scout 109B | Mistral Large 2 |
|---|---|---|---|---|
| MMLU-Pro | 79.4 | 84.2 | 76.8 | 75.3 |
| GPQA Diamond | 70.1 | 78.5 | 63.2 | 59.4 |
| AIME 2025 | 76.5 | 87.0 | 61.3 | 52.1 |
| LiveCodeBench v5 | 72.6 | 79.8 | 65.4 | 61.8 |
| LongBench v2 (1M) | 68.9 | 72.6 | — | — |
| Setup | Nonモードのトークン/秒 | Highモードのトークン数/秒 | Maxモードのトークン/秒 |
|---|---|---|---|
| Mac Studio M3 Ultra 256GB | 10-12 | 8-10 | 5-7 |
| Mac Studio M3 Ultra 512GB | 12-14 | 10-12 | 7-9 |
| 4× RTX A6000 48GB | 20-25 | 16-20 | 12-15 |
| 2×RTX 5090 + 64GBオフロード | 3-5 | 2-4 | 1-2 |
#7. Thinkingモードと長コンテキストモード
V4 Flash は V4 Pro の3つの思考モードを継承しており、品質はやや劣りますが、推論コストは大幅に低くなっています。インフラを独占せずに推論する必要があるエージェントに適した選択です。
- 非モード
- 直接回答します。レイテンシは非常に低く、ストリーミング開始まで約1秒です。対話型チャットや翻訳向けです。
- Highモード
- 回答前に200~2000トークンの思考連鎖(chain-of-thought)。数学・コードの品質が25%向上。最終回答の最初のトークンが出るまでの遅延は5~15秒。
- Maxモード
- 思考トークン数は最大16k。ローカルでの待ち時間は1〜5分。難しい問題(数学の証明、複雑なデバッグ)に限って使用してください。
- 1Mの長いコンテキスト
- HCAによりV4 Proと同等の能力を実現。Needle-in-Haystack 1Mは約95%(Proは98%)です。大規模なデータベースを使うRAGに非常によく適しています。
#V4 Flash と V4 Pro:どちらを選ぶか
| 基準 | V4 Flash 284B | V4 Pro 1.6T |
|---|---|---|
| 総パラメータ数 | 284 B | 1 600 B |
| アクティブなパラメータ/トークン | 13 B | 49 B |
| VRAM Q4_K_M | 170GB | 960 GB |
| ローカルでの最小ハードウェア要件 | Mac Studio Ultra 256GB(中古のM3 Ultraまたは新品のM5 Ultra) | クラスタ費用は約80,000ユーロ |
| ローカル実行時の典型的な速度(トークン/秒) | 10-25 | 0,5-2 |
| MMLU-Proでの性能 | 79.4 | 84.2 |
| AIME 2025 での性能 | 76.5 | 87.0 |
| ネイティブコンテキスト | 1 M | 1 M |
| thinking maxモード | はい | はい(品質がより高い) |
| ライセンス | MIT | MIT |
#2026年7月31日に正式発表(ビルド0731)
DeepSeekは2026年7月末にV4-Flashのプレビューをビルド「0731」とともに公開しました。APIはパブリックベータ版です。また、V4-Proの初期価格は75%低下し、出力トークン100万あたり0.87ドルになりました。Artificial AnalysisはV4ファミリーを「オープンウェイトのリーダーの一人」と位置づけています。重みの面では変化はありません。総パラメータ数284B、アクティブ13Bであり、依然としてハイエンドローカル環境(Mac 256 GB、Strix Halo、マルチGPU)でアグレッシブな量子化により半ば実用的に動作する唯一のV4バリアントです。
8月2日から、LM Studioでもこれを利用できるようになりました。マシンの性能が足りればローカルで、またはBionicアプリを通じて米国のサーバー上で利用できます。後者では「Zero Data Retention」がデフォルトです。このサイトの方針はあくまで100%ローカルですが、このトレードオフは知っておく必要があります。
#FAQ
DeepSeek V4 Flash は、Mac Studio M3 Ultra 256GB で実際に動作していますか?+
V4 Flashをローカルで実用的に動かす構成には、いくらかかりますか?+
V4 Flashを選ぶべきですか、それとも70Bの蒸留モデルを待つべきですか?+
V4 FlashはLlama 4 Maverick / Scoutを上回るか?+
Mac Studio M3 Ultra が V4 Flash インフェレンス時に消費する電力はどれくらいですか?+
V4 Flashでthinking Maxモードを使う価値はありますか?+
V4 Flash をローカルでファインチューニングできますか?+
2026年4月25日時点で、安定したQ4量子化版はありますか?+
価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。