中級 14 分DeepSeek

DeepSeek V4 Flash 284B : Macに搭載可能な1つ目のFrontier Studio

DeepSeek V4 Flash 284Bは、2026年4月24日にV4 Proと同時にリリースされました。「efficient」版に当たり、MoE構成で総パラメータ数は2840億(トークンあたりのアクティブパラメータ数は130億)、MITライセンス、コンテキスト長は100万トークンです。CSA+HCAアーキテクチャと3つのthinkingモードもProと同じです。何より、1台のワークステーションに収まる初のフロンティアクラスモデルです。Q4では170 GBなので、256 GBのMac Studio M3 Ultraで十分です。このガイドでは、インストール方法と実力を解説します。

著者 Mohamed Meguedmi·更新 2026-08-11·Windows・macOS・Linuxでテスト済み

#DeepSeek V4 Flashの概要

公開日
2026年4月24日、V4 Proと同時にリリース。HuggingFaceで公開:deepseek-ai/DeepSeek-V4-Flash。
アーキテクチャ
MoEで総パラメータ数は284B、トークンごとに13Bがアクティブになります。各層に128のエキスパートがあり、top-8ルーティングを使用します。Base版とInstruct版が利用可能です。
Proから受け継いだ技術革新
CSA+HCAアテンション、mHC、Muonオプティマイザ、FP4+FP8混合精度学習。
コンテキスト
ネイティブで1,000,000トークンに対応(Proと同じ)。
思考モード
3段階:Non / High / Max — プロンプトで切り替え可能
ライセンス
Proと同じMITライセンスです。商用利用の制限も、地域による制限もありません。

#1. なぜこれが大きな出来事なのか

2026年4月24日以前、フロンティアモデルをローカルで実行するには、8万ユーロ以上のGPUクラスタを用意するか、70Bモデルの低い品質を受け入れる必要がありました。DeepSeek V4 Flashはこの状況を変えます。Q4で170 GBのモデルが、中古なら4,000〜8,000ユーロの構成に収まります。

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート
Mac Studio M3 Ultra 256GB
2026年9月まではカタログ価格が7,299ユーロでしたが、現在は中古品のみです(Apple では256 GBの M5 Ultra が後継となっています)。モデル170 GB+コンテキスト30 GBでも、メモリに余裕を持って収まります。Q4では約10〜12トークン/秒です。
2× RTX 5090 32 GB(64 GB VRAM)
約11,400ユーロ。容量不足で、約110 GB足りません。CPU オフロードを使えば実行できますが、低速です(3〜5トークン/秒)。
4× RTX A6000 48 GB (192 GB VRAM)
中古で約12,000ユーロ。余裕を持ってメモリに収まり、約18〜25トークン/秒。
ワークステーション 2× Mac Studio Max 64 GB
単体では不十分です。llama.cpp RPC swarmと4台のMac Studioを組み合わせれば可能で、約5トークン/秒です。
→
真に際立つ存在:Mac Studio Ultra
M3 Ultra 256 GB(2026年9月までのカタログ価格は7,299 €、現在は中古で入手)は、チャットモードでDeepSeek V4 Flash Q4を約10トークン/秒で実行します。この価格でフロンティアモデルを動かせる個人用マシンは、世界中を見てもほかにありません。これを可能にしているのがApple Siliconです(ユニファイドメモリ+800 GB/sの帯域幅)。

#2. アーキテクチャ(V4の効率重視の派生版)

V4 Flash は V4 Pro の比例縮小版です:約 5.7 倍少ない専門家、約 3.8 倍少ないアクティブパラメータを持ちながらも、CSA+HCA + Muon + FP4/FP8 という構造がそのまま保持されています。この一貫性が、V4 Flash が Pro の品質を継承しつつも、コストを大きく削減できるようにしています。

層ごとのエキスパート
128(Pro は 256)です。トップ8ルーティングは同じです。
アクティブなパラメータ
13B(Proは49B)。総パラメータ数が同等の場合、推論速度は約3.8倍。
レイヤー
61層(Pro:76層)。推論の深さを保つため、層数の削減は控えめです。
アテンションヘッド
Proと同じです(CSA+HCAの設定も同一)。長いコンテキストでの品質を保つため、アテンションは削減していません。
事前学習
「効率的な推論」を目指す:18Tトークン(Proは32T)。数学とコード向けに最適化したデータの組み合わせを使用。

#3. 量子化ごとのハードウェア

必要な総VRAM(モデル+KVキャッシュ32kトークン)
Quantizationモデルの VRAM+ KV 32k推奨構成
FP16(基準)568 GB~620GBDC:H200 141 GB × 4。ローカルでの実行は現実的ではありません。
Q8_0305GB~340GBMac Studio M3 Ultra 512 GB、またはRTX 4090 24GBを8枚。
Q5_K_M205 GB~235 GBMac Studio Ultra 256 GBではぎりぎり、RTX A6000 48GBを4枚搭載すれば余裕があります。
Q4_K_M170GB~200GBMac Studio Ultra 256GB、4× RTX 4090 24GB、2× RTX 6000 Ada 48GB
IQ3_M(圧縮済み)130GB~160 GBMac Studio M2 Ultra 192 GB、4× RTX 4090(少量をシステム RAM にオフロード)。
IQ2_XS(極端)85 GB~115 GBRTX 5090+64 GBのDDR5メモリへのオフロード、またはRTX 4090×2。
i
2026年のベストバランス
Mac Studio M3 Ultra 256 GBをQ4_K_Mで使う構成は、個人で本格的に利用する場合に、価格・品質・速度のバランスが最も優れています。新品価格は2026年9月まで7,300 €でした(現在は中古品、または新品のM5 Ultra 256 GB)。速度は約10トークン/秒、品質はほぼFP16相当です(この規模では、Q4によるベンチマーク性能の低下は2%未満)。PCで同等の構成を実現するには、12,000 €を超える予算が必要です。

#4. Mac Studio Ultra 256/512 GBの設定

Mac Studio M3 Ultraでのインストール手順一式
# 1. Relever la mémoire GPU allouable
sudo sysctl iogpu.wired_limit_mb=240640    # 256 Go : 235 Go GPU
# Ou pour Mac Studio 512 Go :
# sudo sysctl iogpu.wired_limit_mb=491520

# Persistant
echo "iogpu.wired_limit_mb=240640" | sudo tee -a /etc/sysctl.conf

# 2. llama.cpp avec Metal + Flash Attention
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# 3. Téléchargement Q4_K_M (~170 Go split en chunks)
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash-GGUF \
  --include "*Q4_K_M*.gguf" \
  --local-dir ./models

# 4. Lancement avec optimisations max
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 65536 \
  --host 0.0.0.0 --port 8080
→
起動後
サーバーはhttp://localhost:8080でOpenAI互換のAPIを公開します。ここにOpen WebUI、Continue.dev、Aider、Raycast AIを接続してください。いずれも、ローカルで動作するフロンティアモデルで利用できます。

#5. NVIDIAマルチGPU設定

#オプションA — vLLM 4× RTX A6000 (48 GB × 4 = 192 GB)

vLLM tensor-parallel
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Flash \
  --tensor-parallel-size 4 \
  --quantization fp8 \
  --max-model-len 1000000 \
  --enable-prefix-caching \
  --port 8000

#オプション B — llama.cpp による部分オフロード

2×RTX 5090 + CPUへのオフロード
./build/bin/llama-server \
  -m ./models/DeepSeek-V4-Flash-Q4_K_M-00001-of-00004.gguf \
  -ngl 50 \
  --tensor-split 0.5,0.5 \
  -ctk q8_0 -ctv q8_0 \
  -c 32768
!
Offload = 遅い
VRAMに収まらないデータはシステムRAM(DDR5で約80GB/s に対し HBM3は1TB/s)にオフロードされます。50%オフロードの場合、速度は3〜5トークン/秒に低下します。インタラクティブな使用には、VRAMに100%収まるようにすることが望ましいです。

#6. ベンチマークおよびトークン/秒の測定値

DeepSeekが公開したベンチマーク(2026年4月24日)、Highモードの値
BenchmarkV4 FlashV4 ProLlama 4 Scout 109BMistral Large 2
MMLU-Pro79.484.276.875.3
GPQA Diamond70.178.563.259.4
AIME 202576.587.061.352.1
LiveCodeBench v572.679.865.461.8
LongBench v2 (1M)68.972.6——
実測トークン/秒(チャット、コンテキスト4k、Q4_K_M)
SetupNonモードのトークン/秒Highモードのトークン数/秒Maxモードのトークン/秒
Mac Studio M3 Ultra 256GB10-128-105-7
Mac Studio M3 Ultra 512GB12-1410-127-9
4× RTX A6000 48GB20-2516-2012-15
2×RTX 5090 + 64GBオフロード3-52-41-2

#7. Thinkingモードと長コンテキストモード

V4 Flash は V4 Pro の3つの思考モードを継承しており、品質はやや劣りますが、推論コストは大幅に低くなっています。インフラを独占せずに推論する必要があるエージェントに適した選択です。

非モード
直接回答します。レイテンシは非常に低く、ストリーミング開始まで約1秒です。対話型チャットや翻訳向けです。
Highモード
回答前に200~2000トークンの思考連鎖(chain-of-thought)。数学・コードの品質が25%向上。最終回答の最初のトークンが出るまでの遅延は5~15秒。
Maxモード
思考トークン数は最大16k。ローカルでの待ち時間は1〜5分。難しい問題(数学の証明、複雑なデバッグ)に限って使用してください。
1Mの長いコンテキスト
HCAによりV4 Proと同等の能力を実現。Needle-in-Haystack 1Mは約95%(Proは98%)です。大規模なデータベースを使うRAGに非常によく適しています。

#V4 Flash と V4 Pro:どちらを選ぶか

比較の概要
基準V4 Flash 284BV4 Pro 1.6T
総パラメータ数284 B1 600 B
アクティブなパラメータ/トークン13 B49 B
VRAM Q4_K_M170GB960 GB
ローカルでの最小ハードウェア要件Mac Studio Ultra 256GB(中古のM3 Ultraまたは新品のM5 Ultra)クラスタ費用は約80,000ユーロ
ローカル実行時の典型的な速度(トークン/秒)10-250,5-2
MMLU-Proでの性能79.484.2
AIME 2025 での性能76.587.0
ネイティブコンテキスト1 M1 M
thinking maxモードはいはい(品質がより高い)
ライセンスMITMIT
→
FlashとProをどう使い分けるか
V4 Flash:95%のケースに対応 — チャット、コード、RAG、エージェント、長いコンテキスト。ワークステーションに収まる唯一のフロンティアモデルです。V4 Pro:純粋な研究(数学、証明、AIME の競技問題)、および遅延やハードウェアのコストよりも最高の品質を重視するワークフロー向けです。

#2026年7月31日に正式発表(ビルド0731)

DeepSeekは2026年7月末にV4-Flashのプレビューをビルド「0731」とともに公開しました。APIはパブリックベータ版です。また、V4-Proの初期価格は75%低下し、出力トークン100万あたり0.87ドルになりました。Artificial AnalysisはV4ファミリーを「オープンウェイトのリーダーの一人」と位置づけています。重みの面では変化はありません。総パラメータ数284B、アクティブ13Bであり、依然としてハイエンドローカル環境(Mac 256 GB、Strix Halo、マルチGPU)でアグレッシブな量子化により半ば実用的に動作する唯一のV4バリアントです。

8月2日から、LM Studioでもこれを利用できるようになりました。マシンの性能が足りればローカルで、またはBionicアプリを通じて米国のサーバー上で利用できます。後者では「Zero Data Retention」がデフォルトです。このサイトの方針はあくまで100%ローカルですが、このトレードオフは知っておく必要があります。

#FAQ

DeepSeek V4 Flash は、Mac Studio M3 Ultra 256GB で実際に動作していますか?+
はい、Q4_K_M で:170 GB のモデル + 30 GB の32kコンテキスト + 8 GB のシステム = 約210 GBで、256 GB以内です。測定された速度:Nonモードで10〜12 tok/s、Highモードで8〜10 tok/sです。2026年4月時点で、この性能を実現できる唯一のMac単一マシンです。
V4 Flashをローカルで実用的に動かす構成には、いくらかかりますか?+
3つの予算:(1) Mac Studio Ultra 256 GB — M3 Ultraの中古(2026年9月まで新品7,300 €)またはM5 Ultraの新品。(2) 約12,000 € — 4× RTX A6000 48GB中古 + ワークステーション。(3) 約11,400 € — 2× RTX 5090 + 64 GB DDR5 + オフロード、ただし低速(3-5 tok/s)。
V4 Flashを選ぶべきですか、それとも70Bの蒸留モデルを待つべきですか?+
DeepSeekは、70Bと32Bの蒸留モデルを4〜6週間以内に提供すると発表しました。Mac Studio UltraやGPUクラスターを持っていない場合は、待つのが妥当です。すでに持っている場合は、今V4 Flashを使うほうが、5週間後に70Bの蒸留モデルを使うよりもはるかに有利です(品質が高く、コンテキストは100万トークン)。
V4 FlashはLlama 4 Maverick / Scoutを上回るか?+
DeepSeekが公開したベンチマークでは、はい、すべてで上回っています(MMLU-Proは79.4対Scoutの76.8、GPQAは70.1対63.2)。Chatbot Arenaによる独立した確認は、2週間以内に得られる見込みです。V4 Flashの明確な優位点は、ネイティブで1Mのコンテキストに対応していることです。一方、Llama 4は256kにとどまっています。
Mac Studio M3 Ultra が V4 Flash インフェレンス時に消費する電力はどれくらいですか?+
生成時のピークは約150W、モデルの読み込み後のアイドル時は約30Wです。8時間の稼働で約1.2kWh、つまり1日あたり約0.30ユーロです(フランス、2026年)。LED電球の方が待機時の消費電力は大きいです。
V4 Flashでthinking Maxモードを使う価値はありますか?+
Mac Studioでは、難問(数学、証明、デバッグ)に限っては「はい」となりますが、1〜5分の応答時間が必要です。通常のチャット用途ではHighモードで十分です(8〜10 tok/s、品質は~Mistral Large × 2)。
V4 Flash をローカルでファインチューニングできますか?+
LoRA / QLoRA:はい。512GBのMac Studio UltraでMLX-LMを使う方法(対応状況はインストールしたバージョンに応じて確認が必要)、またはunslothを使う方法(NVIDIA、A6000が最低4枚必要)があります。フルファインチューニング:ローカルでの実施は現実的ではありません。クラウドでの学習費用は推定20万~40万ドルです。
2026年4月25日時点で、安定したQ4量子化版はありますか?+
公式の GGUF Q4_K_M と Q5_K_M 量子化版は、今週末(4月26日〜27日)に HuggingFace で公開されます。vLLM 用の AWQ 量子化版はすでに利用可能(deepseek-ai/DeepSeek-V4-Flash-AWQ)。発表情報は X の @DeepSeek_AI をフォローしてください。

価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。

このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。