MacBook Pro M3 Pro / Max(18〜128GB)に適したLLMはどれか ?
MacBook Pro M3 Pro / Max(2023年末モデル)は、2026年のローカルLLM用ノートPCとして、性能と価格のバランスが優れた選択肢です。16コアのM3 Maxは400 GB/sの帯域幅と最大128 GBのユニファイドメモリを備え、2026年のオープンウェイトモデルの全ラインナップをフル精度で実行するのに十分です。たとえば、Qwen 3.6 35B-A3BをQ8で、Qwen 3.8 27Bをデンスモデルとして実行したり、128k以上のコンテキストで複数のモデルを同時に読み込んだりできます。ただし、M3 Proではメモリ帯域幅が引き下げられています(M2 Proの200 GB/sに対して150 GB/s)。このガイドでは、各バリエーションで実際に何ができるのかを整理します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: MacBook Pro M5 Pro — 24 GB / 1 TB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#2026年のMBP M3 Pro / Max
- 公開日
- 2023年10月〜11月。macOS Sequoia以降でも引き続きサポートされています。
- M3 Pro
- CPUコア11または12基+GPUコア14または18基、150 GB/s(M2 Proより低下)、RAM 18または36 GB。
- M3 Max 14コア
- 14コア CPU + 30コア GPU、300 GB/s、RAM 36GB または 96GB です。
- M3 Max 16コア
- 16コアCPU + 40コアGPU、400GB/s、RAM 48GB、64GB、または128GB。
#1. M3 ProとM3 Maxの比較(落とし穴に注意)
- M3 Pro 150 GB/s
- 9B〜12B(約 30 tok/s)では適切ですが、24B 以上のデンスモデル(約 12 tok/s)では性能が低下します。24B 以上のデンスモデルをターゲットにする場合は避けてください。
- M3 Max 14コア 300 GB/s
- 最適なバランス:Qwen 3.6 35B-A3B(MoE)で35〜38 tok/s、Qwen 3.8 27B(Dense)で15〜17 tok/s。最大RAM 96 GB。
- M3 Max 16コア 400 GB/s
- 最上位モデル。大規模モデルでは速度が30%向上し、128GBのRAMを選べるため、Q8のフル精度や複数モデルの並列実行が可能になります。
#2. 18GBから128GB:どのLLMが適しているか
| モデル | Quant | M3 Pro 18 | M3 Pro 36 | M3 Max 64 | M3 Max 96 | M3 Max 128 |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | Q5_K_M | ✓ 30 | ✓ 32 | ✓ 46 | ✓ 48 | ✓ 50 |
| Gemma 4 12B | Q5_K_M | ✓ 14 | ✓ 16 | ✓ 26 | ✓ 28 | ✓ 30 |
| Mistral Small 24B | Q5_K_M | — | ✓ 10 | ✓ 17 | ✓ 19 | ✓ 20 |
| Qwen 3.8 27B | Q5_K_M | — | — | ✓ 15 | ✓ 16 | ✓ 17 |
| Qwen 3.6 35B-A3B | Q5_K_M | — | — | ✓ 38 | ✓ 40 | ✓ 42 |
| Qwen 3.6 35B-A3B | Q8_0 | — | — | ✓ 32 | ✓ 34 | ✓ 36 |
| Qwen3-Coder 30B-A3B | Q8_0 | — | — | ✓ 33 | ✓ 35 | ✓ 37 |
| GLM 4.7 Flash | Q4_K_M | — | — | ✓ 44 | ✓ 46 | ✓ 48 |
#3. ベンチマーク(トークン/秒)
| モデル | Q4_K_M | Q5_K_M | Flash Attn 8k |
|---|---|---|---|
| Qwen 3.5 9B | 54 t/s | 50 t/s | 48 t/s |
| Gemma 4 12B | 34 t/s | 30 t/s | 29 t/s |
| Mistral Small 24B | 22 t/s | 20 t/s | 19 t/s |
| Qwen 3.8 27B | 19 t/s | 17 t/s | 16 t/s |
| Qwen 3.6 35B-A3B | 46 t/s | 42 t/s | 40 t/s |
#4. インストールと設定
#5. Flash Attentionを使って大規模モデルをフル精度で動かす
Flash Attentionは、長年CUDAに限定されていましたが、2024年末からMetalでllama.cppおよびOllamaを介して利用可能になりました。長文のコンテキスト処理において大きな効果が得られ、Qwen 3.6 35B-A3Bを128kのコンテキストに拡張する上で不可欠です
あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
#6. M3 Max 128GB:ワークステーションの領域
- Qwen 3.6 35B-A3B Q8
- フル精度で最高品質。約36トークン/秒(MoE、アクティブなパラメータは3B)。128GBあれば、コンテキストを犠牲にせずQ8を使えます。
- Qwen 3.8 27B Q8
- フル精度で動作させる最大規模の汎用デンスモデル(約29 GB)。約15トークン/秒。2026年の「Copilotに近い」モデルで、視覚機能も備えています。
- 並列で30Bモデル2つ
- Qwen 3.6 35B-A3B と Qwen3-Coder 30B-A3B を同時にロードします。合計約42 GB。マルチスペシャリストエージェント向けです。
- 35Bモデルで128k以上のコンテキスト
- KVキャッシュをQ8にすると、Qwen 3.6 35B-A3Bを128kのコンテキストと合わせて約50 GBに収められます。長い文書の本格的な分析に対応できます。
#M3 Max と M4 Max の比較
- 帯域幅
- M3 Max 16コア = 400 GB/s。M4 Max 16コア = 546 GB/s(+36%)。
- Qwen 3.6 35B-A3B の速度
- M3 Maxは約40トークン/秒、M4 Maxは約54トークン/秒。実際の使用で35%の速度向上です。
- 最大RAM
- 同じ:両方のトップ構成において128GBです。
- 判定
- 新品で買うならM4 Max。価格が25%安い中古のM3 Maxも、とてもお買い得です。
#よくある質問
LLMの処理では、M3 Proは本当にM2 Proより遅いのでしょうか?+
2026年の大規模モデルを動かすには、どのMBP M3が適していますか?+
M3 Max 14コアモデルと16コアモデルの実際の差は?+
2026年に128GBのRAMは本当に役立ちますか?+
M3 MaxでFlash Attentionを使うと、本当に違いがありますか?+
大規模モデルでのチャット中のバッテリー持続時間は?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。