中級 12 分MacBook Pro

MacBook Pro M3 Pro / Max(18〜128GB)に適したLLMはどれか ?

MacBook Pro M3 Pro / Max(2023年末モデル)は、2026年のローカルLLM用ノートPCとして、性能と価格のバランスが優れた選択肢です。16コアのM3 Maxは400 GB/sの帯域幅と最大128 GBのユニファイドメモリを備え、2026年のオープンウェイトモデルの全ラインナップをフル精度で実行するのに十分です。たとえば、Qwen 3.6 35B-A3BをQ8で、Qwen 3.8 27Bをデンスモデルとして実行したり、128k以上のコンテキストで複数のモデルを同時に読み込んだりできます。ただし、M3 Proではメモリ帯域幅が引き下げられています(M2 Proの200 GB/sに対して150 GB/s)。このガイドでは、各バリエーションで実際に何ができるのかを整理します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-08-27·macOS 14+ でテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: MacBook Pro M5 Pro — 24 GB / 1 TB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#2026年のMBP M3 Pro / Max

公開日
2023年10月〜11月。macOS Sequoia以降でも引き続きサポートされています。
M3 Pro
CPUコア11または12基+GPUコア14または18基、150 GB/s(M2 Proより低下)、RAM 18または36 GB。
M3 Max 14コア
14コア CPU + 30コア GPU、300 GB/s、RAM 36GB または 96GB です。
M3 Max 16コア
16コアCPU + 40コアGPU、400GB/s、RAM 48GB、64GB、または128GB。
!
M3 Proの罠
Apple は M3 Pro のメモリ帯域を150GB/s(M2 Proは200GB/s)に低下させました。結果として、M3 ProはM2 ProよりもLLM処理において遅いです。M3を求める場合は、直接M3 Maxを選びましょう — または、中古のM2 Proを維持してください。

#1. M3 ProとM3 Maxの比較(落とし穴に注意)

M3 Pro 150 GB/s
9B〜12B(約 30 tok/s)では適切ですが、24B 以上のデンスモデル(約 12 tok/s)では性能が低下します。24B 以上のデンスモデルをターゲットにする場合は避けてください。
M3 Max 14コア 300 GB/s
最適なバランス:Qwen 3.6 35B-A3B(MoE)で35〜38 tok/s、Qwen 3.8 27B(Dense)で15〜17 tok/s。最大RAM 96 GB。
M3 Max 16コア 400 GB/s
最上位モデル。大規模モデルでは速度が30%向上し、128GBのRAMを選べるため、Q8のフル精度や複数モデルの並列実行が可能になります。

#2. 18GBから128GB:どのLLMが適しているか

MBP M3の構成別に対応するモデル
モデルQuantM3 Pro 18M3 Pro 36M3 Max 64M3 Max 96M3 Max 128
Qwen 3.5 9BQ5_K_M✓ 30✓ 32✓ 46✓ 48✓ 50
Gemma 4 12BQ5_K_M✓ 14✓ 16✓ 26✓ 28✓ 30
Mistral Small 24BQ5_K_M—✓ 10✓ 17✓ 19✓ 20
Qwen 3.8 27BQ5_K_M——✓ 15✓ 16✓ 17
Qwen 3.6 35B-A3BQ5_K_M——✓ 38✓ 40✓ 42
Qwen 3.6 35B-A3BQ8_0——✓ 32✓ 34✓ 36
Qwen3-Coder 30B-A3BQ8_0——✓ 33✓ 35✓ 37
GLM 4.7 FlashQ4_K_M——✓ 44✓ 46✓ 48

#3. ベンチマーク(トークン/秒)

概算値 — MBP M3 Max、16コアGPU、128 GB、Ollama、電源接続時
モデルQ4_K_MQ5_K_MFlash Attn 8k
Qwen 3.5 9B54 t/s50 t/s48 t/s
Gemma 4 12B34 t/s30 t/s29 t/s
Mistral Small 24B22 t/s20 t/s19 t/s
Qwen 3.8 27B19 t/s17 t/s16 t/s
Qwen 3.6 35B-A3B46 t/s42 t/s40 t/s

#4. インストールと設定

MBP M3 Max 128 GBの完全なセットアップ
brew install --cask ollama

# Relever la mémoire GPU (128 Go → 116 Go GPU)
sudo sysctl iogpu.wired_limit_mb=118784
echo "iogpu.wired_limit_mb=118784" | sudo tee -a /etc/sysctl.conf

# Flash Attention + KV cache Q8
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

brew services restart ollama
ollama pull qwen3.6:35b

#5. Flash Attentionを使って大規模モデルをフル精度で動かす

Flash Attentionは、長年CUDAに限定されていましたが、2024年末からMetalでllama.cppおよびOllamaを介して利用可能になりました。長文のコンテキスト処理において大きな効果が得られ、Qwen 3.6 35B-A3Bを128kのコンテキストに拡張する上で不可欠です

Macキット

あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応
llama.cpp カスタムコンパイル — Qwen 3.6 35B コンテキスト 16k
./build/bin/llama-cli \
  -m ./models/qwen3.6-35b-a3b-q5_K_M.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 16384 \
  --temp 0.7
→
M3 Maxで測定されたFlash Attentionによる性能向上
コンテキスト4k:+8%。コンテキスト8k:+15%。コンテキスト16k:+25%。コンテキストの量が増えるほど、効果は明確になります。M3 Maxでは常に有効に設定してください。

#6. M3 Max 128GB:ワークステーションの領域

Qwen 3.6 35B-A3B Q8
フル精度で最高品質。約36トークン/秒(MoE、アクティブなパラメータは3B)。128GBあれば、コンテキストを犠牲にせずQ8を使えます。
Qwen 3.8 27B Q8
フル精度で動作させる最大規模の汎用デンスモデル(約29 GB)。約15トークン/秒。2026年の「Copilotに近い」モデルで、視覚機能も備えています。
並列で30Bモデル2つ
Qwen 3.6 35B-A3B と Qwen3-Coder 30B-A3B を同時にロードします。合計約42 GB。マルチスペシャリストエージェント向けです。
35Bモデルで128k以上のコンテキスト
KVキャッシュをQ8にすると、Qwen 3.6 35B-A3Bを128kのコンテキストと合わせて約50 GBに収められます。長い文書の本格的な分析に対応できます。

#M3 Max と M4 Max の比較

帯域幅
M3 Max 16コア = 400 GB/s。M4 Max 16コア = 546 GB/s(+36%)。
Qwen 3.6 35B-A3B の速度
M3 Maxは約40トークン/秒、M4 Maxは約54トークン/秒。実際の使用で35%の速度向上です。
最大RAM
同じ:両方のトップ構成において128GBです。
判定
新品で買うならM4 Max。価格が25%安い中古のM3 Maxも、とてもお買い得です。

#よくある質問

LLMの処理では、M3 Proは本当にM2 Proより遅いのでしょうか?+
はい、24B以上の密集モデルでは、帯域幅(150GB/s対200GB/s)の問題により影響を受けます。Qwen 3.5 9Bでは差は小さい(約5%)。Mistral Small 24BではM2 Proが10~15%速いです。アドバイス:中古で購入し、24B以上の密集モデルを狙う場合、M2 Proを優先またはM3 Maxに直接進むことをおすすめします。
2026年の大規模モデルを動かすには、どのMBP M3が適していますか?+
Q8のQwen 3.6 35B-A3B(約35トークン/秒、MoE)を動かすなら、14コアのM3 Max・64 GB構成、複数のモデルを読み込んだりコンテキストを128kまで伸ばしたりするなら、16コアのM3 Max・96〜128 GB構成が適しています。M3 Pro・36 GB構成では、24Bの密なモデルまでに限られます。
M3 Max 14コアモデルと16コアモデルの実際の差は?+
帯域幅は30%増(300GB/sから400GB/s)、GPUコア数は33%増で、128GB RAMのオプションもあります。大規模なMoE 35Bモデルでは速度が40%向上しますが、9Bモデルでは8%の向上にとどまります。大規模モデルを使いたいなら、16コア版は投資する価値があります。
2026年に128GBのRAMは本当に役立ちますか?+
Qwen 3.6 35B-A3BをQ8(フル精度で、Q4より高品質)で動かしたい場合、30Bモデルを2つ並列で動かしたい場合、または128kのコンテキストを使いたい場合は、はい、有用です。標準的な用途なら、64GBで十分余裕があります。
M3 MaxでFlash Attentionを使うと、本当に違いがありますか?+
はい。8k〜16kのコンテキストでは、品質を損なわずに速度が15〜25%向上します。OLLAMA_FLASH_ATTENTION=1 を設定して、通常は有効にしておく。
大規模モデルでのチャット中のバッテリー持続時間は?+
16インチのM3 Maxでは、連続してチャットを行う場合、約1時間40分です(消費電力は約50 W)。外出先での利用にも十分な時間です。大規模モデルでバッチ処理を行う場合は、最大1時間と見込んでください。コンセントにつないで使うことをおすすめします。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。