ホーム › カタログ › MacBook Pro M4 Pro / Maxに最適なLLM(2026年)

MacBook Pro M4 Pro / Maxに最適なLLM(2026年)

◆ Mac — MacでローカルAIを最大限に活用 — ユニファイドメモリ、MLX、お使いのチップに適したモデル · 24 € · または全キットを49 €で →

ランキング更新日:2026年9月22日

MacBook Pro M4 Pro / Max(24〜128GB、273〜546GB/s)は、2026年のローカルAI用途に最適なノートPCです。ファンによる冷却と広いメモリ帯域幅により、Q4/Q5で30B〜70Bのモデルを動かすことを目指せます。

ローカル AI のオファーと代替案

価格を比較する: MacBook Pro M5 Pro — 24 GB / 1 TB 提携販売店にて(製品ページを確認済み):

予算に合わせてどの PC を選ぶべき?800~3,500 ユーロのおすすめをご紹介 →

アフィリエイトリンク — QuelLLM は購入に応じて紹介料を受け取る場合がありますが、お客様に追加費用はかかりません。紹介料の有無が、独立して作成したランキングに影響することはありません。Amazon アソシエイトとして、QuelLLM は条件を満たす購入から収益を得ます。

ランキング

1

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B パラメータ · Apache 2.0 · 128 000 トークン ctx

Gemma 4のMoE版。総パラメータ26B、アクティブパラメータ4B。テキスト・画像・音声に対応する完全なマルチモーダルモデル。

このランクの理由 Gemma 4のMoE版。総パラメータ26B、アクティブパラメータ4B。テキスト・画像・音声に対応する完全なマルチモーダルモデル。
ollama run gemma4:26b
Apple M4 Max(64 GB)上で
Q8
28GB · 22トークン/秒
2

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16B パラメータ · Apache 2.0 · コンテキスト:8,192トークン

Apache 2.0ライセンスで公開された初のdLLM:MoE 16B/1B + 拡散デコーダー6.2B。テキストとビジョンを統合。2026年4月22日公開。

このランクの理由 Apache 2.0ライセンスで公開された初のdLLM:MoE 16B/1B + 拡散デコーダー6.2B。テキストとビジョンを統合。2026年4月22日公開。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Apple M4 Max(64 GB)上で
FP16
47 GB · 60 tok/s
3

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B パラメータ · MIT · 128 000 トークン ctx

GLM-4.7-Flash(MoE 31B、アクティブパラメータ約3B):30Bクラスでコード性能とVRAM使用量のバランスが最も優れています。MITライセンス、128kコンテキスト、3090/4090で非常に高速。

このランクの理由 GLM-4.7-Flash(MoE 31B、アクティブパラメータ約3B):30Bクラスでコード性能とVRAM使用量のバランスが最も優れています。MITライセンス、128kコンテキスト、3090/4090で非常に高速。
ollama run glm-4.7-flash
Apple M4 Max(64 GB)上で
Q8
35 GB · 40 tok/s
4

🇺🇸 Granite 4.0 H-Small 32B-A9B

IBM · 32B パラメータ · Apache 2.0 · 128 000 トークン ctx

Mamba-2とMoEのハイブリッド。総パラメータ32B、アクティブパラメータ9B。長いコンテキストではRAM使用量が約70%少ない。Apache 2.0。

このランクの理由 Mamba-2とMoEのハイブリッド。総パラメータ32B、アクティブパラメータ9B。長いコンテキストではRAM使用量が約70%少ない。Apache 2.0。
ollama run granite4:small-h
Apple M4 Max(64 GB)上で
Q8
35 GB · 30 tok/s
5

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B パラメータ · Apache 2.0 · 131 072 トークン ctx

MoE、総パラメータ数 30B/アクティブパラメータ数 3B、ハイブリッド思考。MMLU 81.4、AIME24 80.4。100以上の言語に対応。

このランクの理由 MoE、総パラメータ数 30B/アクティブパラメータ数 3B、ハイブリッド思考。MMLU 81.4、AIME24 80.4。100以上の言語に対応。
ollama run qwen3:30b-a3b
Apple M4 Max(64 GB)上で
Q8
35 GB · 40 tok/s
6

🇺🇸 Laguna XS.2

Poolside · 33B パラメータ · Apache 2.0 · 131 072 トークン ctx

MoE 33B(アクティブパラメータ3B)。Apache 2.0ライセンスで、エージェント型コーディングに特化。SWE-Bench Verifiedで68.2%、128kのコンテキスト。メモリ36 GBのMacで動作。2026年4月28日リリース。

このランクの理由 MoE 33B(アクティブパラメータ3B)。Apache 2.0ライセンスで、エージェント型コーディングに特化。SWE-Bench Verifiedで68.2%、128kのコンテキスト。メモリ36 GBのMacで動作。2026年4月28日リリース。
ollama run laguna-xs.2
Apple M4 Max(64 GB)上で
Q8
35 GB · 40 tok/s
7

🇨🇳 Qwen 3.6 27B

Alibaba · 27B パラメータ · Apache 2.0 · 262 144 トークン ctx

デンス型27Bマルチモーダルモデル、2026年4月22日公開。262kコンテキスト(YaRNで1M)。SWE-bench Verified 77.2%。

このランクの理由 デンス型27Bマルチモーダルモデル、2026年4月22日公開。262kコンテキスト(YaRNで1M)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
Apple M4 Max(64 GB)上で
Q8
29 GB · 13 tok/s
8

🇨🇳 Qwen 3.8 27B

Alibaba · 27B パラメータ · Apache 2.0 · 262 144 トークン ctx

Qwen 3.8 27B:テキストと画像に対応するDenseマルチモーダルモデル、コンテキスト262k、Q4でVRAM約16 GB(Ollamaの重みは18 GB)。Apache 2.0、エージェント型コーディングと画像認識に対応。

このランクの理由 Qwen 3.8 27B:テキストと画像に対応するDenseマルチモーダルモデル、コンテキスト262k、Q4でVRAM約16 GB(Ollamaの重みは18 GB)。Apache 2.0、エージェント型コーディングと画像認識に対応。
ollama run qwen3.8:27b
Apple M4 Max(64 GB)上で
Q8
29 GB · 14 tok/s

比較表

順位 モデル Params VRAM Q4 コンテキスト ライセンス Apple M4 Max(64 GB)上で
#1 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q8
#2 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 60 tok/s · FP16
#3 GLM 4.7 Flash 31B 19 GB 128 000 MIT 40 tok/s · Q8
#4 Granite 4.0 H-Small 32B-A9B 32B 19 GB 128 000 Apache 2.0 30 tok/s · Q8
#5 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0 40 tok/s · Q8
#6 Laguna XS.2 33B 19 GB 131 072 Apache 2.0 40 tok/s · Q8
#7 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 13 tok/s · Q8
#8 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 14 tok/s · Q8
Macキット

あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

無料の要点まとめ

あなたのマシンでどのコーディング用モデルを動かせばよいですか?

メモを受け取る VRAM → 最適なコーディング用モデル → Ollamaコマンド (1画面に収まり、コピー&ペーストできます)。そして、実際に動く環境を整えるために、ローカルコパイロットキットをご利用ください。

ローカルコパイロットキット — そのまま貼り付けて使える Ollama + Cline + Aider の設定、調整済みの Modelfiles、トラブルシューティング、無期限で利用できるオンラインスペース →

スパムは送りません。配信停止は1クリックで可能です。お客様のデータは当サイトで保管し、転売することはありません。

ランキングの方法論

絞り込み条件:Q4_K_Mで80 GB未満に収まる3〜100Bのモデル(96 GB搭載のM4 MaxでmacOS用に16 GBを残します)。13〜70B(Max)と7〜32B(Pro)には加点。MoEモデルも高評価(Qwen 3 30B-A3BはM4で特に優れています)。

考慮した基準:

  • Q4_K_M ≤ 80 GB
  • 273〜546GB/s の帯域幅を活用
  • 長時間のセッションでも安定
  • MLX最適化対応

スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。

よくある質問

MBP M4 Pro 24GB:どのモデルが適しているのか

Qwen 3 14B Q4(約8 GB)は35〜45トークン/秒、Qwen 3 30B-A3B(MoE、約17 GB)は28〜32トークン/秒です。2026年のノートパソコンでは、M4 Pro 24 GBが最も優れた性能と価格のバランスを提供します。参照: MBP M4ガイド.

MBP M4 Max 64 / 128 GB:Llama 70B を実行できるのでしょうか?

はい。Llama 3.3 70B Q4_K_M(約40 GB)は、M4 Max 128 GBで12〜18 tok/sで動作します。Q5_K_M(約48 GB)は64 GBに収まります。200B以上については、次をご覧ください: Mac Studio Ultra.

MBP M4 と RTX 4090 の比較?

RTX 4090(VRAM 24 GB、1008 GB/s)は、24 GBに収まるモデルでは約2〜3倍高速です。24 GBを超えるとM4 Maxが優位になります(4090単体では70Bモデルは実行できません)。参照: RTX 4090.

M4 MaxではMLXとOllama、どちらを選ぶ?

MLXはM4 Maxで、トークン/秒で表す生成速度を20~30%向上させます(ネイティブなユニファイドメモリ、融合カーネル)。本番運用なら、変換する価値があります。たまにチャットする程度なら、Ollamaのほうが手軽です。

さらに詳しく

QuelLLM キット 用途別のリファレンスガイド
すべてのキットを生涯利用可能 — 49 €