MacBook Pro M2 Pro / Max(16~96GB)で使うLLMは? ?
MacBook Pro M2 Proは、16 GBで8-9Bのモデルを余裕で動作させ、32 GBで24から32Bのモデルを動作させます。M2 Max 64または96 GBは、この世代で70BのモデルをQ4(約40 GB)で動作させ、同時に20から30Bのモデルを2つ動作させられる唯一のバリアントです。速度は帯域幅に依存します。M2 Proは200 GB/s、M2 Maxは400 GB/sであり、同じモデルの場合、M2 Maxはほぼ2倍のトークン/秒を達成します。
2023 年 1 月に発売された MacBook Pro M2 Pro / Max は、今もローカル AI 向けとして特に高い能力を備えたノート PC の一つです。冷却ファンを備え、M2 Max では 400 GB/s のメモリ帯域幅と最大 96 GB のユニファイドメモリを利用できます。このページでは、各メモリ構成で何ができるか、公開された測定結果が何を示しているか、帯域幅を倍にしても速度が倍にならない理由、そして M4 Max に乗り換える価値があるのはどのような場合かを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#2026年のMacBook Pro M2 Pro / Max:役立つ技術仕様
発表時、AppleはM2 Proについて、帯域幅200 GB/s、最大32 GBのユニファイドメモリを、M2 Maxについては、帯域幅400 GB/s、最大96 GBのユニファイドメモリ、最大38コアのGPUを公表していました。Appleは、この96 GBがノートパソコンのグラフィックスメモリの限界を押し広げるものだと説明していました。メモリはプロセッサにはんだ付けされているため、構成は購入時に選ぶ必要があり、後から変更できません。
| チップ | 帯域幅 | 選択可能なメモリ容量 | GPU |
|---|---|---|---|
| M2 Pro | 200 GB/s | 16GBまたは32GB | 16または19コア |
| M2 Max | 400 GB/s | 32GB、64GB、または96GB | 30または38コア |
MacBook Airと比べたときの2つ目の強みは、アクティブ冷却です。MacBook Proは、チップの速度を大きく落とすことなく、長時間の負荷に対応できます。Appleは一部のモデルで、ファンをより速く回せる「高電力モード」も提供しています。長時間の生成処理で試してみたい設定ですが、その分ファンの音が大きくなります。
#M2 ProとM2 Max:帯域幅によって実際に何が変わるのか
あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
テキスト生成では、各トークンごとにモデルのアクティブな重みの全体を読み取ります。したがって、最大速度は帯域幅を重みのサイズで割った値になります。400 GB/s の M2 Max は、理論上、200 GB/s の M2 Pro の2倍の速度で動作できます。llama.cpp リポジトリで公開されている測定値は、これが部分的にのみ正しいことを示しています。
| チップ(GPUコア数) | 帯域幅 | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2 Pro (19) | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
| M2 Max (30) | 400 GB/s | 60,99 t/s | 39,97 t/s | 24,16 t/s |
| M2 Max (38) | 400 GB/s | 65,95 t/s | 41,83 t/s | 24,65 t/s |
Q4_0の7Bモデルでは、M2 Maxの性能はM2 Proのわずか1.6〜1.7倍です。同じモデルをF16にすると、サイズは約13GBになり、性能差は約1.9倍に広がります。計算すると、その理由が分かります。小さなモデルは非常に短時間で読み出せるため、別の制約(計算処理、レイテンシー、オーバーヘッド)が再び支配的になりますが、大きなモデルではメモリへのアクセスが実際に飽和します。実用上の結論は直感に反します。モデルが大きいほど、M2 Maxはその価格に見合う価値を発揮します。7Bモデルなら、M2 Proで十分余裕があります。
#16GBから96GBまで:収まるモデルと、余裕の少ないモデル
Apple Silicon では、デフォルトで GPU がすべてのメモリにアクセスできません。llama.cpp リポジトリの議論によると、Metal はメモリ全体の 2/3 から 3/4 程度を割り当てます。16 GB の場合、モデルとコンテキストに約 10〜12 GB を確保してください。96 GB の場合、約 64〜72 GB になります。この上限は、専用ガイドに詳細が記載されているシステム設定で引き上げられますが、上限を超えるとマシンがフリーズする可能性があります。
| モデル | Q4 の重み | M2 Pro 16 GB | M2 Pro 32 GB | M2 Max 64GB | M2 Max 96 GB |
|---|---|---|---|---|---|
| Qwen 3.5 9B | 6 GB | 快適 | はい | はい | はい |
| Gemma 4 12B | 7 GB | ぎりぎり | はい | はい | はい |
| Mistral Small 3.2 24B | 14 GB | いいえ | はい | はい | はい |
| Qwen 3.5 27B | 16 GB | いいえ | はい、コンテキスト長は中程度 | はい | はい |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | いいえ | はい、コンテキスト長は中程度 | はい | はい |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | いいえ | ぎりぎり | はい | はい |
| Llama 3.3 70B | 40 GB | いいえ | いいえ | はい、短いコンテキスト | はい |
Qwen3-Coder 30B-A3BやQwen 3.6 35B-A3BのようなMoEモデルのサイズはそれぞれ19 GBと21 GBですが、トークンごとに有効になるパラメータは約30億にとどまります。同じメモリ容量なら、27Bのデンスモデルよりも生成が大幅に速くなります。32 GB環境では最も費用対効果の高い選択肢です。96 GB環境では、M2 Maxの利点は、非常に大きなモデルを1つ読み込むことよりも、例えばチャット用とコード用の2つのモデルを同時にメモリに常駐させておけることにあります。
#公表されている処理速度:断言できることとできないこと
このマシンについては、当サイト独自の測定値はありません。1秒あたりのトークン数は、モデル、量子化、コンテキスト、そして llama.cpp または Ollama のバージョンによって変わります。引用している測定値は、ユーザーが Llama 7B で測定して公開したものだけで、速度のおおよその目安となります。より新しいモデルについては、上記の誤差範囲を踏まえつつ、帯域幅をモデルの重みのサイズで割って計算する方法が引き続き有効です。
プロンプト処理では事情が異なります。llama.cppの表によると、同じLlama 7BのF16で、プロンプト処理速度は19コアのM2 Proが384 t/s、38コアのM2 Maxが756 t/sです。GPUコア数が影響するのは、この段階であって、生成ではありません。したがって、RAGや長い文書の分析では、最初の単語が出るまでの待ち時間は、M2 MaxならM2 Proの約半分になります。
#MacでOllamaを正しくインストールし、使用する方法
OllamaにはmacOS Sonoma(14)以降が必要です。公式FAQによると、MacでOllamaをアプリとして実行する場合は、launchctlで環境変数を設定し、その後アプリを再起動する必要があります。ターミナルで環境変数をexportするだけでは不十分です。アプリにはその設定が反映されません。
OllamaのFAQによると、q8_0で量子化したK/Vキャッシュは、デフォルトのf16形式の約半分のメモリを使用します。この効果を得るには、Flash Attentionを有効にする必要があります。70Bモデルで長いコンテキストを使う場合、この設定によってキャッシュがメモリに収まるようになります。注意点として、キャッシュの量子化は一部のモデルで品質をわずかに低下させる可能性があります。その設定を使い続ける前に、実際の用途でテストしてください。
#どのモデルがどの用途に適するか
- 汎用チャット
- 8〜12Bのモデル(Qwen 3.5 9B、Gemma 4 12B)はM2 Proで素早く応答します。より洗練されたフランス語の出力を求めるなら、メモリが32 GB以上あると27Bモデルが有力な選択肢になります。
- コード
- 32 GB以上のメモリで動かすQwen3-Coder 30B-A3Bのようなコード用MoEモデル、またはDevstral Small 2(Q4で14 GB)のような24Bのコーディングエージェント用モデル。インラインの自動補完には、7Bモデルで十分です。
- ドキュメントベースのRAG
- 速度重視なら Gemma 4 12B、推論品質重視なら 24B です。最初のトークンまでの待ち時間を延ばさないよう、コンテキスト長を制限してください。
- 長期間の分析、エージェント
- 64GB以上の場合:Qwen 3.6 35B-A3B をMoEで高速に、または品質を重視する場合は70Bモデルを使用できますが、最悪で約10t/s(400 ÷ 40)まで受け入れる必要があります。
推論モデルについて注意点が1つあります。回答の前に長い推論ブロックを生成するため、生成するトークン数が大幅に増えます。60 t/sのマシンでは、推論トークン1万個に約3分かかります。単純な質問では、モデルが許可している場合、推論モードを無効にしてください。
#バッテリー駆動時と長時間の負荷時:何が変わるか
MacBook ProはAirよりも長く性能を維持できるように設計されていますが、それでもノートパソコンです。処理速度に影響する設定は二つあります。電源モード(バッテリー駆動時にはmacOSが電力を制限する場合があります)と、対応モデルで利用できる高電力モードです。Appleによると、このモードではファンをより高速に回して、非常に負荷の高い処理でもより高い性能を維持できますが、その分騒音も増えます。生成が数分間続く場合は、電源を接続してこのモードを試してください。
#M4 Max に切り替える必要があるでしょうか?
Appleによると、M4 Maxは帯域幅546 GB/s、メモリ容量128 GBに達します。llama.cppの表では、Q4_0のLlama 7Bの速度は、38コアのM2 Maxで65.95 t/s、40コアのM4 Maxで83.06 t/sとなり、約26%向上しています。集中的に使う場合には確かな性能向上がありますが、メモリ96 GBのM2 Maxは、64 GBが上限のM4 Proに対して、容量面での優位性を保っています。
| 状況 | 推奨 |
|---|---|
| 主に8〜14Bモデルを使用しています。 | M2 Pro 32GB で十分です。帯域幅を増やすために追加料金を払う必要はありません |
| 毎日27〜35Bのモデルをロードしています | M2 Max 64GBまたは96GB:この構成で真価を発揮 |
| 快適に70Bを動かしたい場合、または2つのモデルを常駐させたい場合 | M2 Max 96 GB、または速度が重要であればM4 Max 128 GB |
| ディスプレイなしのサーバーをお探しの場合 | Mac mini M4 ProまたはMac Studioがより適しています |
- MacBook Pro M3
- MacBook Pro M4
- Mac Studio(64〜512 GB)
- マシン情報:MacBook Pro M4 Max
- 出典:Appleチップでのllama.cppによる測定
- 出典:Apple、MacBook Pro M2 ProおよびM2 Maxのリリース
- 出典:Ollama 公式 FAQ
#よくある質問
16GBのMacBook Pro M2 Proは、ローカルAIの実行に十分ですか?+
M2 Maxの30コアGPUと38コアGPUでは、何が違いますか?+
M2 Max 64 GBで2つのLLMを並列実行できますか?+
MacBook Pro M2 Max でフランス語を扱うにはどのモデルが適していますか?+
M2 Maxは推論時にM1 Maxよりも熱くなりますか?+
M2 MaxでOllamaと併せてMLXもインストールする必要がありますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。