中級 11 分MacBook Pro

MacBook Pro M2 Pro / Max(16~96GB)で使うLLMは? ?

端的な回答

MacBook Pro M2 Proは、16 GBで8-9Bのモデルを余裕で動作させ、32 GBで24から32Bのモデルを動作させます。M2 Max 64または96 GBは、この世代で70BのモデルをQ4(約40 GB)で動作させ、同時に20から30Bのモデルを2つ動作させられる唯一のバリアントです。速度は帯域幅に依存します。M2 Proは200 GB/s、M2 Maxは400 GB/sであり、同じモデルの場合、M2 Maxはほぼ2倍のトークン/秒を達成します。

2023 年 1 月に発売された MacBook Pro M2 Pro / Max は、今もローカル AI 向けとして特に高い能力を備えたノート PC の一つです。冷却ファンを備え、M2 Max では 400 GB/s のメモリ帯域幅と最大 96 GB のユニファイドメモリを利用できます。このページでは、各メモリ構成で何ができるか、公開された測定結果が何を示しているか、帯域幅を倍にしても速度が倍にならない理由、そして M4 Max に乗り換える価値があるのはどのような場合かを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·macOS 14+ でテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#2026年のMacBook Pro M2 Pro / Max:役立つ技術仕様

発表時、AppleはM2 Proについて、帯域幅200 GB/s、最大32 GBのユニファイドメモリを、M2 Maxについては、帯域幅400 GB/s、最大96 GBのユニファイドメモリ、最大38コアのGPUを公表していました。Appleは、この96 GBがノートパソコンのグラフィックスメモリの限界を押し広げるものだと説明していました。メモリはプロセッサにはんだ付けされているため、構成は購入時に選ぶ必要があり、後から変更できません。

MacBook Pro 14インチおよび16インチ(2023年モデル)のチップ
チップ帯域幅選択可能なメモリ容量GPU
M2 Pro200 GB/s16GBまたは32GB16または19コア
M2 Max400 GB/s32GB、64GB、または96GB30または38コア

MacBook Airと比べたときの2つ目の強みは、アクティブ冷却です。MacBook Proは、チップの速度を大きく落とすことなく、長時間の負荷に対応できます。Appleは一部のモデルで、ファンをより速く回せる「高電力モード」も提供しています。長時間の生成処理で試してみたい設定ですが、その分ファンの音が大きくなります。

#M2 ProとM2 Max:帯域幅によって実際に何が変わるのか

Macキット

あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

テキスト生成では、各トークンごとにモデルのアクティブな重みの全体を読み取ります。したがって、最大速度は帯域幅を重みのサイズで割った値になります。400 GB/s の M2 Max は、理論上、200 GB/s の M2 Pro の2倍の速度で動作できます。llama.cpp リポジトリで公開されている測定値は、これが部分的にのみ正しいことを示しています。

テキスト生成、Llama 7B、llama.cpp(ディスカッション#4167)
チップ(GPUコア数)帯域幅Q4_0Q8_0F16
M2 Pro (19)200 GB/s38,86 t/s23,01 t/s13,06 t/s
M2 Max (30)400 GB/s60,99 t/s39,97 t/s24,16 t/s
M2 Max (38)400 GB/s65,95 t/s41,83 t/s24,65 t/s

Q4_0の7Bモデルでは、M2 Maxの性能はM2 Proのわずか1.6〜1.7倍です。同じモデルをF16にすると、サイズは約13GBになり、性能差は約1.9倍に広がります。計算すると、その理由が分かります。小さなモデルは非常に短時間で読み出せるため、別の制約(計算処理、レイテンシー、オーバーヘッド)が再び支配的になりますが、大きなモデルではメモリへのアクセスが実際に飽和します。実用上の結論は直感に反します。モデルが大きいほど、M2 Maxはその価格に見合う価値を発揮します。7Bモデルなら、M2 Proで十分余裕があります。

→
使用するモデルのおおよその処理速度
メモリ帯域幅をカタログに記載されたQ4の重みサイズで割り、モデルのサイズに応じて、その値から15〜35%を差し引いてください。M2 Maxは、7BのQ4_0では理論上限の約63%、7BのF16では約83%に達します。Qwen3-Coder 30B-A3Bのような19 GBのモデルでは、すべての重みを読み込む場合、M2 Maxの理論上限はすでに21トークン/秒です。MoEモデルはアクティブなパラメータだけを読み直すため、実際の生成速度はこれよりはるかに高くなります。

#16GBから96GBまで:収まるモデルと、余裕の少ないモデル

Apple Silicon では、デフォルトで GPU がすべてのメモリにアクセスできません。llama.cpp リポジトリの議論によると、Metal はメモリ全体の 2/3 から 3/4 程度を割り当てます。16 GB の場合、モデルとコンテキストに約 10〜12 GB を確保してください。96 GB の場合、約 64〜72 GB になります。この上限は、専用ガイドに詳細が記載されているシステム設定で引き上げられますが、上限を超えるとマシンがフリーズする可能性があります。

メモリ容量別の Q4 モデルサイズ(QuelLLM カタログ、コンテキスト用メモリを除く)
モデルQ4 の重みM2 Pro 16 GBM2 Pro 32 GBM2 Max 64GBM2 Max 96 GB
Qwen 3.5 9B6 GB快適はいはいはい
Gemma 4 12B7 GBぎりぎりはいはいはい
Mistral Small 3.2 24B14 GBいいえはいはいはい
Qwen 3.5 27B16 GBいいえはい、コンテキスト長は中程度はいはい
Qwen3-Coder 30B-A3B (MoE)19 GBいいえはい、コンテキスト長は中程度はいはい
Qwen 3.6 35B-A3B (MoE)21 GBいいえぎりぎりはいはい
Llama 3.3 70B40 GBいいえいいえはい、短いコンテキストはい

Qwen3-Coder 30B-A3BやQwen 3.6 35B-A3BのようなMoEモデルのサイズはそれぞれ19 GBと21 GBですが、トークンごとに有効になるパラメータは約30億にとどまります。同じメモリ容量なら、27Bのデンスモデルよりも生成が大幅に速くなります。32 GB環境では最も費用対効果の高い選択肢です。96 GB環境では、M2 Maxの利点は、非常に大きなモデルを1つ読み込むことよりも、例えばチャット用とコード用の2つのモデルを同時にメモリに常駐させておけることにあります。

#公表されている処理速度:断言できることとできないこと

このマシンについては、当サイト独自の測定値はありません。1秒あたりのトークン数は、モデル、量子化、コンテキスト、そして llama.cpp または Ollama のバージョンによって変わります。引用している測定値は、ユーザーが Llama 7B で測定して公開したものだけで、速度のおおよその目安となります。より新しいモデルについては、上記の誤差範囲を踏まえつつ、帯域幅をモデルの重みのサイズで割って計算する方法が引き続き有効です。

プロンプト処理では事情が異なります。llama.cppの表によると、同じLlama 7BのF16で、プロンプト処理速度は19コアのM2 Proが384 t/s、38コアのM2 Maxが756 t/sです。GPUコア数が影響するのは、この段階であって、生成ではありません。したがって、RAGや長い文書の分析では、最初の単語が出るまでの待ち時間は、M2 MaxならM2 Proの約半分になります。

#MacでOllamaを正しくインストールし、使用する方法

OllamaにはmacOS Sonoma(14)以降が必要です。公式FAQによると、MacでOllamaをアプリとして実行する場合は、launchctlで環境変数を設定し、その後アプリを再起動する必要があります。ターミナルで環境変数をexportするだけでは不十分です。アプリにはその設定が反映されません。

大型モデルに役立つ設定
launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
# puis quitter et relancer l'application Ollama

OllamaのFAQによると、q8_0で量子化したK/Vキャッシュは、デフォルトのf16形式の約半分のメモリを使用します。この効果を得るには、Flash Attentionを有効にする必要があります。70Bモデルで長いコンテキストを使う場合、この設定によってキャッシュがメモリに収まるようになります。注意点として、キャッシュの量子化は一部のモデルで品質をわずかに低下させる可能性があります。その設定を使い続ける前に、実際の用途でテストしてください。

!
GPU のメモリ上限は、影響を十分に理解したうえでのみ引き上げてください
iogpu.wired_limit_mbパラメータを使うとGPUにより多くのメモリを割り当てられますが、設定は再起動後には保持されず、割り当てが過剰だとmacOSがフリーズする可能性があります。この設定はApple Siliconの調整ガイドで説明しており、引き続きそのガイドを参照してください。他の方法ではメモリに収まらないモデルに限って適用し、システム用に少なくとも8 GBを残してください。

#どのモデルがどの用途に適するか

汎用チャット
8〜12Bのモデル(Qwen 3.5 9B、Gemma 4 12B)はM2 Proで素早く応答します。より洗練されたフランス語の出力を求めるなら、メモリが32 GB以上あると27Bモデルが有力な選択肢になります。
コード
32 GB以上のメモリで動かすQwen3-Coder 30B-A3Bのようなコード用MoEモデル、またはDevstral Small 2(Q4で14 GB)のような24Bのコーディングエージェント用モデル。インラインの自動補完には、7Bモデルで十分です。
ドキュメントベースのRAG
速度重視なら Gemma 4 12B、推論品質重視なら 24B です。最初のトークンまでの待ち時間を延ばさないよう、コンテキスト長を制限してください。
長期間の分析、エージェント
64GB以上の場合:Qwen 3.6 35B-A3B をMoEで高速に、または品質を重視する場合は70Bモデルを使用できますが、最悪で約10t/s(400 ÷ 40)まで受け入れる必要があります。

推論モデルについて注意点が1つあります。回答の前に長い推論ブロックを生成するため、生成するトークン数が大幅に増えます。60 t/sのマシンでは、推論トークン1万個に約3分かかります。単純な質問では、モデルが許可している場合、推論モードを無効にしてください。

#バッテリー駆動時と長時間の負荷時:何が変わるか

MacBook ProはAirよりも長く性能を維持できるように設計されていますが、それでもノートパソコンです。処理速度に影響する設定は二つあります。電源モード(バッテリー駆動時にはmacOSが電力を制限する場合があります)と、対応モデルで利用できる高電力モードです。Appleによると、このモードではファンをより高速に回して、非常に負荷の高い処理でもより高い性能を維持できますが、その分騒音も増えます。生成が数分間続く場合は、電源を接続してこのモードを試してください。

#M4 Max に切り替える必要があるでしょうか?

Appleによると、M4 Maxは帯域幅546 GB/s、メモリ容量128 GBに達します。llama.cppの表では、Q4_0のLlama 7Bの速度は、38コアのM2 Maxで65.95 t/s、40コアのM4 Maxで83.06 t/sとなり、約26%向上しています。集中的に使う場合には確かな性能向上がありますが、メモリ96 GBのM2 Maxは、64 GBが上限のM4 Proに対して、容量面での優位性を保っています。

M2 Maxを使い続ける場合と買い替える場合
状況推奨
主に8〜14Bモデルを使用しています。M2 Pro 32GB で十分です。帯域幅を増やすために追加料金を払う必要はありません
毎日27〜35BのモデルをロードしていますM2 Max 64GBまたは96GB:この構成で真価を発揮
快適に70Bを動かしたい場合、または2つのモデルを常駐させたい場合M2 Max 96 GB、または速度が重要であればM4 Max 128 GB
ディスプレイなしのサーバーをお探しの場合Mac mini M4 ProまたはMac Studioがより適しています

#よくある質問

FAQ
16GBのMacBook Pro M2 Proは、ローカルAIの実行に十分ですか?+
はい。Q4で5〜6GBになる80億〜90億パラメータのモデルなら、コンテキストの長さを適度に抑えれば十分です。240億パラメータ以上のモデルには適していません。メモリは後から増設できないため、将来もっと大きなモデルに移行できるようにしたいなら、32GBを選んでください。
M2 Maxの30コアGPUと38コアGPUでは、何が違いますか?+
どちらもメモリ帯域幅は400GB/sです。llama.cppの測定では、テキスト生成はメモリ帯域幅に依存するため、38コア版でも約8%速いだけです(Q4_0で65.95対60.99 t/s)。差がより顕著なのはプロンプト処理で、38コア版のほうが明らかに速くなります。
M2 Max 64 GBで2つのLLMを並列実行できますか?+
はい。重みとコンテキストの合計が、MetalがGPUに割り当てるメモリ容量(約43〜48GB)以内に収まれば可能です。例えば、27Bのモデル(16GB)と12Bのモデル(7GB)は収まります。Ollamaはデフォルトでモデルをメモリに5分間保持し、再読み込みには数秒かかります。
MacBook Pro M2 Max でフランス語を扱うにはどのモデルが適していますか?+
フランスの研究開発組織Mistral AIによるMistral Small 3.2 24Bは、32GB以上のメモリで使う場合の有力な候補です(Q4で14GB)。Qwen 3.5 9BとGemma 4 12Bは多言語に対応しており、より高速です。ご自身のテキストで試してください。フランス語の品質はタスクの種類によって異なります。
M2 Maxは推論時にM1 Maxよりも熱くなりますか?+
引用できる信頼性の高い数値比較はありません。両者ともアクティブ冷却を備えており、速度は主にメモリ帯域幅に左右されます。その帯域幅はどちらも400 GB/sです。長時間の生成では、電源を接続し、ファンの騒音を受け入れたうえで、Appleが提供する高出力モードを試してください。
M2 MaxでOllamaと併せてMLXもインストールする必要がありますか?+
必ずしも必要ありません。チャット、RAG、APIにはOllamaで十分です。MLXは、Pythonからモデルを操作したり、ローカルでLoRAによるファインチューニングを試したりしたい開発者に向いています。速度差はモデルやバージョンによって異なります。当サイトの詳細な比較では、一定の速度向上を約束せずに、その違いを検討しています。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。