中級 11 分MacBook Pro

MacBook Pro M4 Pro / Max(24〜128 GB)ではどのLLMを使える? ?

端的な回答

MacBook Pro M4 ProまたはMaxは、14Bから32Bのモデルを難なく動作させ、64 GBまたは128 GBのM4 Maxでは、Q4の70B(約40 GB)も動作します。帯域幅(チップによって273、410、または546 GB/s)は、70Bを約13〜14トークン/秒に制限し、24 GBから128 GBのメモリがモデルのサイズを決定します。

MacBook Pro M4は、チップとメモリを適切に選べば、大規模なローカルモデルに最も適したノートパソコンです。このページでは、どの構成がどのモデルサイズに適しているかを示し、理論上の最大速度を計算するとともに、NVIDIAのGPU、Mac Studio、Airと比較して、このマシンの位置づけを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·macOS 14+ でテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: MacBook Pro M5 Pro — 24 GB / 1 TB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#MacBook Pro M4 ProとM4 Max:構成と帯域幅

MacBook Pro M4では、チップによって2つの要素が決まります。生成速度の上限を決めるメモリ帯域幅と、モデルのサイズを決める最大メモリ容量です。Appleの仕様書によると、M4 Proは273GB/s、CPUが14コア・GPUが32コアのM4 Maxは410GB/s、CPUが16コア・GPUが40コアのM4 Maxは546GB/sです。メモリ容量はチップに応じて24GBから128GBまで異なります。これらの選択肢を同じように扱うことはできません。チップごとに、扱えるモデルの規模が異なります。

Appleの情報に基づくMacBook Pro M4 ProとM4 Maxの構成
チップ帯域幅選択可能なメモリ容量現実的に実行できるモデルの規模(Q4)
M4 Pro273 GB/s24GBまたは48GB14Bまでは余裕を持って実行可能、48 GBなら24~27Bも実行可能
M4 Max 14コアCPU、32コアGPU410 GB/s36 GB24〜27Bは快適に動作、32Bは短いコンテキストで動作
M4 Max 16コアCPU、40コアGPU546 GB/s48、64、または128GB32Bモデルは問題なく動作;70Bモデルは64GB以上で可能;100B超のMoEモデルは128GBで対応

Appleは、M4 Maxが最大128 GBのユニファイドメモリに対応し、これにより開発者が2000億近いパラメータを持つ言語モデルと対話できると説明しています。ただし、Appleはこの数字について量子化方式もコンテキスト長も明示していません。Q4の密なモデルを動かせるという保証として受け取らないでください。このサイトの目安では、70Bの密なモデルだけでも約40 GBを占めるためです。

このページでは14インチのMacBook Proについて説明しています。16インチモデルも同じチップを搭載しています。M4チップの後にはM5世代が登場しており、ここで説明している世代の新品は、いつでも入手できるとは限りません。その価格は中古市場によって決まります。本ページには価格を記載していません。/materiel-ia/macbook-pro-m4-maxのページでは、最新の価格の目安を紹介しています。

#Pro、14コアのMax、16コアのMax:選び方

Macキット

あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応
  1. 01
    まず、対象となるモデルのサイズを決定してください
    80億〜140億パラメータのモデルは、24 GBのM4 Proで実行できます。24B〜32Bモデルには36〜48 GBが必要です。70Bモデルには、短いコンテキストでも少なくとも64 GBが必要です。
  2. 02
    コンテキスト分のメモリと25~30%の余裕を加えてください
    KVキャッシュはコンテキストが長くなるほど大きくなり、macOSもメモリの一部を自身のために確保します。余裕を持って見積もるには、モデルの容量を約1.3倍にしてください。
  3. 03
    望む速度に応じて帯域幅を確認してください
    帯域幅をモデルのデータサイズで割ってください。それが理論上の最大速度です。その速度が用途に対して低すぎる場合は、メモリ容量を増やすよりも、上位のチップを選んでください。
  4. 04
    14コアと16コアのMaxチップのどちらにするか決めてください。
    16コア版の帯域幅は、410 GB/sに対して546 GB/sです。さらに重要なのは、48 GB、64 GB、128 GBのメモリ構成を選べることです。速度だけでなくメモリ容量も、同じくらいこの違いを正当化する理由になります。

この手順では、M4 Pro 48GBとM4 Max 14コア 36GBが比較できない理由を説明します。前者はメモリ容量が大きく、後者は帯域幅が優れています。モデルが小さく、応答が速いことが求められる場合、14コア版が有利です。一方、大きなモデルをロードする場合は、Pro 48GBが優れ、ただし応答が遅くなる可能性があります。

#メモリ帯域幅で決まる理論上の上限

生成される各トークンごとに、アクティブな重みが再読み込みされます。したがって、最大速度は、サイト内の目安(14Bは約9 GB、32Bは約19〜20 GB、70BはQ4で約40 GB)に基づき、帯域幅をギガバイト単位の重みで割った値になります。この表は、この数式を3つのチップに適用したものです。これらは計算上の上限であり、実測値ではありません。実際の速度は、エンジン、コンテキスト、熱負荷によって異なります。

生成速度の理論上限(重みはQ4):実測値ではなく計算値
デンスモデルモデル容量M4 Pro(273GB/s)M4 Max 14コア(410 GB/s)M4 Max 16コア(546 GB/s)
14B≈ 9 GB≈ 30 tok/s≈ 45 tok/s≈ 60 tok/s
32B約19〜20GB≈ 14 tok/s約21トークン/秒約 28 tok/s
70B約 40 GB実行不可(メモリ不足)実行不可(メモリ不足)≈13〜14 tok/s

エキスパート型モデル(MoE)はこの表の例外です。総パラメータ数30Bのうち3Bがアクティブなモデルは、メモリ上では約19 GBを占めますが、トークンごとに読み込む重みの量は数GBに過ぎないため、同じ重みの32Bのデンスモデルよりも、その上限は数倍高くなります。これは48 GB以上のMacBook Proにとって最良の選択肢です。実際のスループットは、/benchmarksまたはサードパーティが公開したベンチマークで確認できますが、チップ、量子化、エンジンを必ず確認してください。

!
測定条件が不明な生成速度には注意してください
メモリ帯域幅546GB/sのM4 Maxで、Q4の32B密モデルについて30トークン/秒を超える速度が報告されているなら、理論上限の28トークン/秒を超えています。その速度は通常の生成方式によるものではありません。どのモデルが動作しているか、どの量子化が使われているか、そしてドラフトモデルが生成を高速化していないかを必ず確認してください。

#MLX、Ollama、LM Studio:このマシンでどのエンジンを使うか

Ollama は主な機能をカバーしています:ワンクリックインストール、ローカルAPI、GPUの自動検出。MLXはAppleのフレームワークで、Macの共有メモリを活用し、CPUとGPU間のデータコピーを回避します。mlx-lmパッケージは、Apple シリコン上でテキスト生成やモデルのファインチューニングを可能にし、量子化モデルに対応しています。LM Studio はグラフィカルインターフェースとMLXモデルを提供しています。MLXとllama.cppの比較ガイドはパフォーマンスに関して明確な結論を提示しており、ここではその結論を繰り返す必要はありません。

  1. 01
    Ollama のインストール
    ollama.comからダウンロードするか、Homebrewでインストールしてください。自動起動については、macOS向けインストールガイドで説明しています。
  2. 02
    選択したモデルを起動
    ollama run t はモデルをダウンロードして実行します。その後、ollama ps でGPUを確認してください。
  3. 03
    KV キャッシュと Flash Attention を設定する
    Ollamaは、ハードウェアが対応している場合にFlash Attentionを自動的に有効にします。変数OLLAMA_KV_CACHE_TYPEでKVキャッシュの量子化を設定でき、デフォルトはf16です。この量子化により、長いコンテキストが占めるメモリを削減できます。
  4. 04
    必要に応じてGPUメモリの上限を引き上げる
    mlx-lmのリポジトリによると、RAMに収まるモデルは、システムのワイヤードメモリの上限を引き上げることで高速化できる場合が多いとされています。これは管理者権限で行うシステム設定です。macOS最適化ガイドの手順に従い、他で見つけた値をそのままコピーしないでください。
ターミナル
brew install --cask ollama
ollama run qwen3:32b
ollama ps

# Long contexte : cache KV quantifié
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

#長いコンテキスト:Proのメモリ容量が最も重要になる用途

長文脈は64GBおよび128GBの主な利点です。Ollamaはデフォルトで、メモリ24 GiB未満の場合は4,000トークン、24 GiBから48 GiBの間では32,000トークン、48 GiB以上では256,000トークンのコンテキストを設定します。そのドキュメントでは、Web検索、エージェント、およびコードツールには少なくとも64,000トークンを推奨しています。32Bモデルで64,000トークンのコンテキストを使用すると、重みの19〜20 GBに加えて、KVキャッシュのギガバイト単位のコストが発生します。48 GBでは、余裕がすぐに尽きてしまいます。64 GBまたは128 GBのマシンであれば、キャッシュを量子化せずにこのコンテキストを確保する余地があります。

#MacBook Pro M4とNVIDIA GPU、Mac Studio、MacBook Airの比較

有用な比較は、速度よりもメモリにあります。RTX 4090 は NVIDIA によると 24 GB の GDDR6X を搭載しています。240億から300億パラメータのモデルを超えると、モデルの一部をシステム RAM にオフロードする必要があり、速度が低下します。64 GB または 128 GB の MacBook Pro M4 Max は 70B のモデル全体をロードできます。モデルがそのメモリに収まり、速度が優先される場合、カードは依然として優位です。

MacBook Pro M4は他の選択肢とどのように位置づけられるか
状況最適なオプション理由
8〜14Bのモデル、持ち運びやすさ、静音性MacBook Air M4 16GBまたは24GB十分な性能で、より軽量
24〜32Bのモデル、複数のモデルを同時に開く場合MacBook Pro M4 Pro 48GBまたはMaxメモリとファンによる冷却
外出先で70Bモデルや非常に長いコンテキストを使う場合MacBook Pro M4 Max 64GBまたは128GB70Bモデル全体を読み込める唯一のノートPC
同じ負荷ですが、オフィス環境での使用Mac StudioまたはMac mini同じチップ、より大型の冷却機構、バッテリーなし
24 GBに収まるモデルで、速度を最大限に高めたい場合24 GB以上のメモリを搭載したNVIDIA GPUモデルがメモリに収まる場合は帯域幅がより高い

#M4かM5か:次世代で何が変わるのか

Appleはその後、MacBook Pro M5 ProとM5 Maxを発売しました。仕様では、M5 Proが307GB/s、32コアGPUのM5 Maxが460GB/s、40コアGPUのM5 Maxが614GB/sとされており、M4世代の273、410、546GB/sから向上しています。帯域幅は約12~13%向上しているため、理論上の速度の上限も同程度に向上します。購入を検討する際は、特にメモリ容量をそろえて比較することが重要です。中古のM4 Max 128GBなら、新品のM5 Pro 48GBよりも多くのモデルを実行できます。

Apple 公表の M4・M5 の Pro および Max チップの帯域幅
チップM4M5
Pro273 GB/s307 GB/s
Max、32コアGPU410 GB/s460 GB/s
Max、GPUコア数40546 GB/s614 GB/s

#知っておくべき限界

メモリの上限
最大128GBです。それ以上はMac Studioまたはその他のプラットフォームが必要です。
CUDA非対応
CUDAを必要とするライブラリは動作しません。MLXとllama.cppは推論には対応していますが、学習用のエコシステム全体をカバーしているわけではありません。
Fine-tuning
MLXでは、量子化されたモデルで低ランクおよびフルファインチューニングを行えます。数十億パラメータを超えるモデルでは、依然として処理に時間がかかり、発熱も伴います。大規模な作業はクラウドサービスで行ってください。
バッテリー
推論を続けるとバッテリーがすぐに減るため、長時間使う場合は電源に接続してください。

#よくある質問

FAQ
MacBook Pro M4 Maxは、LLMの処理においてRTX 4090より優れているのでしょうか?+
モデルのサイズに依存します。RTX 4090は24GBのメモリを持っています。それ以上になるとRAMに転送され、遅くなるためです。M4 Max 64GBまたは128GBでは70Bモデル全体をロードできますが、モデルが24GB以内に収まる場合、カードの性能に比べて遅くなります。対象モデルのサイズに応じて選択してください。
M4 Pro 48 GBまたはM4 Max 36 GB:どちらを選べばよいですか?+
M4 Pro 48GBは、Q4で32Bモデルまでを読み込み可能で、中程度のコンテキストをサポートします。M4 Max 14コアは410GB/sに対し273GB/sであり、約50%の処理速度が向上しますが、36GBのメモリはモデルサイズに制限をもたらします。24B〜32Bモデルの場合、メモリが最も重要です。48GBを採用してください。
M4 Maxのメモリは64 GBと128 GBのどちらを選ぶべきですか?+
Q4の70Bモデル(約40GB)を中程度のコンテキストで使うなら、64GBで十分です。非常に長いコンテキスト、パラメータ数が1,000億を超えるエキスパート型モデル、または複数のモデルを同時に読み込む場合には、128GBを選ぶ理由があります。用途が64GBに収まるなら、メモリを追加しても速度は向上しません。
MacBook Pro M4 Max で 70B モデルを動かすと、どの程度の生成速度が期待できますか?+
理論上の上限は546 GB/sを約40 GBで割った値で、1秒あたり13〜14トークンです。実際の速度はこれより低く、エンジンやコンテキストに依存します。メモリ帯域幅410 GB/s、メモリ容量36 GBのM4 Maxでは70Bモデルを読み込めません。読み込めるのは、メモリ帯域幅546 GB/sで、メモリ容量が64 GBまたは128 GBのバージョンだけです。
MacBook Pro M4上でモデルをファインチューニングすることは可能ですか?+
はい、MLXを使えば可能です。mlx-lmパッケージは、量子化されたモデルでの低ランクファインチューニングとフルファインチューニングに対応しています。実際には、小型モデルや試験用途に適しています。パラメータ数が数百億規模のモデルでは、クラウドサービスの方が依然として高速です。
MacBook Pro M4では、Ollama、LM Studio、MLXのどれを選ぶべきですか?+
シンプルさとローカルAPIにはOllama、グラフィカルインターフェースにはLM Studio、Apple形式とファインチューニングにはMLXを使用します。3つは併用可能ですが、2つの大規模モデルを同時にロードしないでください。メモリが最初の制約となります。MLXとllama.cppの比較ガイドでは速度を比較しています。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。