MacBook Pro M4 Pro / Max(24〜128 GB)ではどのLLMを使える? ?
MacBook Pro M4 ProまたはMaxは、14Bから32Bのモデルを難なく動作させ、64 GBまたは128 GBのM4 Maxでは、Q4の70B(約40 GB)も動作します。帯域幅(チップによって273、410、または546 GB/s)は、70Bを約13〜14トークン/秒に制限し、24 GBから128 GBのメモリがモデルのサイズを決定します。
MacBook Pro M4は、チップとメモリを適切に選べば、大規模なローカルモデルに最も適したノートパソコンです。このページでは、どの構成がどのモデルサイズに適しているかを示し、理論上の最大速度を計算するとともに、NVIDIAのGPU、Mac Studio、Airと比較して、このマシンの位置づけを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: MacBook Pro M5 Pro — 24 GB / 1 TB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#MacBook Pro M4 ProとM4 Max:構成と帯域幅
MacBook Pro M4では、チップによって2つの要素が決まります。生成速度の上限を決めるメモリ帯域幅と、モデルのサイズを決める最大メモリ容量です。Appleの仕様書によると、M4 Proは273GB/s、CPUが14コア・GPUが32コアのM4 Maxは410GB/s、CPUが16コア・GPUが40コアのM4 Maxは546GB/sです。メモリ容量はチップに応じて24GBから128GBまで異なります。これらの選択肢を同じように扱うことはできません。チップごとに、扱えるモデルの規模が異なります。
| チップ | 帯域幅 | 選択可能なメモリ容量 | 現実的に実行できるモデルの規模(Q4) |
|---|---|---|---|
| M4 Pro | 273 GB/s | 24GBまたは48GB | 14Bまでは余裕を持って実行可能、48 GBなら24~27Bも実行可能 |
| M4 Max 14コアCPU、32コアGPU | 410 GB/s | 36 GB | 24〜27Bは快適に動作、32Bは短いコンテキストで動作 |
| M4 Max 16コアCPU、40コアGPU | 546 GB/s | 48、64、または128GB | 32Bモデルは問題なく動作;70Bモデルは64GB以上で可能;100B超のMoEモデルは128GBで対応 |
Appleは、M4 Maxが最大128 GBのユニファイドメモリに対応し、これにより開発者が2000億近いパラメータを持つ言語モデルと対話できると説明しています。ただし、Appleはこの数字について量子化方式もコンテキスト長も明示していません。Q4の密なモデルを動かせるという保証として受け取らないでください。このサイトの目安では、70Bの密なモデルだけでも約40 GBを占めるためです。
このページでは14インチのMacBook Proについて説明しています。16インチモデルも同じチップを搭載しています。M4チップの後にはM5世代が登場しており、ここで説明している世代の新品は、いつでも入手できるとは限りません。その価格は中古市場によって決まります。本ページには価格を記載していません。/materiel-ia/macbook-pro-m4-maxのページでは、最新の価格の目安を紹介しています。
#Pro、14コアのMax、16コアのMax:選び方
あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
- 01まず、対象となるモデルのサイズを決定してください80億〜140億パラメータのモデルは、24 GBのM4 Proで実行できます。24B〜32Bモデルには36〜48 GBが必要です。70Bモデルには、短いコンテキストでも少なくとも64 GBが必要です。
- 02コンテキスト分のメモリと25~30%の余裕を加えてくださいKVキャッシュはコンテキストが長くなるほど大きくなり、macOSもメモリの一部を自身のために確保します。余裕を持って見積もるには、モデルの容量を約1.3倍にしてください。
- 03望む速度に応じて帯域幅を確認してください帯域幅をモデルのデータサイズで割ってください。それが理論上の最大速度です。その速度が用途に対して低すぎる場合は、メモリ容量を増やすよりも、上位のチップを選んでください。
- 0414コアと16コアのMaxチップのどちらにするか決めてください。16コア版の帯域幅は、410 GB/sに対して546 GB/sです。さらに重要なのは、48 GB、64 GB、128 GBのメモリ構成を選べることです。速度だけでなくメモリ容量も、同じくらいこの違いを正当化する理由になります。
この手順では、M4 Pro 48GBとM4 Max 14コア 36GBが比較できない理由を説明します。前者はメモリ容量が大きく、後者は帯域幅が優れています。モデルが小さく、応答が速いことが求められる場合、14コア版が有利です。一方、大きなモデルをロードする場合は、Pro 48GBが優れ、ただし応答が遅くなる可能性があります。
#メモリ帯域幅で決まる理論上の上限
生成される各トークンごとに、アクティブな重みが再読み込みされます。したがって、最大速度は、サイト内の目安(14Bは約9 GB、32Bは約19〜20 GB、70BはQ4で約40 GB)に基づき、帯域幅をギガバイト単位の重みで割った値になります。この表は、この数式を3つのチップに適用したものです。これらは計算上の上限であり、実測値ではありません。実際の速度は、エンジン、コンテキスト、熱負荷によって異なります。
| デンスモデル | モデル容量 | M4 Pro(273GB/s) | M4 Max 14コア(410 GB/s) | M4 Max 16コア(546 GB/s) |
|---|---|---|---|---|
| 14B | ≈ 9 GB | ≈ 30 tok/s | ≈ 45 tok/s | ≈ 60 tok/s |
| 32B | 約19〜20GB | ≈ 14 tok/s | 約21トークン/秒 | 約 28 tok/s |
| 70B | 約 40 GB | 実行不可(メモリ不足) | 実行不可(メモリ不足) | ≈13〜14 tok/s |
エキスパート型モデル(MoE)はこの表の例外です。総パラメータ数30Bのうち3Bがアクティブなモデルは、メモリ上では約19 GBを占めますが、トークンごとに読み込む重みの量は数GBに過ぎないため、同じ重みの32Bのデンスモデルよりも、その上限は数倍高くなります。これは48 GB以上のMacBook Proにとって最良の選択肢です。実際のスループットは、/benchmarksまたはサードパーティが公開したベンチマークで確認できますが、チップ、量子化、エンジンを必ず確認してください。
#MLX、Ollama、LM Studio:このマシンでどのエンジンを使うか
Ollama は主な機能をカバーしています:ワンクリックインストール、ローカルAPI、GPUの自動検出。MLXはAppleのフレームワークで、Macの共有メモリを活用し、CPUとGPU間のデータコピーを回避します。mlx-lmパッケージは、Apple シリコン上でテキスト生成やモデルのファインチューニングを可能にし、量子化モデルに対応しています。LM Studio はグラフィカルインターフェースとMLXモデルを提供しています。MLXとllama.cppの比較ガイドはパフォーマンスに関して明確な結論を提示しており、ここではその結論を繰り返す必要はありません。
- 01Ollama のインストールollama.comからダウンロードするか、Homebrewでインストールしてください。自動起動については、macOS向けインストールガイドで説明しています。
- 02選択したモデルを起動ollama run t はモデルをダウンロードして実行します。その後、ollama ps でGPUを確認してください。
- 03KV キャッシュと Flash Attention を設定するOllamaは、ハードウェアが対応している場合にFlash Attentionを自動的に有効にします。変数OLLAMA_KV_CACHE_TYPEでKVキャッシュの量子化を設定でき、デフォルトはf16です。この量子化により、長いコンテキストが占めるメモリを削減できます。
- 04必要に応じてGPUメモリの上限を引き上げるmlx-lmのリポジトリによると、RAMに収まるモデルは、システムのワイヤードメモリの上限を引き上げることで高速化できる場合が多いとされています。これは管理者権限で行うシステム設定です。macOS最適化ガイドの手順に従い、他で見つけた値をそのままコピーしないでください。
#長いコンテキスト:Proのメモリ容量が最も重要になる用途
長文脈は64GBおよび128GBの主な利点です。Ollamaはデフォルトで、メモリ24 GiB未満の場合は4,000トークン、24 GiBから48 GiBの間では32,000トークン、48 GiB以上では256,000トークンのコンテキストを設定します。そのドキュメントでは、Web検索、エージェント、およびコードツールには少なくとも64,000トークンを推奨しています。32Bモデルで64,000トークンのコンテキストを使用すると、重みの19〜20 GBに加えて、KVキャッシュのギガバイト単位のコストが発生します。48 GBでは、余裕がすぐに尽きてしまいます。64 GBまたは128 GBのマシンであれば、キャッシュを量子化せずにこのコンテキストを確保する余地があります。
#MacBook Pro M4とNVIDIA GPU、Mac Studio、MacBook Airの比較
有用な比較は、速度よりもメモリにあります。RTX 4090 は NVIDIA によると 24 GB の GDDR6X を搭載しています。240億から300億パラメータのモデルを超えると、モデルの一部をシステム RAM にオフロードする必要があり、速度が低下します。64 GB または 128 GB の MacBook Pro M4 Max は 70B のモデル全体をロードできます。モデルがそのメモリに収まり、速度が優先される場合、カードは依然として優位です。
| 状況 | 最適なオプション | 理由 |
|---|---|---|
| 8〜14Bのモデル、持ち運びやすさ、静音性 | MacBook Air M4 16GBまたは24GB | 十分な性能で、より軽量 |
| 24〜32Bのモデル、複数のモデルを同時に開く場合 | MacBook Pro M4 Pro 48GBまたはMax | メモリとファンによる冷却 |
| 外出先で70Bモデルや非常に長いコンテキストを使う場合 | MacBook Pro M4 Max 64GBまたは128GB | 70Bモデル全体を読み込める唯一のノートPC |
| 同じ負荷ですが、オフィス環境での使用 | Mac StudioまたはMac mini | 同じチップ、より大型の冷却機構、バッテリーなし |
| 24 GBに収まるモデルで、速度を最大限に高めたい場合 | 24 GB以上のメモリを搭載したNVIDIA GPU | モデルがメモリに収まる場合は帯域幅がより高い |
#M4かM5か:次世代で何が変わるのか
Appleはその後、MacBook Pro M5 ProとM5 Maxを発売しました。仕様では、M5 Proが307GB/s、32コアGPUのM5 Maxが460GB/s、40コアGPUのM5 Maxが614GB/sとされており、M4世代の273、410、546GB/sから向上しています。帯域幅は約12~13%向上しているため、理論上の速度の上限も同程度に向上します。購入を検討する際は、特にメモリ容量をそろえて比較することが重要です。中古のM4 Max 128GBなら、新品のM5 Pro 48GBよりも多くのモデルを実行できます。
| チップ | M4 | M5 |
|---|---|---|
| Pro | 273 GB/s | 307 GB/s |
| Max、32コアGPU | 410 GB/s | 460 GB/s |
| Max、GPUコア数40 | 546 GB/s | 614 GB/s |
#知っておくべき限界
- メモリの上限
- 最大128GBです。それ以上はMac Studioまたはその他のプラットフォームが必要です。
- CUDA非対応
- CUDAを必要とするライブラリは動作しません。MLXとllama.cppは推論には対応していますが、学習用のエコシステム全体をカバーしているわけではありません。
- Fine-tuning
- MLXでは、量子化されたモデルで低ランクおよびフルファインチューニングを行えます。数十億パラメータを超えるモデルでは、依然として処理に時間がかかり、発熱も伴います。大規模な作業はクラウドサービスで行ってください。
- バッテリー
- 推論を続けるとバッテリーがすぐに減るため、長時間使う場合は電源に接続してください。
- MacBook Air M4:32GB と 120GB/s
- Mac Studio:同じチップをデスクトップで
- Mac mini M4 および M4 Pro
- Apple Silicon 搭載 Mac を最適化する
- マシン情報:MacBook Pro M4 Max
- 出典:AppleのMacBook Pro M4 ProおよびM4 Maxの技術仕様
- 出典:AppleのMacBook Pro(M5 ProおよびM5 Max)の技術仕様
- 出典:Apple、M4 ProおよびM4 Maxチップの発表
- 出典:Ollama ドキュメント、コンテキスト
- ソース:mlx-lmリポジトリ
#よくある質問
MacBook Pro M4 Maxは、LLMの処理においてRTX 4090より優れているのでしょうか?+
M4 Pro 48 GBまたはM4 Max 36 GB:どちらを選べばよいですか?+
M4 Maxのメモリは64 GBと128 GBのどちらを選ぶべきですか?+
MacBook Pro M4 Max で 70B モデルを動かすと、どの程度の生成速度が期待できますか?+
MacBook Pro M4上でモデルをファインチューニングすることは可能ですか?+
MacBook Pro M4では、Ollama、LM Studio、MLXのどれを選ぶべきですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。