Mac M4 Pro(24~48GB統合メモリ)向けに最適なLLM(2026年版)
Mac M4 Proで最適なLLMを選ぶには、まず利用可能なユニファイドメモリの容量が重要です。24 GBのM4 Proと48 GBのM4 Proでは、実行できるモデルの重みが異なります。Apple Siliconはユニファイドメモリを通じてRAMとVRAMを共有するため、一般向けグラフィックスカードが24 GBを上限とするのに対し、4ビット量子化した70Bモデルも利用できます。本ガイドでは、この構成で実際に動作するオープンウェイトモデルを比較し、利用可能な量子化方式、観測された速度、完全なセルフホスト運用で優先したいソフトウェアスタック(Ollama、llama.cpp、MLX)を詳しく説明します。
Mac M4 Pro向けのローカル推論におけるメモリ制約
M4 Pro のユニファイドメモリは、注文時に選ぶ構成に応じて 24 GB または 48 GB です。macOS はシステムとアプリケーション用に約 4〜8 GB を確保するため、おおよそ次の容量が残ります:
- Mac M4 Pro 24 GB : LLM用に利用可能なメモリは約16〜18GBです
- Mac M4 Pro 48 GB : LLMに利用できるメモリは約38〜42GB
Apple が発表したメモリ帯域は、M4 Proにおいて273 GB/sです。 Apple Siliconの公式仕様情報, トークン/秒の処理速度に大きな制約要因となるため、デコード時の推論は帯域幅によって制限されます。 wired memory limit は、次の方法で引き上げることができます: sudo sysctl iogpu.wired_limit_mb GPUメモリ全体に大きなモデルを完全に収容できるようにするための技術は、以下の通りに記載されています llama.cpp コミュニティ.
M4 Pro 48GBで動作するQ4量子化の70Bモデル
48GB構成なら、70BのQ4_K_Mモデルを利用できます。Llamaシリーズとその派生モデルでは、品質とメモリ使用量のバランスが最もよい構成です。有力な候補は次のとおりです:
- Llama 3.3 70B Instruct : Q4で約40GB、Llama 3.3 Communityライセンス、128kのコンテキスト。MMLUスコアは発表されています。 HuggingFace上のMeta は約86です(評価プロトコルに応じて確認が必要です)。M4 Pro 48 GBでllama.cpp Metalを使った場合、デコード時の推定速度は7〜10トークン/秒です。
- Qwen 2.5 72B Instruct :Q4で約42 GB、Qwenライセンス、コンテキスト131k。コードと構造化された推論に優れ、Alibabaのベンチマークによると、HumanEvalでLlama 3.3を上回ることが多いです。
- DeepSeek R1 Distill Llama 70B :Q4で約40 GB。Llama 3.3アーキテクチャ上でR1を蒸留したモデルで、コンテキスト長は128kです。chain-of-thoughtとAIME向けに最適化されており、このメモリ容量帯で推論性能と必要リソースの最もよいバランスを提供します。
- Llama 3.1 Nemotron 70B :Q4 で約40 GB。アライメントと応答品質を重視して NVIDIA がファインチューニングしたモデル。
48 GBではQ4_K_Mを選ぶのが無難です。Q5(約48〜50 GB)も動作しますが、メモリを使い切るため、スワップが発生して処理速度が大幅に低下するおそれがあります。これらのモデルの比較はこちら: Llama 3.3 70B vs Qwen 2.5 72B.
MoE モデル:32〜48 GBでの速度
Mixture-of-Expertsアーキテクチャは、各トークンごとに総パラメータの一部のみをアクティブ化します。これにより、総メモリ量は維持したまま計算負荷を大幅に削減できます。M4 Pro 48 GB向けの注目すべき候補は2つあります。
- Qwen3-Coder-Next 80B-A3B : パラメータ数は80Bですが、トークンごとに稼働するのは3Bのみです。Q4では約48 GBで、メモリ48 GBのM4 Proでは上限ぎりぎりです。余裕を確保するため、Q3_K_M(約36~38 GB)の使用を検討すること。コンテキストは262k、ライセンスはApache 2.0です。全パラメータに占める稼働パラメータの割合は、単純な演算性能よりもメモリ帯域幅が重要なApple Siliconに最適です。
- Hunyuan-A13B Instruct :80Bで、そのうち13Bが有効。Q4で約48 GB。Tencent Hunyuanライセンス(デプロイ前に商用利用の条件を確認すること)。コンテキスト262k。
これらのアーキテクチャでは、M4 Pro 48 GBでデコード時のスループットが20トークン/秒を超える場合があります(MLXコミュニティが公開したベンチマークに基づく推定)。そのため、70Bの密なモデルよりも、対話時の操作感がはるかにスムーズになります。
24 GB構成:低ビット数への積極的な量子化
24GBのM4 Proには、Q4の70Bモデルはどれも収まりません。セルフホストに徹する場合の選択肢は次の3つです:
- Llama 3.3 70B Q2_K (~26 GB) で SSD への部分オフロードを実施:可能ではあるが、遅延が生じ、品質の著しい低下が見られる。推奨しない。
- Q4量子化した30〜40Bのデンスモデル (上記カタログ外、詳細は /catalogue 32Bのオプションについては。
- コンパクトなMoE は、Q3のQwen3-Coder-Next(約36〜38 GB)などでも、24 GBでは収まりません。
このプロファイルに関しては、実用的なアドバイスとして、Q4で16GB未満のモデル(7B〜14Bファミリー)を目標にすることを推奨します。本記事が焦点にしている70B以上のモデルの範囲を逸脱します。詳細は比較表を参照してください Mac M4に最適なLLM エントリーレベル向けの構成に。
推奨技術スタック:Ollama、llama.cpp、MLX
3 つのランタイムが Apple Silicon のエコシステムを主導しています:
- Ollama : シンプルなパッケージ化、モデル管理、ローカルHTTP API。初心者向けに最適です。当社の Mac向けのOllamaガイド。M4 Pro上のOllamaでは、Metalバックエンドが自動的に使用されます。クラウドへの呼び出しは一切なく、バイナリと重みはローカルにあります。
- llama.cpp : 基盤となるエンジン、パラメータの細かな制御(
-ngl,--mlock、KVキャッシュのサイズ)。リポジトリ ggerganov/llama.cpp Metal最適化バイナリを公開しています。 - MLX : メモリ統合を目的としたネイティブなフレームワーク Apple。量子化は、
mlx-lmは、一部のモデルで汎用GGUFよりもAppleのハードウェアを効率的に活用できます。ドキュメント: github.com/ml-explore/mlx.
MacBook Pro M4でLLMを日常的に使うなら、Ollamaでニーズの90%を満たせます。最大限の性能を求める場合や研究用途では、MLXが有力な選択肢になります。
FAQ
Q:M4 Pro 48GBでどの量子化を選択すべきですか?
Q4_K_M は、48GBのメモリで70Bモデルを動かす際の標準です。品質とメモリ使用量のバランスは実証されており、Llama 3.3 または Qwen 2.5 72B では約40GBを使用します。Q5ではメモリを使い切ります。Q3_K_Mでは約10GBの余裕ができますが、コードや複雑な推論では品質の低下が感じられます。
Q:M4 Pro 48GBでDeepSeek V3またはR1 671Bを実行できますか?
いいえ。 DeepSeek V3 671B Q4で約400GBを必要とし、M4 Pro 48GBのメモリの8〜10倍に相当します。これらのモデルは、Mac Studio M4 Ultra 192〜512GBまたはマルチGPUを備えたサーバーに限定してご利用ください。
Q:M4 Pro 48GBでLlama 3.3 70B Q4を動かす場合、毎秒何トークン程度を期待できますか?
デコード速度は、コンテキストの長さとランタイムに応じて7~10トークン/秒と推定されます。プロンプト処理ははるかに高速です(50~100トークン/秒)。これらの数値は、お使いの実際の構成で確認する必要があります。
Q : MLX か llama.cpp か、どちらを優先すべきですか?
llama.cppは依然として成熟度が高く、汎用的なGGUFエコシステムに対応しています。MLXは一部のMoEモデルで優位に立ち、Apple環境とのネイティブな統合を提供します。選択する前に、対象モデルで両方を試すこと。
質問:Qwen3-Coder-Next 80B-A3Bは48 GBで実用的に動作しますか?
ぎりぎりです。Q4は約48 GBを占めるため、余裕はありません。長いコンテキストのKVキャッシュ用に空きを残せるQ3_K_M(推定約36〜38 GB)を優先する。総パラメータ数80Bに対してアクティブなパラメータ数が3Bという比率は、Apple Siliconでのスループットに非常に有利です。
結論
Mac M4 Pro での最適な LLM は、一貫して統合メモリの容量に依存します:Llama 3.3 70B Q4 または Qwen 2.5 72B Q4(48GB)でバランスの取れた密度を実現し、Qwen3-Coder-Next 80B-A3B Q3 は MoE の速度に適しており、DeepSeek R1 Distill 70B は論理的推論に最適です。24GBの場合にはより小型のモデルを検討してください。正確な RAM と使用シーンに応じて、以下のガイドを参照してください。 構成ツール または、モデル一覧を全体で確認してください カタログ.