Mac M4 Pro(24~48GB統合メモリ)向けに最適なLLM(2026年版)

Mac M4 Proで最適なLLMを選ぶには、まず利用可能なユニファイドメモリの容量が重要です。24 GBのM4 Proと48 GBのM4 Proでは、実行できるモデルの重みが異なります。Apple Siliconはユニファイドメモリを通じてRAMとVRAMを共有するため、一般向けグラフィックスカードが24 GBを上限とするのに対し、4ビット量子化した70Bモデルも利用できます。本ガイドでは、この構成で実際に動作するオープンウェイトモデルを比較し、利用可能な量子化方式、観測された速度、完全なセルフホスト運用で優先したいソフトウェアスタック(Ollama、llama.cpp、MLX)を詳しく説明します。

Mac M4 Pro向けのローカル推論におけるメモリ制約

M4 Pro のユニファイドメモリは、注文時に選ぶ構成に応じて 24 GB または 48 GB です。macOS はシステムとアプリケーション用に約 4〜8 GB を確保するため、おおよそ次の容量が残ります:

Apple が発表したメモリ帯域は、M4 Proにおいて273 GB/sです。 Apple Siliconの公式仕様情報, トークン/秒の処理速度に大きな制約要因となるため、デコード時の推論は帯域幅によって制限されます。 wired memory limit は、次の方法で引き上げることができます: sudo sysctl iogpu.wired_limit_mb GPUメモリ全体に大きなモデルを完全に収容できるようにするための技術は、以下の通りに記載されています llama.cpp コミュニティ.

M4 Pro 48GBで動作するQ4量子化の70Bモデル

48GB構成なら、70BのQ4_K_Mモデルを利用できます。Llamaシリーズとその派生モデルでは、品質とメモリ使用量のバランスが最もよい構成です。有力な候補は次のとおりです:

48 GBではQ4_K_Mを選ぶのが無難です。Q5(約48〜50 GB)も動作しますが、メモリを使い切るため、スワップが発生して処理速度が大幅に低下するおそれがあります。これらのモデルの比較はこちら: Llama 3.3 70B vs Qwen 2.5 72B.

MoE モデル:32〜48 GBでの速度

Mixture-of-Expertsアーキテクチャは、各トークンごとに総パラメータの一部のみをアクティブ化します。これにより、総メモリ量は維持したまま計算負荷を大幅に削減できます。M4 Pro 48 GB向けの注目すべき候補は2つあります。

これらのアーキテクチャでは、M4 Pro 48 GBでデコード時のスループットが20トークン/秒を超える場合があります(MLXコミュニティが公開したベンチマークに基づく推定)。そのため、70Bの密なモデルよりも、対話時の操作感がはるかにスムーズになります。

24 GB構成:低ビット数への積極的な量子化

24GBのM4 Proには、Q4の70Bモデルはどれも収まりません。セルフホストに徹する場合の選択肢は次の3つです:

  1. Llama 3.3 70B Q2_K (~26 GB) で SSD への部分オフロードを実施:可能ではあるが、遅延が生じ、品質の著しい低下が見られる。推奨しない。
  2. Q4量子化した30〜40Bのデンスモデル (上記カタログ外、詳細は /catalogue 32Bのオプションについては。
  3. コンパクトなMoE は、Q3のQwen3-Coder-Next(約36〜38 GB)などでも、24 GBでは収まりません。

このプロファイルに関しては、実用的なアドバイスとして、Q4で16GB未満のモデル(7B〜14Bファミリー)を目標にすることを推奨します。本記事が焦点にしている70B以上のモデルの範囲を逸脱します。詳細は比較表を参照してください Mac M4に最適なLLM エントリーレベル向けの構成に。

推奨技術スタック:Ollama、llama.cpp、MLX

3 つのランタイムが Apple Silicon のエコシステムを主導しています:

MacBook Pro M4でLLMを日常的に使うなら、Ollamaでニーズの90%を満たせます。最大限の性能を求める場合や研究用途では、MLXが有力な選択肢になります。

FAQ

Q:M4 Pro 48GBでどの量子化を選択すべきですか?

Q4_K_M は、48GBのメモリで70Bモデルを動かす際の標準です。品質とメモリ使用量のバランスは実証されており、Llama 3.3 または Qwen 2.5 72B では約40GBを使用します。Q5ではメモリを使い切ります。Q3_K_Mでは約10GBの余裕ができますが、コードや複雑な推論では品質の低下が感じられます。

Q:M4 Pro 48GBでDeepSeek V3またはR1 671Bを実行できますか?

いいえ。 DeepSeek V3 671B Q4で約400GBを必要とし、M4 Pro 48GBのメモリの8〜10倍に相当します。これらのモデルは、Mac Studio M4 Ultra 192〜512GBまたはマルチGPUを備えたサーバーに限定してご利用ください。

Q:M4 Pro 48GBでLlama 3.3 70B Q4を動かす場合、毎秒何トークン程度を期待できますか?

デコード速度は、コンテキストの長さとランタイムに応じて7~10トークン/秒と推定されます。プロンプト処理ははるかに高速です(50~100トークン/秒)。これらの数値は、お使いの実際の構成で確認する必要があります。

Q : MLX か llama.cpp か、どちらを優先すべきですか?

llama.cppは依然として成熟度が高く、汎用的なGGUFエコシステムに対応しています。MLXは一部のMoEモデルで優位に立ち、Apple環境とのネイティブな統合を提供します。選択する前に、対象モデルで両方を試すこと。

質問:Qwen3-Coder-Next 80B-A3Bは48 GBで実用的に動作しますか?

ぎりぎりです。Q4は約48 GBを占めるため、余裕はありません。長いコンテキストのKVキャッシュ用に空きを残せるQ3_K_M(推定約36〜38 GB)を優先する。総パラメータ数80Bに対してアクティブなパラメータ数が3Bという比率は、Apple Siliconでのスループットに非常に有利です。

結論

Mac M4 Pro での最適な LLM は、一貫して統合メモリの容量に依存します:Llama 3.3 70B Q4 または Qwen 2.5 72B Q4(48GB)でバランスの取れた密度を実現し、Qwen3-Coder-Next 80B-A3B Q3 は MoE の速度に適しており、DeepSeek R1 Distill 70B は論理的推論に最適です。24GBの場合にはより小型のモデルを検討してください。正確な RAM と使用シーンに応じて、以下のガイドを参照してください。 構成ツール または、モデル一覧を全体で確認してください カタログ.

記事の公開および更新日 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.