Mac M5でのローカルLLM:MLXが今やllama.cppを圧倒(数値 2026)
Mac M5では、MLXとllama.cppのどちらが優れているかという議論は決着しました。同じモデルと量子化設定で比較すると、Appleのフレームワークは現在、1秒あたりに生成するトークン数が30〜40%多くなっています。本ガイドでは、M5とM5 Maxにおける差を数値で示し、2026年6月に登場したOllamaの新しいMLXエンジンを説明するとともに、どこまで性能を引き出せるかを紹介します。Thunderbolt 5で2台のマシンを接続して120B以上のモデルを動かす方法も含みます。MacBook Pro M4 Maxガイドを補完するM5向けのガイドで、基本原則は同じですが、数値を更新しています。
マシンを選んでいるところですか? 予算別のおすすめ →
このセットアップの場合: Mac mini M5 Pro (24 GB / 512 GB).
なぜこの選択か? 完全な解説はこちら: Mac mini M5 Pro (24 GB / 512 GB) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#M5がMacのローカルLLMに大きな変化をもたらす理由
M5 チップは、推論にとって本当に重要な二つの要素をもたらします。各コアに行列乗算ユニット(Neural Accelerators)を内蔵した GPU コアと、向上したメモリ帯域幅です。LLM の推論は、何よりもメモリ帯域幅に左右されます。トークンを一つ生成するたびに、モデルの重み全体を再読み込みするためです。ユニファイドメモリが速いほど、トークンの出力も速くなります。
まさにここで、Apple の MLX フレームワークが llama.cpp に対して優位に立ちます。MLX は M5 GPU の新しい行列演算ユニットを直接活用するように実装されていますが、llama.cpp の Metal 経由の処理は、より汎用的な実装にとどまっています。その結果、同じマシン、同じモデル、同じ量子化設定でも、MLX は 1 秒あたりに生成するトークン数が明らかに多くなります。M3 ではわずかだった差が、M5 では明確になります。
#M5およびM5 Maxのベンチマーク:2026年の数字
あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
以下は、一般的な4ビット量子化モデルを使い、MLXで生成(decode)速度を測定したおおよその値です。ローカル推論では常にそうであるように、これらの速度はコンテキストの長さ、モデルの正確なバージョン、マシンの温度によって変わります。目安として扱い、トークン単位まで正確な速度が保証されるとは考えないでください。
- M5 (GPU 10コア) — 8B Q4
- ~55〜70トークン/秒の生成速度。8Bのモデル(Qwen 3.5、Granite 4.2、Gemma 4)は、ベースチップ上で非常に快適に動作します。
- M5 Max — 8B Q4
- ~230トークン/秒。Maxの高いメモリ帯域が小型モデルにおいて差を生み出し、GPUがボトルネックになることはありません。
- M5 Max — 32B Q4
- 約55〜65トークン/秒。32Bモデル(Qwen 3.8 27B、Devstral)は、出力を快適に読める速度で動作し、対話形式で十分に実用的です。
- M5 Max — 70B Q4
- 約28トークン/秒。70BモデルのQ4版は、統合メモリが48〜64GB以上の場合にメモリ内に収まり、チャットやコード生成においてもスムーズに動作します。
注目すべき点は、専用グラフィックカードのないマシンで70Bモデルが約28 tokens/sで動作し、静音でバッグに収まる点です。比較として、PCで同等の性能を発揮するには、RTX 4090 24 GB(70B Q4は約40 GBであり、24 GBのVRAMに収まらないためCPUへの部分的なオフロードが必要)が必要で、ノイズと消費電力もはるかに大きくなります。
#MLX vs llama.cpp:どこで差が広がるのか
MLXが30~40%優位という性能差は一様ではなく、負荷の特性によって変わります。どのような場合にその差が広がるかを理解すると、MLXへの切り替えが本当に有益かどうかを判断しやすくなります。
- 生成(デコード)
- M5上でMLXの優位性が最もはっきり表れるのが、この部分です。GPUの行列演算ユニットを直接利用できるためです。対話形式のチャットでは、この差を体感できます。
- プロンプトの処理(prefill)
- MLXは優位性を保っていますが、差はやや縮まっています。非常に長いコンテキストでは、どちらのエンジンもメモリが制約になります。
- モデルのサポート
- llama.cppはGGUF形式を使うため、対応するモデルの幅が引き続き広い一方、MLXにはMLX形式に変換したバージョンが必要です。人気のモデルには、ほぼ必ず変換済みのバージョンがあります(Hugging Faceのmlx-communityハブ)。
- Python統合
- MLXはPythonでネイティブに使えるため、プロトタイピング、軽量なファインチューニング、自作パイプラインには自然な選択肢です。llama.cppをPythonから使うには、バインディングを介します。
#モデルごとの前提条件と推奨RAM容量
インストール前に、統合メモリの容量に合わせてモデルのサイズを選んでください。以下に、M5とM5 MaxでQ4を使う場合の現実的な目安を示します。
- 16GB (M5)
- 3B〜8BのQ4モデルは快適に動作します。14Bモデルも動作しますが、大きなコンテキストを扱うための余裕はあまりありません。
- 24-32 GB (M5 / M5 Pro)
- 14Bモデルは余裕を持って動かせ、メモリ容量がこの範囲の上限に近ければ32BのQ4モデルも実用になります。日常の幅広い用途にちょうどよいバランスです。
- 48 GB (M5 Max)
- 32B Q4は非常に余裕を持って動かせますが、70B Q4はぎりぎりです。70Bでコンテキスト分の余裕も確保するなら、64GBを目安にするのがよいでしょう。
- 64〜128 GB (M5 Max)
- 長いコンテキストでも快適に動作する 70B Q4 モデル、または複数モデルの同時読み込み。パワーユーザー向けの領域です。
ソフトウェア面では、最新のmacOSと、MLXを利用するための次の2つの方法のいずれかが必要です。LM Studio(モデルのMLX版があれば自動的にMLXへ切り替わります)、または2026年6月のアップデート以降のOllamaです。このアップデートについては、すぐ後で詳しく説明します。
#OllamaのMLXエンジン(2026年6月)
歴史的に、Ollamaは自社開発エンジンとllama.cppに依存しており、MacではMetalのパスを使用していました。2026年6月のアップデート以降、OllamaはMLXバージョンが利用可能な場合、Apple Silicon上でMLX経由でモデルを実行できるようになりました。これにより、ローカルAIで最も広く使用されているツールが、LM StudioがMLX経由で既に提供していた性能とようやく整合するようになりました。
具体的には、使い慣れた方法を変えずにMLXの性能向上を得られるということです。Ollamaのデーモンは同じで、デフォルトのポートは11434のまま、コマンドもOpenAI互換APIも同じです。エンジンは適切な場合にMLXを選び、それ以外の場合は従来の処理方式に戻ります。
#MLXでモデルをインストールして実行
ターミナルの操作にどれくらい慣れているかに応じて、2つの方法があります。設定なしでMLXを試す最も手軽な方法はLM Studioです。一方、ソフトウェアスタックに最も組み込みやすいのはOllamaです。
- 011. ツールの更新最新版のOllama(2026年6月以降のバージョン)またはLM Studioをインストールしてください。MLXによる実行経路を利用するには、これが前提条件です。
- 022. MLXバージョンのモデルを選択LM Studioでは、Apple Silicon上の検索でMLX版が優先的に表示されます。Ollamaでは、一般的なモデルをダウンロードしてください。変換済みのバージョンが存在すれば、推論エンジンがMLXに切り替わります。
- 033. 起動して生成速度を確認する長い質問をして、表示されるtokens/sを確認してください。必要に応じて同じモデルのGGUF版と比較し、ご自身のマシンでの実際の差を測定してください。
- 044. 必要に応じて量子化を調整するモデルがユニファイドメモリを使い切ってしまう場合は、ツールを変えるよりも量子化を一段階下げてください(Q5 → Q4_K_M)。制約になっているのはメモリであり、実行エンジンではありません。
Pythonでは、MLXをそのままスクリプトで利用できるため、ベンチマークの実施や自作パイプラインへの推論処理の組み込みに役立ちます:
#120B+モデル向け Thunderbolt 5 クラスタ
Macが1台だけでは、メモリを豊富に搭載したM5 Maxであっても、ユニファイドメモリの容量が上限になります。この上限を超えて120B以上のモデルや大規模なMoEを動かすための2026年のアプローチは、複数のApple Silicon搭載マシンをThunderbolt 5で接続し、モデルをそれらに分散させることです。Thunderbolt 5はThunderbolt 4よりも大幅に高い帯域幅を提供するため、推論時のノード間の活性値の交換がようやく現実的になります。
仕組みは次のとおりです。モデルを複数の層からなる区間に分割し、各マシンが重みの一部をメモリに保持します。トークンごとに、活性化値があるノードから次のノードへと渡されます。こうして複数のMacのユニファイドメモリ容量を合算し、どのMacにも単独では収まらないモデルを読み込みます。
- これによって実現できるもの
- 例えば、2つのM5 Max 128 GBを組み合わせることで、アドレス可能なメモリを256 GBに近づけ、Q4の120B以上のモデル、あるいは非常に大きなMoEモデルを扱います。
- 妥協点
- ノード間の遅延によって、毎秒生成できるトークン数が減ります。クラスターは、同じモデルを収容できる単一のマシンよりも遅くなります。クラスターを使うのは、1台では足りないからであり、速度を上げるためではありません。
- ケーブルの接続
- Thunderbolt 5が鍵です。その帯域幅により、アクティベーションの転送を許容できる水準に抑えられます。Thunderbolt 4やEthernetでは、機器間の接続が再びボトルネックになります。
#ヒントとトラブルシューティング
- 「MLXにしても速くならない」
- まず、実際にMLX経由で実行しているか確認してください(ツールが最新バージョンで、モデルのMLX版が実際に読み込まれていること)。Metal経由で読み込んだGGUFは、MLXの恩恵を受けません。
- 数分後に生成速度が急激に低下する
- これは熱制御による制限です。特にMacBook Air(ファンなし)では顕著です。長時間の負荷下では、MacBook ProまたはMac mini/Studioはより安定した処理速度を維持できます。
- モデルを読み込めない
- ユニファイドメモリが逼迫しています。モデルサイズを下げたり、量子化レベルを一段階下げたりしてください。RAMを多く消費するアプリケーションを閉じてください。
- 長いコンテキストで遅延が発生します
- 非常に長いプロンプトのprefillは、大量のメモリを消費します。長いコンテキストが不要ならコンテキストウィンドウを小さくするか、最初のトークンが出るまでの待ち時間が長くなることを受け入れてください。
#さらに詳しく
これらのガイドは、詳しい比較から具体的な導入まで、今読んだ内容を自然に掘り下げるものです:
- MLXとllama.cppの詳細比較
- 「Mac MシリーズでMLXとllama.cppを比較:2026年に勝つのはどちら?」では、M5の数値だけにとどまらず、対応モデル、量子化、Pythonとの統合といった本質的な比較を掘り下げています。
- macOS に Ollama をインストール
- 「macOS(Apple Silicon)にOllamaをインストールする」では、インストール手順を段階的に説明し、ユニファイドメモリの活用方法も扱っています。MLXの利用を目指す前に欠かせない基礎です。
- 量子化の選び方
- 「量子化を選ぶ(Q4、Q5、Q8、FP16)」では、品質とメモリ使用量のトレードオフを説明しています。モデルをお使いのユニファイドメモリに収めるための、最も重要な調整手段です。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。