Mac mini M2 / M2 Pro (8~32 GB) で利用可能な LLM は? ?
Mac mini M2 または M2 Pro は、静かな家庭用 LLM サーバーとして使えます。16 GB のユニファイドメモリで Q4 の 8〜9B モデルを、32 GB(M2 Pro のみ)で 24〜32B モデルまたは 30〜35B の MoE を動かせます。快適さを左右するのはメモリ帯域幅で、M2 は 100 GB/s、M2 Pro は 200 GB/s です。同じモデルなら、M2 Pro はほぼ 2 倍の速度で生成します。8 GB 版は避けてください。
2023年1月に登場したMac mini M2は2024年末にM4に置き換えられましたが、今でも中古市場で多く出回っています。このページでは、各メモリ構成で実際に何ができるか、公表された測定結果で毎秒何トークンを生成できるか、ローカルネットワーク全体からアクセスできるOllamaサーバーとして設定する方法、そしてどのような場合に、より新しい機種を選ぶほうがよいかを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#2026年のMac mini M2 / M2 Pro:仕様表が示す性能
Appleは2023年1月にMac mini M2を発表し、「最大24GBの統合メモリと100GB/sの帯域幅」とし、M2 Proは200GB/s(倍)で最大32GBのメモリを提供しました。Appleの技術仕様書では、シリーズおよびカスタム設定の構成が示されています。M2は8GBから始まり、16GBまたは24GBに設定可能です。M2 Proは16GBから始まり、32GBに設定可能です。したがって、32GBのM2や8GBのM2 Proは存在しません。メモリは組み込みであり、購入時に選択され、その後の変更はできません。
- Mac mini M2
- CPUは8コア、GPUは10コア、メモリ帯域幅は100 GB/s、ユニファイドメモリは8、16、24 GB。
- Mac mini M2 Pro
- 10または12コアのCPU、16または19コアのGPU、200GB/s、16または32GB
- 冷却
- ファンによるアクティブ冷却:Appleは、持続的な性能を発揮するよう設計された熱管理システムを備えているとしています。これは、一日中リクエストに応答するマシンにとって重要です。
- 消費電力
- Apple の公式資料によると、待機時 7W、M2 は最大 50W、M2 Pro は最大 100W です。時折見られる 10W から 30W の値はユーザーによる測定値であり、上限値ではありません。
#M2かM2 Proか:選択の決め手は帯域幅
あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
テキスト生成では、トークンを生成するたびに、チップがモデルの有効な重みすべてをメモリから読み直す必要があります。そのため、速度の上限は帯域幅をモデルのサイズで割った値で決まります。帯域幅が100 GB/sのM2で5 GBのモデルを使う場合、理論上の上限は約20トークン/秒です。帯域幅が200 GB/sのM2 Proでは、この上限が2倍になります。一方、メモリ容量が決めるのは、何がメモリに収まるかだけです。16 GBのマシンでは、Q4の24Bモデル(約14 GB)を載せると、システム用のメモリが残りません。
| 基準 | Mac mini M2 | Mac mini M2 Pro |
|---|---|---|
| 帯域幅 | 100 GB/s | 200 GB/s |
| 選択可能なメモリ容量 | 8GB、16GB、または24GB | 16GBまたは32GB |
| より大きな使用に適した環境 | 8〜9B は Q4 で 16GB、12〜14B は 24GB で利用可能です | メモリ32 GBなら、Q4で24B〜32B |
| マルチユーザー対応、RAG | 1〜2人のライトユーザー | 複数の短いリクエストなら問題ありません |
| 最大消費電力(Apple) | 50 W | 100 W |
24 GBのM2はハイブリッド構成です。14Bモデルを載せられる容量がありますが、メモリ帯域幅はM2のままです。そのため、M2 16 GBより大きなモデルを読み込めても、動作が速くなるわけではありません。長いコンテキストウィンドウや、2つのモデルをメモリに読み込んだ状態が必要なら、この構成を選んでください。それ以外なら、同じモデルで2倍速いM2 Pro 16 GBのほうが、対話的な用途には適していることが多いです。
#メモリ容量に合うモデルはどれか:うたい文句ではなく計算で判断
GPU にすべてのデータを読み込むことはできません。Apple シリコンでは、llama.cpp リポジトリ内の第三者間の議論によると、デフォルトでGPUが使用可能な統合メモリの割合が制限されています。16GBのマシンでは、モデルとコンテキストを含めたメモリは約10〜12GBと見なされ、残りはmacOSに割り当てられます。Q4での重みの目安は、8B ≈ 5GB、14B ≈ 9GB、32B ≈ 19〜20GBとされ、コンテキストキャッシュもその上に加わります。
| モデル (Q4) | モデル容量 | M2 8 GB | M2 16 GB | M2 24GB / M2 Pro 16GB | M2 Pro 32 GB |
|---|---|---|---|---|---|
| Qwen 3.5 4B | 2.3 GB | はい | はい | はい | はい |
| Granite 4.2 8B | 4.6 GB | ぎりぎり | はい | はい | はい |
| Qwen 3.5 9B | 6 GB | いいえ | はい | はい | はい |
| Gemma 4 12B | 7 GB | いいえ | ぎりぎり | はい | はい |
| Mistral Small 3.2 24B | 14 GB | いいえ | いいえ | いいえ(24 GBでも余裕はほとんどありません) | はい |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | いいえ | いいえ | いいえ | はい、ただし余裕はわずか |
表の読み方:「ぎりぎり」は、モデルの重みは収まるものの、長いコンテキストとmacOSが残りのメモリを取り合う状態を意味します。8 GB構成は本格的な用途では避けるべきです。macOSとブラウザだけで、すでにメモリの半分を使います。MoE 35B-A3Bは特殊なケースです。容量は21 GBですが、トークンごとに有効になるパラメータは約30億にとどまるため、同規模の密なモデルより大幅に高速です。これがM2 Pro 32 GBを選ぶ最大の理由です。
#測定された処理速度:公開資料から言えること
当サイトでは独自の測定結果を持っておらず、掲載もしていません。最も参考になる公開情報は、llama.cpp リポジトリの「Performance of llama.cpp on Apple Silicon M-series」というディスカッションです。そこでは、ユーザーが各 Apple チップで Llama 7B モデルを使ったテキスト生成(tg128)の結果を公開しています。これらの数値は、当時の llama.cpp のバージョンと、現在のモデルよりも古いモデルによるものですが、おおよその規模感をつかむ参考になります。
| チップ | 帯域幅 | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2、10コアGPU | 100 GB/s | 21,91 t/s | 12,21 t/s | 6,72 t/s |
| M2 Pro、16コアGPU | 200 GB/s | 37,87 t/s | 22,70 t/s | 12,47 t/s |
| M2 Pro、19コアGPU | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
この表は3つのことを確認しています。第一に、速度は重みのサイズに従います。Q4_0からQ8_0に移行すると、スループットは約1.8倍に減少します。第二に、M2 ProはM2より約1.7倍速く、帯域幅の2倍にはわずかに届きません。第三に、M2 Pro 19コアの追加GPUコアは生成にほとんど影響を与えません(38.86 t/s 対 37.87 t/s):プロンプトの処理には役立ちますが、生成には役立ちません。
#コンテキストとプロンプト処理:実際の遅延の原因
毎秒トークン数だけではすべてを語れません。体験に影響を与える数値は2つあります。プロンプトの処理時間(同じ測定値のpp512列:M2はF16で201 t/s、M2 Pro 19コアは384 t/s)と、コンテキストキャッシュの増加です。この世代のMacでは、20,000トークンの文書を入力すると、最初の単語が出るまで数十秒かかります。RAGや文書分析では、PDF全体を貼り付けるのではなく、短い抜粋を使用してください。
コンテキストキャッシュもメモリを使用します。コンテキストウィンドウが長いほど、モデルの重みに使えるメモリは少なくなります。16 GBの環境では、ウィンドウを8,000または16,000トークンに縮めることで、より大きなモデルを収める余裕ができます。コンテキストウィンドウのガイドではこの原則を詳しく説明し、KVキャッシュのガイドではキャッシュを量子化する方法を解説しています。
#Ollama を 24/7 サーバーとしてインストールする:動作する手順
OllamaにはmacOS Sonoma(14)以降が必要です。デフォルトでは127.0.0.1のポート11434で待ち受けるため、そのマシン自体からしかアクセスできません。他の端末からアクセスできるようにするには、待ち受けアドレスを変更する必要があります。Macの公式FAQによると、Ollamaをアプリとして実行する場合は、launchctlで環境変数を設定し、その後アプリを再起動する必要があります。
- 01Ollamaアプリをインストールする公式サイトからアプリをダウンロードするか、Homebrew を使用してください。macOS 向けのインストールガイドでは、両方の方法を詳しく説明しています。アプリと Homebrew のサービスを同時に使わないでください。同じポートを使おうとして競合するためです。
- 02待ち受けアドレスを設定するターミナルでlaunchctl setenv OLLAMA_HOST 0.0.0.0:11434を実行し、その後Ollamaアプリを終了して再起動してください。
- 03スリープを防ぐ「システム設定」の「省エネルギー」で、ディスプレイがオフのときに自動的にスリープするのを防ぐオプションを有効にしてください。また、Macが人の操作なしで再起動する必要がある場合は、自動ログインを有効にしてください。
- 04固定アドレスを予約ルーターの設定でMac miniに固定IPアドレスを割り当てるか、ローカルネットワーク上でmac-mini.localという名前を使用してください。
- 05モデルを事前に読み込むollama pullでモデルをダウンロードし、その後、別のコンピューターから以下のcurlコマンドでテストしてください。
#Mac miniが家中に提供するもの
Mac mini M2は本番環境のサーバーではありませんが、3つの用途に優れています。家庭用チャット、ツール用のOpenAI互換API、そして軽量な自動化です。Ollamaは同じポート上でOpenAI APIのサブセットをサポートしており、アドレスを変更するだけで多くの既存クライアントを接続できます。必要な機能(ツール、構造化出力)がカバーされているか確認してください。
- Chat
- Open WebUI または Ollama に適合するモバイルアプリ:設定で http://mac-mini.local:11434 を入力してください。
- コード
- Continue、Aider、Zedでは、プロバイダーとしてOllamaサーバーのURLを指定してください。
- 自動化
- n8n、Home Assistant、またはiOSのショートカット:これらはOpenAIと互換性のあるHTTP APIを呼び出すことができます
- ドキュメントのインデックス化
- nomic-embed-textのような軽量な埋め込みモデルなら、16 GBのメモリでも8〜9Bのチャットモデルを動かす余裕が残ります。
知っておくべき制限事項として、Ollama はデフォルトでモデルごとに1リクエストずつ処理します(OLLAMA_NUM_PARALLEL は 1 です)。そのため、2人が同時に質問するとスループットを共有するか、順番を待つことになります。家庭での利用であれば十分ですが、3人または4人以上のアクティブなチームの場合は、より高性能なマシンまたは並列処理用に設計された推論サーバーの方が適しています。
#Mac mini M2またはそれ以降のマシン:いつ切り替えるか
ベースモデルのM4は120 GB/s(llama.cppの表の値)、M4 ProはAppleによると273 GB/sに向上しています。メモリ帯域幅が制約要因となるため、M2とベースモデルのM4の速度差は約20%で、M2 ProとM4 Proの差はさらに大きくなります。24~32Bのモデルを使いたい場合、中古のM2 Pro 32 GBも依然として有力な選択肢です。エージェント用途や長いコンテキストでのコーディングには、より多くのメモリを備えた比較的新しいチップのほうが快適に使えます。
| 状況 | 推奨 |
|---|---|
| 8~9Bモデルで家族用チャット、限られた予算 | メモリ16 GBの中古M2モデルで十分 |
| 24〜32Bモデルまたは30〜35BのMoEモデル | M2 Pro 32 GB、または32 GB以上を搭載した、より新しいMac |
| 長文コンテキスト、エージェント、複数のユーザー | Mac mini M4 Proまたはそれ以上のモデル |
| 64GB以上が必要です | Mac Studio を選び、M2 mini は選ばない |
#よくある質問
Mac mini M2はLLMサーバーとして24時間稼働できますか?+
ローカルAI用に中古のMac mini M2を選ぶなら、どのモデルがよいですか?+
Mac mini M2のトークン/秒はどれくらいですか?+
iPhoneや他のデバイスからMac mini M2を使用できますか?+
Mac mini M2はMacBook Air M2よりも速いですか?+
Mac mini M2 Pro でモデルを微調整することは可能ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。