初心者 12 分Mac mini

Mac mini M2 / M2 Pro (8~32 GB) で利用可能な LLM は? ?

端的な回答

Mac mini M2 または M2 Pro は、静かな家庭用 LLM サーバーとして使えます。16 GB のユニファイドメモリで Q4 の 8〜9B モデルを、32 GB(M2 Pro のみ)で 24〜32B モデルまたは 30〜35B の MoE を動かせます。快適さを左右するのはメモリ帯域幅で、M2 は 100 GB/s、M2 Pro は 200 GB/s です。同じモデルなら、M2 Pro はほぼ 2 倍の速度で生成します。8 GB 版は避けてください。

2023年1月に登場したMac mini M2は2024年末にM4に置き換えられましたが、今でも中古市場で多く出回っています。このページでは、各メモリ構成で実際に何ができるか、公表された測定結果で毎秒何トークンを生成できるか、ローカルネットワーク全体からアクセスできるOllamaサーバーとして設定する方法、そしてどのような場合に、より新しい機種を選ぶほうがよいかを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·macOS 14+ でテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#2026年のMac mini M2 / M2 Pro:仕様表が示す性能

Appleは2023年1月にMac mini M2を発表し、「最大24GBの統合メモリと100GB/sの帯域幅」とし、M2 Proは200GB/s(倍)で最大32GBのメモリを提供しました。Appleの技術仕様書では、シリーズおよびカスタム設定の構成が示されています。M2は8GBから始まり、16GBまたは24GBに設定可能です。M2 Proは16GBから始まり、32GBに設定可能です。したがって、32GBのM2や8GBのM2 Proは存在しません。メモリは組み込みであり、購入時に選択され、その後の変更はできません。

Mac mini M2
CPUは8コア、GPUは10コア、メモリ帯域幅は100 GB/s、ユニファイドメモリは8、16、24 GB。
Mac mini M2 Pro
10または12コアのCPU、16または19コアのGPU、200GB/s、16または32GB
冷却
ファンによるアクティブ冷却:Appleは、持続的な性能を発揮するよう設計された熱管理システムを備えているとしています。これは、一日中リクエストに応答するマシンにとって重要です。
消費電力
Apple の公式資料によると、待機時 7W、M2 は最大 50W、M2 Pro は最大 100W です。時折見られる 10W から 30W の値はユーザーによる測定値であり、上限値ではありません。
i
M2が今でもサーバー用途の有力な選択肢である理由
最大の利点は純粋な速度ではなく、待機時のノイズ、サイズ、消費電力のバランスです。Appleによると、アイドル時の消費電力は7 Wです。1日10分だけ反応して、残りの時間は待機しているマシンは、動作コストが非常に低いです。速度については、帯域幅を確認する必要があります。

#M2かM2 Proか:選択の決め手は帯域幅

Macキット

あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

テキスト生成では、トークンを生成するたびに、チップがモデルの有効な重みすべてをメモリから読み直す必要があります。そのため、速度の上限は帯域幅をモデルのサイズで割った値で決まります。帯域幅が100 GB/sのM2で5 GBのモデルを使う場合、理論上の上限は約20トークン/秒です。帯域幅が200 GB/sのM2 Proでは、この上限が2倍になります。一方、メモリ容量が決めるのは、何がメモリに収まるかだけです。16 GBのマシンでは、Q4の24Bモデル(約14 GB)を載せると、システム用のメモリが残りません。

LLMサーバー向けのM2とM2 Proの比較
基準Mac mini M2Mac mini M2 Pro
帯域幅100 GB/s200 GB/s
選択可能なメモリ容量8GB、16GB、または24GB16GBまたは32GB
より大きな使用に適した環境8〜9B は Q4 で 16GB、12〜14B は 24GB で利用可能ですメモリ32 GBなら、Q4で24B〜32B
マルチユーザー対応、RAG1〜2人のライトユーザー複数の短いリクエストなら問題ありません
最大消費電力(Apple)50 W100 W

24 GBのM2はハイブリッド構成です。14Bモデルを載せられる容量がありますが、メモリ帯域幅はM2のままです。そのため、M2 16 GBより大きなモデルを読み込めても、動作が速くなるわけではありません。長いコンテキストウィンドウや、2つのモデルをメモリに読み込んだ状態が必要なら、この構成を選んでください。それ以外なら、同じモデルで2倍速いM2 Pro 16 GBのほうが、対話的な用途には適していることが多いです。

#メモリ容量に合うモデルはどれか:うたい文句ではなく計算で判断

GPU にすべてのデータを読み込むことはできません。Apple シリコンでは、llama.cpp リポジトリ内の第三者間の議論によると、デフォルトでGPUが使用可能な統合メモリの割合が制限されています。16GBのマシンでは、モデルとコンテキストを含めたメモリは約10〜12GBと見なされ、残りはmacOSに割り当てられます。Q4での重みの目安は、8B ≈ 5GB、14B ≈ 9GB、32B ≈ 19〜20GBとされ、コンテキストキャッシュもその上に加わります。

メモリ容量ごとに収まるモデル(QuelLLMカタログのQ4での重みサイズ。コンテキスト用のメモリは含まない)
モデル (Q4)モデル容量M2 8 GBM2 16 GBM2 24GB / M2 Pro 16GBM2 Pro 32 GB
Qwen 3.5 4B2.3 GBはいはいはいはい
Granite 4.2 8B4.6 GBぎりぎりはいはいはい
Qwen 3.5 9B6 GBいいえはいはいはい
Gemma 4 12B7 GBいいえぎりぎりはいはい
Mistral Small 3.2 24B14 GBいいえいいえいいえ(24 GBでも余裕はほとんどありません)はい
Qwen 3.6 35B-A3B (MoE)21 GBいいえいいえいいえはい、ただし余裕はわずか

表の読み方:「ぎりぎり」は、モデルの重みは収まるものの、長いコンテキストとmacOSが残りのメモリを取り合う状態を意味します。8 GB構成は本格的な用途では避けるべきです。macOSとブラウザだけで、すでにメモリの半分を使います。MoE 35B-A3Bは特殊なケースです。容量は21 GBですが、トークンごとに有効になるパラメータは約30億にとどまるため、同規模の密なモデルより大幅に高速です。これがM2 Pro 32 GBを選ぶ最大の理由です。

#測定された処理速度:公開資料から言えること

当サイトでは独自の測定結果を持っておらず、掲載もしていません。最も参考になる公開情報は、llama.cpp リポジトリの「Performance of llama.cpp on Apple Silicon M-series」というディスカッションです。そこでは、ユーザーが各 Apple チップで Llama 7B モデルを使ったテキスト生成(tg128)の結果を公開しています。これらの数値は、当時の llama.cpp のバージョンと、現在のモデルよりも古いモデルによるものですが、おおよその規模感をつかむ参考になります。

テキスト生成、Llama 7B、llama.cpp(ディスカッション#4167)
チップ帯域幅Q4_0Q8_0F16
M2、10コアGPU100 GB/s21,91 t/s12,21 t/s6,72 t/s
M2 Pro、16コアGPU200 GB/s37,87 t/s22,70 t/s12,47 t/s
M2 Pro、19コアGPU200 GB/s38,86 t/s23,01 t/s13,06 t/s

この表は3つのことを確認しています。第一に、速度は重みのサイズに従います。Q4_0からQ8_0に移行すると、スループットは約1.8倍に減少します。第二に、M2 ProはM2より約1.7倍速く、帯域幅の2倍にはわずかに届きません。第三に、M2 Pro 19コアの追加GPUコアは生成にほとんど影響を与えません(38.86 t/s 対 37.87 t/s):プロンプトの処理には役立ちますが、生成には役立ちません。

→
自分でも計算し直してみる
100 GB/sのM2と3.8 GBのファイルの場合、理論上の上限は約26 t/sに近く、上記の測定値(21.91 t/s)はその約84%を占めています。Q4で約6 GBの9Bモデルの場合、同じ計算では、損失を考慮する前に、M2では約16 t/s、M2 Proでは約33 t/sの上限になります。これらは公開された測定値に基づく上限であり、保証されたスループットではありません。

#コンテキストとプロンプト処理:実際の遅延の原因

毎秒トークン数だけではすべてを語れません。体験に影響を与える数値は2つあります。プロンプトの処理時間(同じ測定値のpp512列:M2はF16で201 t/s、M2 Pro 19コアは384 t/s)と、コンテキストキャッシュの増加です。この世代のMacでは、20,000トークンの文書を入力すると、最初の単語が出るまで数十秒かかります。RAGや文書分析では、PDF全体を貼り付けるのではなく、短い抜粋を使用してください。

コンテキストキャッシュもメモリを使用します。コンテキストウィンドウが長いほど、モデルの重みに使えるメモリは少なくなります。16 GBの環境では、ウィンドウを8,000または16,000トークンに縮めることで、より大きなモデルを収める余裕ができます。コンテキストウィンドウのガイドではこの原則を詳しく説明し、KVキャッシュのガイドではキャッシュを量子化する方法を解説しています。

#Ollama を 24/7 サーバーとしてインストールする:動作する手順

OllamaにはmacOS Sonoma(14)以降が必要です。デフォルトでは127.0.0.1のポート11434で待ち受けるため、そのマシン自体からしかアクセスできません。他の端末からアクセスできるようにするには、待ち受けアドレスを変更する必要があります。Macの公式FAQによると、Ollamaをアプリとして実行する場合は、launchctlで環境変数を設定し、その後アプリを再起動する必要があります。

  1. 01
    Ollamaアプリをインストールする
    公式サイトからアプリをダウンロードするか、Homebrew を使用してください。macOS 向けのインストールガイドでは、両方の方法を詳しく説明しています。アプリと Homebrew のサービスを同時に使わないでください。同じポートを使おうとして競合するためです。
  2. 02
    待ち受けアドレスを設定する
    ターミナルでlaunchctl setenv OLLAMA_HOST 0.0.0.0:11434を実行し、その後Ollamaアプリを終了して再起動してください。
  3. 03
    スリープを防ぐ
    「システム設定」の「省エネルギー」で、ディスプレイがオフのときに自動的にスリープするのを防ぐオプションを有効にしてください。また、Macが人の操作なしで再起動する必要がある場合は、自動ログインを有効にしてください。
  4. 04
    固定アドレスを予約
    ルーターの設定でMac miniに固定IPアドレスを割り当てるか、ローカルネットワーク上でmac-mini.localという名前を使用してください。
  5. 05
    モデルを事前に読み込む
    ollama pullでモデルをダウンロードし、その後、別のコンピューターから以下のcurlコマンドでテストしてください。
設定とテスト
# Sur le Mac mini
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
# quitter puis relancer l'application Ollama
ollama pull qwen3:8b

# Depuis un autre poste du réseau local
curl http://mac-mini.local:11434/api/chat -d '{"model":"qwen3:8b","stream":false,"messages":[{"role":"user","content":"Bonjour"}]}'
!
APIの公開:セキュリティ上の判断
Ollamaには認証機能がありません。0.0.0.0で待ち受ける設定は、信頼できる家庭内ネットワークに適しています。外部からアクセスする場合も、ルーターでポート11434を転送する設定は絶対にしないでください。VPNまたは認証付きリバースプロキシを経由してください。デフォルトでは、最後のリクエストから5分間、モデルがメモリに残ります。その日最初の呼び出しが遅いと感じる場合は、OLLAMA_KEEP_ALIVEを設定してください。

#Mac miniが家中に提供するもの

Mac mini M2は本番環境のサーバーではありませんが、3つの用途に優れています。家庭用チャット、ツール用のOpenAI互換API、そして軽量な自動化です。Ollamaは同じポート上でOpenAI APIのサブセットをサポートしており、アドレスを変更するだけで多くの既存クライアントを接続できます。必要な機能(ツール、構造化出力)がカバーされているか確認してください。

Chat
Open WebUI または Ollama に適合するモバイルアプリ:設定で http://mac-mini.local:11434 を入力してください。
コード
Continue、Aider、Zedでは、プロバイダーとしてOllamaサーバーのURLを指定してください。
自動化
n8n、Home Assistant、またはiOSのショートカット:これらはOpenAIと互換性のあるHTTP APIを呼び出すことができます
ドキュメントのインデックス化
nomic-embed-textのような軽量な埋め込みモデルなら、16 GBのメモリでも8〜9Bのチャットモデルを動かす余裕が残ります。

知っておくべき制限事項として、Ollama はデフォルトでモデルごとに1リクエストずつ処理します(OLLAMA_NUM_PARALLEL は 1 です)。そのため、2人が同時に質問するとスループットを共有するか、順番を待つことになります。家庭での利用であれば十分ですが、3人または4人以上のアクティブなチームの場合は、より高性能なマシンまたは並列処理用に設計された推論サーバーの方が適しています。

#Mac mini M2またはそれ以降のマシン:いつ切り替えるか

ベースモデルのM4は120 GB/s(llama.cppの表の値)、M4 ProはAppleによると273 GB/sに向上しています。メモリ帯域幅が制約要因となるため、M2とベースモデルのM4の速度差は約20%で、M2 ProとM4 Proの差はさらに大きくなります。24~32Bのモデルを使いたい場合、中古のM2 Pro 32 GBも依然として有力な選択肢です。エージェント用途や長いコンテキストでのコーディングには、より多くのメモリを備えた比較的新しいチップのほうが快適に使えます。

M2を使い続ける場合と買い替える場合
状況推奨
8~9Bモデルで家族用チャット、限られた予算メモリ16 GBの中古M2モデルで十分
24〜32Bモデルまたは30〜35BのMoEモデルM2 Pro 32 GB、または32 GB以上を搭載した、より新しいMac
長文コンテキスト、エージェント、複数のユーザーMac mini M4 Proまたはそれ以上のモデル
64GB以上が必要ですMac Studio を選び、M2 mini は選ばない

#よくある質問

FAQ
Mac mini M2はLLMサーバーとして24時間稼働できますか?+
はい、電源を入れたまま使えるように設計されています。Appleはアイドル時の消費電力を7 Wと示しており、継続的な負荷に対応する冷却ファンも備えています。設定で行うべきことは、自動スリープを防ぐことです。高負荷の推論では消費電力が増えますが、Appleが示す最大値はM2で50 W、M2 Proで100 Wです。
ローカルAI用に中古のMac mini M2を選ぶなら、どのモデルがよいですか?+
24〜32Bのモデルや30〜35BのMoEを使いたいなら32 GBのM2 Pro、8〜9Bをできるだけ安く使いたいなら16 GBのM2を選びます。8 GBは避けてください。macOSだけですでに半分を消費します。メモリは基板にはんだ付けされているため、購入前に「このMacについて」で正確な構成を確認してください。
Mac mini M2のトークン/秒はどれくらいですか?+
llama.cppのリポジトリで公開されている測定値では、M2で21.9 t/s、M2 Proで37.9から38.9 t/sとなっています。これはLlama 7BのQ4_0の場合です。9BモデルのQ4では、これより低い値を想定してください。これらはユーザーによる測定値であり、目安としてお考えください。
iPhoneや他のデバイスからMac mini M2を使用できますか?+
はい。OLLAMA_HOSTを0.0.0.0:11434に設定すると、ローカルネットワーク上のOllamaまたはOpenAI互換のクライアントはすべて接続できます。サーバーアドレスを入力する形式のiOSアプリも含まれます。ただし、VPNも認証付きリバースプロキシも使わずにインターネットへ公開しないでください。OllamaのAPI自体には認証機能がないためです。
Mac mini M2はMacBook Air M2よりも速いですか?+
同じチップなら帯域幅も同じなので、最大生成速度は近くなります。Mac miniの利点は冷却ファンがあることです。負荷がかかっても動作周波数を下げずに処理を続けられますが、ファンのないMacBook Airは長い生成処理ではやがて速度が低下します。
Mac mini M2 Pro でモデルを微調整することは可能ですか?+
小規模なモデルなら、MLXを使ったLoRAファインチューニングが可能ですが、時間がかかります。データセットの規模に応じて数時間は見込んでください。macOSと共有する32GBのメモリでは、フルファインチューニングは現実的ではありません。最も合理的なのは、Mac miniを推論に使い、学習時だけGPUをレンタルする方法です。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。