iMac M4(16 / 24 / 32 GB)で使えるLLMは? ?
iMac M4は、80億〜140億パラメータのモデルをQ4で快適に動かせます。M4チップのメモリ帯域幅は120 GB/sで、公開されている測定では、10コアGPUでQ4_0の7Bモデルを動かした際に24トークン/秒を記録しています。ユニファイドメモリの容量(16、24、32 GB)が、動かせるモデルの最大サイズを決めます。16 GBなら14B、24 GBなら速度は遅いものの24B、32 GBならさらに遅い30Bまで動かせます。
iMacは何よりもまず画面が主役の製品です。ただし、ローカルAIで重要なのはM4チップとユニファイドメモリの容量で、購入後に変更することはできません。このガイドでは、各構成で何を実行できるか、公開測定値に基づく実行速度、そしてMac miniのほうが買い物として優れているケースを、数値を交えて解説します。
マシンを選んでいるところですか? 予算別のおすすめ →
このセットアップの場合: iMac M4 — 16 GB / 256 GB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#iMac M4でローカルAIに何ができるか
iMac M4は、80億〜140億パラメータのモデルを快適に実行でき、より大きなモデルも速度を落とせば実行できます。要点は3つの数値に集約されます。Appleの仕様表によると、M4チップのメモリ帯域幅は120 GB/sで、Q4_0の7Bモデルでは理論上の上限が約31トークン/秒となります。llama.cppリポジトリに公開されている10コアGPU搭載M4の測定値では、生成速度は24.11トークン/秒で、この上限の77%に相当します。また、ユニファイドメモリは16〜32 GBで、購入時に選択します。実行可能なモデルのサイズは、このメモリ容量だけで決まります。このiMacに足りないのは容量ではなく、帯域幅です。
- チップ
- Apple M4。Appleの仕様表には、iMac向けのPro版やMax版はありません。
- 帯域幅
- 構成にかかわらず120GB/s。
- ユニファイドメモリ
- 標準は16GB。すべてのモデルで24GBを、4ポートモデルでは32GBをオプションで選択できます。
- 画面
- 24インチの4.5K(4480 × 2520)。そのため、より高性能なGPUを選ぶメリットはほとんどありません。制約となるのはメモリです。
- 価格
- Appleが価格を変更するため、ここには記載していません。当サイトのハードウェアページをご覧ください。
#実際の構成:2つのモデル、3つではありません
あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
Appleのページでは、2種類のモデルが区別されています。2ポートモデルは8コアCPUと8コアGPUを搭載し、メモリは16 GBで、24 GBまで増やせます。4ポートモデルは10コアCPUと10コアGPUを搭載し、メモリは16 GBで、24 GBまたは32 GBまで増やせます。帯域幅はどちらも120 GB/sです。このページの旧版にもあったよくある誤りは、8 GB構成が今も存在すると思い込むことです。標準のメモリ容量は16 GBです。したがって、LLM用途で32 GBが必要なら、4ポートモデルを選ぶことが重要です。
| バージョン | GPU | ユニファイドメモリ | 帯域幅 |
|---|---|---|---|
| 2ポート | 8コア | 16GB、オプション24GB | 120 GB/s |
| 4ポート | 10コア | 16 GB、オプションで24 GBまたは32 GB | 120 GB/s |
テキスト生成では、GPUが8コアか10コアかによる差はおそらく小さいでしょう。速度はメモリ帯域幅に依存し、帯域幅はどちらも同じだからです。参照表には8コア版の公開測定値がないため、この主張は仮説にとどまります。迷った場合は、コア数よりもメモリ容量に予算をかけてください。
#16 GB、24 GB、32 GB:使えるメモリ容量
MacではメモリをシステムとGPUで共有しており、macOSがGPUに使わせるのはその一部だけです。iogpu.wired_limit_mbのデフォルト値は0で、これは搭載メモリ容量からカーネルが上限を決めることを意味します。ModelPiperが測定した32 GBのMacでは、MetalがGPUに提供するメモリは24.96 GiBで、メモリ全体の78%に相当しました。一般には75%という値がよく挙げられます。したがって、iMacでは、メモリ16 GBのモデルで約11〜12 GB、24 GBのモデルで約17〜18 GB、32 GBのモデルで約24〜25 GBを目安にしてください。これらは推定値なので、sysctl iogpu.wired_limit_mbコマンドとModelPiperが説明しているMetalツールを使って、自分のマシンで確認してください。
| 構成 | GPUが使用可能なメモリ | 無理なく使える最大規模のモデル |
|---|---|---|
| 16 GB | ≈ 11 〜 12 GB | Q4の14Bモデル(約9 GB)、中程度のコンテキスト長 |
| 24 GB | 約17〜18GB | Q4量子化の24Bモデル(約14 GB)、短いコンテキスト |
| 32 GB | ≈ 24から25GB | Q4 の30Bモデル(約17〜18 GB)、中程度のコンテキスト長 |
これらの制限を越えるためには、GPUに割り当てる割合を上げることが可能です。Mac Apple Silicon向けの最適化ガイドではこの設定とそのリスクについて詳しく説明されています。ここでは再掲しません。
#どのモデルがどのメモリに対応するか
以下のQ4の重みはQuelLLMのカタログに基づいています。モデルがコンテキストを含めて、前の表に示した利用可能なメモリ容量に収まることを前提としています。「快適さ」の列では、各モデルに120 GB/sの上限を適用しています。これらは計算による概算であり、実測値ではありません。
| モデル | モデル容量 | 最低限必要な構成 | M4で期待できる動作の滑らかさ |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | 16 GB | スムーズ(約15トークン/秒) |
| Gemma 4 12B | ≈ 7 GB | 16 GB | まずまずの速度(約13トークン/秒) |
| Phi-4 14B | ≈ 9 GB | 16 GB | まずまず(約10トークン/秒) |
| gpt-oss 20B | 約 13 GB | 24 GB | 変動あり(MoE:20Bの密なモデルより高速) |
| Devstral Small 2 24B | ≈ 14 GB | 24 GB | 遅い(約 6 〜 7 テキストトークン/秒) |
| Gemma 4 31B | ≈ 18 GB | 32 GB | 非常に遅い(約5トークン/秒) |
基本は、「メモリに収まる」と「快適に使える」を混同しないことです。標準のM4で動かす24Bの密なモデルは、出力を読めるものの、毎秒数語という遅さです。一方、gpt-oss 20BやGemma 4 26B-A4BのようなMoE(Mixture of Experts)モデルは、トークンごとに数十億のパラメータしか読み込まないため、同規模の密なモデルより高速です。24 GBまたは32 GBのiMacでは、MoEが最適な選択となることが多いです。
24 GBの環境では、Q8の12Bモデル(約13 GB)とQ4の24Bモデル(約14 GB)のどちらを選ぶかがよく問題になります。両者のメモリ使用量はほぼ同じなので、生成速度もほぼ同じで、帯域幅の上限から計算すると約7トークン/秒です。後者はより高い推論能力を備え、前者は元のモデルにより近い忠実度を保ちます。帯域幅が同じなら、生成速度を決めるのはパラメータ数ではなく、モデルのサイズが何GBかということです。
#速度を決めるのは帯域幅
唯一の公開された参考測定値は、llama.cppのリポジトリにあるApple Siliconのベンチマーク表です。LLaMA 7BをQ4_0でテストしています。GPUが10コア、メモリ帯域幅が120 GB/sのM4では、プロンプト処理が221.29トークン/秒、生成が24.11トークン/秒となっています。メモリ帯域幅が273 GB/s、GPUが16コアのM4 Proでは、生成が49.64トークン/秒で、2倍を少し上回ります。この比率はメモリ帯域幅の比率(2.3倍)に近く、生成がGPUのコア数ではなくメモリに依存していることを示しています。
| チップ | GPU | 帯域幅 | 生成速度 tg(t/s) |
|---|---|---|---|
| M4(iMac 4ポート) | 10コア | 120 GB/s | 24,11 |
| M4 Pro(Mac mini M4 Pro) | 16コア | 273 GB/s | 49,64 |
これらの測定値はllama.cppの初期バージョンに基づいています。最近のバージョンやMLXでは、より良い結果が得られる可能性があります。おおよその目安としてお考えください。このページの旧バージョンでは、Q5の9Bモデルで1秒あたり28〜31トークンと記載していましたが、この数値は同サイズのモデルでは120 GB/sの上限を超えることになるため、削除しました。
#メモリに応じた3つの現実的な用途
必要なメモリ量は、具体的な用途に当てはめると理解しやすくなります。各ケースで、モデルのサイズ、コンテキストキャッシュの使用量、開いている他のプログラムのメモリ使用量を合計し、前の表にある使用可能なメモリ量と比較してください。当サイトの計算ツールがこの合計を計算してくれるので、考え方だけ押さえておいてください。
| 用途 | 読み込む必要があるもの | 最低限必要な構成 |
|---|---|---|
| オフィス用アシスタント:要約、メール、翻訳 | 8Bまたは12B(Q4)、数千トークンのコンテキスト | 16 GB |
| ドキュメント内の検索(RAG) | 同時に読み込む12Bの生成モデル、埋め込みモデル、リランカー | 24GBを確保して余裕を持たせる |
| 中規模プロジェクトにおけるコード作成の支援 | 24Bモデル(Devstral Small 2)または20〜26BのMoEモデル、長いコンテキスト | 24 GB、コンテキストが大きくなる場合は 32 GB |
発熱と騒音については、iMac M4でLLMの負荷を長時間かけた際の公開測定データは見つからなかったため、ファンについては何も断言しません。唯一の信頼できる判断材料は、実際の使用状況です。生成が何時間も続く場合は、アクティビティモニタで動作周波数と温度を監視し、コンテキスト長を適度に抑えてください。
#セットアップ
- 01メモリを確認Appleメニューから「このMacについて」を開き、iMacのメモリ容量を控えてください。その容量によって、利用できるモデルが決まります。
- 02Ollama または LM Studio をインストールOllamaはMetal APIを介してAppleのGPUでの計算を高速化します。LM Studioは、大きな画面に適したグラフィカルインターフェースを提供します。
- 03適切なモデルを読み込む搭載メモリに応じて表からQ4_K_Mのモデルを選び、ollama runで起動してください。
- 04GPUの使用状況を確認するollama psを使ってモデルがGPUに読み込まれていることを確認し、次にアクティビティモニタでメモリプレッシャーを監視してください。
- 05コンテキストを制限する16GBの場合、数千トークン程度のコンテキストを維持することで、システムがスワップしないようにしてください。
#iMac M4またはMac mini M4:本質的な基準
Mac mini M4 は同じチップと同一の帯域幅を使用しているため、メモリ容量が同じであれば iMac はより遅くありません。異なる点は、交換できない内蔵ディスプレイと Pro バリアントの欠如です。iMac は 32 GB と 120 GB/s が上限ですが、同じ参照ディスカッションによると Mac mini M4 Pro は 273 GB/s まで対応します。24B 以上のモデルを適切な速度で実行するのが目的であれば、Mac mini M4 Pro の帯域幅はスループットを倍にします。一方、8 から 14B のデスクトップアシスタントであれば、iMac は同等です。
| 基準 | iMac M4 | Mac mini M4 / M4 Pro |
|---|---|---|
| 帯域幅 | 120 GB/s | 120 GB/s(M4);273 GB/s(M4 Pro) |
| 最大メモリ | 32 GB | Mac miniのページを参照してください |
| 画面 | 24インチの内蔵4.5Kディスプレイ | 別途選択 |
| 7B Q4_0での実測スループット | 24,11 t/s | 24.11 t/s(M4);49.64 t/s(M4 Pro) |
| 拡張性 | なし、交換不可のメモリ | メモリについても同様、ディスプレイは交換可能 |
- Mac mini M4とM4 Pro:メモリ容量別に適したLLM
- Mac mini M4 Pro のハードウェア仕様
- iMacの仕様書、Apple
- Apple Silicon上でのllama.cppの性能(llama.cppリポジトリ)
- Ollamaドキュメント:対応GPU(Metalを含む)
- ModelPiper:MacでのGPUメモリ制限
#よくある質問
iMac M4はローカルAIに適していますか?+
LLM用のiMac M4は、メモリ16GB、24GB、32GBのどれを選ぶべきですか?+
iMac M4でのLLMの処理速度は?+
iMac M4 Proはなぜ選べないのですか?+
8コアGPU搭載のiMac M4はLLMを動かすのに十分ですか?+
OllamaはiMac M4のGPUを使用していますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。