初心者 11 分iMac

iMac M4(16 / 24 / 32 GB)で使えるLLMは? ?

端的な回答

iMac M4は、80億〜140億パラメータのモデルをQ4で快適に動かせます。M4チップのメモリ帯域幅は120 GB/sで、公開されている測定では、10コアGPUでQ4_0の7Bモデルを動かした際に24トークン/秒を記録しています。ユニファイドメモリの容量(16、24、32 GB)が、動かせるモデルの最大サイズを決めます。16 GBなら14B、24 GBなら速度は遅いものの24B、32 GBならさらに遅い30Bまで動かせます。

iMacは何よりもまず画面が主役の製品です。ただし、ローカルAIで重要なのはM4チップとユニファイドメモリの容量で、購入後に変更することはできません。このガイドでは、各構成で何を実行できるか、公開測定値に基づく実行速度、そしてMac miniのほうが買い物として優れているケースを、数値を交えて解説します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·macOS 14+ でテスト済み
推奨ハードウェア

このセットアップの場合: iMac M4 — 16 GB / 256 GB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#iMac M4でローカルAIに何ができるか

iMac M4は、80億〜140億パラメータのモデルを快適に実行でき、より大きなモデルも速度を落とせば実行できます。要点は3つの数値に集約されます。Appleの仕様表によると、M4チップのメモリ帯域幅は120 GB/sで、Q4_0の7Bモデルでは理論上の上限が約31トークン/秒となります。llama.cppリポジトリに公開されている10コアGPU搭載M4の測定値では、生成速度は24.11トークン/秒で、この上限の77%に相当します。また、ユニファイドメモリは16〜32 GBで、購入時に選択します。実行可能なモデルのサイズは、このメモリ容量だけで決まります。このiMacに足りないのは容量ではなく、帯域幅です。

チップ
Apple M4。Appleの仕様表には、iMac向けのPro版やMax版はありません。
帯域幅
構成にかかわらず120GB/s。
ユニファイドメモリ
標準は16GB。すべてのモデルで24GBを、4ポートモデルでは32GBをオプションで選択できます。
画面
24インチの4.5K(4480 × 2520)。そのため、より高性能なGPUを選ぶメリットはほとんどありません。制約となるのはメモリです。
価格
Appleが価格を変更するため、ここには記載していません。当サイトのハードウェアページをご覧ください。

#実際の構成:2つのモデル、3つではありません

Macキット

あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

Appleのページでは、2種類のモデルが区別されています。2ポートモデルは8コアCPUと8コアGPUを搭載し、メモリは16 GBで、24 GBまで増やせます。4ポートモデルは10コアCPUと10コアGPUを搭載し、メモリは16 GBで、24 GBまたは32 GBまで増やせます。帯域幅はどちらも120 GB/sです。このページの旧版にもあったよくある誤りは、8 GB構成が今も存在すると思い込むことです。標準のメモリ容量は16 GBです。したがって、LLM用途で32 GBが必要なら、4ポートモデルを選ぶことが重要です。

LLMの利用に適したiMac M4の構成(Appleの仕様表)
バージョンGPUユニファイドメモリ帯域幅
2ポート8コア16GB、オプション24GB120 GB/s
4ポート10コア16 GB、オプションで24 GBまたは32 GB120 GB/s

テキスト生成では、GPUが8コアか10コアかによる差はおそらく小さいでしょう。速度はメモリ帯域幅に依存し、帯域幅はどちらも同じだからです。参照表には8コア版の公開測定値がないため、この主張は仮説にとどまります。迷った場合は、コア数よりもメモリ容量に予算をかけてください。

#16 GB、24 GB、32 GB:使えるメモリ容量

MacではメモリをシステムとGPUで共有しており、macOSがGPUに使わせるのはその一部だけです。iogpu.wired_limit_mbのデフォルト値は0で、これは搭載メモリ容量からカーネルが上限を決めることを意味します。ModelPiperが測定した32 GBのMacでは、MetalがGPUに提供するメモリは24.96 GiBで、メモリ全体の78%に相当しました。一般には75%という値がよく挙げられます。したがって、iMacでは、メモリ16 GBのモデルで約11〜12 GB、24 GBのモデルで約17〜18 GB、32 GBのモデルで約24〜25 GBを目安にしてください。これらは推定値なので、sysctl iogpu.wired_limit_mbコマンドとModelPiperが説明しているMetalツールを使って、自分のマシンで確認してください。

モデルに使用できるメモリ(全体の75%と推定)
構成GPUが使用可能なメモリ無理なく使える最大規模のモデル
16 GB≈ 11 〜 12 GBQ4の14Bモデル(約9 GB)、中程度のコンテキスト長
24 GB約17〜18GBQ4量子化の24Bモデル(約14 GB)、短いコンテキスト
32 GB≈ 24から25GBQ4 の30Bモデル(約17〜18 GB)、中程度のコンテキスト長

これらの制限を越えるためには、GPUに割り当てる割合を上げることが可能です。Mac Apple Silicon向けの最適化ガイドではこの設定とそのリスクについて詳しく説明されています。ここでは再掲しません。

#どのモデルがどのメモリに対応するか

以下のQ4の重みはQuelLLMのカタログに基づいています。モデルがコンテキストを含めて、前の表に示した利用可能なメモリ容量に収まることを前提としています。「快適さ」の列では、各モデルに120 GB/sの上限を適用しています。これらは計算による概算であり、実測値ではありません。

メモリ構成別のモデル(Q4、重みのみ)
モデルモデル容量最低限必要な構成M4で期待できる動作の滑らかさ
Llama 3.1 8B≈ 6 GB16 GBスムーズ(約15トークン/秒)
Gemma 4 12B≈ 7 GB16 GBまずまずの速度(約13トークン/秒)
Phi-4 14B≈ 9 GB16 GBまずまず(約10トークン/秒)
gpt-oss 20B約 13 GB24 GB変動あり(MoE:20Bの密なモデルより高速)
Devstral Small 2 24B≈ 14 GB24 GB遅い(約 6 〜 7 テキストトークン/秒)
Gemma 4 31B≈ 18 GB32 GB非常に遅い(約5トークン/秒)

基本は、「メモリに収まる」と「快適に使える」を混同しないことです。標準のM4で動かす24Bの密なモデルは、出力を読めるものの、毎秒数語という遅さです。一方、gpt-oss 20BやGemma 4 26B-A4BのようなMoE(Mixture of Experts)モデルは、トークンごとに数十億のパラメータしか読み込まないため、同規模の密なモデルより高速です。24 GBまたは32 GBのiMacでは、MoEが最適な選択となることが多いです。

24 GBの環境では、Q8の12Bモデル(約13 GB)とQ4の24Bモデル(約14 GB)のどちらを選ぶかがよく問題になります。両者のメモリ使用量はほぼ同じなので、生成速度もほぼ同じで、帯域幅の上限から計算すると約7トークン/秒です。後者はより高い推論能力を備え、前者は元のモデルにより近い忠実度を保ちます。帯域幅が同じなら、生成速度を決めるのはパラメータ数ではなく、モデルのサイズが何GBかということです。

#速度を決めるのは帯域幅

唯一の公開された参考測定値は、llama.cppのリポジトリにあるApple Siliconのベンチマーク表です。LLaMA 7BをQ4_0でテストしています。GPUが10コア、メモリ帯域幅が120 GB/sのM4では、プロンプト処理が221.29トークン/秒、生成が24.11トークン/秒となっています。メモリ帯域幅が273 GB/s、GPUが16コアのM4 Proでは、生成が49.64トークン/秒で、2倍を少し上回ります。この比率はメモリ帯域幅の比率(2.3倍)に近く、生成がGPUのコア数ではなくメモリに依存していることを示しています。

Apple SiliconでのLLaMA 7B Q4_0(llama.cppのディスカッション)
チップGPU帯域幅生成速度 tg(t/s)
M4(iMac 4ポート)10コア120 GB/s24,11
M4 Pro(Mac mini M4 Pro)16コア273 GB/s49,64

これらの測定値はllama.cppの初期バージョンに基づいています。最近のバージョンやMLXでは、より良い結果が得られる可能性があります。おおよその目安としてお考えください。このページの旧バージョンでは、Q5の9Bモデルで1秒あたり28〜31トークンと記載していましたが、この数値は同サイズのモデルでは120 GB/sの上限を超えることになるため、削除しました。

#メモリに応じた3つの現実的な用途

必要なメモリ量は、具体的な用途に当てはめると理解しやすくなります。各ケースで、モデルのサイズ、コンテキストキャッシュの使用量、開いている他のプログラムのメモリ使用量を合計し、前の表にある使用可能なメモリ量と比較してください。当サイトの計算ツールがこの合計を計算してくれるので、考え方だけ押さえておいてください。

代表的な用途と推奨構成
用途読み込む必要があるもの最低限必要な構成
オフィス用アシスタント:要約、メール、翻訳8Bまたは12B(Q4)、数千トークンのコンテキスト16 GB
ドキュメント内の検索(RAG)同時に読み込む12Bの生成モデル、埋め込みモデル、リランカー24GBを確保して余裕を持たせる
中規模プロジェクトにおけるコード作成の支援24Bモデル(Devstral Small 2)または20〜26BのMoEモデル、長いコンテキスト24 GB、コンテキストが大きくなる場合は 32 GB

発熱と騒音については、iMac M4でLLMの負荷を長時間かけた際の公開測定データは見つからなかったため、ファンについては何も断言しません。唯一の信頼できる判断材料は、実際の使用状況です。生成が何時間も続く場合は、アクティビティモニタで動作周波数と温度を監視し、コンテキスト長を適度に抑えてください。

#セットアップ

  1. 01
    メモリを確認
    Appleメニューから「このMacについて」を開き、iMacのメモリ容量を控えてください。その容量によって、利用できるモデルが決まります。
  2. 02
    Ollama または LM Studio をインストール
    OllamaはMetal APIを介してAppleのGPUでの計算を高速化します。LM Studioは、大きな画面に適したグラフィカルインターフェースを提供します。
  3. 03
    適切なモデルを読み込む
    搭載メモリに応じて表からQ4_K_Mのモデルを選び、ollama runで起動してください。
  4. 04
    GPUの使用状況を確認する
    ollama psを使ってモデルがGPUに読み込まれていることを確認し、次にアクティビティモニタでメモリプレッシャーを監視してください。
  5. 05
    コンテキストを制限する
    16GBの場合、数千トークン程度のコンテキストを維持することで、システムがスワップしないようにしてください。
ターミナル
ollama ps
sysctl iogpu.wired_limit_mb
sysctl hw.memsize

#iMac M4またはMac mini M4:本質的な基準

Mac mini M4 は同じチップと同一の帯域幅を使用しているため、メモリ容量が同じであれば iMac はより遅くありません。異なる点は、交換できない内蔵ディスプレイと Pro バリアントの欠如です。iMac は 32 GB と 120 GB/s が上限ですが、同じ参照ディスカッションによると Mac mini M4 Pro は 273 GB/s まで対応します。24B 以上のモデルを適切な速度で実行するのが目的であれば、Mac mini M4 Pro の帯域幅はスループットを倍にします。一方、8 から 14B のデスクトップアシスタントであれば、iMac は同等です。

iMac M4またはMac mini
基準iMac M4Mac mini M4 / M4 Pro
帯域幅120 GB/s120 GB/s(M4);273 GB/s(M4 Pro)
最大メモリ32 GBMac miniのページを参照してください
画面24インチの内蔵4.5Kディスプレイ別途選択
7B Q4_0での実測スループット24,11 t/s24.11 t/s(M4);49.64 t/s(M4 Pro)
拡張性なし、交換不可のメモリメモリについても同様、ディスプレイは交換可能
→
決定的な基準
オールインワン環境と 8〜14B のアシスタントを希望する場合は iMac を選んでください。24B 以上をターゲットにし、帯域幅の倍増によるスループット向上を求める場合は Mac mini M4 Pro を選んでください。価格は変動するため、サイトのハードウェアページで最新情報をご確認ください。

#よくある質問

FAQ
iMac M4はローカルAIに適していますか?+
80億~140億パラメータのモデルであれば、適しています。M4チップのメモリ帯域幅は120 GB/sで、公開されている測定では、Q4_0の7Bモデルで24トークン/秒を記録しています。24B以上のモデルでは大幅に遅くなりますが、その原因は容量不足ではなく、帯域幅不足です。
LLM用のiMac M4は、メモリ16GB、24GB、32GBのどれを選ぶべきですか?+
Q4 形式の 8B から 14B モデルには 16 GB が十分で、利用可能な容量は約 11〜12 GB です。24 GB では 20B から 24B、32 GB では Q4 形式の 30B が扱えます。メモリは購入後に交換できないため、今日使うモデルではなく、今後使用予定の最大モデルを基準にしてください。
iMac M4でのLLMの処理速度は?+
10コアGPUを搭載したM4では、llama.cppの表に、LLaMA 7BのQ4_0で24.11トークン/秒の生成速度が示されています。帯域幅をモデルの重みのサイズで割ると、最近の8BモデルのQ4で約15トークン/秒、24Bの密なモデルで6~7トークン/秒と推定できます。これらは検証が必要な推定値です。
iMac M4 Proはなぜ選べないのですか?+
Appleのページでは、iMac向けにはM4チップのみが提供されており、GPUが8コアと10コアの構成があります。より高い帯域幅を得るには、Mac mini M4 Pro(273GB/s)に切り替える必要があります。参照表では、このモデルの生成速度は2倍を超えています。
8コアGPU搭載のiMac M4はLLMを動かすのに十分ですか?+
おそらく十分です。どの構成もメモリ帯域幅が120 GB/sなので、生成速度はGPUコア数にあまり左右されません。llama.cppの表には8コア版の測定値がないため、これは仮説です。選ぶ際は、むしろメモリ容量を基準にしてください。24 GBが、実用上本当に役立つ最初の容量です。
OllamaはiMac M4のGPUを使用していますか?+
はい。Ollamaのドキュメントには、Metal APIを介してApple GPUでの計算を高速化すると記載されています。ollama psでモデルがGPUに読み込まれていることを確認し、お使いの構成のメモリ容量の限界に近づく場合は、アクティビティモニタでメモリプレッシャーを監視してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。