MacBook Air M4(16 / 24 / 32 GB)で動かせるLLMは? ?
MacBook Air M4は、16 GBのメモリで80億〜120億パラメータのモデル、24 GBでQ4の24Bモデル、32 GBで30BのMoEモデルを快適に実行できます。120 GB/sのメモリ帯域幅により、Q4の8Bモデルの速度上限は約24トークン/秒となります。メモリは増設できないため、その容量が実行できるモデルのサイズを決めます。
M4搭載モデルは、メモリの基本構成が16 GBで、最大32 GBを選べる初めてのMacBook Airです。このページでは、どのメモリ容量を選ぶべきかを示し、チップが達成できる最大速度を計算します。また、Air M5、MacBook Pro、Mac miniと比較し、Airの限界も説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#MacBook Air M4:120 GB/s および最大32 GBのメモリ
MacBook Air M4は、ユニファイドメモリの基本容量が16 GBで、最大32 GBを選べる初のAirモデルです。メモリ帯域幅は120 GB/sです。LLMでは、この2つの数値がコア数より重要です。メモリ容量は読み込めるモデルのサイズを、帯域幅はその最大速度を決めます。帯域幅が120 GB/sの場合、80億パラメータのQ4モデルは理論上24トークン/秒を超えません。実際の速度はそれより低くなります。
- チップ
- Apple M4:Appleの技術仕様によると、CPUは10コア(高性能コア4基、高効率コア6基)、GPUは8コアまたは10コア、Neural Engineは16コアです。
- メモリ
- 標準で 16 GB、24 GB または 32 GB の構成も選べます。メモリは基板にはんだ付けされているため、構成は購入時に選びます。
- 帯域幅
- 120 GB/s(Appleの仕様書に基づく)で、Air M3の100 GB/sに比べて20%高い。
- Neural Engine
- AppleはM4について最大毎秒38兆回の演算を謳っています。現在のエンジン(Ollama、llama.cpp)は主にMetal経由でGPU上で実行されるため、この数値はそのままトークン/秒に換算されるものではありません。
- 冷却
- ファンなし:筐体を通じて放熱するため、非常に長時間にわたる負荷には制約があります。
Macには独立したVRAMがなく、GPUはユニファイドメモリを使います。「MacBook Air M4のVRAM」を調べる場合、実用上の答えは、総メモリ容量からシステム用に確保された分を差し引いた容量です。ただし、macOSがGPUに使用を認める上限の範囲内に限られます。この上限は変更でき、当サイトのmacOS最適化ガイドで、その方法と伴うリスクを説明しています。
#16 GB、24 GB、32 GB:メモリ容量の選び方
あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
モデル、そのコンテキスト、システムはメモリを共有します。以下のモデル用メモリ容量の目安は、慎重に見積もった値です。アクティビティモニタのメモリプレッシャーと照らし合わせて確認してください。総メモリ16GBならモデル用に約11〜12GB、24GBなら17〜19GB、32GBなら24〜26GBです。モデルの容量は当サイトの目安に従い、Q4では8Bが約5GB、14Bが約9GB、24Bが約14GB、32Bが約19〜20GBです。
| メモリ | 推定メモリ余裕容量 | 快適に使えるモデルクラス | 限界に近い |
|---|---|---|---|
| 16 GB | ≈ 11 〜 12 GB | 8〜9B(中程度のコンテキスト)、12B(Q4量子化) | Q4の14Bモデルを短いコンテキストで使用 |
| 24 GB | ≈ 17 から 19 GB | 12-14Bは快適、24BはQ4(約14GB)で利用可能 | Q4の27Bモデル(約16GB)、コンテキスト長を縮小した場合 |
| 32 GB | 約24から26GB | Q5-Q6で24B、Q4で27B、30BのMoEモデル | Q4の32Bデンスモデル(約19~20 GB)を長いコンテキストで使用 |
つまり、どの規模のモデルを使いたいかがポイントです。80億〜120億パラメータのモデルに限るなら、16 GBで十分です。24Bモデルや、embedderとrerankerを並行して動かすRAGには、24 GBが余裕を持って使える最初の容量です。32 GBにすると、主に長いコンテキストや30BのMoEモデルを扱えるようになります。
#最大速度は120 GB/sです
原則は、生成される各トークンがアクティブな重みの読み込みを強制する点です。上限は、帯域幅をギガバイトの重みで割った値です。この表では、M4(120 GB/s)に対するこの式を適用しています。これは計算された上限であり、実測値ではありません。実際の速度は、エンジン、量子化、コンテキスト、チップの温度によって異なります。
| モデル | アクティブな重み | 計算 | 上限 |
|---|---|---|---|
| 3B | ≈ 2 GB | 120 ÷ 2 | ≈ 60 tok/s |
| 8B | ≈ 5 GB | 120 ÷ 5 | 約24トークン/秒 |
| 9B | ≈ 6 GB | 120 ÷ 6 | ≈ 20トークン/秒 |
| 14B | ≈ 9 GB | 120 ÷ 9 | ≈ 13 tok/s |
| 24B | ≈ 14 GB | 120 ÷ 14 | 約8〜9トークン/秒 |
| 32Bの密モデル | 約19〜20GB | 120 ÷ 19,5 | ≈ 6 tok/s |
2つの実用的な影響。このチップ上で8BのQ4は、1秒あたり約24トークンを大きく超えることはありません。このモデルで1秒あたり34トークンという数値が発表されている場合、他の技術を用いない限り不可能です。また、24Bのdenseモデルは最良の場合でも1秒あたり8トークン前後にとどまり、これは注意深く読む速度に相当します。落ち着いた文章の読み取りには快適ですが、連続して呼び出しを行うエージェントには遅いです。実際の測定値については、/benchmarksや、チップと量子化を明確に示しているサードパーティの情報を参照してください。
#M4 と M5:次の世代で状況は変わるのか?
Appleは現在、MacBook Air M5を提供しています。仕様表によると帯域幅は153 GB/sで、M4の120 GB/sより約28%高く、メモリの選択肢は同じ16、24、32 GBです。帯域幅がボトルネックとなるLLMでは、理論上の最大速度の差も同程度です。Q4の8Bモデルでは、速度の上限が約24トークン/秒から約30トークン/秒になる計算です。
| 基準 | Air M4 | Air M5 |
|---|---|---|
| 帯域幅 | 120 GB/s | 153 GB/s |
| メモリ | 16GB、24GB、または32GB | 16GB、24GB、または32GB |
| 8B Q4の理論上の上限 | 約24トークン/秒 | ≈ 30 tok/s |
ただし、メモリ容量は変わりません。Air M5の16GBモデルで使えるモデルの範囲は、Air M4の16GBモデルより広くなるわけではありません。24GBまたは32GBのメモリを搭載したM4が見つかれば、より大きなモデルを使うにはM5の16GBモデルより適しています。同じメモリ容量なら、M5のほうが高速です。現在の店頭価格を比較してください。価格の変動が大きすぎるため、ここには掲載できません。
#インストールとエンジンの選択
- 01Ollama のインストールollama.comから、またはHomebrewを使ってダウンロードしてください。macOSのインストールガイドでは自動起動の設定方法が詳しく説明されています。
- 02メモリに応じてモデルを起動16GBでは9B、24GBではQ4の24B、32GBでは30BのMoE。初回起動時にモデルがダウンロードされます。
- 03GPUを確認するollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
- 04コンテキストを調整するメモリが24 GiB未満の場合、Ollamaのデフォルトのコンテキスト長は4,000トークンです。実際の用途に応じて増やしてください。コンテキストを長くすると、KVキャッシュも大きくなります。
AppleのフレームワークであるMLXは、CPUとGPUの間でデータをコピーせずにMacの共有メモリを活用します。LM Studioでも、MLX形式のモデルを通じて利用できます。どちらの方法でも動作します。手軽さとローカルAPIを重視するならOllama、Apple向けの形式を試すならMLXとLM Studioが適しています。MLXとllama.cppの比較ガイドで両者のアプローチを比較しているため、ここでその結論を繰り返す必要はありません。
#長いコンテキストとGPUメモリの制限
モデルが占めるのは、メモリ使用量の一部にすぎません。コンテキストのトークンが1つ増えるたびにKVキャッシュにエントリが追加され、GPUが実際に使えるメモリにはmacOSによる上限があります。Ollamaは、エンジンとハードウェアが対応している場合にフラッシュアテンションを自動的に使用し、変数OLLAMA_KV_CACHE_TYPE(デフォルトはf16)でKVキャッシュを量子化できます。メモリが16 GBの場合、この設定によって、短いコンテキストしか使えないか、数千トークンのコンテキストを使えるかが分かれることがよくあります。
MLXについては、mlx-lmリポジトリによると、メモリに収まるモデルは、sysctlの設定でシステムのワイヤードメモリの上限を引き上げることで、処理を高速化できることが多いとされています。これはシステム設定の変更です。管理者権限が必要で、再起動後も設定が維持されるとは限らず、値を高くしすぎるとマシンが不安定になる可能性があります。macOS最適化ガイドには、その手順とメモリ容量に応じた適切な値が詳しく説明されています。そのガイドを読むまでは、この設定を変更しないでください。
#Air M4、MacBook Pro、またはMac mini:それぞれの用途に適した選択
Air M4は軽量性と静謐さで優れていますが、ファンは搭載されていません。長時間の使用によりチップの周波数が低下します。MacBook Pro M4 ProまたはMaxはファンを搭載し、273GB/sから546GB/sまでの帯域幅と、モデルによっては128GBのメモリを提供します(詳細はAppleを参照)。Mac mini M4は固定構成のマシンで、アクティブな冷却を実施しています。
| あなたのニーズ | 適したマシン | なぜ |
|---|---|---|
| チャット、要約、簡単なコーディング、持ち運んでの利用 | Air M4 16GB または 24GB | 静粛性、バッテリー持続時間、8Bから14Bのモデル |
| 24B から 32B のモデル、長いコンテキスト | Air M4 32 GBまたはMac mini | メモリは十分。職場に据え置くならMac mini |
| 長時間の処理、複数のモデル | MacBook Pro M4 ProまたはMax、Mac mini | ファンによる冷却、より高い帯域幅 |
| 70Bモデル | MacBook Pro MaxまたはMac Studio | 70BモデルはQ4で約40GBあり、Airでは動かせません |
- MacBook Pro M4 Pro および Max:273 から 546 GB/s
- LLM を動かすための Mac mini M4 と M4 Pro
- MacBook Air M2:100 GB/s、最大24 GB
- MLX と llama.cpp の Mac 上での比較
- Apple Silicon搭載MacをLLM向けに最適化する
- 16GBメモリ向けのLLMはどれですか?
- 出典:AppleのMacBook Air M4技術仕様書
- 出典:Appleによる現行MacBook Airの技術仕様
- 出典:Apple の MacBook Pro M4 Pro および Max の技術仕様
- 出典:Ollama ドキュメント、コンテキスト
#知っておくべき限界
- 長時間の負荷
- ファンがないため、数十分にわたって生成を続けると、最終的にクロック周波数が下がります。チャットではその影響は気になりませんが、インデックス作成やバッチ処理には、ファンで冷却するマシンのほうが適しています。
- 70Bモデルは動かせません
- 70BモデルのサイズはQ4で約40 GBあり、Airの最大メモリ容量である32 GBを超えます。
- Neural EngineはOllamaを高速化しません
- 一般的なエンジンはMetal経由でGPUを使用します。NPUが使われるのは、Core MLを利用する一部の用途に限られます。
- ストレージ
- Ollama のモデルフォルダでは、各モデルが数 GB の容量を占めます。5〜15 GB のモデルを複数保存すると、256 GB の SSD はすぐにいっぱいになります。
#よくある質問
MacBook Air M4 16GBはローカルLLMの実行に十分ですか?+
MacBook Air M4のVRAM容量はどのくらいですか?+
MacBook Air M4で8Bモデルを動かす場合、どのくらいの速度を期待できますか?+
300億パラメータのモデルをAir M4で実行することは可能ですか?+
ローカルAIのためにAir M5を待つべきですか?+
MacBook Air M4はLLMを実行すると発熱しますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。