初心者 11 分MacBook Air

MacBook Air M4(16 / 24 / 32 GB)で動かせるLLMは? ?

端的な回答

MacBook Air M4は、16 GBのメモリで80億〜120億パラメータのモデル、24 GBでQ4の24Bモデル、32 GBで30BのMoEモデルを快適に実行できます。120 GB/sのメモリ帯域幅により、Q4の8Bモデルの速度上限は約24トークン/秒となります。メモリは増設できないため、その容量が実行できるモデルのサイズを決めます。

M4搭載モデルは、メモリの基本構成が16 GBで、最大32 GBを選べる初めてのMacBook Airです。このページでは、どのメモリ容量を選ぶべきかを示し、チップが達成できる最大速度を計算します。また、Air M5、MacBook Pro、Mac miniと比較し、Airの限界も説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·macOS 14+ でテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#MacBook Air M4:120 GB/s および最大32 GBのメモリ

MacBook Air M4は、ユニファイドメモリの基本容量が16 GBで、最大32 GBを選べる初のAirモデルです。メモリ帯域幅は120 GB/sです。LLMでは、この2つの数値がコア数より重要です。メモリ容量は読み込めるモデルのサイズを、帯域幅はその最大速度を決めます。帯域幅が120 GB/sの場合、80億パラメータのQ4モデルは理論上24トークン/秒を超えません。実際の速度はそれより低くなります。

チップ
Apple M4:Appleの技術仕様によると、CPUは10コア(高性能コア4基、高効率コア6基)、GPUは8コアまたは10コア、Neural Engineは16コアです。
メモリ
標準で 16 GB、24 GB または 32 GB の構成も選べます。メモリは基板にはんだ付けされているため、構成は購入時に選びます。
帯域幅
120 GB/s(Appleの仕様書に基づく)で、Air M3の100 GB/sに比べて20%高い。
Neural Engine
AppleはM4について最大毎秒38兆回の演算を謳っています。現在のエンジン(Ollama、llama.cpp)は主にMetal経由でGPU上で実行されるため、この数値はそのままトークン/秒に換算されるものではありません。
冷却
ファンなし:筐体を通じて放熱するため、非常に長時間にわたる負荷には制約があります。

Macには独立したVRAMがなく、GPUはユニファイドメモリを使います。「MacBook Air M4のVRAM」を調べる場合、実用上の答えは、総メモリ容量からシステム用に確保された分を差し引いた容量です。ただし、macOSがGPUに使用を認める上限の範囲内に限られます。この上限は変更でき、当サイトのmacOS最適化ガイドで、その方法と伴うリスクを説明しています。

#16 GB、24 GB、32 GB:メモリ容量の選び方

Macキット

あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

モデル、そのコンテキスト、システムはメモリを共有します。以下のモデル用メモリ容量の目安は、慎重に見積もった値です。アクティビティモニタのメモリプレッシャーと照らし合わせて確認してください。総メモリ16GBならモデル用に約11〜12GB、24GBなら17〜19GB、32GBなら24〜26GBです。モデルの容量は当サイトの目安に従い、Q4では8Bが約5GB、14Bが約9GB、24Bが約14GB、32Bが約19〜20GBです。

MacBook Air M4:メモリに基づくモデルのクラス(Q4_K_M)
メモリ推定メモリ余裕容量快適に使えるモデルクラス限界に近い
16 GB≈ 11 〜 12 GB8〜9B(中程度のコンテキスト)、12B(Q4量子化)Q4の14Bモデルを短いコンテキストで使用
24 GB≈ 17 から 19 GB12-14Bは快適、24BはQ4(約14GB)で利用可能Q4の27Bモデル(約16GB)、コンテキスト長を縮小した場合
32 GB約24から26GBQ5-Q6で24B、Q4で27B、30BのMoEモデルQ4の32Bデンスモデル(約19~20 GB)を長いコンテキストで使用
i
実用的なメモリ容量の目安はモデルの世代によって変わる
エキスパート型モデル(MoE)では計算の仕方が変わります。30Bのうち3Bが有効になるモデルは、メモリ上では約19GBを占めますが、トークンごとに読み直す重みはごく一部です。32GBの環境では、重みのメモリ占有量が同じデンスモデルよりもはるかに高速に動作します。16GBでは読み込めません。まず満たすべき条件は、やはりメモリ容量です。

つまり、どの規模のモデルを使いたいかがポイントです。80億〜120億パラメータのモデルに限るなら、16 GBで十分です。24Bモデルや、embedderとrerankerを並行して動かすRAGには、24 GBが余裕を持って使える最初の容量です。32 GBにすると、主に長いコンテキストや30BのMoEモデルを扱えるようになります。

#最大速度は120 GB/sです

原則は、生成される各トークンがアクティブな重みの読み込みを強制する点です。上限は、帯域幅をギガバイトの重みで割った値です。この表では、M4(120 GB/s)に対するこの式を適用しています。これは計算された上限であり、実測値ではありません。実際の速度は、エンジン、量子化、コンテキスト、チップの温度によって異なります。

Air M4での生成速度の理論上限(120GB/s、Q4の有効な重み):計算値であり、実測値ではありません
モデルアクティブな重み計算上限
3B≈ 2 GB120 ÷ 2≈ 60 tok/s
8B≈ 5 GB120 ÷ 5約24トークン/秒
9B≈ 6 GB120 ÷ 6≈ 20トークン/秒
14B≈ 9 GB120 ÷ 9≈ 13 tok/s
24B≈ 14 GB120 ÷ 14約8〜9トークン/秒
32Bの密モデル約19〜20GB120 ÷ 19,5≈ 6 tok/s

2つの実用的な影響。このチップ上で8BのQ4は、1秒あたり約24トークンを大きく超えることはありません。このモデルで1秒あたり34トークンという数値が発表されている場合、他の技術を用いない限り不可能です。また、24Bのdenseモデルは最良の場合でも1秒あたり8トークン前後にとどまり、これは注意深く読む速度に相当します。落ち着いた文章の読み取りには快適ですが、連続して呼び出しを行うエージェントには遅いです。実際の測定値については、/benchmarksや、チップと量子化を明確に示しているサードパーティの情報を参照してください。

#M4 と M5:次の世代で状況は変わるのか?

Appleは現在、MacBook Air M5を提供しています。仕様表によると帯域幅は153 GB/sで、M4の120 GB/sより約28%高く、メモリの選択肢は同じ16、24、32 GBです。帯域幅がボトルネックとなるLLMでは、理論上の最大速度の差も同程度です。Q4の8Bモデルでは、速度の上限が約24トークン/秒から約30トークン/秒になる計算です。

Air M4とAir M5:Appleの情報に基づく、LLM利用に役立つ数値
基準Air M4Air M5
帯域幅120 GB/s153 GB/s
メモリ16GB、24GB、または32GB16GB、24GB、または32GB
8B Q4の理論上の上限約24トークン/秒≈ 30 tok/s

ただし、メモリ容量は変わりません。Air M5の16GBモデルで使えるモデルの範囲は、Air M4の16GBモデルより広くなるわけではありません。24GBまたは32GBのメモリを搭載したM4が見つかれば、より大きなモデルを使うにはM5の16GBモデルより適しています。同じメモリ容量なら、M5のほうが高速です。現在の店頭価格を比較してください。価格の変動が大きすぎるため、ここには掲載できません。

#インストールとエンジンの選択

  1. 01
    Ollama のインストール
    ollama.comから、またはHomebrewを使ってダウンロードしてください。macOSのインストールガイドでは自動起動の設定方法が詳しく説明されています。
  2. 02
    メモリに応じてモデルを起動
    16GBでは9B、24GBではQ4の24B、32GBでは30BのMoE。初回起動時にモデルがダウンロードされます。
  3. 03
    GPUを確認する
    ollama ps affiche la répartition CPU/GPU dans la colonne PROCESSOR : tout sur le GPU est l'état attendu.
  4. 04
    コンテキストを調整する
    メモリが24 GiB未満の場合、Ollamaのデフォルトのコンテキスト長は4,000トークンです。実際の用途に応じて増やしてください。コンテキストを長くすると、KVキャッシュも大きくなります。
ターミナル
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

AppleのフレームワークであるMLXは、CPUとGPUの間でデータをコピーせずにMacの共有メモリを活用します。LM Studioでも、MLX形式のモデルを通じて利用できます。どちらの方法でも動作します。手軽さとローカルAPIを重視するならOllama、Apple向けの形式を試すならMLXとLM Studioが適しています。MLXとllama.cppの比較ガイドで両者のアプローチを比較しているため、ここでその結論を繰り返す必要はありません。

#長いコンテキストとGPUメモリの制限

モデルが占めるのは、メモリ使用量の一部にすぎません。コンテキストのトークンが1つ増えるたびにKVキャッシュにエントリが追加され、GPUが実際に使えるメモリにはmacOSによる上限があります。Ollamaは、エンジンとハードウェアが対応している場合にフラッシュアテンションを自動的に使用し、変数OLLAMA_KV_CACHE_TYPE(デフォルトはf16)でKVキャッシュを量子化できます。メモリが16 GBの場合、この設定によって、短いコンテキストしか使えないか、数千トークンのコンテキストを使えるかが分かれることがよくあります。

MLXについては、mlx-lmリポジトリによると、メモリに収まるモデルは、sysctlの設定でシステムのワイヤードメモリの上限を引き上げることで、処理を高速化できることが多いとされています。これはシステム設定の変更です。管理者権限が必要で、再起動後も設定が維持されるとは限らず、値を高くしすぎるとマシンが不安定になる可能性があります。macOS最適化ガイドには、その手順とメモリ容量に応じた適切な値が詳しく説明されています。そのガイドを読むまでは、この設定を変更しないでください。

ターミナル
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1
ollama serve

#Air M4、MacBook Pro、またはMac mini:それぞれの用途に適した選択

Air M4は軽量性と静謐さで優れていますが、ファンは搭載されていません。長時間の使用によりチップの周波数が低下します。MacBook Pro M4 ProまたはMaxはファンを搭載し、273GB/sから546GB/sまでの帯域幅と、モデルによっては128GBのメモリを提供します(詳細はAppleを参照)。Mac mini M4は固定構成のマシンで、アクティブな冷却を実施しています。

用途に応じて選択
あなたのニーズ適したマシンなぜ
チャット、要約、簡単なコーディング、持ち運んでの利用Air M4 16GB または 24GB静粛性、バッテリー持続時間、8Bから14Bのモデル
24B から 32B のモデル、長いコンテキストAir M4 32 GBまたはMac miniメモリは十分。職場に据え置くならMac mini
長時間の処理、複数のモデルMacBook Pro M4 ProまたはMax、Mac miniファンによる冷却、より高い帯域幅
70BモデルMacBook Pro MaxまたはMac Studio70BモデルはQ4で約40GBあり、Airでは動かせません

#知っておくべき限界

長時間の負荷
ファンがないため、数十分にわたって生成を続けると、最終的にクロック周波数が下がります。チャットではその影響は気になりませんが、インデックス作成やバッチ処理には、ファンで冷却するマシンのほうが適しています。
70Bモデルは動かせません
70BモデルのサイズはQ4で約40 GBあり、Airの最大メモリ容量である32 GBを超えます。
Neural EngineはOllamaを高速化しません
一般的なエンジンはMetal経由でGPUを使用します。NPUが使われるのは、Core MLを利用する一部の用途に限られます。
ストレージ
Ollama のモデルフォルダでは、各モデルが数 GB の容量を占めます。5〜15 GB のモデルを複数保存すると、256 GB の SSD はすぐにいっぱいになります。

#よくある質問

FAQ
MacBook Air M4 16GBはローカルLLMの実行に十分ですか?+
はい、Q4の80〜120億パラメータのモデルなら十分です。サイズは5〜8GBで、システムとコンテキスト用のメモリにも余裕が残ります。140億パラメータのモデルも、コンテキストが短ければ動作します。24Bモデルや負荷の高いRAGを使うなら、メモリは増設できないため、24GBまたは32GBを選ぶ必要があります。
MacBook Air M4のVRAM容量はどのくらいですか?+
独立したVRAMはありません。GPUはプロセッサとユニファイドメモリを共有しており、その容量は構成によって16GB、24GB、32GBのいずれかです。macOSはGPUが確保できるメモリの割合に上限を設けているため、読み込んだモデルがメモリ全体を占有することはできません。macOS最適化ガイドでは、この上限を引き上げる方法を説明しています。
MacBook Air M4で8Bモデルを動かす場合、どのくらいの速度を期待できますか?+
理論上の上限は、120 GB/sを約5 GBで割った値です。つまり、Q4の8Bモデルでは最大24トークン/秒になります。実際の速度はこれより低く、エンジンとコンテキストに依存します。この上限を大幅に超える速度がうたわれている場合は、疑ってかかるべきです。
300億パラメータのモデルをAir M4で実行することは可能ですか?+
32GB構成の場合に限ります。できれば、アクティブなパラメータが少ないMoEモデルを選んでください。30BモデルはQ4で約19GBを使用するため、利用可能な24〜26GBの範囲に収まります。ただし、30Bの密なモデルは遅く、上限でも約6トークン/秒です。16GB構成では読み込めません。
ローカルAIのためにAir M5を待つべきですか?+
M5の帯域幅は153GB/sで、120GB/sに比べて約28%広くなっていますが、メモリ容量の選択肢は同じ16GB、24GB、32GBです。同じ予算でM5よりもメモリ容量の大きいM4が見つかるなら、メモリ容量を優先してください。使えるモデルのサイズはメモリ容量で決まります。
MacBook Air M4はLLMを実行すると発熱しますか?+
ファンがないため、負荷が長時間続くと温度が上がり、動作クロックが下がります。短いやり取りでは影響は小さいです。長時間の処理では、AC電源に接続し、本体の底面を少し浮かせて、より小さいモデルを選んでください。継続的に負荷をかけるなら、Mac miniまたはMacBook Proを選ぶことをおすすめします。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。