初心者 12 分MacBook Air

MacBook Air M1(8GB/16GB)で使えるLLMは? ?

端的な回答

MacBook Air M1 は、8 GB で 3B〜4B パラメータのモデル、16 GB で 8B〜9B パラメータのモデルを Q4_K_M 量子化で動作させます。制約は計算性能ではなく、統一メモリ(8 GB または 16 GB、拡張不可)と約 68 GB/s のメモリ帯域幅であり、8B モデルの出力速度は 1 秒あたり約 12 トークンに制限されます。

MacBook Air M1は、適切な規模のモデルを選べば、今でもローカルAIを始めるための手堅い選択肢です。このページでは、メモリ容量に応じて何を選ぶべきかを示し、このマシンが物理的に達成できる最高速度を計算し、別の選択肢に移るべきタイミングを示します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·macOS 14+ でテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: MacBook Pro M5 Pro — 24 GB / 1 TB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#MacBook Air M1:LLMの実行で実際にできること

ローカルLLMにとって、MacBook Air M1は3つの数値に集約されます。統合メモリ(標準8 GB、オプション16 GB、購入後は拡張不可)、メモリ帯域幅(約68 GB/s)、そしてファンなし設計です。メモリは読み込めるものを決定し、帯域幅は生成速度を決定し、パッシブ冷却は、その速度が持続する時間を決定します。

チップ
Apple M1(2020):Appleの技術仕様によると、CPUは8コア(高性能コア4基、高効率コア4基)、GPUは構成に応じて7コアまたは8コア、Neural Engineは16コアです。
メモリ
ユニファイドメモリは8 GBで、16 GB構成も選択できます。CPUとGPUは同じメモリ領域を共有するため、別途容量を足し合わせられる独立したVRAMはありません。
帯域幅
Apple はM1の仕様にその情報を掲載していません。一方でM2に関しては100GB/sと発表しており、M1に対して50%多いとされ、M1は通常67〜68GB/sとされる値(LPDDR4X)に相当します。
冷却
ファンはありません。Apple は MacBook Air M1 を、どのような作業でも完全に静かだと紹介しています。その代わり、放熱面での制約があります。詳しくは後述します。
バッテリー
バッテリー容量は49.9 Wh。推論を継続して実行すると、Appleが公称15時間の根拠としているウェブ閲覧よりも、はるかに速くバッテリーを使い切ります。

このマシンは、Appleでは新品の販売が終了してからかなりの年月が経っています。中古で入手できますが、価格の変動が大きすぎるため、ここには掲載していません。中古のAirとより新しいマシンのどちらにするか迷っている場合は、当サイトのハードウェアページ(/materiel-ia)で現在の目安を確認できます。2020年のMac miniは同じM1チップを搭載し、メモリ容量と帯域幅の上限も同じです。ファンが追加されているため、継続的な動作速度がより安定します。

#8 GBか16 GBか:RAM容量でできること・できないこと

Macキット

あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

8GB構成では、システム、ブラウザ、使用中のアプリケーションが、モデルと同じメモリをすでに共有しています。LLMに使えるのは、コンテキストを含めて約4〜5GBです。これは常識的な見積もりであり、実測値ではありません。macOSが自身のメモリ使用量を調整するためです。16GB構成では使えるメモリが約10〜11GBに増え、80〜90億パラメータのモデルも選択肢に入ります。

Air M1 のメモリ容量に収まる範囲(Q4_K_M、サイトの参考値に基づく重みのみ、さらにコンテキストを含む)
モデルQ4 での重みAir M1 8 GBAir M1 16 GB
3B (Granite 4.1 3B, Llama 3.2 3B)≈ 2 から 2.5 GB快適快適
4B(Qwen 3.5 4B、Phi-4 mini)≈ 2.5〜3GB短いコンテキストなら快適快適で、長いコンテキストをサポート
7-9B (Granite 4.1 8B, Qwen 3.5 9B)約 5 〜 6GB容量が厳しい:スワップが発生する可能性が高い良いバランス
12B (Gemma 4 12B)≈ 7 〜 8 GBいいえ制限:短いコンテキストのみ
24B以上≥ 14 GBいいえいいえ

最後の行の順位は速度ではなく、超えられない容量の上限で決まります。システムが読み込まれると、14 GBのモデルは16 GBのメモリに収まりません。モデルの正確なサイズが分からない場合は、本サイトのVRAM計算ツールで、量子化とコンテキストに応じたメモリ使用量を確認できます。

!
本当の警告サインはスワップです
macOSでメモリ使用量がRAM容量を超えると、SSDへの書き込みが発生し、生成速度が大幅に低下するとともに、ディスクの消耗が増えます。アクティビティモニタの「メモリ」タブを開き、生成中に「メモリプレッシャー」が黄色や赤になったら、より小さいモデルを選ぶか、コンテキストを短くしてください。タブを一つずつ閉じるよりも効果的です。

#用途に応じたモデルの選び方

M1 では、モデルのブランドではなくサイズで判断します。8 GB の場合、Q4_K_M の 3B または 4B を目指してください:テキスト要約、リライト、抜粋に対する質問応答、シンプルなコード。16 GB の場合、8B から 9B パラメータのモデルは、長い指示に対する正確性と安定性に明確な向上をもたらしますが、生成速度が遅くなるという代償があります。モデル名は毎月変化します:重要なのはサイズクラスを把握し、現在の状態についてはサイトのカタログを確認することです。

執筆、要約、翻訳
8 GBでは4B、16 GBでは8〜9Bのモデル。フランス語の文章作成の品質は、モデルのサイズよりもモデルファミリーに大きく左右されます。自分の文章で2つの候補を試してください。
コード
4Bモデルで短い関数や説明には十分対応できます。ただし、プロジェクト全体を扱う場合は、Air M1のメモリ容量によりコンテキストを短くする必要があるため、ローカルのコードアシスタントでできることは限られます。
ドキュメントとRAG
軽量な埋め込みモデルと、4B(8 GB)または 8〜9B(16 GB)の生成モデルを組み合わせます。入力に加えるコンテキストはメモリを消費するため、関連箇所を厳選し、数を少なくしてください。
ビジョン
マルチモーダルモデルでは、モデル本体に加えて画像エンコーダの分もメモリを使用します。8 GBの環境では小型のモデルに限定してください。16 GBの環境では動作しますが、速度は遅くなります。

#毎秒何トークンか:理論上の上限

生成中、プロセッサはトークンを生成するたびに、モデルのアクティブな重みのほぼすべてを読み直します。そのため、最大速度の上限は、帯域幅を重みのサイズで割った値になります。帯域幅が約68 GB/sのM1では、GPUコアの数にかかわらず、重みのサイズが5 GBのモデルは約13トークン/秒を超えられません。これは計算上の上限であり、実測値ではありません。計算処理、KVキャッシュ、システムも帯域幅を消費するため、実際の速度はさらに低くなります。

Air M1 の理論上の生成速度の上限(約 68 GB/s、Q4 のモデルの重みのみを考慮):計算値であり、実測値ではありません
モデルQ4 での重み計算上限
3B≈ 2 GB68 ÷ 2≈ 34 tok/s
4B≈ 2.5〜3GB68 ÷ 2,5 à 3約 23 〜 27 tok/s
8B≈ 5 GB68 ÷ 5≈ 13 tok/s
9B≈ 6 GB68 ÷ 6≈ 11 tok/s
12B≈7.5GB68 ÷ 7,5≈9 tok/s

この計算はフィルタとして機能します。M1上でQ4の80億パラメータモデルで1秒あたり30トークンを超えるという主張は、帯域幅と物理的に矛盾します。一部のエキスパートのみがアクティブになるエキスパート混合モデルの場合を除きます。実際の測定値については、サイトの/benchmarksページとサードパーティが公開したベンチマークを参照し、使用されたチップ、量子化、エンジンを確認してください。

i
M1 で Q8 より Q4 を選ぶ理由
Q8はQ4のほぼ2倍のサイズです。同じ帯域幅なら、生成速度はおよそ半分になり、メモリ使用量も増えます。8〜9Bモデルでは、Q4_K_Mによる品質低下は通常わずかです。量子化ガイドでは、Q4、Q5、Q8の選び方を詳しく説明しています。

#数分でインストールおよび確認

Ollama は最も簡単な方法です。実行エンジンのインストール、モデルのダウンロード、MacのGPUの検出を、設定なしで行います。macOSでは、モデルは ~/.ollama/models に保存されます。モデルごとに数ギガバイトの容量が必要なので、256 GBのSSDを使っている場合は、その点に注意してください。

  1. 01
    Ollama のインストール
    ollama.comからアプリをダウンロードするか、以下のコマンドでHomebrew経由でインストールしてください。当サイトのmacOSインストールガイドでは、自動起動について詳しく説明しています。
  2. 02
    RAMに適したモデルを起動する
    8GBの場合4Bモデル、16GBの場合8-9Bモデル。最初の起動ではモデルがダウンロードされ、以降の起動は即時になります。
  3. 03
    GPUが使われていることを確認する
    別のターミナルでollama psを実行してください。PROCESSOR列が100%GPUを示す必要があります。CPU/GPUの割合が見られる場合、モデルがGPUの割り当てメモリを超過していることを示します。
  4. 04
    コンテキストの固定
    Ollamaは利用可能なメモリに応じてデフォルトのコンテキストサイズを選びます。24 GB未満の場合は4,000トークンです。増やすのは必要な場合だけにしてください。コンテキストの各トークンがメモリを消費します。
ターミナル
brew install --cask ollama
ollama run qwen3.5:4b
ollama ps

LM Studioは、充実したグラフィカルインターフェースを備えた代替手段で、ターミナルが苦手な場合に便利です。Ollama単体よりもメモリを少し多く消費するため、メモリが8 GBの場合はこの差が重要になります。AppleのフレームワークであるMLXは、CPUとGPUの間でコピーすることなくMacの共有メモリを活用します。MLXとllama.cppの設定については、macOS最適化ガイドで扱っています。

#長いコンテキスト、8GBの罠

モデルのサイズはメモリの一部にすぎません。各コンテキストトークンに対してKVキャッシュにエントリが追加され、会話の長さとともに増大します。Ollamaは、エンジンおよびハードウェアが許容する場合、自動的にFlash注意を活用し、この増大を抑制します。また、KVキャッシュの量子化を変数OLLAMA_KV_CACHE_TYPEで制御しており、デフォルトはf16です。8GBのAir M1上で、このオプションは4,000トークンのコンテキストと8,000トークンのコンテキストの差を生み出し、精度のわずかな損失を伴います。

ターミナル
# Quantifier le cache KV en q8_0 avant de démarrer le serveur
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1
ollama serve

KVキャッシュの量子化に関するガイドでは、このオプションを使う価値があるのはどのような場合かを説明しています。実用上の目安として、8 GBではコンテキストを短く保ち、役立つ箇所だけを入力に含めてください。16 GBでは、8–9Bのモデルでも8,000トークンのコンテキストは無理のない範囲です。

#ファンレスのAirの発熱

ファンレスのMacBook Air M1は、筐体を通じて熱を放散します。短時間の使用(質問と回答)では、問題はありません。しかし、数十分間のバッチ処理やドキュメントのインデックス作成のような継続的な使用では、チップは自己保護のために周波数を低下させます:マシンが停止することなく、速度が低下します。このページでは、分や度でのしきい値を一切提示していません:それは部屋や負荷によって異なり、信頼できるソースがそれを固定しているわけではありません。

パソコンを少し高い位置に置く
パソコンスタンドを使うと、筐体の下の空気の流れが改善されます。
重いアプリケーションを閉じる
負荷の高いブラウザやビデオ会議アプリは、同時にCPUリソースを使用し、同じチップの温度を上げます。
Q8を使うよりも小さいモデルを選ぶ
再読み込みするメモリが減り、トークンあたりの消費エネルギーも減ります。
長時間のタスクでは電源に接続する
バッテリー使用時、macOSはパフォーマンスをより強く制限することがあります。これはエネルギーモードの設定によるものです。

#限界と、別のマシンへの移行を考える目安

M1が候補から外れる理由は、古さではなくメモリ容量です。ほかの選択肢を検討すべきかどうかの判断基準は、シンプルで測定可能です。

12Bを超えるモデルを使いたい
M1 Airの構成にはこのモデルが快適に収まらないため、MacBook Air M4(32GBまで)またはMacBook Pro Pro/Maxをご検討ください。
大きなドキュメントを扱っています
長いコンテキストでは、計算能力が限界に達する前にメモリがいっぱいになります。RAMを増やすことが唯一の根本的な解決策です。
数時間にわたる処理を実行する場合
ファンを搭載したMac miniやデスクトップPCのほうが、持続的な負荷に強いです。
ファインチューニングに興味がある場合
Air M1はこれに必要な性能を備えていません。必要なときだけクラウドサービスを利用することをおすすめします。
Air M1 と後継世代:ローカル LLM の利用で何が変わるか
基準MacBook Air M1MacBook Air M2MacBook Air M4
最大メモリ16 GB24 GB32 GB
帯域幅≈ 68 GB/s100 GB/s120 GB/s
Q4で快適に動作するモデル8-9B8~9B、24 GB構成なら14B32 GBで14B、24B

#よくある質問

FAQ
8GBのMacBook Air M1は、ローカルLLMの利用に十分ですか?+
はい。Q4の30億〜40億パラメータのモデルなら、サイズは約2〜3 GBで、システムにも余裕が残ります。Q4の80億パラメータのモデル(約5 GB)も実行可能ですが、コンテキストが大きくなると、macOSがSSDへの書き込みを始めます。日常的に使うなら、16 GBのほうがはるかに快適です。
MacBook Air M1で8BのLLMを動かす場合、どのくらいの速度が期待できますか?+
理論上の上限は、メモリ帯域幅(約 68 GB/s)をモデルのサイズで割ることで計算できます。8B モデルの Q4 版(約 5 GB)なら、最大で毎秒約 13 トークンになります。実際の速度はこれより低くなります。この計算は非現実的な数値を除外するためのもので、ご自身のマシンの性能を予測するためのものではありません。
MacBook Air M1で70Bモデルを実行できますか?+
いいえ。700億パラメータのモデルは Q4 形式で約 40 GB の容量を必要とし、Air M1 の最大メモリ(16 GB)の倍以上です。非常に激しいクオンタ化を行っても、正しくロードされません。このマシンで現実的に扱えるサイズクラスは、80億〜120億パラメータ程度までです。
M1ではOllama、LM Studio、MLXのどれを選ぶべきですか?+
すぐに使い始めてスクリプトで操作したいならOllama、充実したグラフィカルインターフェースが好みならLM Studio、AppleのフレームワークをPythonから直接活用したいならMLXが適しています。メモリが8 GBの場合、グラフィカルインターフェースによる追加のメモリ消費は無視できません。まずはOllamaで始め、具体的な必要性が生じた場合にだけ切り替えてください。
MacBook Air M1でLLMを実行すると、かなり熱が発生しますか?+
ファンがないため、負荷が長く続くと発熱し、動作周波数を下げます。短いやり取りでは、その影響はほとんどありません。長時間の処理では、本体を少し高く設置し、AC 電源に接続して、小さめのモデルを選んでください。数時間にわたるタスクを実行するなら、ファン付きの Mac mini のほうが適しています。
Air M4に移行してローカルAIを実行する価値はあるか?+
メモリ容量が制約になっているなら、乗り換える価値があります。Air M4は最大32 GBのメモリを搭載でき、メモリ帯域幅は約68 GB/sから120 GB/sに増えます。テキスト用に40億〜80億パラメータのモデルを使い続けるなら、M1の16 GBモデルもまだ使えます。その場合、買い替えによる主な利点は使い勝手の向上です。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。