MacBook Air M1(8GB/16GB)で使えるLLMは? ?
MacBook Air M1 は、8 GB で 3B〜4B パラメータのモデル、16 GB で 8B〜9B パラメータのモデルを Q4_K_M 量子化で動作させます。制約は計算性能ではなく、統一メモリ(8 GB または 16 GB、拡張不可)と約 68 GB/s のメモリ帯域幅であり、8B モデルの出力速度は 1 秒あたり約 12 トークンに制限されます。
MacBook Air M1は、適切な規模のモデルを選べば、今でもローカルAIを始めるための手堅い選択肢です。このページでは、メモリ容量に応じて何を選ぶべきかを示し、このマシンが物理的に達成できる最高速度を計算し、別の選択肢に移るべきタイミングを示します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: MacBook Pro M5 Pro — 24 GB / 1 TB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#MacBook Air M1:LLMの実行で実際にできること
ローカルLLMにとって、MacBook Air M1は3つの数値に集約されます。統合メモリ(標準8 GB、オプション16 GB、購入後は拡張不可)、メモリ帯域幅(約68 GB/s)、そしてファンなし設計です。メモリは読み込めるものを決定し、帯域幅は生成速度を決定し、パッシブ冷却は、その速度が持続する時間を決定します。
- チップ
- Apple M1(2020):Appleの技術仕様によると、CPUは8コア(高性能コア4基、高効率コア4基)、GPUは構成に応じて7コアまたは8コア、Neural Engineは16コアです。
- メモリ
- ユニファイドメモリは8 GBで、16 GB構成も選択できます。CPUとGPUは同じメモリ領域を共有するため、別途容量を足し合わせられる独立したVRAMはありません。
- 帯域幅
- Apple はM1の仕様にその情報を掲載していません。一方でM2に関しては100GB/sと発表しており、M1に対して50%多いとされ、M1は通常67〜68GB/sとされる値(LPDDR4X)に相当します。
- 冷却
- ファンはありません。Apple は MacBook Air M1 を、どのような作業でも完全に静かだと紹介しています。その代わり、放熱面での制約があります。詳しくは後述します。
- バッテリー
- バッテリー容量は49.9 Wh。推論を継続して実行すると、Appleが公称15時間の根拠としているウェブ閲覧よりも、はるかに速くバッテリーを使い切ります。
このマシンは、Appleでは新品の販売が終了してからかなりの年月が経っています。中古で入手できますが、価格の変動が大きすぎるため、ここには掲載していません。中古のAirとより新しいマシンのどちらにするか迷っている場合は、当サイトのハードウェアページ(/materiel-ia)で現在の目安を確認できます。2020年のMac miniは同じM1チップを搭載し、メモリ容量と帯域幅の上限も同じです。ファンが追加されているため、継続的な動作速度がより安定します。
#8 GBか16 GBか:RAM容量でできること・できないこと
あなたのMacでローカルAIを最大限に活用:ユニファイドメモリ、MLXとGGUFの比較、お使いのチップに合ったモデル、Apple Silicon向けに調整済みのOllamaとLM Studio。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
8GB構成では、システム、ブラウザ、使用中のアプリケーションが、モデルと同じメモリをすでに共有しています。LLMに使えるのは、コンテキストを含めて約4〜5GBです。これは常識的な見積もりであり、実測値ではありません。macOSが自身のメモリ使用量を調整するためです。16GB構成では使えるメモリが約10〜11GBに増え、80〜90億パラメータのモデルも選択肢に入ります。
| モデル | Q4 での重み | Air M1 8 GB | Air M1 16 GB |
|---|---|---|---|
| 3B (Granite 4.1 3B, Llama 3.2 3B) | ≈ 2 から 2.5 GB | 快適 | 快適 |
| 4B(Qwen 3.5 4B、Phi-4 mini) | ≈ 2.5〜3GB | 短いコンテキストなら快適 | 快適で、長いコンテキストをサポート |
| 7-9B (Granite 4.1 8B, Qwen 3.5 9B) | 約 5 〜 6GB | 容量が厳しい:スワップが発生する可能性が高い | 良いバランス |
| 12B (Gemma 4 12B) | ≈ 7 〜 8 GB | いいえ | 制限:短いコンテキストのみ |
| 24B以上 | ≥ 14 GB | いいえ | いいえ |
最後の行の順位は速度ではなく、超えられない容量の上限で決まります。システムが読み込まれると、14 GBのモデルは16 GBのメモリに収まりません。モデルの正確なサイズが分からない場合は、本サイトのVRAM計算ツールで、量子化とコンテキストに応じたメモリ使用量を確認できます。
#用途に応じたモデルの選び方
M1 では、モデルのブランドではなくサイズで判断します。8 GB の場合、Q4_K_M の 3B または 4B を目指してください:テキスト要約、リライト、抜粋に対する質問応答、シンプルなコード。16 GB の場合、8B から 9B パラメータのモデルは、長い指示に対する正確性と安定性に明確な向上をもたらしますが、生成速度が遅くなるという代償があります。モデル名は毎月変化します:重要なのはサイズクラスを把握し、現在の状態についてはサイトのカタログを確認することです。
- 執筆、要約、翻訳
- 8 GBでは4B、16 GBでは8〜9Bのモデル。フランス語の文章作成の品質は、モデルのサイズよりもモデルファミリーに大きく左右されます。自分の文章で2つの候補を試してください。
- コード
- 4Bモデルで短い関数や説明には十分対応できます。ただし、プロジェクト全体を扱う場合は、Air M1のメモリ容量によりコンテキストを短くする必要があるため、ローカルのコードアシスタントでできることは限られます。
- ドキュメントとRAG
- 軽量な埋め込みモデルと、4B(8 GB)または 8〜9B(16 GB)の生成モデルを組み合わせます。入力に加えるコンテキストはメモリを消費するため、関連箇所を厳選し、数を少なくしてください。
- ビジョン
- マルチモーダルモデルでは、モデル本体に加えて画像エンコーダの分もメモリを使用します。8 GBの環境では小型のモデルに限定してください。16 GBの環境では動作しますが、速度は遅くなります。
#毎秒何トークンか:理論上の上限
生成中、プロセッサはトークンを生成するたびに、モデルのアクティブな重みのほぼすべてを読み直します。そのため、最大速度の上限は、帯域幅を重みのサイズで割った値になります。帯域幅が約68 GB/sのM1では、GPUコアの数にかかわらず、重みのサイズが5 GBのモデルは約13トークン/秒を超えられません。これは計算上の上限であり、実測値ではありません。計算処理、KVキャッシュ、システムも帯域幅を消費するため、実際の速度はさらに低くなります。
| モデル | Q4 での重み | 計算 | 上限 |
|---|---|---|---|
| 3B | ≈ 2 GB | 68 ÷ 2 | ≈ 34 tok/s |
| 4B | ≈ 2.5〜3GB | 68 ÷ 2,5 à 3 | 約 23 〜 27 tok/s |
| 8B | ≈ 5 GB | 68 ÷ 5 | ≈ 13 tok/s |
| 9B | ≈ 6 GB | 68 ÷ 6 | ≈ 11 tok/s |
| 12B | ≈7.5GB | 68 ÷ 7,5 | ≈9 tok/s |
この計算はフィルタとして機能します。M1上でQ4の80億パラメータモデルで1秒あたり30トークンを超えるという主張は、帯域幅と物理的に矛盾します。一部のエキスパートのみがアクティブになるエキスパート混合モデルの場合を除きます。実際の測定値については、サイトの/benchmarksページとサードパーティが公開したベンチマークを参照し、使用されたチップ、量子化、エンジンを確認してください。
#数分でインストールおよび確認
Ollama は最も簡単な方法です。実行エンジンのインストール、モデルのダウンロード、MacのGPUの検出を、設定なしで行います。macOSでは、モデルは ~/.ollama/models に保存されます。モデルごとに数ギガバイトの容量が必要なので、256 GBのSSDを使っている場合は、その点に注意してください。
- 01Ollama のインストールollama.comからアプリをダウンロードするか、以下のコマンドでHomebrew経由でインストールしてください。当サイトのmacOSインストールガイドでは、自動起動について詳しく説明しています。
- 02RAMに適したモデルを起動する8GBの場合4Bモデル、16GBの場合8-9Bモデル。最初の起動ではモデルがダウンロードされ、以降の起動は即時になります。
- 03GPUが使われていることを確認する別のターミナルでollama psを実行してください。PROCESSOR列が100%GPUを示す必要があります。CPU/GPUの割合が見られる場合、モデルがGPUの割り当てメモリを超過していることを示します。
- 04コンテキストの固定Ollamaは利用可能なメモリに応じてデフォルトのコンテキストサイズを選びます。24 GB未満の場合は4,000トークンです。増やすのは必要な場合だけにしてください。コンテキストの各トークンがメモリを消費します。
LM Studioは、充実したグラフィカルインターフェースを備えた代替手段で、ターミナルが苦手な場合に便利です。Ollama単体よりもメモリを少し多く消費するため、メモリが8 GBの場合はこの差が重要になります。AppleのフレームワークであるMLXは、CPUとGPUの間でコピーすることなくMacの共有メモリを活用します。MLXとllama.cppの設定については、macOS最適化ガイドで扱っています。
#長いコンテキスト、8GBの罠
モデルのサイズはメモリの一部にすぎません。各コンテキストトークンに対してKVキャッシュにエントリが追加され、会話の長さとともに増大します。Ollamaは、エンジンおよびハードウェアが許容する場合、自動的にFlash注意を活用し、この増大を抑制します。また、KVキャッシュの量子化を変数OLLAMA_KV_CACHE_TYPEで制御しており、デフォルトはf16です。8GBのAir M1上で、このオプションは4,000トークンのコンテキストと8,000トークンのコンテキストの差を生み出し、精度のわずかな損失を伴います。
KVキャッシュの量子化に関するガイドでは、このオプションを使う価値があるのはどのような場合かを説明しています。実用上の目安として、8 GBではコンテキストを短く保ち、役立つ箇所だけを入力に含めてください。16 GBでは、8–9Bのモデルでも8,000トークンのコンテキストは無理のない範囲です。
#ファンレスのAirの発熱
ファンレスのMacBook Air M1は、筐体を通じて熱を放散します。短時間の使用(質問と回答)では、問題はありません。しかし、数十分間のバッチ処理やドキュメントのインデックス作成のような継続的な使用では、チップは自己保護のために周波数を低下させます:マシンが停止することなく、速度が低下します。このページでは、分や度でのしきい値を一切提示していません:それは部屋や負荷によって異なり、信頼できるソースがそれを固定しているわけではありません。
- パソコンを少し高い位置に置く
- パソコンスタンドを使うと、筐体の下の空気の流れが改善されます。
- 重いアプリケーションを閉じる
- 負荷の高いブラウザやビデオ会議アプリは、同時にCPUリソースを使用し、同じチップの温度を上げます。
- Q8を使うよりも小さいモデルを選ぶ
- 再読み込みするメモリが減り、トークンあたりの消費エネルギーも減ります。
- 長時間のタスクでは電源に接続する
- バッテリー使用時、macOSはパフォーマンスをより強く制限することがあります。これはエネルギーモードの設定によるものです。
#限界と、別のマシンへの移行を考える目安
M1が候補から外れる理由は、古さではなくメモリ容量です。ほかの選択肢を検討すべきかどうかの判断基準は、シンプルで測定可能です。
- 12Bを超えるモデルを使いたい
- M1 Airの構成にはこのモデルが快適に収まらないため、MacBook Air M4(32GBまで)またはMacBook Pro Pro/Maxをご検討ください。
- 大きなドキュメントを扱っています
- 長いコンテキストでは、計算能力が限界に達する前にメモリがいっぱいになります。RAMを増やすことが唯一の根本的な解決策です。
- 数時間にわたる処理を実行する場合
- ファンを搭載したMac miniやデスクトップPCのほうが、持続的な負荷に強いです。
- ファインチューニングに興味がある場合
- Air M1はこれに必要な性能を備えていません。必要なときだけクラウドサービスを利用することをおすすめします。
| 基準 | MacBook Air M1 | MacBook Air M2 | MacBook Air M4 |
|---|---|---|---|
| 最大メモリ | 16 GB | 24 GB | 32 GB |
| 帯域幅 | ≈ 68 GB/s | 100 GB/s | 120 GB/s |
| Q4で快適に動作するモデル | 8-9B | 8~9B、24 GB構成なら14B | 32 GBで14B、24B |
- MacBook Air M2:24GBと100GB/sの帯域幅
- MacBook Air M4:最大32GBのメモリ
- macOSにOllamaをインストールする手順
- KVキャッシュを量子化してメモリを節約
- 8 GBのメモリに適したLLMは?
- サイトのVRAM計算ツール
- 出典:AppleのMacBook Air M1技術仕様
- 出典:Apple、M2チップの発表(帯域幅)
- 情報源:Ollamaのドキュメント、コンテキスト長
- 出典:OllamaのFAQ(GPU、KVキャッシュ、Flash Attention)
#よくある質問
8GBのMacBook Air M1は、ローカルLLMの利用に十分ですか?+
MacBook Air M1で8BのLLMを動かす場合、どのくらいの速度が期待できますか?+
MacBook Air M1で70Bモデルを実行できますか?+
M1ではOllama、LM Studio、MLXのどれを選ぶべきですか?+
MacBook Air M1でLLMを実行すると、かなり熱が発生しますか?+
Air M4に移行してローカルAIを実行する価値はあるか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。