VRAM 8 GBで使えるLLMは? ?
VRAMが8 GBなら、Q4に量子化された80億〜90億パラメータのモデルを選び、コンテキストは数千トークン程度にしてください。候補はQwen 3.5 9B(重み6 GB)やGranite 4.2 8B(4.6 GB)です。12BのQ4はかろうじて収まりますが、14BはVRAMに収まりません。KVキャッシュとシステム用に約1 GBの余裕を残してください。
VRAM 8GBは、近年販売されているカードで最も一般的な容量です。本ガイドでは、何が収まるか、マージンをどのように計算するか、本当に8GBのカードはどれか、そして12GBや16GBにステップアップすべきタイミングについて説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
16GBのVRAMにアップグレードするには: RTX 5060 Ti 16GB (ASUS Prime).
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#VRAM 8 GB の場合:40 億から 90 億パラメータのモデル
VRAM が 8 GB の場合は、Qwen 3.5 9B(QuelLLM のカタログによると重みは 6 GB)や Granite 4.2 8B(4.6 GB)のような、80億~90億パラメータの Q4 量子化モデルを、数千トークンのコンテキストで使うのが適切です。120億パラメータの Q4 モデル(7 GB)はかろうじて収まる程度で、コンテキスト用の余裕がありません。140億パラメータ以上のモデルは容量を超えます。判断を左右するのはモデルの重みだけではありません。コンテキスト長に応じて増える KV キャッシュも加え、システムや画面表示用の領域も残す必要があります。
予算の計算は簡単です。モデルの重さに加え、KVキャッシュ、バッファおよび表示用のメモリを含め、合計で8GBを越えないようにする必要があります。9Bモデル(Q4、6GB)の場合、約1GBがコンテキストに残ります。一方、8Bの軽量モデルであるGranite 4.2 8B(4.6GB)の場合、2GB以上がコンテキストに残ります。したがって、モデルの選定とコンテキストサイズの決定は同時に考慮される必要があります。
| モデルと量子化 | モデル容量 | KV キャッシュとシステム用のメモリ余裕 | 判定 |
|---|---|---|---|
| Granite 4.2 8B Q4 | 4.6 GB | ≈ 3.4 GB | 快適に動作し、長いコンテキストも利用可能 |
| Granite 4.2 8B Q5 | 6 GB | ≈ 2 GB | 良いバランス |
| Qwen 3.5 9B Q4 | 6 GB | ≈ 2 GB | 一般用途での最適な選択 |
| Qwen 3.5 9B Q5 | 7 GB | 約 1 GB | 非常に短いコンテキスト |
| Gemma 4 12B Q4 | 7 GB | 約 1 GB | ぎりぎり収まるが、余裕なし |
| Qwen 3.5 4B Q4 | 2.3 GB | 約5.7 GB | 非常に大きなサイズで、小さなタスクに最適です |
これらのメモリの余裕量は目安です。実際のKVキャッシュのサイズはモデルのアーキテクチャとコンテキスト長によって異なります。最も確実に確認するには、モデルを起動して、ollama psとGPUの監視ツール(nvidia-smiまたはrocm-smi)を確認してください。
#8 GB を搭載したカードと、選ぶ際に落とし穴のあるカード
多くのシリーズには複数のメモリ容量のモデルがあり、名前だけでは判断できません。NVIDIAによると、RTX 3060には12 GB版と8 GB版、RTX 4060には8 GB版、RTX 4060 Tiには16 GB版と8 GB版、RTX 5060 Tiには16 GB版と8 GB版があり、RTX 5060は8 GBです。AMDのRX 9060 XTには8 GB版があり、帯域幅は16 GB版と同じ320 GB/sです。そのため、購入や比較の前には、必ず該当するモデルの仕様表でメモリ容量を確認してください。
- NVIDIA 8 GB
- RTX 4060、RTX 5060、RTX 3060・4060 Ti・5060 Tiの8 GB版、および旧世代のRTX 3070、3060 Ti、2060 Super。
- AMD 8 GB
- RX 9060 XT 8 GB、RX 7600、RX 6600 XT、RX 5700 XT
- 注意 : RX 7600 XT
- このカードのメモリ容量は8GBではなく16GBです。llama.cppの性能表にも、16GBのGDDR6を搭載していると記載されています。このガイドの以前の版では、誤って8GBに分類していました。
Macではユニファイドメモリをシステムと共有するため、8GBのMacBook Airでも8GBすべてをAIに使えるわけではありません。MacBook Air M1とM2の専用ガイドでは、実際に使えるメモリ量を詳しく説明しています。専用グラフィックカードがまったくない場合は、GPUなしでLLMを使うガイドで、RAM容量別にモデルを紹介しています。
#8GBでの期待される速度は?
テキスト生成では、トークンごとに重みのほぼすべてを読み取ります。最大速度は、メモリ帯域幅を重みのサイズで割った値です。RX 9060 XT 8 GB(AMDによると320 GB/s)の場合、理論上の上限は、Q4のQwen 3.5 9B(6 GB)で約53トークン/秒、Q4のGranite 4.2 8B(4.6 GB)で約70トークン/秒です。別のカードでは上限も変わります。実際の値は常にこれより低くなります。
GPUカードごとのトークン/秒は公開していません。生成速度はドライバー、ソフトウェア、コンテキストに左右され、これらのモデルをこれらのカードで測定した、引用可能な公開ベンチマークがないためです。Llama 2 7BをQ4_0で測定したllama.cppのコミュニティによる表は、旧世代の8 GBカードの目安になります。ROCm環境のRX 5700 XTでは、生成速度は67トークン/秒です。お使いのハードウェアでは実測してください。ollama runに--verboseオプションを付けると、生成速度が表示されます。
#8 GB環境で用途別に選ぶモデル
QuelLLMのカタログでは、用途ごとにメモリの余裕を残せるモデルを見つけられます。モデルが公表している最大コンテキスト長を、実際に使えるとは限りません。8 GBでは、実際に使える長さを制限するのは、カタログの数値ではなく、モデルの重みを読み込んだ後に残る空きメモリです。
| 用途 | モデル | Q4 の重み | 注記 |
|---|---|---|---|
| ディスカッションと執筆 | Qwen 3.5 9B | 6 GB | 公称コンテキスト長は262,000トークンですが、8 GBでは実際に使える長さはそれを大幅に下回ります |
| 一般的なタスク、十分な余裕 | Granite 4.2 8B | 4.6 GB | 公表されているコンテキスト長は128,000トークン。KVキャッシュ用の領域をより多く確保できます |
| コード補完 | Qwen 2.5 Coder 7B | 5 GB | 70億パラメータのコードモデル、公表されているコンテキスト長は131,072トークン |
| バックグラウンドでの小さなタスク | Qwen 3.5 4B | 2.3 GB | 他のツール用にVRAMの空きを残せます |
| 視覚とマルチモーダル | Gemma 4 12B | 7 GB | 画像・音声対応と表記されています。8 GBにはぎりぎり収まります。 |
補足しておきたい点が2つあります。visionと表示されたモデルは画像エンコーダー用に追加のメモリを消費するため、120億パラメータのマルチモーダルモデルをQ4で量子化しても、画像を読み込むとすぐに8 GBを超えてしまいます。一方、コーディングでは、70億パラメータの特化モデルをQ4で量子化したもの(5 GB)なら余裕を持って収まり、より大きな汎用モデルよりも速く応答します。この速度はインライン補完で重要です。
#8 GBを最大限に活用するための五つの設定
どの設定もVRAMの代わりにはなりませんが、上限を数百MBから1 GBほど引き上げられます。それだけで、コンテキスト長を4,000トークンから16,000トークンに増やすのに十分です。
- コンテキストを制限する
- ドキュメントによると、Ollamaのデフォルトのコンテキストウィンドウは4,096トークンで、OLLAMA_CONTEXT_LENGTHで変更できます。短いメッセージのやり取りなら、32,000トークンに設定しないでください。
- KVキャッシュの量子化
- OLLAMA_KV_CACHE_TYPE=q8_0 はデフォルトのf16と比較してキャッシュメモリをほぼ半分に抑え、Flash Attentionを必要とします。
- Flash Attentionに任せる
- バックエンドとGPUが対応している場合、Ollamaはこれを自動的に使用します。OLLAMA_FLASH_ATTENTION=1を設定して、使用を強制することもできます。
- GPUを解放
- ブラウザ、ゲーム、動画アプリは VRAM を消費します。モデルを読み込む前にこれらを閉じるか、内蔵 GPU がある場合はディスプレイをそちらに接続してください。
- 余裕に応じてQ4またはQ5を選ぶ
- 8 GBでは、Q4_K_Mが適切なデフォルトです。空き容量を1 GB超確保できる小さいモデルの場合に限り、Q5に切り替えてください。
#8GBでは実現できないこと:RAG、コード、大きなモデル
完全な RAG パイプラインは、埋め込みモデル、必要に応じてリランカー、そして回答を作成する LLM で構成されます。8 GB では、この構成全体を余裕を持って収めることはできません。生成モデルだけで 5〜6 GB を占めるためです。対策は二つあります。埋め込みモデルを CPU で実行する方法は、インデックス作成には十分実用的です。もう一つは、Qwen 3.5 4B の Q4(2.3 GB)のような小さな生成モデルを選ぶ方法です。インラインのコード補完には 70 億パラメータのモデルで十分ですが、大きなファイルを読み込むコードエージェントには、8 GB で扱える範囲を超えるコンテキストが必要です。
140億〜320億パラメータのモデルでは、メモリ容量を一段階上げる必要があります。当サイトの目安では、Q4でコンテキスト分を除くと、14Bは約9 GB、32Bは約19〜20 GBです。つまり、14Bが8 GBでは収まらなくなる実質的な境界であり、余裕を持って収められる12 GBの容量帯を選ぶ意義があります。極端なオフロードの工夫を当てにしないでください。モデルの半分をシステムRAMに置いても動作はしますが、読み取り速度が遅く、対話的な利用をためらうほどになります。
#12GBまたは16GBに切り替える時期はいつですか
| 段階 | 実現可能なこと | Guide |
|---|---|---|
| 12 GB | Gemma 4 12BのQ8版、Qwen 3.5 9BのQ8版、より軽量なRAG | VRAM 12 GB 向けの LLM はどれ? |
| 16 GB | Q4量子化の200億〜240億パラメータモデル(gpt-oss 20B、Mistral Small 24B)を、多少のコンテキストを確保して使用 | 16 GB の VRAM ではどの LLM を選ぶべき? |
| 24 GB | 長いコンテキストを使用する、270億パラメータのQ4量子化済み密モデル | VRAM 24 GBで使えるLLMはどれ? |
購入の適切な基準は、VRAMのギガバイト単価であり、カードの価格ではありません。当サイトの価格追跡機能は、各カードについてこれを計算し、週2回更新しています。決定前に必ずご確認ください。新品と中古の価格差は頻繁に変動するためです。
- VRAM 12 GB 向けの LLM はどれ?
- 16 GB の VRAM ではどの LLM を選ぶべき?
- KV キャッシュの量子化で VRAM を節約
- 量子化の選択(Q4、Q5、Q8、FP16)
- GPUなしでローカルLLM:RAM容量別のモデル
- ローカルAI向けグラフィックカードの価格
- ソース:OllamaのFAQ(コンテキスト、KVキャッシュ、Flash Attention)
- 出典:NVIDIAのRTX 5060シリーズ製品情報
- 出典:AMDのRX 9060 XT 8 GBスペックシート
- QuelLLMのモデルカタログ(VRAM上のサイズ)
#よくある質問
8GBのVRAMで利用可能な最適なLLMはどれですか?+
8GBで14Bモデルを実行可能ですか?+
モデル全体が自分のVRAMに収まるかどうかは、どう確認すればよいですか?+
RX 7600 XTのメモリ容量は8 GBですか?+
8GBのメモリでLLMを活用してアプリケーションを開発することは可能でしょうか?+
8GB の Mac は、8GB の VRAM を持つ PC と同等ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。