初心者 11 分VRAM別

VRAM 8 GBで使えるLLMは? ?

端的な回答

VRAMが8 GBなら、Q4に量子化された80億〜90億パラメータのモデルを選び、コンテキストは数千トークン程度にしてください。候補はQwen 3.5 9B(重み6 GB)やGranite 4.2 8B(4.6 GB)です。12BのQ4はかろうじて収まりますが、14BはVRAMに収まりません。KVキャッシュとシステム用に約1 GBの余裕を残してください。

VRAM 8GBは、近年販売されているカードで最も一般的な容量です。本ガイドでは、何が収まるか、マージンをどのように計算するか、本当に8GBのカードはどれか、そして12GBや16GBにステップアップすべきタイミングについて説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

16GBのVRAMにアップグレードするには: RTX 5060 Ti 16GB (ASUS Prime).

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#VRAM 8 GB の場合:40 億から 90 億パラメータのモデル

VRAM が 8 GB の場合は、Qwen 3.5 9B(QuelLLM のカタログによると重みは 6 GB)や Granite 4.2 8B(4.6 GB)のような、80億~90億パラメータの Q4 量子化モデルを、数千トークンのコンテキストで使うのが適切です。120億パラメータの Q4 モデル(7 GB)はかろうじて収まる程度で、コンテキスト用の余裕がありません。140億パラメータ以上のモデルは容量を超えます。判断を左右するのはモデルの重みだけではありません。コンテキスト長に応じて増える KV キャッシュも加え、システムや画面表示用の領域も残す必要があります。

予算の計算は簡単です。モデルの重さに加え、KVキャッシュ、バッファおよび表示用のメモリを含め、合計で8GBを越えないようにする必要があります。9Bモデル(Q4、6GB)の場合、約1GBがコンテキストに残ります。一方、8Bの軽量モデルであるGranite 4.2 8B(4.6GB)の場合、2GB以上がコンテキストに残ります。したがって、モデルの選定とコンテキストサイズの決定は同時に考慮される必要があります。

8 GBでのメモリ配分(モデルの重み:QuelLLMカタログの値)
モデルと量子化モデル容量KV キャッシュとシステム用のメモリ余裕判定
Granite 4.2 8B Q44.6 GB≈ 3.4 GB快適に動作し、長いコンテキストも利用可能
Granite 4.2 8B Q56 GB≈ 2 GB良いバランス
Qwen 3.5 9B Q46 GB≈ 2 GB一般用途での最適な選択
Qwen 3.5 9B Q57 GB約 1 GB非常に短いコンテキスト
Gemma 4 12B Q47 GB約 1 GBぎりぎり収まるが、余裕なし
Qwen 3.5 4B Q42.3 GB約5.7 GB非常に大きなサイズで、小さなタスクに最適です

これらのメモリの余裕量は目安です。実際のKVキャッシュのサイズはモデルのアーキテクチャとコンテキスト長によって異なります。最も確実に確認するには、モデルを起動して、ollama psとGPUの監視ツール(nvidia-smiまたはrocm-smi)を確認してください。

i
サイズに関する修正
このガイドの以前のバージョンでは、Q4でQwen 3.5 9Bが6.6 GB、Gemma 4 12Bが7.6 GBと記載されていました。QuelLLMのカタログでは6 GBと7 GBとされています。これらの値は丸められています。計算した値に対して常に1 GBの余裕を持たせてください。

#8 GB を搭載したカードと、選ぶ際に落とし穴のあるカード

多くのシリーズには複数のメモリ容量のモデルがあり、名前だけでは判断できません。NVIDIAによると、RTX 3060には12 GB版と8 GB版、RTX 4060には8 GB版、RTX 4060 Tiには16 GB版と8 GB版、RTX 5060 Tiには16 GB版と8 GB版があり、RTX 5060は8 GBです。AMDのRX 9060 XTには8 GB版があり、帯域幅は16 GB版と同じ320 GB/sです。そのため、購入や比較の前には、必ず該当するモデルの仕様表でメモリ容量を確認してください。

NVIDIA 8 GB
RTX 4060、RTX 5060、RTX 3060・4060 Ti・5060 Tiの8 GB版、および旧世代のRTX 3070、3060 Ti、2060 Super。
AMD 8 GB
RX 9060 XT 8 GB、RX 7600、RX 6600 XT、RX 5700 XT
注意 : RX 7600 XT
このカードのメモリ容量は8GBではなく16GBです。llama.cppの性能表にも、16GBのGDDR6を搭載していると記載されています。このガイドの以前の版では、誤って8GBに分類していました。

Macではユニファイドメモリをシステムと共有するため、8GBのMacBook Airでも8GBすべてをAIに使えるわけではありません。MacBook Air M1とM2の専用ガイドでは、実際に使えるメモリ量を詳しく説明しています。専用グラフィックカードがまったくない場合は、GPUなしでLLMを使うガイドで、RAM容量別にモデルを紹介しています。

#8GBでの期待される速度は?

テキスト生成では、トークンごとに重みのほぼすべてを読み取ります。最大速度は、メモリ帯域幅を重みのサイズで割った値です。RX 9060 XT 8 GB(AMDによると320 GB/s)の場合、理論上の上限は、Q4のQwen 3.5 9B(6 GB)で約53トークン/秒、Q4のGranite 4.2 8B(4.6 GB)で約70トークン/秒です。別のカードでは上限も変わります。実際の値は常にこれより低くなります。

GPUカードごとのトークン/秒は公開していません。生成速度はドライバー、ソフトウェア、コンテキストに左右され、これらのモデルをこれらのカードで測定した、引用可能な公開ベンチマークがないためです。Llama 2 7BをQ4_0で測定したllama.cppのコミュニティによる表は、旧世代の8 GBカードの目安になります。ROCm環境のRX 5700 XTでは、生成速度は67トークン/秒です。お使いのハードウェアでは実測してください。ollama runに--verboseオプションを付けると、生成速度が表示されます。

自分の環境での処理速度を測定する
ollama run <nom-du-modèle> --verbose
!
モデルがVRAMに収まらなくなると、速度が低下する
モデルの一部がVRAMに収まらない場合、Ollamaはその部分をRAMとプロセッサに移します。その結果、生成速度はRAMの速度に制限され、通常は数倍遅くなります。ollama psでメモリの割り当てを確認できます。GPUへの割り当てを100%にするのが目標です。

#8 GB環境で用途別に選ぶモデル

QuelLLMのカタログでは、用途ごとにメモリの余裕を残せるモデルを見つけられます。モデルが公表している最大コンテキスト長を、実際に使えるとは限りません。8 GBでは、実際に使える長さを制限するのは、カタログの数値ではなく、モデルの重みを読み込んだ後に残る空きメモリです。

用途別の出発点(QuelLLMカタログ)
用途モデルQ4 の重み注記
ディスカッションと執筆Qwen 3.5 9B6 GB公称コンテキスト長は262,000トークンですが、8 GBでは実際に使える長さはそれを大幅に下回ります
一般的なタスク、十分な余裕Granite 4.2 8B4.6 GB公表されているコンテキスト長は128,000トークン。KVキャッシュ用の領域をより多く確保できます
コード補完Qwen 2.5 Coder 7B5 GB70億パラメータのコードモデル、公表されているコンテキスト長は131,072トークン
バックグラウンドでの小さなタスクQwen 3.5 4B2.3 GB他のツール用にVRAMの空きを残せます
視覚とマルチモーダルGemma 4 12B7 GB画像・音声対応と表記されています。8 GBにはぎりぎり収まります。

補足しておきたい点が2つあります。visionと表示されたモデルは画像エンコーダー用に追加のメモリを消費するため、120億パラメータのマルチモーダルモデルをQ4で量子化しても、画像を読み込むとすぐに8 GBを超えてしまいます。一方、コーディングでは、70億パラメータの特化モデルをQ4で量子化したもの(5 GB)なら余裕を持って収まり、より大きな汎用モデルよりも速く応答します。この速度はインライン補完で重要です。

#8 GBを最大限に活用するための五つの設定

どの設定もVRAMの代わりにはなりませんが、上限を数百MBから1 GBほど引き上げられます。それだけで、コンテキスト長を4,000トークンから16,000トークンに増やすのに十分です。

コンテキストを制限する
ドキュメントによると、Ollamaのデフォルトのコンテキストウィンドウは4,096トークンで、OLLAMA_CONTEXT_LENGTHで変更できます。短いメッセージのやり取りなら、32,000トークンに設定しないでください。
KVキャッシュの量子化
OLLAMA_KV_CACHE_TYPE=q8_0 はデフォルトのf16と比較してキャッシュメモリをほぼ半分に抑え、Flash Attentionを必要とします。
Flash Attentionに任せる
バックエンドとGPUが対応している場合、Ollamaはこれを自動的に使用します。OLLAMA_FLASH_ATTENTION=1を設定して、使用を強制することもできます。
GPUを解放
ブラウザ、ゲーム、動画アプリは VRAM を消費します。モデルを読み込む前にこれらを閉じるか、内蔵 GPU がある場合はディスプレイをそちらに接続してください。
余裕に応じてQ4またはQ5を選ぶ
8 GBでは、Q4_K_Mが適切なデフォルトです。空き容量を1 GB超確保できる小さいモデルの場合に限り、Q5に切り替えてください。
量子化済みKVキャッシュを使うOllama
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=8192 ollama serve

#8GBでは実現できないこと:RAG、コード、大きなモデル

完全な RAG パイプラインは、埋め込みモデル、必要に応じてリランカー、そして回答を作成する LLM で構成されます。8 GB では、この構成全体を余裕を持って収めることはできません。生成モデルだけで 5〜6 GB を占めるためです。対策は二つあります。埋め込みモデルを CPU で実行する方法は、インデックス作成には十分実用的です。もう一つは、Qwen 3.5 4B の Q4(2.3 GB)のような小さな生成モデルを選ぶ方法です。インラインのコード補完には 70 億パラメータのモデルで十分ですが、大きなファイルを読み込むコードエージェントには、8 GB で扱える範囲を超えるコンテキストが必要です。

140億〜320億パラメータのモデルでは、メモリ容量を一段階上げる必要があります。当サイトの目安では、Q4でコンテキスト分を除くと、14Bは約9 GB、32Bは約19〜20 GBです。つまり、14Bが8 GBでは収まらなくなる実質的な境界であり、余裕を持って収められる12 GBの容量帯を選ぶ意義があります。極端なオフロードの工夫を当てにしないでください。モデルの半分をシステムRAMに置いても動作はしますが、読み取り速度が遅く、対話的な利用をためらうほどになります。

#12GBまたは16GBに切り替える時期はいつですか

容量を増やすと何ができるようになるか
段階実現可能なことGuide
12 GBGemma 4 12BのQ8版、Qwen 3.5 9BのQ8版、より軽量なRAGVRAM 12 GB 向けの LLM はどれ?
16 GBQ4量子化の200億〜240億パラメータモデル(gpt-oss 20B、Mistral Small 24B)を、多少のコンテキストを確保して使用16 GB の VRAM ではどの LLM を選ぶべき?
24 GB長いコンテキストを使用する、270億パラメータのQ4量子化済み密モデルVRAM 24 GBで使えるLLMはどれ?

購入の適切な基準は、VRAMのギガバイト単価であり、カードの価格ではありません。当サイトの価格追跡機能は、各カードについてこれを計算し、週2回更新しています。決定前に必ずご確認ください。新品と中古の価格差は頻繁に変動するためです。

#よくある質問

よくある質問
8GBのVRAMで利用可能な最適なLLMはどれですか?+
Qwen 3.5 9BのQ4は、QuelLLMカタログによると重みのサイズが約6GBで、数千トークンのコンテキストで使う場合に最適な汎用モデルです。Granite 4.2 8BのQ4(4.6GB)は、長いコンテキストに使えるメモリの余裕がより大きくなります。コード補完には、70億パラメータの特化モデルで十分です。
8GBで14Bモデルを実行可能ですか?+
快適ではありません。サイトのルールによると、14BモデルのQ4量子化サイズは約9 GBで、GPUの容量を超えています。一部がCPUにオフロードされ、速度が大幅に低下します。Gemma 4 12BのQ4(7 GB)はギリギリ収まりますが、コンテキストに余裕がありません。9Bモデルをおすすめします。
モデル全体が自分のVRAMに収まるかどうかは、どう確認すればよいですか?+
応答の生成を開始してから、ollama ps を実行してください。PROCESSOR 列にはGPUとCPUへの処理の割り当てが表示されます。目標は100 % GPUです。一部がCPUに割り当てられている場合は、コンテキストを縮小する、OLLAMA_KV_CACHE_TYPE でKVキャッシュを量子化する、またはより小さいモデルを選ぶといった対策を取ってください。
RX 7600 XTのメモリ容量は8 GBですか?+
いいえ、llama.cpp の性能表に示されているとおり、16 GB の GDDR6 を搭載しています。通常の RX 7600 は 8 GB なので、よくある誤解です。モデルごとの正確なメモリ容量を必ず確認してください。RTX 5060 Ti や RX 9060 XT など、8 GB 版と 16 GB 版の両方があるシリーズは複数あります。
8GBのメモリでLLMを活用してアプリケーションを開発することは可能でしょうか?+
8Bモデルを使ってチャットや情報抽出のアプリケーションを試作するなら、十分です。しかし、エンベッダー、リランカー、140億パラメータのモデルを使う本番用RAGには足りません。12〜16 GBを目安にしてください。エンベッダーをCPUで実行して、LLM用のVRAMを空けることもできます。
8GB の Mac は、8GB の VRAM を持つ PC と同等ですか?+
いいえ。Macのメモリはユニファイドメモリで、システムやアプリケーションと共有されるため、モデルが実際に使える容量は8 GB未満です。専用グラフィックスカードを搭載したPCでは、8 GBのVRAMがGPU専用なので、モデルに使える容量がより多くなります。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。