RTX 3060 8GBで使うLLMはどれ? ?
RTX 3060 8 GBは、Granite 4.2 8B(4.6 GB)や Qwen 3.5 9B(6 GB)のように、Q4で7〜9Bのモデルを実行できますが、12Bは実行できません。その特徴は、128ビットバスと240 GB/sの帯域幅であり、3060 12 GBの192ビットと360 GB/sと比較して、生成速度がはるかに遅くなります。llama.cppの公開テーブルでは、7Bモデルで12 GB版が75.6 tokens/sとされています。
RTX 3060という名称の下で、NVIDIAは2つのカードを販売しました。元の12 GB版と、2022年末に登場した8 GB版です。後者はメモリバスが狭くなっています。このガイドでは、ローカルAIにおいてそれが何を意味するのか、8 GBにどのモデルが収まるのか、購入時に2つのバージョンを混同しないための方法、そして期待できる速度(測定されたものと測定されていないものを含む)について説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16 GB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#RTX 3060 8GB:12GBモデルと比べてどのような違いがありますか?
RTX 3060 8 GBでは、Q4量子化した70億~90億パラメータのモデルを動かせます。QuelLLMのカタログによると、Granite 4.2 8Bには4.6 GB、Qwen 3.5 9Bには6 GBが必要です。Gemma 4 12B(Q4で7 GB)は、余裕を持って収まるとはいえません。3060 12 GBとの違いは二つあります。メモリが4 GB少ないことと、バス幅が192ビットではなく128ビットであることです。発売時に仕様を確認した専門メディアによると、バス幅が狭いため帯域幅は240 GB/sとなり、12 GBモデルの360 GB/sより33%低くなります。テキスト生成は主にメモリ帯域幅に依存するため、ローカルAIではこの差が重要です。8 GBモデルの公開測定値はありませんが、Q4_0の70億パラメータモデルでは約50トークン/秒で生成すると推定できます。一方、12 GBモデルでの実測値は75.6トークン/秒です。
- チップ
- 3060 12 GBと同じGA106チップを搭載し、カードの消費電力も同じ170 Wです。
- メモリ
- GDDR6メモリ8GB、128ビットバス、帯域幅240GB/s。比較対象はメモリ12GB、192ビットバス、帯域幅360GB/sです。
- 結果
- 演算コア数は同じでも、メモリ容量と帯域幅は小さくなります。ローカルAIの制約となるのは、演算能力ではなくメモリです。
#8GBに対応するモデル
| モデル | Q4 での重み | Q8でのモデルサイズ | 8GBでの動作 |
|---|---|---|---|
| Qwen 3.5 4B | 2.3 GB | 4.3 GB | Q8 が可能で、コンテキスト長にも余裕があります |
| Granite 4.2 8B | 4.6 GB | 9 GB | Q4なら快適に動作しますが、Q8はメモリに収まりません |
| Qwen 3.5 9B | 6 GB | 10 GB | Q4、コンテキスト長は控えめに |
| Gemma 4 12B | 7 GB | 13 GB | コンテキストを含めるとメモリに収まらない |
容量は、より高速な8 GBの2つのカードである3070や3060 Tiと同等です。同じルールが適用されます:重みは最大6 GBを目標とし、ドライバーとコンテキスト用に1 GBを確保し、モデルが完全にカード内に収まっていることを確認してください。そのために、ollama psコマンドを実行すると、すべてがカードにロードされている場合、100% GPUと表示されます。CPUのパーセンテージが表示される場合、モデルがオーバーフローしており、速度が急落します。
#速度:メモリバスが決定的な役割を果たす理由
llama.cppの共同作成の比較表(Llama 2 7BのQ4_0、ファイルサイズ3.56 GiB)には3060 8 GBは載っていませんが、メモリバスによって何が変わるかを理解するのに役立ちます。表に示されている速度は、3060 12 GB(192ビットバス)が75.6トークン/秒、3060 Ti 8 GB(256ビットバス)が92.2トークン/秒、バス幅がわずか128ビットのRTX 4060 Ti 8 GBが63.9トークン/秒です。容量が同じなら、多少の例外はあるものの、速度の順位はバス幅に沿います。つまり、バス幅の狭い新しいカードが、バス幅の広い古いカードより遅くなることがあります。
| カード | メモリ | バス | 生成速度 (tok/s) | ステータス |
|---|---|---|---|---|
| RTX 3060 Ti | 8 GB | 256ビット | 92,2 | 公開された測定値 |
| RTX 3060 12 GB | 12 GB | 192 ビット | 75,6 | 公開された測定値 |
| RTX 4060 Ti 8 GB | 8 GB | 128 ビット | 63,9 | 公開された測定値 |
| RTX 3060 8 GB | 8 GB | 128 ビット | 約47から50 | 推定値であり、実測値ではありません |
最終行の推定では、12 GBカードで測定した理論帯域幅の約80%という効率を240 GB/sに適用しています。これは推定値として示してください。ファイルサイズに基づく比例計算では、Granite 4.2 8B(4.6 GB)が約40 tokens/s、Qwen 3.5 9B(6 GB)が約30 tokens/sとなりますが、いずれも理論上の上限値です。この速度なら会話で読むことができますが、8 GB版は12 GB版より約3分の1低速で、3060 Tiより40%を超えて低速です。
#避けるべき落とし穴
- 同じ名前で2種類のカード
- NVIDIA は RTX 3060 の仕様として、メモリ容量12 GB または8 GB、バス幅192ビットまたは128ビットを掲載しています。名前だけでは容量は分かりません。販売情報に容量が明記されていることを必ず確認してください。
- インストール時の検証
- nvidia-smi を実行すると、12GBはllama.cppの測定値で約12,287 MiB、8GBは約7,800 MiB(3060 Tiと類似)と表示されます
- 価格は12GBモデルと同等です。
- 一部の販売店では、両バージョンを同じ価格で掲載しています。固定された価格ではなく、当サイトの毎週の価格追跡情報を使って比較してください。
- 12B モデルへの非現実的な期待
- Gemma 4 12Bや同規模のモデルは、コンテキストを含めるとVRAMに収まりません。Q4での上限は9Bです。
2つ目の確認は、譲り受けたPCなどにも当てはまります。メーカーの説明やWindowsに表示されるグラフィックカード名だけでは、バージョンを区別できないことがありますが、nvidia-smiが返す総メモリ容量なら確実に判断できます。
#推定値の根拠となる計算
原理はシンプルです。トークンを生成するために、カードはモデルの重みの大部分を再読み込みします。したがって、1秒あたりの最大トークン数は、帯域幅をファイルサイズで割った値のオーダーになります。テストファイルの重さは3.56 GiBで、約3.82 GBに相当します。3060 12 GBの場合、360 GB/sを3.82で割ると上限は1秒あたり94トークンとなり、公開されている測定値はこの80%に達しています。8 GBの場合、240 GB/sでは上限は約1秒あたり63トークンです。同じ効率を適用すると、約50トークンになります。
| カード | 帯域幅 | 上限(GB/s ÷ 3.82 GB) | 結果 |
|---|---|---|---|
| RTX 3060 12 GB | 360 GB/s | 約94トークン/秒 | 75.6 tok/s を測定(約80%) |
| RTX 3060 8 GB | 240 GB/s | 約63トークン/秒 | 約50 tok/sと推定 |
この方法には限界があります。効率はカードごとに異なり、同じ表のほかのカードでも、上限値に対する実測値の比率は67%〜85%となっています。そのため、単一の正確な数値ではなく、幅のある目安として捉えてください。また、同じチップを搭載していても、公表された結果はドライバー、システム、カードのメーカーによって変わります。速度が購入の判断を左右する場合は、自分の機材で測定してください。
#実際に使ってみるとどうか
スループットを待ち時間に換算してみましょう。毎秒約40トークンなら、500トークン(説明文1ページ分)の回答に約12秒かかります。3060 12 GBでは同じ回答に約8秒かかりますが、どちらも理論上の推定値です。会話ではこの差は許容できます。文章は読む速度より速く表示されるからです。差が負担になるのは、モデルを何度も呼び出すエージェントと、多数の文書を処理するバッチの2つです。どちらの場合も、その差は積み重なります。
8 GBという容量は、速度よりも明確な制約になります。長いコンテキストと大きなモデルのどちらかを選ぶ必要がある一方、12 GBのカードなら両方を実現できます。用途が8Bモデルに短い質問をするだけなら、8 GBのカードで十分です。モデルを自分の文書と連携させたい場合は、より多くのメモリを備えた構成を選ぶほうがよいでしょう。
- 01出品情報を確認する商品タイトル、説明、または箱の写真で、「8 GB」か「12 GB」の表記を確認してください。容量が明記されていない場合は、販売者に確認してください。
- 02スクリーンショットを要求する総メモリ容量とバス幅が表示された、nvidia-smiまたはGPU-Zのスクリーンショットを必ず求めてください。
- 03受け取り時にテストするその場でnvidia-smiを実行してください。12GB版なら約12,287 MiB、8GB版なら約7,800 MiBです。
- 04モデルを実行するOllamaで8BのQ4モデルをロードし、`ollama ps` コマンドでGPU上で100%使用されていることを確認した上で、購入を決定してください。
#コンテキスト:8 GBを活用する
8 GBでは、コンテキストキャッシュが実際の制約になります。Ollamaのドキュメントによると、Flash Attentionが有効な場合はK/Vキャッシュを量子化できます。サーバーを起動する前に、OLLAMA_FLASH_ATTENTION=1、次にOLLAMA_KV_CACHE_TYPE=q8_0を設定してください。128ビットのバス幅では、このカードはすでに速度面で苦しいため、極端に大きなコンテキストでさらに負荷をかけるのは避けたほうがよいでしょう。Q4の8Bモデルで数千トークンのコンテキストを使うのが、よい妥協点です。
#代わりに何を選ぶか
| カード | メモリ | 生成速度 (tok/s) | これによって得られるもの |
|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 75.6(測定値) | 12Bモデルも実行でき、8 GB版より高速 |
| RTX 3060 Ti | 8 GB | 92.2 (測定値) | 容量は同じでも、はるかに高速 |
| RTX 4060 Ti 8 GB | 8 GB | 63.9(測定値) | より新しいモデルですが、バス幅は3060 8 GBと同じ128ビットです |
選択は何を重視するかによって変わります。メモリ容量なら 3060 12 GB、80億パラメータのモデルでの速度なら 3060 Ti です。中古価格は毎週変動します。当サイトの価格追跡では、ローカル AI 向けグラフィックスカードの最安値を記録しています。
#2026年の結論
- 使い続けるのがおすすめの場合
- すでにPCに搭載されていて、チャットやコード支援にQ4の8Bまたは9Bモデルを使いたい場合で、速度を求めない場合。
- AI用途での購入は避けてください
- 3060 12GBモデルは、しばしば予算に合わせてより優れたパフォーマンスを提供します。8GBモデルは、明確に予算を下回る場合にのみ購入してください。
- バージョンを常に確認してください
- 出品情報にメモリ容量を明記してもらい、受け取り時にnvidia-smiで確認してください。
#よくある質問
RTX 3060 8GB と 12GB をどのように区別できますか?+
RTX 3060 8 GB では 1 秒あたり何トークンですか?+
LLM用にはRTX 3060 8GBとRTX 4060 8GBのどちらを選ぶべきですか?+
RTX 3060 8GBでGemma 4 12Bを実行することは可能ですか?+
OllamaはRTX 3060 8 GBで動作しますか?+
RTX 3060 12GBの方が優れているでしょうか?+
- 出典:CUDA での llama.cpp の性能表
- 出典:RTX 3060のNVIDIAドキュメント
- 出典:Tom's Hardware、RTX 3060 8GB
- 出典:Ollama FAQ(ollama ps、K/Vキャッシュ)
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。