初心者 11 分RTX 30

RTX 3060 8GBで使うLLMはどれ? ?

端的な回答

RTX 3060 8 GBは、Granite 4.2 8B(4.6 GB)や Qwen 3.5 9B(6 GB)のように、Q4で7〜9Bのモデルを実行できますが、12Bは実行できません。その特徴は、128ビットバスと240 GB/sの帯域幅であり、3060 12 GBの192ビットと360 GB/sと比較して、生成速度がはるかに遅くなります。llama.cppの公開テーブルでは、7Bモデルで12 GB版が75.6 tokens/sとされています。

RTX 3060という名称の下で、NVIDIAは2つのカードを販売しました。元の12 GB版と、2022年末に登場した8 GB版です。後者はメモリバスが狭くなっています。このガイドでは、ローカルAIにおいてそれが何を意味するのか、8 GBにどのモデルが収まるのか、購入時に2つのバージョンを混同しないための方法、そして期待できる速度(測定されたものと測定されていないものを含む)について説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16 GB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#RTX 3060 8GB:12GBモデルと比べてどのような違いがありますか?

RTX 3060 8 GBでは、Q4量子化した70億~90億パラメータのモデルを動かせます。QuelLLMのカタログによると、Granite 4.2 8Bには4.6 GB、Qwen 3.5 9Bには6 GBが必要です。Gemma 4 12B(Q4で7 GB)は、余裕を持って収まるとはいえません。3060 12 GBとの違いは二つあります。メモリが4 GB少ないことと、バス幅が192ビットではなく128ビットであることです。発売時に仕様を確認した専門メディアによると、バス幅が狭いため帯域幅は240 GB/sとなり、12 GBモデルの360 GB/sより33%低くなります。テキスト生成は主にメモリ帯域幅に依存するため、ローカルAIではこの差が重要です。8 GBモデルの公開測定値はありませんが、Q4_0の70億パラメータモデルでは約50トークン/秒で生成すると推定できます。一方、12 GBモデルでの実測値は75.6トークン/秒です。

チップ
3060 12 GBと同じGA106チップを搭載し、カードの消費電力も同じ170 Wです。
メモリ
GDDR6メモリ8GB、128ビットバス、帯域幅240GB/s。比較対象はメモリ12GB、192ビットバス、帯域幅360GB/sです。
結果
演算コア数は同じでも、メモリ容量と帯域幅は小さくなります。ローカルAIの制約となるのは、演算能力ではなくメモリです。

#8GBに対応するモデル

RTX 3060 8 GB向けモデル(モデルサイズはQuelLLMカタログに基づく)
モデルQ4 での重みQ8でのモデルサイズ8GBでの動作
Qwen 3.5 4B2.3 GB4.3 GBQ8 が可能で、コンテキスト長にも余裕があります
Granite 4.2 8B4.6 GB9 GBQ4なら快適に動作しますが、Q8はメモリに収まりません
Qwen 3.5 9B6 GB10 GBQ4、コンテキスト長は控えめに
Gemma 4 12B7 GB13 GBコンテキストを含めるとメモリに収まらない

容量は、より高速な8 GBの2つのカードである3070や3060 Tiと同等です。同じルールが適用されます:重みは最大6 GBを目標とし、ドライバーとコンテキスト用に1 GBを確保し、モデルが完全にカード内に収まっていることを確認してください。そのために、ollama psコマンドを実行すると、すべてがカードにロードされている場合、100% GPUと表示されます。CPUのパーセンテージが表示される場合、モデルがオーバーフローしており、速度が急落します。

#速度:メモリバスが決定的な役割を果たす理由

llama.cppの共同作成の比較表(Llama 2 7BのQ4_0、ファイルサイズ3.56 GiB)には3060 8 GBは載っていませんが、メモリバスによって何が変わるかを理解するのに役立ちます。表に示されている速度は、3060 12 GB(192ビットバス)が75.6トークン/秒、3060 Ti 8 GB(256ビットバス)が92.2トークン/秒、バス幅がわずか128ビットのRTX 4060 Ti 8 GBが63.9トークン/秒です。容量が同じなら、多少の例外はあるものの、速度の順位はバス幅に沿います。つまり、バス幅の狭い新しいカードが、バス幅の広い古いカードより遅くなることがあります。

Llama 2 7B Q4_0 での生成:バスが差を生み出します
カードメモリバス生成速度 (tok/s)ステータス
RTX 3060 Ti8 GB256ビット92,2公開された測定値
RTX 3060 12 GB12 GB192 ビット75,6公開された測定値
RTX 4060 Ti 8 GB8 GB128 ビット63,9公開された測定値
RTX 3060 8 GB8 GB128 ビット約47から50推定値であり、実測値ではありません

最終行の推定では、12 GBカードで測定した理論帯域幅の約80%という効率を240 GB/sに適用しています。これは推定値として示してください。ファイルサイズに基づく比例計算では、Granite 4.2 8B(4.6 GB)が約40 tokens/s、Qwen 3.5 9B(6 GB)が約30 tokens/sとなりますが、いずれも理論上の上限値です。この速度なら会話で読むことができますが、8 GB版は12 GB版より約3分の1低速で、3060 Tiより40%を超えて低速です。

#避けるべき落とし穴

同じ名前で2種類のカード
NVIDIA は RTX 3060 の仕様として、メモリ容量12 GB または8 GB、バス幅192ビットまたは128ビットを掲載しています。名前だけでは容量は分かりません。販売情報に容量が明記されていることを必ず確認してください。
インストール時の検証
nvidia-smi を実行すると、12GBはllama.cppの測定値で約12,287 MiB、8GBは約7,800 MiB(3060 Tiと類似)と表示されます
価格は12GBモデルと同等です。
一部の販売店では、両バージョンを同じ価格で掲載しています。固定された価格ではなく、当サイトの毎週の価格追跡情報を使って比較してください。
12B モデルへの非現実的な期待
Gemma 4 12Bや同規模のモデルは、コンテキストを含めるとVRAMに収まりません。Q4での上限は9Bです。
カード名とメモリ総容量を確認する
nvidia-smi --query-gpu=name,memory.total --format=csv

2つ目の確認は、譲り受けたPCなどにも当てはまります。メーカーの説明やWindowsに表示されるグラフィックカード名だけでは、バージョンを区別できないことがありますが、nvidia-smiが返す総メモリ容量なら確実に判断できます。

#推定値の根拠となる計算

原理はシンプルです。トークンを生成するために、カードはモデルの重みの大部分を再読み込みします。したがって、1秒あたりの最大トークン数は、帯域幅をファイルサイズで割った値のオーダーになります。テストファイルの重さは3.56 GiBで、約3.82 GBに相当します。3060 12 GBの場合、360 GB/sを3.82で割ると上限は1秒あたり94トークンとなり、公開されている測定値はこの80%に達しています。8 GBの場合、240 GB/sでは上限は約1秒あたり63トークンです。同じ効率を適用すると、約50トークンになります。

理論的上限から推定への移行
カード帯域幅上限(GB/s ÷ 3.82 GB)結果
RTX 3060 12 GB360 GB/s約94トークン/秒75.6 tok/s を測定(約80%)
RTX 3060 8 GB240 GB/s約63トークン/秒約50 tok/sと推定

この方法には限界があります。効率はカードごとに異なり、同じ表のほかのカードでも、上限値に対する実測値の比率は67%〜85%となっています。そのため、単一の正確な数値ではなく、幅のある目安として捉えてください。また、同じチップを搭載していても、公表された結果はドライバー、システム、カードのメーカーによって変わります。速度が購入の判断を左右する場合は、自分の機材で測定してください。

#実際に使ってみるとどうか

スループットを待ち時間に換算してみましょう。毎秒約40トークンなら、500トークン(説明文1ページ分)の回答に約12秒かかります。3060 12 GBでは同じ回答に約8秒かかりますが、どちらも理論上の推定値です。会話ではこの差は許容できます。文章は読む速度より速く表示されるからです。差が負担になるのは、モデルを何度も呼び出すエージェントと、多数の文書を処理するバッチの2つです。どちらの場合も、その差は積み重なります。

8 GBという容量は、速度よりも明確な制約になります。長いコンテキストと大きなモデルのどちらかを選ぶ必要がある一方、12 GBのカードなら両方を実現できます。用途が8Bモデルに短い質問をするだけなら、8 GBのカードで十分です。モデルを自分の文書と連携させたい場合は、より多くのメモリを備えた構成を選ぶほうがよいでしょう。

  1. 01
    出品情報を確認する
    商品タイトル、説明、または箱の写真で、「8 GB」か「12 GB」の表記を確認してください。容量が明記されていない場合は、販売者に確認してください。
  2. 02
    スクリーンショットを要求する
    総メモリ容量とバス幅が表示された、nvidia-smiまたはGPU-Zのスクリーンショットを必ず求めてください。
  3. 03
    受け取り時にテストする
    その場でnvidia-smiを実行してください。12GB版なら約12,287 MiB、8GB版なら約7,800 MiBです。
  4. 04
    モデルを実行する
    Ollamaで8BのQ4モデルをロードし、`ollama ps` コマンドでGPU上で100%使用されていることを確認した上で、購入を決定してください。

#コンテキスト:8 GBを活用する

8 GBでは、コンテキストキャッシュが実際の制約になります。Ollamaのドキュメントによると、Flash Attentionが有効な場合はK/Vキャッシュを量子化できます。サーバーを起動する前に、OLLAMA_FLASH_ATTENTION=1、次にOLLAMA_KV_CACHE_TYPE=q8_0を設定してください。128ビットのバス幅では、このカードはすでに速度面で苦しいため、極端に大きなコンテキストでさらに負荷をかけるのは避けたほうがよいでしょう。Q4の8Bモデルで数千トークンのコンテキストを使うのが、よい妥協点です。

Linux:量子化したK/Vキャッシュを使用してOllamaを起動する
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#代わりに何を選ぶか

同等の予算で利用可能な代替案
カードメモリ生成速度 (tok/s)これによって得られるもの
RTX 3060 12 GB12 GB75.6(測定値)12Bモデルも実行でき、8 GB版より高速
RTX 3060 Ti8 GB92.2 (測定値)容量は同じでも、はるかに高速
RTX 4060 Ti 8 GB8 GB63.9(測定値)より新しいモデルですが、バス幅は3060 8 GBと同じ128ビットです

選択は何を重視するかによって変わります。メモリ容量なら 3060 12 GB、80億パラメータのモデルでの速度なら 3060 Ti です。中古価格は毎週変動します。当サイトの価格追跡では、ローカル AI 向けグラフィックスカードの最安値を記録しています。

#2026年の結論

使い続けるのがおすすめの場合
すでにPCに搭載されていて、チャットやコード支援にQ4の8Bまたは9Bモデルを使いたい場合で、速度を求めない場合。
AI用途での購入は避けてください
3060 12GBモデルは、しばしば予算に合わせてより優れたパフォーマンスを提供します。8GBモデルは、明確に予算を下回る場合にのみ購入してください。
バージョンを常に確認してください
出品情報にメモリ容量を明記してもらい、受け取り時にnvidia-smiで確認してください。

#よくある質問

よくある質問
RTX 3060 8GB と 12GB をどのように区別できますか?+
パッケージまたは発表資料に記載されているメモリ容量を確認し、nvidia-smi を実行してください。12 GB の場合は総メモリが 12 000 MiB 前後(llama.cpp で計測した 12 287 MiB)、8 GB の場合は 8 000 MiB 前後です。NVIDIA はバス幅も区別します。12 GB は 192 ビット、8 GB は 128 ビットです。
RTX 3060 8 GB では 1 秒あたり何トークンですか?+
公開されている測定値はありません。llama.cppの表によると、12 GBモデルはQ4_0の7Bモデルで毎秒75.6トークンを生成します。帯域幅が360 GB/sではなく240 GB/sであるため、8 GBモデルは同じテストで毎秒47〜50トークン程度になると理論的に推定されます。
LLM用にはRTX 3060 8GBとRTX 4060 8GBのどちらを選ぶべきですか?+
両方とも8GBのメモリと128ビットのバスを備えています。8GBのRTX 4060 Ti(同様に128ビットバス)は、llama.cppのパブリックベンチマークで63.9トークン/秒を記録しています。価格と消費電力に応じて選択してください。メモリとバスが同じであれば、速度は同程度です。
RTX 3060 8GBでGemma 4 12Bを実行することは可能ですか?+
困難です。カタログではQ4で重みが7 GBとされており、コンテキストとシステムにはわずか1 GBしか残っていません。この場合、モデルはGPUとRAMに分散配置され、ollama psがそれを示します。速度は低下します。Qwen 3.5 9B(6 GB)またはGranite 4.2 8B(4.6 GB)を推奨します。
OllamaはRTX 3060 8 GBで動作しますか?+
はい。OllamaはRTX 3060をCompute Capability 8.6のカードとして掲載しており、バージョン550以降のドライバーを要求しています。最初のモデル読み込み後、ollama psで「100% GPU」と表示されることを確認してください。これは、モデル全体が8 GBのVRAM内に収まっていることを示します。
RTX 3060 12GBの方が優れているでしょうか?+
ローカルAI用途なら、ほぼすべての場合で、はい。llama.cppの公開表では75.6トークン/秒が測定されており、メモリが4 GB多く、120億パラメータのモデルも使えます。8 GB版を選ぶメリットがあるのは、すでに搭載されているか、大幅に安い場合だけです。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。