RTX 3060 Ti(8 GB)で使えるLLMは? ?
RTX 3060 Ti(8 GB、448 GB/s)は、Granite 4.2 8B(4.6 GB)や Qwen 3.5 9B(6 GB)など、Q4 量子化された70億〜90億パラメータのモデルを VRAM 内に収めて動作させられます。llama.cpp のベンチマークでは毎秒92トークンを生成し、RTX 3060 12 GB(毎秒75.6トークン)よりも高速ですが、8 GB という容量では120億パラメータのモデルは動かせません。ローカル AI では、その速度で不足する4 GBを補うことはできません。
RTX 3060 Ti(2020年12月)は、ゲーム性能においてRTX 3060よりもはるかに速いですが、メモリは8GBしかありません。本ガイドは、最近公開された実測データに基づいて、どのような処理を実行できるか、Flash Attentionが提供する利点、3060 12GBとの違い、および他の選択肢に切り替えるべきタイミングを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16 GB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#RTX 3060 TiとRTX 3060:ローカルAIで使う場合の比較まとめ
RTX 3060 Ti はテキスト生成において 3060 12 GB より速いですが、VRAM は 4 GB 少なく、ローカル AI では容量がボトルネックとなります。llama.cpp の共同編集テーブルによると、7B モデルの Q4_0 において、3060 Ti は 1 秒あたり 92.2 トークン、3060 12 GB は 75.6 トークンであり、約 22% 高速です。この優位性は 256 ビットのバス幅によるもので、帯域幅は 448 GB/s に対し 360 GB/s です。一方、8 GB の VRAM では 7B から 9B のモデル(Granite 4.2 8B は 4.6 GB、Qwen 3.5 9B は 6 GB)を動作させることができますが、Gemma 4 12B(重み 7 GB)はコンテキストに余裕を残さないため動作しません。ターゲットが 8B なら Ti が 2 つの中で最も速く、12B を目指すなら Ti は選択肢から外れます。
- RTX 3060 Ti
- GA104チップ、2020年12月、CUDAコア4,864基、GDDR6メモリ8 GB、256ビットバス、448 GB/s。
- RTX 3060
- GA106チップ、3,584コア、192ビットバスによる12GBのGDDR6、360GB/s。
- LLMの場合
- 帯域幅が大きいほど速度は上がり、メモリが少ないほど動かせるモデルの選択肢は減ります。この二つの効果は相殺し合いますが、メモリ容量のほうが重要です。
#8GBに対応するモデル
| モデル | Q4 での重み | Q8でのモデルサイズ | 8GBでの動作 |
|---|---|---|---|
| Granite 4.2 8B | 4.6 GB | 9 GB | Q4なら十分余裕がありますが、Q8はメモリに収まりません。 |
| Qwen 3.5 9B | 6 GB | 10 GB | Q4で中程度のコンテキストを用いる |
| Gemma 4 12B | 7 GB | 13 GB | コンテキストを含めるとメモリに収まらない |
制約になるのはカードの生成速度ではなく、メモリ容量です。llama.cppのテストでは、3060 Tiのメモリ容量は公称値の8,192 MiBより少し少ない7,838 MiBと認識されます。この容量をモデルの重み、コンテキストキャッシュ、そして画面が接続されている場合は表示処理で分け合います。数千トークンのコンテキストを確保するには、重みの容量を最大でも6 GBに抑えることを目安にしてください。
#インストールと設定
このカードのCompute CapabilityはOllamaの一覧では8.6で、Ollamaは550以降のドライバーを必要とします。電源については、NVIDIAの仕様表ではカードの消費電力を200 Wとし、システム用電源を600 Wとすることを推奨しています。3060では550 Wが推奨されています。ときどき挙げられる500 Wの電源は、この推奨値を下回ります。
- 01ドライバーをインストールするNVIDIAドライバー550以降をインストールし、nvidia-smi でカードが約8 GBのメモリを搭載したGPUとして認識されていることを確認してください。
- 02Ollama のインストールインストールガイドに従い、ollama runで80億パラメータのQ4モデルを起動してください。
- 03メモリ設定を有効にするOLLAMA_FLASH_ATTENTION=1 および OLLAMA_KV_CACHE_TYPE=q8_0 を設定してサーバーを起動してください。ドキュメントでは、Flash Attention が有効になると K/V キャッシュが量子化できると明記されています。
- 04メモリの監視長時間の会話中に nvidia-smi を確認してください。メモリが 7,800 MiB に近づいたら、コンテキストを縮小してください。
#速度:生成、プロンプトの読み取り、Flash Attention
llama.cppの表に掲載された2026年9月の測定結果から、Q4_0形式で3.56 GiBの70億パラメータモデルを使った3060 Tiの動作を詳しく把握できます。448 GB/sの帯域幅なら、最大で毎秒約117トークンが可能と考えられます。実測では毎秒92トークンに達し、上限の約79%に相当します。最も興味深い結果は、Flash Attentionに関するものです。
| 測定 | フラッシュアテンションなし | Flash Attentionを使用した場合 | 差 |
|---|---|---|---|
| 生成(128トークン) | 92.2 tok/s | 96.5トークン/秒 | +5 % |
| 4,096トークンのプロンプトの読み込み | 1 897 tok/s | 2,598 tok/s | +37 % |
生成速度の向上はわずかですが、長いプロンプトの読み取り速度は3分の1以上向上します。これはRAGや文書要約において重要です。この速度で計算すると、10,000トークンのプロンプトは約4秒で読み取られますが、これは一定のスループットを前提とした理論的な計算です。OllamaはGPUが対応している場合、Flash Attentionを自動的に有効にします。環境変数OLLAMA_FLASH_ATTENTION=1を設定することで、強制有効化することもできます。
テストファイルより重いモデルの場合、比例計算でおおよその値を求められます。92 × 3.82 ÷ 4.6で、Granite 4.2 8BのQ4では約76トークン/秒、Qwen 3.5 9B(6 GB)では約59トークン/秒です。これらは理論上の上限値であり、実測値ではありません。ご自身のカードをこれらの値と比較したい場合は、llama.cppのllama-benchツールでテストを再現できます。同じLlama 2 7BのQ4_0ファイルを使用し、すべてのレイヤーをGPUに配置して、Flash Attentionの有効時と無効時にテストします。結果はドライバー、システム、カードのメーカーによって異なるため、同じチップでも数パーセントの差が出るのは異常ではありません。これらの速度は人が文章を読む速度を上回るため、対話ではカードが制約になることはありません。
#ドキュメントとRAG:どの部分で時間がかかるか
ドキュメントをクエリすると、GPUはまずプロンプトの読み込みに時間を費やし、その後で応答を生成します。3060 Tiでは、llama.cppで測定された速度によると、4,096トークン(約10ページ分)のプロンプトは、Flash Attentionなしで約2.2秒、ありで1.6秒で読み込まれます。その後、400トークンの応答は、テストモデルでは92トークン/秒の速度で約4〜5秒を要し、現在の8Bモデルではさらに長くなります。これらは一定の処理速度を前提とした理論的な計算ですが、待ち時間が数秒程度にとどまることを示しています。
8 GBでのRAGの制限は時間ではなくメモリです:数万字のトークンコンテキストは、80億パラメータのモデルのコンテキストキャッシュを飽和させます。予算内に留まる2つの方法:プロンプトに注入する抽出物の数を減らすこと、およびOllamaのドキュメントによると、デフォルト形式のメモリ使用量の約半分になるq8_0でK/Vキャッシュを量子化することです。
#別の選択肢に切り替えるタイミング
| あなたのニーズ | 重み用のメモリ容量 | 適したカード |
|---|---|---|
| Q4の8Bモデル(Granite 4.2 8B) | 4.6 GB | 8GBは十分です |
| 中程度の長さのコンテキストで使うQ4の9Bモデル(Qwen 3.5 9B) | 6 GB | 8 GBで、快適に使えるぎりぎりの容量 |
| 8B Q8 (Granite 4.2 8B) | 9 GB | 12 GB |
| 12BのQ4(Gemma 4 12B) | 7 GB+コンテキスト用のメモリ | 12 GB |
| 12B Q8 (Gemma 4 12B) | 13 GB | 16 GB |
この表は上から下へ読んでください。3060 Tiは最初の2行に対応できますが、続く3行にはより多くのメモリが必要です。用途が表の下半分に該当するなら、カードを交換する理由があります。そうでなければ、3060 Tiで十分です。サイズは大きくても品質の高いモデルのほうが、より高速なカードよりも有用な場合があります。毎秒92トークン出るなら、速度が制約にはなっていません。
#3060 Tiと3060 12GB:似ていても別物
| 基準 | RTX 3060 Ti | RTX 3060 12 GB |
|---|---|---|
| メモリ | 8 GB | 12 GB |
| バス/帯域幅 | 256ビット / 448GB/s | 192ビット / 360GB/秒 |
| 生成(7B Q4_0) | 92.2 tok/s | 75,6 tok/s |
| Gemma 4 12B の Q4 版(7 GB) | コンテキストを含めるとメモリに収まらない | 余裕を持って収まります |
| 推奨されるシステム電源 | 600 W | 550 W |
まずは速いほうを選びたくなります。しかし、両方のカードで読み込める80億〜90億パラメータのモデルでは、22%の速度向上は使用感を変えません。どちらも、読む速度より速くテキストが表示されるからです。一方、3060 12GBなら、さらに上のカテゴリーのモデルも使えるようになります。そのため、今後も用途を8〜9Bのモデルに限定するのでなければ、ローカルAIにはこちらが最適です。購入時には注意点があります。NVIDIAはGDDR6Xメモリを搭載した3060 Tiも販売しており、仕様表で見分けられます。メモリ容量は同じ8GBです。
#3060 TiおよびRTX 4060 Ti 8GB
より新しい RTX 4060 Ti 8 GB は、同じテストで 63.9 トークン/秒を記録し、3060 Ti よりも明らかに低速です。その理由は 128 ビットのバス幅であり、より効率的なアーキテクチャにもかかわらず、メモリ帯域幅を制限しています。テキスト生成において、3060 Ti は同等の容量を持つこの新しいカードよりも依然として高速です。その強みは別にある:アーキテクチャのより新しい機能と、メーカーの仕様表によるとより控えめな消費電力です。これはコンパクトなケースや、モデルを提供するために常時電源が入ったマシンにおいて有用です。ただし、これはテキスト生成の速度向上でも、メモリ容量の増加でもありません。両者で迷っている場合は、メモリ容量が倍の 16 GB バージョンの 4060 Ti を検討してください。
#2026年の結論
- 使い続けるのがおすすめの場合
- 正常に動作していて、70億〜90億パラメータのモデルを使っている場合:速度は十分であり、メモリ容量が同じものに買い替えても改善は期待できません。
- 12GBモデルを購入できるなら、AI用途ではこちらを買わないでください
- 3060 12 GBなら、120億パラメータのモデルも使えるようになります。中古価格の差は毎週変わるため、当サイトの価格推移を確認してください。
- 12GBまたは16GBへのアップグレードを勧める条件
- 12Bモデル、長いコンテキスト、または大容量の文書を対象としたRAGを使いたい場合。
#よくある質問
LLMにはRTX 3060 TiとRTX 3060 12 GBのどちらを選ぶべきですか?+
RTX 3060 TiがGemma 4 12Bを実行できるか?+
RTX 3060 Tiでの1秒あたりのトークン数は?+
RTX 3060 TiはRTX 4060よりもLLMに適していますか?+
RTX 3060 Tiに必要な電源は?+
RTX 3060 TiでFlash Attentionを使う価値はありますか?+
- 出典:CUDA での llama.cpp の性能表
- 出典:NVIDIAのRTX 3060および3060 Tiの仕様情報
- 出典:Ollama がサポートする NVIDIA カード
- 出典:OllamaのFAQ(Flash Attention、K/Vキャッシュ)
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。