初心者 11 分RTX 30

RTX 3060 Ti(8 GB)で使えるLLMは? ?

端的な回答

RTX 3060 Ti(8 GB、448 GB/s)は、Granite 4.2 8B(4.6 GB)や Qwen 3.5 9B(6 GB)など、Q4 量子化された70億〜90億パラメータのモデルを VRAM 内に収めて動作させられます。llama.cpp のベンチマークでは毎秒92トークンを生成し、RTX 3060 12 GB(毎秒75.6トークン)よりも高速ですが、8 GB という容量では120億パラメータのモデルは動かせません。ローカル AI では、その速度で不足する4 GBを補うことはできません。

RTX 3060 Ti(2020年12月)は、ゲーム性能においてRTX 3060よりもはるかに速いですが、メモリは8GBしかありません。本ガイドは、最近公開された実測データに基づいて、どのような処理を実行できるか、Flash Attentionが提供する利点、3060 12GBとの違い、および他の選択肢に切り替えるべきタイミングを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16 GB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#RTX 3060 TiとRTX 3060:ローカルAIで使う場合の比較まとめ

RTX 3060 Ti はテキスト生成において 3060 12 GB より速いですが、VRAM は 4 GB 少なく、ローカル AI では容量がボトルネックとなります。llama.cpp の共同編集テーブルによると、7B モデルの Q4_0 において、3060 Ti は 1 秒あたり 92.2 トークン、3060 12 GB は 75.6 トークンであり、約 22% 高速です。この優位性は 256 ビットのバス幅によるもので、帯域幅は 448 GB/s に対し 360 GB/s です。一方、8 GB の VRAM では 7B から 9B のモデル(Granite 4.2 8B は 4.6 GB、Qwen 3.5 9B は 6 GB)を動作させることができますが、Gemma 4 12B(重み 7 GB)はコンテキストに余裕を残さないため動作しません。ターゲットが 8B なら Ti が 2 つの中で最も速く、12B を目指すなら Ti は選択肢から外れます。

RTX 3060 Ti
GA104チップ、2020年12月、CUDAコア4,864基、GDDR6メモリ8 GB、256ビットバス、448 GB/s。
RTX 3060
GA106チップ、3,584コア、192ビットバスによる12GBのGDDR6、360GB/s。
LLMの場合
帯域幅が大きいほど速度は上がり、メモリが少ないほど動かせるモデルの選択肢は減ります。この二つの効果は相殺し合いますが、メモリ容量のほうが重要です。

#8GBに対応するモデル

RTX 3060 Ti向けモデル(データサイズはQuelLLMカタログに基づく)
モデルQ4 での重みQ8でのモデルサイズ8GBでの動作
Granite 4.2 8B4.6 GB9 GBQ4なら十分余裕がありますが、Q8はメモリに収まりません。
Qwen 3.5 9B6 GB10 GBQ4で中程度のコンテキストを用いる
Gemma 4 12B7 GB13 GBコンテキストを含めるとメモリに収まらない

制約になるのはカードの生成速度ではなく、メモリ容量です。llama.cppのテストでは、3060 Tiのメモリ容量は公称値の8,192 MiBより少し少ない7,838 MiBと認識されます。この容量をモデルの重み、コンテキストキャッシュ、そして画面が接続されている場合は表示処理で分け合います。数千トークンのコンテキストを確保するには、重みの容量を最大でも6 GBに抑えることを目安にしてください。

#インストールと設定

このカードのCompute CapabilityはOllamaの一覧では8.6で、Ollamaは550以降のドライバーを必要とします。電源については、NVIDIAの仕様表ではカードの消費電力を200 Wとし、システム用電源を600 Wとすることを推奨しています。3060では550 Wが推奨されています。ときどき挙げられる500 Wの電源は、この推奨値を下回ります。

  1. 01
    ドライバーをインストールする
    NVIDIAドライバー550以降をインストールし、nvidia-smi でカードが約8 GBのメモリを搭載したGPUとして認識されていることを確認してください。
  2. 02
    Ollama のインストール
    インストールガイドに従い、ollama runで80億パラメータのQ4モデルを起動してください。
  3. 03
    メモリ設定を有効にする
    OLLAMA_FLASH_ATTENTION=1 および OLLAMA_KV_CACHE_TYPE=q8_0 を設定してサーバーを起動してください。ドキュメントでは、Flash Attention が有効になると K/V キャッシュが量子化できると明記されています。
  4. 04
    メモリの監視
    長時間の会話中に nvidia-smi を確認してください。メモリが 7,800 MiB に近づいたら、コンテキストを縮小してください。
Linux:メモリ設定を適用してOllamaを起動
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#速度:生成、プロンプトの読み取り、Flash Attention

llama.cppの表に掲載された2026年9月の測定結果から、Q4_0形式で3.56 GiBの70億パラメータモデルを使った3060 Tiの動作を詳しく把握できます。448 GB/sの帯域幅なら、最大で毎秒約117トークンが可能と考えられます。実測では毎秒92トークンに達し、上限の約79%に相当します。最も興味深い結果は、Flash Attentionに関するものです。

RTX 3060 Ti、Llama 2 7B Q4_0、Flash Attentionの効果
測定フラッシュアテンションなしFlash Attentionを使用した場合差
生成(128トークン)92.2 tok/s96.5トークン/秒+5 %
4,096トークンのプロンプトの読み込み1 897 tok/s2,598 tok/s+37 %

生成速度の向上はわずかですが、長いプロンプトの読み取り速度は3分の1以上向上します。これはRAGや文書要約において重要です。この速度で計算すると、10,000トークンのプロンプトは約4秒で読み取られますが、これは一定のスループットを前提とした理論的な計算です。OllamaはGPUが対応している場合、Flash Attentionを自動的に有効にします。環境変数OLLAMA_FLASH_ATTENTION=1を設定することで、強制有効化することもできます。

テストファイルより重いモデルの場合、比例計算でおおよその値を求められます。92 × 3.82 ÷ 4.6で、Granite 4.2 8BのQ4では約76トークン/秒、Qwen 3.5 9B(6 GB)では約59トークン/秒です。これらは理論上の上限値であり、実測値ではありません。ご自身のカードをこれらの値と比較したい場合は、llama.cppのllama-benchツールでテストを再現できます。同じLlama 2 7BのQ4_0ファイルを使用し、すべてのレイヤーをGPUに配置して、Flash Attentionの有効時と無効時にテストします。結果はドライバー、システム、カードのメーカーによって異なるため、同じチップでも数パーセントの差が出るのは異常ではありません。これらの速度は人が文章を読む速度を上回るため、対話ではカードが制約になることはありません。

#ドキュメントとRAG:どの部分で時間がかかるか

ドキュメントをクエリすると、GPUはまずプロンプトの読み込みに時間を費やし、その後で応答を生成します。3060 Tiでは、llama.cppで測定された速度によると、4,096トークン(約10ページ分)のプロンプトは、Flash Attentionなしで約2.2秒、ありで1.6秒で読み込まれます。その後、400トークンの応答は、テストモデルでは92トークン/秒の速度で約4〜5秒を要し、現在の8Bモデルではさらに長くなります。これらは一定の処理速度を前提とした理論的な計算ですが、待ち時間が数秒程度にとどまることを示しています。

8 GBでのRAGの制限は時間ではなくメモリです:数万字のトークンコンテキストは、80億パラメータのモデルのコンテキストキャッシュを飽和させます。予算内に留まる2つの方法:プロンプトに注入する抽出物の数を減らすこと、およびOllamaのドキュメントによると、デフォルト形式のメモリ使用量の約半分になるq8_0でK/Vキャッシュを量子化することです。

#別の選択肢に切り替えるタイミング

用途ごとに必要なもの(モデル重みの容量はQuelLLMカタログに基づく)
あなたのニーズ重み用のメモリ容量適したカード
Q4の8Bモデル(Granite 4.2 8B)4.6 GB8GBは十分です
中程度の長さのコンテキストで使うQ4の9Bモデル(Qwen 3.5 9B)6 GB8 GBで、快適に使えるぎりぎりの容量
8B Q8 (Granite 4.2 8B)9 GB12 GB
12BのQ4(Gemma 4 12B)7 GB+コンテキスト用のメモリ12 GB
12B Q8 (Gemma 4 12B)13 GB16 GB

この表は上から下へ読んでください。3060 Tiは最初の2行に対応できますが、続く3行にはより多くのメモリが必要です。用途が表の下半分に該当するなら、カードを交換する理由があります。そうでなければ、3060 Tiで十分です。サイズは大きくても品質の高いモデルのほうが、より高速なカードよりも有用な場合があります。毎秒92トークン出るなら、速度が制約にはなっていません。

#3060 Tiと3060 12GB:似ていても別物

LLM向けに3060 Tiと3060 12 GBを比較
基準RTX 3060 TiRTX 3060 12 GB
メモリ8 GB12 GB
バス/帯域幅256ビット / 448GB/s192ビット / 360GB/秒
生成(7B Q4_0)92.2 tok/s75,6 tok/s
Gemma 4 12B の Q4 版(7 GB)コンテキストを含めるとメモリに収まらない余裕を持って収まります
推奨されるシステム電源600 W550 W

まずは速いほうを選びたくなります。しかし、両方のカードで読み込める80億〜90億パラメータのモデルでは、22%の速度向上は使用感を変えません。どちらも、読む速度より速くテキストが表示されるからです。一方、3060 12GBなら、さらに上のカテゴリーのモデルも使えるようになります。そのため、今後も用途を8〜9Bのモデルに限定するのでなければ、ローカルAIにはこちらが最適です。購入時には注意点があります。NVIDIAはGDDR6Xメモリを搭載した3060 Tiも販売しており、仕様表で見分けられます。メモリ容量は同じ8GBです。

#3060 TiおよびRTX 4060 Ti 8GB

より新しい RTX 4060 Ti 8 GB は、同じテストで 63.9 トークン/秒を記録し、3060 Ti よりも明らかに低速です。その理由は 128 ビットのバス幅であり、より効率的なアーキテクチャにもかかわらず、メモリ帯域幅を制限しています。テキスト生成において、3060 Ti は同等の容量を持つこの新しいカードよりも依然として高速です。その強みは別にある:アーキテクチャのより新しい機能と、メーカーの仕様表によるとより控えめな消費電力です。これはコンパクトなケースや、モデルを提供するために常時電源が入ったマシンにおいて有用です。ただし、これはテキスト生成の速度向上でも、メモリ容量の増加でもありません。両者で迷っている場合は、メモリ容量が倍の 16 GB バージョンの 4060 Ti を検討してください。

#2026年の結論

使い続けるのがおすすめの場合
正常に動作していて、70億〜90億パラメータのモデルを使っている場合:速度は十分であり、メモリ容量が同じものに買い替えても改善は期待できません。
12GBモデルを購入できるなら、AI用途ではこちらを買わないでください
3060 12 GBなら、120億パラメータのモデルも使えるようになります。中古価格の差は毎週変わるため、当サイトの価格推移を確認してください。
12GBまたは16GBへのアップグレードを勧める条件
12Bモデル、長いコンテキスト、または大容量の文書を対象としたRAGを使いたい場合。

#よくある質問

よくある質問
LLMにはRTX 3060 TiとRTX 3060 12 GBのどちらを選ぶべきですか?+
ローカルAIには3060 12 GBがおすすめです。速度は劣り、llama.cppのテストではTiの92.2トークン/秒に対して75.6トークン/秒ですが、メモリが4 GB多くあります。この追加の4 GBにより、Gemma 4 12Bのような120億パラメータのモデルを使えます。3060 Tiでは、これらのモデルをコンテキストとともに読み込むことができません。
RTX 3060 TiがGemma 4 12Bを実行できるか?+
余裕を持って動かすのは難しいです。カタログではQ4のモデルの重みが7GBとされていますが、llama.cppがカード上で認識するVRAMは7,838MiBしかなく、そこからさらにコンテキストキャッシュや画面表示用のメモリが必要です。会話が長くなると、すぐにモデルがVRAMに収まらなくなります。Granite 4.2 8B(4.6GB)またはQwen 3.5 9B(6GB)を使ってください。
RTX 3060 Tiでの1秒あたりのトークン数は?+
llama.cppの公開表によると、Llama 2 7BのQ4_0での生成速度は92.2トークン/秒、Flash Attentionを使用した場合は96.5トークン/秒です。モデルが大きくなると、そのサイズにほぼ比例して生成に時間がかかるようになります。Q4の8Bまたは9Bモデルでは、理論上の推定値として60〜75トークン/秒程度を見込んでください。
RTX 3060 TiはRTX 4060よりもLLMに適していますか?+
メモリ容量が同じ8 GBなら、3060 Tiのほうが生成速度は速く、毎秒92.2トークンです。一方、RTX 4060 Ti 8 GBは毎秒63.9トークンで、バス幅は128ビットしかありません。4060は消費電力が少なく、より新しい機能を備えていますが、テキスト生成速度が上がるわけではありません。
RTX 3060 Tiに必要な電源は?+
NVIDIAはこのカードの消費電力を200 Wと公表し、システム用に600 Wの電源を推奨しています。RTX 3060の推奨値は550 Wです。したがって、500 Wの電源はメーカーの推奨値を下回ります。特にCPUの消費電力が大きい場合は、品質のよい600 Wの電源を選んでください。
RTX 3060 TiでFlash Attentionを使う価値はありますか?+
はい、特に長いプロンプトでは効果があります。llama.cppの表では、4,096トークンの読み取り速度はFlash Attention有効時に2,598トークン/秒、無効時に1,897トークン/秒と測定されており、37%速くなっています。生成速度は約5%向上します。Ollamaは、グラフィックカードが対応していれば自動的に有効にします。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。