ホーム › カタログ › RTX 3060(12 GB)に最適なLLM(2026年)

RTX 3060(12 GB)に最適なLLM(2026年)

◆ ローカルAI — 1時間で、あなたのマシンにプライベートで無料のChatGPTを · 24 € · または全キットを49 €で →

ランキング更新日:09/10/2026

RTX 3060 12 GB は、ローカルで LLM を実行するための低価格帯のグラフィックカードとして最も人気があります。12 GB の VRAM があれば、7〜9B のモデルを Q4/Q5 でスムーズに動作させられます。おすすめのモデルをご紹介します。

ローカル AI のオファーと代替案

RTX 3060 12GB :ローカルAI向けに購入できる別の選択肢 — RTX 5060 Ti 16 GB :

予算に合わせてどの PC を選ぶべき?800~3,500 ユーロのおすすめをご紹介 →

アフィリエイトリンク — ローカルLLMナビは、あなたに追加費用をかけずに購入から手数料を受け取る場合がありますが、独立して決定したランキングには影響しません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

ランキング

1

🇺🇸 Gemma 4 E4B

Google · 4B パラメータ · Apache 2.0 · 128 000 トークン ctx

実効パラメータ数40億のマルチモーダルモデル(テキスト+画像+音声)。140言語。ノートPCとエッジ向け。

このランクの理由 Q8で収まります(利用可能な12 GBのうち約12 GBを使用)。40億パラメータ、コンテキスト長128,000トークン。
ollama run gemma4:e4b
RTX 3060 12GB上で
Q8
12 GB · 14 tok/s
2

🇺🇸 Granite 4.1 8B Instruct

IBM · 8B パラメータ · Apache 2.0 · 131 072 トークン ctx

Dense 8B、Apache 2.0、FRを含む12言語、131k ctx、GQA 32Q/8KV。MMLU 73.84、HumanEval 85.37。2026年4月29日リリース。

このランクの理由 Q8で収まります(利用可能な12 GBのうち約9 GBを使用)。パラメータ数は80億、コンテキストは131,072トークンです。
# HuggingFace : ibm-granite/granite-4.1-8b
RTX 3060 12GB上で
Q8
9 GB · 12 tok/s
3

🇺🇸 Gemma 4 12B

Google · 12B パラメータ · Apache 2.0 · 262 144 トークン ctx

Gemma 4 12B (Google):マルチモーダル Dense モデル(テキスト、ビジョン、オーディオ)、256k コンテキスト、Q4 で VRAM 約 7 GB。Apache 2.0、多言語対応。

このランクの理由 Q5_K_M形式で動作(12GBのうち約9GB)。12Bパラメータ、コンテキスト262,144トークン。
# HuggingFace : google/gemma-4-12B
RTX 3060 12GB上で
Q5_K_M
9GB · 18トークン/秒
4

🇨🇳 Qwen 3 14B

Alibaba · 14B パラメータ · Apache 2.0 · 131 072 トークン ctx

ハイブリッド思考を備えた14Bのデンス型モデル。STEM/コーディング分野でQwen 2.5 32B Baseと同等。

このランクの理由 Q5_K_Mならメモリに収まります(利用可能な12 GBのうち約11 GBを使用)。パラメータ数は140億、コンテキストは131,072トークンです。
ollama run qwen3:14b
RTX 3060 12GB上で
Q5_K_M
11 GB · 6 tok/s
5

🇺🇸 Phi-4 Reasoning 14B

Microsoft · 14B パラメータ · MIT · 32 768 トークン ctx

MITライセンスの14B推論モデル。MicrosoftのAIME24/25評価では、パラメータ数が5分の1でありながらR1-Distill-Llama-70Bを上回ります。

このランクの理由 Q5_K_Mなら収まります(利用可能な12 GBのうち約11 GBを使用)。パラメータ数は140億、コンテキスト長は32,768トークンです。
ollama run phi4-reasoning:14b
RTX 3060 12GB上で
Q5_K_M
11 GB · 6 tok/s
6

🇺🇸 Phi-4 14B

Microsoft · 14B パラメータ · MIT · コンテキスト:16,384トークン

そのサイズに対して卓越した推論能力。STEM向け。

このランクの理由 Q5_K_Mで収まります(利用可能な12 GBのうち約11 GBを使用)。パラメータ数は14B、コンテキスト長は16,384トークンです。
ollama run phi4:14b
RTX 3060 12GB上で
Q5_K_M
11 GB · 6 tok/s
7

🇨🇳 Qwen 2.5 Coder 14B Instruct

Alibaba · 14B パラメータ · Apache 2.0 · 131 072 トークン ctx

Coder 14B。HumanEval 89.6、LiveCodeBench 37.1。コーディング用モデルをセルフホストする際に、VRAM使用量の面でバランスのよい選択肢。

このランクの理由 Q5_K_Mならメモリに収まります(利用可能な12 GBのうち約11 GBを使用)。パラメータ数は140億、コンテキストは131,072トークンです。
ollama run qwen2.5-coder:14b
RTX 3060 12GB上で
Q5_K_M
11 GB · 6 tok/s
8

🇨🇳 DeepSeek R1 Distill Qwen 14B

DeepSeek · 14B パラメータ · MIT · 131 072 トークン ctx

R1をQwen 14Bに蒸留したモデル。AIME24 69.7、MATH-500 93.9。多くのベンチマークでo1-miniを上回る。

このランクの理由 Q5_K_Mならメモリに収まります(利用可能な12 GBのうち約11 GBを使用)。パラメータ数は140億、コンテキストは131,072トークンです。
ollama run deepseek-r1:14b
RTX 3060 12GB上で
Q5_K_M
11 GB · 6 tok/s

比較表

順位 モデル Params VRAM Q4 コンテキスト ライセンス RTX 3060 12GB上で
#1 Gemma 4 E4B 4B 10 GB 128 000 Apache 2.0 14 tok/s · Q8
#2 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 12 tok/s · Q8
#3 Gemma 4 12B 12B 7 GB 262 144 Apache 2.0 18 tok/s · Q5_K_M
#4 Qwen 3 14B 14B 9 GB 131 072 Apache 2.0 6 tok/s · Q5_K_M
#5 Phi-4 Reasoning 14B 14B 9 GB 32 768 MIT 6 tok/s · Q5_K_M
#6 Phi-4 14B 14B 9 GB 16 384 MIT 6 tok/s · Q5_K_M
#7 Qwen 2.5 Coder 14B Instruct 14B 9 GB 131 072 Apache 2.0 6 tok/s · Q5_K_M
#8 DeepSeek R1 Distill Qwen 14B 14B 9 GB 131 072 MIT 6 tok/s · Q5_K_M
ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

無料の要点まとめ

あなたのマシンでどのコーディング用モデルを動かせばよいですか?

メモを受け取る VRAM → 最適なコーディング用モデル → Ollamaコマンド (1画面に収まり、コピー&ペーストできます)。そして、実際に動く環境を整えるために、ローカルコパイロットキットをご利用ください。

ローカルコパイロットキット — そのまま貼り付けて使える Ollama + Cline + Aider の設定、調整済みの Modelfiles、トラブルシューティング、無期限で利用できるオンラインスペース →

スパムは送りません。配信停止は1クリックで可能です。お客様のデータは当サイトで保管し、転売することはありません。

ランキングの方法論

フィルター:Q4_K_Mで12 GBのVRAMに収まるモデル。VRAMを40%以上使用するモデルには加点します。カードの性能を十分に活用できない、小さすぎるモデルを推奨しないためです。

考慮した基準:

  • Q4なら12 GBに収まる
  • 処理速度 ≥ 15トークン/秒
  • 品質がしっかりした7-9Bモデル
  • 成熟したエコシステム

スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。

よくある質問

RTX 3060 12GBで本格的なRAGは可能でしょうか?

はい、Llama 3.1 8B(コンテキスト128k)または Qwen 2.5 7B(131k)で可能です。Q4ではモデル+約32kのRAGコンテキストが12GB以内に収まります。コンテキストが100kを超える場合はQ4_0に切り替えたり、バッチサイズを制限してください。

LLM用途ならRTX 3060とRX 6700 XTのどちら?

CUDAのほうがはるかに手厚くサポートされています(Ollama、llama.cpp、vLLMはいずれもCUDA向けに最適化されています)。AMDもROCm経由で動作しますが、セットアップはより複雑です。LLM用途では、2026年もNVIDIAが当然の選択肢です。

12GBではどの量子化レベル(Q)を選ぶべきですか?

7〜8B向けにはQ5_K_M(約7GBを消費し、大きなコンテキスト処理に余裕をもたらします)。12B向けにはQ4_K_M(Mistral Nemo)を推奨します。Q3またはQ2は避けてください——品質の低下が目立つためです。

12Bモデルをリアルタイムで実行できるか?

はい — Mistral Nemo 12B は Q4_K_M(約7 GB)で、3060上で10〜15トークン/秒を実現します。チャット用途には適していますが、リアルタイム編集には少し遅いです。

さらに詳しく

QuelLLM キット 用途別のリファレンスガイド
すべてのキットを生涯利用可能 — 49 €