ホーム › カタログ › RTX 3080 Ti (12 GB) 向けの最良の LLM(2026)

RTX 3080 Ti (12 GB) 向けの最良の LLM(2026)

◆ ローカルAI — 1時間で、あなたのマシンにプライベートで無料のChatGPTを · 24 € · または全キットを49 €で →

ランキング更新日:2026年9月22日

RTX 3080 Ti(12 GB GDDR6X、912 GB/s)は、VRAMが12 GBのコンシューマー向け製品の中で最も高いメモリ帯域幅を備えています。Qwen 3 14B Q4では55~65 tok/sで、同じモデルを実行した場合、4070よりも高速です。

ローカル AI のオファーと代替案

RTX 3080 Ti :ローカルAI向けに購入できる別の選択肢 — RTX 5060 Ti 16 GB :

予算に合わせてどの PC を選ぶべき?800~3,500 ユーロのおすすめをご紹介 →

アフィリエイトリンク — QuelLLM は購入に応じて紹介料を受け取る場合がありますが、お客様に追加費用はかかりません。紹介料の有無が、独立して作成したランキングに影響することはありません。Amazon アソシエイトとして、QuelLLM は条件を満たす購入から収益を得ます。

ランキング

1

🇺🇸 Granite 4.1 8B Instruct

IBM · 8B パラメータ · Apache 2.0 · 131 072 トークン ctx

Dense 8B、Apache 2.0、FRを含む12言語、131k ctx、GQA 32Q/8KV。MMLU 73.84、HumanEval 85.37。2026年4月29日リリース。

このランクの理由 Dense 8B、Apache 2.0、FRを含む12言語、131k ctx、GQA 32Q/8KV。MMLU 73.84、HumanEval 85.37。2026年4月29日リリース。
# HuggingFace : ibm-granite/granite-4.1-8b
RTX 3080 Ti での動作
Q8
9GB · 35トークン/秒
2

🇺🇸 Gemma 4 12B

Google · 12B パラメータ · Apache 2.0 · 262 144 トークン ctx

Gemma 4 12B (Google):マルチモーダル Dense モデル(テキスト、ビジョン、オーディオ)、256k コンテキスト、Q4 で VRAM 約 7 GB。Apache 2.0、多言語対応。

このランクの理由 Gemma 4 12B (Google):マルチモーダル Dense モデル(テキスト、ビジョン、オーディオ)、256k コンテキスト、Q4 で VRAM 約 7 GB。Apache 2.0、多言語対応。
# HuggingFace : google/gemma-4-12B
RTX 3080 Ti での動作
Q5_K_M
9 GB · 28 tok/s
3

🇨🇳 Qwen 3 14B

Alibaba · 14B パラメータ · Apache 2.0 · 131 072 トークン ctx

ハイブリッド思考を備えた14Bのデンス型モデル。STEM/コーディング分野でQwen 2.5 32B Baseと同等。

このランクの理由 ハイブリッド思考を備えた14Bのデンス型モデル。STEM/コーディング分野でQwen 2.5 32B Baseと同等。
ollama run qwen3:14b
RTX 3080 Ti での動作
Q5_K_M
11 GB · 20 tok/s
4

🇺🇸 Granite 4.2 8B

IBM · 8B パラメータ · Apache 2.0 · 128 000 トークン ctx

Granite 4.2 8B (IBM):Apache 2.0 の Dense モデル、128k コンテキスト、Q4 で VRAM 約 4.6 GB。エンタープライズ向けにチャット、コード、多言語推論に対応。

このランクの理由 Granite 4.2 8B (IBM):Apache 2.0 の Dense モデル、128k コンテキスト、Q4 で VRAM 約 4.6 GB。エンタープライズ向けにチャット、コード、多言語推論に対応。
ollama pull granite4.2
RTX 3080 Ti での動作
Q8
9 GB · 50 tok/s
5

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B パラメータ · Apache 2.0 · コンテキスト:16,000トークン

OLMo 3 7BをSFTで「thinking」向けにファインチューニングしたモデル:段階的な推論、16kのコンテキスト、Q4で約4.2 GBのVRAM。100%オープン、Apache 2.0ライセンス。

このランクの理由 OLMo 3 7BをSFTで「thinking」向けにファインチューニングしたモデル:段階的な推論、16kのコンテキスト、Q4で約4.2 GBのVRAM。100%オープン、Apache 2.0ライセンス。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
RTX 3080 Ti での動作
Q8
8 GB · 50 tok/s
6

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B パラメータ · MIT · 128 000 トークン ctx

GLM 5.3 (Zhipu):コードと推論に特化した Dense 7B モデル、128k コンテキスト、Q4 で VRAM 約 4.1 GB。軽量で、6~8 GB の GPU で動作、MIT ライセンス。

このランクの理由 GLM 5.3 (Zhipu):コードと推論に特化した Dense 7B モデル、128k コンテキスト、Q4 で VRAM 約 4.1 GB。軽量で、6~8 GB の GPU で動作、MIT ライセンス。
ollama pull glm-5.3
RTX 3080 Ti での動作
Q8
7GB · 50トークン/秒
7

🇺🇸 Phi-4 Reasoning 14B

Microsoft · 14B パラメータ · MIT · 32 768 トークン ctx

MITライセンスの14B推論モデル。MicrosoftのAIME24/25評価では、パラメータ数が5分の1でありながらR1-Distill-Llama-70Bを上回ります。

このランクの理由 MITライセンスの14B推論モデル。MicrosoftのAIME24/25評価では、パラメータ数が5分の1でありながらR1-Distill-Llama-70Bを上回ります。
ollama run phi4-reasoning:14b
RTX 3080 Ti での動作
Q5_K_M
11 GB · 20 tok/s

比較表

順位 モデル Params VRAM Q4 コンテキスト ライセンス RTX 3080 Ti での動作
#1 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 35 tok/s · Q8
#2 Gemma 4 12B 12B 7 GB 262 144 Apache 2.0 28 tok/s · Q5_K_M
#3 Qwen 3 14B 14B 9 GB 131 072 Apache 2.0 20 tok/s · Q5_K_M
#4 Granite 4.2 8B 8B 4.6 GB 128 000 Apache 2.0 50 tok/s · Q8
#5 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 50 tok/s · Q8
#6 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 50 tok/s · Q8
#7 Phi-4 Reasoning 14B 14B 9 GB 32 768 MIT 20 tok/s · Q5_K_M
ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

無料の要点まとめ

あなたのマシンでどのコーディング用モデルを動かせばよいですか?

メモを受け取る VRAM → 最適なコーディング用モデル → Ollamaコマンド (1画面に収まり、コピー&ペーストできます)。そして、実際に動く環境を整えるために、ローカルコパイロットキットをご利用ください。

ローカルコパイロットキット — そのまま貼り付けて使える Ollama + Cline + Aider の設定、調整済みの Modelfiles、トラブルシューティング、無期限で利用できるオンラインスペース →

スパムは送りません。配信停止は1クリックで可能です。お客様のデータは当サイトで保管し、転売することはありません。

ランキングの方法論

フィルター:Q4_K_M ≤ 11 GB。ボーナス 7-14B。12 GBのコンシューマーモデルで912 GB/sの帯域幅を記録

考慮した基準:

  • Q4_K_M ≤ 11 GB
  • Qwen 3 14B Q4で60トークン/秒
  • GDDR6X、記録的な帯域幅912 GB/s
  • 12 GB 最高速度

スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。

よくある質問

3080 Ti:12 GB クラスで最高のメモリ帯域幅?

はい — 912 GB/s vs 4070 Ti 504 GB/s、5070 672 GB/s。帯域幅を活用する7-14Bモデル(FP16 / Q5+)の場合、3080 Tiは12 GBで依然として最速です。詳細はこちら guide.

3080 Ti と 4070 Ti Super のどちらが適しているか?

3080 Ti = 12 GB + 912 GB/s。4070 Ti Super = 16 GB + 672 GB/s。14Bモデルで速度を重視するなら3080 Ti。24Bモデル(Mistral Small)を実行したいなら4070 Ti Super。参照: 4070 Ti Super.

中古の3080 Tiが約450〜500 €:お買い得ですか?

7〜14Bモデルの速度を重視するなら、はい。ただし、中古の3090は約650 €で、価格が30%高いだけで24 GBを搭載しているため、LLM用途にははるかに適しています。詳しくは RTX 3090.

3080 Tiで使うLLMの最適な構成は?

Qwen 3 14B Q4(~8 GB)で55〜65 tok/s、Mistral Nemo 12B Q5(~9 GB)で45 tok/s。コードおよびチャットの性能は優秀です。

さらに詳しく

QuelLLM キット 用途別のリファレンスガイド
すべてのキットを生涯利用可能 — 49 €