中級 11 分RTX 30

RTX 3080 / 3080 Ti(10~12 GB)で使えるLLMは? ?

端的な回答

ローカルでLLMを動かす場合、12 GBのRTX 3080または3080 Tiなら、Qwen 3.5 9BをQ8(10 GB)で、Gemma 4 12BをQ4(7 GB)で余裕を持って実行できます。7Bモデルでは約140トークン/秒で、llama.cppのテストでは3080の10 GB版で139.7トークン/秒が測定されています。10 GB版で動かせるのは、Q4の8〜9Bモデルまでです。3種類のカードはいずれも、20BモデルをQ4(13 GB)で読み込むには、一部をシステムRAMに配置する必要があります。

RTX 3080という名前のカードは3種類あります。2020年9月の10 GB、2022年1月の12 GB、そして2021年6月の12 GBの3080 Tiです。これらは同じチップを搭載していますが、メモリは異なり、実行可能な内容を決めるのはメモリです。本ガイドは、速度については公開測定値、容量については公式仕様に基づいています。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5080 16GB (GIGABYTE Gaming OC).

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#ローカルLLM向けのRTX 3080と3080 Ti:3つのバリエーション

12 GBのRTX 3080または3080 Tiは、Q4の120億パラメータモデルまたはQ8の90億パラメータモデルを快適に動作させます。10 GB版はQ4の70億から90億パラメータのモデルに限定されます。QuelLLMのカタログによると、Gemma 4 12BはQ4で7 GB、Q5で9 GBです。Qwen 3.5 9BはQ4で6 GB、Q8で10 GBであり、コンテキストを追加すると最低12 GBが必要です。速度面では、これらのカードは以前の世代の中で最も速い部類に入ります。llama.cppの公開テーブルによると、3080 10 GBはQ4_0の70億パラメータモデルで1秒あたり139.7トークンを生成し、RTX 3060 12 GB(75.6)のほぼ2倍です。したがって、LLM向けのRTX 3080の選択は速度ではなく、メモリによって決まります。

RTX 3080 10 GB
2020年9月、CUDAコア8,704基、320ビットバスの10GB GDDR6Xメモリ、帯域幅760GB/s。カードの消費電力は320Wです。
RTX 3080 12 GB
2022年1月、8,960コア、12GBのGDDR6X(384ビットバス)で912GB/s、350W。帯域幅が約20%増加しています。
RTX 3080 Ti
2021年6月、10,240コア、384ビットバスによるGDDR6X 12GB搭載(3080 12GBモデルと同等)、したがって期待される帯域幅も同等で、350W。

速度の上限を計算すると、仕組みが理解しやすくなります。テキスト生成ではトークンごとに重みを読み込むため、帯域幅が最大速度を決めます。3080 の12GB 版と Ti は10GB 版より帯域幅が20%高いものの、3080 Ti で主に増えているのは演算コアです。演算コアは、生成よりもプロンプトの読み取りを大きく高速化します。

#3080 10GB、12GBまたは3080 Ti:どのモデルを選ぶか

RTX 3080の3種類
基準3080 10GB3080 12 GB3080 Ti 12 GB
CUDAコア8 7048 96010 240
メモリ10 GB GDDR6X12GB GDDR6X12GB GDDR6X
バス/帯域幅320ビット / 760GB/s384ビット / 912GB/s384ビット、帯域幅は同じと見込まれます
GPUの性能320 W350 W350 W
Llama 2 7B Q4_0での生成139.7 tok/s(測定値)推定:最大約167推定:12 GB版に近い

ローカルAI用途では、3080 Tiと3080 12 GBはどちらを選んでもほぼ同じです。メモリ容量はどちらも12 GBで、バスも同じ、生成速度も非常に近いからです。この2枚の推定値は、10 GB版で測定した効率を912 GB/sに適用した上限値です。実測では、同じく384ビットのバスを持つ3090が158.2トークン/秒を記録しています。したがって、コア数に惑わされず、2枚のうち安い方を選んでください。一方、10 GB版は容量の点で一段劣ります。10 GBでは、90億パラメータのモデルをQ8で動かすことはできません。

#メモリ容量別の対応モデル

10 GB と 12 GB に収まるモデル(モデル容量は QuelLLM カタログに基づく)
モデルと量子化モデル容量3080 10GB3080 12 GB / Ti
Qwen 3.5 9B(Q4)6 GBはい、コンテキストありではい、コンテキストも多く確保できます
Gemma 4 12BのQ4量子化7 GBはい、コンテキスト長は中程度はい、快適です
Gemma 4 12B(Q5量子化)9 GB余裕がほとんどないはい、コンテキスト長は中程度
Qwen 3.5 9B Q810 GBいいえはい。ただし、コンテキスト量を少なくする必要があります
gpt-oss 20BのQ4版13 GBいいえ不可:容量を1 GB超過

この表では、2つの点に注目してください。まず、意外に思えるかもしれませんが、3080の10 GBモデルでもGemma 4 12BをQ4(7 GB)で実行できます。コンテキスト用に3 GBが残り、中程度の長さの会話には十分です。次に、12 GBと16 GBの差は明確です。gpt-oss 20Bのような200億パラメータ級のモデルはQ4で13 GBあり、3枚のカードのどれにも収まりません。こうしたモデルが目的なら、16 GB以上のカードが必要です。12 GBのVRAMに関するガイドでは、まさに12 GBで何ができるかを詳しく説明しています。

#インストール、電源、設定

RTX 3080と3080 Tiは、Ollamaが掲載しているCompute Capability 8.6のカードに含まれます。Ollamaはバージョン550以降のドライバーを必要とします。これらのカードで特に注意したいのは電力です。NVIDIAの仕様表ではカードの消費電力を350 W、10 GBモデルでは320 Wとし、システム電源には750 Wを推奨しています。カードを取り付ける前に電源を確認し、カードの各コネクターには別々のケーブルを接続してください。

  1. 01
    電源を確認してください。
    電源ユニットの容量が 750 W に達しており、お使いのグラフィックカードのモデルに必要なコネクターが備わっていることを確認してください。
  2. 02
    ドライバーのインストールとOllamaのセットアップ
    550以降のドライバーをインストールし、その後Ollamaをインストールして、選択したモデルを起動してください。
  3. 03
    メモリを設定する
    10GBバージョンでは、OLLAMA_FLASH_ATTENTION=1 かつ OLLAMA_KV_CACHE_TYPE=q8_0 でサーバーを起動してください。ドキュメントでは、Flash Attentionが有効になるとK/Vキャッシュが量子化できると明記されています。
  4. 04
    制御する
    nvidia-smiを使って、負荷がかかっているときのメモリ使用状況と温度を監視してください。これらのカードは、最近のモデルよりも発熱が大きいためです。
Linux:メモリ設定を適用してOllamaを起動
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#速度:公開された測定値と、それに基づく外挿推定

llama.cppの共同作成ベンチマーク表では、Llama 2 7BをQ4_0(ファイルサイズ3.56GiB、つまり3.82GB)で測定しています。RTX 3080 10GBの結果は、生成が139.65トークン/秒、プロンプト読み込みが5,014トークン/秒です。Flash Attentionを使うと、生成は139.95トークン/秒とほぼ変わりませんが、読み込みは5,570トークン/秒となり、約11%向上します。760GB/sの帯域幅からは、理論上、約199トークン/秒が見込めます。測定値はこの上限の70%に達しています。同じチップでも、スループットはドライバー、システム、カードのメーカーによっても変わります。

他のグラフィックスカードとの比較(Llama 2 7B Q4_0、生成時)
カードメモリ生成速度 (tok/s)
RTX 3060 12 GB12 GB75,6
RTX 3080 10 GB10 GB139,7
RTX 309024 GB158,2

ファイルサイズに基づく比例計算では、3080 10 GBはQwen 3.5 9BのQ4(6 GB)で最大約89トークン/秒、Gemma 4 12BのQ4(7 GB)で最大約76トークン/秒になると推定されます。これらは理論上の上限であり、実測値ではありません。3080 12 GBでは、Qwen 3.5 9BのQ8(10 GB)は理論上65トークン/秒未満となりますが、快適に使える速度です。いずれの場合も、これらのカードの生成速度は人が文章を読む速度を大幅に上回ります。制約になるのは速度ではなく容量です。

プロンプトの読み込み速度は、これらのカードの第二の強みです。3080 10 GB は 5,014 トークン/秒で、10,000 トークンの文書を約 2 秒で読み込みます。Flash Attention を使用すると 5,570 トークン/秒となり、もう少し短い時間で読み込めます。この二つは、一定のスループットを前提とした理論上の計算です。3060 12 GB(2,138 トークン/秒)に比べて、約 2 倍の速さです。複数の人が同じマシンを共有する場合、このプロンプトの読み込みはさらに重要になります。各リクエストは、応答を少しでも生成する前に、まず自身のコンテキストを読み直す必要があり、ここでより低性能なカードとの差が広がります。大容量の文書を扱う RAG や、リクエストのたびに大きなファイルを読み直すコードアシスタントでは、使い勝手が確実に向上します。生成速度はすでに人間が文章を読む速さを大きく上回っているため、生成速度の差よりも、この読み込み速度の差のほうがはるかに実感しやすいのです。

#2026年に購入するなら:これらのカードの位置づけ

16 GBの新品カードと比べると、中古RTX 3080の利点は手頃な価格で速度を得られることですが、メモリは不足します。RTX 3090は24 GBで158.2 tokens/sを記録しており、200億〜300億パラメータのモデルを狙う中古市場で有力な選択肢です。中古カードの価格は毎週変わります。当サイトの価格追跡では各カードの最低価格とVRAM 1 GBあたりの価格を確認できます。ここに固定の価格を記すより、そちらを参照する方が確実です。

ターゲットモデルに応じたカードの選定
ターゲットモデル必要なメモリ適したカード
Q4では8〜9Bモデルの重み:6 GB8GB搭載のグラフィックカードならどれでも
Q4の12BモデルまたはQ8の9Bモデル重みのサイズは7〜10 GB3080 12GBまたはTi、または3080 10GB(Q4用)
Q4の20Bモデル(gpt-oss 20B)重みの容量は13 GB16 GB以上のカード

#2026年の結論

中古の 3080 12 GB または 3080 Ti
12GBから16GBの新しいカードよりもはるかに価格が低い場合に非常に良い選択です。12GBで高速動作し、9BのQ8またはQ4で12Bのモデルを用いる場合、余裕があります。
3080 10GB
Q4の80億〜120億パラメータのモデルに役立ちます。90億パラメータのモデルをQ8で使うことはできず、コンテキスト用の余裕もないため、速度より容量を重視するなら、3060 12 GBのほうが適している場合があります。
購入時
電源、メモリ容量が10GBか12GBかの表記、ファンの状態を確認してください。これらのカードは発熱を伴う使用を経ており、すでに数年使われています。

#よくある質問

よくある質問
LLM 用の RTX 3080 は 10 GB 版と 12 GB 版のどちらを選ぶべきですか?+
価格が近いなら12GBモデルを選んでください。追加の2GBにより、Qwen 3.5 9BのQ8(モデル容量10GB)を利用でき、Gemma 4 12Bにも余裕が生まれます。一方、10GBモデルでは、Q4の8〜9Bモデルと、コンテキストを控えめにしたQ4の12Bモデルまでに限られます。さらに、バス幅が広いため、帯域幅が約20%増えます。
LLM用には RTX 3080 Ti と RTX 3090 のどちらを選ぶべきですか?+
3090は24 GBで12 GBに比べ、llama.cppのテストで158.2トークン/秒を記録し、Q4で200億から300億パラメータのモデルに対応します。120億パラメータ以下であれば3080 Tiで十分です。これらのモデルでは生成速度はほぼ同等ですが、処理能力に差があります。
RTX 3080 12 GBはgpt-oss 20Bを実行できますか?+
カードのVRAMには完全には収まりません。カタログでは、このモデルのQ4でのサイズは13 GBとされており、3080 12 GBのメモリ容量を1 GB上回ります。そのため、モデルはVRAMとシステムRAMに分散して配置され、速度が低下します。最大速度で実行するには、16 GBのメモリを搭載したカードが必要です。
RTX 3080では1秒あたり何トークン生成できますか?+
llama.cppの公開表では、3080 10 GBでLlama 2 7BをQ4_0で動かした場合、139.7トークン/秒とされています。より重いモデルは遅くなり、理論上の推定では9BのQ4で約89トークン/秒、12BのQ4で約76トークン/秒です。12 GB版とTi版はもう少し速いと考えられますが、公開された測定値はありません。
RTX 3080 Ti にはどのような電源が必要ですか?+
NVIDIAはカードの消費電力を350Wと発表し、3080と3080 Tiのどちらにも750Wのシステム電源を推奨しています。650Wの電源は、この推奨値を下回ります。これらのカードは負荷時に大量の熱を放出するため、適切なコネクタとケース内の十分な通気も確保してください。
OllamaはRTX 3080で動作しますか?+
はい。OllamaはRTX 3080と3080 TiをCompute Capability 8.6のカードとして掲載しており、バージョン550以降のドライバーを必要とします。10GB版では、長いコンテキストでのメモリ使用量を減らすため、Flash AttentionとK/Vキャッシュの量子化を有効にしてください。
RTX 3080は2026年でも買う価値がありますか?+
はい。中古価格が、同等のメモリ容量を持つ新品のカードよりも十分に安ければ、まだ購入する価値があります。速度は非常に優れていますが、重要なのは10GBまたは12GBという容量です。判断する前に、当サイトの価格動向を確認し、16GBのカードと比較してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。