RTX 3080 / 3080 Ti(10~12 GB)で使えるLLMは? ?
ローカルでLLMを動かす場合、12 GBのRTX 3080または3080 Tiなら、Qwen 3.5 9BをQ8(10 GB)で、Gemma 4 12BをQ4(7 GB)で余裕を持って実行できます。7Bモデルでは約140トークン/秒で、llama.cppのテストでは3080の10 GB版で139.7トークン/秒が測定されています。10 GB版で動かせるのは、Q4の8〜9Bモデルまでです。3種類のカードはいずれも、20BモデルをQ4(13 GB)で読み込むには、一部をシステムRAMに配置する必要があります。
RTX 3080という名前のカードは3種類あります。2020年9月の10 GB、2022年1月の12 GB、そして2021年6月の12 GBの3080 Tiです。これらは同じチップを搭載していますが、メモリは異なり、実行可能な内容を決めるのはメモリです。本ガイドは、速度については公開測定値、容量については公式仕様に基づいています。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5080 16GB (GIGABYTE Gaming OC).
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#ローカルLLM向けのRTX 3080と3080 Ti:3つのバリエーション
12 GBのRTX 3080または3080 Tiは、Q4の120億パラメータモデルまたはQ8の90億パラメータモデルを快適に動作させます。10 GB版はQ4の70億から90億パラメータのモデルに限定されます。QuelLLMのカタログによると、Gemma 4 12BはQ4で7 GB、Q5で9 GBです。Qwen 3.5 9BはQ4で6 GB、Q8で10 GBであり、コンテキストを追加すると最低12 GBが必要です。速度面では、これらのカードは以前の世代の中で最も速い部類に入ります。llama.cppの公開テーブルによると、3080 10 GBはQ4_0の70億パラメータモデルで1秒あたり139.7トークンを生成し、RTX 3060 12 GB(75.6)のほぼ2倍です。したがって、LLM向けのRTX 3080の選択は速度ではなく、メモリによって決まります。
- RTX 3080 10 GB
- 2020年9月、CUDAコア8,704基、320ビットバスの10GB GDDR6Xメモリ、帯域幅760GB/s。カードの消費電力は320Wです。
- RTX 3080 12 GB
- 2022年1月、8,960コア、12GBのGDDR6X(384ビットバス)で912GB/s、350W。帯域幅が約20%増加しています。
- RTX 3080 Ti
- 2021年6月、10,240コア、384ビットバスによるGDDR6X 12GB搭載(3080 12GBモデルと同等)、したがって期待される帯域幅も同等で、350W。
速度の上限を計算すると、仕組みが理解しやすくなります。テキスト生成ではトークンごとに重みを読み込むため、帯域幅が最大速度を決めます。3080 の12GB 版と Ti は10GB 版より帯域幅が20%高いものの、3080 Ti で主に増えているのは演算コアです。演算コアは、生成よりもプロンプトの読み取りを大きく高速化します。
#3080 10GB、12GBまたは3080 Ti:どのモデルを選ぶか
| 基準 | 3080 10GB | 3080 12 GB | 3080 Ti 12 GB |
|---|---|---|---|
| CUDAコア | 8 704 | 8 960 | 10 240 |
| メモリ | 10 GB GDDR6X | 12GB GDDR6X | 12GB GDDR6X |
| バス/帯域幅 | 320ビット / 760GB/s | 384ビット / 912GB/s | 384ビット、帯域幅は同じと見込まれます |
| GPUの性能 | 320 W | 350 W | 350 W |
| Llama 2 7B Q4_0での生成 | 139.7 tok/s(測定値) | 推定:最大約167 | 推定:12 GB版に近い |
ローカルAI用途では、3080 Tiと3080 12 GBはどちらを選んでもほぼ同じです。メモリ容量はどちらも12 GBで、バスも同じ、生成速度も非常に近いからです。この2枚の推定値は、10 GB版で測定した効率を912 GB/sに適用した上限値です。実測では、同じく384ビットのバスを持つ3090が158.2トークン/秒を記録しています。したがって、コア数に惑わされず、2枚のうち安い方を選んでください。一方、10 GB版は容量の点で一段劣ります。10 GBでは、90億パラメータのモデルをQ8で動かすことはできません。
#メモリ容量別の対応モデル
| モデルと量子化 | モデル容量 | 3080 10GB | 3080 12 GB / Ti |
|---|---|---|---|
| Qwen 3.5 9B(Q4) | 6 GB | はい、コンテキストありで | はい、コンテキストも多く確保できます |
| Gemma 4 12BのQ4量子化 | 7 GB | はい、コンテキスト長は中程度 | はい、快適です |
| Gemma 4 12B(Q5量子化) | 9 GB | 余裕がほとんどない | はい、コンテキスト長は中程度 |
| Qwen 3.5 9B Q8 | 10 GB | いいえ | はい。ただし、コンテキスト量を少なくする必要があります |
| gpt-oss 20BのQ4版 | 13 GB | いいえ | 不可:容量を1 GB超過 |
この表では、2つの点に注目してください。まず、意外に思えるかもしれませんが、3080の10 GBモデルでもGemma 4 12BをQ4(7 GB)で実行できます。コンテキスト用に3 GBが残り、中程度の長さの会話には十分です。次に、12 GBと16 GBの差は明確です。gpt-oss 20Bのような200億パラメータ級のモデルはQ4で13 GBあり、3枚のカードのどれにも収まりません。こうしたモデルが目的なら、16 GB以上のカードが必要です。12 GBのVRAMに関するガイドでは、まさに12 GBで何ができるかを詳しく説明しています。
#インストール、電源、設定
RTX 3080と3080 Tiは、Ollamaが掲載しているCompute Capability 8.6のカードに含まれます。Ollamaはバージョン550以降のドライバーを必要とします。これらのカードで特に注意したいのは電力です。NVIDIAの仕様表ではカードの消費電力を350 W、10 GBモデルでは320 Wとし、システム電源には750 Wを推奨しています。カードを取り付ける前に電源を確認し、カードの各コネクターには別々のケーブルを接続してください。
- 01電源を確認してください。電源ユニットの容量が 750 W に達しており、お使いのグラフィックカードのモデルに必要なコネクターが備わっていることを確認してください。
- 02ドライバーのインストールとOllamaのセットアップ550以降のドライバーをインストールし、その後Ollamaをインストールして、選択したモデルを起動してください。
- 03メモリを設定する10GBバージョンでは、OLLAMA_FLASH_ATTENTION=1 かつ OLLAMA_KV_CACHE_TYPE=q8_0 でサーバーを起動してください。ドキュメントでは、Flash Attentionが有効になるとK/Vキャッシュが量子化できると明記されています。
- 04制御するnvidia-smiを使って、負荷がかかっているときのメモリ使用状況と温度を監視してください。これらのカードは、最近のモデルよりも発熱が大きいためです。
#速度:公開された測定値と、それに基づく外挿推定
llama.cppの共同作成ベンチマーク表では、Llama 2 7BをQ4_0(ファイルサイズ3.56GiB、つまり3.82GB)で測定しています。RTX 3080 10GBの結果は、生成が139.65トークン/秒、プロンプト読み込みが5,014トークン/秒です。Flash Attentionを使うと、生成は139.95トークン/秒とほぼ変わりませんが、読み込みは5,570トークン/秒となり、約11%向上します。760GB/sの帯域幅からは、理論上、約199トークン/秒が見込めます。測定値はこの上限の70%に達しています。同じチップでも、スループットはドライバー、システム、カードのメーカーによっても変わります。
| カード | メモリ | 生成速度 (tok/s) |
|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 |
| RTX 3080 10 GB | 10 GB | 139,7 |
| RTX 3090 | 24 GB | 158,2 |
ファイルサイズに基づく比例計算では、3080 10 GBはQwen 3.5 9BのQ4(6 GB)で最大約89トークン/秒、Gemma 4 12BのQ4(7 GB)で最大約76トークン/秒になると推定されます。これらは理論上の上限であり、実測値ではありません。3080 12 GBでは、Qwen 3.5 9BのQ8(10 GB)は理論上65トークン/秒未満となりますが、快適に使える速度です。いずれの場合も、これらのカードの生成速度は人が文章を読む速度を大幅に上回ります。制約になるのは速度ではなく容量です。
プロンプトの読み込み速度は、これらのカードの第二の強みです。3080 10 GB は 5,014 トークン/秒で、10,000 トークンの文書を約 2 秒で読み込みます。Flash Attention を使用すると 5,570 トークン/秒となり、もう少し短い時間で読み込めます。この二つは、一定のスループットを前提とした理論上の計算です。3060 12 GB(2,138 トークン/秒)に比べて、約 2 倍の速さです。複数の人が同じマシンを共有する場合、このプロンプトの読み込みはさらに重要になります。各リクエストは、応答を少しでも生成する前に、まず自身のコンテキストを読み直す必要があり、ここでより低性能なカードとの差が広がります。大容量の文書を扱う RAG や、リクエストのたびに大きなファイルを読み直すコードアシスタントでは、使い勝手が確実に向上します。生成速度はすでに人間が文章を読む速さを大きく上回っているため、生成速度の差よりも、この読み込み速度の差のほうがはるかに実感しやすいのです。
#2026年に購入するなら:これらのカードの位置づけ
16 GBの新品カードと比べると、中古RTX 3080の利点は手頃な価格で速度を得られることですが、メモリは不足します。RTX 3090は24 GBで158.2 tokens/sを記録しており、200億〜300億パラメータのモデルを狙う中古市場で有力な選択肢です。中古カードの価格は毎週変わります。当サイトの価格追跡では各カードの最低価格とVRAM 1 GBあたりの価格を確認できます。ここに固定の価格を記すより、そちらを参照する方が確実です。
| ターゲットモデル | 必要なメモリ | 適したカード |
|---|---|---|
| Q4では8〜9B | モデルの重み:6 GB | 8GB搭載のグラフィックカードならどれでも |
| Q4の12BモデルまたはQ8の9Bモデル | 重みのサイズは7〜10 GB | 3080 12GBまたはTi、または3080 10GB(Q4用) |
| Q4の20Bモデル(gpt-oss 20B) | 重みの容量は13 GB | 16 GB以上のカード |
- ローカル AI 向けグラフィックカードの価格(週次チェック)
- RTX 3090 / 3090 Ti (24 GB)で使えるLLMは?
- RTX 4070 Ti Super (16 GB) にはどの LLM が最適?
#2026年の結論
- 中古の 3080 12 GB または 3080 Ti
- 12GBから16GBの新しいカードよりもはるかに価格が低い場合に非常に良い選択です。12GBで高速動作し、9BのQ8またはQ4で12Bのモデルを用いる場合、余裕があります。
- 3080 10GB
- Q4の80億〜120億パラメータのモデルに役立ちます。90億パラメータのモデルをQ8で使うことはできず、コンテキスト用の余裕もないため、速度より容量を重視するなら、3060 12 GBのほうが適している場合があります。
- 購入時
- 電源、メモリ容量が10GBか12GBかの表記、ファンの状態を確認してください。これらのカードは発熱を伴う使用を経ており、すでに数年使われています。
#よくある質問
LLM 用の RTX 3080 は 10 GB 版と 12 GB 版のどちらを選ぶべきですか?+
LLM用には RTX 3080 Ti と RTX 3090 のどちらを選ぶべきですか?+
RTX 3080 12 GBはgpt-oss 20Bを実行できますか?+
RTX 3080では1秒あたり何トークン生成できますか?+
RTX 3080 Ti にはどのような電源が必要ですか?+
OllamaはRTX 3080で動作しますか?+
RTX 3080は2026年でも買う価値がありますか?+
- 出典:CUDA での llama.cpp の性能表
- 出典:NVIDIAのRTX 3080および3080 Tiの仕様ページ
- 出典:Ollama がサポートする NVIDIA カード
- 出典:OllamaのFAQ(Flash Attention、K/Vキャッシュ)
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。