RTX 2080 / 2080 Super(8 GB)で利用可能な LLM は? ?
RTX 2080または2080 Super(GDDR6 8 GB)は、Granite 4.2 8B(4.6 GB)やQwen 3.5 9B(6 GB)など、パラメータ数が70億~90億のQ4量子化モデルを問題なく実行できます。この2種類のカードについて公開された測定値はありませんが、256ビットのバスを備えているため、7Bモデルで約88トークン/秒という2070 Superと同程度の速度が見込まれます。制約となるのは、依然として8 GBのメモリ容量です。
RTX 2080(2018年9月)と RTX 2080 Super(2019年7月)はハイエンドのグラフィックカードでしたが、メモリが 8 GB しかないため、2026年にはローカル AI 向けの強みは限られています。このガイドでは、資料で裏付けられている内容と推定を区別し、これらのカードを 12 GB の代替カードと比較するとともに、モデルが実際にメモリに収まるかを確認する方法を説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16GB (ASUS Prime).
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#RTX 2080と2080 Super:動かせるモデル
RTX 2080 または 2080 Super では、70 億から 90 億パラメータのモデルを Q4 で使用する場合、完全にビデオメモリに収まり、高速に動作します。QuelLLM のカタログによると、Granite 4.2 8B は Q4 で 4.6 GB、Qwen 3.5 9B は 6 GB を必要とし、数千トークンのコンテキストに十分な余裕があります。Gemma 4 12B(Q4 で 7 GB)は 8 GB の上限に達しており、会話が続くとオーバーフローします。これらの 2 つのカードはどちらも llama.cpp の公開パフォーマンス表には掲載されていませんが、2070 Super と同じ 256 ビットバスを共有しているため、位置づけは可能です。2070 Super は 70 億パラメータのモデルで Q4_0 を使用した場合、1 秒あたり 88 トークンと測定されています。より高速なメモリを持つ 2080 Super は、わずかに優れた性能を発揮すると考えられます。要約すると、高速ですが、8 GB のメモリに制約されます。
- RTX 2080
- 2018年9月、CUDAコア2,944基、GDDR6メモリ8GB、256ビットバス。14Gbit/sでメモリ帯域幅は448GB/s。
- RTX 2080 Super
- 2019年7月、CUDAコア3,072基、8GBのGDDR6を搭載。メモリ速度は15.5Gbit/s、帯域幅は496GB/sで、2080より約11%高くなっています。
- LLMの場合
- 生成は主に帯域幅に依存します。Super はわずかに優れますが、容量は変わりません。
#対応モデル:8GB以内のもの
| モデル | Q4 での重み | 8GBで期待できる性能 |
|---|---|---|
| Granite 4.2 8B | 4.6 GB | 快適で、数千トークンのコンテキストをサポート |
| Qwen 3.5 9B | 6 GB | Q4ならメモリに収まります。コンテキストは適度な長さに抑え、必要に応じてK/Vキャッシュを調整してください |
| Gemma 4 12B | 7 GB | 余裕がなさすぎる:キャッシュとシステム用のメモリを確保できない |
| Qwen 3.5 9B Q8 | 10 GB | 収まりません:8 GBを超えます |
どのモデルでも考え方は同じです。重みに、コンテキストキャッシュと、ドライバーや画面表示用の約1 GBの余裕を加えて見積もります。画面をそのカードに接続している場合は、メモリの一部がすでに画面用に確保されています。8 GBカードでは、重みを最大6 GBに抑えるのが安全な目安です。より長いコンテキストが必要なら、K/Vキャッシュの量子化が最も効果的です。
#モデルが実際にカードに収まるかを確認してください。
速度低下の多くは、モデル全体が VRAM に収まらないことが原因です。その場合、Ollama はモデルの一部を CPU 側に割り振り、エラーメッセージを出さずに処理速度が低下します。Ollama のドキュメントには、この状態を確認する方法が示されています。ollama ps コマンドは、Processor 列にモデルが読み込まれたメモリの種類を表示します。100% GPU はモデル全体がグラフィックカードのメモリに収まっていることを意味し、48%/52% CPU/GPU のような比率は RAM と VRAM に分けて読み込まれていることを示します。
- 01モデルを読み込むollama runの後にモデル名を指定してモデルを起動し、最初のプロンプトを送信してください。
- 02割当の確認別のターミナルで ollama ps と入力してください。Processor列の表示と、表示されたサイズを記録してください。
- 03必要に応じて修正してくださいモデルがGPU上で100%使用されていない場合は、コンテキストを縮小したり、より軽い量子化を選択したり、より小さなモデルに切り替えるか、キャッシュK/Vの量子化を有効にすることもできます。ドキュメントでは、これはFlash Attentionを必要とすることを明記しています。
#速度:実測値と推定値
llama.cpp の共同編集の性能表(Llama 2 7B、Q4_0、ファイルサイズ 3.56 GiB)には、2070 Super、2080 Ti、3060 12 GB、4060 Ti 8 GB が掲載されていますが、2080 と2080 Super は掲載されていません。この表には、同じチップを搭載していても、ドライバー、システム、カードによって結果が変わると明記されています。以下では、まず測定結果を示し、次にそこから妥当に推測できることを説明します。
| カード | メモリ | バス | 生成 | ステータス |
|---|---|---|---|---|
| RTX 2070 Super | 8 GB | 256ビット | 88,1 | 公開された測定値 |
| RTX 2080 / 2080 Super | 8 GB | 256ビット | ほぼ 88 から 97 | 推定:バスは同じで、Superのほうがメモリが高速 |
| RTX 2080 Ti | 11 GB | 352ビット | 107,5 | 公開された測定値 |
| RTX 3060 12 GB | 12 GB | 192 ビット | 75,6 | 公開された測定値 |
| RTX 4060 Ti 8 GB | 8 GB | 128 ビット | 63,9 | 公開された測定値 |
2080の行の推定値は、単純なルールに基づいています。帯域幅が448 GB/sの2080は2070 Superと非常に近い生成速度になるはずで、496 GB/sの2080 Superはさらに最大10%速くなる可能性があります。つまり、おおよそ毎秒95トークンです。これは推定であり、実測値ではありません。測定結果として引用しないでください。
この表は、GPUを交換するかどうか迷っている方に役立つ教訓を示しています。8GBのRTX 4060 Tiは、より新しいモデルであるにもかかわらず、生成速度が63.9トークン/秒で、2070 Superより遅くなっています。これは128ビットのバスが帯域幅を制限しているためです。テキスト生成では、GPUの世代が新しいからといって、速度が上がるとは限りません。新しい世代が主にもたらすのは、エネルギー効率と新しい機能であり、メモリ容量の増加ではありません。
#2080 SuperとRTX 3060 12 GBの比較:メモリ容量がものをいう
3060 12 GBは2070 Superより生成速度が遅いものの(テストでは毎秒75.6トークン対88.1トークン)、VRAM容量は4 GB多くなっています。ローカルAIでは、この容量が重要です。12 GBあれば、Gemma 4 12B(Q4で7 GB)を読み込んでもコンテキスト用の余裕が残りますが、8 GBのカードではそうはいきません。2080 Superも、速度でこの不利を補うことはできません。毎秒約95トークンまで速くなっても、12Bモデルがメモリに収まらないという事実は変わらないためです。
| 基準 | RTX 2080 Super | RTX 3060 12 GB |
|---|---|---|
| メモリ | 8 GB | 12 GB |
| 生成(7B Q4_0) | 約95トークン/秒と推定されています | 75.6トークン/秒(測定値) |
| 120億パラメータのモデル | いいえ(モデルの重みだけで7GB、余裕なし) | はい、コンテキストありで |
| 70〜90億パラメータのモデル | はい | はい |
結論は、何を使いたいかによって変わります。80億または90億パラメータのアシスタントなら、お使いの2080で十分で、3060 12 GBに移行しても速度は向上しません。12Bモデルや長いコンテキストを使いたい場合は、買い替える理由があります。中古価格は毎週変わるので、固定された数値に頼るのではなく、価格の推移を確認してください。
#8 GBで長いコンテキストを使う:鍵を握るK/Vキャッシュ
8 GBのグラフィックカードでは、問題となるのはモデルではなくコンテキストキャッシュです。会話の各トークンによってメモリ上のデータが増えるため、会話が空の状態では収まっていたQ4の8Bモデルでも、長い文書を貼り付けるとメモリ容量を超えることがあります。Ollamaには2つの対策があります。Flash Attentionは、グラフィックカードが対応していればソフトウェアによって自動的に有効になり、コンテキストが長くなったときに必要なメモリを削減します。これを有効にするとK/Vキャッシュを量子化でき、ドキュメントによると、q8_0形式のメモリ使用量はデフォルト形式の約半分です。q4_0形式ではさらにメモリを節約できますが、コンテキストが長い場合には精度の低下がより顕著になります。
この設定はグローバルです。インスタンスが提供するすべてのモデルに適用されるため、専用マシンでは便利ですが、頻繁にモデルを変更する場合は注意が必要です。ベストプラクティスは、設定変更前に測定することです。モデルを読み込み、使用用途を代表するコンテキストを埋め、ollama psでモデルがGPUに100%残っていることを確認します。そうであれば余裕がありますが、そうでない場合はキャッシュを量子化するか、コンテキストを縮小してください。
#8GBでは不足する場合:次のステップ
| カードのメモリ | 実行可能になるモデル | Q4 での重み |
|---|---|---|
| 8GB(あなたのカード) | 70〜90億パラメータのモデル | 4.6GB から 6GB |
| 12 GB | コンテキストも確保できるGemma 4 12B | 7 GB |
| 16 GB | gpt-oss 20B(13 GB)またはQwen 3.5 27B(16 GB、ほとんど余裕なし) | 13から16GB |
この表の読み方は簡単です。メモリ容量が一段増えるごとに、使えるモデルのカテゴリが広がります。一方、毎秒30~40トークンを超えると、速度がさらに上がっても使い心地はほとんど変わりません。購入を迷っているなら、まずどのモデルを動かしたいかを考え、そのモデルに必要なメモリ容量を備えたカードを選んでください。270億パラメータのモデルを16 GBで動かすのは、すでに容量の限界に近い状態です。その規模のモデルが目標なら、24 GBのカードを検討してください。
#2026年のドライバーとサポート
RTX 2080と2080 Tiは、Ollamaが対応カードとして挙げているCompute Capability 7.5のカードに含まれます。Ollamaにはバージョン550以降のドライバーが必要です。これは現在のOllamaの各バージョンに当てはまります。インストールに失敗した場合は、まずnvidia-smiでドライバーのバージョンを確認してください。したがって、これらのカードへのOllamaやllama.cppのインストールがソフトウェア上の制約で阻まれることを心配する理由はありません。注意すべき点はドライバーのバージョンだけです。ほかの原因を探す前に、ドライバーを更新してください。
#2026年の結論
- 使い続けるのがおすすめの場合
- すでにお使いのPCに搭載されていて、Q4で70億〜90億パラメータのモデルを使いたい場合です。速度は十分で、追加費用もかかりません。
- AI用途での購入は避けてください
- ただし、価格が安く、保証内容が明確な場合は別です。価格が近いなら、12 GB のグラフィックスカードのほうが、毎秒数トークン速くなることよりも価値があります。
- 次の条件に当てはまる場合は別の選択肢を検討してください
- 12B、14B、またはそれ以上のモデル、あるいは8Bモデルで1万トークンを超えるコンテキストを必要とする場合、12 GBから16 GBのVRAMが必要です。
#よくある質問
RTX 2080で80億〜90億パラメータのモデルを実行できるか?+
LLMにはRTX 2080 SuperとRTX 2080 Tiのどちらが適していますか?+
Gemma 4 12BをRTX 2080 Superで実行可能ですか?+
モデルが完全にGPU上で動作しているかをどう確認しますか?+
RTX 2080は、RTX 4060 Ti 8GBよりもテキスト生成において速いですか?+
Ollamaは2026年においてRTX 2080で依然として動作しますか?+
- 出典:CUDA での llama.cpp の性能表
- 出典:Ollama がサポートする NVIDIA カード
- 出典:Ollama FAQ(ollama ps、K/Vキャッシュ)
- 出典:GeForce 20シリーズの仕様
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。