中級 11 分RTX 20

RTX 2080 / 2080 Super(8 GB)で利用可能な LLM は? ?

端的な回答

RTX 2080または2080 Super(GDDR6 8 GB)は、Granite 4.2 8B(4.6 GB)やQwen 3.5 9B(6 GB)など、パラメータ数が70億~90億のQ4量子化モデルを問題なく実行できます。この2種類のカードについて公開された測定値はありませんが、256ビットのバスを備えているため、7Bモデルで約88トークン/秒という2070 Superと同程度の速度が見込まれます。制約となるのは、依然として8 GBのメモリ容量です。

RTX 2080(2018年9月)と RTX 2080 Super(2019年7月)はハイエンドのグラフィックカードでしたが、メモリが 8 GB しかないため、2026年にはローカル AI 向けの強みは限られています。このガイドでは、資料で裏付けられている内容と推定を区別し、これらのカードを 12 GB の代替カードと比較するとともに、モデルが実際にメモリに収まるかを確認する方法を説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16GB (ASUS Prime).

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#RTX 2080と2080 Super:動かせるモデル

RTX 2080 または 2080 Super では、70 億から 90 億パラメータのモデルを Q4 で使用する場合、完全にビデオメモリに収まり、高速に動作します。QuelLLM のカタログによると、Granite 4.2 8B は Q4 で 4.6 GB、Qwen 3.5 9B は 6 GB を必要とし、数千トークンのコンテキストに十分な余裕があります。Gemma 4 12B(Q4 で 7 GB)は 8 GB の上限に達しており、会話が続くとオーバーフローします。これらの 2 つのカードはどちらも llama.cpp の公開パフォーマンス表には掲載されていませんが、2070 Super と同じ 256 ビットバスを共有しているため、位置づけは可能です。2070 Super は 70 億パラメータのモデルで Q4_0 を使用した場合、1 秒あたり 88 トークンと測定されています。より高速なメモリを持つ 2080 Super は、わずかに優れた性能を発揮すると考えられます。要約すると、高速ですが、8 GB のメモリに制約されます。

RTX 2080
2018年9月、CUDAコア2,944基、GDDR6メモリ8GB、256ビットバス。14Gbit/sでメモリ帯域幅は448GB/s。
RTX 2080 Super
2019年7月、CUDAコア3,072基、8GBのGDDR6を搭載。メモリ速度は15.5Gbit/s、帯域幅は496GB/sで、2080より約11%高くなっています。
LLMの場合
生成は主に帯域幅に依存します。Super はわずかに優れますが、容量は変わりません。

#対応モデル:8GB以内のもの

RTX 2080 / 2080 Super向けモデル(モデルサイズはQuelLLMカタログに基づく)
モデルQ4 での重み8GBで期待できる性能
Granite 4.2 8B4.6 GB快適で、数千トークンのコンテキストをサポート
Qwen 3.5 9B6 GBQ4ならメモリに収まります。コンテキストは適度な長さに抑え、必要に応じてK/Vキャッシュを調整してください
Gemma 4 12B7 GB余裕がなさすぎる:キャッシュとシステム用のメモリを確保できない
Qwen 3.5 9B Q810 GB収まりません:8 GBを超えます

どのモデルでも考え方は同じです。重みに、コンテキストキャッシュと、ドライバーや画面表示用の約1 GBの余裕を加えて見積もります。画面をそのカードに接続している場合は、メモリの一部がすでに画面用に確保されています。8 GBカードでは、重みを最大6 GBに抑えるのが安全な目安です。より長いコンテキストが必要なら、K/Vキャッシュの量子化が最も効果的です。

#モデルが実際にカードに収まるかを確認してください。

速度低下の多くは、モデル全体が VRAM に収まらないことが原因です。その場合、Ollama はモデルの一部を CPU 側に割り振り、エラーメッセージを出さずに処理速度が低下します。Ollama のドキュメントには、この状態を確認する方法が示されています。ollama ps コマンドは、Processor 列にモデルが読み込まれたメモリの種類を表示します。100% GPU はモデル全体がグラフィックカードのメモリに収まっていることを意味し、48%/52% CPU/GPU のような比率は RAM と VRAM に分けて読み込まれていることを示します。

  1. 01
    モデルを読み込む
    ollama runの後にモデル名を指定してモデルを起動し、最初のプロンプトを送信してください。
  2. 02
    割当の確認
    別のターミナルで ollama ps と入力してください。Processor列の表示と、表示されたサイズを記録してください。
  3. 03
    必要に応じて修正してください
    モデルがGPU上で100%使用されていない場合は、コンテキストを縮小したり、より軽い量子化を選択したり、より小さなモデルに切り替えるか、キャッシュK/Vの量子化を有効にすることもできます。ドキュメントでは、これはFlash Attentionを必要とすることを明記しています。
GPUとCPUへの処理の割り当てを確認する
ollama ps

#速度:実測値と推定値

llama.cpp の共同編集の性能表(Llama 2 7B、Q4_0、ファイルサイズ 3.56 GiB)には、2070 Super、2080 Ti、3060 12 GB、4060 Ti 8 GB が掲載されていますが、2080 と2080 Super は掲載されていません。この表には、同じチップを搭載していても、ドライバー、システム、カードによって結果が変わると明記されています。以下では、まず測定結果を示し、次にそこから妥当に推測できることを説明します。

llama.cppのテスト、Llama 2 7B Q4_0、生成(トークン/秒)
カードメモリバス生成ステータス
RTX 2070 Super8 GB256ビット88,1公開された測定値
RTX 2080 / 2080 Super8 GB256ビットほぼ 88 から 97推定:バスは同じで、Superのほうがメモリが高速
RTX 2080 Ti11 GB352ビット107,5公開された測定値
RTX 3060 12 GB12 GB192 ビット75,6公開された測定値
RTX 4060 Ti 8 GB8 GB128 ビット63,9公開された測定値

2080の行の推定値は、単純なルールに基づいています。帯域幅が448 GB/sの2080は2070 Superと非常に近い生成速度になるはずで、496 GB/sの2080 Superはさらに最大10%速くなる可能性があります。つまり、おおよそ毎秒95トークンです。これは推定であり、実測値ではありません。測定結果として引用しないでください。

この表は、GPUを交換するかどうか迷っている方に役立つ教訓を示しています。8GBのRTX 4060 Tiは、より新しいモデルであるにもかかわらず、生成速度が63.9トークン/秒で、2070 Superより遅くなっています。これは128ビットのバスが帯域幅を制限しているためです。テキスト生成では、GPUの世代が新しいからといって、速度が上がるとは限りません。新しい世代が主にもたらすのは、エネルギー効率と新しい機能であり、メモリ容量の増加ではありません。

#2080 SuperとRTX 3060 12 GBの比較:メモリ容量がものをいう

3060 12 GBは2070 Superより生成速度が遅いものの(テストでは毎秒75.6トークン対88.1トークン)、VRAM容量は4 GB多くなっています。ローカルAIでは、この容量が重要です。12 GBあれば、Gemma 4 12B(Q4で7 GB)を読み込んでもコンテキスト用の余裕が残りますが、8 GBのカードではそうはいきません。2080 Superも、速度でこの不利を補うことはできません。毎秒約95トークンまで速くなっても、12Bモデルがメモリに収まらないという事実は変わらないためです。

2080 Superか3060 12 GBか:選択の判断材料
基準RTX 2080 SuperRTX 3060 12 GB
メモリ8 GB12 GB
生成(7B Q4_0)約95トークン/秒と推定されています75.6トークン/秒(測定値)
120億パラメータのモデルいいえ(モデルの重みだけで7GB、余裕なし)はい、コンテキストありで
70〜90億パラメータのモデルはいはい

結論は、何を使いたいかによって変わります。80億または90億パラメータのアシスタントなら、お使いの2080で十分で、3060 12 GBに移行しても速度は向上しません。12Bモデルや長いコンテキストを使いたい場合は、買い替える理由があります。中古価格は毎週変わるので、固定された数値に頼るのではなく、価格の推移を確認してください。

#8 GBで長いコンテキストを使う:鍵を握るK/Vキャッシュ

8 GBのグラフィックカードでは、問題となるのはモデルではなくコンテキストキャッシュです。会話の各トークンによってメモリ上のデータが増えるため、会話が空の状態では収まっていたQ4の8Bモデルでも、長い文書を貼り付けるとメモリ容量を超えることがあります。Ollamaには2つの対策があります。Flash Attentionは、グラフィックカードが対応していればソフトウェアによって自動的に有効になり、コンテキストが長くなったときに必要なメモリを削減します。これを有効にするとK/Vキャッシュを量子化でき、ドキュメントによると、q8_0形式のメモリ使用量はデフォルト形式の約半分です。q4_0形式ではさらにメモリを節約できますが、コンテキストが長い場合には精度の低下がより顕著になります。

Linux:Flash Attentionを強制し、キャッシュをq8_0で量子化
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

この設定はグローバルです。インスタンスが提供するすべてのモデルに適用されるため、専用マシンでは便利ですが、頻繁にモデルを変更する場合は注意が必要です。ベストプラクティスは、設定変更前に測定することです。モデルを読み込み、使用用途を代表するコンテキストを埋め、ollama psでモデルがGPUに100%残っていることを確認します。そうであれば余裕がありますが、そうでない場合はキャッシュを量子化するか、コンテキストを縮小してください。

#8GBでは不足する場合:次のステップ

メモリ容量ごとに可能になること(Q4での重みのサイズ、QuelLLMカタログ)
カードのメモリ実行可能になるモデルQ4 での重み
8GB(あなたのカード)70〜90億パラメータのモデル4.6GB から 6GB
12 GBコンテキストも確保できるGemma 4 12B7 GB
16 GBgpt-oss 20B(13 GB)またはQwen 3.5 27B(16 GB、ほとんど余裕なし)13から16GB

この表の読み方は簡単です。メモリ容量が一段増えるごとに、使えるモデルのカテゴリが広がります。一方、毎秒30~40トークンを超えると、速度がさらに上がっても使い心地はほとんど変わりません。購入を迷っているなら、まずどのモデルを動かしたいかを考え、そのモデルに必要なメモリ容量を備えたカードを選んでください。270億パラメータのモデルを16 GBで動かすのは、すでに容量の限界に近い状態です。その規模のモデルが目標なら、24 GBのカードを検討してください。

#2026年のドライバーとサポート

RTX 2080と2080 Tiは、Ollamaが対応カードとして挙げているCompute Capability 7.5のカードに含まれます。Ollamaにはバージョン550以降のドライバーが必要です。これは現在のOllamaの各バージョンに当てはまります。インストールに失敗した場合は、まずnvidia-smiでドライバーのバージョンを確認してください。したがって、これらのカードへのOllamaやllama.cppのインストールがソフトウェア上の制約で阻まれることを心配する理由はありません。注意すべき点はドライバーのバージョンだけです。ほかの原因を探す前に、ドライバーを更新してください。

#2026年の結論

使い続けるのがおすすめの場合
すでにお使いのPCに搭載されていて、Q4で70億〜90億パラメータのモデルを使いたい場合です。速度は十分で、追加費用もかかりません。
AI用途での購入は避けてください
ただし、価格が安く、保証内容が明確な場合は別です。価格が近いなら、12 GB のグラフィックスカードのほうが、毎秒数トークン速くなることよりも価値があります。
次の条件に当てはまる場合は別の選択肢を検討してください
12B、14B、またはそれ以上のモデル、あるいは8Bモデルで1万トークンを超えるコンテキストを必要とする場合、12 GBから16 GBのVRAMが必要です。

#よくある質問

よくある質問
RTX 2080で80億〜90億パラメータのモデルを実行できるか?+
はい。Q4でGranite 4.2 8Bは4.6GB、Qwen 3.5 9Bは6GB(QuelLLMカタログに基づく)とされ、8GBのメモリ内に収まり、適切なコンテキスト設定下で動作します。速度は2070 Superと同等で、7BモデルのQ4_0で88トークン/秒と測定されています。
LLMにはRTX 2080 SuperとRTX 2080 Tiのどちらが適していますか?+
2080 Ti は 11 GB、帯域幅 616 GB/s、2080 Super は 8 GB、496 GB/s です。LLM にとって、速度よりも追加の 3 GB が重要であり、120 億パラメータのモデルを可能にします。予算が許せば、2080 Ti が 2 つのうち最良の選択です。
Gemma 4 12BをRTX 2080 Superで実行可能ですか?+
快適ではありません。カタログでは Q4 の重みが 7 GB とされており、8 GB ではコンテキストキャッシュとシステムに1 GB 程度しか残しません。モデルはロードされますが、Ollama はすぐに一部を RAM にオフロードします。これは ollama ps で確認できます。8B または 9B をお勧めします。
モデルが完全にGPU上で動作しているかをどう確認しますか?+
ollama ps コマンドを使用してください。モデルが完全にGPUに読み込まれている場合、Processor 列には 100% GPU と表示されます。モデルがGPUとシステムメモリに分散している場合は、48%/52% CPU/GPU のような比率が表示されます。後者の場合は速度が大幅に低下するため、コンテキストを短くするか、モデルを小さくするほうがよいでしょう。
RTX 2080は、RTX 4060 Ti 8GBよりもテキスト生成において速いですか?+
llama.cpp の公開表によると、8 GB の 4060 Ti は 63.9 トークン/秒を生成し、2070 Super は 88.1 トークン/秒です。2070 Super のバス幅は 2080 と同一です。4060 Ti の 128 ビットバスは帯域幅を制限しています。したがって、同等の容量であれば、2080 の方が高いスループットを期待できます。
Ollamaは2026年においてRTX 2080で依然として動作しますか?+
はい。OllamaはRTX 2080をCompute Capability 7.5のGPUとして掲載しており、必要なドライバーはバージョン550以降です。確認したドキュメントでは、このGPUファミリーのサポート終了は告知されていません。メジャーアップデートの際に、ドライバーとCUDAのリリースノートを確認してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。