RTX 4080/4080 Super(16 GB)で使うなら、どのLLM? ?
RTX 4080と4080 Superは、どちらも16 GBのGDDR6X(716.8 GB/sと736 GB/s)を搭載しています。Gemma 4 12B、gpt-oss 20B、Mistral Small 24Bを含む、重みが約14 GBまでのモデルをVRAMに読み込めます。第三者による公開測定では、RTX 4080でQ4量子化した8Bモデルが106 tokens/sを記録しています。2つのモデルの帯域幅差は約3%にすぎず、大きな価格差を正当化しません。
RTX 4080 と 4080 Super は、Ada世代のハイエンドな 16 GB カードです。ローカル LLM において、これらは同容量の競合製品(RTX 4070 Ti Super、RTX 5070 Ti、RTX 5080)との違いよりも、互いの違いが小さいと言えます。本ガイドでは、この二つのバリアント間の実際の差、16 GB が許容する範囲、そしてこのカードについて存在する唯一の公開されたスループット測定値を数値化しています。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5080 16 GB.
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#ローカルLLM向けのRTX 4080:16 GBと716 GB/sでできること
RTX 4080またはRTX 4080 Superでは、4Bから24BまでのモデルをQ4でVRAMにすべて収容可能です。Gemma 4 12B(7.7〜8GB)、gpt-oss 20B(14GB)およびMistral Small 24B(14GB)は収容可能です。後者のモデルはコンテキスト用に約2GBの余裕を持ちます。以下に引用された第三者の測定値では、RTX 4080で8BモデルをQ4で生成する際の生成速度が106トークン/秒とされ、インタラクティブな使用においては高速なカードであると評価できます。しかし、容量の制限は依然として存在します。Qwen 3.5 27BはOllamaによれば17GBを消費しており、収容できません。このような規模のモデルには24GBのVRAMが必要です。したがって、RTX 4080は中規模モデル向けの高速カードであり、容量を確保するためのカードとは言えません。
- アーキテクチャ
- Ada Lovelace、AD103チップ。
- メモリ
- 256ビットバスに搭載されたGDDR6X 16GB:Wikipediaによると、4080モデルでは716.8GB/s、4080 Superモデルでは736GB/sです。
- CUDAコア
- NVIDIAによると、4080は9,728、4080 Superは10,240です。
- 消費電力
- 両方のバリアントでグラフィック総消費電力は320 Wです。NVIDIAはPCの最小電源容量を750 Wと示しています。
- 発売価格
- 4080 は2022年11月に1,199ドル、続いて4080 Super は2024年1月に999ドルでした。
#4080または4080 Super:LLM向けの実際の性能差
Super版はCUDAコア数が5%多く(10,240対9,728)、メモリ帯域幅も2.7%大きくなっています(736対716.8GB/s)。テキスト生成では、実際に重要なのはメモリ帯域幅だけです。そのため、理論上の向上幅は3%未満で、使用時には違いを感じられません。両カードともメモリ容量は16GB、消費電力は320Wで、読み込めるモデルも同じです。4080 Superに追加料金を払う価値があるのは、価格が同じか、ほぼ同じ場合に限られます。中古価格は毎週変動するため、固定された数値ではなく、価格の推移を確認してください。
| 基準 | RTX 4080 | RTX 4080 Super |
|---|---|---|
| CUDAコア | 9 728 | 10 240 |
| メモリ | 16GB GDDR6X、256ビット | 16GB GDDR6X、256ビット |
| 帯域幅 | 716.8 GB/s | 736 GB/s |
| グラフィック性能 | 320 W | 320 W |
| 電源の最低要件 | 750 W | 750 W |
| 帯域幅の差 | 参考 | 約2.7%多い |
#16 GB に収まるモデル
| モデル | サイズ | 16 GBでの余裕 | 判定 |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 10.7GB | 非常に長いコンテキストが可能 |
| Gemma 4 12B | 7.7~8.0 GB | 8 GB | 快適 |
| gpt-oss 20B | 14 GB | 2 GB | メモリに収まる、コンテキストは中程度 |
| Mistral Small 24B | 14 GB | 2 GB | メモリに収まる、コンテキストは中程度 |
| Qwen 3.5 27B | 17 GB | 否定 | VRAMに収まらない |
Ollamaはデフォルトで4,096トークンのコンテキストを使用します。2GBの余裕があれば、14GBのモデルでも、K/Vキャッシュを量子化することを条件に、より長いコンテキストを扱えます。Ollamaには、Flash Attentionと併用するq8_0形式があり、f16の約半分のメモリを使用します。この2つの設定が、gpt-oss 20BやMistral Small 24Bを16,000トークンのコンテキストで使うための鍵になります。
#公表された唯一の測定結果:4080について何が分かるか
公開GitHubリポジトリは、llama.cppを使用したLLaMA 3のGPU比較を示しています(2024年5月のインスタンス、Ubuntuシステム、RunPod環境)。RTX 4080 16GBにおいて、Q4_K_M 8Bモデルで1024トークンの生成において106.22トークン/秒を記録し、同モデルをF16で実行した場合、40.29トークン/秒となり、14.96GBのメモリを消費するため、ほぼすべてのVRAMを消費します。これらのデータは第三者による測定であり、サイトに掲載されているモデルよりも古く、llama.cppの旧バージョンを使用しています。概算として理解するものであり、保証とは見なしてはなりません。
| ステップ | 512 トークン | 1,024トークン | 8,192トークン |
|---|---|---|---|
| 生成速度(tokens/s) | 108,15 | 106,22 | 93,71 |
| プロンプトの読み取り速度(トークン/秒) | 5 389,74 | 5 064,99 | 2 882,03 |
ここから2つのことが分かります。まず、コンテキストが長くなると生成速度は低下します。この測定では、コンテキストを512トークンから8,192トークンに増やすと、速度が約13%低下します。各トークンの生成時に読み込む重みに加えて、K/Vキャッシュも読み込む必要があるためです。次に、実測値が理論上限に対してどの程度に達しているかを計算できます。716.8 GB/sをQ4の8Bモデルのサイズである4.58 GBで割ると156トークン/秒となり、実測値はその68%に達しています。F16では上限が48トークン/秒で、実測値はその84%に達しています。したがって、この比率は形式によって68〜84%の範囲で変わります。
| モデル (Q4) | モデル容量 | 上限 | 70 % での推定 |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 135トークン/秒 | 約95トークン/秒 |
| Gemma 4 12B | 7.7 GB | 93トークン/秒 | 約65トークン/秒 |
| Mistral Small 24B | 14 GB | 51トークン/秒 | 約36トークン/秒 |
これらの推定値は、短いコンテキストの場合に当てはまります。gpt-oss 20Bモデルは、各トークンでアクティブなエキスパートだけを読み込みます。そのため、14GBの密なモデルを上回りますが、ここでは信頼できる実測値を掲載していません。
#プロンプトの読み込みは生成よりもはるかに速い
同じ測定結果は、最初の応答前に質問やドキュメントを読み込むプロンプト処理も示しています。1,024トークンで5,065トークン/秒、8,192トークンで2,882トークン/秒です。約8,000トークン(15ページ程度)のドキュメントは、生成が始まる前に約3秒で読み込まれます。この段階は帯域幅ではなく計算に制約され、4060 Tiのような288 GB/sのカードと比較して、4080の追加コアの恩恵がここで見えます。
#4080の性能を活かせる用途:エージェント、RAG、コーディング
この速度のカードは、エージェント、コード修正のループ、文書のバッチ処理など、多数の生成を連続して行う用途に適しています。8Bモデルで100トークン/秒なら、1ステップあたり500トークンを生成するエージェントは数秒で応答します。一方、16 GBという容量は、コンテキストの長さと読み込めるモデル数を制限します。読み込むモデルは、14 GBを使う12Bモデルを1つと、RAG用の小型埋め込みモデルにとどめてください。gpt-oss 20Bのような推論モデルは、回答前に長い思考過程を生成するため、コンテキストを消費します。
| 用途 | 構成 | 注意点 |
|---|---|---|
| コードアシスタント | 8Bから12Bのモデル、16,000トークンのコンテキスト、q8_0キャッシュ | 15GB以上のコードモデル:ほぼゼロのコンテキスト |
| ドキュメントベースの RAG | Gemma 4 12Bと軽量な埋め込み | 生成モデルは1つだけ読み込む |
| 質の高いチャット | Mistral Small 24Bのみ | 中程度のコンテキスト、2GBの余裕 |
#モデルが遅くなる場合:VRAMに適切に収まるか確認してください
16 GBの環境では、14 GBのモデルは余裕が少なく、会話中にコンテキストが増加するとオーバーフローする可能性があります。その兆候は、生成が突然遅くなることです。モデルの一部がシステムRAMに移行している状態です。この確認は1分で済み、カードが遅いという誤った結論を避け、問題がコンテキスト設定にあることを認識できます。
- 01配置を確認する別のターミナルで ollama ps を実行してください。PROCESSOR 列には 100 % GPU と表示される必要があります。CPU/GPUに処理が分かれている場合は、モデルがVRAMに収まりきらず、一部がシステムRAMにオフロードされていることを示します。
- 02コンテキストを縮小OLLAMA_CONTEXT_LENGTHを8192、またはデフォルト値の4096まで下げてから、サーバーを再起動してください。
- 03キャッシュを量子化するFlash Attentionを有効にし、OLLAMA_KV_CACHE_TYPE=q8_0 を設定してください。K/Vキャッシュはf16のメモリの約半分を使用します。
- 04VRAMを解放ゲームやハードウェアアクセラレーションを使用するブラウザなど、GPUを使用しているアプリケーションを終了し、nvidia-smiで確認してください。
- 05モデルの変更どの対策でも不十分な場合は、より軽量なモデルに切り替えてください。たとえば、Mistral Small 24Bの代わりにGemma 4 12Bを使用します。
#4080 と 4070 Ti Super、5070 Ti、5080 の比較
| カード | VRAM | 帯域幅 | 4080との差 |
|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 672 GB/s | 約6%少ない |
| RTX 4080 | 16 GB GDDR6X | 716.8 GB/s | 参考 |
| RTX 4080 Super | 16 GB GDDR6X | 736 GB/s | 約3%多い |
| RTX 5070 Ti | 16 GB GDDR7 | 896 GB/s | 約 25 % 増加 |
| RTX 5080 | 16 GB GDDR7 | 960 GB/s | 約34%増加 |
これらのカードはすべてメモリ容量が同じなので、同じモデルを読み込めます。変わるのはスループットだけで、帯域幅に比例します。4080と4070 Ti Superの差はわずか6%です。価格差が大きければ、Ti Superのほうがお買い得です。50シリーズのカードと比べると、4080は20~25%遅いものの、中古価格が安ければ並ぶものがありません。この選択の決め手は価格であり、スペックではありません。
#2026年の結論:使い続ける、購入する、それとも見送る
- 4080を使い続けるべき場合
- 使用するモデルが16 GBに収まる場合です。このカードは今でも高速で、24 GBが必要になるまでは買い替える理由はありません。
- 次の場合は中古で購入してください
- 価格は、帯域幅が約25%高い5070 Ti新品よりもはるかに低く、その点で優れています。
- 24 GB を目指す場合に
- 27B以上のモデルを使いたい場合:コンテキストも含めて17GBを16GBに収めることは、どのように設定を調整してもできません。
2022年または2023年のカードは、マイニングや負荷の高いゲームに使われていた可能性があります。購入時の請求書があれば提示を求め、返品に応じる販売者を優先してください。中古品を購入する前に、nvidia-smiでカードのメモリ容量が16 GBと表示されることを確認し、14 GBのモデルを起動して、長時間の生成中に温度を監視してください。カードの消費電力は最大320 Wです。電源を確認してください。NVIDIAは最低750 Wを推奨しています。
- ソース:NVIDIA の公式仕様(RTX 4080 および 4080 Super)
- ソース:llama.cppによるGPU上のデュアルスループスレッドレーティング(GitHub)
- 出典:Ollama公式FAQ(Flash Attention、K/Vキャッシュ)
#よくある質問
LLMを実行する場合、RTX 4080と4080 Superにはどのような違いがありますか?+
RTX 4080で生成速度はどのくらいですか?+
RTX 4080 が Qwen 3.5 27B を実行できるでしょうか?+
LLM用にはRTX 4080 SuperとRTX 4070 Ti Superのどちらを選ぶべきですか?+
RTX 4080に必要な電源は?+
LLM用に中古のRTX 4080を買う価値はありますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。