中級 11 分RTX 40

RTX 4080/4080 Super(16 GB)で使うなら、どのLLM? ?

端的な回答

RTX 4080と4080 Superは、どちらも16 GBのGDDR6X(716.8 GB/sと736 GB/s)を搭載しています。Gemma 4 12B、gpt-oss 20B、Mistral Small 24Bを含む、重みが約14 GBまでのモデルをVRAMに読み込めます。第三者による公開測定では、RTX 4080でQ4量子化した8Bモデルが106 tokens/sを記録しています。2つのモデルの帯域幅差は約3%にすぎず、大きな価格差を正当化しません。

RTX 4080 と 4080 Super は、Ada世代のハイエンドな 16 GB カードです。ローカル LLM において、これらは同容量の競合製品(RTX 4070 Ti Super、RTX 5070 Ti、RTX 5080)との違いよりも、互いの違いが小さいと言えます。本ガイドでは、この二つのバリアント間の実際の差、16 GB が許容する範囲、そしてこのカードについて存在する唯一の公開されたスループット測定値を数値化しています。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5080 16 GB.

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#ローカルLLM向けのRTX 4080:16 GBと716 GB/sでできること

RTX 4080またはRTX 4080 Superでは、4Bから24BまでのモデルをQ4でVRAMにすべて収容可能です。Gemma 4 12B(7.7〜8GB)、gpt-oss 20B(14GB)およびMistral Small 24B(14GB)は収容可能です。後者のモデルはコンテキスト用に約2GBの余裕を持ちます。以下に引用された第三者の測定値では、RTX 4080で8BモデルをQ4で生成する際の生成速度が106トークン/秒とされ、インタラクティブな使用においては高速なカードであると評価できます。しかし、容量の制限は依然として存在します。Qwen 3.5 27BはOllamaによれば17GBを消費しており、収容できません。このような規模のモデルには24GBのVRAMが必要です。したがって、RTX 4080は中規模モデル向けの高速カードであり、容量を確保するためのカードとは言えません。

アーキテクチャ
Ada Lovelace、AD103チップ。
メモリ
256ビットバスに搭載されたGDDR6X 16GB:Wikipediaによると、4080モデルでは716.8GB/s、4080 Superモデルでは736GB/sです。
CUDAコア
NVIDIAによると、4080は9,728、4080 Superは10,240です。
消費電力
両方のバリアントでグラフィック総消費電力は320 Wです。NVIDIAはPCの最小電源容量を750 Wと示しています。
発売価格
4080 は2022年11月に1,199ドル、続いて4080 Super は2024年1月に999ドルでした。

#4080または4080 Super:LLM向けの実際の性能差

Super版はCUDAコア数が5%多く(10,240対9,728)、メモリ帯域幅も2.7%大きくなっています(736対716.8GB/s)。テキスト生成では、実際に重要なのはメモリ帯域幅だけです。そのため、理論上の向上幅は3%未満で、使用時には違いを感じられません。両カードともメモリ容量は16GB、消費電力は320Wで、読み込めるモデルも同じです。4080 Superに追加料金を払う価値があるのは、価格が同じか、ほぼ同じ場合に限られます。中古価格は毎週変動するため、固定された数値ではなく、価格の推移を確認してください。

RTX 4080と4080 Super:両モデルの仕様
基準RTX 4080RTX 4080 Super
CUDAコア9 72810 240
メモリ16GB GDDR6X、256ビット16GB GDDR6X、256ビット
帯域幅716.8 GB/s736 GB/s
グラフィック性能320 W320 W
電源の最低要件750 W750 W
帯域幅の差参考約2.7%多い

#16 GB に収まるモデル

RTX 4080で使うモデル(Ollamaに記載されたサイズ、モデルの重みのみ)
モデルサイズ16 GBでの余裕判定
Granite 4.2 8B5.3 GB10.7GB非常に長いコンテキストが可能
Gemma 4 12B7.7~8.0 GB8 GB快適
gpt-oss 20B14 GB2 GBメモリに収まる、コンテキストは中程度
Mistral Small 24B14 GB2 GBメモリに収まる、コンテキストは中程度
Qwen 3.5 27B17 GB否定VRAMに収まらない

Ollamaはデフォルトで4,096トークンのコンテキストを使用します。2GBの余裕があれば、14GBのモデルでも、K/Vキャッシュを量子化することを条件に、より長いコンテキストを扱えます。Ollamaには、Flash Attentionと併用するq8_0形式があり、f16の約半分のメモリを使用します。この2つの設定が、gpt-oss 20BやMistral Small 24Bを16,000トークンのコンテキストで使うための鍵になります。

Ollama サーバーの設定(Linux、macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

#公表された唯一の測定結果:4080について何が分かるか

公開GitHubリポジトリは、llama.cppを使用したLLaMA 3のGPU比較を示しています(2024年5月のインスタンス、Ubuntuシステム、RunPod環境)。RTX 4080 16GBにおいて、Q4_K_M 8Bモデルで1024トークンの生成において106.22トークン/秒を記録し、同モデルをF16で実行した場合、40.29トークン/秒となり、14.96GBのメモリを消費するため、ほぼすべてのVRAMを消費します。これらのデータは第三者による測定であり、サイトに掲載されているモデルよりも古く、llama.cppの旧バージョンを使用しています。概算として理解するものであり、保証とは見なしてはなりません。

RTX 4080 16 GB:第三者による測定結果(LLaMA 3 8B、Q4_K_M、llama.cpp)
ステップ512 トークン1,024トークン8,192トークン
生成速度(tokens/s)108,15106,2293,71
プロンプトの読み取り速度(トークン/秒)5 389,745 064,992 882,03

ここから2つのことが分かります。まず、コンテキストが長くなると生成速度は低下します。この測定では、コンテキストを512トークンから8,192トークンに増やすと、速度が約13%低下します。各トークンの生成時に読み込む重みに加えて、K/Vキャッシュも読み込む必要があるためです。次に、実測値が理論上限に対してどの程度に達しているかを計算できます。716.8 GB/sをQ4の8Bモデルのサイズである4.58 GBで割ると156トークン/秒となり、実測値はその68%に達しています。F16では上限が48トークン/秒で、実測値はその84%に達しています。したがって、この比率は形式によって68〜84%の範囲で変わります。

理論的な上限およびRTX 4080での推定(716.8 GB/s)
モデル (Q4)モデル容量上限70 % での推定
Granite 4.2 8B5.3 GB135トークン/秒約95トークン/秒
Gemma 4 12B7.7 GB93トークン/秒約65トークン/秒
Mistral Small 24B14 GB51トークン/秒約36トークン/秒

これらの推定値は、短いコンテキストの場合に当てはまります。gpt-oss 20Bモデルは、各トークンでアクティブなエキスパートだけを読み込みます。そのため、14GBの密なモデルを上回りますが、ここでは信頼できる実測値を掲載していません。

#プロンプトの読み込みは生成よりもはるかに速い

同じ測定結果は、最初の応答前に質問やドキュメントを読み込むプロンプト処理も示しています。1,024トークンで5,065トークン/秒、8,192トークンで2,882トークン/秒です。約8,000トークン(15ページ程度)のドキュメントは、生成が始まる前に約3秒で読み込まれます。この段階は帯域幅ではなく計算に制約され、4060 Tiのような288 GB/sのカードと比較して、4080の追加コアの恩恵がここで見えます。

#4080の性能を活かせる用途:エージェント、RAG、コーディング

この速度のカードは、エージェント、コード修正のループ、文書のバッチ処理など、多数の生成を連続して行う用途に適しています。8Bモデルで100トークン/秒なら、1ステップあたり500トークンを生成するエージェントは数秒で応答します。一方、16 GBという容量は、コンテキストの長さと読み込めるモデル数を制限します。読み込むモデルは、14 GBを使う12Bモデルを1つと、RAG用の小型埋め込みモデルにとどめてください。gpt-oss 20Bのような推論モデルは、回答前に長い思考過程を生成するため、コンテキストを消費します。

RTX 4080 における 3 つの典型的な構成
用途構成注意点
コードアシスタント8Bから12Bのモデル、16,000トークンのコンテキスト、q8_0キャッシュ15GB以上のコードモデル:ほぼゼロのコンテキスト
ドキュメントベースの RAGGemma 4 12Bと軽量な埋め込み生成モデルは1つだけ読み込む
質の高いチャットMistral Small 24Bのみ中程度のコンテキスト、2GBの余裕

#モデルが遅くなる場合:VRAMに適切に収まるか確認してください

16 GBの環境では、14 GBのモデルは余裕が少なく、会話中にコンテキストが増加するとオーバーフローする可能性があります。その兆候は、生成が突然遅くなることです。モデルの一部がシステムRAMに移行している状態です。この確認は1分で済み、カードが遅いという誤った結論を避け、問題がコンテキスト設定にあることを認識できます。

  1. 01
    配置を確認する
    別のターミナルで ollama ps を実行してください。PROCESSOR 列には 100 % GPU と表示される必要があります。CPU/GPUに処理が分かれている場合は、モデルがVRAMに収まりきらず、一部がシステムRAMにオフロードされていることを示します。
  2. 02
    コンテキストを縮小
    OLLAMA_CONTEXT_LENGTHを8192、またはデフォルト値の4096まで下げてから、サーバーを再起動してください。
  3. 03
    キャッシュを量子化する
    Flash Attentionを有効にし、OLLAMA_KV_CACHE_TYPE=q8_0 を設定してください。K/Vキャッシュはf16のメモリの約半分を使用します。
  4. 04
    VRAMを解放
    ゲームやハードウェアアクセラレーションを使用するブラウザなど、GPUを使用しているアプリケーションを終了し、nvidia-smiで確認してください。
  5. 05
    モデルの変更
    どの対策でも不十分な場合は、より軽量なモデルに切り替えてください。たとえば、Mistral Small 24Bの代わりにGemma 4 12Bを使用します。

#4080 と 4070 Ti Super、5070 Ti、5080 の比較

16GBのカード:同じ容量ですが、帯域幅が異なります
カードVRAM帯域幅4080との差
RTX 4070 Ti Super16 GB GDDR6X672 GB/s約6%少ない
RTX 408016 GB GDDR6X716.8 GB/s参考
RTX 4080 Super16 GB GDDR6X736 GB/s約3%多い
RTX 5070 Ti16 GB GDDR7896 GB/s約 25 % 増加
RTX 508016 GB GDDR7960 GB/s約34%増加

これらのカードはすべてメモリ容量が同じなので、同じモデルを読み込めます。変わるのはスループットだけで、帯域幅に比例します。4080と4070 Ti Superの差はわずか6%です。価格差が大きければ、Ti Superのほうがお買い得です。50シリーズのカードと比べると、4080は20~25%遅いものの、中古価格が安ければ並ぶものがありません。この選択の決め手は価格であり、スペックではありません。

#2026年の結論:使い続ける、購入する、それとも見送る

4080を使い続けるべき場合
使用するモデルが16 GBに収まる場合です。このカードは今でも高速で、24 GBが必要になるまでは買い替える理由はありません。
次の場合は中古で購入してください
価格は、帯域幅が約25%高い5070 Ti新品よりもはるかに低く、その点で優れています。
24 GB を目指す場合に
27B以上のモデルを使いたい場合:コンテキストも含めて17GBを16GBに収めることは、どのように設定を調整してもできません。

2022年または2023年のカードは、マイニングや負荷の高いゲームに使われていた可能性があります。購入時の請求書があれば提示を求め、返品に応じる販売者を優先してください。中古品を購入する前に、nvidia-smiでカードのメモリ容量が16 GBと表示されることを確認し、14 GBのモデルを起動して、長時間の生成中に温度を監視してください。カードの消費電力は最大320 Wです。電源を確認してください。NVIDIAは最低750 Wを推奨しています。

#よくある質問

FAQ
LLMを実行する場合、RTX 4080と4080 Superにはどのような違いがありますか?+
ほとんど違いはありません。SuperはCUDAコアが5%多く、帯域幅も2.7%高くなっています(736 GB/s対716.8 GB/s)。メモリ容量はどちらも16 GBで、消費電力も同じ320 Wです。読み込めるモデルは同じで、速度差は3%未満のため、実際に使っていても体感できません。
RTX 4080で生成速度はどのくらいですか?+
2024年5月に公開された第三者の測定では、llama.cpp上のLLaMA 3 8B(Q4_K_M)で106.22トークン/秒を記録しています。当サイトが実施した測定ではなく、使用されたモデルも当サイトに掲載されているものより古いものです。5.3 GBのモデルの理論上の上限は、約135トークン/秒です。
RTX 4080 が Qwen 3.5 27B を実行できるでしょうか?+
VRAMだけには収まりません。Ollamaによるとモデルは17 GBで、GPUのVRAMは16 GBです。一部の重みがシステムRAMに残ることになり、生成が大幅に遅くなります。このモデルには24 GBのVRAMが必要です。VRAMが16 GBなら、どちらも14 GBのMistral Small 24Bまたはgpt-oss 20Bを選んでください。
LLM用にはRTX 4080 SuperとRTX 4070 Ti Superのどちらを選ぶべきですか?+
どちらも16GBなので、動かせるモデルは同じです。4080 Superのメモリ読み取り速度は736GB/sで、もう一方の672GB/sより約10%速く、これが生成時の速度向上の上限です。4070 Ti Superの中古価格が大幅に安い場合は、そちらを選んでください。
RTX 4080に必要な電源は?+
NVIDIAによると、グラフィックスカードの総消費電力は320Wで、PC全体に必要な電源容量は最低750Wです。お使いのカードのモデルに必要なコネクタを確認してください。品質の良い750Wの電源で対応できますが、高性能なプロセッサを使用する場合は、より大容量の電源を選ぶと余裕ができます。
LLM用に中古のRTX 4080を買う価値はありますか?+
RTX 5070 Tiの新品価格と比べて明らかに価格が低い場合に限り、同じ性能を持ち、帯域幅が約25%高いものと同等の能力を持つ場合に使用可能です。nvidia-smiでカードが16GBを表示することを確認し、長時間生成を試行し、購入前に温度を確認してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。