RTX 5080(16 GB)で使えるLLMは? ?
RTX 5080は16GBのGDDR7 VRAMと960GB/sのメモリ帯域幅を備えています。最大140億パラメータのモデル(Qwen3 14B、9.3GB)とgpt-oss 20B(14GB)をVRAM内に保持できます。Hardware Cornerによると、14Bモデルでは16kのコンテキストで毎秒64トークンを生成します。270億パラメータの密なモデル(17GB)や700億パラメータのモデルはVRAMに収まりません。
RTX 5080は高速に生成できますが、メモリ容量は16 GBなので、より安価なカードと同じ容量制限があります。このガイドでは、実際にメモリに収まるモデルとその正確なサイズ、Hardware Cornerが測定した生成速度、コンテキストに割り当てられるメモリ容量、そして5070 Ti、4080 Super、3090との実際の差を紹介します。24 GBのカードに移行すべきタイミングも分かります。
マシンを選んでいるところですか? 予算別のおすすめ →
このセットアップの場合: RTX 5080 16 GB.
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#ローカルLLM向けのRTX 5080:16 GBでできること
ローカルLLM用としてのRTX 5080の強みは、16 GBのGDDR7と960 GB/sの帯域幅です。生成は高速ですが、メモリ容量によって使えるモデルが制限されます。Ollamaのモデルライブラリによると、Qwen3 14B(9.3 GB)とgpt-oss 20B(14 GB)は完全にVRAMに収まりますが、Qwen 3.5 27B(17 GB)とQwen3 30B(19 GB)はカードの容量を超えます。Hardware Cornerの測定では、Qwen3 14Bは16,000トークンのコンテキストで毎秒64トークン、gpt-oss 20Bは128,000トークンのコンテキストで毎秒105.6トークンを生成しています。したがって、80億〜200億パラメータのモデルには非常に適していますが、27Bの密なモデルには適していません。
- メモリ
- NVIDIAによると、256ビットバスに16GBのGDDR7を搭載。Hardware Cornerによると、30Gbit/sでの帯域幅は960GB/sです。
- 計算
- NVIDIAによると、CUDAコアは10,752基で、第5世代のTensorコアを搭載しています。
- 消費電力
- NVIDIAによると、グラフィックス消費電力は360 W、必要なシステム電源容量は850 W、最高温度は88 °Cです。
#16GB以内に収まるモデル
モデルの重みのサイズは、2026年9月29日に確認したOllamaライブラリのファイルに基づいています。余裕容量は、16 GBから重みのサイズを差し引いた残りで、コンテキスト、キャッシュ、エンジンのバッファに必要な容量はまだ差し引いていません。
| モデル | Ollama ファイル | 粗利益 | 判定 |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 10.7GB | 非常に快適 |
| Qwen 3.5 9B | 6.6 GB | 9.4 GB | 非常に快適に使える(テキスト・画像) |
| Gemma 4 12B | 7.6 GB | 8.4GB | 快適 |
| Qwen3 14B | 9.3 GB | 6.7 GB | 快適で、32kのコンテキストが可能 |
| gpt-oss 20B | 14 GB | 2 GB | メモリに収まり、MXFP4なら長いコンテキストも利用可能 |
| Devstral Small 2 24B / Mistral Small 3.2 24B | 15 GB | 1 GB | 有用なコンテキストを実現するためのマージンが不足しています |
| Qwen 3.5 27B | 17 GB | 1GB不足 | 収まりません |
| Qwen3 30B | 19 GB | 3GB不足 | 収まりません |
Q4量子化した14Bモデルは、快適に動作する最大の密モデルで、コンテキスト用に約7 GBの余裕があります。24Bモデルでは余裕が1 GBしかなく、コンテキストが長くなるとすぐにメモリからあふれます。このカードは会話が短い間なら24Bを動かせますが、エージェント用途には向きません。gpt-oss 20Bは例外です。Ollamaによると、エキスパートの重みはMXFP4でパラメータあたり4.25ビットに量子化されているため、16 GBのメモリで動作できます。Hardware Cornerはこのカードで最大128kのコンテキストを測定しています。
ローカル RAG では埋め込みモデルを追加します。Ollama での bge-m3 のサイズは 1.2 GB なので、Qwen 3.5 9B と合わせると合計 7.8 GB、Gemma 4 12B と合わせると 8.8 GB になります。コンテキストと、そこに挿入するテキスト断片のデータベース用に、7 GB を超えるメモリが残ります。一方、コーディングエージェントには、Ollama のドキュメントによると、少なくとも64,000トークンのコンテキストが必要です。16 GB では、24B を目指すよりも、80億〜140億パラメータのモデルにサイズを下げ、キャッシュを量子化する必要があります。
#実測スループット:速度と帯域幅による上限
これらの数値は、llama.cppで4k〜128kのコンテキストを使ってテストしているHardware Cornerによるものです。QuelLLMが測定した数値ではありません。
| モデル(Q4_K、またはgpt-oss用のMXFP4) | 4kコンテキスト | コンテキスト 32k | 128kコンテキスト | プロンプト読み込み 4k |
|---|---|---|---|---|
| Qwen3 8B | 129,1 | 72,5 | 未測定 | 6 410,1 |
| Qwen3 14B | 80,6 | 51,9 | 未測定 | 3 820,5 |
| gpt-oss 20B (MXFP4) | 172,4 | 149,3 | 105,6 | 9 146,1 |
生成速度はメモリ帯域幅によって制限されます。理論上の上限は、おおよそ帯域幅をモデルの容量で割った値です。Qwen3 14B(9.3 GB)では、960 ÷ 9.3で103トークン/秒となり、4kでの測定値80.6は、その上限の78%に達しています。gpt-oss 20Bは172トークン/秒で、見かけ上の上限(960 ÷ 14 = 69)を超えています。これは、エキスパート型モデルではトークンごとに重みの一部しか読み込まないためです。上限はファイル全体ではなく、その時点で使われる重みの容量に基づいて計算します。
コンテキストは速度に影響します。Qwen3 14Bは4kから32kに変化することで80.6から51.9トークン/秒に低下(-36%)し、一方でgpt-oss 20Bは同じ範囲でわずか13%の低下(172.4から149.3)しかありません。長文処理を行う場合、モデルの選択がGPUよりも重要です。
#コンテキストとKVキャッシュ:16GBの実際の上限
Ollama は VRAM の容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントでは、VRAM が24 GiB 未満の場合は4kトークンとされ、エージェント、ウェブ検索、コーディングツールには少なくとも64,000トークンが推奨されています。そのため、RTX 5080 ではデフォルトが4kトークンになります。デフォルト設定で起動したエージェントは、すぐに履歴を保持できなくなります。コンテキストを増やすと KV キャッシュとして VRAM を消費するため、その分を上の表に示した空き容量でまかなう必要があります。
主な調整手段はキャッシュの量子化です。OllamaのFAQによると、q8_0のメモリ使用量はf16の約半分で、精度の低下はごくわずかです。Flash Attentionが前提となり、GPUとモデルが対応していれば、Ollamaが自動的に有効にします。16 GB環境での優先順位はシンプルです。まず、少なくとも5〜6 GBの余裕が残るモデルを選び、次にキャッシュを量子化し、その後、ollama psで状態を確認しながらコンテキスト長を段階的に増やします。
#RTX 5080搭載環境にOllamaをインストールする
- 01ドライバを確認ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは550以上(Windowsでは551.61)で、総メモリ容量は約16 GBと表示される必要があります。
- 02Ollama のインストールOllamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
- 03モデルの起動ollama run qwen3:14b を実行してください:9.3 GBのダウンロードは一度だけ行われます。より高速なモデルを試したい場合は ollama run gpt-oss:20b(14 GB)を試してください。
- 04処理の配分を確認する2つ目のターミナルで ollama ps を実行してください。「Processeur」列には「100 % GPU」と表示される必要があります。CPUとGPUの両方に処理が分かれている場合は、モデルまたはコンテキストがGPUメモリに収まりきっていないことを意味します。
- 05コンテキストを調整OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定し、その後ollama psを再実行してください。余裕が足りない場合は、起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
#Blackwell:MXFP4、NVFP4、および電力制限
5080は、4ビット浮動小数点形式の処理をハードウェアで高速化します。Hardware Cornerによると、MXFP4とNVFP4に対応しており、重みがMXFP4で配布されているgpt-oss 20Bでは、その性能向上が見られます。NVIDIAは、NVFP4をBlackwellで導入された4ビット浮動小数点形式と説明しています。各ツール(llama.cpp、Ollama、vLLM)のNVFP4対応は急速に進展しています。インストール済みのバージョンとモデルの説明を確認し、Q4_K_Mを堅実な選択肢として残しておいてください。
Flash Attentionの公式リポジトリによると、Flash Attention 3はHopper(H100)専用です。5080ではバージョン2、またはOllamaやllama.cppの実装が使われ、Ollamaは利用可能な場合に自動で有効にします。消費電力を抑えるには、nvidia-smi -pl で電力の上限をワット単位で設定します。LLMの処理は主にメモリに負荷がかかるため、速度低下は小さいものの、お使いのモデルで測定してください。
#5080、5070 Ti、4080 Super、3090:測定された差異
| カード | メモリ | 相対生成 |
|---|---|---|
| RTX 4090 | 24 GB | 123 % |
| RTX 5080 | 16 GB | 100 % |
| RTX 5070 Ti | 16 GB | 91 % |
| RTX 3090 Ti | 24 GB | 89 % |
| RTX 4080 Super | 16 GB | 82 % |
| RTX 3090 | 24 GB | 81 % |
この表は3つのことを示しています。16 GBの5070 Tiは、5080の速度の91 %に達しており、純粋なスループットでは差がわずかです。81 %の3090は、24 GBでほぼ同じ速度を実現し、アクセス可能なモデルのカタログが変わります(Qwen 3.5 27B はこれに対応しますが、5080では対応しません)。最後に、4090は23 %速く、24 GBを提供します。純粋なLLM使用において、問題は速度よりも容量です。
#結論:5080を選ぶ価値があるのはどんな場合か
| 状況 | 決定 | 数値による根拠 |
|---|---|---|
| 80 億から 200 億パラメータのモデル、高速利用向け | 5080が適している | 14Bで64 t/s、gpt-oss 20B 128kでは105.6 t/s |
| 27Bの密なモデルを使いたい | VRAMが24 GBのグラフィックカードを選ぶ | Qwen 3.5 27Bは17GBであり、5080は16GBです |
| 予算が限られているが、16 GBが欲しい場合 | 5070 Tiと4080 Superを比較する | 5080の速度の91%および82% |
| すでに 4080 または 4080 Super を所有している | 手元に残す | 容量は同じ16GB |
| すでに5070 Tiをお持ちです | 手元に残す | 5080の91%の速度を実現しながら、同じ容量を維持 |
5080は16 GBの優れたグラフィックカードですが、LLM用途での欠点は、より安価な近いクラスのカードよりもメモリ容量が多いわけではないことです。購入前に、一つだけ自問してください。動かしたい最大の密なモデルは何ですか?パラメータ数が140億までなら16 GBで十分で、5080の速さを実感できます。それを超えると速度より容量が重要になり、中古の24 GBカードなら近い速度でより多くのモデルを動かせます。今日の価格については、当サイトの価格追跡ページをご覧ください。各カードの最低価格を週2回調査しています。
- 出典:NVIDIA、RTX 5080仕様
- 出典:Hardware Corner、RTX 5080でのLLMベンチマーク
- 出典:Ollama、モデルgpt-ossのページ
- 出典:Ollama ドキュメント、コンテキスト長
- 出典:Flash Attentionの公式リポジトリ
#よくある質問
RTX 5080にどのようなLLMをインストールすべきですか?+
RTX 5080は70Bモデルを実行できますか?+
ローカルLLMにはRTX 5080とRTX 5070 Tiのどちらが適していますか?+
2026年にLLMを動かすには16GBで十分ですか?+
RTX 5080にはどのような電源が必要ですか?+
RTX 5080はFP4をサポートしていますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。