中級 11 分RTX 50

RTX 5080(16 GB)で使えるLLMは? ?

端的な回答

RTX 5080は16GBのGDDR7 VRAMと960GB/sのメモリ帯域幅を備えています。最大140億パラメータのモデル(Qwen3 14B、9.3GB)とgpt-oss 20B(14GB)をVRAM内に保持できます。Hardware Cornerによると、14Bモデルでは16kのコンテキストで毎秒64トークンを生成します。270億パラメータの密なモデル(17GB)や700億パラメータのモデルはVRAMに収まりません。

RTX 5080は高速に生成できますが、メモリ容量は16 GBなので、より安価なカードと同じ容量制限があります。このガイドでは、実際にメモリに収まるモデルとその正確なサイズ、Hardware Cornerが測定した生成速度、コンテキストに割り当てられるメモリ容量、そして5070 Ti、4080 Super、3090との実際の差を紹介します。24 GBのカードに移行すべきタイミングも分かります。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このセットアップの場合: RTX 5080 16 GB.

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#ローカルLLM向けのRTX 5080:16 GBでできること

ローカルLLM用としてのRTX 5080の強みは、16 GBのGDDR7と960 GB/sの帯域幅です。生成は高速ですが、メモリ容量によって使えるモデルが制限されます。Ollamaのモデルライブラリによると、Qwen3 14B(9.3 GB)とgpt-oss 20B(14 GB)は完全にVRAMに収まりますが、Qwen 3.5 27B(17 GB)とQwen3 30B(19 GB)はカードの容量を超えます。Hardware Cornerの測定では、Qwen3 14Bは16,000トークンのコンテキストで毎秒64トークン、gpt-oss 20Bは128,000トークンのコンテキストで毎秒105.6トークンを生成しています。したがって、80億〜200億パラメータのモデルには非常に適していますが、27Bの密なモデルには適していません。

メモリ
NVIDIAによると、256ビットバスに16GBのGDDR7を搭載。Hardware Cornerによると、30Gbit/sでの帯域幅は960GB/sです。
計算
NVIDIAによると、CUDAコアは10,752基で、第5世代のTensorコアを搭載しています。
消費電力
NVIDIAによると、グラフィックス消費電力は360 W、必要なシステム電源容量は850 W、最高温度は88 °Cです。
i
Hardware Cornerがどう考えているか
同サイトは2026年3月時点で、5080はローカルLLM向けには価格に対するモデル実行能力が低いと評価しています。16 GBのメモリでは、強い量子化を施しても扱えるモデルは約280億パラメータまでに限られるため、このメモリ容量ならRTX 4080を推奨しています。これは当時の価格に基づく意見です。判断する前に価格の推移を確認してください。

#16GB以内に収まるモデル

モデルの重みのサイズは、2026年9月29日に確認したOllamaライブラリのファイルに基づいています。余裕容量は、16 GBから重みのサイズを差し引いた残りで、コンテキスト、キャッシュ、エンジンのバッファに必要な容量はまだ差し引いていません。

RTX 5080 向けモデル(Ollama のファイル、特記のない限り Q4)
モデルOllama ファイル粗利益判定
Granite 4.2 8B5.3 GB10.7GB非常に快適
Qwen 3.5 9B6.6 GB9.4 GB非常に快適に使える(テキスト・画像)
Gemma 4 12B7.6 GB8.4GB快適
Qwen3 14B9.3 GB6.7 GB快適で、32kのコンテキストが可能
gpt-oss 20B14 GB2 GBメモリに収まり、MXFP4なら長いコンテキストも利用可能
Devstral Small 2 24B / Mistral Small 3.2 24B15 GB1 GB有用なコンテキストを実現するためのマージンが不足しています
Qwen 3.5 27B17 GB1GB不足収まりません
Qwen3 30B19 GB3GB不足収まりません

Q4量子化した14Bモデルは、快適に動作する最大の密モデルで、コンテキスト用に約7 GBの余裕があります。24Bモデルでは余裕が1 GBしかなく、コンテキストが長くなるとすぐにメモリからあふれます。このカードは会話が短い間なら24Bを動かせますが、エージェント用途には向きません。gpt-oss 20Bは例外です。Ollamaによると、エキスパートの重みはMXFP4でパラメータあたり4.25ビットに量子化されているため、16 GBのメモリで動作できます。Hardware Cornerはこのカードで最大128kのコンテキストを測定しています。

ローカル RAG では埋め込みモデルを追加します。Ollama での bge-m3 のサイズは 1.2 GB なので、Qwen 3.5 9B と合わせると合計 7.8 GB、Gemma 4 12B と合わせると 8.8 GB になります。コンテキストと、そこに挿入するテキスト断片のデータベース用に、7 GB を超えるメモリが残ります。一方、コーディングエージェントには、Ollama のドキュメントによると、少なくとも64,000トークンのコンテキストが必要です。16 GB では、24B を目指すよりも、80億〜140億パラメータのモデルにサイズを下げ、キャッシュを量子化する必要があります。

#実測スループット:速度と帯域幅による上限

これらの数値は、llama.cppで4k〜128kのコンテキストを使ってテストしているHardware Cornerによるものです。QuelLLMが測定した数値ではありません。

RTX 5080での生成速度、トークン/秒(Hardware Corner)
モデル(Q4_K、またはgpt-oss用のMXFP4)4kコンテキストコンテキスト 32k128kコンテキストプロンプト読み込み 4k
Qwen3 8B129,172,5未測定6 410,1
Qwen3 14B80,651,9未測定3 820,5
gpt-oss 20B (MXFP4)172,4149,3105,69 146,1

生成速度はメモリ帯域幅によって制限されます。理論上の上限は、おおよそ帯域幅をモデルの容量で割った値です。Qwen3 14B(9.3 GB)では、960 ÷ 9.3で103トークン/秒となり、4kでの測定値80.6は、その上限の78%に達しています。gpt-oss 20Bは172トークン/秒で、見かけ上の上限(960 ÷ 14 = 69)を超えています。これは、エキスパート型モデルではトークンごとに重みの一部しか読み込まないためです。上限はファイル全体ではなく、その時点で使われる重みの容量に基づいて計算します。

コンテキストは速度に影響します。Qwen3 14Bは4kから32kに変化することで80.6から51.9トークン/秒に低下(-36%)し、一方でgpt-oss 20Bは同じ範囲でわずか13%の低下(172.4から149.3)しかありません。長文処理を行う場合、モデルの選択がGPUよりも重要です。

#コンテキストとKVキャッシュ:16GBの実際の上限

Ollama は VRAM の容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントでは、VRAM が24 GiB 未満の場合は4kトークンとされ、エージェント、ウェブ検索、コーディングツールには少なくとも64,000トークンが推奨されています。そのため、RTX 5080 ではデフォルトが4kトークンになります。デフォルト設定で起動したエージェントは、すぐに履歴を保持できなくなります。コンテキストを増やすと KV キャッシュとして VRAM を消費するため、その分を上の表に示した空き容量でまかなう必要があります。

主な調整手段はキャッシュの量子化です。OllamaのFAQによると、q8_0のメモリ使用量はf16の約半分で、精度の低下はごくわずかです。Flash Attentionが前提となり、GPUとモデルが対応していれば、Ollamaが自動的に有効にします。16 GB環境での優先順位はシンプルです。まず、少なくとも5〜6 GBの余裕が残るモデルを選び、次にキャッシュを量子化し、その後、ollama psで状態を確認しながらコンテキスト長を段階的に増やします。

#RTX 5080搭載環境にOllamaをインストールする

  1. 01
    ドライバを確認
    ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは550以上(Windowsでは551.61)で、総メモリ容量は約16 GBと表示される必要があります。
  2. 02
    Ollama のインストール
    Ollamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
  3. 03
    モデルの起動
    ollama run qwen3:14b を実行してください:9.3 GBのダウンロードは一度だけ行われます。より高速なモデルを試したい場合は ollama run gpt-oss:20b(14 GB)を試してください。
  4. 04
    処理の配分を確認する
    2つ目のターミナルで ollama ps を実行してください。「Processeur」列には「100 % GPU」と表示される必要があります。CPUとGPUの両方に処理が分かれている場合は、モデルまたはコンテキストがGPUメモリに収まりきっていないことを意味します。
  5. 05
    コンテキストを調整
    OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定し、その後ollama psを再実行してください。余裕が足りない場合は、起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
基本コマンド
ollama run qwen3:14b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Blackwell:MXFP4、NVFP4、および電力制限

5080は、4ビット浮動小数点形式の処理をハードウェアで高速化します。Hardware Cornerによると、MXFP4とNVFP4に対応しており、重みがMXFP4で配布されているgpt-oss 20Bでは、その性能向上が見られます。NVIDIAは、NVFP4をBlackwellで導入された4ビット浮動小数点形式と説明しています。各ツール(llama.cpp、Ollama、vLLM)のNVFP4対応は急速に進展しています。インストール済みのバージョンとモデルの説明を確認し、Q4_K_Mを堅実な選択肢として残しておいてください。

Flash Attentionの公式リポジトリによると、Flash Attention 3はHopper(H100)専用です。5080ではバージョン2、またはOllamaやllama.cppの実装が使われ、Ollamaは利用可能な場合に自動で有効にします。消費電力を抑えるには、nvidia-smi -pl で電力の上限をワット単位で設定します。LLMの処理は主にメモリに負荷がかかるため、速度低下は小さいものの、お使いのモデルで測定してください。

消費電力を制限する(管理者権限が必要)
sudo nvidia-smi -pl 300

#5080、5070 Ti、4080 Super、3090:測定された差異

カード別の相対的な生成性能(Hardware Corner、5080 = 100%)
カードメモリ相対生成
RTX 409024 GB123 %
RTX 508016 GB100 %
RTX 5070 Ti16 GB91 %
RTX 3090 Ti24 GB89 %
RTX 4080 Super16 GB82 %
RTX 309024 GB81 %

この表は3つのことを示しています。16 GBの5070 Tiは、5080の速度の91 %に達しており、純粋なスループットでは差がわずかです。81 %の3090は、24 GBでほぼ同じ速度を実現し、アクセス可能なモデルのカタログが変わります(Qwen 3.5 27B はこれに対応しますが、5080では対応しません)。最後に、4090は23 %速く、24 GBを提供します。純粋なLLM使用において、問題は速度よりも容量です。

#結論:5080を選ぶ価値があるのはどんな場合か

状況別の判断
状況決定数値による根拠
80 億から 200 億パラメータのモデル、高速利用向け5080が適している14Bで64 t/s、gpt-oss 20B 128kでは105.6 t/s
27Bの密なモデルを使いたいVRAMが24 GBのグラフィックカードを選ぶQwen 3.5 27Bは17GBであり、5080は16GBです
予算が限られているが、16 GBが欲しい場合5070 Tiと4080 Superを比較する5080の速度の91%および82%
すでに 4080 または 4080 Super を所有している手元に残す容量は同じ16GB
すでに5070 Tiをお持ちです手元に残す5080の91%の速度を実現しながら、同じ容量を維持

5080は16 GBの優れたグラフィックカードですが、LLM用途での欠点は、より安価な近いクラスのカードよりもメモリ容量が多いわけではないことです。購入前に、一つだけ自問してください。動かしたい最大の密なモデルは何ですか?パラメータ数が140億までなら16 GBで十分で、5080の速さを実感できます。それを超えると速度より容量が重要になり、中古の24 GBカードなら近い速度でより多くのモデルを動かせます。今日の価格については、当サイトの価格追跡ページをご覧ください。各カードの最低価格を週2回調査しています。

#よくある質問

FAQ
RTX 5080にどのようなLLMをインストールすべきですか?+
まずQwen3 14Bから始めましょう。9.3 GBのOllamaファイルなので約7 GBの余裕が残り、Hardware Cornerによると4kで毎秒80.6トークンを生成します。さらに速度を求めるなら、gpt-oss 20B(14 GB)は4kで毎秒170トークンを超えます。一般的な用途では、Qwen 3.5 9B(6.6 GB)が最も軽量です。
RTX 5080は70Bモデルを実行できますか?+
いいえ。Llama 3.3 70BはQ4で43 GBあり、カードの16 GBのほぼ3倍です。モデルをGPUメモリとシステムRAMに分けて配置すると、生成速度が大幅に低下します。密なモデルはトークンごとにすべての重みを読み直すためです。70Bモデルには、24 GBのカード2枚、より多くのメモリを搭載した5090、またはユニファイドメモリ搭載マシンが必要です。
ローカルLLMにはRTX 5080とRTX 5070 Tiのどちらが適していますか?+
どちらも16 GBなので、同じモデルを実行できます。Hardware Cornerによると、5070 Tiの生成速度は5080の91%に達します。価格差を比較してください。容量が同じなら、速度の9%の差だけで大幅な追加費用が正当化されることはまれです。価格の追跡情報には、その時点の価格が示されています。
2026年にLLMを動かすには16GBで十分ですか?+
80 億~140 億パラメータのモデルと gpt-oss 20B なら十分で、チャット、軽いコーディング、RAG に対応できます。Q4 の 270 億~320 億パラメータのモデルは 17~20 GB あるため、足りません。240 億パラメータのモデル(15 GB)は収まりますが、長いコンテキストを使う余裕はありません。
RTX 5080にはどのような電源が必要ですか?+
NVIDIAは、グラフィックス消費電力360 Wに対し、システムに必要な電源容量を850 Wとしています。これらはPC全体を対象とするメーカーの指定値です。電力制限を設定するとカードの消費電力は下がりますが、その代わりに処理速度も低下するため、使用するモデルでその低下を測定する必要があります。推奨される電源容量は変わりません。
RTX 5080はFP4をサポートしていますか?+
はい。Hardware Cornerによると、MXFP4とNVFP4をハードウェアでサポートしています。その効果は、MXFP4で提供されるgpt-oss 20Bで見られ、4kで毎秒172トークンと測定されています。他のモデルでは、Q4_K_Mが依然として最も一般的な形式です。FP4を使えるかどうかは、変換済みファイルが入手できるかに左右されます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。