RTX 5090(32 GB)で使うLLMは? ?
RTX 5090は32 GBのGDDR7 VRAMと1,792 GB/sのメモリ帯域幅を備えています。270億~320億パラメータの密なモデル(Qwen 3.5 27B、Qwen3 32B)や、300億~350億パラメータのエキスパート型モデルを、長いコンテキストとともにVRAMに保持できます。27Bの密なモデルでは毎秒約60トークンを生成します。70B(Q4で43 GB)は1枚のカードには収まりません。
32 GBのVRAMを搭載したRTX 5090なら、24 GBのカードでは長いコンテキストで使えないモデルも、VRAM上で動かせます。このガイドでは、実際にメモリに収まるモデルとその正確なサイズ、Hardware Cornerが測定した処理速度、FP4形式によって変わること、コンテキストに割り当てられるメモリ容量、電源に関する制約を紹介します。また、5090が4090や3090との差に見合う価値を持つのはどのような場合かも分かります。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#ローカルLLM向けのRTX 5090:32GBでできること
ローカルLLMにとって、RTX 5090 は 32 GB の GDDR7 と 1 792 GB/s の帯域幅により価値があります。24 GB のカードでは息苦しくなる、270億から350億パラメータのモデルを長文脈付きで完全に VRAM に保持できます。Ollama ライブラリによると、Qwen 3.5 27B は 17 GB、Qwen 3.8 27B は 18 GB、Qwen3 32B と Gemma 4 31B は 20 GB、Qwen 3.5 35B と Nemotron 3 Nano 30B は 24 GB です。Hardware Corner の測定では、4 000 トークンのコンテキストで 270億から320億パラメータのデンスモデルで約 59 から 61 トークン/秒、350億パラメータのエキスパートモデルでは 160 トークン/秒以上を記録しています。70B(Llama 3.3 の Q4 で 43 GB)は依然として単一のカードに収まりません。
- メモリ
- NVIDIAによると、メモリは32GBのGDDR7で、バス幅は512ビットです。Hardware Cornerによると、メモリ帯域幅は1,792GB/sです。
- 計算
- NVIDIAによると、CUDAコア21,760基と第5世代Tensor Coreを搭載しています。Compute Capabilityは12.0で、バージョン550以降のドライバーを使用すればOllamaで対応しています。
- 消費電力
- グラフィック電力575 W、システム電源要件1,000 W(NVIDIAによる)、600 WのPCIe Gen 5ケーブルまたは付属アダプタを使用。
#32GBに収まるモデル
モデルのサイズは、2026年9月29日に確認した Ollama ライブラリのファイルサイズに基づいています。余裕容量とは、32 GB からモデルのサイズを差し引いた残りで、コンテキスト、キャッシュ、エンジンのバッファに必要な容量はまだ差し引いていません。
| モデル | Ollama ファイル | 粗利益 | 注記 |
|---|---|---|---|
| gpt-oss 20B | 14 GB | 18 GB | 128kのコンテキストを制限なしで使用 |
| Qwen 3.5 27B | 17 GB | 15 GB | デンス型、テキストと画像 |
| Qwen 3.8 27B | 18 GB | 14 GB | 密モデル、比較的新しい世代 |
| Qwen3 32B / Gemma 4 31B | 20 GB | 12 GB | 快適に使える密なモデルの規模の上限 |
| Qwen 3.5 35B / Nemotron 3 Nano 30B | 24 GB | 8 GB | コンテキストを含めると24GBには収まりません |
| Llama 3.3 70B | 43 GB | 11GB不足 | 収まりません |
| gpt-oss 120B | 65 GB | 33 GB不足 | 現実的な範囲外 |
32GBで主に変わるのはメモリの余裕です。27BのDenseモデルでは、コンテキスト用に14~15GBを残せますが、24GBのカードでは6~7GBです。また、重みが24GBあるモデルも、8GBの余裕を残してロードできます。この余裕によって、以下で数値を示す128kのコンテキストが可能になります。
#実測スループット:5090は他のカードと比べて何をもたらすか
以下の数字はHardware Cornerがllama.cppを使用して4kから256kのコンテキストで測定したものです。これらはQuelLLMの測定結果ではありません。
| モデル(Q4_K、ただし Qwen 3.5 35B は MXFP4) | 4kコンテキスト | コンテキスト 32k | 128kコンテキスト |
|---|---|---|---|
| Qwen3 14B | 123,8 | 82,4 | 37,2 |
| gpt-oss 20B | 298,2 | 215,1 | 112,0 |
| Qwen3 30B A3B | 226,1 | 143,1 | 76,8 |
| Qwen 3.5 27B | 58,8 | 53,8 | 44,1 |
| Gemma 4 31B | 61,1 | 55,4 | 43,4 |
| Qwen3 32B | 61,4 | 43,8 | 未測定 |
| Qwen 3.5 35B (MXFP4) | 165,2 | 143,2 | 118,2 |
生成速度は帯域幅によって制限されます。理論上の上限は、おおむね帯域幅をモデルの容量で割った値です。Qwen 3.5 27B(17 GB)の場合、1,792 ÷ 17で毎秒105トークンとなり、実測値の58.8トークンはその56%に達します。Qwen3 32B(20 GB)の場合、上限は毎秒90トークン、実測値は61.4トークンで、上限の68%です。したがって、270億〜320億パラメータのデンスモデルは、5090上で毎秒約60トークンで動作します。
Qwen 3.5 27Bでは、5090の生成速度は3090の1.76倍です(Hardware Cornerの2つのページによると58.8対33.5)。一方、メモリ帯域幅は1.91倍です(1,792対936 GB/s)。llama.cppのランキングでは、Llama 2 7B Q4_0で5090は約290〜300トークン/秒に達するのに対し、3090は約160トークン/秒です。
#5090 と 4090 および 3090 の間の性能差:実測値
| カード | メモリ | 相対生成 |
|---|---|---|
| RTX 5090 | 32 GB | 100 % |
| RTX 4090 | 24 GB | 77 % |
| RTX 3090 Ti | 24 GB | 55 % |
| RTX 3090 | 24 GB | 51 % |
#コンテキストとKVキャッシュ:32GBのメモリ容量に合わせた設計
OllamaはVRAMの容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントでは、VRAMが24〜48GiBの場合は32kトークンとされており、エージェント、ウェブ検索、コード関連ツールには少なくとも64,000トークンが推奨されています。5090は32kに設定される区分に入り、24GiB未満のカードの4kよりも余裕があります。コンテキスト長を増やすと、その分KVキャッシュに必要なメモリが増えます。KVキャッシュは、読み込んだ各トークンのアテンションのキーと値を保存します。
最も効果的なのはキャッシュの量子化です。OllamaのFAQによると、q8_0のメモリ使用量はf16の約半分で、精度の低下はごくわずかです。また、Flash Attentionが前提となり、GPUとモデルが対応していればOllamaが自動的に有効にします。計算の目安は、モデルを読み込んだ後の空きメモリから、バッファ用の1〜2 GBを引いた量がキャッシュに使える容量になる、というものです。Qwen 3.5 27B(17 GB)では、コンテキスト用に13 GBを超える容量が残り、Hardware Cornerによる128kでの測定でも確認されています。ollama psで結果を確認してください。
#FP4、NVFP4、MXFP4:Blackwellで実際に何が変わるのか
BlackwellはNVFP4フォーマットを導入しています:NVIDIAによると、4ビットの浮動小数点フォーマットであり、MXFP4の32値ブロックに対して16値ブロックのスケーリングファクターを持つため、より細かく精度が高くなります。Hardware Cornerは、5090がNVFP4をハードウェアで加速できると指摘しています。Q4_K_Mはllama.cppによるブロック単位の量子化であり、両者は紙面では対立しません。どちらもファイルフォーマットであり、モデルがどちらかのフォーマットに存在するのは、誰かがそれを変換したからです。
実際、上の表の Qwen 3.5 35B の MXFP4 の行は、このカードで4ビット浮動小数点形式を使った場合の結果を示しています。重みは24 GB、コンテキスト長4kで生成速度は165トークン/秒です。各ツール(llama.cpp、Ollama、vLLM)による NVFP4 の対応状況は急速に変化しています。ファイルを選ぶ前に、インストール済みのバージョンとモデルの仕様を確認し、Q4_K_M を堅実な選択肢としておきましょう。
#RTX 5090にOllamaをインストール
- 01ドライバを確認ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは550以上(Windowsでは551.61)である必要があり、メモリ総容量には約32 GBと表示される必要があります。
- 02Ollama のインストールOllamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
- 03モデルの起動ollama run qwen3.5:27bを実行してください。17GBのダウンロードは一度だけ行われます。より大きなMoEモデルを試すには、ollama run qwen3.5:35b(24GB)を実行してください。
- 04処理の配分を確認する別のターミナルで ollama ps を実行し、プロセッサ列に100 % GPUと表示されることを確認してください。
- 05コンテキストを調整OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定してから、ollama psを再実行してください。メモリの余裕が足りなければ、起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
#電源、発熱、ファインチューニング
NVIDIAの発表によると、グラフィックス消費電力は575W、システム電源は1,000W、GPUの最高温度は90°Cで、PCIe Gen 5ケーブルは600W対応です。5090は、この比較で最も厳しい要件を求めるカードです。取り付け前にケーブルとそのコネクタを確認し、通気性のよいケースを用意してください。LLMは主にメモリを利用するため、電力制限を設定すると、速度の低下をわずかに抑えながら消費電力を減らせます(3090のガイドにある、250Wに制限した際の測定結果を参照)。
ファインチューニングについて、Unslothは4ビットQLoRAで必要なVRAMの最小容量を示しています。270億パラメータのモデルでは22 GB、320億では26 GB、400億では30 GB、700億では41 GBです。したがって、RTX 5090では、バッチサイズ1かつ短いコンテキストという条件で、最大40BのモデルをQLoRAでファインチューニングできます。70Bのモデルは対象外です。
#結論:用途に応じて5090、4090、3090を選ぶ
| 状況 | 決定 | 数値による根拠 |
|---|---|---|
| 長いコンテキストで27B〜32Bのデンスモデルを使いたい場合 | 5090 | 32 GB:12〜15 GBの余裕、Qwen 3.5 27Bでコンテキスト長128k時に44トークン/秒 |
| 300億〜350億パラメータのMoEモデルを使いたい場合 | 5090 | モデルの重みだけで24 GB:コンテキストも含めると、VRAM 24 GBのカードには収まりません |
| 8B から 14B のモデルにとどまります | 5090を持っていない | RTX 3090または16GBのGPUで十分です |
| すでに4090を所有している | 32GBが必要でなければ、そのまま使い続ける | 生成速度は5090の77% |
| 70Bモデルを使いたい | カード2枚、またはユニファイドメモリ搭載マシン | Q4での重み容量は43GB |
4090 から 5090 への買い替えがまず必要になるのは、メモリ容量が足りない場合です。Hardware Corner によると速度の向上は約 30 % ですが、32 GB のメモリがあれば、24 GB では収まらないモデルやコンテキストを読み込めます。現在の価格は、各カードの最安値を週に 2 回記録している当サイトの価格情報をご覧ください。
- 出典:NVIDIA、RTX 5090の仕様
- 出典:Hardware Corner、RTX 5090向けLLMベンチマーク
- 出典:NVIDIA、NVFP4 フォーマットの紹介
- 出典:Ollama ドキュメント、コンテキスト長
- 出典:Unsloth、ファインチューニングに必要な VRAM
#よくある質問
RTX 5090にどのLLMをインストールすべきか?+
RTX 5090 が 70B モデルを実行できるでしょうか?+
RTX 5090は、LLM向けにRTX 4090よりもはるかに速いのでしょうか?+
RTX 5090がFP4およびNVFP4をサポートしていますか?+
RTX 5090 に必要な電源は?+
RTX 5090上でモデルをファインチューニングすることは可能ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。