中級 11 分RTX 50

RTX 5090(32 GB)で使うLLMは? ?

端的な回答

RTX 5090は32 GBのGDDR7 VRAMと1,792 GB/sのメモリ帯域幅を備えています。270億~320億パラメータの密なモデル(Qwen 3.5 27B、Qwen3 32B)や、300億~350億パラメータのエキスパート型モデルを、長いコンテキストとともにVRAMに保持できます。27Bの密なモデルでは毎秒約60トークンを生成します。70B(Q4で43 GB)は1枚のカードには収まりません。

32 GBのVRAMを搭載したRTX 5090なら、24 GBのカードでは長いコンテキストで使えないモデルも、VRAM上で動かせます。このガイドでは、実際にメモリに収まるモデルとその正確なサイズ、Hardware Cornerが測定した処理速度、FP4形式によって変わること、コンテキストに割り当てられるメモリ容量、電源に関する制約を紹介します。また、5090が4090や3090との差に見合う価値を持つのはどのような場合かも分かります。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#ローカルLLM向けのRTX 5090:32GBでできること

ローカルLLMにとって、RTX 5090 は 32 GB の GDDR7 と 1 792 GB/s の帯域幅により価値があります。24 GB のカードでは息苦しくなる、270億から350億パラメータのモデルを長文脈付きで完全に VRAM に保持できます。Ollama ライブラリによると、Qwen 3.5 27B は 17 GB、Qwen 3.8 27B は 18 GB、Qwen3 32B と Gemma 4 31B は 20 GB、Qwen 3.5 35B と Nemotron 3 Nano 30B は 24 GB です。Hardware Corner の測定では、4 000 トークンのコンテキストで 270億から320億パラメータのデンスモデルで約 59 から 61 トークン/秒、350億パラメータのエキスパートモデルでは 160 トークン/秒以上を記録しています。70B(Llama 3.3 の Q4 で 43 GB)は依然として単一のカードに収まりません。

メモリ
NVIDIAによると、メモリは32GBのGDDR7で、バス幅は512ビットです。Hardware Cornerによると、メモリ帯域幅は1,792GB/sです。
計算
NVIDIAによると、CUDAコア21,760基と第5世代Tensor Coreを搭載しています。Compute Capabilityは12.0で、バージョン550以降のドライバーを使用すればOllamaで対応しています。
消費電力
グラフィック電力575 W、システム電源要件1,000 W(NVIDIAによる)、600 WのPCIe Gen 5ケーブルまたは付属アダプタを使用。

#32GBに収まるモデル

モデルのサイズは、2026年9月29日に確認した Ollama ライブラリのファイルサイズに基づいています。余裕容量とは、32 GB からモデルのサイズを差し引いた残りで、コンテキスト、キャッシュ、エンジンのバッファに必要な容量はまだ差し引いていません。

RTX 5090向けモデル(Ollamaのファイル、特記がない限りQ4)
モデルOllama ファイル粗利益注記
gpt-oss 20B14 GB18 GB128kのコンテキストを制限なしで使用
Qwen 3.5 27B17 GB15 GBデンス型、テキストと画像
Qwen 3.8 27B18 GB14 GB密モデル、比較的新しい世代
Qwen3 32B / Gemma 4 31B20 GB12 GB快適に使える密なモデルの規模の上限
Qwen 3.5 35B / Nemotron 3 Nano 30B24 GB8 GBコンテキストを含めると24GBには収まりません
Llama 3.3 70B43 GB11GB不足収まりません
gpt-oss 120B65 GB33 GB不足現実的な範囲外

32GBで主に変わるのはメモリの余裕です。27BのDenseモデルでは、コンテキスト用に14~15GBを残せますが、24GBのカードでは6~7GBです。また、重みが24GBあるモデルも、8GBの余裕を残してロードできます。この余裕によって、以下で数値を示す128kのコンテキストが可能になります。

#実測スループット:5090は他のカードと比べて何をもたらすか

以下の数字はHardware Cornerがllama.cppを使用して4kから256kのコンテキストで測定したものです。これらはQuelLLMの測定結果ではありません。

RTX 5090で生成、トークン/秒(Hardware Corner)
モデル(Q4_K、ただし Qwen 3.5 35B は MXFP4)4kコンテキストコンテキスト 32k128kコンテキスト
Qwen3 14B123,882,437,2
gpt-oss 20B298,2215,1112,0
Qwen3 30B A3B226,1143,176,8
Qwen 3.5 27B58,853,844,1
Gemma 4 31B61,155,443,4
Qwen3 32B61,443,8未測定
Qwen 3.5 35B (MXFP4)165,2143,2118,2

生成速度は帯域幅によって制限されます。理論上の上限は、おおむね帯域幅をモデルの容量で割った値です。Qwen 3.5 27B(17 GB)の場合、1,792 ÷ 17で毎秒105トークンとなり、実測値の58.8トークンはその56%に達します。Qwen3 32B(20 GB)の場合、上限は毎秒90トークン、実測値は61.4トークンで、上限の68%です。したがって、270億〜320億パラメータのデンスモデルは、5090上で毎秒約60トークンで動作します。

Qwen 3.5 27Bでは、5090の生成速度は3090の1.76倍です(Hardware Cornerの2つのページによると58.8対33.5)。一方、メモリ帯域幅は1.91倍です(1,792対936 GB/s)。llama.cppのランキングでは、Llama 2 7B Q4_0で5090は約290〜300トークン/秒に達するのに対し、3090は約160トークン/秒です。

#5090 と 4090 および 3090 の間の性能差:実測値

カード別の相対的な生成性能(Hardware Corner、5090 = 100 %)
カードメモリ相対生成
RTX 509032 GB100 %
RTX 409024 GB77 %
RTX 3090 Ti24 GB55 %
RTX 309024 GB51 %
→
本質的な利点:長いコンテキストサポート
5090はコンテキストが長くなっても生成速度を保ちます。Qwen 3.5 27Bでは、コンテキストが4kから128kになると、生成速度は58.8トークン/秒から44.1トークン/秒に低下します(-25%)。また、MXFP4のQwen 3.5 35Bは、256,000トークンのコンテキストでも97.3トークン/秒で生成できます。短いチャットではなく、こうした使い方でこそ、32 GBのメモリがこのカードを選ぶ理由になります。

#コンテキストとKVキャッシュ:32GBのメモリ容量に合わせた設計

OllamaはVRAMの容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントでは、VRAMが24〜48GiBの場合は32kトークンとされており、エージェント、ウェブ検索、コード関連ツールには少なくとも64,000トークンが推奨されています。5090は32kに設定される区分に入り、24GiB未満のカードの4kよりも余裕があります。コンテキスト長を増やすと、その分KVキャッシュに必要なメモリが増えます。KVキャッシュは、読み込んだ各トークンのアテンションのキーと値を保存します。

最も効果的なのはキャッシュの量子化です。OllamaのFAQによると、q8_0のメモリ使用量はf16の約半分で、精度の低下はごくわずかです。また、Flash Attentionが前提となり、GPUとモデルが対応していればOllamaが自動的に有効にします。計算の目安は、モデルを読み込んだ後の空きメモリから、バッファ用の1〜2 GBを引いた量がキャッシュに使える容量になる、というものです。Qwen 3.5 27B(17 GB)では、コンテキスト用に13 GBを超える容量が残り、Hardware Cornerによる128kでの測定でも確認されています。ollama psで結果を確認してください。

#FP4、NVFP4、MXFP4:Blackwellで実際に何が変わるのか

BlackwellはNVFP4フォーマットを導入しています:NVIDIAによると、4ビットの浮動小数点フォーマットであり、MXFP4の32値ブロックに対して16値ブロックのスケーリングファクターを持つため、より細かく精度が高くなります。Hardware Cornerは、5090がNVFP4をハードウェアで加速できると指摘しています。Q4_K_Mはllama.cppによるブロック単位の量子化であり、両者は紙面では対立しません。どちらもファイルフォーマットであり、モデルがどちらかのフォーマットに存在するのは、誰かがそれを変換したからです。

実際、上の表の Qwen 3.5 35B の MXFP4 の行は、このカードで4ビット浮動小数点形式を使った場合の結果を示しています。重みは24 GB、コンテキスト長4kで生成速度は165トークン/秒です。各ツール(llama.cpp、Ollama、vLLM)による NVFP4 の対応状況は急速に変化しています。ファイルを選ぶ前に、インストール済みのバージョンとモデルの仕様を確認し、Q4_K_M を堅実な選択肢としておきましょう。

#RTX 5090にOllamaをインストール

  1. 01
    ドライバを確認
    ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは550以上(Windowsでは551.61)である必要があり、メモリ総容量には約32 GBと表示される必要があります。
  2. 02
    Ollama のインストール
    Ollamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
  3. 03
    モデルの起動
    ollama run qwen3.5:27bを実行してください。17GBのダウンロードは一度だけ行われます。より大きなMoEモデルを試すには、ollama run qwen3.5:35b(24GB)を実行してください。
  4. 04
    処理の配分を確認する
    別のターミナルで ollama ps を実行し、プロセッサ列に100 % GPUと表示されることを確認してください。
  5. 05
    コンテキストを調整
    OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定してから、ollama psを再実行してください。メモリの余裕が足りなければ、起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
基本コマンド
ollama run qwen3.5:27b
ollama run qwen3.5:35b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#電源、発熱、ファインチューニング

NVIDIAの発表によると、グラフィックス消費電力は575W、システム電源は1,000W、GPUの最高温度は90°Cで、PCIe Gen 5ケーブルは600W対応です。5090は、この比較で最も厳しい要件を求めるカードです。取り付け前にケーブルとそのコネクタを確認し、通気性のよいケースを用意してください。LLMは主にメモリを利用するため、電力制限を設定すると、速度の低下をわずかに抑えながら消費電力を減らせます(3090のガイドにある、250Wに制限した際の測定結果を参照)。

ファインチューニングについて、Unslothは4ビットQLoRAで必要なVRAMの最小容量を示しています。270億パラメータのモデルでは22 GB、320億では26 GB、400億では30 GB、700億では41 GBです。したがって、RTX 5090では、バッチサイズ1かつ短いコンテキストという条件で、最大40BのモデルをQLoRAでファインチューニングできます。70Bのモデルは対象外です。

#結論:用途に応じて5090、4090、3090を選ぶ

状況別の判断
状況決定数値による根拠
長いコンテキストで27B〜32Bのデンスモデルを使いたい場合509032 GB:12〜15 GBの余裕、Qwen 3.5 27Bでコンテキスト長128k時に44トークン/秒
300億〜350億パラメータのMoEモデルを使いたい場合5090モデルの重みだけで24 GB:コンテキストも含めると、VRAM 24 GBのカードには収まりません
8B から 14B のモデルにとどまります5090を持っていないRTX 3090または16GBのGPUで十分です
すでに4090を所有している32GBが必要でなければ、そのまま使い続ける生成速度は5090の77%
70Bモデルを使いたいカード2枚、またはユニファイドメモリ搭載マシンQ4での重み容量は43GB

4090 から 5090 への買い替えがまず必要になるのは、メモリ容量が足りない場合です。Hardware Corner によると速度の向上は約 30 % ですが、32 GB のメモリがあれば、24 GB では収まらないモデルやコンテキストを読み込めます。現在の価格は、各カードの最安値を週に 2 回記録している当サイトの価格情報をご覧ください。

#よくある質問

FAQ
RTX 5090にどのLLMをインストールすべきか?+
まずは Qwen 3.5 27B から始めてください。Ollama 用ファイルは 17 GB で、約 15 GB の余裕が残り、Hardware Corner によると毎秒約 59 トークンを生成します。より大きなエキスパート型モデルなら、Qwen 3.5 35B(24 GB)は毎秒 160 トークンを超えます。Qwen3 32B と Gemma 4 31B(20 GB)は、密なモデルで使えるサイズの上限に当たります。
RTX 5090 が 70B モデルを実行できるでしょうか?+
いいえ、完全には収まりません。Llama 3.3 70BはOllamaで43 GBあり、カードの容量を11 GB超えます。gpt-oss 120Bは65 GBです。モデルをVRAMとメインメモリに分散させると、密なモデルではトークンを生成するたびにすべての重みを読み直すため、スループットが低下します。70BをVRAMに収めるには、2枚のカードまたはユニファイドメモリ搭載マシンが必要です。
RTX 5090は、LLM向けにRTX 4090よりもはるかに速いのでしょうか?+
Hardware Cornerによると、4090は5090の77%の出力速度を発揮し、約30%の差が5090にあります。その主な利点は32GBのメモリであり、より大きなモデルやコンテキストをロードできる点です。
RTX 5090がFP4およびNVFP4をサポートしていますか?+
はい:NVFP4 は Blackwell で導入された 4 ビット形式であり、Hardware Corner によれば、そのカードがハードウェア的に加速するとのことです。ソフトウェア側のサポートは進化しています:Ollama、llama.cpp、または vLLM のバージョンがモデルのフォーマットをサポートしているかを確認してください。Q4_K_M は確実な選択肢であり、FP4 は不要です。
RTX 5090 に必要な電源は?+
NVIDIAは、グラフィックス消費電力575Wに対して、1000Wのシステム電源と、600W対応のPCIe Gen 5ケーブルまたは付属アダプターを指定しています。Hardware Cornerは、少なくとも950WのGold認証電源を推奨しています。品質の高い電源を選び、取り付け前にケーブルを確認してください。
RTX 5090上でモデルをファインチューニングすることは可能ですか?+
はい、QLoRAの場合です。Unslothによると、27Bモデルの最小要件は22 GB、40Bモデルは30 GBであり、バッチサイズ1であれば32 GBに収まります。70Bモデルは41 GB必要であり、収まりません。これらは絶対的な最小値であり、コンテキストやバッチサイズによって増加します。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。