中級 13 分RTX 30

RTX 3090 / 3090 Ti (24 GB) で利用可能なLLMは? ?

端的な回答

RTX 3090 は24 GBのVRAMと936 GB/sのメモリ帯域幅を備えており、270億〜320億パラメータの密なモデル(Qwen 3.5 27B、Qwen3 32B、Gemma 4 31B)や、gpt-oss 20Bのようなエキスパート型モデルをQ4で動かすのに十分です。3090 Tiによる速度向上は6〜8%にとどまります。70Bモデルは1枚のカードには収まりません。

24 GBのVRAMを備えるRTX 3090と3090 Tiなら、270億〜320億パラメータのデンスモデルをVRAM内に保持できます。12 GBや16 GBのカードでは、これはできません。このガイドでは、実際にVRAMに収まるモデルとその正確なサイズ、Hardware Cornerが測定した処理速度、コンテキストの影響、消費電力を抑える電力制限、購入前に確認すべき点を紹介します。4090や5090を選んだほうがよい場合もわかります。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#ローカルLLM向けのRTX 3090:24 GBでできること

ローカルLLMにおいて、RTX 3090 はまず 24 GB の GDDR6X と 936 GB/s の帯域幅で価値があります。これにより、12 GB や 16 GB のカードでは収容できない 27B から 32B のパラメータを持つモデルを Q4 量子化で完全に VRAM に保持できます。Ollama ライブラリによると、Qwen 3.5 27B は 17 GB、Qwen 3.8 27B は 18 GB、Qwen3 32B および Gemma 4 31B は 20 GB です。Hardware Corner の測定では、これらの稠密モデルで 4 000 トークンのコンテキスト長の場合、約 33 から 35 トークン/秒、gpt-oss 20B のようなエキスパートモデルでは 100 トークン/秒以上を記録しています。Q4 量子化の 70B(Llama 3.3 の場合は 43 GB)は、単一のカードでは依然として対応が困難です。3090 Ti は帯域幅を 8 % しか向上させません。

メモリ
384ビットバスに搭載された24GBのGDDR6X;Wikipediaの表によると、3090は936GB/s、3090 Tiは1008GB/sです。
消費電力
NVIDIAによると、グラフィックス消費電力は3090が350 W、Tiが450 Wです。必要なシステム電源は3090が750 W、Tiが850 Wです。
ソフトウェア
Ollamaは、ドライバー550以降でサポートされるCompute Capability 8.6のカードとして、RTX 3090を挙げています。
i
帯域幅を986 GB/sとする情報がネット上で出回っています
一部のベンチマークページでは、3090の帯域幅を986 GB/sとしています。384ビットのバスと19.5 Gbit/sのメモリ転送速度から計算される値は936 GB/s(384 × 19.5 ÷ 8)で、Wikipediaの表にもこの値が記載されています。本ガイドでは、この数値を使用しています。

#24GBに収まるモデル

以下のファイルサイズは、2026年9月29日に確認したOllamaライブラリのファイルのサイズです。余裕とは、24 GBからモデルのファイルサイズを差し引いた残りで、コンテキスト、キャッシュ、エンジンのバッファの分はまだ含めていません。カードが画面表示も担っている場合は、システム用の領域も確保してください。

RTX 3090 / 3090 Ti向けモデル(Ollamaのファイル、特記がない限りQ4)
モデルOllama ファイル粗利益提供するもの
gpt-oss 20B14 GB10 GB高速推論、長いコンテキストが可能
Devstral Small 2 24B15 GB9 GBコーディングとエージェント
Qwen 3.5 27B17 GB7 GB汎用性の高いデンスモデル、テキストと画像に対応
Qwen 3.8 27B18 GB6 GB新しい世代の27Bデンスモデル
Qwen3-Coder 30B19 GB5 GBコード、MoE(混合エキスパート)モデル
Gemma 4 26B19 GB5 GBエキスパート混合モデル、高スループット
Qwen3 32B / Gemma 4 31B20 GB4 GBデンスモデルの上限
Qwen 3.5 35B24 GB0 GBQ4でもメモリに収まらず、コンテキストを確保できない
Llama 3.3 70B43 GB19 GB が不足しています単一のカードでは対応不可

まずは270億パラメータの密なモデルから始めてください。Qwen 3.5 27Bなら、コンテキスト用に7GBの余裕が残ります。20GBを超えると、実用的なコンテキストを確保するには余裕が少なすぎます。エキスパートモデル(Qwen3-Coder 30B、Gemma 4 26B、gpt-oss 20B)は、各トークンで重みの一部しか使わないため、密なモデルよりもはるかに高速です。

#コンテキストとKVキャッシュ:24GBの利点

OllamaはVRAM容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントによると、VRAMが24 GiB未満なら4kトークン、24〜48 GiBなら32kトークンです。RTX 3090はその境界に位置するため、カードがエンジンに報告する容量によって32kまたは4kになります。デフォルト設定で起動したエージェントは、予告なく履歴を失う可能性があります。ollama psで実際の値を確認し、エージェント用には自分で設定してください。ドキュメントでは、エージェントには少なくとも64,000トークンを推奨しています。

KV キャッシュはメモリを消費します。コンテキスト内の各トークンについて、アテンションのキーと値が保存されます。主な調整手段はキャッシュの量子化です。Ollama の FAQ によると、q8_0 は f16 の約半分のメモリを使用し、精度の低下はごくわずかです。コンテキストを増やすと速度も低下します。Hardware Corner の測定では、Qwen3 14B のコンテキストを 4k、16k、32k と増やすにつれて、速度は毎秒 70、52、39 トークンと低下しています。

RTX 3090でのプロンプト処理と生成の速度、単位はトークン/秒(Hardware Cornerによる第三者測定)
モデル(Q4_K、またはgpt-oss用のMXFP4)4k 生成16k生成32k生成プロンプト読み込み 4kプロンプトの読み取り 32k
Qwen3 8B115,387,567,94 049,61 714,6
Qwen3 14B70,052,138,62 459,01 175,7
gpt-oss 20B147,5128,5112,64 400,32 547,2
Qwen3 30B A3B153,6113,887,22 988,61 336,8
Qwen 3.5 27B33,532,331,01 104,2848,2
Gemma 4 31B34,733,531,41 155,8723,7

挙動は2つに分かれます。Qwen3 14Bのような従来のモデルは、4kから32kにかけて処理速度がほぼ半分に低下します。一方、Qwen 3.5 27Bは同じ範囲で7%しか低下しません(33.5から31.0)。出典にはその理由が記載されていませんが、長いドキュメントを扱う場合、この挙動はモデルのサイズ以上に重要です。これらはHardware Cornerの数値であり、QuelLLMによる測定値ではありません。

#Ollamaをインストールし、モデルがメモリに収まることを確認する

3090は、コンピュートケイパビリティ8.6のAmpere GPUで、NVIDIAドライバー550以降でOllamaに対応しています。Windowsでは、ドキュメント上で551.61以降が必要とされています。コンテキストのメモリ使用量を削減するFlash Attention 2は、公式リポジトリによるとAmpereで動作します。バージョン3はHopper(H100)専用で、3090では利用できません。

  1. 01
    ドライバを確認
    ターミナルで nvidia-smi を実行してください。ドライバーのバージョンは 550 以上(Windows では 551.61)で、総メモリは約 24 GB が表示される必要があります。
  2. 02
    Ollama のインストール
    Ollamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
  3. 03
    270億パラメータのモデルを起動する
    ollama run qwen3.5:27b を実行してください。17 GB のダウンロードは一度だけです。より高速なモデルをお求めの場合は、ollama run gpt-oss:20b(14 GB)をお試しください。
  4. 04
    メモリの割り当てを確認
    別のターミナルでollama psを実行してください。プロセッサ列には100 % GPUと表示される必要があります。CPU/GPUに分かれている場合は、モデルまたはそのコンテキストがVRAMに収まらず、一部がシステムRAMに移されていることを意味します。
  5. 05
    コンテキストを調整
    OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定し、ollama psを再実行してください。メモリに十分な余裕がない場合は、サーバー起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
基本コマンド
ollama run qwen3.5:27b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#生成速度:帯域幅によって実際にどこまで出せるか

生成速度は帯域幅によって制限されます。GPUはトークンごとに有効な重みをすべて読み直すため、理論上の上限はおよそ帯域幅をモデルの重みのサイズで割った値です。帯域幅936 GB/sの場合、Qwen3 14B(9.3 GB)の上限は約100トークン/秒で、Hardware Cornerの測定ではコンテキスト4kで70.0トークン/秒、上限の70%です。Qwen 3.5 27B(17 GB)は上限55に対して実測33.5で61%、Qwen3 32B(20 GB)は上限47に対して実測35.1で75%です。したがって、27Bや32Bの密なモデルは上限の60~75%程度、33~35トークン/秒で動作し、読み進めるには十分快適な速度です。

llama.cppのコミュニティランキングでも、両カードの性能が近いことが確認できます。Llama 2 7B Q4_0(3.56 GiB)では、3090の生成速度はFlash Attentionなしで毎秒158.16トークン、ありで毎秒161.89トークンです。対して3090 Tiは、それぞれ毎秒171.19トークンと172.26トークンで、約8%と6%速く、メモリ帯域幅が8%広いことと整合しています。二つの測定結果は別々の投稿者によるものなので、実際の差はマシンによって異なります。

→
プロンプトの処理は生成と同じくらい重要
プロンプトの読み取り速度は計算性能に依存し、帯域幅には依存しません。Qwen 3.5 27Bでは、Hardware Cornerの測定により、4kコンテキストで1秒あたり1 104トークン、32kコンテキストで1秒あたり848トークンが確認されています。32 000トークンの文書は約40秒で読み取られます。各ターンで大きなコンテキストを返すエージェントの場合、この遅延は生成速度よりも大きな影響を及ぼします。

#冷却、消費電力の上限、中古での購入

3090の消費電力は350 W、Tiは450 Wで、NVIDIAによるとGPUの最高温度はそれぞれ93 °C、92 °Cです。LLMで高負荷が続く場合は、ケースの騒音と発熱も重要です。通気性のよいケースと、NVIDIAが求める750 W(3090)または850 W(Ti)の要件を満たす電源を用意してください。LLMは主にメモリに負荷をかけるため、電力制限による速度低下はわずかです。

llama.cppのランキングは、おおよその目安になります。ある貢献者は3090の電力上限を250Wに制限し、Llama 2 7B Q4_0で137.72トークン/秒を記録しています。一方、標準設定での測定では158.16トークン/秒です。電力が29%少なくなる代わりに、速度は約13%低下しています。この2つの測定値は異なるマシンで得られたものです。参考程度に捉えたうえで、ご自身の環境で測定してください。

消費電力を制限する(管理者権限が必要)
sudo nvidia-smi -pl 250

nvidia-smiの-plオプションは、最大消費電力をワット単位で設定します。Windowsでは管理者権限でターミナルを開いてください。設定を自動適用するようにしていなければ、再起動時に設定は失われます。中古のカードでは、HWiNFOなどのツールでメモリの温度も監視してください。メモリの温度がGPUコアの温度より大幅に高くなる場合は、サーマルパッドの交換を検討する必要があります。

#中古3090の購入:確認すべき点

3090はAmpereアーキテクチャのカードで、主に中古市場で見かけます。現在の価格については、当社のトラッキングを参照してください。トラッキングでは、各カードの最低価格を週2回、VRAMの1 GBあたりの価格とともに記録しています。

識別情報
nvidia-smiで、カードのメモリ容量が24 GBと表示され、モデル名が別の製品ではなく、正しいもの(3090または3090 Ti)になっていることを確認してください。
安定性
270億パラメータのモデルを約30分間ループで実行してください。クラッシュ、アーティファクト、またはサーマルスロットリングは警告の兆候です。
メモリ温度
メモリの温度とGPUコアの温度を比較してください。差が大きい場合は、サーマルパッドの劣化を示しています。
保証
返品を受け付けること、または販売者による保証を必ず求めてください。サーマルパッドやグリスの交換費用も見込んでおく必要があります。
電源
ピーク消費電力は350 W または450 W。購入前に、電源ユニットとカードの電源コネクタを確認してください。

#3090、4090、5090:より多く払うと何が得られる?

RTX 4090も24 GBを搭載し、計算能力はさらに高くなっています。その優位性は、生成よりもプロンプトの読み取りで大きく現れます。生成は依然として帯域幅に制約されるためです。RTX 5090では32 GBになり、32Bのデンスモデルでも長いコンテキストに使える余裕が残る容量帯に入ります。この2枚のカードのガイドでは、それぞれのケースを詳しく説明しています。

#vLLM、2枚のカード、3090でのファインチューニング

3090では、3つの用途がよく挙げられます。vLLMは動作します。ドキュメントによるとCompute Capability 7.5以上が必要で、3090は8.6です。llama.cppとvLLMのどちらを選ぶかについては、エンジン比較をご覧ください。2枚の3090は、30シリーズのカード用のNVLinkブリッジで組み合わせられます。レイヤーの分担については、マルチGPUガイドで詳しく説明しています。

ファインチューニングについて、Unslothは4ビットQLoRAでのVRAMの最低要件を示しています。80億パラメータのモデルで6 GB、140億で8.5 GB、270億で22 GB、320億で26 GBです。したがって、3090ではバッチサイズ1と短いコンテキストという条件で、QLoRAによる27Bまでのファインチューニングがぎりぎり可能ですが、32Bは収まりません。16ビットLoRAでは、90億パラメータでもすでに24 GBが必要で、カードのVRAM容量をすべて使います。

#結論:3090が引き続き適切な選択となるケース

状況別の判断
状況決定数値による根拠
27Bまたは32Bの密なモデルをローカルで使いたい3090(または4090)24GB:モデルの重みに17〜20GB、残りの余裕は4〜7GB
主に70億から140億パラメータのモデルを対象としています12GBまたは16GBのGPUカードで十分です3090の利点は速度だけです:936GB/s
70Bモデルまたは非常に長いコンテキストを使いたい5090 または 2 枚のカード70BモデルのQ4での重み容量は43 GB
静音性と消費電力を最優先する比較的新しい16 GBのグラフィックカード3090 には 750 W の電源が必要です
3090と3090 Tiのどちらを選ぶか迷っています2つのうち安い方を選んでください生成速度の向上はわずか+6〜+8%

3090は、27Bモデルをローカルで使うための入門用GPUとして、今も最も一般的です。これはHardware Cornerの結論で、同サイトは本格的な用途を始めるための中古GPUとして最良の選択肢だと評価しています。予算が許せば4090が代わりになり、32 GBを求めるなら5090が選択肢になります。

#よくある質問

FAQ
RTX 3090でどのようなLLMを実行すべきですか?+
まずはQwen 3.5 27Bから始めてください。Ollama用のファイルは17 GBで、コンテキスト用に約7 GBの余裕が残ります。Hardware Cornerによると、生成速度は約33トークン/秒です。さらに速度を求めるなら、gpt-oss 20B(14 GB)は100トークン/秒を超えます。Qwen3 32BとGemma 4 31B(20 GB)が上限です。
RTX 3090 で 70B モデルを実行できますか?+
いいえ、全体をGPUに載せることはできません。Llama 3.3 70BはOllamaでは43GBあり、カードの容量を19GB上回ります。メインメモリにも分散して配置すると、トークンを生成するたびにすべての重みを読み直すため、非常に遅くなります。70BをVRAMに収めるには、24GBのカード2枚、または43GBを超える容量のカードが必要です。
ローカルLLMにはRTX 3090と3090 Tiのどちらを選ぶべきですか?+
ほぼ同等の性能です。同じ24GBのメモリを備えていますが、帯域幅は936GB/s対1008GB/sであり、llama.cppでのランキングにおいて6~8%の生成速度向上が見られます。Tiの消費電力は450Wに対し、350Wです。価格のわずかな差を除き、3090が最適な選択です。
RTX 3090にはどのような電源ユニットが必要ですか?+
NVIDIA は、3090(グラフィックス消費電力350W)には750W、3090 Ti(グラフィックス消費電力450W)には850Wのシステム電源が必要だとしています。これらの値はPC全体を対象としています。コミュニティによる測定では、電力上限を250Wにすると、速度が約13%低下する代わりに、カードの消費電力を抑えられます。
RTX 3090はvLLMおよびFlash Attentionをサポートしていますか?+
はい、両方に対応しています。vLLMにはCompute Capability 7.5以上が必要で、3090は8.6です。公式リポジトリによると、Flash Attention 2は3090を含むAmpere GPUで動作します。一方、Flash Attention 3はHopper専用なので、一般向けのAmpereカードで使おうとしないでください。
RTX 3090 でモデルをファインチューニングすることは可能ですか?+
はい、QLoRAなら可能です。Unslothによると、最低必要量は27Bモデルで22 GB、14Bモデルで8.5 GBです。そのため、27Bはバッチサイズ1ならぎりぎり動作します。32Bには26 GB必要なので収まりません。16ビットLoRAでは、実用上の上限はおよそ90億パラメータです。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。