RTX 3090 / 3090 Ti (24 GB) で利用可能なLLMは? ?
RTX 3090 は24 GBのVRAMと936 GB/sのメモリ帯域幅を備えており、270億〜320億パラメータの密なモデル(Qwen 3.5 27B、Qwen3 32B、Gemma 4 31B)や、gpt-oss 20Bのようなエキスパート型モデルをQ4で動かすのに十分です。3090 Tiによる速度向上は6〜8%にとどまります。70Bモデルは1枚のカードには収まりません。
24 GBのVRAMを備えるRTX 3090と3090 Tiなら、270億〜320億パラメータのデンスモデルをVRAM内に保持できます。12 GBや16 GBのカードでは、これはできません。このガイドでは、実際にVRAMに収まるモデルとその正確なサイズ、Hardware Cornerが測定した処理速度、コンテキストの影響、消費電力を抑える電力制限、購入前に確認すべき点を紹介します。4090や5090を選んだほうがよい場合もわかります。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#ローカルLLM向けのRTX 3090:24 GBでできること
ローカルLLMにおいて、RTX 3090 はまず 24 GB の GDDR6X と 936 GB/s の帯域幅で価値があります。これにより、12 GB や 16 GB のカードでは収容できない 27B から 32B のパラメータを持つモデルを Q4 量子化で完全に VRAM に保持できます。Ollama ライブラリによると、Qwen 3.5 27B は 17 GB、Qwen 3.8 27B は 18 GB、Qwen3 32B および Gemma 4 31B は 20 GB です。Hardware Corner の測定では、これらの稠密モデルで 4 000 トークンのコンテキスト長の場合、約 33 から 35 トークン/秒、gpt-oss 20B のようなエキスパートモデルでは 100 トークン/秒以上を記録しています。Q4 量子化の 70B(Llama 3.3 の場合は 43 GB)は、単一のカードでは依然として対応が困難です。3090 Ti は帯域幅を 8 % しか向上させません。
- メモリ
- 384ビットバスに搭載された24GBのGDDR6X;Wikipediaの表によると、3090は936GB/s、3090 Tiは1008GB/sです。
- 消費電力
- NVIDIAによると、グラフィックス消費電力は3090が350 W、Tiが450 Wです。必要なシステム電源は3090が750 W、Tiが850 Wです。
- ソフトウェア
- Ollamaは、ドライバー550以降でサポートされるCompute Capability 8.6のカードとして、RTX 3090を挙げています。
#24GBに収まるモデル
以下のファイルサイズは、2026年9月29日に確認したOllamaライブラリのファイルのサイズです。余裕とは、24 GBからモデルのファイルサイズを差し引いた残りで、コンテキスト、キャッシュ、エンジンのバッファの分はまだ含めていません。カードが画面表示も担っている場合は、システム用の領域も確保してください。
| モデル | Ollama ファイル | 粗利益 | 提供するもの |
|---|---|---|---|
| gpt-oss 20B | 14 GB | 10 GB | 高速推論、長いコンテキストが可能 |
| Devstral Small 2 24B | 15 GB | 9 GB | コーディングとエージェント |
| Qwen 3.5 27B | 17 GB | 7 GB | 汎用性の高いデンスモデル、テキストと画像に対応 |
| Qwen 3.8 27B | 18 GB | 6 GB | 新しい世代の27Bデンスモデル |
| Qwen3-Coder 30B | 19 GB | 5 GB | コード、MoE(混合エキスパート)モデル |
| Gemma 4 26B | 19 GB | 5 GB | エキスパート混合モデル、高スループット |
| Qwen3 32B / Gemma 4 31B | 20 GB | 4 GB | デンスモデルの上限 |
| Qwen 3.5 35B | 24 GB | 0 GB | Q4でもメモリに収まらず、コンテキストを確保できない |
| Llama 3.3 70B | 43 GB | 19 GB が不足しています | 単一のカードでは対応不可 |
まずは270億パラメータの密なモデルから始めてください。Qwen 3.5 27Bなら、コンテキスト用に7GBの余裕が残ります。20GBを超えると、実用的なコンテキストを確保するには余裕が少なすぎます。エキスパートモデル(Qwen3-Coder 30B、Gemma 4 26B、gpt-oss 20B)は、各トークンで重みの一部しか使わないため、密なモデルよりもはるかに高速です。
#コンテキストとKVキャッシュ:24GBの利点
OllamaはVRAM容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントによると、VRAMが24 GiB未満なら4kトークン、24〜48 GiBなら32kトークンです。RTX 3090はその境界に位置するため、カードがエンジンに報告する容量によって32kまたは4kになります。デフォルト設定で起動したエージェントは、予告なく履歴を失う可能性があります。ollama psで実際の値を確認し、エージェント用には自分で設定してください。ドキュメントでは、エージェントには少なくとも64,000トークンを推奨しています。
KV キャッシュはメモリを消費します。コンテキスト内の各トークンについて、アテンションのキーと値が保存されます。主な調整手段はキャッシュの量子化です。Ollama の FAQ によると、q8_0 は f16 の約半分のメモリを使用し、精度の低下はごくわずかです。コンテキストを増やすと速度も低下します。Hardware Corner の測定では、Qwen3 14B のコンテキストを 4k、16k、32k と増やすにつれて、速度は毎秒 70、52、39 トークンと低下しています。
| モデル(Q4_K、またはgpt-oss用のMXFP4) | 4k 生成 | 16k生成 | 32k生成 | プロンプト読み込み 4k | プロンプトの読み取り 32k |
|---|---|---|---|---|---|
| Qwen3 8B | 115,3 | 87,5 | 67,9 | 4 049,6 | 1 714,6 |
| Qwen3 14B | 70,0 | 52,1 | 38,6 | 2 459,0 | 1 175,7 |
| gpt-oss 20B | 147,5 | 128,5 | 112,6 | 4 400,3 | 2 547,2 |
| Qwen3 30B A3B | 153,6 | 113,8 | 87,2 | 2 988,6 | 1 336,8 |
| Qwen 3.5 27B | 33,5 | 32,3 | 31,0 | 1 104,2 | 848,2 |
| Gemma 4 31B | 34,7 | 33,5 | 31,4 | 1 155,8 | 723,7 |
挙動は2つに分かれます。Qwen3 14Bのような従来のモデルは、4kから32kにかけて処理速度がほぼ半分に低下します。一方、Qwen 3.5 27Bは同じ範囲で7%しか低下しません(33.5から31.0)。出典にはその理由が記載されていませんが、長いドキュメントを扱う場合、この挙動はモデルのサイズ以上に重要です。これらはHardware Cornerの数値であり、QuelLLMによる測定値ではありません。
#Ollamaをインストールし、モデルがメモリに収まることを確認する
3090は、コンピュートケイパビリティ8.6のAmpere GPUで、NVIDIAドライバー550以降でOllamaに対応しています。Windowsでは、ドキュメント上で551.61以降が必要とされています。コンテキストのメモリ使用量を削減するFlash Attention 2は、公式リポジトリによるとAmpereで動作します。バージョン3はHopper(H100)専用で、3090では利用できません。
- 01ドライバを確認ターミナルで nvidia-smi を実行してください。ドライバーのバージョンは 550 以上(Windows では 551.61)で、総メモリは約 24 GB が表示される必要があります。
- 02Ollama のインストールOllamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
- 03270億パラメータのモデルを起動するollama run qwen3.5:27b を実行してください。17 GB のダウンロードは一度だけです。より高速なモデルをお求めの場合は、ollama run gpt-oss:20b(14 GB)をお試しください。
- 04メモリの割り当てを確認別のターミナルでollama psを実行してください。プロセッサ列には100 % GPUと表示される必要があります。CPU/GPUに分かれている場合は、モデルまたはそのコンテキストがVRAMに収まらず、一部がシステムRAMに移されていることを意味します。
- 05コンテキストを調整OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定し、ollama psを再実行してください。メモリに十分な余裕がない場合は、サーバー起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
#生成速度:帯域幅によって実際にどこまで出せるか
生成速度は帯域幅によって制限されます。GPUはトークンごとに有効な重みをすべて読み直すため、理論上の上限はおよそ帯域幅をモデルの重みのサイズで割った値です。帯域幅936 GB/sの場合、Qwen3 14B(9.3 GB)の上限は約100トークン/秒で、Hardware Cornerの測定ではコンテキスト4kで70.0トークン/秒、上限の70%です。Qwen 3.5 27B(17 GB)は上限55に対して実測33.5で61%、Qwen3 32B(20 GB)は上限47に対して実測35.1で75%です。したがって、27Bや32Bの密なモデルは上限の60~75%程度、33~35トークン/秒で動作し、読み進めるには十分快適な速度です。
llama.cppのコミュニティランキングでも、両カードの性能が近いことが確認できます。Llama 2 7B Q4_0(3.56 GiB)では、3090の生成速度はFlash Attentionなしで毎秒158.16トークン、ありで毎秒161.89トークンです。対して3090 Tiは、それぞれ毎秒171.19トークンと172.26トークンで、約8%と6%速く、メモリ帯域幅が8%広いことと整合しています。二つの測定結果は別々の投稿者によるものなので、実際の差はマシンによって異なります。
#冷却、消費電力の上限、中古での購入
3090の消費電力は350 W、Tiは450 Wで、NVIDIAによるとGPUの最高温度はそれぞれ93 °C、92 °Cです。LLMで高負荷が続く場合は、ケースの騒音と発熱も重要です。通気性のよいケースと、NVIDIAが求める750 W(3090)または850 W(Ti)の要件を満たす電源を用意してください。LLMは主にメモリに負荷をかけるため、電力制限による速度低下はわずかです。
llama.cppのランキングは、おおよその目安になります。ある貢献者は3090の電力上限を250Wに制限し、Llama 2 7B Q4_0で137.72トークン/秒を記録しています。一方、標準設定での測定では158.16トークン/秒です。電力が29%少なくなる代わりに、速度は約13%低下しています。この2つの測定値は異なるマシンで得られたものです。参考程度に捉えたうえで、ご自身の環境で測定してください。
nvidia-smiの-plオプションは、最大消費電力をワット単位で設定します。Windowsでは管理者権限でターミナルを開いてください。設定を自動適用するようにしていなければ、再起動時に設定は失われます。中古のカードでは、HWiNFOなどのツールでメモリの温度も監視してください。メモリの温度がGPUコアの温度より大幅に高くなる場合は、サーマルパッドの交換を検討する必要があります。
#中古3090の購入:確認すべき点
3090はAmpereアーキテクチャのカードで、主に中古市場で見かけます。現在の価格については、当社のトラッキングを参照してください。トラッキングでは、各カードの最低価格を週2回、VRAMの1 GBあたりの価格とともに記録しています。
- 識別情報
- nvidia-smiで、カードのメモリ容量が24 GBと表示され、モデル名が別の製品ではなく、正しいもの(3090または3090 Ti)になっていることを確認してください。
- 安定性
- 270億パラメータのモデルを約30分間ループで実行してください。クラッシュ、アーティファクト、またはサーマルスロットリングは警告の兆候です。
- メモリ温度
- メモリの温度とGPUコアの温度を比較してください。差が大きい場合は、サーマルパッドの劣化を示しています。
- 保証
- 返品を受け付けること、または販売者による保証を必ず求めてください。サーマルパッドやグリスの交換費用も見込んでおく必要があります。
- 電源
- ピーク消費電力は350 W または450 W。購入前に、電源ユニットとカードの電源コネクタを確認してください。
#3090、4090、5090:より多く払うと何が得られる?
RTX 4090も24 GBを搭載し、計算能力はさらに高くなっています。その優位性は、生成よりもプロンプトの読み取りで大きく現れます。生成は依然として帯域幅に制約されるためです。RTX 5090では32 GBになり、32Bのデンスモデルでも長いコンテキストに使える余裕が残る容量帯に入ります。この2枚のカードのガイドでは、それぞれのケースを詳しく説明しています。
#vLLM、2枚のカード、3090でのファインチューニング
3090では、3つの用途がよく挙げられます。vLLMは動作します。ドキュメントによるとCompute Capability 7.5以上が必要で、3090は8.6です。llama.cppとvLLMのどちらを選ぶかについては、エンジン比較をご覧ください。2枚の3090は、30シリーズのカード用のNVLinkブリッジで組み合わせられます。レイヤーの分担については、マルチGPUガイドで詳しく説明しています。
ファインチューニングについて、Unslothは4ビットQLoRAでのVRAMの最低要件を示しています。80億パラメータのモデルで6 GB、140億で8.5 GB、270億で22 GB、320億で26 GBです。したがって、3090ではバッチサイズ1と短いコンテキストという条件で、QLoRAによる27Bまでのファインチューニングがぎりぎり可能ですが、32Bは収まりません。16ビットLoRAでは、90億パラメータでもすでに24 GBが必要で、カードのVRAM容量をすべて使います。
#結論:3090が引き続き適切な選択となるケース
| 状況 | 決定 | 数値による根拠 |
|---|---|---|
| 27Bまたは32Bの密なモデルをローカルで使いたい | 3090(または4090) | 24GB:モデルの重みに17〜20GB、残りの余裕は4〜7GB |
| 主に70億から140億パラメータのモデルを対象としています | 12GBまたは16GBのGPUカードで十分です | 3090の利点は速度だけです:936GB/s |
| 70Bモデルまたは非常に長いコンテキストを使いたい | 5090 または 2 枚のカード | 70BモデルのQ4での重み容量は43 GB |
| 静音性と消費電力を最優先する | 比較的新しい16 GBのグラフィックカード | 3090 には 750 W の電源が必要です |
| 3090と3090 Tiのどちらを選ぶか迷っています | 2つのうち安い方を選んでください | 生成速度の向上はわずか+6〜+8% |
3090は、27Bモデルをローカルで使うための入門用GPUとして、今も最も一般的です。これはHardware Cornerの結論で、同サイトは本格的な用途を始めるための中古GPUとして最良の選択肢だと評価しています。予算が許せば4090が代わりになり、32 GBを求めるなら5090が選択肢になります。
- 出典:NVIDIA、RTX 3090およびRTX 3090 Ti仕様
- 出典:Hardware Corner、RTX 3090で実行されたLLMベンチマーク
- 出典:CUDAでのllama.cppのコミュニティランキング
- 出典:Ollama ドキュメント、コンテキスト長
- 出典:Unsloth、ファインチューニングに必要な VRAM
#よくある質問
RTX 3090でどのようなLLMを実行すべきですか?+
RTX 3090 で 70B モデルを実行できますか?+
ローカルLLMにはRTX 3090と3090 Tiのどちらを選ぶべきですか?+
RTX 3090にはどのような電源ユニットが必要ですか?+
RTX 3090はvLLMおよびFlash Attentionをサポートしていますか?+
RTX 3090 でモデルをファインチューニングすることは可能ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。