RTX 4090(24 GB)で使うLLMはどれか ?
RTX 4090(2022年10月)は、2026年も一般ユーザー向けローカルAIの定番です。24 GBのGDDR6X VRAM、1008 GB/sのメモリ帯域幅、16,384基のAda Lovelace CUDAコアを備えています。Qwen 3.5 9Bは90トークン/秒を超える速度で動作し、Qwen 3.8 27B Q4も快適に動かせます。さらに、軽度のオフロードでLlama 70B Q4も動作します。現在の中古価格は1700〜2000ユーロ(ex-LHR在庫)で、LLM専用の用途では新品の5080よりも価格あたりの性能に優れています。本ガイドでは、動作するすべてのモデルと、おおよその生成速度を詳しく紹介します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#2026年のRTX 4090、今なお最強
- アーキテクチャ
- Ada Lovelace(AD102)、TSMC 4Nプロセスで製造。トランジスタ数は760億。
- VRAM
- 24 GB GDDR6X、21 Gbps、バス幅384ビット。帯域幅は1008 GB/sです。
- CUDAコア
- 16 384。第4世代Tensor Cores、FP8をネイティブサポート。第3世代RT Cores。
- TDP
- 450 W。850 Wの電源ユニットを推奨。
- 2026年の価格
- 状態良好な中古品では1700〜2000ユーロです。
#1. 24GB対応モデル
| モデル | Quant | VRAM | Tokens/sec | 用途 |
|---|---|---|---|---|
| gpt-oss 20B | Q4_K_M | 13 GB | 117-143 | 即座に応答するチャット |
| Devstral Small 2 24B | Q4_K_M | 14 GB | 36-44 | チャット + RAG(フランス語) |
| Qwen 3.6 27B | Q4_K_M | 16 GB | 29-35 | プロ向けコーディングアシスタント |
| Qwen 3.8 27B | Q4_K_M | 16 GB | 20-24 | 高品質な推論 |
| Mistral Small 24B | Q6_K | 20 GB | 32-38 | バランスのよい万能型 |
| GLM 4.7 Flash | Q4_K_M | 19 GB | 90-110 | 高度な推論 |
| Granite 4.1 30B Instruct | Q4_K_M | 17 GB | 27-33 | 複数ファイルを含む複雑なコード |
| Gemma 4 26B-A4B MoE | Q5_K_M | 19 GB | 54-66 | システムRAMに2 GBをオフロード、実用可能 |
| Gemma 4 31B | Q5_K_M | 22 GB | 27-33 | すべてVRAMに収まるが、品質は低下 |
#2. インストールおよびCUDA
- 01NVIDIAドライバー550以上CUDA 12.4以降。新品の4090なら、GeForce Experienceで対応できます。Linuxではnvidia-driver-565以降。
- 02Ollamaollama.comの標準インストーラー。CUDA対応GPUを自動検出。
- 0324GB環境で最初のモデルテストollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
#3. ベンチマーク(トークン/秒)
| モデル | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Qwen 3.5 4B | 135 t/s | 122 t/s | 110 t/s | 90 t/s |
| Granite 4.2 8B | 100 t/s | 92 t/s | 82 t/s | 66 t/s |
| Qwen 3.5 9B | 92 t/s | 85 t/s | 76 t/s | 62 t/s |
| Gemma 4 12B | 70 t/s | 64 t/s | 57 t/s | 48 t/s |
| Mistral Small 24B | 42 t/s | 38 t/s | 34 t/s | 28 t/s |
| Qwen 3.8 27B | 32 t/s | 28 t/s | 25 t/s | — |
#4. Ada最適化
- Flash Attention 2
- デフォルトで有効です。FA3は今後のllama.cppバージョンで提供されます。
- KVキャッシュ Q8
- OLLAMA_KV_CACHE_TYPE=q8_0。14Bモデルで32kのコンテキストを実現し、約15GBを消費するため、他のプロセスに9GBを残すことができます。
- パワーリミット
- nvidia-smi -pl 350(350 W以上)。LLM:速度-2%、熱と騒音-25%。24/7持続可能な設定。
- FP8 を TensorRT-LLM で利用
- AdaはFP8をネイティブでサポートしています。TensorRT-LLMを介して、Qwen 3.5 9Bにおいてバッチ処理のスループットが+40%向上します。複数ユーザーによるサービングにおいて特に効果的です。
#5. 4090 vs 5090 vs 3090
| 基準 | RTX 5090 | RTX 4090 | RTX 3090 |
|---|---|---|---|
| VRAM | 32 GB GDDR7 | 24 GB GDDR6X | 24 GB GDDR6X |
| 帯域幅 | 1792 GB/s | 1008 GB/s | 936 GB/s |
| Qwen 3.5 9B Q4 | 115 t/s | 92 t/s | 66 t/s |
| Llama 70B Q4 | 22-28 t/s | 7-10 t/s | 5-8 t/s |
| 2026年の価格 | ≈ 5 700 € (28/09/2026) | ~1800 €(中古) | 中古で約750ユーロ |
#2026年の中古品購入は賢い選択?
- 次の条件に当てはまるなら、中古の4090を購入してください
- 予算は1,500~2,000ユーロで、LLMを集中的に利用し、最新世代にはこだわらない場合。24 GBのVRAMは大きな魅力です。
- 次の条件に当てはまるならRTX 5090がおすすめ
- 予算が5,700ユーロ以上、70Bモデルを日常的に使う、FP4のネイティブ対応が必要、チーム用サーバーとして使う場合。32GBのメモリ容量で状況は大きく変わります。
- RTX 3090を選ぶほうがよい場合
- 予算が1000 €以下で、LLM専用に使い、速度を重視しない場合。同じVRAM容量を半額で確保できます。
- 次の条件に当てはまるなら、RTX 5070 Ti を優先して選んでください
- 予算~1,400 €、最大14Bの使用が可能。新品で保証付き、GDDR7、FP4対応。
#よくある質問
RTX 4090でLlama 3.3 70Bをローカルで実行可能ですか?+
Qwen 3.5 9B が RTX 4090 で実行される場合のトークン/秒はどれくらいですか?+
RTX 4090(中古)かRTX 5080(新品)か?+
RTX 4090はLLMの実行時に発熱や消費電力が大きいですか?+
RTX 4090 で LoRA ファインチューニングは可能ですか?+
RTX 4090はFP8をサポートしていますか?+
RTX 4090向けの電源は?+
価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。