中級 12 分RTX 40

RTX 4090(24 GB)で使うLLMはどれか ?

RTX 4090(2022年10月)は、2026年も一般ユーザー向けローカルAIの定番です。24 GBのGDDR6X VRAM、1008 GB/sのメモリ帯域幅、16,384基のAda Lovelace CUDAコアを備えています。Qwen 3.5 9Bは90トークン/秒を超える速度で動作し、Qwen 3.8 27B Q4も快適に動かせます。さらに、軽度のオフロードでLlama 70B Q4も動作します。現在の中古価格は1700〜2000ユーロ(ex-LHR在庫)で、LLM専用の用途では新品の5080よりも価格あたりの性能に優れています。本ガイドでは、動作するすべてのモデルと、おおよその生成速度を詳しく紹介します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-08-27·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#2026年のRTX 4090、今なお最強

アーキテクチャ
Ada Lovelace(AD102)、TSMC 4Nプロセスで製造。トランジスタ数は760億。
VRAM
24 GB GDDR6X、21 Gbps、バス幅384ビット。帯域幅は1008 GB/sです。
CUDAコア
16 384。第4世代Tensor Cores、FP8をネイティブサポート。第3世代RT Cores。
TDP
450 W。850 Wの電源ユニットを推奨。
2026年の価格
状態良好な中古品では1700〜2000ユーロです。
→
2026年において依然として有効な理由
24GBは魔の閾値で、Llama 3.3 70B Q2_K(2GBのオフロードで26GB)を可能にし、Qwen 3.8 27B でQ8、Qwen3-Coder 30B-A3B が実現されます。5080(新規16GB)では不可能であり、5090(新規32GB、約5,700€)は価格が約3倍かかります。純粋にVRAM/€の観点から見ると、4090の中古モデルが優位です。

#1. 24GB対応モデル

LLM モデル — RTX 4090 24 GB
モデルQuantVRAMTokens/sec用途
gpt-oss 20BQ4_K_M13 GB117-143即座に応答するチャット
Devstral Small 2 24BQ4_K_M14 GB36-44チャット + RAG(フランス語)
Qwen 3.6 27BQ4_K_M16 GB29-35プロ向けコーディングアシスタント
Qwen 3.8 27BQ4_K_M16 GB20-24高品質な推論
Mistral Small 24BQ6_K20 GB32-38バランスのよい万能型
GLM 4.7 FlashQ4_K_M19 GB90-110高度な推論
Granite 4.1 30B InstructQ4_K_M17 GB27-33複数ファイルを含む複雑なコード
Gemma 4 26B-A4B MoEQ5_K_M19 GB54-66システムRAMに2 GBをオフロード、実用可能
Gemma 4 31BQ5_K_M22 GB27-33すべてVRAMに収まるが、品質は低下
i
Llama 70B:どの量子化方式を優先すべきでしょうか?
Q4_K_M(42 GB):大量のオフロードが必要で、約6トークン/秒。あまり快適ではありません。Q2_K(26 GB):2 GB分をRAMにオフロードする必要があり、約10トークン/秒。品質はまずまずです。IQ2_XS(21 GB):すべてVRAMに収まり、約20トークン/秒ですが、品質は大幅に低下します。70Bモデルをローカルで快適に使うには、5090(32 GB)またはMac Studioを目指してください。

#2. インストールおよびCUDA

  1. 01
    NVIDIAドライバー550以上
    CUDA 12.4以降。新品の4090なら、GeForce Experienceで対応できます。Linuxではnvidia-driver-565以降。
  2. 02
    Ollama
    ollama.comの標準インストーラー。CUDA対応GPUを自動検出。
  3. 03
    24GB環境で最初のモデルテスト
    ollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
Linux用の完全セットアップ
# Ubuntu 24.04
sudo apt install nvidia-driver-565
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3.8:27b

#3. ベンチマーク(トークン/秒)

RTX 4090 24 GB — トークン/秒の目安
モデルQ4_K_MQ5_K_MQ6_KQ8_0
Qwen 3.5 4B135 t/s122 t/s110 t/s90 t/s
Granite 4.2 8B100 t/s92 t/s82 t/s66 t/s
Qwen 3.5 9B92 t/s85 t/s76 t/s62 t/s
Gemma 4 12B70 t/s64 t/s57 t/s48 t/s
Mistral Small 24B42 t/s38 t/s34 t/s28 t/s
Qwen 3.8 27B32 t/s28 t/s25 t/s—

#4. Ada最適化

Flash Attention 2
デフォルトで有効です。FA3は今後のllama.cppバージョンで提供されます。
KVキャッシュ Q8
OLLAMA_KV_CACHE_TYPE=q8_0。14Bモデルで32kのコンテキストを実現し、約15GBを消費するため、他のプロセスに9GBを残すことができます。
パワーリミット
nvidia-smi -pl 350(350 W以上)。LLM:速度-2%、熱と騒音-25%。24/7持続可能な設定。
FP8 を TensorRT-LLM で利用
AdaはFP8をネイティブでサポートしています。TensorRT-LLMを介して、Qwen 3.5 9Bにおいてバッチ処理のスループットが+40%向上します。複数ユーザーによるサービングにおいて特に効果的です。

#5. 4090 vs 5090 vs 3090

NVIDIAの一般向けフラッグシップ3機種
基準RTX 5090RTX 4090RTX 3090
VRAM32 GB GDDR724 GB GDDR6X24 GB GDDR6X
帯域幅1792 GB/s1008 GB/s936 GB/s
Qwen 3.5 9B Q4115 t/s92 t/s66 t/s
Llama 70B Q422-28 t/s7-10 t/s5-8 t/s
2026年の価格≈ 5 700 € (28/09/2026)~1800 €(中古)中古で約750ユーロ
→
24 GBのVRAMを最もお得に:中古の3090
3090は1,800 €に対して750 €で、同じ24 GBのVRAMを備えています。純粋な速度は約30%低下します。最大速度ではなくVRAM(24〜32Bモデル、14B以上のQLoRA)を優先するなら、中古の3090は今なおNVIDIAの歴史全体で最もコストパフォーマンスに優れたLLM用GPUです。

#2026年の中古品購入は賢い選択?

次の条件に当てはまるなら、中古の4090を購入してください
予算は1,500~2,000ユーロで、LLMを集中的に利用し、最新世代にはこだわらない場合。24 GBのVRAMは大きな魅力です。
次の条件に当てはまるならRTX 5090がおすすめ
予算が5,700ユーロ以上、70Bモデルを日常的に使う、FP4のネイティブ対応が必要、チーム用サーバーとして使う場合。32GBのメモリ容量で状況は大きく変わります。
RTX 3090を選ぶほうがよい場合
予算が1000 €以下で、LLM専用に使い、速度を重視しない場合。同じVRAM容量を半額で確保できます。
次の条件に当てはまるなら、RTX 5070 Ti を優先して選んでください
予算~1,400 €、最大14Bの使用が可能。新品で保証付き、GDDR7、FP4対応。

#よくある質問

RTX 4090でLlama 3.3 70Bをローカルで実行可能ですか?+
はい、ただし妥協が必要です。Q4_K_M(42GB):大量にシステムRAMへオフロード → 6〜8トークン/秒(実用に耐えません)。Q2_K(26GB):2GBをRAMに置く → 10〜12トークン/秒(許容範囲です)。IQ2_XS(21GB):全体がVRAMに収まる → 20トークン/秒ですが、品質は低下します。本格的な大規模モデルを快適に使うには、5090(32GB)を選ぶか、全体がVRAMに収まるQwen 3.8 27Bを引き続き使ってください。
Qwen 3.5 9B が RTX 4090 で実行される場合のトークン/秒はどれくらいですか?+
Q4_K_Mでは約90トークン/秒、Q8_0では62トークン/秒です。どのようなチャット用途にも十分すぎる速度で、さらにモデルの256kのコンテキストと画像認識機能も利用できます。
RTX 4090(中古)かRTX 5080(新品)か?+
中古の4090(1,800€):VRAMは24GB。7Bモデルでは5080より10%遅いものの、オフロードで70Bモデルを、Q6で32Bモデルを実行できます。新品の5080(約1,500~1,850€):16GBで、小型モデルではより高速。3年保証があり、FP4に対応しています。LLM専用なら、VRAM容量のおかげで4090が優位です。性能と保証を重視するなら5080です。
RTX 4090はLLMの実行時に発熱や消費電力が大きいですか?+
ゲーム中よりも少ないです。Qwen 3.5 9B での推論は 250〜320 W(TDP 450 W に対して)、GPU 温度は 65〜72 °C です。適切なエアフローを持つケースがあれば十分です。24/7 での使用を想定する場合、アンダーボルティングで 350 W に設定すると、LLM 性能の大きな低下なしに熱と騒音を低減できます。
RTX 4090 で LoRA ファインチューニングは可能ですか?+
はい、とても適しています。Qwen 3.5 9BのLoRAは12 GBで、バッチサイズ4、コンテキスト長4096なら余裕を持って実行できます。Mistral Small 24BのQLoRAは約18 GBで実行可能です。70BモデルのQLoRAは余裕がありませんが、unslothとバッチサイズ1なら実行できます。70Bモデルで通常のLoRAを行うには、4090が2枚、または5090が1枚必要です。
RTX 4090はFP8をサポートしていますか?+
はい。Ada Lovelaceの第4世代Tensor CoresはFP8をネイティブにサポートしています。TensorRT-LLM(FP16比で30〜40%向上)、vLLM(0.5以降)、そして部分的にllama.cppで活用されています。一般ユーザーがOllamaを使う場合は、引き続きQ4〜Q8を選びます。バッチ処理での推論提供には、FP8を使う価値があります。
RTX 4090向けの電源は?+
最低でも 850 W の良質な電源が必要です(ATX 3.0 を推奨しますが、必須ではありません)。LLM 使用時の平均消費電力は 250〜320 W、ゲームやベンチマーク時は 450 W です。ハイエンド CPU(9950X、14900K)を使う場合は、1000 W の電源にするとより安心です。

価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。

このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。