2026年、24 GBのVRAMで動かす最適なLLM
検索する 24GBのVRAMで動く最適なLLM は、主にコンテキストサイズ、ライセンス、想定する用途のバランスによって決まります。RTX 3090やRTX 4090に典型的なこの構成では、Q4量子化で300億〜400億パラメータ規模のモデルを利用でき、12 GBや16 GBのGPUと比べて、ローカルで利用できる推論能力の水準が大きく変わります。この記事では、このメモリ容量に実際に収まるモデル、そのライセンス、選ぶ前に知っておきたいトレードオフを紹介します。
Q4量子化で24GBに収まるのはどのモデルですか?
VRAMが24 GBの場合、KVキャッシュ用の領域を確保した後、モデルの重みに使える容量は17〜22 GBです。複数のモデルが、この上限をわずかに下回るか、その前後に位置しています:
- Seed-OSS 36B Instruct :Q4で約22GB、Apache 2.0ライセンス、524,288トークンという非常に大きなコンテキスト。
- Qwen 3.6 35B-A3B :Q4で約21 GB、アクティブパラメータが3BのMoEアーキテクチャ、コンテキストは262,000トークン。
- Salamandra 40B Instruct :Q4で約24GB、容量の上限に近く、ライセンスはApache 2.0。
- Command R 35B v01 et Aya 23 35B : Q4でそれぞれ約20GB、CC-BY-NC 4.0ライセンス(非商用使用)。
- Yi 1.5 34B Chat :Q4で約20 GB、コンテキストは4,096トークンに制限されています。
Le Mixtral 8x7B de Mistral AI、合計47Bのパラメータ(MoEアーキテクチャ)を備え、Q4では約26GBを要するため、24GBをわずかに上回るため、しばしばより積極的な量子化(Q3)またはCPUへの部分的なデチャージが求められます。エディタごとのスペック詳細は以下の通りです。 Mistral AIのHugging Faceページ et Hugging Face上のBSC Salamandra向けに
RTX 3090 vs RTX 4090:実際に期待できる処理速度
両カードとも 24 GB の GDDR6X VRAM を搭載していますが、RTX 4090 のほうがメモリ帯域幅と演算性能に優れています。32〜35B クラスのモデルを Q4 で実行する場合:
- RTX 3090 : モデルや推論エンジンによって12〜20トークン/秒の推定速度です
- RTX 4090 : 同じ条件で18から30トークン/秒の推定速度です
これらの数字はエンジンによって大きく異なります—— llama.cpp(公式GitHub) et Ollama(公式 GitHub) GGUF量子化には最もシンプルな選択肢であり、 vLLM (ドキュメント) は、複数の同時リクエストで高速サービスをターゲットにしています。MoEモデルのように Qwen 3 30B-A3B または Nemotron Nano 3 30B-A3Bでは、トークンごとにパラメータの一部だけが有効になるため、同等の規模の密なモデルよりも通常はスループットが高くなります。
ライセンス:Apache 2.0、CC-BY-NCおよび独自ライセンス
商用利用の可否や条件は、選ぶライセンスによって決まります:
- Apache 2.0 (商用利用は自由):Mixtral 8x7B、Salamandra 40B、Seed-OSS 36B、Qwen 3.6 35B-A3B、Qwen 2.5/3シリーズのほぼすべてのモデル、Gemma 4 31B、OLMo 3 32B、Granite 4.0 H-Small。
- CC-BY-NC 4.0 (非商用):Command R 35B v01、Aya 23 35B Aya Expanse 32B, コヒアから発表された — 詳細は、 Hugging Face上のCohere.
- MIT : DeepSeek R1 Distill 32B et DeepSeek R2 32Bで、こちらも利用上の制約が非常に少ないものです。
- 各モデル独自のプロプライエタリライセンス : EXAONE 4.5 33B (EXAONE AI Model License、利用制限あり)および Nemotron 3 33B (NVIDIA Open Model License).
商用の本番運用を予定しているプロジェクトでは、Apache 2.0 または MIT を優先することで、商用利用を禁じる条項に伴う法的な曖昧さを避けられます。
用途:推論、コーディング、汎用性
VRAMが24 GBの場合、用途は次の3つのタイプに分かれます:
- 長い推論 : QwQ 32B および DeepSeek R1 Distill 32B は複雑な論理チェーンタスクをターゲットとしており、公開ベンチマークでは AIME と MMLU でのスコアが一般的に報告されています Open LLM Leaderboard (Hugging Face).
- コード : Qwen 2.5 Coder 32B は、この規模のモデルの中では、今もHumanEvalでの基準となるモデルです。 Qwen3-Coder 30B-A3B 大規模なリポジトリの分析に向けて、262,144トークンに拡張されたコンテキストを提供します。
- 多言語対応・汎用 :Aya 23 35BとAya Expanse 32Bは、多言語への対応範囲を広げることを明確に目指しています。一方、 Jais 30B Chat v3 アラビア語に特化しています。
このVRAM容量帯でよく候補に挙がる2つのモデルを直接比較するには、比較ページ Aya Expanse 32B と Qwen 2.5 32B の比較 et DeepSeek R1 32BとQwQ 32Bの比較 では、ベンチマークの差を並べて詳しく比較しています。
KVキャッシュを活用して利用可能なコンテキストを最適化
32〜35BのモデルをQ4で量化すると、単に重みだけでも17〜22GBのVRAMを消費します。KVキャッシュの残り容量は、技術仕様で示された最大128,000または262,000トークンのコンテキストサイズを実際に利用可能な範囲に制限します。キャッシュの量子化(Q8、Q4)がモデルを変えずに数GBを節約できる理由を理解するには、以下の記事を参照してください 量子化および KV キャッシュに関するガイド と 量子化 Q4/Q5/Q8 の選択ガイド.
FAQ
Q:24GBのVRAMで商業用途に適したApache 2.0ライセンスのモデルはどれですか?
Seed-OSS 36B、Qwen 3.6 35B-A3B、Qwen 2.5 32B Coderは、Apache 2.0ライセンスの3つの選択肢で、Q4なら24 GBに収まります。選択は用途によって異なります。長いコンテキストならSeed-OSS、コーディングならQwen 2.5 Coder、MoEの汎用性ならQwen 3.6です。
Q:Mixtral 8x7B は本当に 24 GB に収まるのですか?
Q4での推定メモリ使用量は約26 GBで、24 GBの容量をわずかに超えます。より低いビット数での量子化(Q3)やコンテキストの短縮により、通常は収まるようになりますが、品質低下については個別に確認する必要があります。
Q:これらのモデルにはRTX 3090とRTX 4090のどちらがよいですか?
両方とも24 GBのVRAMを提供しており、モデルの読み込み能力は同じです。RTX 4090はメモリ帯域が高く、トークン/秒の処理速度(推定値)が優れ、バッチ処理や長コンテキスト処理に適しています。
Q:Command R 35BとAya 23 35Bは企業で利用できますか?
これらのモデルのCC-BY-NC 4.0ライセンスでは、Cohereと別途合意しない限り、商用利用が制限されます。企業内での導入には、同等の規模でApache 2.0またはMITライセンスのモデルを選ぶほうが望ましいです。
Q:これらのモデルをローカルで実行するには、どのツールを使えばよいですか?
llama.cpp(公式GitHub) et Ollama(公式 GitHub) は、1枚のGPUで量子化GGUFモデルの推論に対応しています。セルフホスト型のWebインターフェースには、 Open WebUI(公式GitHub) どちらにも追加できます。
Q:24 GBよりも32 GBを目指すべきですか?
32 GBに増やすと、量子化で妥協することなく、より長いコンテキストを利用でき、35〜40Bモデルの実行にも余裕が生まれます。 32GBのVRAMガイド このレベルで利用可能な追加モデルを詳細に説明します。
結論
Le 24GBのVRAMで動く最適なLLM 一意ではありません。検索されるライセンス(Seed-OSS 36B については Apache 2.0 または Qwen 3.6 35B-A3B、Command R および Aya については CC-BY-NC)や、用途(コード、論理的推論、多言語)、実際に KV キャッシュを考慮した上で必要なコンテキストの量によって異なります。 構成ツール これらの基準を自動的に比較できる機能を提供し、かつ 全モデルのカタログ には249モデルが掲載されており、量子化方式ごとの詳細なVRAM仕様を確認できます。
LLMをローカルで実行するためのハードウェア
これらのモデルを快適にローカルで実行するには、 RTX 5090 は優れたコストパフォーマンスを備えています。価格を比較してください:
アフィリエイトリンク — QuelLLMは購入に対して紹介料を受け取る場合があります。お客様に追加費用はかかりません。Amazonアソシエイトとして、QuelLLMは適格販売により収入を得ています。