VRAM 24 GBで使えるLLMはどれ? ?
VRAMが24 GBあれば、Qwen 3.8 27Bのような270億パラメータのデンスモデルをQ4で読み込むか(重み16 GB、余裕8 GB)、300億〜350億パラメータのMoEモデル(19〜21 GB)を読み込んでください。Q4の70Bデンスモデル(約40 GB)は収まりません。GPUカード2枚、またはユニファイドメモリが必要です。
VRAM 24 GB は、270 億から 350 億パラメータのモデルの基準です。このガイドでは、何が収まるか、どのカードが本当に 24 GB を備えているか、その帯域幅が許容する速度の上限、そしてファインチューニングの限界について説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#VRAM 24 GB:270億〜350億パラメータのモデルを動かすための容量
24 GBのVRAMがあれば、Q4の270億パラメータの密モデル(QuelLLMのカタログでは重みが16 GB)をすべてメモリに読み込み、コンテキスト用に8 GBの余裕を確保できます。または、総パラメータ数が300億〜350億で、そのうち30億がアクティブなMoEモデル(19〜21 GB)を、より短いコンテキストで読み込めます。Q4の70B密モデルは約40 GBあるため、収まりません。2枚のGPUかユニファイドメモリが必要です。24 GBは、90億〜140億パラメータのモデルから、かつての大規模モデルに匹敵するモデルへ移行できる容量帯です。
| モデル | Q4 の重み | 24GBでの空き容量 | 注記 |
|---|---|---|---|
| gpt-oss 20B (MoE) | 13 GB | 11 GB | 非常に広いコンテキスト長 |
| Devstral Small 2 24B | 14 GB | 10 GB | コードエージェント |
| Qwen 3.8 27B | 16 GB | 8 GB | 密モデル、汎用型、公称コンテキスト長262,144トークン |
| Gemma 4 31B | 18 GB | 6 GB | Denseモデル。Q5では22GBとなり、余裕が少なすぎます。 |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 5 GB | コード、30億のアクティブパラメータ |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 3 GB | コンテキストを短くすれば、ぎりぎりメモリに収まる |
| Qwen 3.8 27B 8ビット量子化 | 29 GB | いいえ | 容量超過 |
このガイドの以前のバージョンに対する修正です:以前のバージョンでは、Qwen 3.8 27B について 18 GB と 16 GB の両方が記載されており、Qwen 3.6 35B-A3B については 23 GB と記載されていました。カタログには 16 GB と 21 GB と記載されています。これらの数値は Q4 量子化の重みを四捨五入したものです。KV キャッシュと約 1 GB の余裕を必ず加えてください。
#24GBのカードはどれか、その違いは何か
この価格帯では、3つのコンシューマー向けカードが主流です。NVIDIAは24 GBのGDDR6Xを搭載したRTX 3090を、RTX 4090は24 GBのGDDR6Xを搭載したモデルを指します。AMDはRX 7900 XTXについて24 GBのGDDR6と最大960 GB/sの帯域幅を公表しています。NVIDIAによると、512ビットバスに32 GBのGDDR7を搭載したRTX 5090は、上位の価格帯に属します。20 GBのRX 7900 XTと混同しないようにしてください。llama.cppのパフォーマンステーブルでは、20 GBのGDDR6搭載としてリストされています。
| カード | ソフトウェア | 以下の条件に該当する場合に推奨 | Guide |
|---|---|---|---|
| RTX 3090 / 3090 Ti | CUDA | CUDAを使いたく、中古で初期費用を抑えたい場合 | RTX 3090向けのLLM |
| RTX 4090 | CUDA | より新しいアーキテクチャでCUDAを使いたい場合 | RTX 4090上で動作するLLM |
| RX 7900 XTX | ROCm 7またはVulkan | Linuxを使用していて、ROCmの利用を受け入れられる場合 | RX 7900 XTXでLLMを実行 |
選択は三つの基準で決まります。ソフトウェアエコシステム、カードの製造年(状態、保証)、そして変動する現在の価格です。当サイトの価格追跡機能は、VRAMのギガバイト単価を週に2回更新します。これは、24 GBの中古カードと16 GBの新規カードのどちらを選ぶべきかを判断するための適切な指標です。
#24 GB環境で用途別に選ぶモデル
| 用途 | モデル | なぜ |
|---|---|---|
| 多用途で汎用性の高いモデル | Qwen 3.8 27B Q4 | デンスモデル、コンテキスト用に8GBの余裕 |
| 速度と推論性能 | gpt-oss 20B | 軽量のMoE、11 GBの余裕 |
| コーディングと開発エージェント | Devstral Small 2 24B または Qwen3-Coder 30B-A3B | 14 GBまたは19 GB、コンテキスト長は空き容量に応じて設定 |
| 最大のMoEモデル | Qwen 3.6 35B-A3B Q4 | 21 GB、アクティブパラメータ30億、短いコンテキスト |
| エージェントとツールの呼び出し | GLM 4.7 Flash Q4 | 19 GB、MITライセンス(カタログに基づく) |
DenseとMoEの選択は、このクラスにおける本質的なトレードオフです。27BのDenseモデルは、各トークンごとにすべての重みを読み込むため、MoEモデルよりも遅くなりますが、コンテキストにより多くのVRAMを確保できます。一方、35BのMoEモデルはアクティブなパラメータのみを読み込むため、生成速度は速くなりますが、総重みがGPUメモリをほぼ占め尽くします。MoEに関するガイドでメカニズムが説明されています。
#70Bはどうでしょうか?24 GBで実際にできること
当サイトの目安では、Q4で量子化した70Bのデンスモデルの重みは約40 GBあり、24 GBを少なくとも16 GB上回ります。この超過分をRAMにオフロードする必要があり、その場合の生成速度はカードではなく、RAMとPCIeバスの速度に制約されます。検証可能な情報源がないため、このケースの生成速度は提示していません。快適な対話用途には遅すぎると覚えておいてください。同程度の品質を持つ30B〜35BのMoEモデルが、この制約に対する実用的な解決策です。
- 24 GB のカード 1 枚
- 30~35BのMoEモデルはQ4、27~31Bの密なモデルはQ4またはQ5で、コンテキスト用に3~8GBを確保。
- 24 GB のカード 2 枚(48 GB)
- 層をカード間に分散させることで、Q4の70Bモデル(約40 GB)を、コンテキスト用の余裕を少し残して実行できます。
- 32GBのカード1枚
- RTX 5090:Q4 の70Bモデルは依然としてこのカード1枚には収まりませんが、270億〜320億パラメータのデンスモデルなら余裕があります。
llama.cppのデフォルトの分散方式では、モデルを層ごとに複数のカードへ分割し、パイプライン方式で処理します。各カードに割り当てる割合は調整できます。向上するのはモデルを載せられる容量であり、トークンごとの処理速度ではありません。各カードが順番に動作するためです。
#速度:帯域幅が定める上限
生成時には、トークンごとに密なモデルの重みの大部分を読み込みます。理論上の速度上限は、メモリ帯域幅を重みのサイズで割った値です。AMDの仕様表では、RX 7900 XTXの帯域幅は960GB/秒とされています。NVIDIAのカードについては、該当するモデルの仕様表で帯域幅を確認してください。表は、密なモデルについて帯域幅100GB/秒あたりの速度上限を示しています。MoEはトークンごとに読み込む重みが少ないため、より高速です。
| Q4量子化モデル | 読み込む重み | 100 GB/sあたり | 例:960 GB/s (7900 XTX) |
|---|---|---|---|
| Devstral Small 2 24B | 14 GB | ≈ 7トークン/秒 | 約69トークン/秒 |
| Qwen 3.8 27B | 16 GB | 約6トークン/秒 | 60トークン/秒 |
| Gemma 4 31B | 18 GB | ≈ 5.6トークン/秒 | 約53トークン/秒 |
これらの値は上限であり、実測値では決してありません。実際の速度はこれより低く、ドライバー、ソフトウェア、コンテキストによって変わります。これらのモデルについて比較可能な公開ベンチマーク環境がないため、当サイトではカードごとのトークン毎秒の数値を掲載していません。ご自身の環境を測定するには、ollama run に --verbose オプションを付けて実行してください。
#コンテキスト:24 GB環境での本当の制約
24 GBでは、KVキャッシュによって利用できるコンテキスト長が決まります。Q4のQwen 3.8 27Bでは8 GBが残りますが、Qwen 3.6 35B-A3Bでは3 GBしか残りません。Ollamaのドキュメントによると、デフォルトのコンテキスト長は4,096トークンで、OLLAMA_CONTEXT_LENGTHで変更できます。メモリを節約するには、キャッシュを量子化してください。Flash Attentionが有効であることを条件に、OLLAMA_KV_CACHE_TYPE=q8_0はデフォルトのf16の約半分のメモリを使用します。
#3行で求めるメモリ容量の余裕
モデルとコンテキストが収まるかどうかを確認するには、カタログの重さ、KVキャッシュ、および約1 GBの余裕を足し算してください。カタログの重さについて2つの例を挙げます。Qwen 3.8 27BのQ5は19 GBです:24から19を引いてさらに1を引くと、KVキャッシュに使えるのは4 GBです。Qwen 3.6 35B-A3BのQ4は21 GBです:24から21を引いてさらに1を引くと、わずか2 GBしか残らず、KVキャッシュを量子化しない限り、コンテキストは短くなります。同じ27BをQ4(16 GB)にすると7 GBが解放され、はるかに長いコンテキストを許可します。
この計算から、よく採られる選択の理由が分かります。コンテキストを優先する場合はQ5よりQ4の量子化を選び、短い文章を扱い、モデルの忠実度を重視する場合はQ4よりQ5を選ぶというものです。量子化の選び方に関するガイドでは品質の違いを、KVキャッシュに関するガイドではメモリ容量の節約効果を詳しく説明しています。
#24 GBの中古GPUを購入する際の確認事項
最も普及している24 GBのカードは2020年から2022年製です。中古品が多く流通しており、長期間連続稼働していたものもあります。購入前に、負荷テストのスクリーンショットを依頼し、テスト中のメモリ温度を確認するとともに、ファンノイズをチェックしてください。ドライバー上で表示される容量が確かに24 GBであること、ご使用の電源がカードの消費電力に対応していること、そしてケース内に十分なスペースがあることを確認してください。これらのカードの価格は週ごとに変動します。当サイトの価格追跡機能を使用すると、新品と中古のVRAM 1 GBあたりの価格を比較できます。
#24GBでのファインチューニング:できること、できないこと
Unslothのドキュメントでは、モデルサイズと手法ごとの最小VRAM容量を表形式で公開しており、これらは絶対的な最小値であることを明記しています。QLoRA(4ビット)の場合、7Bは5 GB、14Bは8.5 GB、27Bは22 GBを必要とします。LoRA 16ビットの場合、8Bは22 GB、14Bは33 GBを必要とします。24 GBの環境では、140億パラメータまでのモデルのQLoRAは快適に動作し、27Bは余裕なくギリギリ動作しますが、14Bの16ビットLoRAは実行不可能です。
| モデル | QLoRA (4ビット) | LoRA (16ビット) | 24GBの場合 |
|---|---|---|---|
| 7B | 5 GB | 19 GB | QLoRA および LoRA |
| 9B | 6.5 GB | 24 GB | QLoRA;LoRAではメモリの余裕なし |
| 14B | 8.5GB | 33 GB | QLoRAのみ |
| 27B | 22 GB | 64 GB | QLoRAならギリギリ可能 |
| 32B | 26 GB | 76GB | いいえ |
| 70B | 41 GB | 164 GB | いいえ |
- 32GBのVRAMで使うなら、どのLLM?
- 16 GB の VRAM ではどの LLM を選ぶべき?
- RTX 3090 / 3090 Ti(24 GB)向けのLLM
- RX 7900 XTX(24 GB)で動かすLLM
- MoE の解説:なぜ 30B-A3B は小型モデルのように動作するのか
- ローカルAI向けグラフィックカードの価格
#よくある質問
24GBのVRAMで最適なLLMはどれですか?+
24 GBでも、まだ70Bを狙うべきですか?+
24GBのVRAMなら、RTX 3090、RTX 4090、RX 7900 XTXのどれを選ぶべきですか?+
24 GBでは毎秒何トークン生成できますか?+
24GB はファインチューニングに十分ですか?+
24 GBのカードを2枚一緒に使用できますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。