中級 11 分VRAM別

VRAM 24 GBで使えるLLMはどれ? ?

端的な回答

VRAMが24 GBあれば、Qwen 3.8 27Bのような270億パラメータのデンスモデルをQ4で読み込むか(重み16 GB、余裕8 GB)、300億〜350億パラメータのMoEモデル(19〜21 GB)を読み込んでください。Q4の70Bデンスモデル(約40 GB)は収まりません。GPUカード2枚、またはユニファイドメモリが必要です。

VRAM 24 GB は、270 億から 350 億パラメータのモデルの基準です。このガイドでは、何が収まるか、どのカードが本当に 24 GB を備えているか、その帯域幅が許容する速度の上限、そしてファインチューニングの限界について説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#VRAM 24 GB:270億〜350億パラメータのモデルを動かすための容量

24 GBのVRAMがあれば、Q4の270億パラメータの密モデル(QuelLLMのカタログでは重みが16 GB)をすべてメモリに読み込み、コンテキスト用に8 GBの余裕を確保できます。または、総パラメータ数が300億〜350億で、そのうち30億がアクティブなMoEモデル(19〜21 GB)を、より短いコンテキストで読み込めます。Q4の70B密モデルは約40 GBあるため、収まりません。2枚のGPUかユニファイドメモリが必要です。24 GBは、90億〜140億パラメータのモデルから、かつての大規模モデルに匹敵するモデルへ移行できる容量帯です。

24 GBに収まるモデル(QuelLLMカタログ記載のモデルサイズ。特記がない限りQ4)
モデルQ4 の重み24GBでの空き容量注記
gpt-oss 20B (MoE)13 GB11 GB非常に広いコンテキスト長
Devstral Small 2 24B14 GB10 GBコードエージェント
Qwen 3.8 27B16 GB8 GB密モデル、汎用型、公称コンテキスト長262,144トークン
Gemma 4 31B18 GB6 GBDenseモデル。Q5では22GBとなり、余裕が少なすぎます。
Qwen3-Coder 30B-A3B (MoE)19 GB5 GBコード、30億のアクティブパラメータ
Qwen 3.6 35B-A3B (MoE)21 GB3 GBコンテキストを短くすれば、ぎりぎりメモリに収まる
Qwen 3.8 27B 8ビット量子化29 GBいいえ容量超過

このガイドの以前のバージョンに対する修正です:以前のバージョンでは、Qwen 3.8 27B について 18 GB と 16 GB の両方が記載されており、Qwen 3.6 35B-A3B については 23 GB と記載されていました。カタログには 16 GB と 21 GB と記載されています。これらの数値は Q4 量子化の重みを四捨五入したものです。KV キャッシュと約 1 GB の余裕を必ず加えてください。

#24GBのカードはどれか、その違いは何か

この価格帯では、3つのコンシューマー向けカードが主流です。NVIDIAは24 GBのGDDR6Xを搭載したRTX 3090を、RTX 4090は24 GBのGDDR6Xを搭載したモデルを指します。AMDはRX 7900 XTXについて24 GBのGDDR6と最大960 GB/sの帯域幅を公表しています。NVIDIAによると、512ビットバスに32 GBのGDDR7を搭載したRTX 5090は、上位の価格帯に属します。20 GBのRX 7900 XTと混同しないようにしてください。llama.cppのパフォーマンステーブルでは、20 GBのGDDR6搭載としてリストされています。

24 GB を確保する三つの方法
カードソフトウェア以下の条件に該当する場合に推奨Guide
RTX 3090 / 3090 TiCUDACUDAを使いたく、中古で初期費用を抑えたい場合RTX 3090向けのLLM
RTX 4090CUDAより新しいアーキテクチャでCUDAを使いたい場合RTX 4090上で動作するLLM
RX 7900 XTXROCm 7またはVulkanLinuxを使用していて、ROCmの利用を受け入れられる場合RX 7900 XTXでLLMを実行

選択は三つの基準で決まります。ソフトウェアエコシステム、カードの製造年(状態、保証)、そして変動する現在の価格です。当サイトの価格追跡機能は、VRAMのギガバイト単価を週に2回更新します。これは、24 GBの中古カードと16 GBの新規カードのどちらを選ぶべきかを判断するための適切な指標です。

#24 GB環境で用途別に選ぶモデル

用途ごとの出発点
用途モデルなぜ
多用途で汎用性の高いモデルQwen 3.8 27B Q4デンスモデル、コンテキスト用に8GBの余裕
速度と推論性能gpt-oss 20B軽量のMoE、11 GBの余裕
コーディングと開発エージェントDevstral Small 2 24B または Qwen3-Coder 30B-A3B14 GBまたは19 GB、コンテキスト長は空き容量に応じて設定
最大のMoEモデルQwen 3.6 35B-A3B Q421 GB、アクティブパラメータ30億、短いコンテキスト
エージェントとツールの呼び出しGLM 4.7 Flash Q419 GB、MITライセンス(カタログに基づく)

DenseとMoEの選択は、このクラスにおける本質的なトレードオフです。27BのDenseモデルは、各トークンごとにすべての重みを読み込むため、MoEモデルよりも遅くなりますが、コンテキストにより多くのVRAMを確保できます。一方、35BのMoEモデルはアクティブなパラメータのみを読み込むため、生成速度は速くなりますが、総重みがGPUメモリをほぼ占め尽くします。MoEに関するガイドでメカニズムが説明されています。

#70Bはどうでしょうか?24 GBで実際にできること

当サイトの目安では、Q4で量子化した70Bのデンスモデルの重みは約40 GBあり、24 GBを少なくとも16 GB上回ります。この超過分をRAMにオフロードする必要があり、その場合の生成速度はカードではなく、RAMとPCIeバスの速度に制約されます。検証可能な情報源がないため、このケースの生成速度は提示していません。快適な対話用途には遅すぎると覚えておいてください。同程度の品質を持つ30B〜35BのMoEモデルが、この制約に対する実用的な解決策です。

24 GB のカード 1 枚
30~35BのMoEモデルはQ4、27~31Bの密なモデルはQ4またはQ5で、コンテキスト用に3~8GBを確保。
24 GB のカード 2 枚(48 GB)
層をカード間に分散させることで、Q4の70Bモデル(約40 GB)を、コンテキスト用の余裕を少し残して実行できます。
32GBのカード1枚
RTX 5090:Q4 の70Bモデルは依然としてこのカード1枚には収まりませんが、270億〜320億パラメータのデンスモデルなら余裕があります。

llama.cppのデフォルトの分散方式では、モデルを層ごとに複数のカードへ分割し、パイプライン方式で処理します。各カードに割り当てる割合は調整できます。向上するのはモデルを載せられる容量であり、トークンごとの処理速度ではありません。各カードが順番に動作するためです。

#速度:帯域幅が定める上限

生成時には、トークンごとに密なモデルの重みの大部分を読み込みます。理論上の速度上限は、メモリ帯域幅を重みのサイズで割った値です。AMDの仕様表では、RX 7900 XTXの帯域幅は960GB/秒とされています。NVIDIAのカードについては、該当するモデルの仕様表で帯域幅を確認してください。表は、密なモデルについて帯域幅100GB/秒あたりの速度上限を示しています。MoEはトークンごとに読み込む重みが少ないため、より高速です。

メモリ帯域幅100 GB/sあたりの密モデルの理論上限
Q4量子化モデル読み込む重み100 GB/sあたり例:960 GB/s (7900 XTX)
Devstral Small 2 24B14 GB≈ 7トークン/秒約69トークン/秒
Qwen 3.8 27B16 GB約6トークン/秒60トークン/秒
Gemma 4 31B18 GB≈ 5.6トークン/秒約53トークン/秒

これらの値は上限であり、実測値では決してありません。実際の速度はこれより低く、ドライバー、ソフトウェア、コンテキストによって変わります。これらのモデルについて比較可能な公開ベンチマーク環境がないため、当サイトではカードごとのトークン毎秒の数値を掲載していません。ご自身の環境を測定するには、ollama run に --verbose オプションを付けて実行してください。

#コンテキスト:24 GB環境での本当の制約

24 GBでは、KVキャッシュによって利用できるコンテキスト長が決まります。Q4のQwen 3.8 27Bでは8 GBが残りますが、Qwen 3.6 35B-A3Bでは3 GBしか残りません。Ollamaのドキュメントによると、デフォルトのコンテキスト長は4,096トークンで、OLLAMA_CONTEXT_LENGTHで変更できます。メモリを節約するには、キャッシュを量子化してください。Flash Attentionが有効であることを条件に、OLLAMA_KV_CACHE_TYPE=q8_0はデフォルトのf16の約半分のメモリを使用します。

KVキャッシュをq8_0にした32kのコンテキスト
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=32768 ollama serve
ollama ps

#3行で求めるメモリ容量の余裕

モデルとコンテキストが収まるかどうかを確認するには、カタログの重さ、KVキャッシュ、および約1 GBの余裕を足し算してください。カタログの重さについて2つの例を挙げます。Qwen 3.8 27BのQ5は19 GBです:24から19を引いてさらに1を引くと、KVキャッシュに使えるのは4 GBです。Qwen 3.6 35B-A3BのQ4は21 GBです:24から21を引いてさらに1を引くと、わずか2 GBしか残らず、KVキャッシュを量子化しない限り、コンテキストは短くなります。同じ27BをQ4(16 GB)にすると7 GBが解放され、はるかに長いコンテキストを許可します。

この計算から、よく採られる選択の理由が分かります。コンテキストを優先する場合はQ5よりQ4の量子化を選び、短い文章を扱い、モデルの忠実度を重視する場合はQ4よりQ5を選ぶというものです。量子化の選び方に関するガイドでは品質の違いを、KVキャッシュに関するガイドではメモリ容量の節約効果を詳しく説明しています。

#24 GBの中古GPUを購入する際の確認事項

最も普及している24 GBのカードは2020年から2022年製です。中古品が多く流通しており、長期間連続稼働していたものもあります。購入前に、負荷テストのスクリーンショットを依頼し、テスト中のメモリ温度を確認するとともに、ファンノイズをチェックしてください。ドライバー上で表示される容量が確かに24 GBであること、ご使用の電源がカードの消費電力に対応していること、そしてケース内に十分なスペースがあることを確認してください。これらのカードの価格は週ごとに変動します。当サイトの価格追跡機能を使用すると、新品と中古のVRAM 1 GBあたりの価格を比較できます。

#24GBでのファインチューニング:できること、できないこと

Unslothのドキュメントでは、モデルサイズと手法ごとの最小VRAM容量を表形式で公開しており、これらは絶対的な最小値であることを明記しています。QLoRA(4ビット)の場合、7Bは5 GB、14Bは8.5 GB、27Bは22 GBを必要とします。LoRA 16ビットの場合、8Bは22 GB、14Bは33 GBを必要とします。24 GBの環境では、140億パラメータまでのモデルのQLoRAは快適に動作し、27Bは余裕なくギリギリ動作しますが、14Bの16ビットLoRAは実行不可能です。

Unslothによる微調整用の最小VRAM要件
モデルQLoRA (4ビット)LoRA (16ビット)24GBの場合
7B5 GB19 GBQLoRA および LoRA
9B6.5 GB24 GBQLoRA;LoRAではメモリの余裕なし
14B8.5GB33 GBQLoRAのみ
27B22 GB64 GBQLoRAならギリギリ可能
32B26 GB76GBいいえ
70B41 GB164 GBいいえ
!
誤りの訂正:70BモデルのQLoRAは24GBに収まりません
このガイドの以前の版では、70BモデルのQLoRAは22〜23GBで「ぎりぎり収まる」と説明していました。Unslothによると、QLoRAには70Bモデルで最低41GB、27Bモデルで22GBが必要です。したがって、70Bモデルには少なくとも24GBのカード2枚、またはより大容量のカード1枚が必要です。

#よくある質問

よくある質問
24GBのVRAMで最適なLLMはどれですか?+
一般用途向けに、Qwen 3.8 27B を Q4 で使用する場合、QuelLLM カタログによると重みは 16 GB であり、そのためコンテキスト用に 8 GB の余裕が確保されます。速度に関しては gpt-oss 20B (13 GB) が適しています。コード生成に関しては、Devstral Small 2 24B (14 GB) または Qwen3-Coder 30B-A3B (19 GB) が選択可能です。大きな MoE モデルを想定する場合、Qwen 3.6 35B-A3B (21 GB) を使用し、短いコンテキストで運用します。
24 GBでも、まだ70Bを狙うべきですか?+
いいえ。Q4の密な70Bモデルは約40 GBあり、少なくとも16 GB分はVRAMに収まらず、システムRAMに配置されるため、対話的な利用には遅すぎます。パラメータ数が300億〜350億のMoEモデルなら、カードに収まります。70Bモデルには、24 GBのカード2枚、合計48 GBを用意してください。
24GBのVRAMなら、RTX 3090、RTX 4090、RX 7900 XTXのどれを選ぶべきですか?+
すべて 24 GB です。選択はエコシステムに基づきます:RTX 2 枚には CUDA、RX 7900 XTX には ROCm 7 または Vulkan、そして当日の価格(固定しません)。VRAM のギガバイト単位のコストを計算するサイトの価格追跡を確認してください。
24 GBでは毎秒何トークン生成できますか?+
モデルとグラフィックスカードによって異なります。密なモデル(dense model)の場合、理論上の上限はメモリ帯域幅を重みのサイズで割った値です。たとえば、重みが16 GBの27Bモデルを帯域幅960 GB/sで動かす場合は約60トークン/秒ですが、この値に厳密に達することはありません。当サイトではカード別の測定値を公開していません。ollama run に --verbose を付けると、ご自身の環境での測定値を確認できます。
24GB はファインチューニングに十分ですか?+
パラメータ数が140億までのモデルをQLoRAで学習するなら、十分に足ります。Unslothによると、14Bモデルに必要な容量は最低8.5GBです。27Bモデルには22GBが必要で、容量の限界に近づきます。14Bモデルの16ビットLoRA(33GB)と70BモデルのQLoRA(41GB)は、24GBのVRAMには収まりません。
24 GBのカードを2枚一緒に使用できますか?+
はい。llama.cppのデフォルトモードでは、レイヤーとKVキャッシュがGPU間で分散されます。48 GBのメモリが得られ、Q4の70Bモデルには十分ですが、カードがパイプラインで動作するため、トークンあたりの速度は倍になりません。2枚のカード用の電源と冷却を準備してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。