方法論 · 2026年更新
推奨ツール: 量子化
お使いのVRAM容量に最適なGGUF、GPTQ、AWQの量子化を対応させるガイド。試行錯誤も、メモリの無駄もありません。
基本式 : VRAM_Go = (Paramètres_Md × Bits / 8) × 1,2。係数1.2は、コンテキスト長8Kで必要となるKVキャッシュと活性化に伴う追加メモリを見込んだものです。
自分のマシンに適した量子化は?
メモリ容量を入力してください。ツールは、その容量に収まるカタログ内のモデルを、それぞれで利用可能な最良の量子化設定とともに一覧表示します。
カタログの読み込み中…
30秒で選ぶ
以下で利用可能なVRAM容量を確認し、8Kのコンテキストを使用してもメモリに収まる最大のモデルと量子化設定を読み取ってください。一般的なGGUFファイルサイズを示しています(llama.cpp/Ollamaのデフォルト設定、KVキャッシュはFP16)。最後の列は、コンテキストを16Kに増やすために残っているメモリ容量を示します。
| VRAM | 典型的なGPU | 推奨モデル+量子化 | 16K マージン |
|---|---|---|---|
| 6 GB | RTX 3060 Laptop(6 GB)、RTX 4050 Laptop | Qwen 3 4B Q5_K_M、または Qwen 3 8B Q3_K_M | Juste — Q4_K_S に変更 |
| 8 GB | RTX 3050 8 GB、RTX 4060、RTX 5060 | Qwen 3 8B Q4_K_M, Llama 3.1 8B Q4_K_M | Q4_K_M でOKです |
| 12 GB | RTX 3060 12GB、RTX 4070、RTX 5070 | Qwen 3 14B Q4_K_M, Qwen 2.5 Coder 14B Q4_K_M, Gemma 3 12B Q5_K_M | 14B 用にのみ |
| 16 GB | RTX 4060 Ti 16 GB, RTX 5060 Ti 16 GB, RTX 5070 Ti, RTX 5080 | Qwen 3 14B Q6_K、Mistral Small 3.2 24B Q4_K_M(メモリの余裕は少ない) | 14Bモデルとしては良好 |
| 24 GB | RTX 3090、RTX 4090、RX 7900 XTX | Qwen 3 32B Q4_K_M、Qwen3-Coder 30B-A3B Q4_K_M、Gemma 3 27B Q4_K_M | 32Bのデンスモデルにはぎりぎり、27Bなら余裕があります |
| 32 GB | RTX 5090 | Qwen 3 32B Q6_K, Qwen 3 30B-A3B Q6_K | 32B モデルの Q6_K でのみ対応 |
| 48 GB | RTX 6000 Ada、2× RTX 3090/4090 | Llama 3.3 70B Q4_K_M, Qwen 2.5 72B Q4_K_S | 短いコンテキスト(8K)のみ |
| 80 GB | H100 80 GB、A100 80 GB | gpt-oss 120B (MXFP4), Llama 3.3 70B Q8_0 (短いコンテキスト) | gpt-oss 120Bを余裕をもって実行可能 |
推奨を導く計算
量子化は、各重みをFP16(16ビット)から2〜8ビットに圧縮します。7BモデルをQ4_K_Mで量子化すると、重みあたり平均約4.85ビットを使用するため、7,000,000,000 × 4.85 / 8 ≈ 4.2 GBとなります。コンテキストが長くなるにつれて増えるKVキャッシュを加えると、グループ化クエリアテンションを使うモデル(Mistral 7B、Qwen、Llama 3)では、8Kのコンテキストで約5.5 GBになります。長いコンテキストでは、KVキャッシュの影響が×1.2という係数による見積もりを大きく上回ります。
重みあたりのビット数の目安
| Quant | 重みあたりの実効ビット数 | VRAM (8B) | VRAM(32B) | VRAM (70B) |
|---|---|---|---|---|
| FP16 | 16,0 | 16.0 GB | 64.0 GB | 140.0 GB |
| Q8_0 | 8,5 | 8.5GB | 34.0 GB | 74.4 GB |
| Q6_K | 6,6 | 6.6 GB | 26.4 GB | 57.8 GB |
| Q5_K_M | 5,7 | 5.7 GB | 22.8 GB | 49.9 GB |
| Q4_K_M | 4,83 | 4.83 GB | 19.3 GB | 42.3 GB |
| Q4_K_S | 4,58 | 4.58 GB | 18.3 GB | 40.1GB |
| Q3_K_M | 3,9 | 3.9 GB | 15.6GB | 34.1 GB |
| Q2_K | 3,35 | 3.35 GB | 13.4GB | 29.3 GB |
品質の低下:実際の数字が示す内容
基準となる指標は、引き続きllama.cppのk-quantsとともに公開されたパープレキシティです(PR #1684、LLaMA 7B、FP16 = 5.9066)。差が小さいほど、量子化モデルの挙動は元のモデルに近くなります。Q4_K_MとQ3_K_Mの間には明確な性能の落差があり、Q5からQ6への改善はごくわずかです。
| Quant | パープレキシティ(LLaMA 7B) | FP16 との差異 | 判定 |
|---|---|---|---|
| Q8_0 | — | ごくわずか | 判別不能 |
| Q6_K | 5,9110 | +0,07 % | ほぼ損失なし |
| Q5_K_M | 5,9208 | +0,24 % | 優秀 |
| Q4_K_M | 5,9601 | +0,91 % | バランスの取れる水準 |
| Q4_K_S | 6,0215 | +1,95 % | 許容範囲 |
| Q3_K_M | 6,1503 | +4,13 % | 知覚可能 |
| Q2_K | 6,7764 | +14,7 % | 最後の手段 |
これらは2023年にLLaMA 7Bで測定した結果です。はるかに多くのデータで学習した最近のモデルは、量子化の影響をやや受けやすいことが多いものの、おおよその規模感は今も参考になります。
同じメモリ容量なら、一般にQ4_K_Mで量子化した大きなモデルのほうが、Q8_0で量子化した小さなモデルよりも高い性能を発揮します。迷った場合は、ビット数ではなくパラメータ数を増やしてください。
GGUF、GPTQ、AWQ:適切なビット数だけでなく、適切な形式も選ぶ
GGUF (llama.cpp / Ollama / LM Studio):単一ユーザーでの推論、CPUオフロード、Apple Siliconでの標準的な選択肢です。 GPTQ :4ビット、vLLM/TGIを使ったGPUのみでの推論。 AWQ : 4ビット、GPU専用 — 2026年にRTX 4090、RTX 5090、H100/H200向けのバッチ推論において最も高速な選択肢です。
| 用途 | 最適なフォーマット | なぜ |
|---|---|---|
| 単一ユーザー、デスクトップ環境、ChatGPT風 | GGUF Q4_K_M | CPUへのオフロード、一部のレイヤーをGPUで実行、どの環境でも動作 |
| Apple Silicon(M1-M5) | GGUF Q4_K_MまたはMLX 4ビット | Metal カーネル、統合メモリ |
| バッチAPI、同時ユーザー数が4人を超える場合 | vLLM上での4ビットAWQ | 大きなバッチサイズでより高いスループット |
| 古い Ampere(A100、RTX 3090) | GPTQ 4ビットまたはAWQ | 両方とも動作します。自分の用途でベンチマークを実施する |
よくある質問
Q4_K_Mは本当にバランスの取れた選択肢なのか、それとも単に人気があるのか?
はい。llama.cpp で公開されたk-quantのパラメータの困惑度測定結果(LLaMA 7B)において、Q4_K_MはFP16に対して約0.9%の誤差しか生じず、ほぼ30%のメモリを消費します。Q5_K_Mは約0.2%の誤差で、約17%のメモリを消費しますが、これはほとんど利益をもたらさず、余裕のあるメモリ環境の下でのみ有効です。
70BモデルにはどのくらいのVRAMが必要ですか?
Q4_K_Mでは、重みに約42 GBが必要です。さらに、Llama 3.3 70Bでは8KのコンテキストでKVキャッシュに2〜3 GBが必要です(グループ化アテンションによる)。短いコンテキストなら、48 GBのカード(RTX 6000 Ada)1枚、または24 GBのカード2枚(2×RTX 3090/4090)に収まります。Q2_Kでは重みが約26 GBまで減りますが、品質は大幅に低下します。
GGUF、GPTQ、AWQ:どれを選べばよいですか?
PCやApple Silicon搭載機での単一ユーザー利用にはGGUF。Ada、Hopper、BlackwellのGPUでバッチ処理を行うAPIサービスにはAWQ。GPTQは従来からある選択肢で、Ampereでも引き続き動作しますが、2026年に最速となることはめったにありません。
KVキャッシュを量子化すると品質は低下しますか?
KVキャッシュをQ8_0で量子化すると、サイズが半分になり、品質の低下は一般に無視できる程度とされています。Q4_0では品質の低下が測定可能になります。長いコンテキストをメモリに収める唯一の方法である場合に限って使用してください。
DeepSeek V3のようなMoEモデルは異なるのでしょうか?
はい。保存に必要な容量はパラメータの総数で決まるため、671BのMoEはQ4でも数百GBを必要とします。一方、速度は有効化されるパラメータ数に依存します(DeepSeek V3では37B)。Q4より低いビット数では、品質の低下が急速に大きくなります。ただし、動的量子化(たとえばUnslothによるDeepSeek R1向けの量子化)は、非常に大きなMoEでも2ビットで実用性を保てることを示しています。
量子化したモデルが本当にVRAMに収まるかを確認するには?
500トークンの生成中に `nvidia-smi -l 1` を実行してください。VRAM使用量が増えてから安定すれば問題ありません。使用量が頭打ちになり、トークン/秒が急落する場合は、モデルの一部がシステムRAMに移されています。量子化レベルを一段下げるか、コンテキストを短くしてください。
さらに進みたいですか? VRAM計算ツール が、お使いのモデルに必要な量を正確に算出します。また、当サイトの Q4 と Q5 と Q8 の比較ガイド 品質テストの詳細を示します。