ツール · すぐに計算
LLM用VRAM計算機
LLMをローカルで実行するには、実際にどれくらいのGPUメモリが必要でしょうか?モデルの重み、KVキャッシュ、オーバーヘッドを含めて、必要量を率直に見積もります。
基本の計算式:VRAM ≈ パラメータ数(10億単位)× 重みあたりのバイト数 + KVキャッシュ + 約20%のオーバーヘッド。Q4ではパラメータ10億個あたり約0.55〜0.6 GB、FP16では10億個あたり2 GBです。コンテキストが長くなると、KVキャッシュは20%を大きく超えて増加します。
推定値 = 重みのメモリ使用量 × (1 + 0.2 × コンテキスト/8K)。これはDenseモデル向けの概算式です。MoE(Mixture of Experts)モデルはトークンごとに有効化する重みが少なく、モデルサイズから想定するよりも快適に動作する場合があります。OSと画面表示のために、常に1〜2 GBの余裕を確保してください。
モデルサイズごとの必要なVRAM(8Kコンテキスト)
| サイズ | Q4_K_M | Q8_0 | FP16 | 実行できるGPU(Q4) |
|---|---|---|---|---|
| 7B | 4.9 GB | 9.0 GB | 16.8 GB | 8 GBのグラフィックボード(RTX 3050、4060) |
| 9B | 6.3 GB | 11.6 GB | 21.6 GB | 8〜12 GBのグラフィックボード |
| 14B | 9.7 GB | 18.0 GB | 33.6 GB | 12〜16 GBのグラフィックボード |
| 27B | 18.8 GB | 34.7 GB | 64.8 GB | 24 GBのグラフィックボード(RTX 3090/4090) |
| 32B | 22.3 GB | 41.1 GB | 76.8 GB | 24 GBのグラフィックボード、短いコンテキスト |
| 70B | 48.7 GB | 89.9 GB | 168.0 GB | 48 GB以上、または24 GBのGPUを2基 |
8KコンテキストでのKVキャッシュとオーバーヘッド用に20%の余裕を含めた数値です。単位はGBで、小数第1位に丸めています。
次はモデルを選びましょう
利用できるメモリ容量を把握するだけでは、まだ道半ばです。ハードウェア構成ツールでは、お使いのGPUやMacの機種に合う実際のモデルを探せます。ローカルLLMランキングは、ローカルで実行できるすべてのモデルを順位付けしています。ハードウェア別のランキングなら、目的に合うモデルをすぐに探せます:VRAM 8 GB向けのおすすめLLM、RTX 4090、メモリ16 GBのMac。クラウドとローカルのどちらにするか迷っていますか?コスト計算機で費用を計算してみましょう。
よくある質問
パラメータ10億個あたりVRAMはどれくらいですか?
FP16ではパラメータ10億あたり約2 GB、Q8では1.1 GB、Q4量子化では0.55〜0.6 GBです。標準的な8Kコンテキストでは、KVキャッシュとオーバーヘッドのために約20%を加算してください。コンテキストが長い場合は、さらに余裕を見込んでください。
ローカルLLM用に8GBのVRAMは十分ですか?
はい。Q4 では、8〜9B(約 5〜6 GB の重み)のモデルは 8 GB の GPU に完全に収まり、コンテキストの余裕も確保できます。8 GB の VRAM に最適な LLM のランキングを参照してください。
24GBのGPU(RTX 3090/4090)で32Bのモデルを実行することは可能ですか?
はい。Q4量子化した32BのDenseモデルには約20〜22GBが必要なので、短いコンテキストなら24GBのカードに収まります。長いコンテキストを使う場合は、27Bモデルのほうが無難です。
MacのユニファイドメモリはVRAMとして使えますか?
Apple Silicon搭載のMacでは、CPUとGPUが同じユニファイドメモリを共有します。そのため、メモリ32 GBのMacは、16 GBの専用GPUよりも大きなモデルを読み込めます。ただし、macOS自体のために8〜10 GBを確保してください。