◆ ローカルAI — 1時間で、あなたのマシンにプライベートで無料のChatGPTを · 24 € · または全キットを49 €で →

ツール · すぐに計算

LLM用VRAM計算機

LLMをローカルで実行するには、実際にどれくらいのGPUメモリが必要でしょうか?モデルの重み、KVキャッシュ、オーバーヘッドを含めて、必要量を率直に見積もります。

基本の計算式:VRAM ≈ パラメータ数(10億単位)× 重みあたりのバイト数 + KVキャッシュ + 約20%のオーバーヘッド。Q4ではパラメータ10億個あたり約0.55〜0.6 GB、FP16では10億個あたり2 GBです。コンテキストが長くなると、KVキャッシュは20%を大きく超えて増加します。

推定値 = 重みのメモリ使用量 × (1 + 0.2 × コンテキスト/8K)。これはDenseモデル向けの概算式です。MoE(Mixture of Experts)モデルはトークンごとに有効化する重みが少なく、モデルサイズから想定するよりも快適に動作する場合があります。OSと画面表示のために、常に1〜2 GBの余裕を確保してください。

モデルサイズごとの必要なVRAM(8Kコンテキスト)

サイズQ4_K_MQ8_0FP16実行できるGPU(Q4)
7B4.9 GB9.0 GB16.8 GB8 GBのグラフィックボード(RTX 3050、4060)
9B6.3 GB11.6 GB21.6 GB8〜12 GBのグラフィックボード
14B9.7 GB18.0 GB33.6 GB12〜16 GBのグラフィックボード
27B18.8 GB34.7 GB64.8 GB24 GBのグラフィックボード(RTX 3090/4090)
32B22.3 GB41.1 GB76.8 GB24 GBのグラフィックボード、短いコンテキスト
70B48.7 GB89.9 GB168.0 GB48 GB以上、または24 GBのGPUを2基

8KコンテキストでのKVキャッシュとオーバーヘッド用に20%の余裕を含めた数値です。単位はGBで、小数第1位に丸めています。

次はモデルを選びましょう

利用できるメモリ容量を把握するだけでは、まだ道半ばです。ハードウェア構成ツールでは、お使いのGPUやMacの機種に合う実際のモデルを探せます。ローカルLLMランキングは、ローカルで実行できるすべてのモデルを順位付けしています。ハードウェア別のランキングなら、目的に合うモデルをすぐに探せます:VRAM 8 GB向けのおすすめLLM、RTX 4090、メモリ16 GBのMac。クラウドとローカルのどちらにするか迷っていますか?コスト計算機で費用を計算してみましょう。

よくある質問

パラメータ10億個あたりVRAMはどれくらいですか?

FP16ではパラメータ10億あたり約2 GB、Q8では1.1 GB、Q4量子化では0.55〜0.6 GBです。標準的な8Kコンテキストでは、KVキャッシュとオーバーヘッドのために約20%を加算してください。コンテキストが長い場合は、さらに余裕を見込んでください。

ローカルLLM用に8GBのVRAMは十分ですか?

はい。Q4 では、8〜9B(約 5〜6 GB の重み)のモデルは 8 GB の GPU に完全に収まり、コンテキストの余裕も確保できます。8 GB の VRAM に最適な LLM のランキングを参照してください。

24GBのGPU(RTX 3090/4090)で32Bのモデルを実行することは可能ですか?

はい。Q4量子化した32BのDenseモデルには約20〜22GBが必要なので、短いコンテキストなら24GBのカードに収まります。長いコンテキストを使う場合は、27Bモデルのほうが無難です。

MacのユニファイドメモリはVRAMとして使えますか?

Apple Silicon搭載のMacでは、CPUとGPUが同じユニファイドメモリを共有します。そのため、メモリ32 GBのMacは、16 GBの専用GPUよりも大きなモデルを読み込めます。ただし、macOS自体のために8〜10 GBを確保してください。

その他の無料ツール