32GBのVRAMで使うなら、どのLLM? ?
32 GBのVRAMがあれば、27B〜32BのデンスモデルをQ4(16〜20 GB)で長いコンテキストとともに全体をロードできます。30B〜35BのMoE(19〜21 GB)やgpt-oss-20b(14 GB)も、十分な余裕を持ってロードできます。収まらないのは70Bモデルです。Q4でも40〜43 GB必要なため、必ず一部をシステムRAMに置くことになり、そこで速度が大幅に低下します。重みに加えて、コンテキストキャッシュの容量も必ず計算に入れてください。
32 GBのVRAMは、モデルのサイズとコンテキスト長のどちらかを優先する必要がなくなる容量の節目です。このページでは、実際にVRAMに収まるモデル、カード(RTX 5090またはRadeon AI PRO R9700)による違い、70Bや123Bが快適に動作するようにはならない理由、そしてMacのユニファイドメモリや2枚目のカードを選ぶほうがよい買い物になる場合を説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#32GBのVRAM:24GBと比べて容量の違いで何が変わるか
Q4 のモデルは、パラメータ 10 億あたり約 0.6 GB を占め、さらに会話の長さに応じて増加するコンテキストキャッシュが必要です。24 GB の場合、Q4 の 27B〜32B の Dense モデル(16〜20 GB)は動作しますが、コンテキストは短く保つ必要があります。32 GB の場合、コンテキスト、アクティベーション、システム用に 12〜16 GB が残ります。この予算により、27B モデルで 32,000〜128,000 トークンのウィンドウ、または余裕のある 30-35B の MoE が可能になります。
| モデル | Q4 の重み | コンテキストとシステム用の残り容量 | 判定 |
|---|---|---|---|
| gpt-oss-20b | 14 GB | 18 GB | 余裕が非常に大きく、長いコンテキストにも対応 |
| Qwen 3.5 27B / Qwen 3.8 27B | 16 GB | 16 GB | 快適に動作し、長いコンテキストも利用可能 |
| Gemma 4 31B | 18 GB | 14 GB | 快適 |
| Qwen 3 32B | 19-20 GB | 12 GB | 良好。ただし、コンテキストの使用量に注意 |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 13 GB | 良好。モデルのサイズを考えると非常に高速です。 |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 11 GB | 良好、コンテキストは中程度 |
| Llama 3.3 70B | 43 GB | マイナス | VRAMに収まらないため、オフロードが必須 |
これらの値はファイルサイズであり、必要なメモリの総量ではありません。このサイトの計算ツールは、指定されたモデルとコンテキストに応じたキャッシュ容量を加算します。キャッシュはq8_0で量子化することもできます。OllamaのFAQによると、Flash Attentionを有効にすることを条件に、f16と比べてサイズを約半分にできます。
#32 GBを搭載するカードと、帯域幅が重要な理由
デスクトップ向けでは2つのカードが際立っています。GeForce RTX 5090は512ビットバスに32 GBのGDDR7を搭載し、NVIDIAによるとメモリ帯域幅は1,792 GB/sです。AMDのRadeon AI PRO R9700も32 GBですが、256ビットバスのGDDR6で、AMDによると帯域幅は640 GB/sです。デスクトップPCでの業務用途向けのカードです。容量は同じですが、生成速度は異なります。
| カード | メモリ | 帯域幅 | 19 GBのモデルの理論上の速度上限 |
|---|---|---|---|
| GeForce RTX 5090 | 32GB GDDR7、512ビット | 1,792 GB/s | 約94トークン/秒 |
| Radeon AI PRO R9700 | 32GB GDDR6、256ビット | 640 GB/s | 約34 t/s |
上限は、トークンごとに読み込まれる重みで帯域幅を割ることで計算されます。完全に実現されることはありませんが、比率は依然として有効です。同じモデルであれば、RTX 5090 はR9700の2倍以上の速度で生成します。AMDカードの場合、ドライバーとソフトウェアスタック(ROCm、Vulkan)も重要であり、AMDカード向けの専用ガイドで制限事項が詳述されています。具体的なカードにはそれぞれページがあり、RTX 5090 のページにはカードの詳細が記載されています。
32 GBを確保する方法は、ほかにも2つあります。llama.cppを使えば、16 GBのカード2枚にモデルを分散できますが、PCIe接続によってデータのやり取りが遅くなり、モデルを適切に分割できる必要があります。方法はマルチGPUのガイドで説明しています。32 GB以上のユニファイドメモリを搭載したMacが第3の選択肢です。帯域幅は低くなりますが、専用VRAM容量による制限はありません。
価格は急速に変動します。サイトは月曜日および木曜日に、ローカルAI用のGPUカードの価格を週ごとに追跡し、VRAMあたりの価格を記録します。
#32GBで推奨されるモデル
- 27B〜32Bの密なモデル
- 品質重視の選択肢:Qwen 3.5 27Bまたは3.8 27B(Q4で16GB)、Gemma 4 31B(18GB)、Qwen 3 32B(19〜20GB)。これらは長いコンテキストを使うためのメモリの余裕を残せます。さらに品質を高めたい場合は、Q5やQ6といった、より高精度の量子化にも適しています。
- MoE 30-35B
- Qwen3-Coder 30B-A3B(19 GB)とQwen 3.6 35B-A3B(21 GB)は、トークンごとに約30億個のパラメータしか有効にしません。モデルのサイズに対して最も高速で、コードやエージェントに適した選択です。
- gpt-oss-20b
- Ollamaのライブラリでは14 GBです。Ollamaのページには、少なくとも16 GBのメモリを搭載したシステムで動作可能と記載されています。32 GBあれば、非常に長いコンテキストのための余裕があり、さらに別のモデルも同時に読み込んだままにできます。
- 24Bのコードモデル
- Devstral Small 2 24B(14GB):コーディングエージェントに特化したモデルで、2つのモデルをメモリに常駐させる余裕を残せます。
選ぶ際は、3つの問いを立ててください。長いコンテキスト(ドキュメントやコードリポジトリ)に対応する必要がありますか?その場合は、キャッシュ用に16GBを残せる27Bの密モデルをQ4で選んでください。速度が必要ですか(エージェントやツール呼び出しのループ)?その場合はMoEです。単に24GBの環境よりも高い品質を求めていますか?27B〜32BのモデルでQ4からQ6に切り替えてください。そのための容量はあります。
#モデルが実際にカードに収まるかを確認する
モデルが「読み込める」からといって、全体がGPU上に載っているとは限りません。VRAMが不足すると、Ollamaは通知せずにレイヤーをGPUとシステムRAMに分散させ、エラーメッセージを出さないまま速度が低下します。公式FAQによると、ollama psコマンドのProcessor列には、モデルがどこに読み込まれたかが表示されます。100 % GPUならモデル全体がGPU上に載っており、30 %/70 % CPU/GPUのような表示なら、VRAMに収まらない部分がシステムRAMに移されています。
- 01使用予定のコンテキスト長でモデルを読み込むデフォルト値ではなく、実際の用途で必要なコンテキスト長を指定してモデルを起動してください。メモリ容量を超過する原因になるのは、コンテキストキャッシュです。
- 02Processor列を確認する別のターミナルでollama psを実行してください。100% GPUを目指してください。処理の一部でもCPUに回ると、速度が低下します。
- 03必要に応じて減らすモデルがメモリに収まらない場合は、コンテキストを減らすか、Flash Attentionと併せてキャッシュのq8_0量子化を有効にするか、より軽量な量子化に切り替えてください。
- 04VRAMの空き容量を確認するWindowsまたはLinuxでは、nvidia-smiで使用中のメモリを表示できます。ディスプレイ表示とピーク時のために1〜2 GBの余裕を確保してください。
- 05実際の用途で測定する短いプロンプトと実際のプロンプトの両方でスループットを比較してください:重要なのは後者の数値です。
#70Bと123B:オフロードを使ってもこれらのモデルを実用的に使えない理由
Ollamaライブラリでは、Llama 3.3 70Bのサイズは43GB、Mistral Large 123Bは73GBです。VRAMが32GBの場合、70Bでは少なくとも11GB、123Bでは41GB分をシステムRAMに置く必要があります。各トークンの生成時に、CPUはこれらのレイヤーをシステムメモリの速度で読み出します。デュアルチャネルのDDR5-6400では、最大で約102GB/sです(6400 MT/s × 8バイト × 2)。これを41GBで割ると、123Bの生成速度の上限は約2.5トークン/秒になります。70Bでは、RAM上の11GBに対して約9トークン/秒です。これらは上限値であり、実測値ではありません。特に、レイヤーがGPUから外れると、生成速度が滑らかに低下するのではなく、段階的に落ちることを示しています。
| モデル | Ollamaでのサイズ | システム RAM に置かれる部分の容量 | RAM による速度の上限(102GB/s) |
|---|---|---|---|
| Llama 3.3 70B | 43 GB | 約11 GB(34%) | 約9t/s |
| Mistral Large 123B | 73 GB | 約41GB(56%) | 約2.5トークン/秒 |
この計算では、カード上に32GB分の重みを保持すると仮定しています。実際にはコンテキストキャッシュも容量を使うため、より多くの重みがシステムRAMに移され、上限は下がります。MoEはこの点で有利です。llama.cppには、一部の層のエキスパートをCPU側に保持するオプション(--n-cpu-moe)があり、モデル全体をGPUに読み込めない構成で使えます。GPUに収まらないモデルを動かせるようにする方法ですが、llama.cppのリポジトリのあるユーザーは、すべてのエキスパートをCPU側に置くと速度が約80%低下すると報告しています。最後の手段と考えるべきです。
--n-cpu-moeの値はメモリ容量によって異なるため、試行を重ねて適切な値を見つける必要があります。70Bの密なモデルを32GBで使う場合、ほぼ常に適切な解決策は、オフロードではなく、より小さいモデルを使うかメモリを増やすことです。
#32 GBでモデルをファインチューニングする:できること、できないこと
QLoRAによるファインチューニングでは、モデルの重みを4ビットで保持し、小さなアダプタのみを学習します。70Bモデルは重みだけでも40GBを占めるため、32GBでは70BモデルのQLoRAによるファインチューニングは行えません。32Bモデルの重みは4ビットで約19〜20GBを占めるため、アクティベーション、オプティマイザ、アダプタ用に12GBが残ります。短いコンテキストとバッチサイズ1なら実行可能ですが、安全のための余裕はありません。7〜14Bモデルなら余裕があります。これらはおおよその目安であり、使用するツールで確認する必要があります。
#32 GBのVRAMか、別の選択肢か:選択のための判断表
| ニーズ | 解決策 | なぜ |
|---|---|---|
| 27〜32Bの密モデル、長いコンテキスト、最高速度 | 32GBのNVIDIA製グラフィックスカード | 高い帯域幅、CUDAエコシステム |
| より少ない消費電力で同じ容量を確保 | Radeon AI PRO R9700 | 32GBでも、理論的な帯域幅が低い |
| 64GB以上のモデル、時々の利用 | 64GB以上の統合メモリを備えたMac | オフロードせずに収まる容量、速度は低め |
| 予算制限あり、30B MoE | 24 GBのカードで十分な場合が多い | 19 GBのMoEモデルは、コンテキスト長を控えめにすればメモリに収まります |
- VRAM 24 GBで使えるLLMはどれ?
- Mac Studio(64〜512 GB)
- 出典:NVIDIA、RTX 50の発表
- 出典:AMD、Radeon AI PRO R9700
- 出典:OllamaライブラリのMistral Large
#よくある質問
32 GB の VRAM に最適な LLM はどれですか?+
Mistral Large 123Bを動かすには、32GBのVRAMで十分ですか?+
ローカルAIにはRTX 5090とMac Studio 64GBのどちらを選ぶべきですか?+
16GBのカード2枚は、32GBのカード1枚と同等ですか?+
32 GBで2つのモデルを同時にロードできますか?+
32GBでどの量子化を選択すべきですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。