上級 11 分VRAM別

32GBのVRAMで使うなら、どのLLM? ?

端的な回答

32 GBのVRAMがあれば、27B〜32BのデンスモデルをQ4(16〜20 GB)で長いコンテキストとともに全体をロードできます。30B〜35BのMoE(19〜21 GB)やgpt-oss-20b(14 GB)も、十分な余裕を持ってロードできます。収まらないのは70Bモデルです。Q4でも40〜43 GB必要なため、必ず一部をシステムRAMに置くことになり、そこで速度が大幅に低下します。重みに加えて、コンテキストキャッシュの容量も必ず計算に入れてください。

32 GBのVRAMは、モデルのサイズとコンテキスト長のどちらかを優先する必要がなくなる容量の節目です。このページでは、実際にVRAMに収まるモデル、カード(RTX 5090またはRadeon AI PRO R9700)による違い、70Bや123Bが快適に動作するようにはならない理由、そしてMacのユニファイドメモリや2枚目のカードを選ぶほうがよい買い物になる場合を説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#32GBのVRAM:24GBと比べて容量の違いで何が変わるか

Q4 のモデルは、パラメータ 10 億あたり約 0.6 GB を占め、さらに会話の長さに応じて増加するコンテキストキャッシュが必要です。24 GB の場合、Q4 の 27B〜32B の Dense モデル(16〜20 GB)は動作しますが、コンテキストは短く保つ必要があります。32 GB の場合、コンテキスト、アクティベーション、システム用に 12〜16 GB が残ります。この予算により、27B モデルで 32,000〜128,000 トークンのウィンドウ、または余裕のある 30-35B の MoE が可能になります。

代表的なモデルの32 GBメモリ容量の配分(Q4でのモデル重み、コンテキスト分を除く)
モデルQ4 の重みコンテキストとシステム用の残り容量判定
gpt-oss-20b14 GB18 GB余裕が非常に大きく、長いコンテキストにも対応
Qwen 3.5 27B / Qwen 3.8 27B16 GB16 GB快適に動作し、長いコンテキストも利用可能
Gemma 4 31B18 GB14 GB快適
Qwen 3 32B19-20 GB12 GB良好。ただし、コンテキストの使用量に注意
Qwen3-Coder 30B-A3B (MoE)19 GB13 GB良好。モデルのサイズを考えると非常に高速です。
Qwen 3.6 35B-A3B (MoE)21 GB11 GB良好、コンテキストは中程度
Llama 3.3 70B43 GBマイナスVRAMに収まらないため、オフロードが必須

これらの値はファイルサイズであり、必要なメモリの総量ではありません。このサイトの計算ツールは、指定されたモデルとコンテキストに応じたキャッシュ容量を加算します。キャッシュはq8_0で量子化することもできます。OllamaのFAQによると、Flash Attentionを有効にすることを条件に、f16と比べてサイズを約半分にできます。

#32 GBを搭載するカードと、帯域幅が重要な理由

デスクトップ向けでは2つのカードが際立っています。GeForce RTX 5090は512ビットバスに32 GBのGDDR7を搭載し、NVIDIAによるとメモリ帯域幅は1,792 GB/sです。AMDのRadeon AI PRO R9700も32 GBですが、256ビットバスのGDDR6で、AMDによると帯域幅は640 GB/sです。デスクトップPCでの業務用途向けのカードです。容量は同じですが、生成速度は異なります。

32 GBのGPUカード2種類:容量は同じでも、理論上の処理速度は大きく異なる
カードメモリ帯域幅19 GBのモデルの理論上の速度上限
GeForce RTX 509032GB GDDR7、512ビット1,792 GB/s約94トークン/秒
Radeon AI PRO R970032GB GDDR6、256ビット640 GB/s約34 t/s

上限は、トークンごとに読み込まれる重みで帯域幅を割ることで計算されます。完全に実現されることはありませんが、比率は依然として有効です。同じモデルであれば、RTX 5090 はR9700の2倍以上の速度で生成します。AMDカードの場合、ドライバーとソフトウェアスタック(ROCm、Vulkan)も重要であり、AMDカード向けの専用ガイドで制限事項が詳述されています。具体的なカードにはそれぞれページがあり、RTX 5090 のページにはカードの詳細が記載されています。

32 GBを確保する方法は、ほかにも2つあります。llama.cppを使えば、16 GBのカード2枚にモデルを分散できますが、PCIe接続によってデータのやり取りが遅くなり、モデルを適切に分割できる必要があります。方法はマルチGPUのガイドで説明しています。32 GB以上のユニファイドメモリを搭載したMacが第3の選択肢です。帯域幅は低くなりますが、専用VRAM容量による制限はありません。

価格は急速に変動します。サイトは月曜日および木曜日に、ローカルAI用のGPUカードの価格を週ごとに追跡し、VRAMあたりの価格を記録します。

#32GBで推奨されるモデル

27B〜32Bの密なモデル
品質重視の選択肢:Qwen 3.5 27Bまたは3.8 27B(Q4で16GB)、Gemma 4 31B(18GB)、Qwen 3 32B(19〜20GB)。これらは長いコンテキストを使うためのメモリの余裕を残せます。さらに品質を高めたい場合は、Q5やQ6といった、より高精度の量子化にも適しています。
MoE 30-35B
Qwen3-Coder 30B-A3B(19 GB)とQwen 3.6 35B-A3B(21 GB)は、トークンごとに約30億個のパラメータしか有効にしません。モデルのサイズに対して最も高速で、コードやエージェントに適した選択です。
gpt-oss-20b
Ollamaのライブラリでは14 GBです。Ollamaのページには、少なくとも16 GBのメモリを搭載したシステムで動作可能と記載されています。32 GBあれば、非常に長いコンテキストのための余裕があり、さらに別のモデルも同時に読み込んだままにできます。
24Bのコードモデル
Devstral Small 2 24B(14GB):コーディングエージェントに特化したモデルで、2つのモデルをメモリに常駐させる余裕を残せます。

選ぶ際は、3つの問いを立ててください。長いコンテキスト(ドキュメントやコードリポジトリ)に対応する必要がありますか?その場合は、キャッシュ用に16GBを残せる27Bの密モデルをQ4で選んでください。速度が必要ですか(エージェントやツール呼び出しのループ)?その場合はMoEです。単に24GBの環境よりも高い品質を求めていますか?27B〜32BのモデルでQ4からQ6に切り替えてください。そのための容量はあります。

#モデルが実際にカードに収まるかを確認する

モデルが「読み込める」からといって、全体がGPU上に載っているとは限りません。VRAMが不足すると、Ollamaは通知せずにレイヤーをGPUとシステムRAMに分散させ、エラーメッセージを出さないまま速度が低下します。公式FAQによると、ollama psコマンドのProcessor列には、モデルがどこに読み込まれたかが表示されます。100 % GPUならモデル全体がGPU上に載っており、30 %/70 % CPU/GPUのような表示なら、VRAMに収まらない部分がシステムRAMに移されています。

  1. 01
    使用予定のコンテキスト長でモデルを読み込む
    デフォルト値ではなく、実際の用途で必要なコンテキスト長を指定してモデルを起動してください。メモリ容量を超過する原因になるのは、コンテキストキャッシュです。
  2. 02
    Processor列を確認する
    別のターミナルでollama psを実行してください。100% GPUを目指してください。処理の一部でもCPUに回ると、速度が低下します。
  3. 03
    必要に応じて減らす
    モデルがメモリに収まらない場合は、コンテキストを減らすか、Flash Attentionと併せてキャッシュのq8_0量子化を有効にするか、より軽量な量子化に切り替えてください。
  4. 04
    VRAMの空き容量を確認する
    WindowsまたはLinuxでは、nvidia-smiで使用中のメモリを表示できます。ディスプレイ表示とピーク時のために1〜2 GBの余裕を確保してください。
  5. 05
    実際の用途で測定する
    短いプロンプトと実際のプロンプトの両方でスループットを比較してください:重要なのは後者の数値です。
!
デフォルトのコンテキストの罠
OllamaのFAQによると、デフォルトのコンテキストウィンドウは4,096トークンです。この設定ではモデルがVRAMに収まるように見えても、文書を分析するために32,000トークンに増やした途端、VRAM容量を超えることがあります。必ず、実際に必要なコンテキスト長でテストしてください。

#70Bと123B:オフロードを使ってもこれらのモデルを実用的に使えない理由

Ollamaライブラリでは、Llama 3.3 70Bのサイズは43GB、Mistral Large 123Bは73GBです。VRAMが32GBの場合、70Bでは少なくとも11GB、123Bでは41GB分をシステムRAMに置く必要があります。各トークンの生成時に、CPUはこれらのレイヤーをシステムメモリの速度で読み出します。デュアルチャネルのDDR5-6400では、最大で約102GB/sです(6400 MT/s × 8バイト × 2)。これを41GBで割ると、123Bの生成速度の上限は約2.5トークン/秒になります。70Bでは、RAM上の11GBに対して約9トークン/秒です。これらは上限値であり、実測値ではありません。特に、レイヤーがGPUから外れると、生成速度が滑らかに低下するのではなく、段階的に落ちることを示しています。

32 GBのVRAMに収まらないモデルの性能目安(システムメモリから算出)
モデルOllamaでのサイズシステム RAM に置かれる部分の容量RAM による速度の上限(102GB/s)
Llama 3.3 70B43 GB約11 GB(34%)約9t/s
Mistral Large 123B73 GB約41GB(56%)約2.5トークン/秒

この計算では、カード上に32GB分の重みを保持すると仮定しています。実際にはコンテキストキャッシュも容量を使うため、より多くの重みがシステムRAMに移され、上限は下がります。MoEはこの点で有利です。llama.cppには、一部の層のエキスパートをCPU側に保持するオプション(--n-cpu-moe)があり、モデル全体をGPUに読み込めない構成で使えます。GPUに収まらないモデルを動かせるようにする方法ですが、llama.cppのリポジトリのあるユーザーは、すべてのエキスパートをCPU側に置くと速度が約80%低下すると報告しています。最後の手段と考えるべきです。

大きすぎる MoE:エキスパートを CPU 側に残す(llama.cpp)
llama-server -m modele-moe.gguf -ngl 99 -fa --n-cpu-moe 12 -c 16384

--n-cpu-moeの値はメモリ容量によって異なるため、試行を重ねて適切な値を見つける必要があります。70Bの密なモデルを32GBで使う場合、ほぼ常に適切な解決策は、オフロードではなく、より小さいモデルを使うかメモリを増やすことです。

#32 GBでモデルをファインチューニングする:できること、できないこと

QLoRAによるファインチューニングでは、モデルの重みを4ビットで保持し、小さなアダプタのみを学習します。70Bモデルは重みだけでも40GBを占めるため、32GBでは70BモデルのQLoRAによるファインチューニングは行えません。32Bモデルの重みは4ビットで約19〜20GBを占めるため、アクティベーション、オプティマイザ、アダプタ用に12GBが残ります。短いコンテキストとバッチサイズ1なら実行可能ですが、安全のための余裕はありません。7〜14Bモデルなら余裕があります。これらはおおよその目安であり、使用するツールで確認する必要があります。

#32 GBのVRAMか、別の選択肢か:選択のための判断表

あなたのニーズに応じて何を選べばよいのか
ニーズ解決策なぜ
27〜32Bの密モデル、長いコンテキスト、最高速度32GBのNVIDIA製グラフィックスカード高い帯域幅、CUDAエコシステム
より少ない消費電力で同じ容量を確保Radeon AI PRO R970032GBでも、理論的な帯域幅が低い
64GB以上のモデル、時々の利用64GB以上の統合メモリを備えたMacオフロードせずに収まる容量、速度は低め
予算制限あり、30B MoE24 GBのカードで十分な場合が多い19 GBのMoEモデルは、コンテキスト長を控えめにすればメモリに収まります

#よくある質問

FAQ
32 GB の VRAM に最適な LLM はどれですか?+
品質を重視するなら、長いコンテキストを使えるQ4の27〜32Bの密なモデル(Qwen 3.5または3.8 27B、Gemma 4 31B、Qwen 3 32B)が適しています。速度とコードを重視するなら、Qwen3-Coder 30B-A3Bのような30〜35BのMoEモデルです。あらゆる場合に最良となるモデルはありません。どれが最適かは、タスクと言語によって決まります。
Mistral Large 123Bを動かすには、32GBのVRAMで十分ですか?+
いいえ。Ollamaのライブラリでは、Mistral Large 123Bのサイズは73GBと記載されています。40GB超はメインメモリに残ることになり、そこでの読み取り速度は約100GB/sに限られるため、理論上の上限は毎秒2〜3トークンです。バックグラウンド処理には使えますが、チャットには向きません。
ローカルAIにはRTX 5090とMac Studio 64GBのどちらを選ぶべきですか?+
速度を重視するならグラフィックカードです。32GBに収まるモデルでは、メモリ帯域幅は1,792GB/sで、Macの数百GB/sを上回ります。容量を重視するならMacです。40〜50GBのモデルがオフロードなしで収まりますが、速度は低くなります。読み込むモデルのサイズに応じて選んでください。
16GBのカード2枚は、32GBのカード1枚と同等ですか?+
16 GB のカード 2 枚で合計 32 GB になりますが、モデルはこれらに分散され、PCIe 接続によるデータ交換が遅くなります。また、分散には llama.cpp での設定が必要です。同じ合計容量であれば、32 GB の 1 枚の方がシンプルで速いです。ただし、すでに 2 枚のカードをお持ちの場合は別です。
32 GBで2つのモデルを同時にロードできますか?+
はい、例えば gpt-oss-20b(14 GB)と Devstral Small 2 24B(14 GB)なら、重みの合計は 28 GB で、コンテキストを短くすれば同時に読み込めます。Ollama はデフォルトでモデルをメモリに 5 分間保持し、メモリ容量が許せば複数のモデルを保持できます。各モデルの重みに加えてコンテキストキャッシュもメモリを使用するため、その使用量に注意してください。
32GBでどの量子化を選択すべきですか?+
270億〜320億パラメータの密なモデルでは、Q4_K_Mが引き続き最もバランスのよい選択です。メモリに余裕がある場合(モデルの重みが14〜16GB)、Q5やQ6に上げると品質を改善できます。Q4より下げるのは、大きすぎるモデルをメモリに収めるために必要な場合だけにし、品質の低下を受け入れてください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。