Qwen3.6 35B-A3Bをローカルで使う:テストと必要条件 VRAM
Qwen3.6 35B-A3BはAlibabaによるMixture-of-Experts (MoE)モデルです。総パラメータ数は350億ですが、トークンごとにアクティブになるのは30億のみです。理論上は、30B以上の品質と3Bの速度を両立すると期待されます。しかし実際には、落とし穴はVRAMにあります。本ガイドでは、qwen3.6をローカルで実行するために実際に必要なVRAM容量を量子化レベル別に測定し、一般的なGPUで得られるトークン/秒の速度を報告します。
#ローカルで Qwen3.6 35B-A3B を実行する理由
従来の 32B の密なモデルよりも、このモデルを試したくなる具体的な理由が三つあります。まず速度です。各トークンの計算に関わるのはアクティブな 3B のパラメータだけなので、同じ VRAM 容量で比較すると、密な Qwen 32B モデルよりも推論がはるかに速くなります。次に品質です。公開ベンチマークでは、35B-A3B は推論、コード、フランス語で、14B〜24B の密なモデルに匹敵する性能を示しています。
最後に、このバランスを実現し、本番環境でも利用できる寛容なライセンスで提供されているモデルは数少なく、このモデルはその一つです。正確で応答が速く、24GBのグラフィックカードに収まる汎用アシスタントをお探しなら、Qwen3.6 35B-A3Bは現在、最有力候補の一つです。
#MoE アーキテクチャを一分で
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
デンスモデルでは、各トークンがすべての層とすべてのニューロンを通過します。MoE では、一部のフィードフォワード層が独立したエキスパート群に置き換えられ、小さな「ルーター」ネットワークがトークンごとにどのエキスパートを有効にするかを決めます(通常は2〜8個)。残りのエキスパートは動作しません。
- トークンあたりの計算量
- アクティブなパラメータ数(3B)に比例します。そのため、生成が速いのです。
- メモリ(VRAM)
- 総パラメータ数(35B)に比例します。どのエキスパートが呼び出されるかは事前にわからないため、すべてのエキスパートを読み込む必要があります。
- 品質
- 3Bの密モデルと35Bの密モデルの中間です。汎用的なタスクでは、実際には14B〜24Bの密モデルに近い性能を示します。
- バッチ処理による影響
- プロンプトを一度に1つだけ処理する場合、MoEは強みを発揮します。バッチが非常に大きくなると、最終的にすべてのエキスパートが有効になるため、計算コスト面での優位性が薄れます。
#ハードウェア要件
- 最小VRAM要件
- テスト用には16GBが必要(Q3、部分的なCPUオフロードは許容)。快適な使用には20~24GBが必要(Q4)。
- 余裕のあるVRAM容量
- Q5/Q6と長いコンテキストを余裕を持って扱うなら、32GB(RTX 5090)または48GB(Appleのユニファイドメモリ)。
- システムRAM
- CPUへのオフロードを許容する場合は最低32 GB。RAMだけにモデルを読み込む場合は64 GB。
- ディスク
- Q4_K_M用に22 GB、FP16用に70 GBのディスク容量を確保する。NVMe SSDを強く推奨します。
- OS / ランタイム
- Linux、macOS(Apple Silicon)、Windows 11。Ollama ≥ 0.5.x、または新しいllama.cpp(2026年3月より後のビルド)。
#量子化方式別の実際のVRAM使用量
以下は、コンテキスト長を8kトークンとしてllama.cppで測定したメモリ使用量です(モデル+KVキャッシュ+オーバーヘッド)。値には実行環境が使用するメモリも含まれており、ディスク上のGGUFファイルのサイズだけを示すものではありません。
- Q2_K (≈13GB)
- RTX 4070 / 4060 Ti 16 GBで利用可能です。特にコードと複数段階の推論では、品質の低下が目立ちます。応急的な利用に限ってください。
- Q3_K_M (≈ 17 GB)
- RX 7900 GRE / 4080 / 5070 Ti 16 GBで、限定的なコンテキストを用いて動作します。フランス語の一般チャット用途にはまだ妥当な品質を維持しています。
- Q4_K_M(≈22GB)
- 最適なバランス。RTX 3090 / 4090 / 7900 XTX(24 GB)とRTX 5090(32 GB)で快適に動作します。基本の推奨設定です。
- Q5_K_M(≈26GB)
- 32 GB(RTX 5090)、または36 GB以上のMac Mシリーズが必要です。Q4と比べた品質の向上は、コード用途を除けばわずかです。
- Q6_K(約30GB)
- RTX 5090、Mac Studio、またはマルチGPU構成向けに限られます。ユーザーが目にする出力では、Q8との差はごくわずかです。
- Q8_0 (≈ 37 GB)
- Mac Studio M2/M3/M5 Ultra、または2×3090の双GPU環境。ほぼFP16品質。
- FP16 (≈ 70 GB)
- 研究、ファインチューニング、vLLMの本番運用向け。ほとんどのローカル構成では利用できません。
#Ollama でインストール
Ollamaを使うのが、引き続き最も手っ取り早い方法です。まだインストールしていない場合は、インストールしてください(お使いのOSに対応するインストールガイドを参照)。デーモンがポート11434で稼働していれば、コマンドは1つだけで済みます。
ダウンロードサイズは約21GBです。最初のプロンプトではモデルがVRAMに読み込まれますが、その後の起動はモデルがメモリに保持されている限りほぼ即時です。
PROCESSOR列には100% GPUと表示される必要があります。CPUとGPUが混在している場合は、VRAMが不足しています。より強く圧縮する量子化(Q3_K_M)に切り替える、num_ctxを減らす、または処理速度の低下を受け入れる、という選択肢があります。
#llama.cppによるインストール
エキスパートの配置、バッチ処理、KVキャッシュを細かく制御したい場合は、llama.cppのほうが柔軟です。Hugging FaceからGGUF Q4_K_Mをダウンロードし(Qwenチームまたはbartowski/unslothが公開したモデル)、続いてOpenAI互換サーバーを起動します。
- -ngl 99
- すべての層をGPUにオフロードします。CPUのみで実行する場合は0を、CPUとGPUに分けて実行する場合は一部の層に相当する値を設定する。
- -c 16384
- コンテキストサイズ。デフォルトを超える4 kごとに、KV キャッシュが約0.5 GB追加で必要になると見込んでください。
- --flash-attn
- 使用しているビルドが対応している場合(CUDA、Metal)、Flash Attentionを有効にします。長いコンテキストでは、メモリ使用量を大きく削減できます。
- --threads 8
- 主に処理の一部をCPUで行う場合に役立ちます。GPUだけで処理する場合、影響はほとんどありません。
#推論速度(測定値)
Q4_K_Mで測定、コンテキスト4096、プロンプトは短い(約200トークン)、生成は512トークン、バッチサイズ1。これらの数字はプロンプト評価および生成フェーズを含みます。
- RTX 5090 32GB
- 生成時約 110~125 tok/s。プロンプト評価フェーズは 4000 tok/s を超えます。32 k のコンテキストまで快適です。
- RTX 4090 24 GB
- 約80~95トークン/秒。Q4量子化モデルは、16kのコンテキストを含めてもメモリ容量内に収まります。
- RTX 3090 24 GB
- 約55〜70 tok/s。中古では価格性能比が非常に優れていますが、メモリ帯域幅は4090より低いです。
- Mac Studio M5 Max 64GB
- Q4_K_Mで約60〜75 tok/s、Q8_0で約45〜55 tok/s。24時間365日の静かなサーバー運用に最適です。
- Radeon RX 7900 XTX 24 GB (ROCm)
- ≈ 45–60 tok/s。Ollama がサポートされています。llama.cpp では ROCm/Vulkan を使用できます。
- RTX 4070 Ti Super 16 GB (Q3_K_M)
- 約50〜65 tok/sで、コンテキストは4kに制限されます。この条件では、稠密モデルのQwen 14Bのほうが適していることが多いです。
#有用な最適化
- 01Flash Attentionを有効にするOllamaでは、新しい世代のGPUで自動的に有効になります。llama.cppでは、--flash-attnを追加する。コンテキスト長が8k以上になると、VRAM使用量の削減効果が顕著になります。
- 02KVキャッシュの量子化llama.cppは --cache-type-k q8_0 --cache-type-v q8_0 に対応しています。キャッシュのVRAM使用量を約30%削減でき、品質の低下はほとんどありません。
- 03有効なエキスパートの数を減らす一部のバリエーションでは--override-kv qwen3moe.expert_used_count=2(デフォルトの4または8ではなく)をサポートしています。より高速ですが、品質にわずかな損失が生じます。
- 04num_ctxを必要な範囲に制限する16kあれば、ほとんどのチャットには十分すぎるほどです。32k以上が必要になるのは、長い文書を要約する場合だけです。
- 05対話型チャットではbatch=1を優先するバッチサイズが大きいと、MoEの優位性は薄れます。複数のユーザーに同時に対応する場合は、OllamaよりもvLLMの利用を検討してください。
#トラブルシューティング
- RTX 4090でのロード時にOOMエラー
- num_ctxを4096に下げ、ほかのGPUプロセス(ブラウザーやゲーム)が動作していないことを確認してください。Q4_K_Mなら、2〜3 GBの余裕を残して収まるはずです。
- RTX 4090での生成速度が5トークン/秒
- モデルの一部が CPU 側にオフロードされています。ollama ps では CPU と GPU の併用が表示されます。すべてを終了するか、Ollama を再起動するか、量子化を Q3_K_M に下げてください。
- フランス語の回答に一貫性がない
- Base ではなく Instruct 版を使っていることを確認してください。MoE のルーティングはシステムプロンプトの言い回しに敏感なので、簡潔で直接的な表現を使ってください。
- 最初のトークンが出るまでが非常に遅い(10秒超)
- プロンプト評価に時間がかかります。MoEで長いコンテキストを扱う場合には、想定される動作です。リクエスト間でプロンプトキャッシュを再利用してください(llama.cppの--prompt-cacheオプション)。
- Ollama にモデルが見つかりません
- 正確なタグは異なる可能性があります(qwen3.6 と qwen3_6 と qwen36)。コマンドを入力する前に、ollama.com/library で検索してください。
#さらに詳しく
Qwen3.6 35B-A3B がご自身の環境で稼働するようになった今、セットアップをさらに進めるためのいくつかのヒントです。
- 量子化の選択(Q4、Q5、Q8、FP16)
- MoEモデルでQ3、Q4、Q5の間にどのような違いが生じるかを正確に理解するために。
- Ollamaと組み合わせたOpen WebUI
- ローカルで動作するQwen3.6に、履歴とRAGを備えたChatGPT風のインターフェースを組み合わせます。
- ローカルAI向けGPUの選び方
- このタイプの30B以上のMoEモデル向けに、中古の3090、4090、5090のどれを選ぶか迷っている場合に。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。