中級 11 分Qwen

Qwen3.6 35B-A3Bをローカルで使う:テストと必要条件 VRAM

Qwen3.6 35B-A3BはAlibabaによるMixture-of-Experts (MoE)モデルです。総パラメータ数は350億ですが、トークンごとにアクティブになるのは30億のみです。理論上は、30B以上の品質と3Bの速度を両立すると期待されます。しかし実際には、落とし穴はVRAMにあります。本ガイドでは、qwen3.6をローカルで実行するために実際に必要なVRAM容量を量子化レベル別に測定し、一般的なGPUで得られるトークン/秒の速度を報告します。

著者 Mohamed Meguedmi·更新 2026-06-03·Windows・macOS・Linuxでテスト済み

#ローカルで Qwen3.6 35B-A3B を実行する理由

従来の 32B の密なモデルよりも、このモデルを試したくなる具体的な理由が三つあります。まず速度です。各トークンの計算に関わるのはアクティブな 3B のパラメータだけなので、同じ VRAM 容量で比較すると、密な Qwen 32B モデルよりも推論がはるかに速くなります。次に品質です。公開ベンチマークでは、35B-A3B は推論、コード、フランス語で、14B〜24B の密なモデルに匹敵する性能を示しています。

最後に、このバランスを実現し、本番環境でも利用できる寛容なライセンスで提供されているモデルは数少なく、このモデルはその一つです。正確で応答が速く、24GBのグラフィックカードに収まる汎用アシスタントをお探しなら、Qwen3.6 35B-A3Bは現在、最有力候補の一つです。

i
名前の意味を読み解く
35B = 合計350億パラメータ。A3B = トークンあたり30億の「アクティブ」パラメータ。MoEルーターは各パスで約64のエキスパートからいくつかを動的に選択するため、計算コストは削減されますが、メモリコストは削減されません。

#MoE アーキテクチャを一分で

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

デンスモデルでは、各トークンがすべての層とすべてのニューロンを通過します。MoE では、一部のフィードフォワード層が独立したエキスパート群に置き換えられ、小さな「ルーター」ネットワークがトークンごとにどのエキスパートを有効にするかを決めます(通常は2〜8個)。残りのエキスパートは動作しません。

トークンあたりの計算量
アクティブなパラメータ数(3B)に比例します。そのため、生成が速いのです。
メモリ(VRAM)
総パラメータ数(35B)に比例します。どのエキスパートが呼び出されるかは事前にわからないため、すべてのエキスパートを読み込む必要があります。
品質
3Bの密モデルと35Bの密モデルの中間です。汎用的なタスクでは、実際には14B〜24Bの密モデルに近い性能を示します。
バッチ処理による影響
プロンプトを一度に1つだけ処理する場合、MoEは強みを発揮します。バッチが非常に大きくなると、最終的にすべてのエキスパートが有効になるため、計算コスト面での優位性が薄れます。
→
セルフホストにとって魅力的な理由
VRAM 24 GBのRTX 4090では、Q4量子化のQwen 32B密モデルは、速度が25~35トークン/秒で頭打ちになることがよくあります。同じVRAM容量でQwen3.6 35B-A3Bは約70~90トークン/秒で動作し、専門性の高くないタスクの大半では同程度の回答品質を得られます。

#ハードウェア要件

最小VRAM要件
テスト用には16GBが必要(Q3、部分的なCPUオフロードは許容)。快適な使用には20~24GBが必要(Q4)。
余裕のあるVRAM容量
Q5/Q6と長いコンテキストを余裕を持って扱うなら、32GB(RTX 5090)または48GB(Appleのユニファイドメモリ)。
システムRAM
CPUへのオフロードを許容する場合は最低32 GB。RAMだけにモデルを読み込む場合は64 GB。
ディスク
Q4_K_M用に22 GB、FP16用に70 GBのディスク容量を確保する。NVMe SSDを強く推奨します。
OS / ランタイム
Linux、macOS(Apple Silicon)、Windows 11。Ollama ≥ 0.5.x、または新しいllama.cpp(2026年3月より後のビルド)。
!
MoE ≠ 小規模モデル
「アクティブなパラメータは3B」という表現に惑わされないでください。それでもモデル全体をVRAMに読み込む必要があります。推論時に「3B分しか計算しない」としても、RTX 4060 8GBでは容量が足りません。すべてのエキスパートに即座にアクセスできる状態を保つ必要があります。

#量子化方式別の実際のVRAM使用量

以下は、コンテキスト長を8kトークンとしてllama.cppで測定したメモリ使用量です(モデル+KVキャッシュ+オーバーヘッド)。値には実行環境が使用するメモリも含まれており、ディスク上のGGUFファイルのサイズだけを示すものではありません。

Q2_K (≈13GB)
RTX 4070 / 4060 Ti 16 GBで利用可能です。特にコードと複数段階の推論では、品質の低下が目立ちます。応急的な利用に限ってください。
Q3_K_M (≈ 17 GB)
RX 7900 GRE / 4080 / 5070 Ti 16 GBで、限定的なコンテキストを用いて動作します。フランス語の一般チャット用途にはまだ妥当な品質を維持しています。
Q4_K_M(≈22GB)
最適なバランス。RTX 3090 / 4090 / 7900 XTX(24 GB)とRTX 5090(32 GB)で快適に動作します。基本の推奨設定です。
Q5_K_M(≈26GB)
32 GB(RTX 5090)、または36 GB以上のMac Mシリーズが必要です。Q4と比べた品質の向上は、コード用途を除けばわずかです。
Q6_K(約30GB)
RTX 5090、Mac Studio、またはマルチGPU構成向けに限られます。ユーザーが目にする出力では、Q8との差はごくわずかです。
Q8_0 (≈ 37 GB)
Mac Studio M2/M3/M5 Ultra、または2×3090の双GPU環境。ほぼFP16品質。
FP16 (≈ 70 GB)
研究、ファインチューニング、vLLMの本番運用向け。ほとんどのローカル構成では利用できません。
→
どの量子化レベルを選択すべきか
95%の用途においては、Q4_K_M がデフォルトとして最適です。品質の大部分を維持しつつ、VRAMを節約し、処理速度を向上させます。プロンプト上で明確な品質の低下が確認された場合にのみ、Q5またはQ6にアップグレードしてください。

#Ollama でインストール

Ollamaを使うのが、引き続き最も手っ取り早い方法です。まだインストールしていない場合は、インストールしてください(お使いのOSに対応するインストールガイドを参照)。デーモンがポート11434で稼働していれば、コマンドは1つだけで済みます。

ダウンロードして起動する
ollama run qwen3.6:35b-a3b-q4_K_M

ダウンロードサイズは約21GBです。最初のプロンプトではモデルがVRAMに読み込まれますが、その後の起動はモデルがメモリに保持されている限りほぼ即時です。

GPUの配置を確認してください
ollama ps

PROCESSOR列には100% GPUと表示される必要があります。CPUとGPUが混在している場合は、VRAMが不足しています。より強く圧縮する量子化(Q3_K_M)に切り替える、num_ctxを減らす、または処理速度の低下を受け入れる、という選択肢があります。

i
コンテキストの拡張
デフォルトでは、Ollama はコンテキストを 2048トークンに制限します。ドキュメントの生成や長時間の会話に必要な場合、Modelfile を作成して num_ctx を 8192 または 16384 に設定することで対応できます — それぞれの倍増は数 hundred MB の追加 VRAM を必要とします。
最小構成のModelfile
# fichier : Modelfile.qwen36-long
FROM qwen3.6:35b-a3b-q4_K_M
PARAMETER num_ctx 16384
PARAMETER temperature 0.7

# build
# ollama create qwen36-long -f Modelfile.qwen36-long

#llama.cppによるインストール

エキスパートの配置、バッチ処理、KVキャッシュを細かく制御したい場合は、llama.cppのほうが柔軟です。Hugging FaceからGGUF Q4_K_Mをダウンロードし(Qwenチームまたはbartowski/unslothが公開したモデル)、続いてOpenAI互換サーバーを起動します。

llama.cppサーバー
./llama-server \
  -m ./models/Qwen3.6-35B-A3B-Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 \
  -c 16384 \
  -ngl 99 \
  --flash-attn \
  --threads 8
-ngl 99
すべての層をGPUにオフロードします。CPUのみで実行する場合は0を、CPUとGPUに分けて実行する場合は一部の層に相当する値を設定する。
-c 16384
コンテキストサイズ。デフォルトを超える4 kごとに、KV キャッシュが約0.5 GB追加で必要になると見込んでください。
--flash-attn
使用しているビルドが対応している場合(CUDA、Metal)、Flash Attentionを有効にします。長いコンテキストでは、メモリ使用量を大きく削減できます。
--threads 8
主に処理の一部をCPUで行う場合に役立ちます。GPUだけで処理する場合、影響はほとんどありません。
→
MoE とエキスパートのオフロード
llama.cppの最近のビルドでは、--override-tensorを使って一部のエキスパートをRAMに配置できます。4070 12GBでは、これによりQ4_K_Mを収められますが、その代わりにスループットが低下します。詳しく知りたい場合は、「expert offload」に関するドキュメントを探してください。

#推論速度(測定値)

Q4_K_Mで測定、コンテキスト4096、プロンプトは短い(約200トークン)、生成は512トークン、バッチサイズ1。これらの数字はプロンプト評価および生成フェーズを含みます。

RTX 5090 32GB
生成時約 110~125 tok/s。プロンプト評価フェーズは 4000 tok/s を超えます。32 k のコンテキストまで快適です。
RTX 4090 24 GB
約80~95トークン/秒。Q4量子化モデルは、16kのコンテキストを含めてもメモリ容量内に収まります。
RTX 3090 24 GB
約55〜70 tok/s。中古では価格性能比が非常に優れていますが、メモリ帯域幅は4090より低いです。
Mac Studio M5 Max 64GB
Q4_K_Mで約60〜75 tok/s、Q8_0で約45〜55 tok/s。24時間365日の静かなサーバー運用に最適です。
Radeon RX 7900 XTX 24 GB (ROCm)
≈ 45–60 tok/s。Ollama がサポートされています。llama.cpp では ROCm/Vulkan を使用できます。
RTX 4070 Ti Super 16 GB (Q3_K_M)
約50〜65 tok/sで、コンテキストは4kに制限されます。この条件では、稠密モデルのQwen 14Bのほうが適していることが多いです。
i
MoE および長文コンテキスト
生成時の速度は高いままですが、16kのコンテキストを入力すると、プロンプト評価(prompt eval)にかかる時間が急速に増えます。これは正常です。プロンプトの処理中に、すべてのエキスパートがそれぞれどこかの時点で使われるためです。RAGでは、リクエストをバッチ処理してください。

#有用な最適化

  1. 01
    Flash Attentionを有効にする
    Ollamaでは、新しい世代のGPUで自動的に有効になります。llama.cppでは、--flash-attnを追加する。コンテキスト長が8k以上になると、VRAM使用量の削減効果が顕著になります。
  2. 02
    KVキャッシュの量子化
    llama.cppは --cache-type-k q8_0 --cache-type-v q8_0 に対応しています。キャッシュのVRAM使用量を約30%削減でき、品質の低下はほとんどありません。
  3. 03
    有効なエキスパートの数を減らす
    一部のバリエーションでは--override-kv qwen3moe.expert_used_count=2(デフォルトの4または8ではなく)をサポートしています。より高速ですが、品質にわずかな損失が生じます。
  4. 04
    num_ctxを必要な範囲に制限する
    16kあれば、ほとんどのチャットには十分すぎるほどです。32k以上が必要になるのは、長い文書を要約する場合だけです。
  5. 05
    対話型チャットではbatch=1を優先する
    バッチサイズが大きいと、MoEの優位性は薄れます。複数のユーザーに同時に対応する場合は、OllamaよりもvLLMの利用を検討してください。

#トラブルシューティング

RTX 4090でのロード時にOOMエラー
num_ctxを4096に下げ、ほかのGPUプロセス(ブラウザーやゲーム)が動作していないことを確認してください。Q4_K_Mなら、2〜3 GBの余裕を残して収まるはずです。
RTX 4090での生成速度が5トークン/秒
モデルの一部が CPU 側にオフロードされています。ollama ps では CPU と GPU の併用が表示されます。すべてを終了するか、Ollama を再起動するか、量子化を Q3_K_M に下げてください。
フランス語の回答に一貫性がない
Base ではなく Instruct 版を使っていることを確認してください。MoE のルーティングはシステムプロンプトの言い回しに敏感なので、簡潔で直接的な表現を使ってください。
最初のトークンが出るまでが非常に遅い(10秒超)
プロンプト評価に時間がかかります。MoEで長いコンテキストを扱う場合には、想定される動作です。リクエスト間でプロンプトキャッシュを再利用してください(llama.cppの--prompt-cacheオプション)。
Ollama にモデルが見つかりません
正確なタグは異なる可能性があります(qwen3.6 と qwen3_6 と qwen36)。コマンドを入力する前に、ollama.com/library で検索してください。

#さらに詳しく

Qwen3.6 35B-A3B がご自身の環境で稼働するようになった今、セットアップをさらに進めるためのいくつかのヒントです。

量子化の選択(Q4、Q5、Q8、FP16)
MoEモデルでQ3、Q4、Q5の間にどのような違いが生じるかを正確に理解するために。
Ollamaと組み合わせたOpen WebUI
ローカルで動作するQwen3.6に、履歴とRAGを備えたChatGPT風のインターフェースを組み合わせます。
ローカルAI向けGPUの選び方
このタイプの30B以上のMoEモデル向けに、中古の3090、4090、5090のどれを選ぶか迷っている場合に。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。