MoE 解説:なぜ 30B-A3B は小型モデルのように動作するのか モデル
2025年以降、主要なオープンウェイトモデルのリリースの大半には共通点があります。Mixture of Experts(MoE)を採用していることです。Qwen3 30B-A3B、gpt-oss 120B、Llama 4 Scout 17B-A2Bといった名前を目にすると、数字が2つ並ぶ表記が気になるかもしれません。基本的な考え方はシンプルです。MoEモデルには多くのパラメータがありますが、各トークンで使われるのはそのごく一部だけです。その結果、「300億パラメータ」のモデルでも、30億パラメータのモデルと同じ速度で動作できます。このガイドでは、その仕組みと表記の読み方を説明し、VRAMと生成速度への実際の影響を詳しく解説します。
#MoEが解決する問題
従来の言語モデルは「dense(密)」と呼ばれます。各単語を生成する際、テキストをすべてのパラメータに通します。32Bのdenseモデルは、各トークンに対して320億のパラメータを動員します。これが強力な理由ですが、同時に遅く、リソースを大量に消費する原因でもあります。パラメータ数が多いほど、計算量とメモリが必要になり、回避策はありません。
ローカルでの実行には、ここにジレンマがあります。大規模モデルの知識と精緻さに加え、小規模モデルの速度と省資源性も欲しいのです。一般消費者向けのGPUでは、70Bの密なモデルは動かすこと自体が難しいか、動いてもつらいほど遅くなります。Mixture of Expertsは、これまで結びついていると思われていたモデルのサイズとトークンごとの処理コストを切り離すことで、このトレードオフを解消します。
#仕組み:必要に応じてエキスパートを有効化
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
Mixture of Expertsモデルでは、大規模な計算層は単一のブロックではなく、「エキスパート」と呼ばれるサブネットワークの集合になっています。1つのモデルに64個、128個、場合によってはそれ以上のエキスパートが含まれます。トークンを処理するたびに、小さな振り分け役である「ルーター」がコンテキストを確認し、有効にするエキスパートを2個、4個、または8個だけ選びます。残りのエキスパートは、そのトークンに対して計算を行いません。
この言葉が示唆するのとは異なり、これらのエキスパートはテーマ別ではありません。「フランス語のエキスパート」や「コードのエキスパート」があるわけではないのです。ルーターはモデルと同時に学習され、誰も手動で操作せず、統計的なパターンに基づいて処理を振り分けます。トークンごとに選択は変わります。文全体では、ほぼすべてのエキスパートが最終的に使われますが、同時にすべてが使われることはありません。
- エキスパート
- 特定の処理に特化したサブネットワークで、すべてがメモリ上にありますが、トークンごとに動作するのはその一部だけです。
- ルーター(ゲーティング)
- トークンごとに、どのエキスパートを有効にするかを決める軽量なコンポーネント。
- アクティブなエキスパート
- トークンごとに活性化されるエキスパートの数で、多くの場合は2〜8です。この数が速度を決めます。
- アクティブなパラメータ
- トークンごとに実際に使われるパラメータの総数。計算に関わるのは、全パラメータのうちこの部分です。
#30B-A3Bという表記を読み解く
初心者を戸惑わせる表記は、一度コツを掴めば非常に読みやすいものです。Qwen3 30B-A3Bを例にとると、最初の数字はモデルのパラメータ総数を示し、2番目の数字(「A」はActive、つまりアクティブを意味します)はトークンあたりのアクティブパラメータ数を示します。
- 30B
- このモデルは合計で300億のパラメータを備えています。これは、モデルをロードする際に必要なメモリ量を決定します。
- A3B
- 各トークンごとにアクティブなパラメータは約 30 億のみです。これが生成速度を決定します。
言い換えると、30B-A3Bは「300億個のパラメータを備え、そのうち30億個が働く」と読めます。このモデルは30Bモデル並みの豊富な知識を持ちながら、生成速度は3Bのデンスモデルとほぼ同じです。この仕組みは、ほかの最近リリースされたモデルにもすべて当てはまります。
- Qwen3 30B-A3B
- 総パラメータ数300億、アクティブパラメータ数30億 — 一般向けMoEの代表格です。
- Llama 4 Scout 17B-A2B
- 総パラメータ数は 17B、トークンあたり約 2B がアクティブで、さらにマルチモーダル機能も備えています。
- gpt-oss 120B
- 合計1200億パラメータですが、実際に活用されているのは約50億パラメータで、そのサイズに対して驚くほど高速な動作を実現しています。
- DeepSeek V3.2 671B-A37B
- 6710 億パラメータを備え、370 億パラメータがアクティブ: トークンあたりのコストは中規模モデル程度という巨人。
#VRAM:実際に何が変わるのか
ここが最も誤解されやすい点なので、はっきりさせておきましょう。MoEのすべてのエキスパートをメモリに読み込む必要があります。ルーターが次のトークンでどのエキスパートを呼び出すか分からないためです。したがって、必要なVRAM容量は、アクティブなパラメータ数ではなく、総パラメータ数によって決まります。30B-A3Bに必要なメモリ容量は、30Bの密なモデルと同じように見積もります。
- Q4_K_Mで量子化したQwen3 30B-A3B
- 必要なVRAMは約18〜19 GBで、32Bのデンスモデルと同程度です。そのため、RTX 4090 24 GBが目安となり、VRAM容量の小さいカードでは一部をシステムRAMにオフロードすることになります。
- Llama 4 Scout 17B-A2B(Q4)
- 約10〜11 GB。RTX 4070 12 GBや3060 12 GBで対応できる範囲です。
- gpt-oss 120B
- 数十GB:高性能な構成、またはRAM/SSDへのオフロードを利用する場合に限られます。
したがって、ローカルでMoEを使う利点はメモリ使用量ではなく、同じVRAM容量で得られる品質と速度のバランスです。30Bの密なモデルがグラフィックカード上で遅い場合でも、30B-A3BのMoEモデルは同じ容量を使いながら、はるかに速く生成できます。また、非アクティブなエキスパートは各トークンの処理で使われないため、MoEは重みの一部をシステムRAMにオフロードしても、性能を維持しやすい傾向があります。GPU上に残る重みが優先的に使われるためです。
#速度:なぜ速いのか
LLMの生成速度は主に、各トークンの処理で使われるパラメータ数に左右されます。MoEはそのごく一部しか有効化しないため、トークンあたりの計算量が大幅に減ります。具体的には、30B-A3Bは3Bのデンスモデルに近い速度でトークンを生成しながら、30Bモデル並みの深みのある回答を返します。
まさにこれが、控えめな性能のマシンでも MoE が広がっている理由です。大型モデルの品質を得ながら、その遅さを引き受けずに済みます。代償は別のところにあります。すでに見たようにメモリを多く必要とし、すべてのエキスパートを保存するため、ダウンロード時に必要なディスク容量も大きくなります。
- 高速化につながる要因
- アクティブなパラメータがトークンあたり少ないため、計算量が少なくなり、トークン/秒が増加します。
- 変化しない点
- VRAMの必要量とファイルサイズは、総パラメータ数に応じて決まります。
- 実質的なメリット
- 同じメモリ容量で、MoEは、はるかに小さい密なモデルに匹敵する速度で、より多くの知識を提供します。
#理解すべき制限
MoEは魔法ではなく、デンスモデルを時代遅れにするものでもありません。有効なパラメータ数が同じなら、デンスモデルのほうが通常は推論の精緻さで一段上です。30B-A3Bは優秀ですが、トークンごとに300億パラメータすべてを使う本来の30Bデンスモデルなら、さらに高い能力を発揮するでしょう。ただし、ローカル環境では実用にならないほど遅くなるという代償を伴います。
- メモリが削減されていない
- モデル全体を収めるだけのVRAMが必要です。MoEだからといって、大きなモデルが小さなカードに収まるわけではありません。
- トークンあたりの品質
- アクティブなパラメータ数が同程度なら、十分に学習された密なモデルは、特に高度な推論で優位に立つことがよくあります。
- ダウンロードサイズが大きい
- すべてのエキスパートが保存されるため、GGUFファイルのサイズはアクティブなパラメータ数ではなく、総パラメータ数に対応します。
- 量子化への感度
- ルーターと一部のエキスパートは、過度に低ビット化する量子化に弱いため、Q4_K_M以上を使ってください。
#ローカルで試すべき主要なMoEモデル
以下に、2026年に自宅で試す候補として特に適したMixture of Expertsモデルを、最も手軽に試せるものから最も要求の厳しいものまで順に紹介します。
- Qwen3 30B-A3B
- 最初に試すモデルとして最適です。一般用途でもコードでも確かな品質を備え、速度も優れており、Q4では約18GBです。MoEを知るための定番モデルです。
- Llama 4 Scout 17B-A2B
- MoEマルチモーダル(テキスト+画像)および長文コンテキストをサポート。VRAM消費が少ないため、12GBのカードをお持ちの方に最適です
- gpt-oss 120B
- OpenAIのオープンウェイトモデルで、アクティブなパラメータは約50億のみ。その規模に対して驚くほど高速ですが、高性能な構成が必要です。
- DeepSeek V3.2 671B-A37B
- モンスター級。大量のRAMを備え、重みの大部分をオフロードする構成向けです。最上位クラスのモデルを試してみたい人に向いています。
初心者の方は、Qwen3 30B-A3B から始めることをお勧めします。これは、単一のコンシューマー向けカードでアーキテクチャの利点を最もよく示す MoE です。
#3分でMoEを試す
Ollamaがすでにインストールされ、デフォルトポートでリッスンしている場合、MoEとdenseの差を実感するには2つのコマンドで十分です。
- 01MoEをダウンロードして実行するQwen3 30B-A3Bをダウンロードしてすぐに会話できます。初回起動時にモデルがダウンロードされます(数GBの容量を想定してください)
- 02処理速度を観察する少し長めの質問をして、生成速度を記録してください。300億パラメータもあるにもかかわらず、小さなモデルと同じ速度で即座に答えます。
- 03デンスモデルと比較する同程度のサイズの密なモデル(Denseモデル)を起動し、同じ質問をしてください。VRAM容量が同程度なら、MoEモデルのほうが大幅に速く生成できるはずです。
#さらに詳しく
MoEは、ローカルAIのほかの基本概念と関連づけると理解しやすくなります。以下のガイドは、このガイドの内容をさらに掘り下げるものです。
- 量子化の選択(Q4、Q5、Q8、FP16)
- MoEは量子化を強めすぎると影響を受けやすいため、このガイドは品質とメモリ使用量の適切なバランスを見つけるのに役立ちます。
- Ollama のインストール:Windows、macOS、Linux
- 最初のMoEモデルをダウンロードする前に、ポート11434でローカルデーモンを設定するためのガイドです。
- Llama 4 Scoutのローカル導入:Ollamaでのインストールと初期テスト
- マルチモーダルMoEを順を追って詳しく解説し、このガイドで説明した理論が実際にどう働くかを示します。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。