🇨🇳 Qwen 3 VL 30B-A3B
ビジョン対応のMoEモデル。総パラメータ30B、アクティブパラメータ3B。Qwen 3のビジョンモデルの中でバランスのよい選択肢。256kコンテキスト。
ollama run qwen3-vl:30b
ランキング更新日:2026年9月22日
入力画像を分析できるオープンウェイトLLMのランキングです。OCR、画像の説明、VQA、グラフ分析、スクリーンショットからのデータ抽出に対応するモデルを紹介しています。すべてセルフホスト可能です。
ビジョン対応のMoEモデル。総パラメータ30B、アクティブパラメータ3B。Qwen 3のビジョンモデルの中でバランスのよい選択肢。256kコンテキスト。
ollama run qwen3-vl:30b
Gemma 4のMoE版。総パラメータ26B、アクティブパラメータ4B。テキスト・画像・音声に対応する完全なマルチモーダルモデル。
ollama run gemma4:26b
Apache 2.0ライセンスで公開された初のdLLM:MoE 16B/1B + 拡散デコーダー6.2B。テキストとビジョンを統合。2026年4月22日公開。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
デンス型27Bマルチモーダルモデル、2026年4月22日公開。262kコンテキスト(YaRNで1M)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
Qwen 3.8 27B:テキストと画像に対応するDenseマルチモーダルモデル、コンテキスト262k、Q4でVRAM約16 GB(Ollamaの重みは18 GB)。Apache 2.0、エージェント型コーディングと画像認識に対応。
ollama run qwen3.8:27b
Dense型の31Bマルチモーダルモデル(テキスト+画像+音声)。140以上の言語、コンテキスト長256k。Chatbot Arenaのオープンモデル部門で3位。
ollama run gemma4:31b
Qwen 3 のデンス型8Bビジョンモデル。Qwen第3世代で最も優れた小型VLM。
ollama run qwen3-vl:8b
| 順位 | モデル | Params | VRAM Q4 | コンテキスト | ライセンス |
|---|---|---|---|---|---|
| #1 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 |
| #2 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 |
| #3 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 |
| #4 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 |
| #7 | Qwen 3 VL 8B | 8B | 6 GB | 262 144 | Apache 2.0 |
視覚モデルを選択しました。ローカルAIキットは、あなたの環境で画像と対話を行う方法について、完全に適切に実行するための章を設けています(第7章)。
「vision」タグで絞り込みます。スコアでは、新しいモデル(VLMは非常に速く進化するため)と規模の大きいモデル(細部をよりよく捉えられるため)が優遇されます。
考慮した基準:
スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。
オープンソースのLLMで、画像の分析に最も適したものは何ですか?
Qwen 3 VL 30B-A3B は、300億パラメータのモデルの中で当サイトの第1位です。より軽量な構成なら、Qwen 2.5 VL 7BはVRAMが8〜12GBあれば非常に快適に動作します。
これらのモデルでOCRは可能でしょうか?
はい。最近のVLMは、画像内のテキスト(スキャンした文書やスクリーンショット)を読み取れます。大量処理や産業用途のOCRには、特化したDeepSeek OCRがあります。フランス語の手書きテキストには、フランス語をうまく扱えるQwen 2.5 VLをおすすめします。
ビジョン対応にはOllamaかllama.cppが必須ですか?
どちらも視覚モデル(Llama 3.2 Vision、LLaVA、Qwen VL)に対応しています。LM Studioも対応しています。APIは次の方法で利用してください: -images またはパラメータ images Ollama で動作します。
十分な性能のVLMにはどれくらいのVRAMが必要ですか?
7B VL(Qwen 2.5 VL 7B)には8 GB、11B(Llama 3.2 Vision)には12-16 GB、大型の72Bには40 GB以上が必要です。ビジョン機能は、テキストモデルに加えてVRAMを約1-2 GB追加で消費します。
最終候補同士を詳しく比較した当サイトの記事で、理解をさらに深めてください: