ホーム › カタログ › 2026年、ビジョン機能付きで最適なローカルLLM

2026年、ビジョン機能付きで最適なローカルLLM

◆ ローカルAI — 1時間で、あなたのマシンにプライベートで無料のChatGPTを · 24 € · または全キットを49 €で →

ランキング更新日:2026年9月22日

入力画像を分析できるオープンウェイトLLMのランキングです。OCR、画像の説明、VQA、グラフ分析、スクリーンショットからのデータ抽出に対応するモデルを紹介しています。すべてセルフホスト可能です。

ランキング

1

🇨🇳 Qwen 3 VL 30B-A3B

Alibaba · 30B パラメータ · Apache 2.0 · 262 144 トークン ctx

ビジョン対応のMoEモデル。総パラメータ30B、アクティブパラメータ3B。Qwen 3のビジョンモデルの中でバランスのよい選択肢。256kコンテキスト。

このランクの理由 画像入力をネイティブにサポートしています。30Bパラメータで詳細な分析が可能です。
ollama run qwen3-vl:30b
VRAM Q4
19 GB
35 GB(Q8)
2

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B パラメータ · Apache 2.0 · 128 000 トークン ctx

Gemma 4のMoE版。総パラメータ26B、アクティブパラメータ4B。テキスト・画像・音声に対応する完全なマルチモーダルモデル。

このランクの理由 画像入力にネイティブ対応しています。26Bのパラメータにより、適切な分析が可能です。
ollama run gemma4:26b
VRAM Q4
16 GB
Q8で28GB
3

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16B パラメータ · Apache 2.0 · コンテキスト:8,192トークン

Apache 2.0ライセンスで公開された初のdLLM:MoE 16B/1B + 拡散デコーダー6.2B。テキストとビジョンを統合。2026年4月22日公開。

このランクの理由 画像入力にネイティブ対応しています。160億パラメータで適切な分析ができます。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
VRAM Q4
18 GB
Q8で30GB
4

🇨🇳 Qwen 3.6 27B

Alibaba · 27B パラメータ · Apache 2.0 · 262 144 トークン ctx

デンス型27Bマルチモーダルモデル、2026年4月22日公開。262kコンテキスト(YaRNで1M)。SWE-bench Verified 77.2%。

このランクの理由 画像入力にネイティブ対応しています。270億パラメータで、十分な分析性能を備えています。
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB(Q8)
5

🇨🇳 Qwen 3.8 27B

Alibaba · 27B パラメータ · Apache 2.0 · 262 144 トークン ctx

Qwen 3.8 27B:テキストと画像に対応するDenseマルチモーダルモデル、コンテキスト262k、Q4でVRAM約16 GB(Ollamaの重みは18 GB)。Apache 2.0、エージェント型コーディングと画像認識に対応。

このランクの理由 画像入力にネイティブ対応しています。270億パラメータで、十分な分析性能を備えています。
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB(Q8)
6

🇺🇸 Gemma 4 31B

Google · 31B パラメータ · Apache 2.0 · 256,000 トークン ctx

Dense型の31Bマルチモーダルモデル(テキスト+画像+音声)。140以上の言語、コンテキスト長256k。Chatbot Arenaのオープンモデル部門で3位。

このランクの理由 画像入力をネイティブにサポートしています。31Bのパラメータにより、詳細な分析が可能です。
ollama run gemma4:31b
VRAM Q4
18 GB
33GB(Q8)
7

🇨🇳 Qwen 3 VL 8B

Alibaba · 8B パラメータ · Apache 2.0 · 262 144 トークン ctx

Qwen 3 のデンス型8Bビジョンモデル。Qwen第3世代で最も優れた小型VLM。

このランクの理由 画像入力にネイティブ対応しています。80億パラメータで、十分な分析が可能です。
ollama run qwen3-vl:8b
VRAM Q4
6 GB
Q8 で 10GB

比較表

順位 モデル Params VRAM Q4 コンテキスト ライセンス
#1 Qwen 3 VL 30B-A3B 30B 19 GB 262 144 Apache 2.0
#2 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0
#3 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0
#4 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#5 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0
#7 Qwen 3 VL 8B 8B 6 GB 262 144 Apache 2.0
ローカルAIキット

視覚モデルを選択しました。ローカルAIキットは、あなたの環境で画像と対話を行う方法について、完全に適切に実行するための章を設けています(第7章)。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

ランキングの方法論

「vision」タグで絞り込みます。スコアでは、新しいモデル(VLMは非常に速く進化するため)と規模の大きいモデル(細部をよりよく捉えられるため)が優遇されます。

考慮した基準:

  • 画像理解
  • OCR / 文字抽出
  • VQA(画像に関する質問)
  • Ollama / llama.cpp 互換

スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。

よくある質問

オープンソースのLLMで、画像の分析に最も適したものは何ですか?

Qwen 3 VL 30B-A3B は、300億パラメータのモデルの中で当サイトの第1位です。より軽量な構成なら、Qwen 2.5 VL 7BはVRAMが8〜12GBあれば非常に快適に動作します。

これらのモデルでOCRは可能でしょうか?

はい。最近のVLMは、画像内のテキスト(スキャンした文書やスクリーンショット)を読み取れます。大量処理や産業用途のOCRには、特化したDeepSeek OCRがあります。フランス語の手書きテキストには、フランス語をうまく扱えるQwen 2.5 VLをおすすめします。

ビジョン対応にはOllamaかllama.cppが必須ですか?

どちらも視覚モデル(Llama 3.2 Vision、LLaVA、Qwen VL)に対応しています。LM Studioも対応しています。APIは次の方法で利用してください: -images またはパラメータ images Ollama で動作します。

十分な性能のVLMにはどれくらいのVRAMが必要ですか?

7B VL(Qwen 2.5 VL 7B)には8 GB、11B(Llama 3.2 Vision)には12-16 GB、大型の72Bには40 GB以上が必要です。ビジョン機能は、テキストモデルに加えてVRAMを約1-2 GB追加で消費します。

1対1の比較

最終候補同士を詳しく比較した当サイトの記事で、理解をさらに深めてください:

さらに詳しく

QuelLLM キット 用途別のリファレンスガイド
すべてのキットを生涯利用可能 — 49 €