ホーム › 比較ツール › Granite 4.0 H-Small 32B-A9B vs Qwen 3 VL 30B-A3B

Granite 4.0 H-Small 32B-A9BvsQwen 3 VL 30B-A3B

徹底比較: Granite 4.0 H-Small 32B-A9B (32Bパラメータ、IBM) および Qwen 3 VL 30B-A3B (30B、Alibaba)。量子化方式ごとの必要VRAM、4種類の基準GPUで測定したトークン/秒、用途別の評価、ライセンス、インストールコマンド。すべての数値はカタログデータから計算されており、ページ間のコピー&ペーストは一切ありません。

要約

特徴 Granite 4.0 H-Small 32B-A9B Qwen 3 VL 30B-A3B
パラメータ 32B 30B
ファミリー Granite Qwen
著者 IBM Alibaba
開発国 US CN
ライセンス Apache 2.0 Apache 2.0
コンテキスト 128 000 トークン 262 144 トークン
公開日 2025年10月 2025年5月

メモリフットプリント

平均的なコンテキストウィンドウでの推論に必要なVRAMの概算値です。勝者(緑色)は消費量が moins — 小規模モデルに有利。

量子化 Granite 4.0 H-Small 32B-A9B Qwen 3 VL 30B-A3B
Q4_K_M(軽量) 19 GB 19 GB
Q5_K_M(バランス型) 23 GB 23 GB
Q8(ほぼ無損失) 35 GB 35 GB
FP16(最高品質) 64 GB 62 GB
CPUのみで実行する場合のRAM 32 GB 32 GB

推定速度(トークン/秒)

各GPUで実行可能な最適な量子化に基づく推定値です。実際の数値はプロンプト、コンテキスト、エンジン(llama.cpp、vLLM、MLX)によって異なります。 方法論.

基準となるGPU Granite 4.0 H-Small 32B-A9B Qwen 3 VL 30B-A3B
RTX 4090 (24 GB) 75トークン/秒 · Q5_K_M 100 tok/s · Q5_K_M
RTX 4080 (16 GB) ✗ 重すぎる ✗ 重すぎる
RTX 3060 12GB (12 GB) ✗ 重すぎる ✗ 重すぎる
Apple M4 Pro (48 GB) (36 GB) 30 tok/s · Q8 40 tok/s · Q8

ユースケース別評価

一般的な用途ごとに、タグ、サイズ、専門性に基づいてどちらが最も適しているかを示します。

一般チャット
接戦 — 具体的な条件によって変わります。 この基準では両者同等です。VRAMやライセンスの制約に応じて判断してください。
ビジョン / 画像
Qwen 3 VL 30B-A3B が優位。 画像入力をネイティブでサポートします。
RAG / 長い文書
接戦 — 具体的な条件によって変わります。 この基準では両者同等です。VRAMやライセンスの制約に応じて判断してください。
エージェント & ツール使用
接戦 — 具体的な条件によって変わります。 この基準では両者同等です。VRAMやライセンスの制約に応じて判断してください。
ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

強みと弱み

IBM · 32B

Granite 4.0 H-Small 32B-A9B

Mamba-2とMoEのハイブリッド。総パラメータ32B、アクティブパラメータ9B。長いコンテキストではRAM使用量が約70%少ない。Apache 2.0。

  • 長いコンテキストでのRAM使用量を70%削減
  • Apache 2.0
  • Enterprise-ready
  • 新しいバージョンのllama.cppによる対応が必要

インストール

ollama run granite4:small-h
Alibaba · 30B

Qwen 3 VL 30B-A3B

ビジョン対応のMoEモデル。総パラメータ30B、アクティブパラメータ3B。Qwen 3のビジョンモデルの中でバランスのよい選択肢。256kコンテキスト。

  • 262kのマルチモーダルコンテキスト
  • 19 GB VRAM Q4
  • 効率的な MoE
  • Apache 2.0
  • 視覚認識は 235B より劣る
  • Qwen2-VLよりファインチューニング済みモデルが少ない

インストール

ollama run qwen3-vl:30b

よくある質問

RTX 4090(24 GB)でよりよく動作するのは、Granite 4.0 H-Small 32B-A9BとQwen 3 VL 30B-A3Bのどちらですか?

RTX 4090 で Granite 4.0 H-Small 32B-A9B は Q5_K_M (~75トー/秒)、Qwen 3 VL 30B-A3B において Q5_K_M (約100 tok/s)。純粋なスループットでは、 Qwen 3 VL 30B-A3B が優位です。 構成ツール で、お使いのGPUの機種を指定して試してみてください。

VRAM消費が最も少ないのはどれか?

Q4では両者とも同じ量のVRAM(19 GB)を必要とします。その場合は、ライセンスや使ってみて感じる品質を基準に選びます。

これらのモデルは商用の本番環境で使用できますか?

Granite 4.0 H-Small 32B-A9B は Apache 2.0 ライセンスで公開されており、商用利用も自由です。 Qwen 3 VL 30B-A3B は Apache 2.0 ライセンスで公開されており、こちらも自由に利用できます。SaaS には Apache 2.0 または MIT を優先してください。

2026 年にどれを選ぶべきか?

主な制約条件によります。 より小さい / より高速 : Qwen 3 VL 30B-A3B (30B)。 より高性能 : Granite 4.0 H-Small 32B-A9B (32B)。迷っている場合は、以下のを実行してください 構成ツール お使いのGPUとユースケースに基づいて判断します。

検討すべき代替案

どちらもご希望に合わない場合は、検討できる類似モデルを以下に紹介します。

さらに詳しく