ホーム › 比較ツール › ERNIE 4.5 21B-A3B Thinking vs Trinity Mini 26B-A3B

ERNIE 4.5 21B-A3B ThinkingvsTrinity Mini 26B-A3B

徹底比較: ERNIE 4.5 21B-A3B Thinking (21Bパラメータ、Baidu) および Trinity Mini 26B-A3B (26B, Arcee AI)。量子化方式別の必要VRAM容量、4種類の基準GPUで測定したトークン/秒、用途別の評価、ライセンス、インストールコマンド。すべての数値はカタログのデータから計算されており、ページ間でのコピー&ペーストは一切ありません。

要約

特徴 ERNIE 4.5 21B-A3B Thinking Trinity Mini 26B-A3B
パラメータ 21B 26B
ファミリー ERNIE Trinity
著者 Baidu Arcee AI
開発国 CN US
ライセンス Apache 2.0 Apache 2.0
コンテキスト 131,072トークン 131,072トークン
公開日 2025年4月 2025年3月

メモリフットプリント

平均的なコンテキストウィンドウでの推論に必要なVRAMの概算値です。勝者(緑色)は消費量が 少なく、小規模モデルに有利です。

量子化 ERNIE 4.5 21B-A3B Thinking Trinity Mini 26B-A3B
Q4_K_M(軽量) 13 GB 15 GB
Q5_K_M(バランス型) 16 GB 18 GB
Q8(ほぼ無損失) 23 GB 28 GB
FP16(最高品質) 42 GB 52GB
CPUのみで実行する場合のRAM 18 GB 24 GB

推定速度(トークン/秒)

各GPUで実行可能な最適な量子化に基づく推定値です。実際の数値はプロンプト、コンテキスト、エンジン(llama.cpp、vLLM、MLX)によって異なります。 方法論.

基準となるGPU ERNIE 4.5 21B-A3B Thinking Trinity Mini 26B-A3B
RTX 4090 (24 GB) 100トークン/秒 · Q8 100 tok/s · Q5_K_M
RTX 4080 (16 GB) 40 tok/s · Q5_K_M 40 tok/s · Q4_K_M
RTX 3060 12GB (12 GB) ✗ 重すぎる ✗ 重すぎる
Apple M4 Pro (48 GB) (36 GB) 40 tok/s · Q8 40 tok/s · Q8

ユースケース別評価

一般的な用途ごとに、タグ、サイズ、専門性に基づいてどちらが最も適しているかを示します。

一般チャット
Trinity Mini 26B-A3B が優位です この用途では、能力と制約のバランスが最も良い。
推論 / 数学
ERNIE 4.5 21B-A3B Thinking が優れています 推論過程を明示するモデル(chain-of-thought)で、数学・論理の問題でより優れています。
RAG / 長い文書
Trinity Mini 26B-A3B が優位です コンテキストウィンドウがより大きく(131,072トークン)、長い文書に適しています。
エージェント & ツール使用
接戦 — 具体的な条件によって変わります。 この基準では両者同等です。VRAMやライセンスの制約に応じて判断してください。
ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

強みと弱み

Baidu · 21B

ERNIE 4.5 21B-A3B Thinking

総パラメータ数21B、アクティブパラメータ数3BのコンパクトなMoE推論モデル。Apache 2.0。アクティブパラメータが3Bのため高速。

  • 13 GB VRAM Q4
  • コンパクトなMoEによる推論
  • 中国語に強い
  • Qwenより多言語対応が弱い
  • Baiduのライセンスは要確認

インストール

ollama pull hf.co/baidu/ernie-4.5-21b-GGUF
Arcee AI · 26B

Trinity Mini 26B-A3B

米国の研究所が開発したMoEモデル。総パラメータ数260億、アクティブパラメータ数30億。アクティブパラメータ数が30億のため高速。Apache 2.0。

  • 効率的なMoE(アクティブパラメータ数3.5B)
  • 131k コンテキスト
  • エージェント用途が得意
  • Apache 2.0
  • 公開ベンチマークが少ない
  • Mistral/Qwenより知名度が低い

インストール

ollama pull hf.co/arcee-ai/Trinity-Mini-26B-GGUF

よくある質問

RTX 4090(24 GB)でより快適に動作するのは、ERNIE 4.5 21B-A3B ThinkingとTrinity Mini 26B-A3Bのどちらですか?

RTX 4090上で ERNIE 4.5 21B-A3B Thinking は、 Q8 (~100 tok/s)、Trinity Mini 26B-A3B では Q5_K_M (約100 tok/s)。純粋なスループットでは、 Trinity Mini 26B-A3B が優位です。 構成ツール で、お使いのGPUの機種を指定して試してみてください。

VRAM消費が最も少ないのはどれか?

Q4_K_M の場合、 ERNIE 4.5 21B-A3B Thinking 収まる容量 13 GB に対して 15 GB が競合製品には必要です — 2 GB の差です。RTX 3060 や 4060 Ti 8 GB を目指すなら有意な差です。

これらのモデルは商用の本番環境で使用できますか?

ERNIE 4.5 21B-A3B Thinking は Apache 2.0 ライセンスで公開されており、商用利用も自由です。 Trinity Mini 26B-A3B は Apache 2.0 ライセンスで公開されており、こちらも自由に利用できます。SaaS には Apache 2.0 または MIT を優先してください。

2026 年にどれを選ぶべきか?

主な制約条件によります。 より小さい / より高速 : ERNIE 4.5 21B-A3B Thinking (21B)。 より高性能 : Trinity Mini 26B-A3B (26B)。迷っている場合は、実行してください 構成ツール お使いのGPUとユースケースに基づいて判断します。

検討すべき代替案

どちらもご希望に合わない場合は、検討できる類似モデルを以下に紹介します。

さらに詳しく