🇨🇳 Qwen 3.6 27B
デンス型27Bマルチモーダルモデル、2026年4月22日公開。262kコンテキスト(YaRNで1M)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
ランキング更新日:2026年9月22日
RAG に最も適した LLM のランキング:長いコンテキストウィンドウ(複数のドキュメントを処理するために 32k トークン以上)、提供されたソースに対する要約品質、プロンプト内の関連しない情報(「ディストラクター」)に対する頑健性。
デンス型27Bマルチモーダルモデル、2026年4月22日公開。262kコンテキスト(YaRNで1M)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
Qwen 3.8 27B:テキストと画像に対応するDenseマルチモーダルモデル、コンテキスト262k、Q4でVRAM約16 GB(Ollamaの重みは18 GB)。Apache 2.0、エージェント型コーディングと画像認識に対応。
ollama run qwen3.8:27b
エージェント型コーディングと推論を重視したCohereの30.5Bモデル。コンテキスト488k、Apache 2.0、Q4で約18 GBのVRAM。
ollama run north-mini-code-1.0
Gemma 4のMoE版。総パラメータ26B、アクティブパラメータ4B。テキスト・画像・音声に対応する完全なマルチモーダルモデル。
ollama run gemma4:26b
Dense型の31Bマルチモーダルモデル(テキスト+画像+音声)。140以上の言語、コンテキスト長256k。Chatbot Arenaのオープンモデル部門で3位。
ollama run gemma4:31b
GLM-4.7-Flash(MoE 31B、アクティブパラメータ約3B):30Bクラスでコード性能とVRAM使用量のバランスが最も優れています。MITライセンス、128kコンテキスト、3090/4090で非常に高速。
ollama run glm-4.7-flash
エージェント型コーディング向けのMoE。総パラメータ35B、アクティブ3B。SWE-Bench 73.4%。2026年4月16日リリース。
ollama run qwen3.6:35b-a3b
| 順位 | モデル | Params | VRAM Q4 | コンテキスト | ライセンス |
|---|---|---|---|---|---|
| #1 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #2 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #3 | North Mini Code 1.0 | 30.5B | 18 GB | 488 000 | Apache 2.0 |
| #4 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 |
| #5 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 |
| #6 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #7 | Qwen 3.6 35B-A3B | 35B | 21 GB | 262 000 | Apache 2.0 |
あなたのドキュメント、あなたのAI:あなたのPDF、メモ、メールを扱う信頼性の高いローカルRAG。何もクラウドに送信しません。
対象とするのは、コンテキストが少なくとも32kトークンあるチャット用・汎用モデルです(有用なチャンキングに必要な条件です)。スコアでは、比較的新しく、コンテキストウィンドウが大きく、制約の少ないライセンスを採用したモデルを高く評価します(企業での導入を考慮)。
考慮した基準:
スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。
良好なRAGに必要なコンテキストのサイズは?
約2kトークンのチャンク5〜10個とプロンプトを扱うには、最低32kトークンが必要です。理想は128kトークンです(Qwen 3.6 27Bは262,144トークンに対応)。これなら、ドキュメントを過度に細かく分割せずに、全体を処理できます。
24GB VRAM(RTX 4090)で RAG に適したモデルはどれですか?
Mistral Small 3.1 24B はQ4_K_Mで、または Qwen 2.5 32B Q4では24GBで収まります。Llama 3.3 70Bを実行するには、Q2またはQ3に切り替えるか、追加のGPUを設置する必要があります。
これらのLLMには、どの埋め込みモデルを組み合わせるべきですか?
フランス語対応については: BGE-M3, multilingual-e5-large, または埋め込み Mistral。詳細は フランス語向け埋め込みガイド.
ローカルRAG環境で推奨されるスタックは?
Ollama (LLMサーバー) + ChromaDB または Qdrant (vector store) + LlamaIndex または LangChain (オーケストレーション)。次をご覧ください: 完全ガイド.