ホーム › カタログ › 2026年、RAGに最適なローカルLLM

2026年、RAGに最適なローカルLLM

◆ RAG Local — ローカルAIに自分の文書について質問、クラウド不要 · 24 € · または全キットで49 € →

ランキング更新日:2026年9月22日

RAG に最も適した LLM のランキング:長いコンテキストウィンドウ(複数のドキュメントを処理するために 32k トークン以上)、提供されたソースに対する要約品質、プロンプト内の関連しない情報(「ディストラクター」)に対する頑健性。

ランキング

1

🇨🇳 Qwen 3.6 27B

Alibaba · 27B パラメータ · Apache 2.0 · 262 144 トークン ctx

デンス型27Bマルチモーダルモデル、2026年4月22日公開。262kコンテキスト(YaRNで1M)。SWE-bench Verified 77.2%。

このランクの理由 262,144トークンのコンテキストで、大規模なコーパスに非常に適しています。27Bパラメータにより、質の高い要約が可能です。
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB(Q8)
2

🇨🇳 Qwen 3.8 27B

Alibaba · 27B パラメータ · Apache 2.0 · 262 144 トークン ctx

Qwen 3.8 27B:テキストと画像に対応するDenseマルチモーダルモデル、コンテキスト262k、Q4でVRAM約16 GB(Ollamaの重みは18 GB)。Apache 2.0、エージェント型コーディングと画像認識に対応。

このランクの理由 262,144トークンのコンテキストで、大規模なコーパスに非常に適しています。27Bパラメータにより、質の高い要約が可能です。
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB(Q8)
3

🇺🇸 North Mini Code 1.0

Cohere · 30.5B パラメータ · Apache 2.0 · 488 000 tokens ctx

エージェント型コーディングと推論を重視したCohereの30.5Bモデル。コンテキスト488k、Apache 2.0、Q4で約18 GBのVRAM。

このランクの理由 488,000トークンのコンテキスト — 大規模なコーパスに非常に適しています。30.5Bパラメータにより、質の高い要約が可能です。
ollama run north-mini-code-1.0
VRAM Q4
18 GB
33GB(Q8)
4

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B パラメータ · Apache 2.0 · 128 000 トークン ctx

Gemma 4のMoE版。総パラメータ26B、アクティブパラメータ4B。テキスト・画像・音声に対応する完全なマルチモーダルモデル。

このランクの理由 128,000トークンのコンテキストで、大規模なコーパスに非常に適しています。26Bのパラメータにより、質の高い要約が可能です。
ollama run gemma4:26b
VRAM Q4
16 GB
Q8で28GB
5

🇺🇸 Gemma 4 31B

Google · 31B パラメータ · Apache 2.0 · 256,000 トークン ctx

Dense型の31Bマルチモーダルモデル(テキスト+画像+音声)。140以上の言語、コンテキスト長256k。Chatbot Arenaのオープンモデル部門で3位。

このランクの理由 256,000トークンのコンテキスト — 大規模なコーパスの処理に非常に適しています。31Bパラメータで質の高い要約が可能です。
ollama run gemma4:31b
VRAM Q4
18 GB
33GB(Q8)
6

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B パラメータ · MIT · 128 000 トークン ctx

GLM-4.7-Flash(MoE 31B、アクティブパラメータ約3B):30Bクラスでコード性能とVRAM使用量のバランスが最も優れています。MITライセンス、128kコンテキスト、3090/4090で非常に高速。

このランクの理由 128,000トークンのコンテキスト — 大規模なコーパスに優れた対応力を発揮します。310億パラメータにより、質の高い要約が可能です。
ollama run glm-4.7-flash
VRAM Q4
19 GB
35 GB(Q8)
7

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B パラメータ · Apache 2.0 · 262 000 トークン ctx

エージェント型コーディング向けのMoE。総パラメータ35B、アクティブ3B。SWE-Bench 73.4%。2026年4月16日リリース。

このランクの理由 262,000トークンのコンテキスト — 大規模なコーパスに最適です。350億パラメータで質の高い要約ができます。
ollama run qwen3.6:35b-a3b
VRAM Q4
21 GB
Q8で38GB

比較表

順位 モデル Params VRAM Q4 コンテキスト ライセンス
#1 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#2 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#3 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#4 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0
#5 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0
#6 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#7 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
ローカルRAGキット

あなたのドキュメント、あなたのAI:あなたのPDF、メモ、メールを扱う信頼性の高いローカルRAG。何もクラウドに送信しません。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

ランキングの方法論

対象とするのは、コンテキストが少なくとも32kトークンあるチャット用・汎用モデルです(有用なチャンキングに必要な条件です)。スコアでは、比較的新しく、コンテキストウィンドウが大きく、制約の少ないライセンスを採用したモデルを高く評価します(企業での導入を考慮)。

考慮した基準:

  • コンテキスト ≥ 32kトークン
  • 要約の品質
  • 紛らわしい情報への頑健性
  • 自由な利用を認めるライセンス

スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。

よくある質問

良好なRAGに必要なコンテキストのサイズは?

約2kトークンのチャンク5〜10個とプロンプトを扱うには、最低32kトークンが必要です。理想は128kトークンです(Qwen 3.6 27Bは262,144トークンに対応)。これなら、ドキュメントを過度に細かく分割せずに、全体を処理できます。

24GB VRAM(RTX 4090)で RAG に適したモデルはどれですか?

Mistral Small 3.1 24B はQ4_K_Mで、または Qwen 2.5 32B Q4では24GBで収まります。Llama 3.3 70Bを実行するには、Q2またはQ3に切り替えるか、追加のGPUを設置する必要があります。

これらのLLMには、どの埋め込みモデルを組み合わせるべきですか?

フランス語対応については: BGE-M3, multilingual-e5-large, または埋め込み Mistral。詳細は フランス語向け埋め込みガイド.

ローカルRAG環境で推奨されるスタックは?

Ollama (LLMサーバー) + ChromaDB または Qdrant (vector store) + LlamaIndex または LangChain (オーケストレーション)。次をご覧ください: 完全ガイド.

さらに詳しく

QuelLLM キット 用途別のリファレンスガイド
すべてのキットを生涯利用可能 — 49 €