ホーム › カタログ › エージェント/ツール使用に最適なローカルLLM(2026年)

エージェント/ツール使用に最適なローカルLLM(2026年)

◆ ローカルエージェント — あなたのマシン上で動作するエージェント(クラウド不要)· 24 € · またはすべてのキット 49 € →

ランキング更新日:2026年9月22日

ローカルで自律的なエージェントを構築するための最も信頼性の高いLLMのランキング:関数呼び出しの精度、マルチターンの堅牢性、JSONスキーマの理解、アクションプランを維持するための十分なコンテキスト。

ランキング

1

🇨🇳 Qwen 3.6 27B

Alibaba · 27B パラメータ · Apache 2.0 · 262 144 トークン ctx

デンス型27Bマルチモーダルモデル、2026年4月22日公開。262kコンテキスト(YaRNで1M)。SWE-bench Verified 77.2%。

このランクの理由 信頼性のある関数呼び出し、262,144トークンのコンテキストでアクション履歴を保持。推論機能も付帯しています。
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB(Q8)
2

🇨🇳 Qwen 3.8 27B

Alibaba · 27B パラメータ · Apache 2.0 · 262 144 トークン ctx

Qwen 3.8 27B:テキストと画像に対応するDenseマルチモーダルモデル、コンテキスト262k、Q4でVRAM約16 GB(Ollamaの重みは18 GB)。Apache 2.0、エージェント型コーディングと画像認識に対応。

このランクの理由 信頼性のある関数呼び出し、262,144トークンのコンテキストでアクション履歴を保持。推論機能も付帯しています。
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB(Q8)
3

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B パラメータ · MIT · 128 000 トークン ctx

GLM-4.7-Flash(MoE 31B、アクティブパラメータ約3B):30Bクラスでコード性能とVRAM使用量のバランスが最も優れています。MITライセンス、128kコンテキスト、3090/4090で非常に高速。

このランクの理由 信頼性の高い関数呼び出しと、アクション履歴を保持するための128,000トークンのコンテキスト。さらに、推論能力も備えています。
ollama run glm-4.7-flash
VRAM Q4
19 GB
35 GB(Q8)
4

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B パラメータ · NVIDIA Open Model License · 128 000 トークン ctx

MoE 30B(アクティブパラメータ3B):thinkingモード + instruct。IMO 2025とIOI 2025で金メダル。アクティブパラメータが3Bのため推論が高速で、30Bレベルの推論能力を備えます。2026年4月リリース。

このランクの理由 信頼性の高い関数呼び出しと、アクション履歴を保持するための128,000トークンのコンテキスト。さらに、推論能力も備えています。
ollama run nemotron-cascade-2
VRAM Q4
17 GB
Q8 で32GB
5

🇺🇸 North Mini Code 1.0

Cohere · 30.5B パラメータ · Apache 2.0 · 488 000 tokens ctx

エージェント型コーディングと推論を重視したCohereの30.5Bモデル。コンテキスト488k、Apache 2.0、Q4で約18 GBのVRAM。

このランクの理由 信頼性の高い関数呼び出し。アクション履歴を保持できる488,000トークンのコンテキスト。推論能力も備えています。
ollama run north-mini-code-1.0
VRAM Q4
18 GB
33GB(Q8)
6

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B パラメータ · Apache 2.0 · 262 000 トークン ctx

エージェント型コーディング向けのMoE。総パラメータ35B、アクティブ3B。SWE-Bench 73.4%。2026年4月16日リリース。

このランクの理由 信頼性の高い関数呼び出しと、アクション履歴を保持するための262,000トークンのコンテキスト。さらに、推論能力も備えています。
ollama run qwen3.6:35b-a3b
VRAM Q4
21 GB
Q8で38GB
7

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B パラメータ · Apache 2.0 · 131 072 トークン ctx

MoE、総パラメータ数 30B/アクティブパラメータ数 3B、ハイブリッド思考。MMLU 81.4、AIME24 80.4。100以上の言語に対応。

このランクの理由 信頼性の高い関数呼び出しと、アクション履歴を保持できる131,072トークンのコンテキスト。さらに、推論能力も備えています。
ollama run qwen3:30b-a3b
VRAM Q4
19 GB
35 GB(Q8)

比較表

順位 モデル Params VRAM Q4 コンテキスト ライセンス
#1 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#2 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#3 GLM 4.7 Flash 31B 19 GB 128 000 MIT
#4 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License
#5 North Mini Code 1.0 30.5B 18 GB 488 000 Apache 2.0
#6 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0
#7 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0
ローカルエージェントキット

あなたのマシンで動作するエージェント:エージェント型 Cline、MCP、n8n + Ollama、ローカル自動化。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

ランキングの方法論

7B以上で、コンテキストが32k以上(アクション履歴を保持するため)、かつchatまたはreasoningタグが付いたモデルを優先します。スコアは、最近のモデルと中規模から大規模のモデル(function callingの信頼性が高まる規模)が有利になるように付けられます。

考慮した基準:

  • 正確な関数呼び出し
  • コンテキスト ≥ 32kトークン
  • マルチターンの信頼性
  • JSON形式に準拠

スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。

よくある質問

ローカルで動作する自律型エージェントには、どのLLMが適していますか?

Qwen 3.6 27B が当サイトの第1位です。Mistral Small 3.1は、ツール使用時の信頼性と低レイテンシで特に高く評価されています。これらは、1つのタスクで20回以上の呼び出しを行うエージェントにとって極めて重要です。

Ollama は function calling をサポートしていますか?

はい、バージョン0.3.0以降では、次のパラメータを使うことで可能です: tools。LM StudioとvLLMも対応しています。モデルがツール利用向けに学習されていることを確認してください(最近のMistral、Qwen、Llamaは対応しています)。

ローカルエージェントを構築するには、どのフレームワークを使えばよいですか?

LangGraph, CrewAI, AutoGen, Smolagents — いずれもOpenAI互換のエンドポイント経由で、ローカルのOllamaを接続先として指定できます(http://localhost:11434/v1).

reasoning とエージェントの違いは?

推論モデル(DeepSeek R1、QwQ)は、回答する前に思考の連鎖を展開します。エージェントモデル(Mistral Small、Qwen)は外部ツールを選択して呼び出します。両者は組み合わせることができます。推論で計画を立て、エージェントで実行します。

さらに詳しく

QuelLLM キット 用途別のリファレンスガイド
すべてのキットを生涯利用可能 — 49 €