AIエージェントとは?定義・例・限界
AIエージェントとは、チャットボットのように一度回答して終わるのではなく、与えられた目標を達成するためにどのツールを呼び出すかを、一段階ずつ自ら決める言語モデルです。各アクションの結果を確認し、タスクを完了するか断念するまで、このプロセスを繰り返します。
AIエージェントとは、言語モデルが目標を達成するために取るべき行動を自ら決めるプログラムです。ツールを選び、結果を観察し、完了するまでこの処理を繰り返します。この点が、応答したらそこで止まるチャットボットとの違いです。「エージェント型AI」という用語は、こうしたシステムの構築方法を指します。2026年9月20日現在、最も役立つエージェントは、コードを書くものと調査を行うものです。このページでは、明確な定義、実際の例、限界、そして自分のマシンでエージェントを動かすために必要なものを紹介します。
#AI エージェントとは何ですか?
最も実用的な定義は一言で言い表せます。エージェントとは、ループの中でツールを使用する言語モデルです。目的を与えます。例えば「このテストが失敗する理由を見つけ、修正してください」といった具合です。モデルはコードを読み、テストを実行し、エラーを読み、ファイルを修正し、テストを再実行し、テストが成功するか、諦めるまで続けます。このシーケンスを事前に誰かが書いたわけではありません。モデルは、観察した内容に基づいて、ステップごとにそれを決定します。
「エージェント」という言葉は、広まりすぎたために意味が曖昧になっています。「エージェント」として売られている製品の多くは、名前を付けただけのチャットボットや、スクリプト内の決まった段階でモデルが文章を書く従来型の自動化にすぎません。見分けるための決定的な問いは、次のステップを誰が決めるのか、ということです。呼び出しの順序が固定された、あらかじめ書かれたプログラムが決めるのであれば、一連の処理のどこかに言語モデルが関わっていても、それはエージェントではありません。
#チャットボット、ワークフロー、エージェント:違い
あなたのマシンで動作するエージェント:エージェント型 Cline、MCP、n8n + Ollama、ローカル自動化。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
| Chatbot | AIを活用したワークフロー | エージェント | |
|---|---|---|---|
| ステップの決定権は誰が持つか | 人:一つの質問に一つの回答 | 開発者は事前に | モデルは進行中です |
| ツール | なし、またはウェブ検索 | はい、固定順序で | はい、自由に選択してください |
| 予測可能性 | 高い | 高い | より低い |
| タスクあたりのコスト | モデルへの呼び出し | 数回の呼び出し | 数十回の呼び出し、場合によってはそれ以上 |
| 適切な使用 | 質問、文章の作成 | 明確に定義された繰り返しタスク | 解決までの手順が分からない、自由度の高いタスク |
この区別は、Anthropicが設計ガイドで示しているものです。「ワークフローは、事前に定義されたコードの処理経路に沿ってLLMとツールを連携させるシステム」である一方、「エージェントは、LLMが自らの処理とツールの使用を動的に指揮し、タスクの遂行方法を自ら管理するシステム」です。ここから導かれる助言は、誰にでも当てはまります。できる限りシンプルな解決策を見つけ、必要な場合にだけ複雑さを増すことです。適切に設計されたワークフローは、企業のニーズの大半でエージェントを上回ります。挙動が予測可能で、コストも低いためです。
#エージェントの 4 つの構成要素
- 1つのモデル
- 頭脳に当たる部分です。複数の段階にわたって推論し、正しい形式のツール呼び出しを生成できる必要があります。他のすべての要素の限界を決める部分です。
- ツール
- モデルが呼び出すことができる機能:ファイルの読み書き、コマンドの実行、ウェブ検索、データベースの問い合わせ。MCPプロトコルは、これらの機能を接続する標準的な方法となっています。
- ループ
- コンテキストをモデルに送り、要求されたツールを実行し、結果をコンテキストに追加して、この流れを繰り返すプログラムです。このループは、ステップ数の上限、確認手順、予算といった安全策も設定します。
- メモリ
- 短期的な記憶はコンテキストウィンドウです。各ステップで埋まっていき、長いタスクでは最終的に上限に達します。長期的な記憶は、メモファイル、過去のステップを圧縮した要約、またはエージェントがセッションをまたいで読み返すデータベースです。新しい会話のたびにゼロからやり直さずに済むようにします。
#ループの仕組み:ReAct
本番環境で使われるエージェントの大半は、その名前を明示しないまま、2022年にGoogleとプリンストン大学の研究者がReAct(「Reasoning and Acting」)という名称で説明した仕組みに従っています。モデルは各ターンで明示的な推論(Thought)を生成し、通常はツール呼び出しにあたる行動(Action)を選び、その結果(Observation)を受け取ってから、同じ流れを繰り返します。行動の前に推論を言語化させると、エージェントのデバッグが容易になります。何をしたかだけでなく、なぜそのツールを選んだかも分かるからです。
#実際に機能する例
- コーディングエージェント
- 最も成熟した事例です。Claude Code、Cline、OpenCode、Aiderなどはリポジトリを読み、複数のファイルを変更し、テストを実行して自分の誤りを修正します。この分野はこうした用途に適しています。テストに合格するかどうかで、結果を自動的に検証できるからです。
- 調査エージェント
- 数十回の検索を行い、ページを読み、複数の情報源を照合して、内容をまとめます。引用を確認することを条件に、継続的な情報収集や、その分野の最新の知見を整理するのに役立ちます。
- 運用エージェント
- これらのエージェントはログを監視し、インシデントを診断して、修正を提案または適用します。本番環境では、ほぼ常に、何らかの操作を行う前に人間の承認を受けます。
- デスクトップ操作エージェント
- マウスとキーボードを使ってブラウザやコンピュータを操作します。驚くべきデモンストレーションはありますが、監視なしでの使用には信頼性がまだ不十分です
うまくいくこれらのケースに共通するのは、客観的で、すぐに確認できる成功基準があることです。テストの合否、ファイルの形式が正しいこと、インシデントが解決したかどうかなどです。一方、成功が曖昧な人間の判断に依存する場合、たとえば「説得力のあるマーケティング戦略を書いて」といった依頼では、エージェントのループがもたらす利点は、モデルと単純に一往復やり取りする場合と比べてわずかです。各ステップの間に、次のステップの方向を決めるために客観的に観察できるものがないからです。
#エージェントが失敗する理由
第一の理由は算術的なものです。ループ内では、エラーは相殺されるのではなく乗算的に増幅されます。各ステップを個別に見たときに95%の信頼性を持つモデルでも、十ステップのタスクを正しく完了するのは60%のケースに留まり、二十ステップのタスクではわずか36%のケースしか正しく完了しません。個別のステップが明確に不良であるわけではないにもかかわらずです。
| 各ステップの信頼性 | 5ステップ | 10ステップ | 20ステップ |
|---|---|---|---|
| 90 % | 59 % | 35 % | 12 % |
| 95 % | 77 % | 60 % | 36 % |
| 99 % | 95 % | 90 % | 82 % |
そのため、エージェントは、例えばテストを再実行するなどして自分で結果を検証できる場面では成功しますが、それ以外の場面では期待に応えられません。他の限界もここから生じます。タスクごとに数十回の呼び出しが必要となり、コンテキストも膨らむため、コストがかかります。外部のコンテンツを読むエージェントは、その内容によって操作される可能性があるため、セキュリティ上の問題もあります。また、目標を誤解したまま熱心に追求すると、方向性がずれていきます。
METR評価ラボは、この進歩を「タイムホライズン」という指標で測定しています。これは、現在の最上位モデルが50%の成功率で完了できる人間のタスクの所要時間です。METRによると、この所要時間は2019年以降、約7ヶ月で倍増する指数関数的な傾向を示しており、2023年以降は約4ヶ月強で倍増する加速が観測されています。具体的には、1年前に1時間のタスクで失敗していたエージェントは、今日では成功する可能性が高いです。限界は移動するだけで、消えるわけではありません。
#ローカルで動作する AI エージェント:必要なもの
エージェントがクラウドを利用する必要はありません。処理ループとツールはすでにお使いのマシン上で動作しているので、あとはそれらを制御するモデルも同じマシン上で動かすだけです。より小さく、より遅いモデルでも済む単純なチャットと比べると、三つの要件がより厳しくなります。
| 要件 | なぜ | 実用的な目安 |
|---|---|---|
| ツールを呼び出せるように学習されたモデル | これがないと、呼び出しは不正になり、ループが破綻します | パラメータ数140億以上のモデルを目安にしてください:Qwen 3 14B(9 GB)、gpt-oss 20B(13 GB)、Qwen3-Coder 30B-A3B(19 GB) |
| 大容量のコンテキスト | 各ステップでツールの結果が会話に追加されます | 最低32,000トークン。重みのメモリ使用量に加えて、KVキャッシュに4〜8GBが必要 |
| 速度 | 1つのタスクで数十回の往復のやり取りが発生します | 1秒あたり30トークン以上;MoEモデルは有利です |
実際には、16 GBのGPUなら短いタスクで役立つエージェントを動かせ、24 GBなら余裕を持って使えます。それ未満では、エージェントはデモとしては動作しても、日常的な利用では期待外れになります。
しばしば見落とされる点として、ローカルエージェントのコストはモデルの重みのVRAMに限りません。接続された各ツールは、各ターンでその説明をプロンプトに追加し、この説明もまたKVキャッシュ、つまりVRAMを消費します。これはループの全期間にわたって続きます。140億パラメータのモデルと、適切に記述された六つのツールを使用する場合、会話コンテキストの前に、ツール定義だけで数百MBのKVキャッシュを消費すると考えましょう。
- ランキング:エージェント向けのおすすめローカルLLM
- ローカルAIエージェントの作成:アーキテクチャと推奨ツール
- チュートリアル:LangChain と Ollama を使用したPythonによるローカルエージェント
#どこから始めればよいですか
- 01自分でエージェントを作る前に、既存のエージェントを使ってくださいエディタやターミナル内のコードエージェントは、これらのシステムが何ができるのか、どこでつまずくのかを 1 週間で教えてくれます。
- 02検証可能なタスクを選択ご自身が判定しなくても成否を測れるタスクです。たとえば、テストに合格する、正しい形式のファイルが生成される、合計が正しく算出される、といったものです。
- 03ツールの数を絞ってください三つのよく説明されたツールは、三十個のツールよりも優れています。追加されるそれぞれのツールは、誤った選択のリスクを高め、コンテキストを重くします。
- 04取り消せない操作は自分で管理してください読み取りは自由に、書き込みは承認を得てから行います。メール送信、ファイル削除、支払い、公開は、エージェントが表示する確信度にかかわらず、必ず実行前に人間の明示的な承認を得てください。
#FAQ
AIエージェントとChatGPTの違いは何ですか?+
エージェント型AIとは何ですか?+
AI エージェントはインターネットなしで動作できますか?+
AIエージェントは人間の仕事を代替するのでしょうか?+
エージェントを作るには、プログラミングができる必要がありますか?+
AIエージェントにおけるReActパターンとは何ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。