Cline + Ollama : VS内での100%ローカルコードエージェント コード
Cline は VS Code を自律的なコードエージェントに変換します。ファイルを読み取り、差分を提案し、コマンドを実行し、タスクが完了するまで繰り返します。Ollama に接続することで、すべての処理があなたのマシン上で行われ、第三者サーバーにトークンが送信されることはありません。このガイドでは、Cline と Ollama を完全に機能させるセットアップを構築し、VRAM に応じてどのモデルを選ぶべきか、コンテキストの悪影響を回避するための Ollama の設定、そして使いやすいエージェントと無駄に回るエージェントを区別するための設定について説明します。
#ローカルでClineエージェントを使用する理由
Cline(旧称 Claude Dev)は、LLM をエージェントのループで動かす VS Code 拡張機能です。計画を立て、複数のファイルを編集し、ターミナルでコマンドを実行し、出力を読み取って修正します。単なるインライン補完とは異なり、関数の作成、モジュールの移行、スタックトレースのデバッグといったタスク全体を引き受けて実行します。
クラウドAPIではなくOllamaと組み合わせることで、具体的な利点が3つあります。プロプライエタリコードがワークステーションから外に出ないこと、トークン単位の費用が発生しないこと(Clineはコンテキストを大量に消費するため、クラウドではコストが急速に高くなります)、そしてエージェントがオフラインで動作することです。代償として、優れたローカルコードモデルにはVRAMが必要であり、Ollamaのデフォルト設定はエージェント用途には適していません。
#前提条件
このガイドでモデルの導入まで、キットでエディタ内でコードを書くコパイロットの導入まで進められます。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
- VS Code
- 比較的新しいバージョン(1.90以降)。ClineはOpen VSX互換のフォーク(VSCodium、Cursor)でも動作しますが、このガイドは標準のVS Codeを対象としています。
- Ollama インストール済み
- デーモンが起動し、http://localhost:11434 で接続を待ち受けている必要があります。まだこの状態になっていない場合は、当サイトの Ollama インストールガイドを参照してください。
- 十分な VRAM を備えた GPU
- エージェントを快適に動作させるには最低16 GB、上位クラスには24 GBが必要です。CPUだけでも実行できますが、エージェントの処理ループには遅すぎます。
- VS Codeで開いたプロジェクト
- Clineは現在のワークスペースのフォルダ内で動作します。単独のファイルではなく、実際のリポジトリを開いてください。
#VRAMに基づいてモデルを選択
モデルの選択が最も重要です。Clineエージェントはツール呼び出し、ファイル読み取り、差分の処理を連続して行うため、指示に従い、ツールの形式を遵守するモデルが必要です。2026年の大多数のカードをカバーする3つのプロファイルがあります。
- 24 GB(RTX 4090、3090、RX 7900 XTX)— Qwen3-Coder 32B
- 現在最も優れたローカルエージェントです。Q4_K_Mでは約19GBを使用し、32kのコンテキストを扱うための余裕が残ります。GPUに収まるなら、目指すべきモデルです。
- 16 GB (RTX 4080、5070 Ti、4060 Ti 16GB) — Devstral Small 2
- コードエージェントに特化したMistralのモデルで、Q4_K_Mなら実用的なコンテキストを確保しつつ16 GBに収まるよう設計されています。このクラスのグラフィックカードでは、最もバランスのよい選択肢です。
- 堅実な汎用モデル — Qwen 3.6 27B
- コードとそれ以外の用途に1つのモデルを使いたい場合、27BのバリアントはQ4形式で24 GBに収まり、エージェントとして非常に優れた性能を発揮します。純粋なコード処理ではQwen3-Coderより一歩劣りますが、汎用性では優れています。
エージェント用途では14B未満のモデルを避けてください。ツール呼び出しの形式を崩したり、ループしたり、適用できない差分(diff)を提示したりするためです。小型で高速なモデルは、TabbyやContinueを使ったインライン補完には優れていますが、Clineを動かす用途には向いていません。
#1. Ollamaの準備
まずOllamaが動作していることを確認し、次に選んだモデルをダウンロードしてください。ここではQwen3-Coder 32Bを例にしています。タグは、お使いのVRAM容量に合うものに置き換えてください。
#2. Ollamaのコンテキストを設定
ここは誰もがつまずくステップです。デフォルトでは、Ollamaは4096トークンのコンテキストウィンドウでモデルを実行します。しかし、Clineは複数のファイルの内容、タスクの履歴、ツールの定義を送信します。4kでは、エージェントが毎ターン自分のタスクの冒頭を忘れてしまい、使い物にならなくなります。
num_ctxを引き上げる必要があります。適切な方法は、Modelfileを使って派生モデルを作成し、設定を永続化してClineに依存しないようにすることです。
#3. Clineのインストール
- 01マーケットプレイスを開くVS Codeで、拡張機能パネル(Ctrl+Shift+X)を開いてください。
- 02Clineを検索する検索バーに「Cline」と入力してください。公式拡張機能の発行元は「Cline Bot Inc.」です。模倣版を避けるため、発行元を確認してください。
- 03インストールおよびピン留め「インストール」をクリックしてください。サイドバーのアクティビティバーにClineのアイコンが表示されます。すぐにアクセスできるように、ピン留めしてください。
#4. ClineをOllamaに接続する
ClineはOllamaに標準で対応しているため、OpenAI互換APIのURLを手作業で設定する必要はありません。Clineパネルを開き、設定アイコンをクリックして、プロバイダーを設定してください。
- 01API Provider → OllamaAPI Provider のドロップダウンリストから「Ollama」を選択してください。
- 02Base URLデフォルト値のhttp://localhost:11434を維持してください。他のマシンまたはコンテナ上でOllamaが動作している場合にのみ変更してください。
- 03Modelqwen3-coder-agent(ステップ2で作成した派生モデル)を選択してください。コンテキストが4kの、変更を加えていない元のモデルは選択しないでください。
- 04コンテキストウィンドウの確認Clineには「Context Window」という入力欄があります。Modelfileのnum_ctx(32768)と値を揃えてください。ここにずれがあると、Ollamaに渡される前に、Cline側でプロンプトが切り詰められます。
#5. エージェントモードでの最初の実行
実際のプロジェクトを開き、Clineに具体的で範囲を限定したタスクを与えてください。最初に試すなら、変更するファイルが少ないタスクが適しています。たとえば、テストを追加する、特定済みのバグを修正する、小さなユーティリティ関数を書く、といったタスクです。
Clineはフォルダーを読み取り、差分を提案し、編集とコマンドの一つひとつについて承認を求めます。初回は動作を理解するために、一つずつ承認してください。安心して使えるようになったら、設定で一部の操作(ファイルの読み取り、非破壊的なコマンド)の自動承認を有効にできます。
#よくある落とし穴
- エージェントがタスクを忘れる
- ほぼ必ずコンテキストの問題です。Ollama 側の num_ctx が低すぎるか、Cline 側の「Context Window」が適切に設定されていません。両方の値を合わせ直してください。
- 差分は適用されません
- モデルが小さすぎるか、量子化が強すぎるため、編集フォーマットを守れません。モデルを一段階大きくする(14B → 27B/32B)か、Q3 から Q4_K_M に変更してください。
- 推論がCPUに切り替わります
- モデルとコンテキストに必要なメモリがVRAM容量を超えています。`ollama ps`で確認し、num_ctxを減らすか、より小さいモデルを選んでください。一部がCPUで動作するエージェントは、実用になりません。
- ツールの無限ループ
- 一部のモデルは同じコマンドを繰り返し実行します。まずPlan Modeに切り替え、タスクをより小さなサブタスクに分割してください。
- 接続が拒否されました
- Ollamaが接続を待ち受けていないか、想定したURLで待ち受けていません。`curl http://localhost:11434/api/version` を実行して確認してください。コンテナで動かしている場合はポートを公開し、Clineの接続先を正しいアドレスに設定してください。
#さらに詳しく
これで、何も外部に公開せずにコードを編集する、100%ローカルのClineエージェントが使えるようになりました。次のステップとして自然なのは、モデル選びをさらに詰めることと、Clineにはないインライン自動補完を追加することの2つです。
- 2026年のコーディングに最適なローカルLLM
- Devstral、Qwen3-Coderとその代替モデルを、VRAMとコード品質も含めて比較し、Clineに接続するモデルの選択を絞り込むための比較記事です。
- CursorによるContinue.devの買収:Clineへ移行する
- Continue.devから移行する場合は、設定のエクスポートと、この同じ構成への移行に特化したガイドをご参照ください。
- 量子化の選択(Q4、Q5、Q8、FP16)
- 品質とVRAMのトレードオフを理解し、グラフィックカードに収まる範囲で最大のモデルを使えるようにする。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。