中級 14 分エージェント

Cline + Ollama : VS内での100%ローカルコードエージェント コード

Cline は VS Code を自律的なコードエージェントに変換します。ファイルを読み取り、差分を提案し、コマンドを実行し、タスクが完了するまで繰り返します。Ollama に接続することで、すべての処理があなたのマシン上で行われ、第三者サーバーにトークンが送信されることはありません。このガイドでは、Cline と Ollama を完全に機能させるセットアップを構築し、VRAM に応じてどのモデルを選ぶべきか、コンテキストの悪影響を回避するための Ollama の設定、そして使いやすいエージェントと無駄に回るエージェントを区別するための設定について説明します。

著者 Mohamed Meguedmi·更新 2026-08-27·Windows・macOS・Linuxでテスト済み

#ローカルでClineエージェントを使用する理由

Cline(旧称 Claude Dev)は、LLM をエージェントのループで動かす VS Code 拡張機能です。計画を立て、複数のファイルを編集し、ターミナルでコマンドを実行し、出力を読み取って修正します。単なるインライン補完とは異なり、関数の作成、モジュールの移行、スタックトレースのデバッグといったタスク全体を引き受けて実行します。

クラウドAPIではなくOllamaと組み合わせることで、具体的な利点が3つあります。プロプライエタリコードがワークステーションから外に出ないこと、トークン単位の費用が発生しないこと(Clineはコンテキストを大量に消費するため、クラウドではコストが急速に高くなります)、そしてエージェントがオフラインで動作することです。代償として、優れたローカルコードモデルにはVRAMが必要であり、Ollamaのデフォルト設定はエージェント用途には適していません。

i
このガイドは移行ガイドではありません。
Continue.devからの移行を考えていて、既存の設定を引き継ぎたい場合は、当サイトの専用ガイド「Continue.devがCursorに買収:Clineへ移行する」をご覧ください。データのエクスポートと設定の対応付けを解説しています。ここでは、Cline + Ollamaの環境をゼロからきちんと構築します。

#前提条件

ローカルコパイロットキット

このガイドでモデルの導入まで、キットでエディタ内でコードを書くコパイロットの導入まで進められます。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応
VS Code
比較的新しいバージョン(1.90以降)。ClineはOpen VSX互換のフォーク(VSCodium、Cursor)でも動作しますが、このガイドは標準のVS Codeを対象としています。
Ollama インストール済み
デーモンが起動し、http://localhost:11434 で接続を待ち受けている必要があります。まだこの状態になっていない場合は、当サイトの Ollama インストールガイドを参照してください。
十分な VRAM を備えた GPU
エージェントを快適に動作させるには最低16 GB、上位クラスには24 GBが必要です。CPUだけでも実行できますが、エージェントの処理ループには遅すぎます。
VS Codeで開いたプロジェクト
Clineは現在のワークスペースのフォルダ内で動作します。単独のファイルではなく、実際のリポジトリを開いてください。

#VRAMに基づいてモデルを選択

モデルの選択が最も重要です。Clineエージェントはツール呼び出し、ファイル読み取り、差分の処理を連続して行うため、指示に従い、ツールの形式を遵守するモデルが必要です。2026年の大多数のカードをカバーする3つのプロファイルがあります。

24 GB(RTX 4090、3090、RX 7900 XTX)— Qwen3-Coder 32B
現在最も優れたローカルエージェントです。Q4_K_Mでは約19GBを使用し、32kのコンテキストを扱うための余裕が残ります。GPUに収まるなら、目指すべきモデルです。
16 GB (RTX 4080、5070 Ti、4060 Ti 16GB) — Devstral Small 2
コードエージェントに特化したMistralのモデルで、Q4_K_Mなら実用的なコンテキストを確保しつつ16 GBに収まるよう設計されています。このクラスのグラフィックカードでは、最もバランスのよい選択肢です。
堅実な汎用モデル — Qwen 3.6 27B
コードとそれ以外の用途に1つのモデルを使いたい場合、27BのバリアントはQ4形式で24 GBに収まり、エージェントとして非常に優れた性能を発揮します。純粋なコード処理ではQwen3-Coderより一歩劣りますが、汎用性では優れています。
→
Q4でのVRAM使用量の目安
Q4_K_M量子化(推奨されるデフォルト設定)では、14Bは約9 GB、27Bは約16~17 GB、32Bは約19 GBです。これにコンテキスト用のVRAM容量も加えてください。コンテキストウィンドウが大きいほど、KVキャッシュも大きくなります。常に2~3 GBの余裕を確保してください。

エージェント用途では14B未満のモデルを避けてください。ツール呼び出しの形式を崩したり、ループしたり、適用できない差分(diff)を提示したりするためです。小型で高速なモデルは、TabbyやContinueを使ったインライン補完には優れていますが、Clineを動かす用途には向いていません。

#1. Ollamaの準備

まずOllamaが動作していることを確認し、次に選んだモデルをダウンロードしてください。ここではQwen3-Coder 32Bを例にしています。タグは、お使いのVRAM容量に合うものに置き換えてください。

ターミナル
# Vérifier que le daemon répond
curl http://localhost:11434/api/version

# Tirer le modèle de code (adapter au tag exact affiché sur ollama.com)
ollama pull qwen3-coder:32b

# Alternatives selon la VRAM
ollama pull devstral-small-2   # 16 Go
ollama pull qwen3.6:27b        # généraliste 24 Go

# Lister ce qui est installé
ollama list
!
正確なタグを確認してください
Ollamaのタグ名は変わります(量子化の接尾辞やバージョンなど)。タグを推測せず、ollama.comにあるモデルの公式ページからコピーしてください。存在しないタグを指定すると、表面化しないpullエラーが返されます。

#2. Ollamaのコンテキストを設定

ここは誰もがつまずくステップです。デフォルトでは、Ollamaは4096トークンのコンテキストウィンドウでモデルを実行します。しかし、Clineは複数のファイルの内容、タスクの履歴、ツールの定義を送信します。4kでは、エージェントが毎ターン自分のタスクの冒頭を忘れてしまい、使い物にならなくなります。

num_ctxを引き上げる必要があります。適切な方法は、Modelfileを使って派生モデルを作成し、設定を永続化してClineに依存しないようにすることです。

Modelfile
# Fichier : Modelfile
FROM qwen3-coder:32b

# Contexte élargi pour l'usage agent (32k)
PARAMETER num_ctx 32768

# Un peu de déterminisme pour le code
PARAMETER temperature 0.2
ターミナル
# Créer le modèle dérivé
ollama create qwen3-coder-agent -f Modelfile

# Il apparaît désormais dans la liste
ollama list
!
num_ctxはVRAMを消費します
4kから32kに増やすと、KVキャッシュが数GB増えます。VRAMが16 GBの場合は、32kではなく16k(num_ctx 16384)にとどめてください。そうしないと、Ollamaがモデルの一部をシステムRAMにオフロードし、エージェントの動作が遅くなります。`ollama ps`を確認してください。PROCESSOR列にCPUが表示される場合は、コンテキスト長または量子化設定を下げてください。

#3. Clineのインストール

  1. 01
    マーケットプレイスを開く
    VS Codeで、拡張機能パネル(Ctrl+Shift+X)を開いてください。
  2. 02
    Clineを検索する
    検索バーに「Cline」と入力してください。公式拡張機能の発行元は「Cline Bot Inc.」です。模倣版を避けるため、発行元を確認してください。
  3. 03
    インストールおよびピン留め
    「インストール」をクリックしてください。サイドバーのアクティビティバーにClineのアイコンが表示されます。すぐにアクセスできるように、ピン留めしてください。

#4. ClineをOllamaに接続する

ClineはOllamaに標準で対応しているため、OpenAI互換APIのURLを手作業で設定する必要はありません。Clineパネルを開き、設定アイコンをクリックして、プロバイダーを設定してください。

  1. 01
    API Provider → Ollama
    API Provider のドロップダウンリストから「Ollama」を選択してください。
  2. 02
    Base URL
    デフォルト値のhttp://localhost:11434を維持してください。他のマシンまたはコンテナ上でOllamaが動作している場合にのみ変更してください。
  3. 03
    Model
    qwen3-coder-agent(ステップ2で作成した派生モデル)を選択してください。コンテキストが4kの、変更を加えていない元のモデルは選択しないでください。
  4. 04
    コンテキストウィンドウの確認
    Clineには「Context Window」という入力欄があります。Modelfileのnum_ctx(32768)と値を揃えてください。ここにずれがあると、Ollamaに渡される前に、Cline側でプロンプトが切り詰められます。
i
Plan ModeとAct Mode
Cline は、Plan モード(ファイルを変更せずに考え、戦略を提案する)と Act モード(実行する)を区別します。ローカルモデルを使用する場合、アプローチを検証するために Plan モードから始めることをお勧めします。これにより、性能がやや低いモデルが誤った方向に 10 個のファイルを編集し始めるのを防ぐことができます。

#5. エージェントモードでの最初の実行

実際のプロジェクトを開き、Clineに具体的で範囲を限定したタスクを与えてください。最初に試すなら、変更するファイルが少ないタスクが適しています。たとえば、テストを追加する、特定済みのバグを修正する、小さなユーティリティ関数を書く、といったタスクです。

Cline用プロンプト
Ajoute une fonction `slugify(texte)` dans src/utils/strings.js qui met en minuscules, remplace les accents et les espaces par des tirets. Écris aussi un test unitaire dans le fichier de tests existant à côté.

Clineはフォルダーを読み取り、差分を提案し、編集とコマンドの一つひとつについて承認を求めます。初回は動作を理解するために、一つずつ承認してください。安心して使えるようになったら、設定で一部の操作(ファイルの読み取り、非破壊的なコマンド)の自動承認を有効にできます。

→
プロジェクト用のルールファイル
リポジトリのルートに`.clinerules`ファイルを追加し、エージェントが従うルールを定めてください。命名規則、実行するテストコマンド、絶対に変更してはいけないフォルダを記載します。ルールが明確で簡潔なほど、ローカルモデルは指示に従いやすくなります。

#よくある落とし穴

エージェントがタスクを忘れる
ほぼ必ずコンテキストの問題です。Ollama 側の num_ctx が低すぎるか、Cline 側の「Context Window」が適切に設定されていません。両方の値を合わせ直してください。
差分は適用されません
モデルが小さすぎるか、量子化が強すぎるため、編集フォーマットを守れません。モデルを一段階大きくする(14B → 27B/32B)か、Q3 から Q4_K_M に変更してください。
推論がCPUに切り替わります
モデルとコンテキストに必要なメモリがVRAM容量を超えています。`ollama ps`で確認し、num_ctxを減らすか、より小さいモデルを選んでください。一部がCPUで動作するエージェントは、実用になりません。
ツールの無限ループ
一部のモデルは同じコマンドを繰り返し実行します。まずPlan Modeに切り替え、タスクをより小さなサブタスクに分割してください。
接続が拒否されました
Ollamaが接続を待ち受けていないか、想定したURLで待ち受けていません。`curl http://localhost:11434/api/version` を実行して確認してください。コンテナで動かしている場合はポートを公開し、Clineの接続先を正しいアドレスに設定してください。

#さらに詳しく

これで、何も外部に公開せずにコードを編集する、100%ローカルのClineエージェントが使えるようになりました。次のステップとして自然なのは、モデル選びをさらに詰めることと、Clineにはないインライン自動補完を追加することの2つです。

→
ローカルコパイロットキット
GitHub Copilotをローカル環境で置き換えるための一式です。タスク処理にはCline(チャット+エージェント)、入力中にグレー表示される補完にはTabbyを使い、GPUに合ったコードモデルを組み合わせます。各構成要素はすべて手元のマシン上で動作します。
2026年のコーディングに最適なローカルLLM
Devstral、Qwen3-Coderとその代替モデルを、VRAMとコード品質も含めて比較し、Clineに接続するモデルの選択を絞り込むための比較記事です。
CursorによるContinue.devの買収:Clineへ移行する
Continue.devから移行する場合は、設定のエクスポートと、この同じ構成への移行に特化したガイドをご参照ください。
量子化の選択(Q4、Q5、Q8、FP16)
品質とVRAMのトレードオフを理解し、グラフィックカードに収まる範囲で最大のモデルを使えるようにする。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。