IntelliJおよびJetBrainsにOllama:ローカルに搭載されたAIアシスタント IDE
IntelliJ(またはPyCharm、WebStorm、GoLandなど)をOllamaに接続することは、Copilotのようなコードアシスタントを、自社のマシン上で実行するというものです。プロジェクト内のチャット、行末補完、リファクタリングが可能になります。ただし、どのラインも第三者サーバーに送られません。このガイドでは、Ollamaと互換性のあるプラグインを整理し、AI「プロキシ」を介して全体を接続する方法を示し、グラフィックカードに応じてどのコードモデルを選ぶべきかを説明します。
#IDEにローカルLLMを導入する理由
クラウドのアシスタント(GitHub Copilot、JetBrains AI、Cursor)は便利ですが、コードのコンテキストを、時にはファイル全体、時にはリポジトリ全体を、リモートサーバーに送信します。NDAの対象となるコードやプロプライエタリなソフトウェアを扱う場合、あるいは単に方針として外部送信を認めない場合、これは受け入れられません。IntelliJに接続したローカルLLMなら、この問題を根本から解決できます。モデルは手元のGPUで動作し、プロンプトもコード補完の出力もマシンの外に出ることはありません。
もう一つの理由はコストです。CopilotやJetBrains AIのサブスクリプションは、利用を続ける限り毎月支払いが発生します。Ollamaをインストールしてコード用モデルをダウンロードすれば、オフラインでも、利用枠の制限やトークン単位の課金なしでコード補完やチャットができます。妥協が必要なのは品質です。小型のローカルモデルは最先端のクラウドモデルには及びませんが、Qwen 3.8 27BやDevstral 24Bは、コード補完や日常的なチャットではそれに近い性能を発揮します。
- プライバシー
- コード、プロンプト、応答はすべてローカルに残ります。クラウド側では何のログも記録されません。
- サブスクリプションは一切必要ありません
- モデルをダウンロードした後は、継続的な費用は発生しません。利用回数は無制限です。
- Hors-ligne
- 電車の中でも、隔離されたネットワーク上でも、厳しい制限のある企業プロキシの背後でも動作します。
- モデルの制御
- サイズ、量子化方法を選び、タスクに応じてモデルを変更できます。
#Ollamaと連携するJetBrainsプラグイン
このガイドでモデルの導入まで、キットでエディタ内でコードを書くコパイロットの導入まで進められます。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
JetBrainsの各製品で共通して使えるOllamaのネイティブサポートはありません。利用するには、マーケットプレイスのプラグインを使います。3つの選択肢でほぼすべてのニーズをカバーでき、それぞれ異なる強みがあります。
- ProxyAI(旧 CodeGPT)
- ローカル利用向けとしては最も機能が充実しています。チャット、インライン補完、選択範囲の編集に対応し、Ollamaコネクターも組み込まれています。タイトルで触れている「AIプロキシ」がこれで、IDEとOllamaデーモンの橋渡しをします。
- Continue
- オープンソースで、設定ファイルを使って細かく設定できます。チャット、自動補完、コードへの操作に対応し、Ollamaをプロバイダーとして本格的にサポートしています。モデルごとに細かく調整したい場合に最適です。
- JetBrains AI Assistant
- JetBrains公式のアシスタントです。2025年から、オフラインモード用にOllamaまたはLM Studioのローカルモデルへ接続できるようになりました。JetBrains製のツールを使い続けたい場合に便利ですが、ローカルでのコード補完の柔軟性は低めです。
#前提条件
Ollamaがすでにインストールされ、正常に動作しているものとします。あとは比較的新しいJetBrains IDEと、ダウンロード済みのコード用モデルが少なくとも1つあれば十分です。
- JetBrains IDE 2024.1+
- IntelliJ IDEA、PyCharm、WebStorm、GoLand、Rider、PhpStorm…。上記のプラグインは、これらすべての製品に同じマーケットプレイスからインストールできます。
- Ollamaは正常に動作しています
- デーモンがインストールされ、http://localhost:11434 に接続できること。何かを設定する前に、ollama list で動作を確認してください。
- チャット/コードモデル
- qwen3.5:9bは、まず試す汎用モデルとして適しています(256kのコンテキスト、画像認識)。Q4_K_Mでは約6.6 GBのVRAMに収まります。
- GPUの使用を推奨
- 補完が有用であるためには、応答が1秒未満である必要があります。RTX 3060 12 GBでは7Bモデルを快適に動作させることができます。GPUがない場合は、自動補完ではなくチャットに限定してください。
#ProxyAI + Ollamaの設定
ProxyAI(旧CodeGPT)は、JetBrainsでフル機能のローカルアシスタントを使うための最も手軽な方法です。Ollamaコネクターがチャット、選択範囲の編集、補完に対応しており、APIキーもアカウントも不要です。
- 01プラグインのインストールSettings → Plugins → Marketplaceで「ProxyAI」(バージョンによっては「CodeGPT」)を検索し、インストールしてください。再起動を求められた場合は、IDEを再起動してください。
- 02提供元 Ollama を選ぶSettings → Tools → ProxyAI → Providers。クラウドの選択肢(OpenAI、Anthropic など)ではなく、Ollama (Local) をプロバイダーとして選択してください。
- 03サーバーのURLを確認する「Base URL」フィールドにはhttp://localhost:11434を設定する必要があります。Ollamaがネットワーク上の別のマシンで動作している場合は、localhostの代わりにそのマシンのIPアドレスを入力してください。
- 04モデルを選択モデル一覧から、ダウンロードしたモデル(例:qwen3.5:9b)を選択してください。ProxyAIはOllamaに問い合わせ、利用可能なモデルをリストアップします。
- 05チャットをテストするProxyAIパネル(サイドバーのアイコン)を開き、開いているファイルについて質問してください。外部接続の警告が表示されず、ローカルで回答が返ってくるはずです。
#Continueと標準搭載のAI Assistant
細部まで自分で設定したい場合、Continueではメニューではなくファイルで設定を扱えます。そのファイルで、プロバイダーとしてOllamaを指定し、チャット用モデルと、それとは別に補完用モデルを明示的に定義します。記述量は増えますが、設定をはるかに細かく制御でき、特に自動補完には小型で高速なモデル、チャットにはより大きなモデルを割り当てる場合に便利です。
JetBrains AI Assistant の場合、手順はより明確に定義されています。アシスタントの設定でローカルモデルの使用を有効にし、Ollama を指定してください。単一のツールで済ませたい場合に有用ですが、ネイティブアシスタントは主に JetBrains クラウド向けに設計されており、そのローカル補完機能は ProxyAI や Continue ほど成熟していません。本格的な 100% ローカル利用には、後者の 2 つを推奨します。
#VRAM に応じたコードモデルはどれですか?
基本はシンプルです。モデルが大きいほど回答の質は高くなりますが、VRAMの消費量が増え、応答も遅くなります。Qwen 3.5 / Qwen 3.8ファミリーは小型から大型まで幅広くカバーし、2026年のローカル環境でのコーディングにおける代表的な選択肢です。Devstral 24B(コーディングエージェントに特化)とGranite 4.2も有力な代替候補です。以下に、Q4_K_M量子化(サイズと品質の最良のバランス)での目安を示します。
- 軽量 3B — ~2 GB VRAM
- granite4.2:3b。手早いトラブルシューティングや簡単な質問に向いており、リソース消費が非常に少ないモデルです。小型GPUでも動作し、対話を必要としない用途ならCPUでも動作します。
- 汎用9Bモデル — VRAM約6.6 GB
- qwen3.5:9b。バランスのよい選択肢です。チャット、編集、リファクタリングでまずまずの性能を発揮し、256kのコンテキストと画像理解に対応しています。RTX 3060 12GB/4070 12GB向けです。
- 快適に使える12B — VRAM約7.6GB
- gemma4:12b。推論と複数ファイルにまたがるリファクタリングで明らかに優れており、マルチモーダルに対応し、Apache 2.0ライセンスで提供されています。RTX 4080 16 GBで余裕を持って動作します。
- ハイエンド 27B — ~18 GB VRAM
- qwen3.8:27b。ローカルでのコーディング用途で、クラウドに最も近いモデルです(262kのコンテキスト、画像認識対応)。24 GBのRTX 4090、または32 GB以上のユニファイドメモリを搭載したApple Silicon Macが必要です。ヒント:推論の設定を「low」にしてください。デフォルトでは考えすぎる傾向があります。
#ローカルでのコード補完:FIMに注意
Copilotのようなコード補完は、「fill-in-the-middle」(FIM)に基づいています。モデルは、カーソルの前と後の両方のコードを把握したうえで、コードの途中を補完する必要があります。すべてのモデルがこれに対応しているわけではありません。instruct版はチャット向けに学習されており、FIM向けではありません。自動補完には、その用途に特化して設計されたbase版を使ってください。
- Instructモデルではなくベースモデル
- コード補完には、2026年もFIMの定番であり続けているqwen2.5-coder:7b-baseを選んでください。instructモデルは、冗長な補完や所定の形式に合わない補完を生成します。
- スピードが最優先です
- 補完においては、速度が精度よりも重要です。半秒未満で応答できる専用ベースモデルは、2秒かかる大きなチャットモデルよりも実用的です。
- GPUがほぼ必須です
- ハードウェアアクセラレーションがないと、補完候補が表示されるのが遅すぎて、入力速度に追いつきません。その場合は、ローカルAIの用途をチャットに限定してください。
#ローカルAIがまだIDEで行えないこと
ローカル環境は進化しましたが、クラウドベースのハイエンドアシスタントと比べてまだ差が残っています。こうした点を理解しておくことで、期待値を適切に設定し、失望を避けられます。
- マルチファイル推論
- 大規模なリポジトリは、ローカルモデルのコンテキストウィンドウを超えてしまいます。モデルが参照できるのは渡されたファイルであり、アーキテクチャ全体ではありません。Copilot WorkspaceやCursorはプロジェクト全体をインデックス化しますが、ローカルではまだ手作業に頼る部分が多いのが現状です。
- 高度なエージェントモード
- コマンドを実行させ、テストを行い、反復を重ねるには(Cline/Cursor Agentのように)、ツールを確実に使いこなせるモデルが必要です。小型のローカルモデルは、こうした処理に失敗することがよくあります。コード専用モデル(Devstral 24B、Qwen3-Coder 30B、GLM 4.7 Flash)を選び、ある程度の失敗を受け入れる必要があります。
- 複雑なコードにおけるモデル自体の性能
- 高度なアルゴリズムや、学習データにあまり含まれていない最近のフレームワークでは、8〜12Bのローカルモデルは依然として最先端のクラウドモデルに及びません。
- 製品へのきめ細かな統合
- 言語の自動検出、豊富なコンテキストに応じたアクション、PRへの対応…ローカルツールも追いつきつつありますが、商用アシスタントの洗練された使い心地には、まだ一歩及びません。
実際、ローカルモデルはコード補完、ファイルについてのチャット、コードの説明、限定的な範囲のリファクタリングに優れています。負荷の高いエージェント処理やリポジトリ全体の分析では、クラウドが引き続き有利です。そのため、両方を使えるようにしておき、コードの機密性に応じて使い分けるとよいでしょう。
#トラブルシューティング
- プラグインにモデルが一つも表示されない
- プラグインがOllamaに接続できていません。デーモンが動作していること(ollama list)と、URLが http://localhost:11434 になっていることを確認してください。Ollamaが別のマシン上にある場合は、OLLAMA_HOST=0.0.0.0 を指定して起動し、接続先をそのマシンのIPアドレスに設定してください。
- 「Connection refused」
- Ollamaが起動していないか、ファイアウォールがポート11434をブロックしています。IDEと同じマシンからcurl http://localhost:11434/api/tagsを実行してテストしてください。
- モデルはリストに表示されていません
- タグが一致していません。ollama listで返される名前を、タグも含めて正確にコピーしてください(qwen3.5ではなくqwen3.5:9b)。
- 応答が非常に遅い
- モデルがGPUに収まらず、一部の処理がCPUに回っています。より小さいモデルかQ4_K_Mに切り替え、nvidia-smiでGPUが実際に使われていることを確認してください。
- 補完結果が空、または意味不明
- FIMにinstructモデルを使用しています。-baseのバリエーション(qwen2.5-coder:7b-base)に切り替えてください。
- IDEが生成中に遅くなる
- 2つのモデルを読み込むとVRAMが飽和します。片方のサイズを縮小するか、プラグインを一度に1つだけ有効にしてください。
#さらに詳しく
IDE内のローカルアシスタントの性能は、それを支えるデーモンとGPUにかかっています。これらのガイドは、環境構築を補足するものです。
- Ollama のインストール
- 基本:ポート11434でコードモデルを提供するデーモンをインストールして起動する。
- 無料で使えるローカルCopilot:VS Codeで使うCline、Tabby、CodeGeeX
- VS Codeでの同様の活用法を紹介し、エディタごとのアプローチやプラグインを比較できます。
- Claude CodeとCursorでOllamaを使用する
- 同じローカルモデルを他のアシスタントに接続し、タスクに応じてローカルとクラウドを使い分けるために。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。