学習パス02 · コーディング向け

開発者 — 「ローカルCopilot、100%オフライン、クラウド遅延ゼロ。」

Qwen2.5 Coder 32BをContinue.dev経由でVSCodeに接続。オートコンプリート、チャット、ファイル全体のリファクタリング——Microsoft、OpenAI、Anthropicにコードの1行も漏洩することはありません。あなたのPRにAPIキーが含まれていても、そこに残ります。

総所要時間
~30分
必要なレベル
ターミナルに慣れています
コスト
0 €
マシンタイプ
16GBのVRAMを備えたGPUまたはMac Mシリーズ32GB以上
↑
私たちの約束

この学習コースを終えると、Q4で量子化したQwen2.5 Coder 32Bを使うllama.cppサーバーがバックグラウンドで動作するようになります。Continue.devはVSCodeに接続され、自動補完(FIM)とサイドバーのチャットが使えるようになります。遅延は100 ms未満で、自動補完の品質はCopilotと同程度になり、最近のコードでは上回ることもあります。

対象者 どんな人向け?

30分を無駄にしていただくより、早めにお伝えしたいと考えています。

✓ 次の条件に当てはまる方におすすめ
  • ✓毎日コードを書いていて、コードスニペットをWeb UIにコピーするのにうんざりしています。
  • ✓勤務先がGitHub Copilot、ChatGPT、Cursorの使用を禁止しているのには、もっともな理由があります。
  • ✓プロプライエタリなコード、秘密保持契約(NDA)の対象となるコード、または平文のAPIシークレットを扱っている。
  • ✓RTX 4070 Ti+、RTX 4090、RTX 5090、またはメモリ32 GB以上のMacBook Pro M2/M3/M4をお持ちです。
  • ✓クラウドAPIへのpingが200 msかかり、作業のリズムが崩れます。
✕ 以下に当てはまる場合は、別の選択肢を検討してください
  • ·VRAMが8 GBの場合:実行は可能ですが、使えるのは7Bモデルで、品質はCopilotを大きく下回ります。
  • ·週に1時間だけコードを書くなら、クラウドプロバイダーの無料アカウントを使うほうが手間がかかりません。
  • ·汎用のチャットアシスタントを使いたい方は、より簡単な「好奇心のある方向けコース」をご覧ください。

4ステップで進む学習パス

各ステップには、作業と並行して読める詳しいガイドへのリンクがあります。順序は最適化されています。初回はステップを飛ばさないでください。

合計 · 約30分
  1. 1
    ステップ 01·12 分·上級

    GPUアクセラレーション付き llama.cpp のコンパイル

    ソースからビルドすることで、トークン/秒の最大値を得られます。NVIDIA では CUDA、Apple シリコンでは Metal、AMD では ROCm を使用します。Ollama と比べて15%〜30%速いです。

    llama-server バイナリが用意されており、OpenAI互換APIを提供可能です。
    ガイドを読む →
  2. 2
    ステップ 02·6 分·中級

    Qwen2.5 Coder 32B (Q4) をダウンロード

    コード向けオープンウェイトモデルとしてそのカテゴリで最も優れたモデルです。Q4_K_M は約 19 GB の VRAM を消費し、FP16 と比べて 95% の品質を維持します。Hugging Face からダウンロード可能です。

    モデルは localhost:8080 で、Chat Completions 形式で提供されます。
    ガイドを読む →
  3. 3
    ステップ 03·8 分·中級

    VSCodeにContinue.devを接続する

    marketplaceからContinue拡張機能をインストールし、~/.continue/config.jsonを編集してローカルエンドポイントに設定し、FIMモデルを自動補完用に構成してください。

    Tabキーで提案を受け入れ、Cmd+Lで選択範囲についてのチャットを開きます。
    ガイドを読む →
  4. +
    ボーナスステップ·4分·上級

    おまけ — コマンドラインで使うAider

    より広範なタスク(モジュールのリファクタリング、テストの生成)に対して、Aiderはターミナルから自然言語でファイルを編集し、Gitによる自動コミットを実行できます。

    同じバックエンドに接続し、Continueを補完するエージェント型CLIです。
    ガイドを読む →

おすすめモデル

この学習コース向けにテストした3つの選択肢を、最も軽量なものから最も高性能なものまで紹介します。クリックすると詳細ページ(VRAM、コンテキスト、ベンチマーク)が開きます。

参照されているモデル
qwen2.5-14b

汎用性の高いモデル。14B は Q4 で 9 GB。コードの品質が非常に高く、12 GB の VRAM に収まります。

汎用型
Mistral Small 3
Mistral AI · 24B · Q4で 14 GB

16GB VRAM を持っている場合に良いバランスを提供します。より広い用途に対応可能です。

詳細を確認 →
参照されているモデル
llama-3.3-70b

64 GBのMacまたは48 GBのGPUをお持ちなら、最高の選択肢です。レイテンシは高くなりますが、品質は抜群です。

よくある質問

メールやMastodonで実際に寄せられる質問です。ご自身の質問が掲載されていない場合は、チケットを作成してください。

ラインバイラインの自動補完において、Qwen2.5 Coder 32Bは非常に近い性能を示し、2024年以降のコードに関しては場合によっては優れている。チャット機能では、Copilot Chat(GPT-4oをバックエンドとして使用)が一歩先進しているが、あなたのデータを完全に管理できます。
この学習パスを完了すると
次のコース

機密性を重視するプロ — 「私の資料は、自分のパソコンの外には出ません。」

法律専門家、医師、人事担当者、コンサルタント、公認会計士、公証人——扱う文書には職業上の守秘義務やNDAが適用されます。ローカルLLMとRAGを組み合わせることで、文書について質問したり、要約したり、…

→
ローカルコパイロットキット

GitHub Copilot や Cursor を 100 % ローカルのコードコパイロットに置き換える — 参考ガイド、設定ファイル付き。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

ご質問、誤字・脱字、バグはありますか?

この学習コースはモデルがリリースされるたびに進化します。皆さんからのフィードバックが、その材料となります。