SWE-bench:2026年のオープンソース LLM のコーディング能力ランキング

SWE-benchでLLMをローカル評価すると、オープンウェイトモデルがGitHub上の実際のバグを解決する能力を、HumanEvalのスコアだけでは捉えきれない範囲まで測定できます。SWE-benchの特徴は、モデルにリポジトリ全体を調べ、イシューの内容を理解し、複数のファイルを変更して、テストスイートを通過することを求める点です。本記事では、ベンチマークの仕組み、SWE-bench Verifiedという派生版、ハードウェア要件、カタログに掲載された候補モデル、ローカル実行手順を詳しく説明し、その後、セルフホスティングを行う実務者のよくある質問に答えます。

SWE-benchの仕組みを理解する

SWE-benchは、プリンストン大学が2023年に公開したベンチマークです。Django、scikit-learn、sympy、matplotlibなど、人気のある12のPythonプロジェクトから、GitHub上の実際の問題2,294件を集めています。各タスクでは、特定のコミット時点のリポジトリとissueの説明がモデルに与えられます。LLMはパッチ(diff) を適用することで、以前に失敗していたテストを通過させつつ既存のテストを破ることなく実現できます。データセットの構成に関する詳細は、以下の オリジナルのSWE-benchペーパー と 公式GitHubリポジトリ.

短い関数を単独で評価するHumanEvalとは異なり、SWE-benchは次の項目を測定します:

SWE-benchでの素点が20%のモデルは、HumanEvalでは80%を超えるスコアを示すことがよくあります。そのため、多くのモデルはHumanEvalで優れた成績を示しても、SWE-benchでは成績が大きく落ち込みます。

SWE-bench Verified:フィルタリング済みのバージョン

SWE-bench Verified は、OpenAI とプリンストンの著者たちが共同で手動で注釈した500件のインスタンスから構成されています。目的は、記述が曖昧なタスク、隠されたテストが非常に特定化されたもの、または参照パッチが提供されていないコンテキストに依存するタスクを除外することです。詳細については、 Verifiedについて解説したOpenAIのブログ記事.

ローカルテストの場合、 SWE-bench Verifiedは最適な選択です :

基準となるエージェントの中で最も広く使われているのは SWE-agentは、LLMに対話型ターミナルを提供するハーネスで、LLMがファイルを編集し、コマンドを実行し、テストを実行できるようにします。よく使われる代替ツールとしては OpenHandsは、OpenAI互換のバックエンド(vLLM、llama.cpp server、SGLang)をネイティブにサポートしています。

ベンチマークに適したカタログ掲載モデル

コーディングエージェント用のLLMには、広いコンテキスト(ハーネスがスタックトレース、ソースコード、操作履歴を挿入します)と優れた推論性能の両立が求められます。以下に、カタログに掲載された候補をハードウェア構成別に示します。

非常に大容量のVRAMを備えたワークステーション(400 GB以上)

マルチGPUクラスタ(140〜250GB)

単一ステーション(≤ 80 GB)

コードの詳細な比較については、以下のページを参照してください Qwen3-Coder と DeepSeek V3.2 の比較 およびページ コード向けに最適なLLM.

トークン/秒および実行時間への影響

SWE-bench Verifiedの完全実行では、ハーネスや許容試行回数に応じて5億から20億トークンの範囲で消費されます。したがって、トークン/秒の処理速度がベンチマークの実行時間に直接影響します

目安となる推定値(お使いの環境で要確認) :

実効コンテキストは純粋な速度と同等に重要です。SWE-agent は定期的にプロンプトに 30k から 60k のトークンを注入して、リポジトリの状態を再構成します。32k のコンテキストに制限されたモデルは不適切です。少なくとも 128k を目指してください。また、 量子化による VRAM 使用量のガイド メモリ予算を調整するため

ローカル実行手順

完全なセルフホスト環境を構築するための簡略化した手順を紹介します。

  1. Docker環境の準備 :SWE-bench Verifiedでは、テストの実行を分離するために、プロジェクトごとのDockerイメージ(Django、sympyなど)が必要です。メンテナーが公開している公式イメージ用に、80 GBのディスク容量を見込んでください。

  2. OpenAI互換の推論サーバーを起動する : と併せて vLLM またはllama.cppをサーバーモードで使用し、モデルを公開してください localhost:8000/v1。2×A100でQwen3-Coder-NextをQ4で実行する場合、一般的なvLLMコマンドでは次のように設定します: --tensor-parallel-size 2 --max-model-len 131072 --quantization awq.

  3. SWE-agentをクローンする また、ローカルエンドポイントを参照するようにテストハーネスを設定する。設定ファイルで使用できるのは api_base: http://localhost:8000/v1 et model_name: <votre-modèle>.

  4. キャリブレーション用の試行を実行する 10〜20件のインスタンスで、アクションが所定の形式に従っていることを確認する。多くのオープンウェイトモデルは、テストハーネスが認識できないXMLタグを勝手に作り出すため、この段階で失敗する。

  5. 全件実行 :500インスタンス、所要日数は数日。事後分析のために、生成されたパッチを漏れなく記録すること。

  6. 任意で提出 公式ランキング で公開の場で比較するため。

実用的なヒント:インスタンスごとのアクション数に上限を設けてください(50〜75回)。モデルがトークン予算を消費する無限ループに陥るのを防げます。

結果の解釈

SWE-bench Verified における素点は相対的に解釈され、絶対的な評価とはなりません。

スコアを超えて、を確認してください 失敗の分布 : タイムアウトするテスト、適用されないパッチ、スコープ外のファイルの変更が見られる。この分析は、モデルが論理的思考に制限されているのではなく、フレームワーク(ウィンドウサイズ、アクションのパース)に制限されていることをよく示す。エージェントモデルの選定についてさらに深く知りたい場合は、以下のページをご覧ください エージェント向けLLMガイド.

FAQ

Q:最初のテストには、SWE-benchとSWE-bench Verifiedのどちらを使うべきですか?

Verifiedです。迷う必要はありません。500件のインスタンスは手作業でアノテーションされ、曖昧なものは除外されており、1台のワークステーションでも実行時間は現実的な範囲に収まります。SWE-bench全体(2,294件のインスタンス)には、仕様が不明確でモデルを不当に不利にするタスクが含まれています。Verifiedなら、プロプライエタリモデルのベンダーが公開しているスコアと直接比較することもできます。

Q:コード分野のスコアを維持するには、どの量子化を選ぶべきですか?

Q4_K_M (GGUF) または AWQ 4ビットは、FP16と比較してSWE-benchスコアで通常1から3点程度低下するものの、これは受け入れ可能である。推論モデルではQ3やQ2を使用するのは避けるべきであり、その際の性能低下が顕著になる。VRAMが許容する場合、Q5_K_MまたはQ8はより優れた性能を提供する。詳細は GGUF と AWQ の量子化比較.

Q:コーディング特化モデルと汎用モデルのどちらを選ぶべきですか?

どちらのタイプも有効です。コードに特化したモデルの例: Qwen3-Coder-Next 80B-A3B パッチ生成において優れたパフォーマンスを発揮しますが、一般論理を扱うモデルなど、 DeepSeek R1 671B は、バグの特定や複数段階の計画立案で優れていることが多く、これらの作業がSWE-benchのタスクのコストの大部分を占めます。

Q:SWE-bench Verified は単一の RTX 4090 で実行できますか?

難しいです。24GBのVRAMでは、Q4で30B以下のモデルに限られます。これらのモデルは推論能力が十分でないため、Verifiedのスコアは通常10%未満にとどまります。Qwen3-Coder-Nextのような軽量モデルを部分的にCPUへオフロードしてパイプラインを検証することはできますが、実用的な結果を得るには、3090を2枚、またはA100 80GBを1枚使う構成を目指してください。

Q:完全な実行に必要なトークン数はいくつですか?

ハーネス(SWE-agent、OpenHands、カスタム)と、各インスタンスで許可されるアクション数の上限に応じて、5億~20億トークンと推定されます。各インスタンスのアクション上限を50回、平均コンテキストを30kトークンとすると、500インスタンスで約10億トークンを見込む必要があります。モデルが連鎖的に「考える」(R1スタイル)ほど、トークン料金は増加します。

Q:ローカルでの結果は、リーダーボードのスコアと比較できますか?

はい。公式の評価ハーネスと同じバージョンのデータセットを使用し、提出プロトコル(インスタンスごとにパッチは1つだけ、オラクルを使った再試行は禁止)を守ることが条件です。ハーネスやシステムプロンプトに変更を加えた場合は、その内容をすべて文書化する必要があります。 SWE-benchランキング セルフホスト環境での結果の提出を受け付け、再現性を検証しています。

結論

SWE-bench LLM をローカルで実行することは、オープンウェイトのコードモデルと HumanEval の単純な学習モデルを区別する最も明確な試験です。SWE-bench Verified では、2×A100 または 4×H100 のスタンドと適切なモデル(Qwen3-Coder-Next, DeepSeek V3.2 または gpt-oss 120B)なら、現実的な実行条件で数日以内に完了します。ベンチマークを開始する前に実行環境を調整するには、次のツールを使用してください: quelllm.frの設定ツール または、以下を閲覧する 全モデルのカタログ.

記事公開日: 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.