ARC-AGI 2:オープンソースLLMの推論能力をテスト

Le ARC-AGI 2 ベンチマーク 2025年以降、オープンウェイトLLMの一般化および抽象的推論を測定するための基準となり、MMLU型のクイズを超えるレベルにまで達しています。フランソワ・シャルルとArc Prize財団によって開発された ARC-AGI 2 ベンチマーク モデルに未知の視覚パズルを解かせます。これらのパズルでは、暗記や総当たりだけではもはや十分ではありません。この記事では、評価プロトコル、quelllm.frのカタログで上位に位置するオープンソースモデル、それらに必要なVRAM容量、そしてこれらのテストをローカルで再現するためのベストプラクティスを解説します。

ARC-AGI 2とは何か、なぜ画期的なのか

ARC-AGI 2 は、Abstraction and Reasoning Corpus の第二版であり、「」の枠組み内で公開されました。Arc Prize 2025 賞金100万ドルを伴います。このゲームには、約1,000件の公開トレーニングタスク、400件の公開評価タスク、100件の非公開最終テストタスクが含まれています。各タスクは、入力カラーグリッドと出力グリッド、および2〜5つの例で構成されています。モデルは変換ルールを推論し、新しいケースに適用する必要があります。

MMLUまたはHumanEvalとは異なり、ARC-AGI 2は一般的な知識や文法パターンマッチングを報酬にしません。その目的は LLMによる論理的推論 本質的には:ルールの構成、物体の操作、対称性、数え上げ。以下の Chollet の基礎論文 (arXiv:1911.01547)によると、特別な訓練を受けていない人でも正答率は80%を超えます。一方、2025年初頭には、最も優れたオープンソースLLMでも正答率は5〜15%で頭打ちでした。

このベンチマークがエコシステムにおける位置づけを理解するには、私たちの 2025年LLMベンチマークガイド.

評価プロトコル:ARC-AGI 2が実際に測定する内容

公式プロトコルは、ARC-AGI 2を通常のベンチマークと区別する2つの制約を課しています:

公式スコアは、2 回の試行が許可された条件下で解決されたタスクの割合に対応します(pass@2)。推奨される入力形式は、色を0~9の数値で表すASCIIまたはJSONのグリッドです。 公式GitHubリポジトリ arc-prize/ARC-AGI-2 は、評価スクリプト、Pythonのテストハーネス、比較の基準となるベースラインを提供します。

オープンソースの提出物では、主に3系統のアプローチが使われています:

テストタイムトレーニングは現在最も優れた結果をもたらしていますが、タスクあたり2倍から10倍のトークンを消費します。プログラム合成のアプローチは、MindsAIチームが2024年の提出で紹介したものです。 Arc Prizeのブログ.

オープンソースモデルの候補:VRAMとライセンス

ローカルLLMナビ カテゴリのモデルの中で、評価で優れたスコアを狙うのに最も適したものです ARC-AGI 2 ベンチマーク、ハードウェア構成別に分類しています。

最上位クラス(Q4でVRAM 400 GB以上) :

ワークステーションで実行可能なミドルレンジ(Q4で60~250 GB) :

一般ユーザー向けプロファイル(Q4 50GB 以下) :

Q4でのVRAM使用量は、GGUF Q4_K_Mに基づく推定値です。Q8ではその1.9倍、FP16では3.8倍を見込む必要があります。これらの数値は、使用するランタイム(llama.cpp、vLLM、SGLang)に応じて確認する必要があります。

期待されるパフォーマンスおよびトークン/秒

これらのモデルのバージョン2のベンチマークにおける公式スコアはまだ統合されていません——順位は毎月変化します。参考として、コミュニティからのフィードバックはArc Prize Leaderboard 2025 によると、明示的な推論を行うモデル(R1、Ring-1T)のpass@2スコアは、TTTなしで8〜18%、積極的なテスト時学習を行うと最大25〜35%に達します。これらの数値は、Q4量子化版についてはまだ確認が必要です。

生成速度については、RTX 6000 Adaを2枚搭載した構成(VRAM合計96GB)でllama.cppを使用した場合:

推論の詳細な比較については、次をご覧ください: DeepSeek R1 vs Llama 3.3 et 推論モデルのランキング.

実践例:ローカルでARC-AGI 2を再現

カタログにあるモデルの評価を行うために、 ARC-AGI 2 ベンチマーク、標準的なワークフローは次のとおりです:

  1. 公式リポジトリをクローンする arc-prize/ARC-AGI-2 およびPythonの依存関係をインストールする。
  2. vLLMまたはllama.cppを使い、OpenAI互換サーバーモードでモデルを読み込む。 vLLMドキュメント はQwen 3 235B-A22BのようなMoEモデルを扱っています。
  3. 各グリッドをASCII文字列にエンコードし、few-shot例を用いてプロンプトを構築する
  4. テスト時学習では、各タスクの2〜5件のデモンストレーションで学習させたランク16〜32のLoRAを分離して用意する(タスクごとに30〜90秒のオーバーヘッド)。ライブラリ HuggingFace の PEFT この用途に対応しています
  5. スクリプトで評価 scoring.py が提供されており、pass@1およびpass@2を計算します。

長文コンテキストを備えたモデル、例えば MiMo V2.5 Pro (1Mトークン)または Llama 4 Maverick 400B (100万トークン)なら、多数の例を途中で切り詰めることなく入力できるため、複数のルールを組み合わせるタスクに役立ちます。

必要なハードウェア容量を見積もるには、 quelllm.frのモデル選定ツール ターゲットの量子化に基づいて必要な VRAM を計算します。

ARC-AGI 2でよくある誤りと攻略のアプローチ

拒絶された提出物の分析について arc-prize/ARC-AGI-2リポジトリ オープンソースLLMで繰り返し発生するバグを、3つの種類に分類して明らかにしています:

別のアプローチを検討する場合、Greenblattチームの研究(サンプリング後にフィルタリングによる) Claude Sonnet、arXiv:2406.07394 を参照してください) は、より小さなモデルが大量生成(Pythonプログラム1000件以上をサンプルおよびテスト)を行うことで、より大きなモデルを単一ショットで上回ることが示されています。この論理は、 Qwen3-Coder-Next 80B-A3B、プログラム合成において優れています。

ARC-AGI 1との簡単な比較

ARC-AGI 1(2019年)は、2024年末には、55%を超えるスコアを達成したハイブリッド型の手法によって飽和状態に達していました。ARC-AGI 2は、次の4つの変更で意図的に難易度を再び引き上げています:

結果:2025年には最優秀な提出物の割合が~30%にとどまり、v1では60%を上回っていました。このテーマをさらに掘り下げたい場合は、以下の記事もご参照ください LLMの推論と数学の比較ガイド と比較ページ DeepSeek R1 vs Ring-1T.

FAQ

Q:2025年末時点で、ARC-AGI 2のスコアが最も高いオープンソースモデルはどれですか?

本稿作成時点では、オープンソース分野における公式ランキングが確定していません。コミュニティによる提出が順位を決定しています。 DeepSeek R1 671B et Ring-1T 標準搭載の思考の連鎖(chain-of-thought)により、首位に位置しています。Arc Prizeチームがランキングを毎月更新しているため、正確な数値は引き続き確認が必要です。

Q:推論モデルと汎用モデルのどちらが必要ですか?

明示的に推論するモデル(R1、Ring-1T、gpt-oss 120B)は、パラメータ数が同等の汎用モデルを一貫して上回ります。ARC-AGI 2では、思考トークンによる追加コスト(多くの場合3〜10倍)を、pass@2の向上が十分に補います。 Llama 3.3 70B 標準は実際のニーズに比べて限界があります DeepSeek R1 Distill Llama 70B.

Q:本格的にベンチマークを試すには、最低どれくらいのVRAM容量が必要ですか?

40GBのVRAM(RTX 6000 AdaまたはA6000)を持つ場合、以下の処理が可能です DeepSeek R1 Distill Llama 70B Q4で実行し、まずまずのスコアを目指します。オープンソースの最前線に到達するには、次のようなモデルで、合計250 GB以上(マルチGPU、またはCPUへの積極的なオフロード)を目指す必要があります Qwen 3 235B-A22B.

Q:テスト時トレーニングは実際に性能向上をもたらしますか?

TTTなしの場合、 LLMによる論理的推論 インコンテキスト推論のみに依存します。各タスクのデモンストレーションで短時間の学習を行ったLoRAを使うと、8〜15パーセントポイントの改善が見られます。その代わり、計算コストは5〜10倍になり、実装も複雑になります。最初のテストでは、直接プロンプトを与える方法にとどめてください。

Q:商用利用にはどのライセンスが必要ですか?

パーミッシブライセンスを優先してください。 Qwen 3 235B-A22B, gpt-oss 120B, Ring-1T et DeepSeek R1 671B はApache 2.0またはMITライセンスであり、商業利用の制限はありません。避けてください Command R+ 104B CC-BY-NC 4.0で提供される、有料製品の場合。

Q:公式データセットとスクリプトはどこで入手できますか?

すべてがに集中しています GitHubリポジトリ arc-prize/ARC-AGI-2 および HuggingFace datasets/arc-prize. JSONフォーマットは2019年の初回リリースからドキュメント化され、安定しています。

結論

Le ARC-AGI 2 ベンチマーク 2026年までに、感染や記憶への耐性を持つ少数のテストの一つとして残り、オープンソースLLMの推論を客観的に比較するための貴重なツールとなります。評価を開始する前に、GPUのサイズを正確に評価してください。 quelllm.frのモデル選定ツール または、以下を閲覧する 全モデルのカタログ ご希望のVRAM予算およびライセンス対象に最も適したモデルを特定するために、

記事公開日: 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.