ARC-AGI 2:オープンソースLLMの推論能力をテスト
Le ARC-AGI 2 ベンチマーク 2025年以降、オープンウェイトLLMの一般化および抽象的推論を測定するための基準となり、MMLU型のクイズを超えるレベルにまで達しています。フランソワ・シャルルとArc Prize財団によって開発された ARC-AGI 2 ベンチマーク モデルに未知の視覚パズルを解かせます。これらのパズルでは、暗記や総当たりだけではもはや十分ではありません。この記事では、評価プロトコル、quelllm.frのカタログで上位に位置するオープンソースモデル、それらに必要なVRAM容量、そしてこれらのテストをローカルで再現するためのベストプラクティスを解説します。
ARC-AGI 2とは何か、なぜ画期的なのか
ARC-AGI 2 は、Abstraction and Reasoning Corpus の第二版であり、「」の枠組み内で公開されました。Arc Prize 2025 賞金100万ドルを伴います。このゲームには、約1,000件の公開トレーニングタスク、400件の公開評価タスク、100件の非公開最終テストタスクが含まれています。各タスクは、入力カラーグリッドと出力グリッド、および2〜5つの例で構成されています。モデルは変換ルールを推論し、新しいケースに適用する必要があります。
MMLUまたはHumanEvalとは異なり、ARC-AGI 2は一般的な知識や文法パターンマッチングを報酬にしません。その目的は LLMによる論理的推論 本質的には:ルールの構成、物体の操作、対称性、数え上げ。以下の Chollet の基礎論文 (arXiv:1911.01547)によると、特別な訓練を受けていない人でも正答率は80%を超えます。一方、2025年初頭には、最も優れたオープンソースLLMでも正答率は5〜15%で頭打ちでした。
このベンチマークがエコシステムにおける位置づけを理解するには、私たちの 2025年LLMベンチマークガイド.
評価プロトコル:ARC-AGI 2が実際に測定する内容
公式プロトコルは、ARC-AGI 2を通常のベンチマークと区別する2つの制約を課しています:
- データの汚染なし :非公開の100課題はインターネット上では決して公開されないため、事前学習による偏りを防ぐことができます。
- 計算量に上限 :コストの高い総当たりを抑制するため、各提出に使える計算リソースには上限があります。
公式スコアは、2 回の試行が許可された条件下で解決されたタスクの割合に対応します(pass@2)。推奨される入力形式は、色を0~9の数値で表すASCIIまたはJSONのグリッドです。 公式GitHubリポジトリ arc-prize/ARC-AGI-2 は、評価スクリプト、Pythonのテストハーネス、比較の基準となるベースラインを提供します。
オープンソースの提出物では、主に3系統のアプローチが使われています:
- 直接プロンプトを与える 構造化された思考連鎖で
- テスト時トレーニング (TTT):推論前に2~5個の例を使って行う短時間のファインチューニング
- プログラム合成 :グリッドを生成するためにモデルが実行するPythonコードの生成
テストタイムトレーニングは現在最も優れた結果をもたらしていますが、タスクあたり2倍から10倍のトークンを消費します。プログラム合成のアプローチは、MindsAIチームが2024年の提出で紹介したものです。 Arc Prizeのブログ.
オープンソースモデルの候補:VRAMとライセンス
ローカルLLMナビ カテゴリのモデルの中で、評価で優れたスコアを狙うのに最も適したものです ARC-AGI 2 ベンチマーク、ハードウェア構成別に分類しています。
最上位クラス(Q4でVRAM 400 GB以上) :
- DeepSeek V4 Pro 1.6T —— 1600Bのパラメータ、MITライセンス、Q4での約960GBのVRAM、1,000,000トークンのコンテキスト。マルチステップ推論に適したMoEアーキテクチャ。
- Kimi K2.6 — 1000B、Modified MIT、約600GB Q4。プランニングタスクでの良好な結果が発表されています。
- Ring-1T — 1000B、MIT、Q4で約600 GB、コンテキスト長131,072トークン、長時間の推論向けに設計されています。
- DeepSeek R1 671B — 671B、MIT、Q4で約400 GB。Chain-of-Thought(思考の連鎖)を標準で備えた推論モデル。
- MiMo V2.5 Pro — 1020B、MIT、Q4で約595 GB、コンテキスト長100万トークン。大規模なfew-shotプロンプトに適しています。
ワークステーションで実行可能なミドルレンジ(Q4で60~250 GB) :
- Qwen 3 235B-A22B —— 235B、Apache 2.0、~142 GB Q4、コンテキスト 131 072。
- gpt-oss 120B — 117B、Apache 2.0、Q4で約70 GB。コストに対する推論能力のバランスが良好です。
- Nemotron 3 Super 120B — 120B、NVIDIA オープンモデルライセンス、約72 GB Q4
- Llama 4 Scout 109B — 109B、Llama 4 Community、Q4で約65GB、最大1,000万トークンの拡張コンテキスト。
- Mistral Small 4 — 119B、Apache 2.0、~72 GB Q4、コンテキスト256 000トークン。
一般ユーザー向けプロファイル(Q4 50GB 以下) :
- Qwen3-Coder-Next 80B-A3B —— 80B、Apache 2.0、~48GB Q4。プログラム合成アプローチに適しています。
- DeepSeek R1 Distill Llama 70B — 70B、Q4で約40 GB。R1の推論能力を蒸留したバージョンです。
- Llama 3.3 70B Instruct —— 70B、約40 GB Q4。
Q4でのVRAM使用量は、GGUF Q4_K_Mに基づく推定値です。Q8ではその1.9倍、FP16では3.8倍を見込む必要があります。これらの数値は、使用するランタイム(llama.cpp、vLLM、SGLang)に応じて確認する必要があります。
期待されるパフォーマンスおよびトークン/秒
これらのモデルのバージョン2のベンチマークにおける公式スコアはまだ統合されていません——順位は毎月変化します。参考として、コミュニティからのフィードバックはArc Prize Leaderboard 2025 によると、明示的な推論を行うモデル(R1、Ring-1T)のpass@2スコアは、TTTなしで8〜18%、積極的なテスト時学習を行うと最大25〜35%に達します。これらの数値は、Q4量子化版についてはまだ確認が必要です。
生成速度については、RTX 6000 Adaを2枚搭載した構成(VRAM合計96GB)でllama.cppを使用した場合:
- Llama 3.3 70B Q4 : 18-22トークン/秒(推定値)
- gpt-oss 120B Q4 : 12-16トークン/秒(推定)
- Qwen 3 235B-A22B Q4 :CPUへの部分的なオフロードで8〜12トークン/秒
推論の詳細な比較については、次をご覧ください: DeepSeek R1 vs Llama 3.3 et 推論モデルのランキング.
実践例:ローカルでARC-AGI 2を再現
カタログにあるモデルの評価を行うために、 ARC-AGI 2 ベンチマーク、標準的なワークフローは次のとおりです:
- 公式リポジトリをクローンする
arc-prize/ARC-AGI-2およびPythonの依存関係をインストールする。 - vLLMまたはllama.cppを使い、OpenAI互換サーバーモードでモデルを読み込む。 vLLMドキュメント はQwen 3 235B-A22BのようなMoEモデルを扱っています。
- 各グリッドをASCII文字列にエンコードし、few-shot例を用いてプロンプトを構築する
- テスト時学習では、各タスクの2〜5件のデモンストレーションで学習させたランク16〜32のLoRAを分離して用意する(タスクごとに30〜90秒のオーバーヘッド)。ライブラリ HuggingFace の PEFT この用途に対応しています
- スクリプトで評価
scoring.pyが提供されており、pass@1およびpass@2を計算します。
長文コンテキストを備えたモデル、例えば MiMo V2.5 Pro (1Mトークン)または Llama 4 Maverick 400B (100万トークン)なら、多数の例を途中で切り詰めることなく入力できるため、複数のルールを組み合わせるタスクに役立ちます。
必要なハードウェア容量を見積もるには、 quelllm.frのモデル選定ツール ターゲットの量子化に基づいて必要な VRAM を計算します。
ARC-AGI 2でよくある誤りと攻略のアプローチ
拒絶された提出物の分析について arc-prize/ARC-AGI-2リポジトリ オープンソースLLMで繰り返し発生するバグを、3つの種類に分類して明らかにしています:
- 色のハルシネーション :モデルが0〜9のパレットにない色を生成します。対策:型付きJSONの文法で出力を制約すること(vLLMではlogits processorを使用)。
- 行と列の逆転 : 非正方形グリッドにおける次元の混同。緩和策:注釈を付ける
H × Lプロンプト内に。 - 過度の一般化 :例には正しく当てはまるものの、テストケースの細かな違いを捉えられないルールを適用すること。対策:次のステップを必須にする
<verification>思考連鎖(chain-of-thought)の後に。
別のアプローチを検討する場合、Greenblattチームの研究(サンプリング後にフィルタリングによる) Claude Sonnet、arXiv:2406.07394 を参照してください) は、より小さなモデルが大量生成(Pythonプログラム1000件以上をサンプルおよびテスト)を行うことで、より大きなモデルを単一ショットで上回ることが示されています。この論理は、 Qwen3-Coder-Next 80B-A3B、プログラム合成において優れています。
ARC-AGI 1との簡単な比較
ARC-AGI 1(2019年)は、2024年末には、55%を超えるスコアを達成したハイブリッド型の手法によって飽和状態に達していました。ARC-AGI 2は、次の4つの変更で意図的に難易度を再び引き上げています:
- 1つだけではなく、2〜4つの基本変換を組み合わせる複合タスク。
- より大きなグリッド(v1の15×15から30×30まで)。
- 列挙による総当たり探索を可能にしていた統計的バイアスの除去。
- 2025〜2026年向けに更新された非公開タスク。そのうち50件は、視覚的推論に精通した人間の専門家が設計したものです。
結果:2025年には最優秀な提出物の割合が~30%にとどまり、v1では60%を上回っていました。このテーマをさらに掘り下げたい場合は、以下の記事もご参照ください LLMの推論と数学の比較ガイド と比較ページ DeepSeek R1 vs Ring-1T.
FAQ
Q:2025年末時点で、ARC-AGI 2のスコアが最も高いオープンソースモデルはどれですか?
本稿作成時点では、オープンソース分野における公式ランキングが確定していません。コミュニティによる提出が順位を決定しています。 DeepSeek R1 671B et Ring-1T 標準搭載の思考の連鎖(chain-of-thought)により、首位に位置しています。Arc Prizeチームがランキングを毎月更新しているため、正確な数値は引き続き確認が必要です。
Q:推論モデルと汎用モデルのどちらが必要ですか?
明示的に推論するモデル(R1、Ring-1T、gpt-oss 120B)は、パラメータ数が同等の汎用モデルを一貫して上回ります。ARC-AGI 2では、思考トークンによる追加コスト(多くの場合3〜10倍)を、pass@2の向上が十分に補います。 Llama 3.3 70B 標準は実際のニーズに比べて限界があります DeepSeek R1 Distill Llama 70B.
Q:本格的にベンチマークを試すには、最低どれくらいのVRAM容量が必要ですか?
40GBのVRAM(RTX 6000 AdaまたはA6000)を持つ場合、以下の処理が可能です DeepSeek R1 Distill Llama 70B Q4で実行し、まずまずのスコアを目指します。オープンソースの最前線に到達するには、次のようなモデルで、合計250 GB以上(マルチGPU、またはCPUへの積極的なオフロード)を目指す必要があります Qwen 3 235B-A22B.
Q:テスト時トレーニングは実際に性能向上をもたらしますか?
TTTなしの場合、 LLMによる論理的推論 インコンテキスト推論のみに依存します。各タスクのデモンストレーションで短時間の学習を行ったLoRAを使うと、8〜15パーセントポイントの改善が見られます。その代わり、計算コストは5〜10倍になり、実装も複雑になります。最初のテストでは、直接プロンプトを与える方法にとどめてください。
Q:商用利用にはどのライセンスが必要ですか?
パーミッシブライセンスを優先してください。 Qwen 3 235B-A22B, gpt-oss 120B, Ring-1T et DeepSeek R1 671B はApache 2.0またはMITライセンスであり、商業利用の制限はありません。避けてください Command R+ 104B CC-BY-NC 4.0で提供される、有料製品の場合。
Q:公式データセットとスクリプトはどこで入手できますか?
すべてがに集中しています GitHubリポジトリ arc-prize/ARC-AGI-2 および HuggingFace datasets/arc-prize. JSONフォーマットは2019年の初回リリースからドキュメント化され、安定しています。
結論
Le ARC-AGI 2 ベンチマーク 2026年までに、感染や記憶への耐性を持つ少数のテストの一つとして残り、オープンソースLLMの推論を客観的に比較するための貴重なツールとなります。評価を開始する前に、GPUのサイズを正確に評価してください。 quelllm.frのモデル選定ツール または、以下を閲覧する 全モデルのカタログ ご希望のVRAM予算およびライセンス対象に最も適したモデルを特定するために、