論文の概要: Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?
- arxiv url: http://arxiv.org/abs/2607.15439v1
- Date: Thu, 16 Jul 2026 20:18:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.696372
- Title: Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?
- Title(参考訳): ARC-AGI-3を解くには, 実行可能世界モデル, 単純化, 検証が必要か?
- Abstract要約: Codex-based ARC-AGI-3 エージェントのネスト性能について検討した。
最も堅牢な結果は、全てのエージェント変種がより強いモデルで改善されることである。
モデルはこれらの試合を延期し、保持されたパフォーマンスがまだ証明されていないため、この結果は公開セットのみの飽和と解釈されるべきである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Our previous ARC-AGI-3 agent bundled executable world modeling, scheduled simplification, and exact replay verification, leaving unclear which idea accounted for its performance. We address this attribution question with four nested Codex-based agents: a textual baseline; a flexible-interface executable world model without replay verification; the same executable model with scheduled simplification; and a fixed-interface verification treatment that retains simplification and requires exact reproduction of recorded observations. The main study evaluates all four agents with gpt-5.4 and gpt-5.5 at high and xhigh reasoning effort on the public ARC-AGI-3 games. Exploratory follow-ups evaluate the textual and verification variants with gpt-5.6-sol at xhigh and max. The most robust result is that every agent variant improves with a stronger model and with greater reasoning effort. Within each model-effort setting, differences among variants are smaller than anticipated, while the effects of individual components vary across settings. Requiring a persistent executable deliverable is not universally beneficial: the textual variant outperforms the flexible-interface executable variant in both gpt-5.5 settings. Simplification improves performance in three of the four model-effort settings, with the weakest setting as the only exception. The complete verification treatment ranks first in all four settings, although it uses substantially more resources. In the gpt-5.6-sol follow-up, the verification variant fully solves every public game at both reasoning efforts, achieves about 99% RHAE, and uses fewer than half the total actions of the human baseline. Because the model postdates these games and held-out performance remains untested, this result should be interpreted as saturation of the public set only.
- Abstract(参考訳): これまでのARC-AGI-3エージェントは、実行可能世界モデリング、スケジュールの単純化、正確なリプレイ検証をバンドルしており、どのアイデアがパフォーマンスに寄与したのかは明らかになっていない。
テキストベースライン、再生検証のないフレキシブルインターフェース実行可能世界モデル、スケジュールされた単純化を伴う同一実行可能モデル、単純化を維持し、記録された観察を正確に再現する必要がある固定インターフェース検証処理である。
本研究は、パブリックARC-AGI-3ゲームにおいて、gpt-5.4とgpt-5.5の4つのエージェント全てを高い、および、xhighな推論努力で評価する。
探索的な追従は、xhighとmaxでgpt-5.6-solでテキストと検証の変種を評価する。
最もロバストな結果は、全てのエージェントの変種がより強いモデルで改善し、より深い推論の努力で改善するということである。
各モデル・エフォート・セッティングにおいて、変種間の差は予想より小さいが、個々のコンポーネントの影響は設定によって異なる。
文の変種は、どちらも gpt-5.5 設定でフレキシブル・インタフェースの変種よりも優れている。
単純化は4つのモデル・エフォート・セッティングのうち3つのパフォーマンスを改善し、唯一の例外は最も弱い設定である。
完全な検証処理は4つの設定で最初にランク付けされるが、それよりもはるかに多くのリソースを使用する。
gpt-5.6-solのフォローアップでは、検証版は両方の推論で全ての公開ゲームを完全に解決し、約99%のRHAEを達成し、人間のベースラインの総アクションの半分以下を使用する。
モデルはこれらの試合を延期し、保持されたパフォーマンスがまだ証明されていないため、この結果は公開セットのみの飽和と解釈されるべきである。
関連論文リスト
- PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity [0.24554686192257422]
PoTRE(Poly-Topological Reasoning Ensembles)は、推論を4つのエージェントに分解する異種フレームワークである。
我々は、ARC-AGI-2、HLE(Humanity's Last Exam)、PRBench Financeの3つのフロンティアベンチマークでPoTREを評価した。
PoTREはHLEで49.92%の最先端の精度を達成し、以前の最高得点を上回った。
論文 参考訳(メタデータ) (2026-07-22T15:20:53Z) - ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations [84.45092853572407]
ARMは、画像の理解、生成、編集を統一する表現ベースのAutoRegressive Modelである。
我々のトークンライザは、意味的識別性、言語アライメント、忠実な再構築を共同で促進する複数の目的で管理されている。
最後に、ARMは、視覚的品質、命令順守、編集一貫性といったタスクレベルの目標を最適化するために強化学習を適用している。
論文 参考訳(メタデータ) (2026-06-09T17:59:28Z) - FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search [88.16262636915975]
FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-30T10:21:20Z) - RewardHarness: Self-Evolving Agentic Post-Training [51.16917192137169]
RewardHarnessは、命令誘導画像編集のための自己進化型エージェント報酬フレームワークである。
ツールやスキルのライブラリを、100もの好みのデモから反復的に進化させることによって、人間の好みに合わせている。
画像編集評価ベンチマークの平均精度は47.4%で、GPT-5を5.3ポイント上回る。
論文 参考訳(メタデータ) (2026-05-09T05:32:48Z) - Executable World Models for ARC-AGI-3 in the Era of Coding Agents [0.0]
ARC-AGI-3の初期符号化システムの評価を行った。
このシステムは、スクリプト化されたコントローラ、事前に定義されたワールドモデルインターフェース、検証プログラム、プラン実行器を使用する。
その結果、検証器駆動型実行可能世界モデルがARC-AGI-3エージェントにとって有望なアプローチであることを示す予備的証拠が得られた。
論文 参考訳(メタデータ) (2026-05-06T17:12:36Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - An Analysis of Architectural Impact on LLM-based Abstract Visual Reasoning: A Systematic Benchmark on RAVEN-FAIR [0.0]
GPT-4.1-Miniは全アーキテクチャで最高精度を達成した。
それぞれのモデルは、アーキテクチャ設計に対して異なる感度パターンを示し、推論の有効性がモデル固有のものであることを強調した。
論文 参考訳(メタデータ) (2025-11-14T22:50:22Z) - Model Editing with Canonical Examples [75.33218320106585]
標準例を用いたモデル編集について紹介する。
例えば、モーリシャスの首都はポートルイである。
本稿では,各標準例に対して数個の感覚ベクトルを選択し,微調整するセンスファインタニングを提案する。
論文 参考訳(メタデータ) (2024-02-09T03:08:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。