論文の概要: Executable World Models for ARC-AGI-3 in the Era of Coding Agents
- arxiv url: http://arxiv.org/abs/2605.05138v1
- Date: Wed, 06 May 2026 17:12:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.955097
- Title: Executable World Models for ARC-AGI-3 in the Era of Coding Agents
- Title(参考訳): コーディングエージェント時代のARC-AGI-3における実行可能世界モデル
- Authors: Sergey Rodionov,
- Abstract要約: ARC-AGI-3の初期符号化システムの評価を行った。
このシステムは、スクリプト化されたコントローラ、事前に定義されたワールドモデルインターフェース、検証プログラム、プラン実行器を使用する。
その結果、検証器駆動型実行可能世界モデルがARC-AGI-3エージェントにとって有望なアプローチであることを示す予備的証拠が得られた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We evaluate an initial coding-agent system for ARC-AGI-3 in which the agent maintains an executable Python world model, verifies it against previous observations, refactors it toward simpler abstractions as a practical proxy for an MDL-like simplicity bias, and plans through the model before acting. The system is intentionally direct: it uses a scripted controller, predefined world-model interfaces, verifier programs, and a plan executor, but no hand-coded game-specific logic. We report results on the 25 public ARC-AGI-3 games. Each recorded playthrough uses a fresh agent instance with no access to previous playthrough-specific files or conversation state. Most games have a single recorded playthrough; for a few games, we report multiple independent fresh-agent playthroughs to expose run-to-run variability. The agent fully solved 7 games, achieved a Relative Human Action Efficiency greater than 75%, on 6 games, and obtained a mean per-game RHAE of 32.58%. Because the system uses no game-specific code, it can serve as a game-general baseline for ARC-AGI-3. Performance on the private validation set remains to be tested. Overall, the results provide preliminary evidence that verifier-driven executable world models are a promising approach for ARC-AGI-3 agents.
- Abstract(参考訳): 我々は,ARC-AGI-3 の初期符号化エージェントシステムの評価を行い,エージェントが実行可能な Python の世界モデルを維持し,それを以前の観測結果に対して検証し,MDL のような単純さバイアスの実用的なプロキシとして単純な抽象化に向けてリファクタリングし,動作前にモデルを通して計画する。
このシステムは意図的に直接的であり、スクリプト化されたコントローラ、事前に定義されたワールドモデルインターフェース、検証プログラム、計画実行プログラムを使用するが、手書きのゲーム固有のロジックは使用しない。
ARC-AGI-3の公開試合25試合について報告する。
記録された各プレイスルーは、以前のプレイスルー固有のファイルや会話状態にアクセスせずに、新鮮なエージェントインスタンスを使用する。
ほとんどのゲームは単一のプレイスルーを記録しており、いくつかのゲームでは、複数の独立した新しいエージェントのプレイスルーを報告し、実行間変動を露呈する。
エージェントは7つのゲームを完全に解決し、6つのゲームで75%以上の相対的ヒューマンアクション効率を達成し、ゲーム当たりの平均RHAEは32.58%に達した。
このシステムはゲーム固有のコードを使用しないので、ARC-AGI-3のゲーム汎用ベースラインとして機能する。
プライベート検証セットのパフォーマンスはまだテストされていない。
全体として、検証器駆動型実行可能世界モデルがARC-AGI-3エージェントにとって有望なアプローチであることを示す予備的な証拠を提供する。
関連論文リスト
- GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents [76.60994803070436]
GameWorldは、ブラウザ環境におけるマルチモーダル大言語モデル(MLLM)ゲームエージェントの評価のためのベンチマークである。
2つのゲームエージェントインタフェースが研究され、 (i) キーボードとマウスのコントロールを直接出力するコンピュータ利用エージェント、 (ii) セマンティックアクション空間で作用する汎用マルチモーダルエージェントが研究されている。
18組のモデルとインタフェースのペアによる結果は、最高のパフォーマンスエージェントでさえ、ビデオゲームで人間の能力を達成するには程遠いことを示唆している。
論文 参考訳(メタデータ) (2026-04-08T17:49:03Z) - NitroGen: An Open Foundation Model for Generalist Gaming Agents [101.41866522979548]
NitroGenは、ジェネラリストゲームエージェントのためのビジョンアクション基盤モデルである。
1000以上のゲームで4万時間のゲームプレイビデオでトレーニングされている。
論文 参考訳(メタデータ) (2026-01-04T16:24:50Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - PokéAI: A Goal-Generating, Battle-Optimizing Multi-agent System for Pokemon Red [4.558478169296784]
Pok'eAIは,Pok'emon Redを通じて自律的に再生・進行するように設計された,テキストベースでマルチエージェントな大規模言語モデル(LLM)フレームワークである。
本システムでは,3つの専門エージェント(Planning, Execution, Critique-each)と,独自のメモリバンク,役割,スキルセットで構成されている。
論文 参考訳(メタデータ) (2025-06-30T10:09:13Z) - A Survey on Large Language Model-Based Game Agents [35.34074811680046]
ゲームエージェントは、人工知能に関連する能力を探索するための貴重なテストベッドを提供する。
近年、LLM(Large Language Models)の出現は、これらのエージェントに一般化可能な推論を与える新たな機会を提供する。
この調査は、統一された参照アーキテクチャを通して、LLMベースのゲームエージェントの最新のレビューを提供する。
論文 参考訳(メタデータ) (2024-04-02T15:34:18Z) - Promptable Game Models: Text-Guided Game Simulation via Masked Diffusion
Models [68.85478477006178]
ニューラルビデオゲームシミュレータのためのPGM(Promptable Game Model)を提案する。
ユーザーは高レベルのアクションシーケンスと低レベルのアクションシーケンスでゲームを実行することができる。
私たちのPGMは、エージェントの目標をプロンプトの形で指定することで、ディレクターのモードをアンロックします。
提案手法は,既存のニューラルビデオゲームシミュレータのレンダリング品質を著しく上回り,現在の最先端の能力を超えたアプリケーションをアンロックする。
論文 参考訳(メタデータ) (2023-03-23T17:43:17Z) - An Empirical Study on the Generalization Power of Neural Representations
Learned via Visual Guessing Games [79.23847247132345]
本研究は,視覚質問応答(VQA)のような新しいNLP下流タスクにおいて,後から実行を依頼されたとき,人工エージェントが推測ゲームでどの程度の利益を得ることができるかを検討する。
提案手法は,1) エージェントがうまく推理ゲームを模倣することを学習する教師あり学習シナリオ,2) エージェントが単独でプレイする新しい方法,すなわち,反復経験学習(SPIEL)によるセルフプレイ(Self-play)を提案する。
論文 参考訳(メタデータ) (2021-01-31T10:30:48Z) - Disentangling Controllable Object through Video Prediction Improves
Visual Reinforcement Learning [82.25034245150582]
多くの視覚に基づく強化学習問題において、エージェントは視野内の可動物体を制御する。
制御可能なオブジェクトを観測信号から切り離すためのエンドツーエンド学習フレームワークを提案する。
不整合表現は、RLがエージェントに追加の観察チャネルとして有用であることが示されている。
論文 参考訳(メタデータ) (2020-02-21T05:43:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。