論文の概要: Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3
- arxiv url: http://arxiv.org/abs/2607.28287v1
- Date: Thu, 30 Jul 2026 14:34:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.608836
- Title: Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3
- Title(参考訳): Tycho: ARC-AGI-3のプログラムワールドモデルによるアクティブ抽象化
- Authors: Jens Lehmann, Andrei Aioanei, Sahar Vahdati,
- Abstract要約: ARC-AGI-3は抽象化をスキル獲得の対話的な問題に変える。
我々はこれらの環境をパラメータ化レンダリング決定論的ムーアマシンとして定式化する。
我々は,インタラクション中にゲーム固有のモデルを構築し,使用するコーディングエージェントシステムであるTychoを紹介する。
- 参考スコア(独自算出の注目度): 6.41363581085404
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: ARC-AGI-3 turns abstraction into an interactive problem of skill acquisition. A player must infer an unfamiliar game's rules, hidden state, and goal while maintaining action efficiency because every move counts. We formalize these environments as parameterized rendered deterministic Moore machines and introduce Tycho, a coding-agent system that constructs and uses game-specific models during interaction. Tycho separates actionable observations from intermediate animation, level-completion, and game-over frames. From this structured history, an agent can model, test, plan with, repair, or bypass a free-form executable hypothesis. In one matched public-set run per policy, we compare four orchestration policies on all 25 public games using Claude Opus 4.8 under matched inference budgets. Actor-requested delegation to a model builder obtains the highest observed mean Relative Human Action Efficiency (RHAE), 88.49. With this selected policy, GPT-5.6 Sol and Opus 5 both reach 100.00 RHAE and complete all 183 levels. Their game-balanced first-run human-replay midranks are 98.5 and 100.0. Opus 5 uses 61% fewer scored actions than the aggregate official human baselines. Automatic repair after verification failures produces models that reproduce observed transitions much more accurately, yet reaches only 83.07 RHAE. Transition match indicates whether a simulator reproduces observed dynamics, not whether it has identified the objective or improves the next action. Strong play also requires deciding when to construct, repair, use, or bypass a model. We call this joint problem active abstraction: generating a testable model from costly interaction and deciding when acquiring or using it is worth its cost.
- Abstract(参考訳): ARC-AGI-3は抽象化をスキル獲得の対話的な問題に変える。
プレイヤーは、すべての動きがカウントされるため、アクション効率を維持しながら、なじみの無いゲームのルール、隠れ状態、ゴールを推測しなければならない。
我々はこれらの環境をパラメータ化レンダリング決定論的ムーアマシンとして定式化し、インタラクション中にゲーム固有のモデルを構築し、使用するコーディングエージェントシステムであるTychoを導入する。
Tychoは、アクション可能な観察を中間アニメーション、レベルコンプリート、ゲームオーバーフレームから分離する。
この構造化された歴史から、エージェントは自由形式の実行可能な仮説をモデル化、テスト、計画、修復、バイパスすることができる。
ポリシ毎にマッチしたパブリックセットの実行では、一致した推論予算の下でClaude Opus 4.8を使用して、25のパブリックゲームすべてに対する4つのオーケストレーションポリシを比較します。
モデルビルダーへのアクター要求デリゲートは、RHAE(Relative Human Action Effective)88.49の最も高い平均値を得る。
この選択された方針により、GPT-5.6ソルとオプス5は100.00RHAEに達し、183レベルを完備した。
彼らのゲームバランスの第1回人間プレイのミッドランクは98.5と100.0である。
Opus 5は、公式のベースラインの合計よりも61%少ないスコアのアクションを使用する。
検証失敗後の自動修復は、観測された遷移をより正確に再現するモデルを生成するが、83.07 RHAEにしか達しない。
トランジションマッチは、シミュレータが観測されたダイナミクスを再現するかどうかを示す。
強い遊びはまた、モデルをいつ構築、修復、使用、バイパスするかを決定する必要がある。
コストのかかるインタラクションからテスト可能なモデルを生成し、それをいつ取得または使用するかを決めることは、そのコストに値することです。
関連論文リスト
- OdysSim: Building Foundation Models for Human Behavior Simulation [70.35265860287608]
大規模言語モデルは、対話的評価と社会シミュレーションのための人間のシミュレータとして、ますます多くデプロイされている。
しかし、有益性駆動のポストトレーニングは、それらを同質で過度に同意できるアシスタントレジスタへと引き寄せる。
OdysSimは行動基礎モデルに関する最大のオープン・システマティック・リサーチである。
論文 参考訳(メタデータ) (2026-06-12T07:31:55Z) - Agent Island: A Saturation- and Contamination-Resistant Benchmark from Multiagent Games [0.0]
我々は,言語モデルエージェントが相互協力,対立,説得のゲームで競うマルチプレイヤーシミュレーション環境であるエージェントアイランドを紹介した。
ベイズプラケット・ルーキーモデルでプレイヤーをランク付けし、プレイヤースキルの不確実性を定量化する。
49のユニークなモデルを含む999のゲームでは、openai/gpt-5.5が5.64で、第2位のモデルであるopenai/gpt-5.2と第3位のモデルであるopenai/gpt-5.3-codexの2.86と、ピアを圧倒している。
論文 参考訳(メタデータ) (2026-05-05T21:24:58Z) - ActionParty: Multi-Subject Action Binding in Generative Video Games [117.52562594944679]
ActionPartyは、ゲーム生成のための制御可能な多目的世界モデルである。
46の多様な環境において最大7人のプレイヤーを同時に制御できる最初のビデオワールドモデルを実証する。
論文 参考訳(メタデータ) (2026-04-02T17:59:58Z) - Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play [52.3079697845254]
evaは、オフラインとオンラインのRLポストトレーニングの両方で、言語モデルがトレーニングプロンプトを適応的に作成できるようにする最初の方法である。
我々は,エバが有効なRLキュリキュラを作成でき,アブレーションにまたがって堅牢であることを示す。
論文 参考訳(メタデータ) (2024-10-31T08:15:32Z) - Blending Data-Driven Priors in Dynamic Games [9.085463548798366]
Kullback-Leibler (KL) 正規化による非協調的ダイナミックゲームの解法を定式化する。
我々は,KLGameのNash平衡戦略を,マルチモーダル近似フィードバックをリアルタイムに計算するための効率的なアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-02-21T23:22:32Z) - Auto-Encoding Bayesian Inverse Games [36.06617326128679]
ゲームの性質が不明な逆ゲーム問題を考える。
既存の最大推定手法は、未知のパラメータの点推定のみを提供する。
ベイズ的視点を採り、ゲームパラメータの後方分布を構成する。
この構造化されたVAEは、観測された相互作用のラベルのないデータセットから訓練することができる。
論文 参考訳(メタデータ) (2024-02-14T02:17:37Z) - Tool-Augmented Reward Modeling [58.381678612409]
本稿では,外部環境へのアクセスによるRMの強化により,制約に対処するツール拡張された嗜好モデリング手法であるThemisを提案する。
我々の研究は、外部ツールをRMに統合し、様々な外部ソースとの相互作用を可能にすることを目的としている。
人間の評価では、テミスで訓練されたRLHFはベースラインと比較して平均32%の勝利率を得る。
論文 参考訳(メタデータ) (2023-10-02T09:47:40Z) - Promptable Game Models: Text-Guided Game Simulation via Masked Diffusion
Models [68.85478477006178]
ニューラルビデオゲームシミュレータのためのPGM(Promptable Game Model)を提案する。
ユーザーは高レベルのアクションシーケンスと低レベルのアクションシーケンスでゲームを実行することができる。
私たちのPGMは、エージェントの目標をプロンプトの形で指定することで、ディレクターのモードをアンロックします。
提案手法は,既存のニューラルビデオゲームシミュレータのレンダリング品質を著しく上回り,現在の最先端の能力を超えたアプリケーションをアンロックする。
論文 参考訳(メタデータ) (2023-03-23T17:43:17Z) - Learning to Perceive in Deep Model-Free Reinforcement Learning [1.2891210250935146]
本研究は、入力観察の一部にのみアクセス可能な未知のタスクの完了方法を学ぶことができる、新しいモデルフリー強化学習(RL)エージェントを提案する。
我々は、人間の特徴である視覚的注意と能動的知覚の概念からインスピレーションを得て、エージェントにそれらを適用しようとした。
論文 参考訳(メタデータ) (2023-01-10T00:31:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。