論文の概要: OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration
- arxiv url: http://arxiv.org/abs/2607.01531v1
- Date: Wed, 01 Jul 2026 23:04:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.614784
- Title: OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration
- Title(参考訳): OPINE-World:Ontology-error-Prioritized Interactive Explorationを用いたプログラム的世界モデリング
- Abstract要約: 本稿では,対話からオブジェクト中心のプログラミング世界モデルを学ぶエージェントOPINE-Worldを紹介する。
OPINE-Worldは25試合中20試合をゲームごとのトレーニングなしで解決し、人間のベースラインに対するアクション効率スコア78.4に達する。
- 参考スコア(独自算出の注目度): 29.764166104307932
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Learning how an environment behaves from interaction is central to building agents that adapt to unfamiliar tasks. World models learned with deep networks are flexible but data-hungry and transfer poorly beyond their training distribution. Program-synthesized world models, written as source code by LLMs and refined through counterexample-guided inductive synthesis (CEGIS), are instead data-efficient and reusable, yet they have been demonstrated mainly on structured-state worlds with a given object vocabulary, and a single program search does not scale to pixel-rendered environments whose object structure must be hypothesized flexibly. We introduce OPINE-World, an LLM agent that learns an object-centric programmatic world model online from interaction. OPINE-World couples two cooperating agents in a loop of hypothesis and test, one acting in the environment and one synthesizing the model in code with replay verification and model-based planning, and it steers exploration with a Bayesian measure of object-type adequacy we call ontology error. We evaluate OPINE-World on ARC-AGI-3, a benchmark for skill-acquisition efficiency in which the object vocabulary, the goal, and the action semantics are withheld. OPINE-World solves 20 of 25 games without per-game training and reaches an action-efficiency score of 78.4 against the human baseline.
- Abstract(参考訳): 環境がインタラクションからどのように振る舞うかを学ぶことは、馴染みの無いタスクに適応するエージェントを構築することの中心である。
深層ネットワークで学んだ世界モデルはフレキシブルだが、データ収集やデータ転送はトレーニング分布を超えては不十分だ。
LLMによってソースコードとして記述され、反例誘導型帰納的合成(CEGIS)によって洗練されるプログラム合成世界モデルは、代わりにデータ効率が高く再利用可能なものであるが、それらは主に与えられたオブジェクトの語彙を持つ構造化状態の世界で実証され、単一のプログラム探索は、オブジェクト構造を柔軟に仮説化しなければならないピクセルレンダリング環境にスケールしない。
対話からオブジェクト中心のプログラミング世界モデルを学ぶLLMエージェントであるOPINE-Worldを紹介する。
OPINE-Worldは仮説とテストのループに2つの協調エージェントを結合し、1つは環境に作用し、もう1つはリプレイ検証とモデルベース計画によるコードでモデルを合成する。
我々はARC-AGI-3上でOPINE-Worldを評価する。これは、オブジェクトの語彙、ゴール、アクションの意味が保持されないスキル獲得効率のベンチマークである。
OPINE-Worldは25試合中20試合をゲームごとのトレーニングなしで解決し、人間のベースラインに対するアクション効率スコア78.4に達する。
関連論文リスト
- Bridging the Agent-World Gap: Text World Models for LLM-based Agents [83.8237017249529]
大規模言語モデル(LLM)ベースのエージェントは、インタラクティブなテキスト環境においてますます使われている。
多くは反応が強く、これらの環境がどのように構成され、どのように進化するかの明確なモデルなしで、観察を行動にマッピングする。
テキストワールドモデル(TWMs): 状態と候補アクションが与えられたら、結果のWebページ、端末出力、API応答、ユーザ応答を予測する。
LLMをベースとしたエージェントのテキストワールドモデルについて,形式的なフレームワークとエージェントライフサイクルを中心に整理し,体系的にレビューを行った。
論文 参考訳(メタデータ) (2026-06-08T04:58:52Z) - Learning POMDP World Models from Observations with Language-Model Priors [52.11151769796862]
部分的に観測可能なマルコフ決定プロセス(POMDP)は、内部世界モデルのための柔軟なモデリングクラスを提供する。
先行知識を活用することで,言語モデルがコストのかかる相互作用を低減できるかどうかを問う。
我々は,emphPinductor が LLM ベースの POMDP 学習手法の性能とサンプル効率に一致することを示す。
論文 参考訳(メタデータ) (2026-05-13T16:18:15Z) - From Word to World: Can Large Language Models be Implicit Text-based World Models? [82.47317196099907]
エージェント強化学習は、経験駆動のスケーリングにますます依存している。
世界モデルは、シミュレートされた経験を通して学習効率を改善する潜在的方法を提供する。
大規模言語モデルがこの役割を確実に果たせるか,どのような条件でエージェントに有意義な利益をもたらすかを検討する。
論文 参考訳(メタデータ) (2025-12-21T17:28:42Z) - WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World [100.68103378427567]
エージェントは現実的な4D駆動環境を合成し、説得力があるように見えるが、物理的または行動的に失敗することが多い。
モデルがどのように構築され、理解され、その生成された世界の中でどのように振る舞うかを評価するフルスペクトルベンチマークであるWorldLensを紹介します。
さらに、数値的なスコアとテキストの合理性を備えた人間の注釈付きビデオの大規模データセット WorldLens-26K を構築し、WorldLens-Agent を開発した。
論文 参考訳(メタデータ) (2025-12-11T18:59:58Z) - Object-Centric World Models for Causality-Aware Reinforcement Learning [13.063093054280946]
カルーサリティ対応強化学習(ASTICA)を用いたEmph Transformer Imaginationを提案する。
オブジェクト中心のトランスフォーマーが世界モデルおよび因果対応ポリシーおよびバリューネットワークとして機能する統合フレームワーク。
オブジェクトリッチベンチマークの実験では、STICAはサンプル効率と最終性能の両方において、最先端のエージェントよりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-11-18T08:53:09Z) - Learning Interactive World Model for Object-Centric Reinforcement Learning [27.710001478315288]
我々は、世界モデル内で、オブジェクトとそれらの相互作用の構造化表現を学習する統一的なフレームワークを導入する。
FIOC-WMは、オブジェクト相互作用のアンタングルおよびモジュラー表現で環境力学をキャプチャする。
FIOC-WMは、シミュレーションされたロボットと組み込みAIベンチマークにおいて、世界モデルベースラインに対するポリシー学習サンプル効率と一般化を改善している。
論文 参考訳(メタデータ) (2025-11-04T03:35:58Z) - World Model Implanting for Test-time Adaptation of Embodied Agents [29.514831254621438]
具体的AIにおいて、永続的な課題は、エージェントが広範なデータ収集や再トレーニングを必要とせずに、新しいドメインへの堅牢な適応を可能にすることである。
本稿では、大規模言語モデルの推論能力と、独立に学習されたドメイン固有世界モデルを組み合わせた世界モデル埋め込みフレームワーク(WorMI)を提案する。
我々は、VirtualHomeとALFWorldのベンチマークでWorMIを評価し、いくつかのLSMベースのアプローチと比較して、ゼロショットと少数ショットのパフォーマンスが優れていることを示した。
論文 参考訳(メタデータ) (2025-09-04T07:32:16Z) - Relational Object-Centric Actor-Critic [44.99833362998488]
近年の研究では、アンタングルオブジェクト表現は、イメージベースでオブジェクト中心の強化学習タスクにおけるポリシー学習に役立つことが強調されている。
本稿では,アクタ批判的アプローチとモデルに基づくアプローチを統合した,オブジェクト中心強化学習アルゴリズムを提案する。
シミュレーションされた3次元ロボット環境と構成構造を持つ2次元環境において,本手法の評価を行った。
論文 参考訳(メタデータ) (2023-10-26T06:05:12Z) - Transferring Foundation Models for Generalizable Robotic Manipulation [82.12754319808197]
インターネット規模の基盤モデルによって生成された言語推論セグメンテーションマスクを効果的に活用する新しいパラダイムを提案する。
提案手法は,オブジェクトのポーズを効果的かつ堅牢に知覚し,サンプル効率のよい一般化学習を可能にする。
デモは提出されたビデオで見ることができ、より包括的なデモはlink1またはlink2で見ることができます。
論文 参考訳(メタデータ) (2023-06-09T07:22:12Z) - Bridging the Gap to Real-World Object-Centric Learning [66.55867830853803]
自己教師付き方法で訓練されたモデルから特徴を再構成することは、完全に教師なしの方法でオブジェクト中心表現が生じるための十分な訓練信号であることを示す。
我々のアプローチであるDINOSAURは、シミュレーションデータ上で既存のオブジェクト中心学習モデルよりも大幅に優れています。
論文 参考訳(メタデータ) (2022-09-29T15:24:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。