論文の概要: Object-Centric Environment Modeling for Agentic Tasks
- arxiv url: http://arxiv.org/abs/2607.02846v1
- Date: Fri, 03 Jul 2026 00:49:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.432991
- Title: Object-Centric Environment Modeling for Agentic Tasks
- Title(参考訳): エージェントタスクのためのオブジェクト中心環境モデリング
- Abstract要約: 本稿では,経験をオブジェクト中心環境モデルに整理するオブジェクト中心環境モデリング(OCM)を提案する。
OCMはオンライン環境で動作します。各エピソードの後、OCMは軌道を反映し、両方の知識ベースを更新し、すべてのプロシージャが更新されたオブジェクトモデルに対して実行されることを検証します。
OCMはベンチマーク全体で最高の平均ランクを獲得し、無効なアクションを減らすことで、エージェントがオブジェクト中心の環境モデルを構築することのメリットを実証する。
- 参考スコア(独自算出の注目度): 24.702874059340576
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents can improve through accumulated experience, but free-form textual memories become difficult to maintain, validate, and reuse as interactions grow. Recent symbolic approaches learn executable skills or programmatic world models, yet often store local procedures or assume simplified dynamics. We propose Object-Centric Environment Modeling (OCM), which organizes experience into an executable object-centric environment model. OCM maintains two connected code bases: object knowledge, which defines environment entities and mechanisms as Python classes, and procedure knowledge, which records reusable interaction patterns that must import and use the object model. OCM works in an online setting: after each episode, OCM reflects on the trajectory, updates both knowledge bases, and verifies that all procedures execute against the updated object model. During future interaction, the agent uses progressive knowledge disclosure to inspect compact code signatures first and read source code only when needed. Experiments show that OCM achieves the best average rank across benchmarks and reduces invalid actions, demonstrating that agents can benefit from building object-centric environment models.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、蓄積された経験を通して改善することができるが、自由形式のテキストメモリは、相互作用が大きくなるにつれて維持、検証、再利用が困難になる。
最近のシンボリックアプローチは実行可能なスキルやプログラム的な世界モデルを学ぶが、しばしばローカルプロシージャを格納するか、単純化されたダイナミクスを仮定する。
本稿では,経験をオブジェクト中心環境モデルに整理するオブジェクト中心環境モデリング(OCM)を提案する。
OCMは、環境エンティティとメカニズムをPythonクラスとして定義するオブジェクト知識と、オブジェクトモデルをインポートして使用しなければならない再利用可能なインタラクションパターンを記録するプロシージャ知識という、2つの接続されたコードベースを維持している。
OCMはオンライン環境で動作します。各エピソードの後、OCMは軌道を反映し、両方の知識ベースを更新し、すべてのプロシージャが更新されたオブジェクトモデルに対して実行されることを検証します。
将来的なインタラクションの間、エージェントはプログレッシブな知識開示を使用して、まずコンパクトなコードシグネチャを検査し、必要な時にのみソースコードを読み取る。
実験により、OCMはベンチマーク全体で最高の平均ランクを達成し、無効なアクションを減らし、エージェントがオブジェクト中心の環境モデルを構築する利点を享受できることが示されている。
関連論文リスト
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks [43.36285223987099]
動的で現実的な設定でプロアクティブエージェントを評価するための最初の能力駆動型ベンチマークであるUniClawBenchを紹介する。
UniClawBenchは、Skill Usage、Exploration、Long-Context Reasoning、Multimodal Understanding、Cross-Platform Coordinationの5つの実行モデル機能を中心に構築されている。
静的で記録された回答に依存する以前のベンチマークとは異なり、我々のベンチマークは、詳細なステップバイステップの完了チェックポイントを使用して、Dockerコンテナ内のエージェントを評価します。
論文 参考訳(メタデータ) (2026-07-09T17:59:32Z) - Bridging the Agent-World Gap: Text World Models for LLM-based Agents [83.8237017249529]
大規模言語モデル(LLM)ベースのエージェントは、インタラクティブなテキスト環境においてますます使われている。
多くは反応が強く、これらの環境がどのように構成され、どのように進化するかの明確なモデルなしで、観察を行動にマッピングする。
テキストワールドモデル(TWMs): 状態と候補アクションが与えられたら、結果のWebページ、端末出力、API応答、ユーザ応答を予測する。
LLMをベースとしたエージェントのテキストワールドモデルについて,形式的なフレームワークとエージェントライフサイクルを中心に整理し,体系的にレビューを行った。
論文 参考訳(メタデータ) (2026-06-08T04:58:52Z) - Learning POMDP World Models from Observations with Language-Model Priors [52.11151769796862]
部分的に観測可能なマルコフ決定プロセス(POMDP)は、内部世界モデルのための柔軟なモデリングクラスを提供する。
先行知識を活用することで,言語モデルがコストのかかる相互作用を低減できるかどうかを問う。
我々は,emphPinductor が LLM ベースの POMDP 学習手法の性能とサンプル効率に一致することを示す。
論文 参考訳(メタデータ) (2026-05-13T16:18:15Z) - Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning [62.499592503950026]
大規模言語モデル(LLM)は、ツールや環境とのマルチターンインタラクションを必要とする複雑なタスクを実行するために、自律エージェントに権限を与えている。
完全合成環境生成パイプラインであるエージェント・ワールド・モデル(AWM)を提案する。
私たちは、エージェントがリッチなツールセットと対話できる、毎日のシナリオをカバーする1,000の環境にスケールします。
論文 参考訳(メタデータ) (2026-02-10T18:55:41Z) - Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection [59.04089915447622]
ForenAgentはインタラクティブなIFDフレームワークで、MLLMが検出対象に関するPythonベースの低レベルツールを自律的に生成、実行、洗練することができる。
人間の推論にインスパイアされた我々は、グローバルな認識、局所的な焦点、反復的探索、そして全体論的偏見を含む動的推論ループを設計する。
実験の結果,ForenAgent は IFD 課題に対する創発的なツール利用能力と反射的推論を示すことがわかった。
論文 参考訳(メタデータ) (2025-12-18T08:38:44Z) - Learning Interactive World Model for Object-Centric Reinforcement Learning [27.710001478315288]
我々は、世界モデル内で、オブジェクトとそれらの相互作用の構造化表現を学習する統一的なフレームワークを導入する。
FIOC-WMは、オブジェクト相互作用のアンタングルおよびモジュラー表現で環境力学をキャプチャする。
FIOC-WMは、シミュレーションされたロボットと組み込みAIベンチマークにおいて、世界モデルベースラインに対するポリシー学習サンプル効率と一般化を改善している。
論文 参考訳(メタデータ) (2025-11-04T03:35:58Z) - MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering [57.156093929365255]
自律型大規模言語モデル(LLM)エージェントを体系的に強化し、評価し、改善するためのガイムスタイルのフレームワーク。
MLE-Dojoは、現実的なエンジニアリングシナリオを反映した、多様でオープンなMLEタスクを慎重にキュレートする。
完全に実行可能な環境は、教師付き微調整と強化学習の両方を通して包括的なエージェントトレーニングをサポートする。
論文 参考訳(メタデータ) (2025-05-12T17:35:43Z) - Localizing Active Objects from Egocentric Vision with Symbolic World
Knowledge [62.981429762309226]
タスクの指示をエゴセントリックな視点から積極的に下す能力は、AIエージェントがタスクを達成したり、人間をバーチャルに支援する上で不可欠である。
本稿では,現在進行中のオブジェクトの役割を学習し,指示から正確に抽出することで,アクティブなオブジェクトをローカライズするフレーズグラウンドモデルの性能を向上させることを提案する。
Ego4DおよびEpic-Kitchensデータセットに関するフレームワークの評価を行った。
論文 参考訳(メタデータ) (2023-10-23T16:14:05Z) - CGMI: Configurable General Multi-Agent Interaction Framework [0.0]
ヒューマンインタラクションを現実のシナリオで再現するために設計された汎用多エージェントインタラクション(CGMI)フレームワーク。
エージェントパーソナリティの割り当て,検出,維持のための木構造的手法を提案する。
また,仮想環境の現実性を高めるために汎用エージェントを統合した。
論文 参考訳(メタデータ) (2023-08-24T02:03:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。