論文の概要: Self-Evolving World Models for LLM Agent Planning
- arxiv url: http://arxiv.org/abs/2606.30639v1
- Date: Mon, 29 Jun 2026 17:58:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.375667
- Title: Self-Evolving World Models for LLM Agent Planning
- Title(参考訳): LLMエージェント計画のための自己進化型世界モデル
- Authors: Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng,
- Abstract要約: 我々はWorldEvolverを紹介した。WorldEvolverは、ダウンストリームエージェントとすべてのモデルパラメータを凍結したまま、デプロイメント時間コンテキストを更新する自己進化型ワールドモデルフレームワークである。
WorldEvolverは3つのバックボーンで最高の予測精度を達成し、下流エージェントの成功率で他のワールドモデルベースラインを導く。
- 参考スコア(独自算出の注目度): 72.99782619992361
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models offer a principled way to equip long-horizon LLM agents with foresight: predictions of action consequences before execution. However, unreliable foresight can be ignored, misused, or even degrade downstream decision-making. In this paper, we introduce WorldEvolver, a self-evolving world model framework that revises its deployment-time context while keeping the downstream agent and all model parameters frozen. WorldEvolver integrates three modules: (i) Episodic Memory, which exploits real action transitions through retrieval-based simulation; (ii) Semantic Memory, which extracts persistent heuristic rules from prediction-observation mismatches; and (iii) Selective Foresight, which filters low-confidence predictions before integrating them into agent reasoning context. We evaluate WorldEvolver on ALFWorld and ScienceWorld, measuring world model prediction accuracy on Word2World and downstream agent success rate on AgentBoard. Extensive experiments show that WorldEvolver achieves the highest prediction accuracy across three backbones and leads other world model baselines on downstream agent success rate, demonstrating that test-time memory revision enhances both predictive fidelity and planning performance.
- Abstract(参考訳): 世界モデルは、ロングホライズンLSMエージェントにフォアシスタンスを装備する原則的な方法を提供する:実行前のアクション結果の予測。
しかし、信頼性の低い監視は無視したり、誤用されたり、下流の意思決定を低下させたりすることができる。
本稿では、下流エージェントとすべてのモデルパラメータを凍結したまま、展開時間コンテキストを更新する自己進化型世界モデルフレームワークであるWorldEvolverを紹介する。
WorldEvolverは3つのモジュールを統合する。
一 検索に基づくシミュレーションにより実際の行動遷移を利用するエピソード記憶
二 予測・観測ミスマッチから永続的ヒューリスティック規則を抽出する意味記憶
三 エージェント推論コンテキストに組み込む前に、低信頼度予測をフィルタリングする選択予測
我々は、ALFWorldとScienceWorldのWorldEvolverを評価し、Word2Worldのワールドモデル予測精度とAgentBoardのダウンストリームエージェント成功率を測定した。
大規模な実験により、WorldEvolverは3つのバックボーンの中で最も高い予測精度を達成し、他のワールドモデルベースラインを下流エージェントの成功率に導いた。
関連論文リスト
- Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning [32.26884129316165]
大規模言語モデル(LLM)エージェントは、シーケンシャルな意思決定において強力な能力を示している。
コミットメントの前に潜在的な計画を評価するために「What-if」推論を採用する人間とは異なり、標準エージェントは将来の成果をシミュレートする内的世界モデルが欠如している。
本研究では,1つの自己回帰モデルを訓練し,将来的な状態展開と計画条件による成功推定の両方を言語化することにより,将来の計画の内在化を提案する。
論文 参考訳(メタデータ) (2026-06-25T19:05:44Z) - COMAP: Co-Evolving World Models and Agent Policies for LLM Agents [14.918267305899619]
COMAPは、クローズドループインタラクションを通じてテキストワールドモデルとエージェントポリシーを共進化させる新しいフレームワークである。
各決定ステップにおいて、世界モデルは、候補行動に対する将来の状態フィードバックを予測し、エージェントは、このフィードバックの信頼性を推定して、将来の状態リフレクションを行う。
結果として生じるオンライン軌道は、自己蒸留によって世界モデルを更新するために使用され、エージェントの進化する相互作用分布によく一致する。
論文 参考訳(メタデータ) (2026-06-01T15:21:17Z) - Feedback World Model Enables Precise Guidance of Diffusion Policy [36.965417653906535]
本稿では,推定時刻における予測と観測のループを閉じる新たなパラダイムであるフィードバック・ワールド・モデルを提案する。
本手法は,分布シフト時の予測精度とポリシー性能を大幅に向上することを示す。
特に、世界モデルの予測誤差を最大76.4%削減し、アウト・オブ・ディストリビューション(OOD)の成功率を30%改善する。
論文 参考訳(メタデータ) (2026-05-15T07:52:13Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - Current Agents Fail to Leverage World Model as Tool for Foresight [61.82522354207919]
エージェントは、行動する前に結果を予測するためにそれらを使用できます。
本稿では,現在のエージェントがそのような世界モデルを,認知力を高めるツールとして活用できるかどうかを実証的に検討する。
論文 参考訳(メタデータ) (2026-01-07T13:15:23Z) - Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback [51.22403664895878]
Agent2Worldは、強力な推論時ワールドモデル生成を実現するツール拡張マルチエージェントフレームワークである。
また、マルチエージェントフィードバックの生成を基盤にすることで、教師付き微調整のためのデータエンジンとしても機能する。
論文 参考訳(メタデータ) (2025-12-26T18:54:14Z) - RLVR-World: Training World Models with Reinforcement Learning [41.04369775904968]
検証可能な報酬で強化学習を活用する統合フレームワークであるRLVR-Worldを提案する。
我々は,テキストゲーム,Webナビゲーション,ロボット操作など,ドメイン間の言語およびビデオベースの世界モデルにおいて,大幅なパフォーマンス向上を示す。
論文 参考訳(メタデータ) (2025-05-20T05:02:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。