論文の概要: PatchWorld: Gradient-Free Optimization of Executable World Models
- arxiv url: http://arxiv.org/abs/2605.30880v1
- Date: Fri, 29 May 2026 06:11:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.413832
- Title: PatchWorld: Gradient-Free Optimization of Executable World Models
- Title(参考訳): PatchWorld: 実行可能な世界モデルのグラディエントフリー最適化
- Abstract要約: 我々は、オフラインのトラジェクトリを実行可能なPythonの世界モデルに変換する、勾配のないフレームワークであるPatchWorldを紹介します。
7つのAgentGym環境の中で、PatchWorld-Simpleはコードベースの計画スコアが最も高い。
人間の特定残差バイアスは, 表面観察精度を向上するが, 判定性は低下する。
- 参考スコア(独自算出の注目度): 69.05094454437402
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-agent environments are typically modeled as partially observable Markov decision processes (POMDPs), assuming that the simulator's latent state and transition dynamics are hidden from the agent. Yet little work has examined whether executable code can be induced to serve as a world model for prediction and planning under partial observability. We introduce PatchWorld, a gradient-free framework that turns offline trajectories into executable Python world models through counterexample-guided code repair. Instead of predicting the next observation with a black-box model, PatchWorld induces symbolic belief-state programs whose action updates can be inspected, replayed, and locally patched. Across seven AgentGym environments, PatchWorld-Simple achieves the highest code-based planning score among evaluated methods, reaching 76.4\% macro success in live one-step lookahead while invoking no LLM calls inside the world-model prediction module itself. We further find that a human-specified residual-memory bias improves surface observation fidelity but weakens decision utility. This exposes a tradeoff in executable world models, since improving observation fidelity can come at the expense of action-discriminative dynamics, and vice versa. Code is available at https://github.com/HKBU-KnowComp/PatchWorld.
- Abstract(参考訳): テキストエージェント環境は一般に部分的に観測可能なマルコフ決定プロセス(POMDP)としてモデル化され、シミュレータの潜伏状態と遷移ダイナミクスがエージェントから隠されていると仮定される。
しかし、実行可能コードが部分的に可観測性の下での予測と計画のワールドモデルとして機能するかどうかを調査する作業はほとんどない。
我々はPatchWorldを紹介した。これは勾配のないフレームワークで、オフラインのトラジェクトリを反例のコード修正によって実行可能Pythonの世界モデルに変換する。
次の観測をブラックボックスモデルで予測する代わりに、PatchWorldは、アクション更新を検査、再生、局所的なパッチ適用が可能なシンボリックな信念状態プログラムを誘導する。
7つのAgentGym環境の中で、PatchWorld-Simpleは評価されたメソッドの中で最も高いコードベースの計画スコアを達成し、ライブワンステップのルックアヘッドで76.4\%のマクロ成功を達成した。
さらに、人間の特定残差バイアスは、表面観察の忠実度を向上させるが、決定ユーティリティを弱める。
これは、観測精度の向上は行動識別力学の犠牲となり、またその逆も生じるため、実行可能な世界モデルにおけるトレードオフを露呈する。
コードはhttps://github.com/HKBU-KnowComp/PatchWorldで入手できる。
関連論文リスト
- Discriminative World Models for Web Agents [52.31107486410659]
最近のWebエージェントは、テストタイムアクションの選択に世界モデルを使用し、候補アクションをサンプリングし、結果のWeb状態を予測し、ランキングモデルまたはプロセスリワードモデル(PRM)でランキングする。
予測状態マッチング(英: predict-state matching)は、予測された表現が真の結果状態と、代替行動によって到達した状態とを区別しなければならない訓練目的である。
提案手法は,WebPRMBench上でのPRMスタイルのアクションランキングを改善する。
論文 参考訳(メタデータ) (2026-09-02T17:59:40Z) - VisualPatchWorld: Code World Models as Latent Structured Representations for Planning [8.39933163242427]
我々は,世界ダイナミクスをコードとして表現したVisualPatchWorld (VPW)を紹介した。
VPWはまず、短いアクティブプローブを持つ定性的な動的形式を選択し、その後、記録された状態-作用トレースからその形式の自由パラメータに適合する。
VPWは69.0%の平均的な計画成功率に達し、最強のコードベースラインを23.5ポイント越えている。
論文 参考訳(メタデータ) (2026-07-28T03:23:47Z) - Self-Evolving World Models for LLM Agent Planning [72.99782619992361]
我々はWorldEvolverを紹介した。WorldEvolverは、ダウンストリームエージェントとすべてのモデルパラメータを凍結したまま、デプロイメント時間コンテキストを更新する自己進化型ワールドモデルフレームワークである。
WorldEvolverは3つのバックボーンで最高の予測精度を達成し、下流エージェントの成功率で他のワールドモデルベースラインを導く。
論文 参考訳(メタデータ) (2026-06-29T17:58:43Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games [26.359796001522707]
Mind-Studioは、状態-作用-次の状態軌道からパイゲームスタイルの世界モデルを合成するフレームワークである。
モンテズマの復讐では、Mind-Studioは選択された次の状態予測をPoE-Worldの0.3%から48.7%に改善し、8つのサブゴールのうち5つを検証する。
論文 参考訳(メタデータ) (2026-06-14T23:53:49Z) - Beyond State Consistency: Behavior Consistency in Text-Based World Models [58.216587360435305]
本研究では,世界モデルと実環境の機能的整合性を改善することを目的とした,行動整合性トレーニングパラダイムを提案する。
WebShopとTextWorldの実験では、BehRベースのトレーニングによって、いくつかの設定における長期的なアライメントが改善されている。
論文 参考訳(メタデータ) (2026-04-15T12:56:45Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - Parallel Stochastic Gradient-Based Planning for World Models [39.699893143984916]
本稿では,学習した世界モデルの識別性を有効に活用する,堅牢で並列性の高いプランナを提案する。
本手法は,ソフトダイナミックス制約による最適化変数(仮想状態)として状態を扱い,並列かつ容易な最適化を実現する。
我々のプランナーはGRASP(GradAxed Planner)と呼ばれ、非凝縮またはコロケーションベースの最適コントローラの有効なバージョンと見なすことができる。
論文 参考訳(メタデータ) (2026-01-31T02:57:47Z) - WorldPrediction: A Benchmark for High-level World Modeling and Long-horizon Procedural Planning [52.36434784963598]
我々は、異なるAIモデルのワールドモデリングと手続き計画能力を評価するためのビデオベースのベンチマークであるWorldPredictionを紹介する。
現在のフロンティアモデルでは,WorldPrediction-WMでは57%,WorldPrediction-PPでは38%の精度しか達成できないが,人間は両タスクを完璧に解くことができる。
論文 参考訳(メタデータ) (2025-06-04T18:22:40Z) - RLVR-World: Training World Models with Reinforcement Learning [41.04369775904968]
検証可能な報酬で強化学習を活用する統合フレームワークであるRLVR-Worldを提案する。
我々は,テキストゲーム,Webナビゲーション,ロボット操作など,ドメイン間の言語およびビデオベースの世界モデルにおいて,大幅なパフォーマンス向上を示す。
論文 参考訳(メタデータ) (2025-05-20T05:02:53Z) - AI in a vat: Fundamental limits of efficient world modelling for agent sandboxing and interpretability [84.52205243353761]
最近の研究は、世界モデルを使用して、AIエージェントをデプロイ前にテストできる制御された仮想環境を生成することを提案する。
評価対象のAIエージェントに非依存な世界モデルを簡単にする方法を検討する。
論文 参考訳(メタデータ) (2025-04-06T20:35:44Z) - Learning World Models for Unconstrained Goal Navigation [4.549550797148707]
本研究では,世界モデル学習のための目標指向探索アルゴリズムであるMUNを紹介する。
MUNは、リプレイバッファ内の任意のサブゴール状態間の状態遷移をモデル化することができる。
その結果、MUNは世界モデルの信頼性を高め、政策の一般化能力を大幅に改善することを示した。
論文 参考訳(メタデータ) (2024-11-03T01:35:06Z) - Defensive Patches for Robust Recognition in the Physical World [111.46724655123813]
データエンドディフェンスは、モデルを変更する代わりに入力データの操作によって堅牢性を改善する。
従来のデータエンドディフェンスは、様々なノイズに対する低一般化と、複数のモデル間での弱い転送可能性を示している。
モデルがこれらの機能をよりよく活用することを支援することにより、これらの問題に対処するための防御パッチ生成フレームワークを提案する。
論文 参考訳(メタデータ) (2022-04-13T07:34:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。