論文の概要: Discriminative World Models for Web Agents
- arxiv url: http://arxiv.org/abs/2609.02885v1
- Date: Wed, 02 Sep 2026 17:59:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.487422
- Title: Discriminative World Models for Web Agents
- Title(参考訳): Webエージェントの差別的世界モデル
- Abstract要約: 最近のWebエージェントは、テストタイムアクションの選択に世界モデルを使用し、候補アクションをサンプリングし、結果のWeb状態を予測し、ランキングモデルまたはプロセスリワードモデル(PRM)でランキングする。
予測状態マッチング(英: predict-state matching)は、予測された表現が真の結果状態と、代替行動によって到達した状態とを区別しなければならない訓練目的である。
提案手法は,WebPRMBench上でのPRMスタイルのアクションランキングを改善する。
- 参考スコア(独自算出の注目度): 52.31107486410659
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent web agents use world models for test-time action selection by sampling candidate actions, predicting the resulting web states, and ranking them with a ranker model or a Process Reward Model (PRM). These world models are typically trained via supervised next-state prediction to generate fixed representations like HTML or AXTree snapshots. However, this objective is misaligned with the downstream ranker, which relies on predicted states being discriminative across candidates to accurately score them. To address this, we introduce predicted-state matching, a training objective where the predicted representation must distinguish the true resulting state from those reached by alternative actions. We train these models using a branching web-agent dataset derived from WebArena Go-Browse trajectories, where every decision point contains multiple alternative actions and their resulting states. Experiments on our held-out predicted-state matching benchmark show that our approach outperforms world models trained with supervised next-state prediction. We further show that our approach improves PRM-style action ranking on WebPRMBench compared with action-only PRMs and PRMs augmented with supervised-next-state world models. Finally, on WebArena-Lite, using our world model for test-time action selection improves end-to-end task success. Our project page is available at: https://dhruvpendharkar.github.io/dwm/.
- Abstract(参考訳): 最近のWebエージェントは、テスト時のアクション選択に世界モデルを使用し、候補アクションをサンプリングし、結果のWeb状態を予測し、それらをランキングモデルまたはプロセスリワードモデル(PRM)でランク付けする。
これらのワールドモデルは一般的に、教師付き次世代予測を通じてトレーニングされ、HTMLやAXTreeスナップショットのような固定された表現を生成する。
しかし、この目的は下流のランク付け者とは一致せず、予測された状態が正確に評価するために候補者間で差別的であることに依存している。
予測状態マッチングは,予測表現が真の結果状態と,代替行動によって到達した状態とを区別しなければならない訓練目的である。
我々はこれらのモデルをWebArena Go-Browseトラジェクトリから派生した分岐Webエージェントデータセットを用いてトレーニングする。
得られた予測状態マッチングベンチマーク実験から,本手法は,教師付き次状態予測で訓練した世界モデルより優れていることが示された。
さらに本手法は,WebPRMBench上でのPRMスタイルのアクションランキングを,教師付きnext-state Worldモデルで強化したPRMやPRMと比較して改善することを示す。
最後に、WebArena-Liteでは、テスト時のアクション選択に私たちの世界モデルを使用することで、エンドツーエンドのタスクの成功が向上します。
私たちのプロジェクトページは、https://dhruvpendharkar.github.io/dwm/.com/で公開されています。
関連論文リスト
- World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models [20.97725301919032]
World-Coherent-Decoding (WCD)は、WAMのための自己検証テスト時間計画フレームワークである。
WCDは、将来の候補選択のための軽量オンライン予測器を訓練する。
RoboTwin 2.0では、WCDは限定的なランダム化シーンの監督の下でハードな成功を55.80%ドルから60.90%ドルに改善し、Horizon-3タスクでは+16.43ドルが上昇した。
WAMのテストタイムスケーリングは、信頼できるものを選択することよりも、より多くの未来をサンプリングすることに依存します。
論文 参考訳(メタデータ) (2026-09-02T06:21:36Z) - Impression Share Prediction: An Offline Evaluation Task for Ranking Systems [2.455009405787869]
本稿では,オフライン評価タスクとして,共感共有予測を提案する。
候補者はライブトラフィックを提供していないので、このタスクは本質的に非現実的です。
本研究では,素早い相互作用の信頼信号から印象共有を予測する統計的学習フレームワークを開発する。
論文 参考訳(メタデータ) (2026-08-17T17:52:55Z) - Self-Evolving World Models for LLM Agent Planning [72.99782619992361]
我々はWorldEvolverを紹介した。WorldEvolverは、ダウンストリームエージェントとすべてのモデルパラメータを凍結したまま、デプロイメント時間コンテキストを更新する自己進化型ワールドモデルフレームワークである。
WorldEvolverは3つのバックボーンで最高の予測精度を達成し、下流エージェントの成功率で他のワールドモデルベースラインを導く。
論文 参考訳(メタデータ) (2026-06-29T17:58:43Z) - COMAP: Co-Evolving World Models and Agent Policies for LLM Agents [14.918267305899619]
COMAPは、クローズドループインタラクションを通じてテキストワールドモデルとエージェントポリシーを共進化させる新しいフレームワークである。
各決定ステップにおいて、世界モデルは、候補行動に対する将来の状態フィードバックを予測し、エージェントは、このフィードバックの信頼性を推定して、将来の状態リフレクションを行う。
結果として生じるオンライン軌道は、自己蒸留によって世界モデルを更新するために使用され、エージェントの進化する相互作用分布によく一致する。
論文 参考訳(メタデータ) (2026-06-01T15:21:17Z) - TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation [61.35569005726248]
既存の具体的制御研究は、トレーニングデータとモデルサイズをスケールすることで、顕著なパフォーマンス向上を示す。
拡散や自己回帰モデルのような非決定論的生成モデルは、エンボディドコントロールの分野で広く採用されている。
推測時間サンプリングのためのプラグイン・アンド・プレイフレームワークである textbfTapSampling を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:03:31Z) - Learning Lifted Action Models from Unsupervised Visual Traces [38.479081137300945]
本研究では,状態予測,行動予測,持ち上げ行動モデルなどを共同で学習するディープラーニングフレームワークを提案する。
また,予測崩壊や自己強化エラーを防止するために,MILP(mixed-integer linear program)を導入する。
複数の領域にわたる実験により、MILPベースの補正を統合することで、モデルが局所最適から逃れ、一貫した解へと収束することを示す。
論文 参考訳(メタデータ) (2026-04-21T03:49:04Z) - Beyond State Consistency: Behavior Consistency in Text-Based World Models [58.216587360435305]
本研究では,世界モデルと実環境の機能的整合性を改善することを目的とした,行動整合性トレーニングパラダイムを提案する。
WebShopとTextWorldの実験では、BehRベースのトレーニングによって、いくつかの設定における長期的なアライメントが改善されている。
論文 参考訳(メタデータ) (2026-04-15T12:56:45Z) - Benchmarking World-Model Learning [48.64929865461133]
我々は、異なるが関連する環境において、評価されたフェーズを分離するモデル学習エージェントを評価するためのプロトコルであるWorldTestを提案する。
秋のベンチでは,517人の参加者と3つのモデルを比較した。
人間はいくつかの環境でモデルより優れていますが、他の環境では優れていません。
論文 参考訳(メタデータ) (2025-10-22T17:23:18Z) - WorldPrediction: A Benchmark for High-level World Modeling and Long-horizon Procedural Planning [52.36434784963598]
我々は、異なるAIモデルのワールドモデリングと手続き計画能力を評価するためのビデオベースのベンチマークであるWorldPredictionを紹介する。
現在のフロンティアモデルでは,WorldPrediction-WMでは57%,WorldPrediction-PPでは38%の精度しか達成できないが,人間は両タスクを完璧に解くことができる。
論文 参考訳(メタデータ) (2025-06-04T18:22:40Z) - A Control-Centric Benchmark for Video Prediction [69.22614362800692]
本稿では,アクション条件付きビデオ予測のベンチマークを,制御ベンチマークの形式で提案する。
私たちのベンチマークには、11のタスクカテゴリと310のタスクインスタンス定義を備えたシミュレーション環境が含まれています。
次に、ベンチマークを活用して、スケールするモデルサイズ、トレーニングデータの量、モデルアンサンブルの影響を調査します。
論文 参考訳(メタデータ) (2023-04-26T17:59:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。