論文の概要: Dual-Frontier: When Can an Agent Trust Its World Model?
- arxiv url: http://arxiv.org/abs/2609.26293v2
- Date: Thu, 24 Sep 2026 04:08:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.32172
- Title: Dual-Frontier: When Can an Agent Trust Its World Model?
- Title(参考訳): Dual-Frontier: エージェントはいつ世界モデルを信頼できるのか?
- Abstract要約: 本研究は,世界モデル誘導型意思決定が失敗した場合,エージェントの意思決定ルールと世界モデルが損失を引き起こしたかどうかを,軌跡だけでは明らかにできないことを示す。
我々は、この障害帰属問題を、リターン損失の非実効分解として定式化する。
提案するDual-Frontierは,予測される優位性が決定関連世界モデルエラーの認定境界を超える場合にのみ,世界モデル誘導決定を認める学習原理である。
- 参考スコア(独自算出の注目度): 27.999328033210492
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Learned world models are becoming essential to general-purpose agents: by predicting action consequences, they support planning and decision-making while reducing reliance on costly trial and error. This reliance creates a fundamental ambiguity: when a world-model-guided decision fails, the trajectory alone may not reveal whether the agent's decision rule or the world model caused the loss. We formalize this failure-attribution problem as a counterfactual decomposition of return loss and prove that its components are not identifiable from passive interaction, even for finite-horizon planners. This obstruction motivates Dual-Frontier, a learning principle that admits a world-model-guided decision only when its predicted advantage exceeds a certified bound on decision-relevant world-model error; otherwise, evidence is allocated to world-model verification. Action-conditioned value bounds and a closed-loop extension guarantee non-decreasing return for admitted decisions. Calibrated gates and simultaneous confidence sequences support adaptive evidence reuse, with sufficient and necessary verification bounds. Controlled learned-model experiments validate the predicted failure modes and certification behavior, while cross-backbone tool-use benchmarks instantiate the same verify-then-promote rule in realistic agent world-model pipelines, consistently improving decision quality and reliability.
- Abstract(参考訳): 学習された世界モデルは、汎用エージェントにとって欠かせないものになりつつある。行動の結果を予測することによって、コストのかかる試行錯誤への依存を軽減しつつ、計画と意思決定をサポートする。
この依存は基本的な曖昧さを生じさせる: 世界モデル誘導決定が失敗したとき、その軌道だけではエージェントの決定規則や世界モデルが損失を引き起こしたかどうかを明らかにしないかもしれない。
我々は、この故障帰属問題を、返却損失の反実的分解として定式化し、有限水平プランナーであっても、その成分が受動的相互作用から識別できないことを証明した。
この障害はデュアル=フランティエ(Dual-Frontier)を動機付けている。これは、予測された優位性が決定関連世界モデルエラーの認定境界を超える場合にのみ、世界モデル誘導決定を認める学習原理であり、そうでなければ、証拠は世界モデル検証に割り当てられる。
アクション条件付き値バウンドとクローズドループ拡張は、承認された決定に対する非減少的なリターンを保証する。
校正ゲートと同時信頼シーケンスは、十分な検証境界を持つ適応的エビデンス(英語版)の再利用を支援する。
制御された学習モデル実験は、予測された障害モードと認定動作を検証する一方、クロスバックツール使用ベンチマークは、現実的なエージェントのワールドモデルパイプラインにおいて、同じ検証対象のルールをインスタンス化し、決定品質と信頼性を一貫して改善する。
関連論文リスト
- Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering [78.51705689800838]
本稿では, 要求, モデル, 評価器の見直しに, 展開証拠を用いた保証・修正ループを提案する。
そこで我々は,人的判断,エージェント能力,計算能力に対する資源配分問題としてエージェント開発を保証した。
論文 参考訳(メタデータ) (2026-09-10T17:58:48Z) - FMMO: Detecting the Divergence Between Local Attribution and Global Drift [2.007262412327553]
デプロイ後のドリフトは、アルゴリズム的な説明責任に重大なリスクをもたらす。
モデル信頼性が低下しても, 局所帰属法が誤導安定性を示すことを示す。
本研究では,局所的な説明安定とグローバルな分布シフトの相違を明らかにするために,FMMO(Model Monitoring and Observability)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-05T16:25:59Z) - Where World Models Break: Natural-Input Failure Discovery [13.330611636170103]
本研究では, 自然入力障害発見問題を定式化し, 重度の予測リスクを生じさせる環境変数条件と行動プレフィックスを求める。
本研究では,不確実性誘導型グローバルサーチと型付き局所置換器とのペアリングにより,有効な入力の基盤構造を利用するBassenLensを提案する。
論文 参考訳(メタデータ) (2026-08-23T13:53:15Z) - Self-Evolving World Models for LLM Agent Planning [72.99782619992361]
我々はWorldEvolverを紹介した。WorldEvolverは、ダウンストリームエージェントとすべてのモデルパラメータを凍結したまま、デプロイメント時間コンテキストを更新する自己進化型ワールドモデルフレームワークである。
WorldEvolverは3つのバックボーンで最高の予測精度を達成し、下流エージェントの成功率で他のワールドモデルベースラインを導く。
論文 参考訳(メタデータ) (2026-06-29T17:58:43Z) - Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs [20.59321114618083]
単一ターン診断はRAGの安全性を体系的に過大評価し、矛盾は安全な解決法とは無関係であり、普遍的な即時修正は存在しないことを示した。
モデルが認識するものと何をするかのギャップは、検索強化されたシステムが高レベルな設定で信頼される前に測定され、クローズされなければならない。
論文 参考訳(メタデータ) (2026-05-26T15:18:43Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - TrustLoRA: Low-Rank Adaptation for Failure Detection under Out-of-distribution Data [62.22804234013273]
本稿では,共変量および意味的シフトの両条件下での拒絶による分類を統一し,促進する,単純な故障検出フレームワークを提案する。
キーとなる洞察は、障害固有の信頼性知識を低ランクアダプタで分離し、統合することにより、障害検出能力を効果的かつ柔軟に向上できるということです。
論文 参考訳(メタデータ) (2025-04-20T09:20:55Z) - Online Decision Mediation [72.80902932543474]
意思決定支援アシスタントを学習し、(好奇心)専門家の行動と(不完全)人間の行動の仲介役として機能することを検討する。
臨床診断では、完全に自律的な機械行動は倫理的余裕を超えることが多い。
論文 参考訳(メタデータ) (2023-10-28T05:59:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。