論文の概要: Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators
- arxiv url: http://arxiv.org/abs/2607.07196v1
- Date: Wed, 08 Jul 2026 09:30:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.344742
- Title: Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators
- Title(参考訳): 世界模型シミュレーターの許容度を信頼する前の夢の検証
- Abstract要約: 宣誓供述書として使用される世界モデル(WM)は、その判決が証拠として機能する前に最初に認定されなければならないと我々は主張する。
我々のフレームワークは具体化に依存しず、自律運転でインスタンス化されている。
- 参考スコア(独自算出の注目度): 2.299872239734834
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Across robotics, World Models (WMs) are increasingly used to evaluate action policies by simulating the consequences of actions in an imagined world, and returning a success or safety verdict. Yet a verdict is only as trustworthy as the WM that produced it, and the WM itself needs to be certified. In video-generation WMs, fidelity metrics such as Fréchet Video Distance (FVD) reward visual realism, but ignore whether the world responds correctly to the policy's actions, including those unseen in training. Classical simulation-based validation assumes a trusted simulator evaluating an untrusted policy, whereas generative WMs are themselves unverified learned artifacts. Hence, we argue that any WM used as a test oracle must first be accredited before its verdicts can serve as evidence. Building on credibility practices from safety-critical simulation, including Verification, Validation & Accreditation (VV&A), Safety of the Intended Functionality (SOTIF), and scenario-based testing standards, we define an admissibility ladder (L0-L4) that a WM must climb before its closed-loop verdicts are accepted as assurance evidence. Our framework is embodiment-agnostic, and is instantiated in autonomous driving (AD), where assurance methods for traditional simulation are most mature. Applied to two driving WMs, the lower rungs reveal a reversal: the model that ranks higher on visual generation quality (L0) ranks lower on action-following (L1-L2), so visual fidelity does not predict the action-robustness a closed-loop verdict depends on.
- Abstract(参考訳): ロボット工学全体では、世界モデル(WM)は、想像された世界におけるアクションの結果をシミュレートし、成功または安全性の判断を返すことで、アクションポリシーを評価するためにますます使われています。
しかし、判決はそれを作成したWMに匹敵する信頼性しか持たず、WM自体を認定する必要がある。
ビデオ世代WMでは、フレシェ・ビデオ・ディスタンス (Fréchet Video Distance, FVD) のような忠実度指標は視覚リアリズムに報いるが、トレーニングで見えないものを含め、世界がポリシーの行動に正しく反応するかどうかを無視する。
古典的シミュレーションに基づく検証では、信頼できないポリシーを評価する信頼できるシミュレータが想定されるが、生成的なWMはそれ自体が未検証の学習成果物である。
したがって、私たちは、テストオラクルとして使用されるWMは、その判決が証拠として機能する前に最初に認定されなければならないと論じる。
検証・検証・認定・認定(VV&A)・意図的機能安全(SOTIF)・シナリオベーステスト標準などの安全クリティカルなシミュレーションによる信頼性の実践に基づいて,WMがクローズドループの判断を保証証拠として受け入れる前に上昇しなければならない許容ラグ(L0-L4)を定義する。
従来のシミュレーションの保証手法が最も成熟した自律運転(AD)において,本フレームワークは具体的非依存であり,インスタンス化されている。
視覚生成品質(L0)が高い位置にあるモデル(L1-L2)は、動作追従(L1-L2)よりも低い位置にあるため、クローズドループの判定が依存するアクション損耗を視覚的忠実度が予測しない。
関連論文リスト
- Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering [78.51705689800838]
本稿では, 要求, モデル, 評価器の見直しに, 展開証拠を用いた保証・修正ループを提案する。
そこで我々は,人的判断,エージェント能力,計算能力に対する資源配分問題としてエージェント開発を保証した。
論文 参考訳(メタデータ) (2026-09-10T17:58:48Z) - SimVerity: When Does Simulated Agent Success Survive Physical Deployment? [5.081228499547384]
検証-転送保証フレームワークであるSimVerityを提案する。
ターゲットとするスマートホームデプロイメントのシナリオをリプレイする。
それは、独立して資格のある身体的目撃者に対して、エージェントの実行を横切り検証する。
論文 参考訳(メタデータ) (2026-08-25T19:00:49Z) - WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation [85.15806404962193]
行動条件付き世界モデル(ACWM)は、計画、ポリシー評価、データ生成のためのスケーラブルな予測シミュレータを具現化したAIを提供することを約束する。
物理シミュレータが期待する観測能力を用いてACWMを評価する。
WorldSimProbeは、制御のバリエーション、相互作用のグラウンディングにおける構造化された障害、ダイナミックスにまたがる、システマティックなアクション実現の劣化を明らかにする。
論文 参考訳(メタデータ) (2026-08-10T08:48:06Z) - WM-Cov: Test Adequacy for Interactive World-Model-Style Autonomous Driving Simulation [0.596133719688107]
自律運転のためのインタラクティブなテストインフラストラクチャとして、世界モデルと生成シミュレータが登場している。
本稿では WM-Cov を導入し,インタラクティブな世界モデル型テストの妥当性を定式化する。
WM-Covは、カバレッジの増大、有効な欠陥発見、失敗モードの多様性、リアリズム、アーティファクトの抑制、有効証拠の精度を通じて、妥当性を報告している。
論文 参考訳(メタデータ) (2026-07-31T21:16:20Z) - A Causal Probabilistic Framework for Perception-Informed Closed-Loop Simulation of Autonomous Driving [1.9798595819903433]
ソフトウェア・イン・ザ・ループ (Software-in-the-loop, SIL) シミュレーションは、現代の自動車安全機能を検証する基盤となる。
本稿では, 実世界の知覚行動と地下構造シミュレーションのギャップを埋める, 知覚インフォームドSILテスト手法を提案する。
論文 参考訳(メタデータ) (2026-06-05T11:53:43Z) - World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning [67.93052893044603]
本研究では,抽象的推論を伴う視覚的未来のシミュレーションを,モデルがどのように実行し,検証し,統合するかを考察する。
PF-OPSDは、教師側の特権的文脈としてのみ、地道な未来のビデオと回答を使用して、政治上の具体的な軌道を評価する。
論文 参考訳(メタデータ) (2026-06-02T13:07:49Z) - MANTA: Multi-turn Assessment for Nonhuman Thinking & Alignment [0.1452394725421793]
MANTAは、Inspect AIプラットフォーム上に構築された動的マルチターン評価フレームワークである。
Clude-sonnet-4-20250514およびopenai/gpt-4oの評価を行った。
また, LLM-as-judge 評価において, 体系的フォーマットバイアスを示す制御された4要素法であるSTYLEJUDGEを提案する。
論文 参考訳(メタデータ) (2026-04-18T19:51:32Z) - CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation [68.53387633351484]
有害な行為に対する統計的保証を提供するポスト・ポリティクス・プレアクション保護フレームワークであるCORA(Conformal Risk-control GUI Agent)を提案する。
CORAは、安全を選択的行動実行として再定義する:我々は、提案されたステップごとに行動条件リスクを推定するためにガーディアンモデルを訓練する。
このパラダイムを厳格に評価するために、ステップレベルのハーモラベルを持つモバイル安全違反の新しいベンチマークであるPhone-Harmを紹介する。
論文 参考訳(メタデータ) (2026-04-10T09:41:21Z) - Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models [8.630726904040781]
EVPV(Explicit Visual Premise Verification)は,ステップが依存する視覚的前提の信頼性を段階的に評価する,軽量な検証インターフェースである。
EVPVはステップレベルの検証を改善し、強いベースラインよりも常にBest-of-Nの精度を向上する。
論文 参考訳(メタデータ) (2026-03-17T08:40:26Z) - How Far Can Unsupervised RLVR Scale LLM Training? [57.44753418846446]
検証可能な報酬を伴う教師なし強化学習(URLVR)は、監督ボトルネックを越えてLLMトレーニングをスケールするための経路を提供する。
最近の研究は、モデル固有の信号を活用し、期待できる早期の利得を示しているが、その可能性と限界は未だ不明である。
我々は、URLVRメソッドを報酬源に基づく固有対外部に分類し、統一された理論的枠組みを確立する。
論文 参考訳(メタデータ) (2026-03-09T17:38:11Z) - The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents [37.75212140218036]
コントロの損失リスクを定式化し、これまで過小評価されていた内因性価値の相違(内因性VM)を識別する。
次に、このリスクを体系的に評価するシナリオ駆動フレームワークであるIMPRESSを紹介します。
我々は,21種類のLLMエージェント上での固有のVMの評価を行い,モデル間での安全性のリスクが広く見られることを発見した。
論文 参考訳(メタデータ) (2026-01-24T07:09:50Z) - Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking [64.97768177044355]
大規模言語モデル(LLM)は、現実のファクトチェックシステムにますます多くデプロイされている。
FactArenaは、完全に自動化されたアリーナスタイルの評価フレームワークである。
本研究では,静的クレーム検証精度とエンドツーエンドのファクトチェック能力の相違点を明らかにした。
論文 参考訳(メタデータ) (2026-01-06T02:51:56Z) - Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning [71.19675094463834]
この作業では、モデルが実行前に計画されたアクションを推論し、修正することを可能にする、自己修正型のVLAフレームワークである、Counterfactual VLAを導入している。
CF-VLAはまず、駆動意図を要約した時間分割メタアクションを生成し、その後、メタアクションと視覚コンテキストの両方で条件付けられた反実的推論を実行する。
大規模運転データセットの実験では、CF-VLAは軌道精度を最大17.6%向上し、安全基準を20.5%向上し、適応的思考を示す。
論文 参考訳(メタデータ) (2025-12-30T19:04:17Z) - Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification [17.67273082468732]
検証 -- エージェントの振る舞いに報酬を割り当てる関数 -- は、数学やボードゲームのような分野におけるAIの進歩の鍵となっている。
我々は,Multimodal Large Language Models (MLLM) を,Webナビゲーション,コンピュータ利用,ロボット操作におけるエージェントトラジェクトリの検証手段として評価した。
本稿では,MLLMの知識と推論をより効果的に活用する軽量な手法である自己検証(SGV)を提案する。
論文 参考訳(メタデータ) (2025-07-15T18:50:29Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。