論文の概要: When Shared Rollouts Fail in Defensive Driving Evaluation: A NAVSIM Score Basis Audit
- arxiv url: http://arxiv.org/abs/2608.04896v1
- Date: Wed, 05 Aug 2026 14:22:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.959199
- Title: When Shared Rollouts Fail in Defensive Driving Evaluation: A NAVSIM Score Basis Audit
- Title(参考訳): 防犯運転評価における共有ロールアウトの障害:NAVSIMスコアベイシ監査
- Authors: Ziang Wei, Minjun Yu, Zheyuan Lai, Mingjie Pang, Wei Li,
- Abstract要約: 再シミュレーションベンチマークでは、基準条件付き許しを使用し、ログされた人間の参照がコンプライアンスチャネルに障害が発生した場合、エージェントがクレジットを受け取る。
我々はこのリスクをNAVSIM v2.2のオリジナルシーンシングルステージスコアで評価する。
- 参考スコア(独自算出の注目度): 2.823425836233287
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Defensive driving scores are useful only when they preserve distinctions between policies that observe surrounding actors and those that do not. Re-simulation benchmarks may use reference-conditioned forgiveness, under which an agent receives credit when the logged human reference fails a compliance channel. When agent and reference share an unstable rollout transformation, this rule can propagate shared reference failures into broad compliance credit. We audit this risk in NAVSIM v2.2 original scene single-stage scoring. Under the affected documented-stack condition on the audited numerical backend, the route-blind Ignore-All probe and a route-aware actor-blind probe outrank human replay and PDM-Closed over the complete 12,146-token navtest split. A fresh installation following the public specification reproduces rollout divergence on a fixed 32-token diagnostic set. A same-source dependency stack control and an exact-input diagnostic isolate dependency-sensitive numerical behavior in the shared velocity refit. On a 450-token control pool, replacing only the solver eliminates rollout divergence and restores blind-last ordering while keeping forgiveness enabled. Thus, the numerical instability is the direct trigger. Reference-conditioned forgiveness propagates the resulting shared reference failures into compliance credit. We contribute an audit protocol requiring score basis and stack disclosure, blind probes, overwrite reporting, and rollout stability tests before using such scores for defensive driving claims.
- Abstract(参考訳): 防御運転スコアは、周囲のアクターとそうでないアクターを観察するポリシーの区別を保持する場合にのみ有用である。
再シミュレーションベンチマークでは、基準条件付き許しを使用し、ログされた人間の参照がコンプライアンスチャネルに障害が発生した場合、エージェントがクレジットを受け取る。
エージェントと参照が不安定なロールアウト変換を共有する場合、このルールは共有参照失敗を広範なコンプライアンスクレジットに伝達することができる。
我々はこのリスクをNAVSIM v2.2のオリジナルシーンシングルステージスコアで評価する。
評価された数値バックエンド上の文書化スタック条件下では、ルートブルドIgnore-Allプローブとルートブルドアクター-オールプローブは人間のリプレイを上回り、PDM-Closedは完全な12,146のナヴテストスプリットを乗り越えた。
パブリック仕様に続く新しいインストールは、固定された32トークンの診断セット上でロールアウトのばらつきを再現する。
同ソースの依存性スタック制御と正確な入力診断により,共有速度補正における依存性に敏感な数値的挙動を推定する。
450トンの制御プールでは、解凍器のみを置き換えることで、ロールアウトのばらつきを排除し、許しを保ちながらブラインドラストの注文を復元する。
したがって、数値不安定が直接引き金となる。
参照条件付き許しは、結果の共有参照失敗をコンプライアンスクレジットに伝達する。
本稿では, スコアベースとスタック開示, ブラインドプローブ, オーバーライト報告, ロールアウト安定性テストを必要とする監査プロトコルを, ディフェンスドライビングクレームに使用する前に提案する。
関連論文リスト
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents [5.91817208489443]
検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
論文 参考訳(メタデータ) (2026-07-27T11:45:14Z) - Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs [4.721990925113432]
修飾言語モデルは、非証拠的な圧力下で定期的に誤レポートされる。
我々は2つの要求を調査し、抵抗(不当な圧力)と更新(認可された証拠をフォロー)する。
低ランクレポートのコーディネートを慎重にローカライズして,回答,信頼,注意を喚起する。
論文 参考訳(メタデータ) (2026-07-14T17:28:25Z) - Verification of Adaptive Agentic Controllers through Finite Rule Revision [0.0]
本稿では,有限記号規則で表される適応エージェント制御系に対する有界検証プロトコルを定式化する。
診断の失敗は、ルールの追加、ルール削除、優先度修正など、事前に定義されたルールレベルの編集にマップされる。
修理されたコントローラは、保持されたシミュレーションシードまたはクローンされた初期状態に基づいて評価される。
論文 参考訳(メタデータ) (2026-07-07T13:38:01Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - Benchmarking Recursive-Collapse Warning Claims Under Matched False-Positive Control [0.0]
再帰的なシステムは、過度な失敗が見える前に、崩壊のような状態に入ることができる。
障害が指向性テレメトリパターンに従うかどうかをテストするためのクレームバウンド型ベンチマークフレームワークであるLoopzeroを紹介した。
凍結した2つの公開アーティファクトベンチマークのブリッジを評価する。
論文 参考訳(メタデータ) (2026-05-29T20:12:42Z) - Auditing Privacy in Multi-Tenant RAG under Account Collusion [1.253312107729806]
マルチテナント検索拡張生成サービスは、ログ単位の差分プライバシーを操作リーク境界として宣伝する。
我々は、同一インデックスのマルチアカウント共謀をプライバシ境界障害とみなす。
修正されていないRAGデプロイメントに対して動作する最初の監査プロトコルを設計する。
論文 参考訳(メタデータ) (2026-05-19T13:41:59Z) - Counterfactual Likelihood Tests for Indirect Influence in Private Reasoning Channels [51.56484100374058]
本稿では,私的推論チャネル間の影響を測定するための実証実験について述べる。
この方法は、上流のプライベートブロックを長さマッチングドナーブロックに置き換え、公開トークンシーケンスと下流ターゲットを固定し、下流ターゲットの負のログに似たシフトを測定する。
論文 参考訳(メタデータ) (2026-05-18T20:27:43Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。