論文の概要: Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency
- arxiv url: http://arxiv.org/abs/2608.29583v1
- Date: Sun, 30 Aug 2026 06:03:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.012849
- Title: Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency
- Title(参考訳): 思考を駆動する:VLA推論-軌道整合性のランタイムモニタリング
- Abstract要約: Chain-of-Thought (CoT) はモデル出力をクロスチェックするための豊富な仕様である。
本稿では,最近のオープンドライビングVLAのCoTがこのようなモニタリングをサポートできるかどうかを評価する。
本稿では,CoTトラジェクトリの整合性チェックをランタイムモニタに統合することを提案する。
- 参考スコア(独自算出の注目度): 7.931305046286546
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous vehicles (AVs) operate in complex environments where failures are consequential. Sophisticated machine learning models for perception and planning are key to overcoming at least part of that complexity, but their black-box nature complicates validation and verification (V&V). The recent integration of Vision-Language-Action (VLA) models into AVs introduces a unique opportunity: besides generating trajectories, these models produce an explicit Chain-of-Thought (CoT) explaining their underlying rationale. This CoT provides a rich specification to cross-check model outputs and detect inconsistencies that may expose unsafe or unintended behavior. This paper assesses whether CoTs from a recent open driving VLA can support such monitoring. We curate DriveAlignBench, a specialized dataset from NVIDIA's Alpamayo 1.5 VLA for AVs containing 150 CoT-trajectory pairs, which we manually annotate for reliability, trajectory consistency, and safety. Our analysis reveals that 33.3% of CoTs are unreliable. Among reliable CoTs, the generated trajectory is consistent with the CoT in 74% of cases. Leveraging this potential, we propose integrating a CoT-trajectory consistency check into a runtime monitor. The check is nontrivial: CoTs express open-vocabulary, scene-relative driving commitments, while trajectories are low-level ego-motion sequences whose semantics depend on road geometry and motion context. To bridge this gap, we develop a family of automated consistency monitors. Our best monitor, lane-relative F-LLM with GPT-5.5, achieves F1 = 0.75, improving over the strongest raw-waypoint LLM baseline by +0.13 absolute F1 and over a rule-based monitor by +0.38. We release DriveAlignBench, the monitor implementations, and annotation tools at https://github.com/776styjsu/drive-the-thoughts.
- Abstract(参考訳): 自律走行車(AV)は、障害が連続的に発生する複雑な環境で運用される。
認識と計画のための洗練された機械学習モデルは、その複雑さの少なくとも一部を克服する鍵であるが、ブラックボックスの性質は検証と検証(V&V)を複雑にする。
近年のVLA(Vision-Language-Action)モデルのAVへの統合は、トラジェクトリの生成に加えて、これらのモデルが基礎となる理論的根拠を説明する明示的なChain-of-Thought(CoT)を生成するという、ユニークな機会をもたらしている。
このCoTは、モデル出力をクロスチェックし、安全でない、意図しない振る舞いを露呈する不整合を検出するためのリッチな仕様を提供する。
本稿では,最近のオープンドライビングVLAのCoTがこのようなモニタリングをサポートできるかどうかを評価する。
DriveAlignBenchはNVIDIAのAlpamayo 1.5 VLAから150のCoT-トラジェクトリペアを含むAV用の特別なデータセットで、信頼性、トラジェクトリ一貫性、安全性を手動でアノテートします。
分析の結果,CoTの33.3%は信頼できないことがわかった。
信頼性の高いCoTのうち、生成された軌道は74%のケースでCoTと一致している。
この可能性を生かして,ランタイムモニタにCoTトラジェクトリ整合性チェックを統合することを提案する。
チェックは簡単ではない: CoT はオープンボキャブラリ、シーン相対駆動のコミットメントを表現し、トラジェクトリは道路の幾何学や動きの文脈に依存する低レベルのエゴモーションシーケンスである。
このギャップを埋めるために、自動整合性モニタのファミリーを開発する。
GPT-5.5 のレーン相対 F-LLM は F1 = 0.75 を達成し,最強の原点 LLM ベースラインを +0.13 絶対 F1 で,ルールベースのモニターを +0.38 で改善した。
DriveAlignBench、モニターの実装、アノテーションツールをhttps://github.com/776styjsu/drive-the- Thoughtsでリリースします。
関連論文リスト
- GenTrack3: Hybrid Stochastic-Deterministic Online Multi-Object Tracking with Cluster-Aware Association [3.259045978275386]
マルチオブジェクト追跡(MOT)は、オブジェクトが動的にシーンに入り、去るときに、一貫したターゲットIDを維持する。
本稿では,不確実性下でのロバストなトラッキングを実現するために,決定論的および推論原理を統合したオンラインフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-10T13:16:17Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures [0.0]
VLAアーキテクチャは、モーター・コマンドレベルで根本的に異なる予測可能な方法で失敗する。
我々は、よく知られた離散/連続的なVLAの区別の結果を定量化する。
論文 参考訳(メタデータ) (2026-05-27T16:44:55Z) - OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models [69.2503510410147]
予め訓練されたVLM上に構築した統合自動運転フレームワークを提案する。
トレーニング済みのVLMアテンションは、純粋言語モデリング以上の強い伝達性を示すことを示す。
エンドツーエンドの自動運転ベンチマークの実験は、最先端のパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-04-20T07:50:00Z) - Bench2Drive-VL: Benchmarks for Closed-Loop Autonomous Driving with Vision-Language Models [50.22099309218635]
自律運転においては、閉ループ評価はオープンループ評価よりも信頼性の高い検証方法として広く認識されている。
本稿では,VLM駆動における閉ループ評価を実現するBench2Drive-VLについて述べる。
論文 参考訳(メタデータ) (2026-04-01T11:38:46Z) - COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm [59.26203051651017]
C-TAOはOpen-Vocabulary Multi-Object Tracking (OVMOT)のための最初の連続アノテーション付きトレーニングセットである
フレームワークボトルネックに対するCOVTrack++は,3つのモジュールによる検出とアソシエーションの双方向相互機構を実現するための相乗的フレームワークである。
TAOの実験では、新しいTAAは検証とテストセットで35.4%、30.5%に達し、新しいAssocAは4.8%、新しいLocAは5.8%向上した。
論文 参考訳(メタデータ) (2026-03-25T07:20:27Z) - Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity [3.117948413097524]
CoT(Chain-of- Thought)出力によって、モデルのステップバイステップ推論を読み取ることができます。
BBH,GPQA,MMLUの命令調整モデルと推論モデルについて検討した。
論文 参考訳(メタデータ) (2025-10-31T11:14:39Z) - A Pragmatic Way to Measure Chain-of-Thought Monitorability [10.811252340660907]
CoT(Chain-of-Thought)モニタリングは、AIの安全性にユニークな機会を提供する。
監視可能性を維持するために,可視性とカバレッジという2つのコンポーネントを測定するための実用的手法を提案する。
我々はこれらのメトリクスをオートラッタープロンプトで実装し、任意の有能なLCMが既存のCoTの可視性とカバレッジを計算できるようにする。
論文 参考訳(メタデータ) (2025-10-28T00:44:25Z) - Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured Videos [58.156141601478794]
マルチオブジェクトトラッキング(UAVT)は、ビデオのフレーム間で一貫したアイデンティティを維持しながら、複数のオブジェクトを追跡することを目的としている。
既存の手法は、通常、動作キューと外観を別々にモデル化し、それらの相互作用を見渡して、最適下追跡性能をもたらす。
本稿では、AMC行列とMTCモジュールの2つの主要コンポーネントを通して、外観と動きの手がかりを利用するAMOTを提案する。
論文 参考訳(メタデータ) (2025-08-03T12:06:47Z) - Mitigating Deceptive Alignment via Self-Monitoring [15.365589693661823]
我々は,CoT Monitor+という,自己監視をチェーン・オブ・シントプロセス自体に組み込むフレームワークを開発した。
生成中、モデルは(i)通常の推論ステップを生成し、(ii)不整合戦略のフラグと抑制のために訓練された内部自己評価信号を生成する。
この信号は強化学習の補助的な報酬として使われ、正直な推論に報いるフィードバックループを作成し、隠れた目標を阻止する。
論文 参考訳(メタデータ) (2025-05-24T17:41:47Z) - BEVTrack: A Simple and Strong Baseline for 3D Single Object Tracking in Bird's-Eye View [54.48052449493636]
3Dシングルオブジェクトトラッキング(SOT)はコンピュータビジョンの基本課題であり、自律運転のようなアプリケーションにおいて重要な役割を果たす。
BEVTrackは、シンプルだが効果的な動きに基づくトラッキング手法である。
我々は,BEVTrackが200FPSで動作しながら最先端の結果を達成し,リアルタイム適用性を実現していることを示す。
論文 参考訳(メタデータ) (2023-09-05T12:42:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。