論文の概要: Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring
- arxiv url: http://arxiv.org/abs/2605.30834v1
- Date: Fri, 29 May 2026 04:40:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.390063
- Title: Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring
- Title(参考訳): トラジェクトリにおけるHie-and-Seek: VLAランタイム監視のための障害信号の発見
- Authors: Seongheon Park, Wendi Li, Changdae Oh, Samuel Yeh, Zsolt Kira, Michael Hagenow, Sharon Li,
- Abstract要約: textbf-and-Seekは、粗い教師付き学習問題としてVLA障害検出を定式化するフレームワークである。
我々は、LIBERO、VLABench、および3つの代表的なVLAポリシーをまたいだ現実世界のロボットプラットフォームについて、Hie-and-Seekの評価を行った。
- 参考スコア(独自算出の注目度): 35.34120853605602
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models enable robots to follow natural language instructions and generalize across diverse tasks, but they remain vulnerable to execution failures that compromise reliability in real-world deployment. Detecting such failures during execution is therefore critical for the robust deployment of embodied systems. Existing failure detection methods either rely on expensive action resampling or external models, while alternatives propagate trajectory-level labels uniformly across every timestep, obscuring localized failure signals. In this paper, we propose \textbf{Hide-and-Seek}, a framework that formulates VLA failure detection as a coarsely supervised learning problem. By combining inter-trajectory and intra-trajectory contrastive objectives, Hide-and-Seek localizes failure-indicative actions and induces temporally structured failure signals from trajectory-level supervision alone, without any step-level annotation. We evaluate Hide-and-Seek on LIBERO, VLABench, and a real-world robotic platform across three representative VLA policies: OpenVLA, $π_0$, and $π_{0.5}$.Our method achieves state-of-the-art multi-task failure detection performance with a practical accuracy--timeliness trade-off under conformal prediction, and generalizes well to both seen and unseen tasks.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、ロボットが自然言語の指示に従い、さまざまなタスクを一般化することを可能にする。
したがって、実行中にそのような障害を検出することは、実施されたシステムのロバストな展開に不可欠である。
既存の障害検出方法は高価なアクションサンプリングか外部モデルに依存し、代替手段は各時間ステップにわたって軌道レベルのラベルを均一に伝播し、局所的な障害信号を隠蔽する。
本稿では,VLA故障検出を粗い教師付き学習問題として定式化するフレームワークである「textbf{Hide-and-Seek}」を提案する。
トラジェクティブ間およびトラジェクティブ内コントラスト目的を組み合わせることで、Hie-and-Seekは障害指示アクションをローカライズし、ステップレベルのアノテーションを使わずに、トラジェクトリレベルの監視のみから時間的に構造化された障害信号を誘導する。
LIBERO, VLABench, and a real-world robotic platform across three representative VLA policy: OpenVLA, $π_0$, $π_{0.5}$。
提案手法は, 精度の高いマルチタスク故障検出性能を実現し, 整合予測の下でのタイムリなトレードオフを実現し, 目に見えるタスクと目に見えないタスクの両方に最適化する。
関連論文リスト
- Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models [32.87104367896446]
本稿では,拡散型および流路型VLAポリシーに対する適応的負のガイダンスとして,障害軌跡を利用するエンドツーエンドフレームワークを提案する。
AFILはトレーニング済みのVLAを使用して、オンラインの障害ロールアウトを生成する。
その後、デュアルアクションジェネレータ(DAG)を共同で訓練し、共通の視覚言語バックボーンを共有しながら、動作が成功し失敗する。
論文 参考訳(メタデータ) (2026-05-08T19:57:11Z) - Failure Identification in Imitation Learning Via Statistical and Semantic Filtering [2.2515832864485024]
ロボット工学における模倣学習(IL)ポリシは、制御された設定において強力なパフォーマンスを提供するが、実際のデプロイメントでは脆弱である。
本稿では、ポリシーに依存しない障害検出モジュールFIDeL(Failure Identification in Demonstration Learning)を紹介する。
また,ロボット工学における故障検出のための実世界のタスクのマルチモーダルデータセットであるBotFailsを紹介した。
論文 参考訳(メタデータ) (2026-04-15T12:27:32Z) - TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models [59.13964209628383]
VLA(Vision-Language-Action)ポリシーは、言語指示や視覚的な観察をロボット行動にマッピングする上で大きな進歩を見せている。
本稿では,VLA政策における乱れや外見に起因したバイアスを明示的に軽減する単純な推論時ガイダンス機構であるTAG(Target-Agnostic Guidance)を提案する。
我々は, LIBERO, LIBERO-Plus, VLABenchなどの標準操作ベンチマーク上でTAGを評価し, クラッタ下での堅牢性を一貫して改善し, ニアミスや不正なオブジェクト実行を減らす。
論文 参考訳(メタデータ) (2026-03-25T17:56:32Z) - From Knowing to Doing Precisely: A General Self-Correction and Termination Framework for VLA models [42.553888395227766]
本稿では、視覚言語アクション(VLA)モデルのための軽量でトレーニング不要なフレームワークを提案する。
VLA-SCTは自己修正制御ループとして動作し、データ駆動型アクションリファインメントと条件論理を組み合わせて終了する。
本手法は,LIBEROベンチマークのすべてのデータセットに対して一貫した改善を実現する。
論文 参考訳(メタデータ) (2026-02-02T08:44:40Z) - CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding [60.06899554269808]
サイクロンVLA(CycleVLA)は、VLA(Vision-Language-Action Model)を積極的に自己補正するシステムである。
CycleVLAは、重要なサブタスク遷移ポイントにフラグを付けるプログレス対応のVLAを統合することで、これを実現する。
大規模な実験により、CycleVLAは、よく訓練されたVLAと訓練されていないVLAの両方のパフォーマンスを改善することが示された。
論文 参考訳(メタデータ) (2026-01-05T17:31:01Z) - Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models [53.20969621498248]
本稿では,多種多様な計画および実行障害を生成するために,軌道を手続き的に乱す自動ロボット故障合成手法を提案する。
RLBench-Fail, BridgeDataV2-Fail, UR5-Failの3つの新しい故障検出ベンチマークを構築した。
次に、詳細な障害推論と検出のためのマルチビューイメージを備えたVLMであるGuardianをトレーニングします。
論文 参考訳(メタデータ) (2025-12-01T17:57:27Z) - Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [56.66677293607114]
オープンセットのリアクティブかつアクティブな障害検出のためのCode-as-Monitor(CaM)を提案する。
モニタリングの精度と効率を高めるために,制約関連エンティティを抽象化する制約要素を導入する。
実験により、CaMは28.7%高い成功率を達成し、厳しい乱れの下で実行時間を31.8%短縮することが示された。
論文 参考訳(メタデータ) (2024-12-05T18:58:27Z) - Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress [31.952925824381325]
本稿では,障害検出を補完する2つのカテゴリに分割するランタイム監視フレームワークを提案する。
視覚言語モデル(VLM)を用いて、ポリシーがタスクを解決しないアクションを確実かつ一貫して行うことを検知する。
時間的一貫性検出とVLMランタイム監視を統一することにより、Sentinelは2つの検出器のみを使用する場合よりも18%の障害を検出する。
論文 参考訳(メタデータ) (2024-10-06T22:13:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。