論文の概要: SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration
- arxiv url: http://arxiv.org/abs/2608.04246v1
- Date: Tue, 04 Aug 2026 21:57:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.646115
- Title: SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration
- Title(参考訳): SAFECAST:コントラスト・セット・トレーニングと校正によるVLAポリシーのロバスト故障検出
- Abstract要約: コントラストセットの摂動を利用して、隠れ状態プローブのトレーニングと展開時間シフトの校正を改善するSAFECASTを導入する。
SAFECASTは、データ増大に視覚的・言語的コントラストセットの摂動を用いる場合が最も有用であり、コントラストセットの摂動では、sim-to-realキャリブレーションが実際のロールアウトデータのみを使用するよりも優れたプローブをもたらす。
- 参考スコア(独自算出の注目度): 9.238827766981291
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action policies often fail under deployment-time distribution shifts such as clutter, distractor objects, lighting changes, novel objects, altered initial states, and reworded instructions. Hidden-state-based risk probes combined with functional conformal prediction can detect rollout failures, but their reliability depends on calibration data matching deployment conditions. We introduce SAFECAST, which leverages contrast set perturbations to improve hidden-state probe training and calibration for deployment time shift. SAFECAST statistically significantly improves failure detection ROC-AUC scores over a state of the art baseline in both real-world DROID and LIBERO simulation experiments across multiple VLM backbones. We further find that SAFECAST benefits most when both visual and language contrast set perturbations are used to augment data, and that with contrast set perturbations, sim-to-real calibration leads to better probes than using real rollout data only.
- Abstract(参考訳): 視覚言語によるアクションポリシーは、乱雑な、邪魔なオブジェクト、照明の変更、新しいオブジェクト、初期状態の変更、リワード命令などのデプロイメント時の分散シフトで失敗することが多い。
隠れ状態に基づくリスクプローブと機能的適合予測を組み合わせることで、ロールアウト障害を検出することができるが、その信頼性はデプロイメント条件と一致するキャリブレーションデータに依存する。
コントラストセットの摂動を利用して、隠れ状態プローブのトレーニングと展開時間シフトの校正を改善するSAFECASTを導入する。
SAFECASTは、複数のVLMバックボーンにまたがる実世界のDROIDおよびLIBEROシミュレーション実験において、最先端のベースライン上での障害検出ROC-AUCスコアを統計的に有意に改善する。
さらに、SAFECASTは、視覚的コントラストと言語的コントラストの摂動がデータ増大に使用される場合に最も有用であり、コントラストセットの摂動では、sim-to-realキャリブレーションが実際のロールアウトデータのみを使用するよりも優れたプローブをもたらすことが判明した。
関連論文リスト
- Conformal Changepoint Localization and Root Cause Analysis with Corrupted Observations [55.76952683833966]
本稿では,データ破損時の信頼性設定サイズを低減するために,重み付きCONCH(W-CONCH)と重み付きCROC(W-CROC)を提案する。
画像ベースおよび実世界の変化点と根本原因ベンチマークの実験は、不確実性ベースの重み付けが信頼性セットのサイズを大幅に減少させることを示している。
論文 参考訳(メタデータ) (2026-07-29T05:16:59Z) - Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking [58.338848435042536]
RGB-Eventトラッキングは、イベントセンサからRGB外観テクスチャと高密度時間運動キューを融合することにより、ローカライズを改善する。
現実世界のシーンは、従来のマルチモーダル融合を妨げる多様な構造的な信号劣化に悩まされる。
本稿では,RGBイベント追跡に適した階層的摂動・検索フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-24T23:34:06Z) - Reliability-Guided Adaptive Ensembling for Robust Test-Time Adaptation [21.989744597091192]
テスト時間適応(TTA)は、ソースデータなしでドメインシフトを行うことができるが、逆向きに汚染されたテストストリームの下では、非常に脆弱である。
本研究は, 標準TTAと比較し, 相対的に過小評価されている, 対向ストリーム設定におけるRTTAについて検討する。
RTTAのためのトレーニング不要な信頼性誘導型拡張ラッパーSAFERを提案する。
論文 参考訳(メタデータ) (2026-06-21T06:20:22Z) - VLA-FAIL: Efficient Task Failure Detection for Finetuned Vision-Language-Action Models [19.137291311347788]
視覚言語アクションモデル(VLA)は、多くのロボットタスクで最先端のパフォーマンスを達成するが、それでも、アウト・オブ・ディストリビューションのシナリオでは予測不可能に振る舞うことができる。
本稿では、2つの新しい障害検出器を最小限のオーバーヘッドで結合するフレームワークであるVLA-FAILを提案する。
論文 参考訳(メタデータ) (2026-06-19T12:51:21Z) - Trust, Geometry, and Rules: A Credibility-Aware Reinforcement Learning Framework for Safe USV Navigation under Uncertainty [32.34854002457735]
本稿では,信頼性を意識した学習,幾何的安全遮蔽,連続ルール認識の埋め込みを組み込んだフレームワークを提案する。
本研究は,直観的不整合に対するトレーニングの堅牢性の向上と衝突回避性の向上,およびベースラインに対するCOLREGのコンプライアンスについて述べる。
論文 参考訳(メタデータ) (2026-05-26T12:59:43Z) - FACTOR: Counterfactual Training-Free Test-Time Adaptation for Open-Vocabulary Object Detection [63.91351553178842]
FACTORはオープン語彙オブジェクト検出のためのトレーニング不要なテスト時間適応である。
属性依存性の予測を選択的に抑制するために、属性の感度、意味的関連性、予測のバリエーションを定量化する。
PASCAL-C, COCO-C, FoggyCityscapes の実験では、FACTOR が従来の TTA 法より一貫して優れていたことが示されている。
論文 参考訳(メタデータ) (2026-05-05T02:31:18Z) - Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models [48.89466384943165]
VLA(Vision-Language-Action Model)は、逐次的な意思決定において優れた性能を発揮するが、微妙な環境変化に対して脆弱である。
検証自由なテスト時間適応フレームワークである遅延フィードバックを用いた摂動学習(PDF)を提案する。
論文 参考訳(メタデータ) (2026-04-20T11:25:51Z) - TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models [59.13964209628383]
VLA(Vision-Language-Action)ポリシーは、言語指示や視覚的な観察をロボット行動にマッピングする上で大きな進歩を見せている。
本稿では,VLA政策における乱れや外見に起因したバイアスを明示的に軽減する単純な推論時ガイダンス機構であるTAG(Target-Agnostic Guidance)を提案する。
我々は, LIBERO, LIBERO-Plus, VLABenchなどの標準操作ベンチマーク上でTAGを評価し, クラッタ下での堅牢性を一貫して改善し, ニアミスや不正なオブジェクト実行を減らす。
論文 参考訳(メタデータ) (2026-03-25T17:56:32Z) - Transformer-Based Predictive Maintenance for Risk-Aware Instrument Calibration [0.13543803103181612]
キャリブレーションスケジューリングを予測的メンテナンス問題として検討する。
我々は、NASA C-MAPSSベンチマークをキャリブレーション設定に適合させる。
本研究では,条件に基づくキャリブレーションを共同予測と決定の問題とみなすことができることを示す。
論文 参考訳(メタデータ) (2026-03-19T06:32:01Z) - Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision [0.29316801942271303]
本研究は, 視覚言語モデル (VLM) を実用的検出法として検討する。
評価は、精度、精度、リコール、F1、ROC-AUC、および検出品質と効率を共同で定量化する平均クリック毎のレイテンシにまたがる。
論文 参考訳(メタデータ) (2026-03-03T11:42:47Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Learning Robust Output Control Barrier Functions from Safe Expert Demonstrations [50.37808220291108]
本稿では,専門家によるデモンストレーションの部分的な観察から,安全な出力フィードバック制御法を考察する。
まず,安全性を保証する手段として,ロバスト出力制御バリア関数(ROCBF)を提案する。
次に、安全なシステム動作を示す専門家による実証からROCBFを学習するための最適化問題を定式化する。
論文 参考訳(メタデータ) (2021-11-18T23:21:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。