論文の概要: GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs
- arxiv url: http://arxiv.org/abs/2608.04510v1
- Date: Wed, 05 Aug 2026 06:48:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.762456
- Title: GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs
- Title(参考訳): GUARD:拡散型VLAの接地不確かさとアブレーションに基づくリスク検出
- Authors: Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta,
- Abstract要約: 拡散に基づく視覚言語アクション(VLA)ポリシーは、そのタスクを定義する視覚的および言語的エビデンスに、その予測が弱く根付いていても、妥当なアクションを生成することができる。
我々は、事前訓練されたポリシーを変更することなく、このグラウンドを計測するテスト時間障害検出手法であるGUARDを紹介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Diffusion-based vision-language-action (VLA) policies can generate plausible actions even when their predictions are weakly grounded in the visual and language evidence defining the task. We introduce GUARD, a test-time failure detection method that measures this grounding without modifying the pretrained policy. GUARD estimates the influence of token-indexed entries in the final vision-language model key-value (KV) cache, constructs counterfactual caches by ablating salient KV entries, and compares their denoising responses with the original conditioning. Based on the comparison, we derive GUARD diagnostic stream including sensitivity, attention entropy, modality bias, and grounding efficiency, which are calibrated online and processed by a lightweight temporal classifier. We evaluate GUARD under task-held-out splits across five policy-benchmark settings, using Pi0, SmolVLA, and Alpamayo-1.5 on LIBERO, SimplerEnv, MetaWorld, and PhysicalAI-AV. GUARD achieves the best ROC-AUC on four of five unseen-task settings and ranks second on the remaining setting, improving the average unseen-task ROC-AUC by 5.73 percentage points over the strongest competing runtime monitor while remaining within 0.19 points of the best seen-task average. These results show that directly probing action-head dependence on multimodal evidence provides a transferable failure signal across policies, tasks, embodiments, and domains.
- Abstract(参考訳): 拡散に基づく視覚言語アクション(VLA)ポリシーは、そのタスクを定義する視覚的および言語的エビデンスに、その予測が弱く根付いていても、妥当なアクションを生成することができる。
我々は、事前訓練されたポリシーを変更することなく、このグラウンドを計測するテスト時間障害検出手法であるGUARDを紹介する。
GUARDは、最終ビジョン言語モデルキー値(KV)キャッシュにおけるトークンインデックス付きエントリの影響を推定し、適切なKVエントリを非難することで反ファクト的キャッシュを構築し、元の条件と比較する。
本手法では, 感度, 注意エントロピー, モダリティバイアス, グラウンドリング効率などの診断ストリームをオンライン化し, 軽量時間分類器で処理する。
LIBERO,SimplerEnv,MetaWorld,PhysicalAI-AVでは,P0,SmolVLA,Alpamayo-1.5の5つのポリシーベンチマーク設定でGUARDを評価した。
GUARDは5つの目に見えない5つの設定のうち、最高のROC-AUCを達成し、残りの設定では2位にランクインし、最強の競合するランタイムモニターよりも平均のROC-AUCを5.73ポイント改善し、最高の監視タスク平均の0.19ポイント以内に留まる。
これらの結果は、マルチモーダルなエビデンスへのアクションヘッド依存を直接探索することで、ポリシー、タスク、実施状況、ドメイン間の転送可能な障害信号が得られることを示している。
関連論文リスト
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning [16.054905457693824]
視覚的位置認識(VPR)は、ロボット工学アプリケーションにおいて、正確な位置決めと長期の自律ナビゲーションを可能にする重要な手段である。
VLMベースの監査は、最先端の手法に比べて平均13.6%改善している。
論文 参考訳(メタデータ) (2026-07-14T14:30:24Z) - TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors [54.12833308568015]
VLA(Vision-Language-Action)モデルは、エンドユーザが監査できないパイプラインを通じてデプロイされる。
小さな視覚トリガーは、障害が観測可能である前に、長い水平ロボットポリシーをリダイレクトする。
個別に提案した2つのVLA攻撃を通してこのギャップについて検討した。
論文 参考訳(メタデータ) (2026-07-14T09:43:52Z) - LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models [13.30873593845724]
LoopVLAは、表現の洗練、アクション予測、十分性推定を学習する、リカレントなVision-Language-Actionアーキテクチャである。
この結果から,LoopVLAはVLAポリシーの効率性向上のフロンティアを推し進め,パラメータを45%削減し,推論スループットを最大1.7倍向上させることを示した。
論文 参考訳(メタデータ) (2026-05-11T03:51:22Z) - From Frames to Events: Rethinking Evaluation in Human-Centric Video Anomaly Detection [9.404376027901277]
ポースベースのビデオ異常検出(VAD)は、プライバシー保護の性質と環境変動に対する堅牢性において大きな注目を集めている。
従来のフレームレベルの評価では、ビデオは孤立したフレームの集合として扱われ、現実の世界で異常がどのように現れ、行動するかを根本的に誤解している。
本稿では,階層的なガウススムースメントと適応二項化を備えたスコアリファインメントパイプラインと,イベントレベルの検出を直接生成するエンドツーエンドのデュアルブランチモデルという,時間的イベントローカライゼーションのための2つの戦略を紹介する。
論文 参考訳(メタデータ) (2026-04-10T13:52:18Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Contamination Detection for VLMs using Multi-Modal Semantic Perturbation [73.76465227729818]
オープンソースのVision-Language Models (VLM)は、ベンチマークタスクで最先端のパフォーマンスを達成した。
プレトレーニングコーパスは,テストセットリークによるパフォーマンスの低下という,実践者とユーザ双方にとって重要な懸念を提起する。
既存の検出手法が不整合性を示すか,不整合性を示すかを示す。
マルチモーダルなセマンティック摂動に基づく,新しい簡易かつ効果的な検出法を提案する。
論文 参考訳(メタデータ) (2025-11-05T18:59:52Z) - TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in Vision-Language Models [53.91006249339802]
視覚的対人攻撃に対するCLIPの推論ロバスト性を高めるため, TAPT(Test-Time Adversarial Prompt Tuning)と呼ばれる新しい防御手法を提案する。
TAPTは、CLIPの推論プロセスを堅牢化するために、防御的バイモーダル(テキストと視覚)のプロンプトを学習するテストタイムディフェンス手法である。
我々は、ImageNetなど10のゼロショットデータセットを含む11のベンチマークデータセットに対するTAPTの有効性を評価する。
論文 参考訳(メタデータ) (2024-11-20T08:58:59Z) - Policy Smoothing for Provably Robust Reinforcement Learning [109.90239627115336]
入力のノルム有界対向摂動に対する強化学習の証明可能な堅牢性について検討する。
我々は、スムーズなポリシーによって得られる全報酬が、入力の摂動のノルムバウンドな逆数の下で一定の閾値以下に収まらないことを保証した証明書を生成する。
論文 参考訳(メタデータ) (2021-06-21T21:42:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。