論文の概要: TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors
- arxiv url: http://arxiv.org/abs/2607.12571v1
- Date: Tue, 14 Jul 2026 09:43:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.100492
- Title: TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors
- Title(参考訳): TrustVLA: ビジョン・ランゲージ・アクション・バックドアに対するメカニズム誘導型推論時防御
- Authors: Pinhan Fu, Xianda Guo, Xuetao Li, Wenke Huang, Ruilin Wang, Weiheng Zhao, Wei Sui, Mang Ye,
- Abstract要約: VLA(Vision-Language-Action)モデルは、エンドユーザが監査できないパイプラインを通じてデプロイされる。
小さな視覚トリガーは、障害が観測可能である前に、長い水平ロボットポリシーをリダイレクトする。
個別に提案した2つのVLA攻撃を通してこのギャップについて検討した。
- 参考スコア(独自算出の注目度): 54.12833308568015
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models are deployed through pipelines that end users cannot audit, and a poisoned VLA can behave normally on clean observations while a small visual trigger redirects a long-horizon robot policy before any failure becomes observable. Existing vision or language defenses rarely explain what a triggered VLA representation looks like or how to recover behavior without retraining. We study this gap through two independently proposed VLA attacks from groups with distinct injection strategies, BadVLA and INFUSE; the latter persists after downstream clean adaptation. Across the evaluated poisoned models, we identify a recurring internal mechanism: a \emph{compact causal footprint}, namely a small visual support that is attention-seeded, spatially compact, and \emph{causal} in a precise sense -- masking it returns a clean-calibrated evidence-evolution score to the normal operating region. This footprint motivates TrustVLA, a mechanism-guided inference-time defense that adapts the Dirichlet evidence framework from trusted classification to monitor per-token, per-layer epistemic uncertainty in VLA policies. With only a small clean calibration set, TrustVLA (i)~detects abnormal evidence evolution, (ii)~localizes the compact support by counterfactual mechanism-score drop, and (iii)~recovers the observation by localized inpainting. Across OpenVLA/LIBERO and $π_{0.5}$ transfer evaluations, TrustVLA reduces attack success while preserving clean-task performance, providing a retraining-free, mechanism-guided defense for visual-triggered VLA backdoors.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、エンドユーザが監査できないパイプラインを通じてデプロイされ、毒を盛ったVLAはクリーンな観察で正常に動作し、小さな視覚トリガーは障害が観測される前に長い水平ロボットポリシーをリダイレクトする。
既存のビジョンや言語防衛は、トリガVLA表現がどのようなものか、あるいは再トレーニングせずに振る舞いを回復する方法を説明することはめったにない。
我々はこのギャップを、BadVLAとINFUSEという異なる注射戦略を持つグループから独自に提案された2つのVLA攻撃を通して検討し、後者は下流の清浄な適応後に継続する。
評価された有毒モデル全体で、繰り返し発生する内部メカニズムを識別する: a \emph{compact causal footprint}、すなわち、注意を向け、空間的にコンパクトな小さな視覚的サポートと、正確には \emph{causal} -- マスクすることで、正常な操作領域にクリーンな校正されたエビデンス進化スコアを返す。
このフットプリントはTrustVLAを動機付けている。TrustVLAはメカニズム誘導の推論時防御で、ディリクレのエビデンスフレームワークを信頼された分類から適応し、VLAポリシーにおける階層ごとのエピステミック不確実性を監視する。
小型クリーンキャリブレーションセットTrustVLA
(i) - 異常な証拠の進化。
(ii)~反実的機構スコアドロップによるコンパクトサポートのローカライズ、及び
(iii)-局所塗布による観察を復元する。
OpenVLA/LIBEROおよび$π_{0.5}$転送評価の他、TrustVLAはクリーンタスクのパフォーマンスを維持しながら攻撃成功を低減し、ビジュアルトリガー付きVLAバックドアのトレーニング不要で機構誘導型ディフェンスを提供する。
関連論文リスト
- Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring [35.34120853605602]
textbf-and-Seekは、粗い教師付き学習問題としてVLA障害検出を定式化するフレームワークである。
我々は、LIBERO、VLABench、および3つの代表的なVLAポリシーをまたいだ現実世界のロボットプラットフォームについて、Hie-and-Seekの評価を行った。
論文 参考訳(メタデータ) (2026-05-29T04:40:12Z) - VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies [58.65913948991329]
正確な低レイテンシVLAポリシーのためのビジュアル中間推論フレームワークであるVISUALTHINK-VLAを提案する。
私たちのブートストラップ哲学は、効果的な視覚的思考でアクションを導くことです。
これは、デコードオーバーヘッドを回避しながら空間的精度を保った、コンパクトなビジュアル・エビデンスインターフェースを通じてアクション予測をブートストラップする。
論文 参考訳(メタデータ) (2026-05-28T14:36:53Z) - Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration [24.562540060971273]
VLA(Vision-Language-Action)モデルにより、ロボットは自然言語命令から直接操作タスクを実行することができる。
言語命令がシーンに矛盾する場合でも、VLAポリシーが視覚的に妥当な動作を実行し続ける重要な障害モードを明らかにする。
Instruction-Guided Attention Recalibration (IGAR) を提案する。
論文 参考訳(メタデータ) (2026-03-06T08:01:36Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models [60.39655329875822]
VLA(Vision-Language-Action)モデルは、ロボットが自然言語の命令を解釈し、多様なタスクを実行することを可能にするモデルである。
このようなモデルを攻撃することへの関心は高まっているが、既存の手法の有効性は依然として不明である。
我々はVLA開発ライフサイクルに合わせて統合されたフレームワークであるAttackVLAを提案する。
論文 参考訳(メタデータ) (2025-11-15T10:30:46Z) - TabVLA: Targeted Backdoor Attacks on Vision-Language-Action Models [63.51290426425441]
バックドア付きVLAエージェントは、プレインジェクトされたバックドアによって隠蔽的にトリガーされ、敵のアクションを実行することができる。
我々は,VLAモデルに対するターゲットバックドア攻撃について検討し,ブラックボックスファインチューニングによる攻撃を可能にする新しいフレームワークであるTabVLAを紹介した。
我々の研究は、バックドア操作をターゲットにしたVLAモデルの脆弱性を強調し、より高度な防御の必要性を強調します。
論文 参考訳(メタデータ) (2025-10-13T02:45:48Z) - BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization [45.97834622654751]
BadVLAはObjective-Decoupled Optimizationに基づくバックドア攻撃手法である。
我々は,BadVLAがクリーンタスク精度に最小限の影響を伴って,ほぼ100%の攻撃成功率を達成することを示す。
我々の研究は、VLAモデルにおけるバックドア脆弱性に関する最初の体系的な調査を提供する。
論文 参考訳(メタデータ) (2025-05-22T13:12:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。