論文の概要: Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2605.09005v1
- Date: Sat, 09 May 2026 15:44:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.014369
- Title: Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models
- Title(参考訳): ビジュアライゼーション・ランゲージ・アクションモデルのためのバックドア型オーナーシップ検証に向けて
- Abstract要約: ここでは、VLA(Vision-Language-Action Model)に特化して設計された、バックドアベースのオーナシップ検証フレームワークであるGuardVLAを紹介する。
GuardVLAは、秘密メッセージを埋め込みビジュアルデータに注入することで、トレーニング中にステルスで無害なバックドアの透かしを保護されたモデルに埋め込む。
リリース後検証のために,トリガープロジェクタと外部分類器ヘッドを用いて組込みバックドアを起動・検出するスワップ・アンド・ディテクト機構を提案する。
- 参考スコア(独自算出の注目度): 17.76088063187756
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action models (VLAs) support generalist robotic control by enabling end-to-end decision policies directly from multi-modal inputs. As trained VLAs are increasingly shared and adapted, protecting model ownership becomes essential for secure deployment and responsible open-source usage. In this paper, we present GuardVLA, the first backdoor-based ownership verification framework specifically designed for VLAs. GuardVLA embeds a stealthy and harmless backdoor watermark into the protected model during training by injecting secret messages into embodied visual data. For post-release verification, we propose a swap-and-detect mechanism, in which the trigger projector and an external classifier head are used to activate and detect the embedded backdoor based on prediction probabilities. Extensive experiments across multiple datasets, model architectures, and adaptation settings demonstrate that GuardVLA enables reliable ownership verification while preserving benign task performance. Further results show that the embedded watermark remains detectable under post-release model adaptation.
- Abstract(参考訳): VLA(Vision-Language-Action Model)は、マルチモーダル入力から直接エンドツーエンドの決定ポリシーを有効にすることにより、汎用的なロボット制御をサポートする。
トレーニングされたVLAが共有され、適応されるにつれて、セキュアなデプロイメントと責任のあるオープンソース利用には、モデルオーナシップの保護が不可欠になる。
本稿では,VLAに特化して設計された初のバックドア型オーナシップ検証フレームワークであるGuardVLAを提案する。
GuardVLAは、秘密メッセージを埋め込みビジュアルデータに注入することで、トレーニング中にステルスで無害なバックドアの透かしを保護されたモデルに埋め込む。
リリース後検証のために,トリガープロジェクタと外部分類器ヘッドを用いて,予測確率に基づいて組込みバックドアを活性化・検出するスワップ・アンド・ディテクト機構を提案する。
複数のデータセット、モデルアーキテクチャ、適応設定にわたる広範な実験により、GardageVLAは、良質なタスクパフォーマンスを維持しながら、信頼性の高いオーナシップ検証を可能にすることが証明された。
さらに, 組込み透かしは, リリース後のモデル適応下で検出可能であることを示した。
関連論文リスト
- Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering [9.737607721974664]
ビジョン-言語モデル(VLM)はモデルサプライチェーンを通じてますます展開される。
本稿では,VLMサプライチェーンにアーキテクチャバックドアを埋め込むことで,悪意のあるプロバイダがこの信頼境界を活用できることを示す。
論文 参考訳(メタデータ) (2026-07-28T09:12:11Z) - TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors [54.12833308568015]
VLA(Vision-Language-Action)モデルは、エンドユーザが監査できないパイプラインを通じてデプロイされる。
小さな視覚トリガーは、障害が観測可能である前に、長い水平ロボットポリシーをリダイレクトする。
個別に提案した2つのVLA攻撃を通してこのギャップについて検討した。
論文 参考訳(メタデータ) (2026-07-14T09:43:52Z) - VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking [49.51251398232003]
VLA-HijackはVision-Language-Actionモデルのための統合された対向フレームワークである。
共有された視覚的自己ローカライゼーションプロセスを活用することで、根本的な脆弱性を悪用する。
ホワイトボックス設定において優れた最適化効率を実現し、クロスアーキテクチャとクロスドメインブラックボックス転送性のための新しいSOTAを設定する。
論文 参考訳(メタデータ) (2026-05-27T07:38:16Z) - Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery [62.75419724651416]
textbfSentinel-VLAは,リアルタイム実行状況を監視するアクティブセンチネルモジュールを備えたメタ認知型VLAモデルである。
すべてのトレーニングデータは、設計したパイプラインを通じて自動生成され、注釈付けされます。
実世界の実験では、Sentinel-VLAはSOTAモデルであるPI0と比較してタスク成功率を30%以上向上することを示した。
論文 参考訳(メタデータ) (2026-05-02T02:10:54Z) - GAVEL: Towards rule-based safety through activation monitoring [2.337566423505956]
大規模言語モデル(LLM)は、有害な行動を検出し予防するために、アクティベーションベースの監視とペアになってきています。
既存のアクティベーション安全性アプローチ、幅広い誤用データセットのトレーニング、精度の低下、柔軟性の制限、解釈可能性の欠如。
本稿では,サイバーセキュリティにおけるルール共有プラクティスにインスパイアされた,ルールベースのアクティベーション安全という新たなパラダイムを紹介する。
論文 参考訳(メタデータ) (2026-01-27T16:31:39Z) - TabVLA: Targeted Backdoor Attacks on Vision-Language-Action Models [63.51290426425441]
バックドア付きVLAエージェントは、プレインジェクトされたバックドアによって隠蔽的にトリガーされ、敵のアクションを実行することができる。
我々は,VLAモデルに対するターゲットバックドア攻撃について検討し,ブラックボックスファインチューニングによる攻撃を可能にする新しいフレームワークであるTabVLAを紹介した。
我々の研究は、バックドア操作をターゲットにしたVLAモデルの脆弱性を強調し、より高度な防御の必要性を強調します。
論文 参考訳(メタデータ) (2025-10-13T02:45:48Z) - Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols [80.68060125494645]
プロトコルとモニタモデルを知っている信頼できないモデルによるアダプティブアタックについて検討する。
我々は、攻撃者がモデル出力に公知またはゼロショットプロンプトインジェクションを埋め込む単純な適応攻撃ベクトルをインスタンス化する。
論文 参考訳(メタデータ) (2025-10-10T15:12:44Z) - BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization [45.97834622654751]
BadVLAはObjective-Decoupled Optimizationに基づくバックドア攻撃手法である。
我々は,BadVLAがクリーンタスク精度に最小限の影響を伴って,ほぼ100%の攻撃成功率を達成することを示す。
我々の研究は、VLAモデルにおけるバックドア脆弱性に関する最初の体系的な調査を提供する。
論文 参考訳(メタデータ) (2025-05-22T13:12:46Z) - PCDiff: Proactive Control for Ownership Protection in Diffusion Models with Watermark Compatibility [23.64920988914223]
PCDiffは、生成品質を規制することによってモデルの認可を再定義するプロアクティブアクセス制御フレームワークである。
PCDIFFはトレーニング可能なfuserモジュールと階層的な認証レイヤをデコーダアーキテクチャに統合する。
論文 参考訳(メタデータ) (2025-04-16T05:28:50Z) - Model Pairing Using Embedding Translation for Backdoor Attack Detection on Open-Set Classification Tasks [63.269788236474234]
バックドア検出のためのオープンセット分類タスクにモデルペアを用いることを提案する。
このスコアは、異なるアーキテクチャのモデルがあるにもかかわらず、バックドアの存在を示す指標であることを示している。
この技術は、オープンセット分類タスク用に設計されたモデル上のバックドアの検出を可能にするが、文献ではほとんど研究されていない。
論文 参考訳(メタデータ) (2024-02-28T21:29:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。