論文の概要: When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens
- arxiv url: http://arxiv.org/abs/2602.03153v1
- Date: Tue, 03 Feb 2026 06:09:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:41.12088
- Title: When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens
- Title(参考訳): 注意:視覚トークンの再構築によるロボット政策におけるバックドアアタックの消去
- Authors: Xuetao Li, Pinhan Fu, Wenke Huang, Nengyuan Pan, Songhua Yang, Kaiyan Zhao, Guancheng Wan, Mengde Li, Jifeng Xuan, Miao Li,
- Abstract要約: 視覚言語アクション(VLA)モデルの下流での微調整はロボティクスを強化するが、パイプラインをバックドアのリスクに晒す。
本稿では,遅延空間のローカライゼーションによって異常な注意を払ってトークンを検出するテスト時間バックドアフレームワークであるBelaを紹介する。
ベラは名目のパフォーマンスを効果的に維持し、攻撃の成功率を大幅に低下させ、バックドア出力から常に良質な振る舞いを復元する。
- 参考スコア(独自算出の注目度): 32.50082492538355
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Downstream fine-tuning of vision-language-action (VLA) models enhances robotics, yet exposes the pipeline to backdoor risks. Attackers can pretrain VLAs on poisoned data to implant backdoors that remain stealthy but can trigger harmful behavior during inference. However, existing defenses either lack mechanistic insight into multimodal backdoors or impose prohibitive computational costs via full-model retraining. To this end, we uncover a deep-layer attention grabbing mechanism: backdoors redirect late-stage attention and form compact embedding clusters near the clean manifold. Leveraging this insight, we introduce Bera, a test-time backdoor erasure framework that detects tokens with anomalous attention via latent-space localization, masks suspicious regions using deep-layer cues, and reconstructs a trigger-free image to break the trigger-unsafe-action mapping while restoring correct behavior. Unlike prior defenses, Bera requires neither retraining of VLAs nor any changes to the training pipeline. Extensive experiments across multiple embodied platforms and tasks show that Bera effectively maintains nominal performance, significantly reduces attack success rates, and consistently restores benign behavior from backdoored outputs, thereby offering a robust and practical defense mechanism for securing robotic systems.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルの下流での微調整はロボティクスを強化するが、パイプラインをバックドアのリスクに晒す。
攻撃者は、毒入りデータにVLAを事前訓練して、ステルス性を維持しながら推論中に有害な行動を起こさせるバックドアを移植することができる。
しかし、既存の防衛は、マルチモーダルバックドアに関する機械的な洞察を欠いているか、フルモデル再訓練による計算コストの禁止を課している。
バックドアは後段の注意をリダイレクトし、クリーン多様体の近傍にコンパクトな埋め込みクラスタを形成する。
この知見を生かして、潜伏空間の局所化による異常な注意を伴うトークンを検出するテスト時間バックドア消去フレームワークであるBellaを導入し、深い層状キューを用いて疑わしい領域をマスクし、トリガフリーイメージを再構築し、正しい振る舞いを復元しながらトリガ・アンセーフ・アクションマッピングを破る。
以前の防衛と異なり、ベラはVLAの再訓練も訓練パイプラインの変更も必要としない。
複数の具体的プラットフォームとタスクにわたる大規模な実験により、ベラは名目のパフォーマンスを効果的に維持し、攻撃の成功率を著しく低減し、バックドアアウトプットから良質な振る舞いを継続的に回復し、ロボットシステムを保護するための堅牢で実用的な防御メカニズムを提供することを示した。
関連論文リスト
- TabVLA: Targeted Backdoor Attacks on Vision-Language-Action Models [63.51290426425441]
バックドア付きVLAエージェントは、プレインジェクトされたバックドアによって隠蔽的にトリガーされ、敵のアクションを実行することができる。
我々は,VLAモデルに対するターゲットバックドア攻撃について検討し,ブラックボックスファインチューニングによる攻撃を可能にする新しいフレームワークであるTabVLAを紹介した。
我々の研究は、バックドア操作をターゲットにしたVLAモデルの脆弱性を強調し、より高度な防御の必要性を強調します。
論文 参考訳(メタデータ) (2025-10-13T02:45:48Z) - Unlearn to Relearn Backdoors: Deferred Backdoor Functionality Attacks on Deep Learning Models [6.937795040660591]
バックドア攻撃の新たなパラダイムとして,Deferred Activated Backdoor Functionality (DABF)を紹介した。
従来の攻撃とは異なり、DABFは当初バックドアを隠蔽し、起動しても良質な出力を生成する。
DABF攻撃は、マシンラーニングモデルのライフサイクルで一般的なプラクティスを利用して、モデル更新と初期デプロイ後の微調整を実行する。
論文 参考訳(メタデータ) (2024-11-10T07:01:53Z) - BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models [57.5404308854535]
大型言語モデル(LLM)における安全バックドア攻撃は、正常な相互作用中の検出を回避しながら、安全でない振る舞いをステルス的に引き起こすことができる。
モデル埋め込み空間において,バックドアトリガーが比較的均一なドリフトを引き起こすという知見を活かした緩和手法であるBEEARを提案する。
両レベル最適化手法は、不要な振る舞いを誘発する普遍的な埋め込み摂動を特定し、モデルパラメータを調整し、これらの摂動に対する安全な振舞いを強化する。
論文 参考訳(メタデータ) (2024-06-24T19:29:47Z) - Mitigating Backdoor Attack by Injecting Proactive Defensive Backdoor [63.84477483795964]
データ中毒のバックドア攻撃は、機械学習モデルにとって深刻なセキュリティ上の脅威である。
本稿では,トレーニング中のバックドアディフェンスに着目し,データセットが有害になりうる場合でもクリーンなモデルをトレーニングすることを目的とした。
PDB(Proactive Defensive Backdoor)と呼ばれる新しい防衛手法を提案する。
論文 参考訳(メタデータ) (2024-05-25T07:52:26Z) - BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive
Learning [85.2564206440109]
本報告では,防衛後においてもバックドア攻撃が有効であり続けるという現実的なシナリオにおける脅威を明らかにする。
バックドア検出や細調整防御のモデル化に抵抗性のあるemphtoolnsアタックを導入する。
論文 参考訳(メタデータ) (2023-11-20T02:21:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。