論文の概要: Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2606.09749v1
- Date: Mon, 08 Jun 2026 17:11:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:07.583403
- Title: Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models
- Title(参考訳): あなたのモデルはすでに知っている:ビジョン・ランゲージ・アクション・モデルのための注意誘導型安全フィルタ
- Authors: Seongbin Park, Fan Zhang, Baharan Mirzasoleiman, Shahriar Talebi, Nader Sehatbakhsh,
- Abstract要約: VLA(Vision-Language-Action)モデルでは、さまざまなロボット操作タスクにおいて、エンドツーエンドのパフォーマンスが著しく向上している。
既存の安全フィルタは、障害物とその位置を特定するために視覚言語モデル(VLM)をクエリすることで、この問題を回避している。
VLAモデル内の少数の注意点が、ポリシーがアプローチしようとする対象を確実に位置づけすることを発見した。
- 参考スコア(独自算出の注目度): 25.34659221262947
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models have demonstrated impressive end-to-end performance across a variety of robotic manipulation tasks. However, these policies offer no guarantees against collisions with task-irrelevant objects in the scene. Existing safety filters sidestep this problem by querying a vision-language model (VLM) to identify obstacles and their locations. This, however, is too slow to run in the control loop and can only be invoked at episode initialization, leaving the filter unable to track moving obstacles. We discover that a small number of attention heads within a VLA model reliably localize the object the policy intends to approach. These heads can be exploited within a training-free safety framework that obtains the active target from the attention heads at every step, treats the remainder of the scene as obstacles, and feeds these into a Control Barrier Function (CBF) filter. Together with a lightweight real-time object tracker, this allows for collision avoidance for non-static obstacles. We evaluate our framework on SafeLIBERO, which we extend with moving obstacles. On the original static benchmark, our method performs comparably to an oracle that uses privileged simulator state to identify the target, emulating a VLM-based identification step run once at episode initialization. On the dynamic variant, where the oracle's init-time target assignment becomes stale, our method substantially outperforms it by 43%, on average. Our findings suggest that the perceptual signals needed for real-time safety filtering are already present within VLA policies and can be exploited without additional training or heavy auxiliary models.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルでは、さまざまなロボット操作タスクにおいて、エンドツーエンドのパフォーマンスが著しく向上している。
しかし、これらのポリシーは、現場におけるタスク非関連オブジェクトとの衝突に対する保証を提供しない。
既存の安全フィルタは、障害物とその位置を特定するために視覚言語モデル(VLM)をクエリすることで、この問題を回避している。
しかし、これは制御ループ内での実行には遅すぎるため、エピソード初期化時にのみ起動することができ、フィルタは動く障害物を追跡することができない。
VLAモデル内の少数の注意点が、ポリシーがアプローチしようとする対象を確実に位置づけすることを発見した。
これらのヘッドは、各ステップで注意ヘッドからアクティブターゲットを取得し、シーンの残りの部分を障害として扱い、これらを制御バリア機能(CBF)フィルタに供給する、トレーニングフリーの安全フレームワーク内で利用することができる。
軽量なリアルタイムオブジェクトトラッカーとともに、非定常障害物の衝突回避を可能にする。
我々は,移動障害物で拡張するSafeLIBEROの枠組みを評価した。
従来の静的なベンチマークでは、特権化されたシミュレータの状態を用いてターゲットを識別するオラクルと互換性があり、エピソード初期化時に一度VLMベースの識別ステップをエミュレートする。
オラクルのinit-timeターゲット割り当てが不安定な動的変種では,本手法は平均で43%向上する。
本研究は, リアルタイム安全フィルタリングに必要な知覚信号が, VLAポリシ内にすでに存在し, 追加のトレーニングや重度補助モデルなしで活用可能であることを示唆している。
関連論文リスト
- VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring [60.53395558502203]
Vision-Language Embodied Safety Agent (VLESA)は、自我中心のビデオから人間の活動を監視する。
VLESAは、コンテキストに応じて同一のアクションが安全または危険である意図に依存した安全性に対処する。
目標を共同で推測し,映像から将来の行動を予測するための意図-行動予測エージェントを提案する。
論文 参考訳(メタデータ) (2026-06-02T17:42:17Z) - TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models [59.13964209628383]
VLA(Vision-Language-Action)ポリシーは、言語指示や視覚的な観察をロボット行動にマッピングする上で大きな進歩を見せている。
本稿では,VLA政策における乱れや外見に起因したバイアスを明示的に軽減する単純な推論時ガイダンス機構であるTAG(Target-Agnostic Guidance)を提案する。
我々は, LIBERO, LIBERO-Plus, VLABenchなどの標準操作ベンチマーク上でTAGを評価し, クラッタ下での堅牢性を一貫して改善し, ニアミスや不正なオブジェクト実行を減らす。
論文 参考訳(メタデータ) (2026-03-25T17:56:32Z) - Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation [5.268770735910558]
我々は、エゴセントリックなRGB入力を用いてCBF安全フィルタの保守性をリアルタイムで適応する視覚制御ナビゲーションフレームワークAlphaAdjを提案する。
その結果、AlphaAdjは衝突のないナビゲーションを維持しつつ、(パスの長さとゴールまでの時間の観点から)効率を最大18.5%改善していることがわかった。
論文 参考訳(メタデータ) (2026-03-22T09:35:18Z) - BarrierSteer: LLM Safety via Learning Barrier Steering [83.12893815611052]
BarrierSteerは、学習した非線形安全性制約を直接モデルの潜在表現空間に埋め込むことで、安全性を形式化する新しいフレームワークである。
BarrierSteerは、敵の成功率を大幅に低下させ、安全でない世代を減少させ、既存の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-02-23T18:19:46Z) - AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models [60.39655329875822]
VLA(Vision-Language-Action)モデルは、ロボットが自然言語の命令を解釈し、多様なタスクを実行することを可能にするモデルである。
このようなモデルを攻撃することへの関心は高まっているが、既存の手法の有効性は依然として不明である。
我々はVLA開発ライフサイクルに合わせて統合されたフレームワークであるAttackVLAを提案する。
論文 参考訳(メタデータ) (2025-11-15T10:30:46Z) - Constrained Decoding for Robotics Foundation Models [12.916330118607918]
本稿では,自動回帰ロボット基盤モデルのための制約付き復号化フレームワークであるSafeDecを紹介する。
タスク固有の安全ルールはSignal Temporal Logic (STL) 公式として表現され、最小限のオーバーヘッドで推論時に強制される。
提案手法は,実行時に仮定された動的条件下でのSTL仕様を,再トレーニングなしで確実に満たすものである。
論文 参考訳(メタデータ) (2025-09-01T19:17:40Z) - Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving [65.61999354218628]
我々は、自律運転システムにおいて、視覚言語モデル(VLM)をターゲットとしたブラックボックス敵攻撃を設計する第一歩を踏み出す。
セマンティクスの生成と注入による低レベル推論の分解を目標とするカスケーディング・アディバーショナル・ディスラプション(CAD)を提案する。
本稿では,高レベルリスクシナリオの理解と構築に代理VLMを活用することで,動的適応に対処するリスクシーンインジェクションを提案する。
論文 参考訳(メタデータ) (2025-01-23T11:10:02Z) - ASMA: An Adaptive Safety Margin Algorithm for Vision-Language Drone Navigation via Scene-Aware Control Barrier Functions [9.645098673995317]
VLNを運用するドローンプラットフォームについて検討し、新しいシーン認識CBFを定式化することによって安全性を向上させる。
CBFのないベースラインシステムは、コマンドを順序づけられたランドマークのシーケンスに変換するために、モーダルな注意を持つビジョンランゲージを使用する。
ASMAは移動物体を追跡し、シーン認識CBF評価をオンザフライで実行し、追加の制約として機能する。
論文 参考訳(メタデータ) (2024-09-16T13:44:50Z) - In-Distribution Barrier Functions: Self-Supervised Policy Filters that
Avoid Out-of-Distribution States [84.24300005271185]
本稿では,任意の参照ポリシーをラップした制御フィルタを提案する。
本手法は、トップダウンとエゴセントリックの両方のビュー設定を含むシミュレーション環境における2つの異なるビズモータ制御タスクに有効である。
論文 参考訳(メタデータ) (2023-01-27T22:28:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。