論文の概要: Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation
- arxiv url: http://arxiv.org/abs/2603.05754v1
- Date: Thu, 05 Mar 2026 23:26:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:41.9651
- Title: Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation
- Title(参考訳): 安全Night VLA:安全臨界マニピュレーションのためのサーマル・パーセプティブ・ビジョン・ランゲージ・アクションモデル
- Abstract要約: ロボットが見えないものを見ることができるマルチモーダル操作フレームワークであるSafe-Night VLAを提案する。
具体的には、Safe-Night VLAは、長波長赤外線熱知覚を事前訓練された視覚言語バックボーンに統合する。
我々は,フランカマニピュレータを用いた実世界の実験を通じて,我々の枠組みを検証する。
- 参考スコア(独自算出の注目度): 9.129204825142077
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current Vision-Language-Action (VLA) models rely primarily on RGB perception, preventing them from capturing modalities such as thermal signals that are imperceptible to conventional visual sensors. Moreover, end-to-end generative policies lack explicit safety constraints, making them fragile when encountering obstacles and novel scenarios outside the training distribution. To address these limitations, we propose Safe-Night VLA, a multimodal manipulation framework that enables robots to see the unseen while enforcing rigorous safety constraints for thermal-aware manipulation in unstructured environments. Specifically, Safe-Night VLA integrates long-wave infrared thermal perception into a pre-trained vision-language backbone, enabling semantic reasoning grounded in thermodynamic properties. To ensure safe execution under out-of-distribution conditions, we incorporate a safety filter via control barrier functions, which provide deterministic workspace constraint enforcement during policy execution. We validate our framework through real-world experiments on a Franka manipulator, introducing a novel evaluation paradigm featuring temperature-conditioned manipulation, subsurface target localization, and reflection disambiguation, while maintaining constrained execution at inference time. Results demonstrate that Safe-Night VLA outperforms RGB-only baselines and provide empirical evidence that foundation models can effectively leverage non-visible physical modalities for robust manipulation.
- Abstract(参考訳): 現在のVision-Language-Action(VLA)モデルは、主にRGBの知覚に依存しており、従来の視覚センサーでは認識できない熱信号のようなモダリティの捕捉を妨げている。
さらに、エンドツーエンドの生成ポリシーには明確な安全性の制約がなく、トレーニングディストリビューション外の障害や新しいシナリオに遭遇する際にも脆弱である。
これらの制約に対処するために,ロボットが非構造環境におけるサーマルアウェア操作の厳密な安全制約を課しながら,その見えないものを見ることができるマルチモーダル操作フレームワークであるSafe-Night VLAを提案する。
具体的には、Safe-Night VLAは、長波長赤外線の熱知覚をトレーニング済みの視覚言語バックボーンに統合し、熱力学特性に基づく意味論的推論を可能にする。
アウト・オブ・ディストリビューション条件下での安全な実行を確保するため、制御バリア機能を介して安全フィルタを導入し、ポリシー実行中に決定論的ワークスペース制約を強制する。
我々は,Frankaマニピュレータを用いた実世界の実験を通じて,温度条件の操作,地表面の目標位置化,反射の曖昧さを特徴とする新しい評価パラダイムを導入し,推論時の制約実行を維持しながら,本フレームワークの有効性を検証した。
その結果, Safe-Night VLAはRGBのみのベースラインよりも優れており, 基礎モデルが頑健な操作に非可視的な物理的モダリティを効果的に活用できるという実証的証拠が得られた。
関連論文リスト
- D-SafeMPC: Diffusion-Driven Safe Model Predictive Control with Discrete-Time Control Barrier Functions [35.33769360235326]
ロボット計画における拡散モデルの使用に関する重要な制限は、本質的に安全性や動的制約を強制できないことである。
本稿では拡散と制御の相互作用を強化するD-SafeMPCを提案する。
フランカマニピュレータのシミュレーションでは、D-SafeMPCは最先端のベースラインよりも安全性、タスク成功率、計画効率を向上させる。
論文 参考訳(メタデータ) (2026-07-12T17:10:05Z) - VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring [60.53395558502203]
Vision-Language Embodied Safety Agent (VLESA)は、自我中心のビデオから人間の活動を監視する。
VLESAは、コンテキストに応じて同一のアクションが安全または危険である意図に依存した安全性に対処する。
目標を共同で推測し,映像から将来の行動を予測するための意図-行動予測エージェントを提案する。
論文 参考訳(メタデータ) (2026-06-02T17:42:17Z) - SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues [50.928203120795786]
本研究では,視覚言語モデルにおけるマルチモーダル安全性の挙動を,単純な意味的手がかりによって評価できるかどうかを考察する。
シーン内容を変更することなく、テキスト、視覚、認知の介入を制御できるセマンティック・ステアリング・フレームワークを導入する。
論文 参考訳(メタデータ) (2026-03-19T16:18:00Z) - BarrierSteer: LLM Safety via Learning Barrier Steering [83.12893815611052]
BarrierSteerは、学習した非線形安全性制約を直接モデルの潜在表現空間に埋め込むことで、安全性を形式化する新しいフレームワークである。
BarrierSteerは、敵の成功率を大幅に低下させ、安全でない世代を減少させ、既存の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-02-23T18:19:46Z) - Contextual Safety Reasoning and Grounding for Open-World Robots [79.98924225712668]
COREは、環境に関する事前の知識なしに、オンラインのコンテキスト推論、接地、執行を可能にする安全フレームワークである。
知覚の不確実性を考慮したCOREの確率論的安全性保証を提供する。
シミュレーションと実世界の実験を通じて、COREは目に見えない環境において、文脈的に適切な振る舞いを強制することを示した。
論文 参考訳(メタデータ) (2026-02-23T15:51:23Z) - Concept-Based Dictionary Learning for Inference-Time Safety in Vision Language Action Models [30.400796921799778]
視覚言語行動(VLA)モデルは、マルチモーダル命令を実行可能な動作に変換することで知覚行動ループを閉じる。
推論時間安全制御のための概念に基づく辞書学習フレームワークを提案する。
Libero-Harm、BadRobot、RoboPair、IS-Benchの実験により、我々のアプローチが最先端の防衛性能を達成することを示す。
論文 参考訳(メタデータ) (2026-02-02T09:06:43Z) - Constrained Decoding for Robotics Foundation Models [12.916330118607918]
本稿では,自動回帰ロボット基盤モデルのための制約付き復号化フレームワークであるSafeDecを紹介する。
タスク固有の安全ルールはSignal Temporal Logic (STL) 公式として表現され、最小限のオーバーヘッドで推論時に強制される。
提案手法は,実行時に仮定された動的条件下でのSTL仕様を,再トレーニングなしで確実に満たすものである。
論文 参考訳(メタデータ) (2025-09-01T19:17:40Z) - Generalizing Safety Beyond Collision-Avoidance via Latent-Space Reachability Analysis [6.267574471145217]
Hamilton-Jacobi (H) は、ロボットが安全でない状態を同時に検出し、アクションを生成するための厳格なフレームワークである。
生観測データを直接操作する潜在空間到達性であるLa Safety Filtersを提案する。
論文 参考訳(メタデータ) (2025-02-02T22:00:20Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z) - In-Distribution Barrier Functions: Self-Supervised Policy Filters that
Avoid Out-of-Distribution States [84.24300005271185]
本稿では,任意の参照ポリシーをラップした制御フィルタを提案する。
本手法は、トップダウンとエゴセントリックの両方のビュー設定を含むシミュレーション環境における2つの異なるビズモータ制御タスクに有効である。
論文 参考訳(メタデータ) (2023-01-27T22:28:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。