論文の概要: Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies
- arxiv url: http://arxiv.org/abs/2609.03142v1
- Date: Wed, 02 Sep 2026 20:25:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.848359
- Title: Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies
- Title(参考訳): モダリティが重要か:ロバストVLA政策の正則化の証拠
- Abstract要約: EGR(Evidence-Gated Regularization)は、推論時間オーバーヘッドをゼロにするモダリティに依存しないトレーニング目標である。
EGRは2つの状態条件の整合性をゲートするフレーム単位とセンサ単位のタスク関連シグナルを導出する。
EGRをBEHAVIOR-1Kに基づくベンチマークで検証し,高速な推論専用診断スイートとロールアウトに基づく47のスキルを備える。
- 参考スコア(独自算出の注目度): 36.174462532201964
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) policies fuse multimodal sensory inputs, but training on limited and homogeneous robot demonstrations encourages spurious inter-sensor correlations rather than task-relevant signal, a failure we term modality entanglement. Under real-world occlusions and distractors, this manifests as nuisance sensitivity to corruption of uninformative sensors and single-modality insufficiency when only one informative sensor remains intact. We propose Evidence-Gated Regularization (EGR), a modality-agnostic training objective that introduces zero inference-time overhead. EGR derives a per-frame and per-sensor task-relevance signal to gate two state-conditional consistency objectives: invariance on low-evidence sensors, and single-sensor sufficiency on high-evidence ones. We introduce a benchmark based on BEHAVIOR-1K, comprising a fast inference-only diagnostic suite and 47 rollout-based skills targeting modality entanglement. We validate EGR on this benchmark and on two real-robot setups with fundamentally different embodiments: a bi-manual setup with two Kinova arms and three RGB cameras, and a single-arm MELFA ASSISTA setup combining vision and GelSight tactile sensors. EGR improves simulation success rates (SR) from 12.5% to 16.4% under full modalities (+31%), from 9.4% to 16.5% under uninformative-sensor corruption (+75%), and from 2.8% to 6.1% under single-sensor fallback (+120%). Under physical-object distractors, EGR boosts SR from 30% to 85% on the bi-manual setup (+183%) and from 55% to 70% on the tactile setup (+27%).
- Abstract(参考訳): VLA(Vision-Language-Action)ポリシーは、マルチモーダルな感覚入力を融合させるが、限定的で均質なロボットデモの訓練は、タスク関連信号よりも刺激的な感覚間相関を促進する。
現実世界の隠蔽や妨害下では、これは、情報センサが1つしか残っていない場合、非情報センサの破損に対するニュアンス感受性と、単一モダリティ障害が現れる。
提案するEvidence-Gated Regularization (EGR, Evidence-Gated Regularization, EGR) は, 推定時間のオーバーヘッドをゼロにするモダリティに依存しない学習目標である。
EGRはフレーム単位とセンサ単位のタスク関連信号から,2つの状態条件整合性をゲートする。
我々は,高速な推論のみの診断スイートと,モダリティの絡み合いをターゲットとした47のロールアウトベースのスキルを備えたBEHAVIOR-1Kに基づくベンチマークを導入する。
2つのKinovaアームと3つのRGBカメラを備えたバイマニュアルセットアップと、視覚とGelSightの触覚センサーを組み合わせたシングルアームのMELFA ASSISTAセットアップである。
EGRはシミュレーション成功率(SR)を、完全なモダリティ(+31%)で12.5%から16.4%(+75%)で9.4%から16.5%(+75%)で2.8%から6.1%(+120%)で改善している。
EGRは、物理的対象のイントラクタの下で、SRをバイマニュアル設定(+183%)で30%から85%、触覚設定(+27%)で55%から70%に向上させる。
関連論文リスト
- BIFTA: Brain-Inspired Few-Shot Tactile Adaptation for Unknown Sensors [9.215504075946754]
凍結エンコーダを未知の触覚センサに適応させるために,Brain-Inspired Few-Shot Tactile Adaptation (BIFTA) フレームワークを提案する。
BIFTAは、二視点統計メモリを通して事前訓練された表現を保存する。
これは、凍結エンコーダを未知の触覚センサーに適応させるために、脳の迅速な感覚適応機構の上に構築されている。
論文 参考訳(メタデータ) (2026-09-08T12:39:36Z) - Vision-Language Models for Analog Gauge Reading: An Empirical Study of Specialization, Transfer and Reliability [3.112410411428948]
本研究は,汎用視覚言語モデル(VLM)の特殊化,伝達,堅牢性,信頼性の体系的評価である。
Qwen2.5-VL-7B-インストラクトモデルは、ゼロショットプロンプト、インコンテキストラーニング(ICL)、および量子化低ランク適応(QLoRA)を用いたパラメータ効率の微調整を用いて評価される。
最高の微調整MPE値は、95%信頼区間(CI)が1.43-3.90%、圧力ゲージデータセットが2.61%、CIが1.66-3.80%、および4.4の合成データセットで2.39%である。
論文 参考訳(メタデータ) (2026-08-18T12:47:14Z) - Robust and Personalized Federated Learning for Aircraft-Engine Prognostics under Benign and Adversarial Client Heterogeneity [0.4776836972093627]
FL(Federated Learning)は、航空機の運用者が生データを共有せずに、エンジンセンサーテレメトリから残留寿命(RUL)モデルを共同訓練することを可能にする。
本研究では, 正直な操作者が異なる操作条件や障害モードを観察する良性不均一性と, 妥協した操作者が有毒な更新を提出する敵対的不均一性という2つの相補的課題について検討した。
エンジンの劣化を隠蔽する物理的に動機付けられたセンサ値バックドアを含む,4つのアグリゲーション手法に対する5つの攻撃を評価した。
論文 参考訳(メタデータ) (2026-08-04T06:54:29Z) - Design and Validation of a Lightweight 1D CNN for Affective Touch Classification in Soft Plush Companions [59.49967357689445]
ソフトなセンサー付きコンパニオンは、社会的支援技術のための物理的に安全で感情的に直感的なインターフェースを提供する。
本研究では,ソフト・インタラクティブ・コンパニオンにおける感情的触覚認識のためのディープラーニングモデルの開発と検証を目的とした,オープンソースで拡張されたリアルタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-16T10:20:05Z) - Joint Sensor Deployment and Physics-Informed Graph Transformer for Smart Grid Attack Detection [7.8160642765456165]
物理インフォームドグラフトランス (PIGTN) に基づく新しい検出モデルを提案する。
提案したPIGTNベースの検出モデルは、交流電力フロー制約を組み込むことで、目に見えない攻撃に対してよく一般化する。
論文 参考訳(メタデータ) (2026-02-16T06:37:19Z) - PRISM: Performer RS-IMLE for Single-pass Multisensory Imitation Learning [51.24484551729328]
PRISMは,IMLEのバッチ・グロバル・リジェクション・サンプリングに基づく単一パスポリシーである。
PRISMは、Performerアーキテクチャを用いた線形アテンション発生器と時間的マルチセンサエンコーダを結合する。
7-DoFアームD1を搭載したUnitree Go2を用いたロコマニピュレーションやUR5マニピュレータを用いたテーブルトップ操作など,PRISMの有効性を実証する。
論文 参考訳(メタデータ) (2026-02-02T17:57:37Z) - Time-Series at the Edge: Tiny Separable CNNs for Wearable Gait Detection and Optimal Sensor Placement [3.7765281299298015]
我々は,3軸加速度の短い窓から発生するパーキンソン病(PD)の歩行検出のためのデバイス上での時系列解析について検討した。
1つの文献ベースライン(分離可能な畳み込み)と2つのウルトラライトモデル(純粋に分離可能なもの)である。
論文 参考訳(メタデータ) (2025-11-29T08:52:41Z) - A Multimodal Approach to Heritage Preservation in the Context of Climate Change [0.0]
本稿では,センサデータ(温度,湿度)と視覚画像とを融合させて,遺産の重症度を予測する軽量なマルチモーダルアーキテクチャを提案する。
ストラスブール大聖堂からのデータでは、標準的なマルチモーダルアーキテクチャよりも43%向上した76.9%のアクク・レシーを達成した。
論文 参考訳(メタデータ) (2025-10-15T22:07:57Z) - UAV Individual Identification via Distilled RF Fingerprints-Based LLM in ISAC Networks [60.16924915676577]
無人航空機(UAV)個人識別は、低高度統合センシング通信(ISAC)ネットワークにおける重要なセキュリティ監視戦略である。
UAVID識別のための新しい動的知識蒸留(KD)対応無線周波数指紋大言語モデル(RFF-LLM)を提案する。
実験結果から,提案フレームワークは,0.15万のパラメータと2.74ミリ秒の応答時間で,98.38%のID識別精度を実現していることがわかった。
論文 参考訳(メタデータ) (2025-08-18T03:14:44Z) - CAFuser: Condition-Aware Multimodal Fusion for Robust Semantic Perception of Driving Scenes [56.52618054240197]
本研究では,運転シーンのロバストな意味認識のための条件対応型マルチモーダル融合手法を提案する。
CAFuserは、RGBカメラ入力を用いて環境条件を分類し、コンディショントークンを生成する。
我々のモデルは、特に悪条件シナリオにおいて、ロバスト性と精度を著しく向上させる。
論文 参考訳(メタデータ) (2024-10-14T17:56:20Z) - Patch-Level Contrasting without Patch Correspondence for Accurate and
Dense Contrastive Representation Learning [79.43940012723539]
ADCLRは、正確で高密度な視覚表現を学習するための自己教師型学習フレームワークである。
提案手法は, コントラッシブな手法のための新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2023-06-23T07:38:09Z) - Bayesian Imitation Learning for End-to-End Mobile Manipulation [80.47771322489422]
RGB + 深度カメラのような追加のセンサー入力によるポリシーの強化は、ロボットの知覚能力を改善するための簡単なアプローチである。
畳み込みニューラルネットワークを正規化するために変分情報ボトルネックを用いることで、保持領域への一般化が向上することを示す。
提案手法は, シミュレーションと現実のギャップを埋めることと, RGBと奥行き変調をうまく融合できることを実証する。
論文 参考訳(メタデータ) (2022-02-15T17:38:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。