論文の概要: Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2604.23272v1
- Date: Sat, 25 Apr 2026 12:28:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:07.242006
- Title: Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models
- Title(参考訳): 視覚・言語・行動モデルにおける物理フィードバック統合のためのモジュール型感覚ストリーム
- Authors: Jimin Lee, Huiwon Jang, Myungkyu Koo, Jungwoo Park, Jinwoo Shin,
- Abstract要約: MoSSはモジュラー・センサ・ストリーム・フレームワークであり、ビジョン・ランゲージ・アクション・モデルを適用し、複数のセンサー信号を利用して行動予測を行う。
新たなモダリティを安定的に組み込むために,事前学習したVLAパラメータを早期に凍結する2段階のトレーニング手法を採用する。
接触相互作用のダイナミクスをよりよく捉えるために,将来的な物理的信号を予測する補助的なタスクを組み込む。
- 参考スコア(独自算出の注目度): 48.57114740339529
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Humans understand and interact with the real world by relying on diverse physical feedback beyond visual perception. Motivated by this, recent approaches attempt to incorporate physical sensory signals into Vision-Language-Action models (VLAs). However, they typically focus on a single type of physical signal, failing to capture the heterogeneous and complementary nature of real-world interactions. In this paper, we propose MoSS, a modular sensory stream framework that adapts VLAs to leverage multiple sensory signals for action prediction. Specifically, we introduce decoupled modality streams that integrate heterogeneous physical signals into the action stream via joint cross-modal self-attention. To enable stable incorporation of new modalities, we adopt a two-stage training scheme that freezes pretrained VLA parameters in the early stage. Furthermore, to better capture contact interaction dynamics, we incorporate an auxiliary task that predicts future physical signals. Through extensive real-world experiments, we demonstrate that MoSS successfully augments VLAs to leverage diverse physical signals (i.e., tactile and torque), integrating multiple signals to achieve synergistic performance gains.
- Abstract(参考訳): 人間は、視覚的知覚を超えた多様な物理的フィードバックを頼りにすることで、現実世界を理解し、対話する。
これに触発された近年のアプローチでは、物理的な感覚信号を視覚・言語・行動モデル(VLA)に組み込もうと試みている。
しかし、それらは典型的には単一の物理信号に焦点を合わせ、現実世界の相互作用の異質性と相補的な性質を捉えられなかった。
本稿では,VLAに適応して動作予測に複数のセンサ信号を利用するモジュール型センサストリームフレームワークであるMoSSを提案する。
具体的には,不均一な物理信号を連成モーダル自己アテンションを介して動作ストリームに統合する疎結合なモーダルストリームを提案する。
新たなモダリティを安定的に組み込むために,事前学習したVLAパラメータを早期に凍結する2段階のトレーニング手法を採用する。
さらに,接触相互作用のダイナミクスをよりよく捉えるために,将来的な物理信号を予測する補助的タスクを組み込んだ。
実世界の広範な実験を通して、MoSSは様々な物理信号(触覚とトルク)を活用するためにVLAを増強し、シナジスティックな性能向上を達成するために複数の信号を統合することを実証した。
関連論文リスト
- VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs [47.982092015932444]
Video-Action Models (VAM) は、インテリジェンスを具現化するための有望なフレームワークとして登場した。
本稿では,触覚を接地信号として組み込んだマルチモーダル世界モデリングフレームワークであるVideo-Tactile Action Model (VTAM)を紹介する。
VTAMは、触覚ストリームでトレーニング済みのビデオトランスフォーマーを軽量なモダリティ転送ファインタニングで強化する。
論文 参考訳(メタデータ) (2026-03-24T17:45:06Z) - Tactile Modality Fusion for Vision-Language-Action Models [22.788833830429766]
本稿では,視覚触覚信号と視覚言語アクション(VLA)モデルを統合する軽量なモーダルフュージョンアプローチであるTacFiLMを提案する。
その結果, 成功率, 直接挿入性能, 完了時間, 負荷安定性の両面において一貫した改善が見られた。
論文 参考訳(メタデータ) (2026-03-15T20:57:51Z) - Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction [67.45032003041399]
本研究では,先進的かつ意味論的に誘導された摂動を通じて対向的伝達性を高めるセマンティック・ダイナミック・コントラシブ・アタック(SADCA)を提案する。
SADCAは、対立、正、負のサンプルを含む対照的な学習メカニズムを確立し、得られた摂動の意味的不整合を強化する。
複数のデータセットとモデルの実験により、SADCAは対向移動性を大幅に改善し、最先端の手法を一貫して超えることを示した。
論文 参考訳(メタデータ) (2026-03-05T05:46:16Z) - ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning [52.86018040861575]
本稿では,単一のネットワークに視覚計画と反応力制御を統合した,一貫したエンドツーエンドの視覚力拡散政策を提案する。
本稿では,非同期な視覚と力のトークンを同時に処理するための因果的注意力を利用した構造的スローフォールストラーニングを紹介する。
コンタクトリッチタスクの実験では、ImplicitRDPは視覚のみのベースラインと階層的なベースラインの両方で著しく優れていた。
論文 参考訳(メタデータ) (2025-12-11T18:59:46Z) - PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing [49.243031514520794]
LLM(Large Language Models)は、テキスト中心の設計のため、長距離信号の取得に優れる。
PhysLLMは最先端の精度とロバスト性を実現し、照明のバリエーションや動きのシナリオにまたがる優れた一般化を示す。
論文 参考訳(メタデータ) (2025-05-06T15:18:38Z) - Towards Robust Multimodal Physiological Foundation Models: Handling Arbitrary Missing Modalities [9.785262633953794]
生理オムニ (Phylo Omni) は、マルチモーダルな生理的信号解析の基礎モデルである。
分離されたマルチモーダル・トークンーザを訓練し、マスクされた信号の事前訓練を可能にする。
最先端のパフォーマンスを達成しつつ、モダリティの欠如に対して強い堅牢性を維持します。
論文 参考訳(メタデータ) (2025-04-28T09:00:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。