論文の概要: Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force
- arxiv url: http://arxiv.org/abs/2606.30988v3
- Date: Sun, 05 Jul 2026 18:58:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.655926
- Title: Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force
- Title(参考訳): 多感覚連続学習 : 訓練済みのバイスモータ・ポリシーを強制に適応させる
- Authors: Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song,
- Abstract要約: MultiSensory World Model (MuSe)は、限られたマルチセンサーデータを事前訓練された視覚のみのポリシーに組み込む。
MuSeは、保留中のコンタクトリッチな微調整タスクに強く依存する。
- 参考スコア(独自算出の注目度): 20.18514342575897
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robot manipulation often relies on sensory feedback beyond vision, particularly in contact-rich settings where force, tactile, or audio signals reveal interaction states that are not directly observable from images. However, these modalities are often hardware- and task-specific, and large-scale multisensory robot datasets remain scarce. As a result, it is impractical to pretrain policies with every sensor they may encounter. We study multisensory continual learning: adapting a pretrained robot policy to new tasks with newly introduced modalities while preserving performance under the original sensor suite. We propose MultiSensory World Model (MuSe), which incorporates limited multisensory data into pretrained vision-only policies through multi-stage fusion, multisensory future prediction, and experience replay over pretraining data. We instantiate MuSe by augmenting a pretrained vision-only policy with force-torque sensing and evaluate it on real-world manipulation tasks. Our experiments show that MuSe performs strongly on contact-rich finetuning tasks while preserving, and in some cases improving, performance on the original pretraining tasks. These results suggest that a modest multisensory dataset can improve general robot capabilities beyond the finetuning distribution. Project website: https://jadenvc.github.io/multisensory-continual-learning/
- Abstract(参考訳): ロボットの操作は、視覚以外の感覚フィードバック、特に、力、触覚、音声信号が画像から直接観察できない相互作用状態を示すような、接触に富んだ設定に依存していることが多い。
しかし、これらのモダリティはハードウェアやタスク固有のものが多く、大規模なマルチセンサーロボットデータセットは少ないままである。
結果として、彼らが遭遇する可能性のあるすべてのセンサーでポリシーを事前訓練するのは現実的ではない。
我々は,マルチ感覚連続学習について研究し,事前訓練されたロボットポリシーを新しいタスクに適応させながら,元のセンサースイートで性能を保ちながら,新たなモダリティを付与する。
我々は,多段階融合,多段階未来予測,事前学習データに対する経験的リプレイを通じて,限られた多感覚データを事前学習された視覚のみのポリシーに組み込む多感覚世界モデル(MuSe)を提案する。
我々は、実世界の操作タスクにおいて、力トルク検出による事前訓練された視覚のみのポリシーを拡張して、 MuSe をインスタンス化し、評価する。
実験の結果, MuSe は接点に富んだ微調整作業に強い効果を示し, 同時に元の事前訓練作業でも性能が向上した。
これらの結果から,微調整分布を超える汎用ロボットの能力を,控えめなマルチセンサ・データセットにより向上させることができることが示唆された。
プロジェクトウェブサイト:https://jadenvc.github.io/multisensory-continual-learning/
関連論文リスト
- FingerEye: Continuous and Unified Vision-Tactile Sensing for Dexterous Manipulation [8.809778152652724]
有害なロボット操作は、あらゆる段階の相互作用を包括的に知覚する必要がある。
我々は,対話プロセスを通じて連続的な視覚触覚フィードバックを提供する,コンパクトで費用効率のよいセンサであるFingerEyeを紹介する。
我々は、複数のFingerEyeセンサーからの信号を融合して、限られた実世界のデータから巧妙な操作行動を学習する視覚触覚模倣学習ポリシーを開発した。
論文 参考訳(メタデータ) (2026-04-22T15:37:34Z) - Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning [10.782934021703783]
MultiSensory Dynamic Pretraining (MSDP)は、タスク指向のポリシー学習に適した表現型多感覚表現を学習するためのフレームワークである。
MSDPはマスク付きオートエンコーディングに基づいており、センサ埋め込みのサブセットのみからの多感覚観測を再構成することでトランスフォーマーベースのエンコーダを訓練する。
下流の政策学習では,凍結した埋め込みから動的にタスク固有の特徴を抽出するクロスアテンション機構が導入された。
論文 参考訳(メタデータ) (2025-11-18T12:32:23Z) - Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding [85.63710017456792]
FuSeは、不均一なセンサのモダリティに対する微調整型ビズモータ一般政策を可能にする新しいアプローチである。
FuSeは視覚,触覚,音などのモーダル性に対して共同で推論を必要とする挑戦的なタスクを実行できることを示す。
実世界での実験では、FuSeisはすべての基準ラインと比較して成功率を20%以上引き上げることができた。
論文 参考訳(メタデータ) (2025-01-08T18:57:33Z) - Hearing Touch: Audio-Visual Pretraining for Contact-Rich Manipulation [13.026061233933435]
現在のパラダイムは視覚表現のための大規模な事前訓練のみを実行する。
触覚などの他のモダリティを事前訓練するために、インターネットスケールのデータがどのように使われるのかは不明だ。
本稿では,コンタクトマイクを代替触覚センサとして利用することで,このギャップに対処する。
論文 参考訳(メタデータ) (2024-05-14T13:16:46Z) - What Makes Pre-Trained Visual Representations Successful for Robust
Manipulation? [57.92924256181857]
照明やシーンテクスチャの微妙な変化の下では,操作や制御作業のために設計された視覚表現が必ずしも一般化されないことがわかった。
創発的セグメンテーション能力は,ViTモデルにおける分布外一般化の強い予測因子であることがわかった。
論文 参考訳(メタデータ) (2023-11-03T18:09:08Z) - Multimodal and Force-Matched Imitation Learning with a See-Through Visuotactile Sensor [14.492202828369127]
我々は、模倣学習(IL)の枠組みの中でマルチモーダル・ビゾタクタクタブル・センサを活用して、コンタクトリッチなタスクを実行する。
本稿では,IL改善のための補完手法として,触覚力マッチングと学習モード切替という2つのアルゴリズム的貢献を紹介する。
以上の結果から, 力の一致が平均政策成功率62.5%, ビズオタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタクタク
論文 参考訳(メタデータ) (2023-11-02T14:02:42Z) - Robot Learning with Sensorimotor Pre-training [98.7755895548928]
ロボット工学のための自己教師型感覚運動器事前学習手法を提案する。
我々のモデルはRTTと呼ばれ、センサモレータトークンのシーケンスで動作するトランスフォーマーである。
感覚運動の事前学習は、ゼロからトレーニングを一貫して上回り、優れたスケーリング特性を持ち、さまざまなタスク、環境、ロボット間での移動を可能にしている。
論文 参考訳(メタデータ) (2023-06-16T17:58:10Z) - Tactile-Filter: Interactive Tactile Perception for Part Mating [54.46221808805662]
人間は触覚と触覚に頼っている。
視覚ベースの触覚センサーは、様々なロボット認識や制御タスクに広く利用されている。
本稿では,視覚に基づく触覚センサを用いた対話的知覚手法を提案する。
論文 参考訳(メタデータ) (2023-03-10T16:27:37Z) - A Framework for Multisensory Foresight for Embodied Agents [11.351546861334292]
将来の感覚状態を予測することは、ロボット、ドローン、自動運転車などの学習エージェントにとって不可欠である。
本稿では,複数の感覚モーダルを探索行動と組み合わせ,この問題に対処するための予測ニューラルネットワークアーキテクチャを提案する。
このフレームワークは、大規模なオブジェクトに対して9つの動作を複数回実行するヒューマノイドロボット上で、4つの感覚モーダル(ビジョン、触覚、オーディオ、触覚)を含むデータセットでテストされ、検証された。
論文 参考訳(メタデータ) (2021-09-15T20:20:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。