論文の概要: Active Stereo-Camera Outperforms Multi-Sensor Setup in ACT Imitation Learning for Humanoid Manipulation
- arxiv url: http://arxiv.org/abs/2603.28422v1
- Date: Mon, 30 Mar 2026 13:30:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.416011
- Title: Active Stereo-Camera Outperforms Multi-Sensor Setup in ACT Imitation Learning for Humanoid Manipulation
- Title(参考訳): アクティブステレオカメラによるヒューマノイドマニピュレーションのためのACT模倣学習におけるマルチセンサ設定性能
- Authors: Robin Kühn, Moritz Schappler, Thomas Seel, Dennis Bank,
- Abstract要約: 本論文は,Unitree G1ヒューマノイドロボットの3本指ハンドを2つの操作タスクに装着した14種類のセンサの組み合わせをベンチマークする。
触覚とプロモセプティブの融合と能動視覚の併用について検討した。
- 参考スコア(独自算出の注目度): 4.864819846886142
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The complexity of teaching humanoid robots new tasks is one of the major reasons hindering their widespread adoption in the industry. While Imitation Learning (IL), particularly Action Chunking with Transformers (ACT), enables rapid task acquisition, there is no consensus yet on the optimal sensory hardware required for manipulation tasks. This paper benchmarks 14 sensor combinations on the Unitree G1 humanoid robot equipped with three-finger hands for two manipulation tasks. We explicitly evaluate the integration of tactile and proprioceptive modalities alongside active vision. Our analysis demonstrates that strategic sensor selection can outperform complex configurations in data-limited regimes while reducing computational overhead. We develop an open-source Unified Ablation Framework that utilizes sensor masking on a comprehensive master dataset. Results indicate that additional modalities often degrade performance for IL with limited data. A minimal active stereo-camera setup outperformed complex multi-sensor configurations, achieving 87.5% success in a spatial generalization task and 94.4% in a structured manipulation task. Conversely, adding pressure sensors to this setup reduced success to 67.3% in the latter task due to a low signal-to-noise ratio. We conclude that in data-limited regimes, active vision offers a superior trade-off between robustness and complexity. While tactile modalities may require larger datasets to be effective, our findings validate that strategic sensor selection is critical for designing an efficient learning process.
- Abstract(参考訳): ヒューマノイドロボットに新しいタスクを教える複雑さは、業界で広く採用されていることを妨げる主要な理由の1つだ。
Imitation Learning(IL)、特にACT(Action Chunking with Transformers)は、迅速なタスク獲得を可能にするが、タスク操作に必要な最適な感覚ハードウェアについてはまだ合意が得られていない。
本論文は,Unitree G1ヒューマノイドロボットの3本指ハンドを2つの操作タスクに装着した14種類のセンサの組み合わせをベンチマークする。
本研究は,能動視覚とともに触覚と固有感覚の融合を明示的に評価する。
解析により, 計算オーバーヘッドを低減しつつ, データ制限されたレシエーションにおいて, 戦略的センサ選択が複雑な構成を上回り得ることを示す。
我々は,センサマスキングを包括的マスタデータセット上で利用するオープンソースのUnified Ablation Frameworkを開発した。
以上の結果から,データ制限によるILの性能低下が生じることが示唆された。
最小限のアクティブステレオカメラは複雑なマルチセンサー構成に優れ、空間一般化タスクで87.5%、構造化操作タスクで94.4%の成功を収めた。
逆に、このセットアップに圧力センサーを追加することで、信号対雑音比が低いため、後者のタスクでは67.3%に低下した。
データ制限されたレシエーションでは、アクティブビジョンは堅牢性と複雑性のトレードオフに優れたものだ、と私たちは結論付けています。
触覚のモダリティはより大きなデータセットを効果的に扱う必要があるかもしれないが、我々の研究結果は、戦略的センサの選択が効率的な学習プロセスの設計に重要であることを証明している。
関連論文リスト
- UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking [47.900334665380115]
シミュレーションベースのビジュオ触覚データプラットフォームUniVTACを提案する。
大規模なシミュレーション合成データに基づいて訓練されたビジュオ触覚エンコーダであるUniVTACエンコーダを紹介する。
代表的な8つのビジュオ触覚操作タスクからなるUniVTACベンチマークを提案する。
論文 参考訳(メタデータ) (2026-02-10T18:57:00Z) - UniForce: A Unified Latent Force Model for Robot Manipulation with Diverse Tactile Sensors [51.88112610411651]
そこで本研究では,多様な触覚センサにまたがる共用潜在力空間を学習する,新しい統合された触覚表現学習フレームワークを提案する。
UniForceは、逆ダイナミクス(image-to-force)とフォワードダイナミクス(force-to-image)を共同モデリングすることで、クロスセンサー領域シフトを低減する
高価な外部力/トルクセンサ(F/T)への依存を避けるため,静的平衡を利用して直接センサ・オブジェクト・センサ・インタラクションを介して力対効果データを収集する。
論文 参考訳(メタデータ) (2026-02-01T11:03:01Z) - Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation [21.78866976181311]
See-through-skin (STS) センサーは触覚と視覚を結合する。
既存のSTSの設計では、同時的なマルチモーダル認識が欠如し、信頼性の低い触覚追跡に悩まされている。
STSセンサであるTacThruを導入し,視覚認識と触覚信号抽出を同時に行う。
論文 参考訳(メタデータ) (2025-12-10T17:35:13Z) - Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning [10.782934021703783]
MultiSensory Dynamic Pretraining (MSDP)は、タスク指向のポリシー学習に適した表現型多感覚表現を学習するためのフレームワークである。
MSDPはマスク付きオートエンコーディングに基づいており、センサ埋め込みのサブセットのみからの多感覚観測を再構成することでトランスフォーマーベースのエンコーダを訓練する。
下流の政策学習では,凍結した埋め込みから動的にタスク固有の特徴を抽出するクロスアテンション機構が導入された。
論文 参考訳(メタデータ) (2025-11-18T12:32:23Z) - StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation [56.996371714721995]
高度に圧縮された2つの状態表現を学習する教師なしの手法を提案する。
私たちの表現は効率的で解釈可能で、既存のVLAベースのモデルとシームレスに統合されます。
提案手法は,コンパクトな状態表現から一般化可能なロボットモーションを学習できることから,StaMoと命名する。
論文 参考訳(メタデータ) (2025-10-06T17:37:24Z) - Rethinking Bimanual Robotic Manipulation: Learning with Decoupled Interaction Framework [51.39847596489193]
バイオマチックなロボット操作は、ロボティクスコミュニティにおいて、新しくて重要なトピックである。
本稿では,バイマニュアル操作における異なるタスクの特徴を考察した,疎結合なインタラクションフレームワークを提案する。
我々のフレームワークは,SOTA法よりも23.5%向上し,優れた性能を実現している。
論文 参考訳(メタデータ) (2025-03-12T09:28:41Z) - AI-in-the-Loop Sensing and Communication Joint Design for Edge Intelligence [65.29835430845893]
本稿では,AI-in-the-loopジョイントセンシングと通信によるエッジインテリジェンス向上のためのフレームワークを提案する。
私たちの研究の重要な貢献は、バリデーション損失とシステムのチューニング可能なパラメータとの間に明確な関係を確立することです。
提案手法は, 通信エネルギー消費を最大77%削減し, 試料数で測定した検知コストを最大52%削減する。
論文 参考訳(メタデータ) (2025-02-14T14:56:58Z) - SensorBench: Benchmarking LLMs in Coding-Based Sensor Processing [6.8009140511761546]
大規模言語モデル(LLM)は、知覚データを処理する上で有望な能力を持ち、センサーシステムを開発するための副操縦士としての可能性を示している。
我々は,定量化のための総合的なベンチマークであるSensorBenchを構築した。
以上の結果から,LLMは単純なタスクでかなりの習熟度を示す一方で,構成タスクの処理において固有の課題に直面していることが明らかとなった。
論文 参考訳(メタデータ) (2024-10-14T17:21:39Z) - Dynamic Hand Gesture-Featured Human Motor Adaptation in Tool Delivery
using Voice Recognition [5.13619372598999]
本稿では,革新的なロボット協調フレームワークを提案する。
手の動きや動的動きの認識、音声認識、切り替え可能な制御適応戦略をシームレスに統合する。
ハンドジェスチャ認識における優れた性能を示す実験結果が得られた。
論文 参考訳(メタデータ) (2023-09-20T14:51:09Z) - Bayesian Imitation Learning for End-to-End Mobile Manipulation [80.47771322489422]
RGB + 深度カメラのような追加のセンサー入力によるポリシーの強化は、ロボットの知覚能力を改善するための簡単なアプローチである。
畳み込みニューラルネットワークを正規化するために変分情報ボトルネックを用いることで、保持領域への一般化が向上することを示す。
提案手法は, シミュレーションと現実のギャップを埋めることと, RGBと奥行き変調をうまく融合できることを実証する。
論文 参考訳(メタデータ) (2022-02-15T17:38:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。