論文の概要: SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation
- arxiv url: http://arxiv.org/abs/2608.04196v1
- Date: Tue, 04 Aug 2026 19:55:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.62028
- Title: SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation
- Title(参考訳): SiMDex: クロス・エボディメント・デキスタラス・マニピュレーションのための類似のエゴセントリック・ビデオ
- Authors: Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato,
- Abstract要約: SiMDexは、Dexterous操作におけるVLA後のトレーニングのために、人間のデータ選択をレコメンデーション問題としてキャストする。
SiMDexは、32Mエゴセントリックなヒトサンプルのプールからタスク関連サブセットを抽出するために、3層リコールグレードのパイプラインを使用している。
- 参考スコア(独自算出の注目度): 37.846581225763956
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent years have witnessed an explosive trend of scaling ego-centric human videos for robot manipulation, yet it remains unclear which data actually benefits dexterous manipulation. We present SiMDex, a similarity-based data mining framework that casts human data selection for VLA post-training in dexterous manipulation as a recommendation problem. For each robot demonstration, SiMDex employs a three-layer recall-ranking-re-ranking pipeline to extract task-relevant subsets from a pool of ~32M egocentric human samples, operating in a morphology-agnostic action space that requires no changes to VLA architecture or training. Against a strong baseline trained with an equal amount of randomly sampled human data, SiMDex uses only ~1.49M mined samples (<5% of the pool) yet improves the overall success rate from 47.7% to 61.1%, showing that selective curation outperforms indiscriminate data mixing.
- Abstract(参考訳): 近年、ロボット操作のためにエゴ中心の人間のビデオをスケールする爆発的な傾向が見られたが、どのデータがデキスタス操作に実際に役立つのかは不明だ。
提案するSiMDexは類似性に基づくデータマイニングフレームワークで,VLA後処理のための人為的データ選択を推奨問題とする。
ロボットのデモごとに、SiMDexは3層リコールレベルのパイプラインを使用して、約32Mの人間サンプルのプールからタスク関連サブセットを抽出し、VLAアーキテクチャやトレーニングを変更する必要のない形態に依存しないアクション空間で動作させる。
ランダムなサンプルデータと同じ量のトレーニングを受けた強いベースラインに対して、SiMDexはわずか1.49Mの採掘サンプル(プールの5%)しか使用していないが、全体的な成功率を47.7%から61.1%に改善し、選択的なキュレーションが不差別なデータ混合よりも優れていることを示した。
関連論文リスト
- HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining [93.5192770515694]
Embodied foundation modelは、大きな言語モデルのようなデータスケーリングの恩恵を受けることが期待されているが、より厳密なデータボトルネックに直面している。
遠隔操作された実ロボット軌道は、正確な行動監督と実施の整合性のために、訓練前の主流の源である。
エゴセントリックなデータに基づいて事前訓練された基礎モデルは、実ロボットアクション予測において24%低い検証損失を達成する。
論文 参考訳(メタデータ) (2026-06-18T17:37:34Z) - Do as I Do: Dexterous Manipulation Data from Everyday Human Videos [69.98851738909168]
我々は,単眼のRGBビデオの再構成と,多指ロボットハンドへの再ターゲティングを行うDO AS I DOを提案する。
アルゴリズムは、これらの手動の相互作用の推定値を、現実世界で実行可能な一連のアクションに再ターゲティングする。
総合的に、DO AS I DOは、手動物体の相互作用を推定し、RGBビデオから巧妙な操作軌跡を抽出する手法のこれまでの状態よりも優れていた。
論文 参考訳(メタデータ) (2026-06-17T17:57:34Z) - HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning [52.022681285103126]
我々はHumanoid MimicGenについて述べる。
本手法は,少数の実演から新しい状態へ,接触に富んだ全身スキルを適応させる。
我々は、HumanoidMimicGenが生成したデータと協調してトレーニングされた全身ビズモータポリシーが、実世界のデータでのみトレーニングされたものよりも20%優れていたことを示す。
論文 参考訳(メタデータ) (2026-05-26T21:57:11Z) - UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos [65.2981273885678]
実際のロボット遠隔操作データの収集コストのため、デクサラスな操作は依然として困難である。
我々は、ロボット中心の大規模データセットと視覚言語アクション(VLA)ポリシーを結合したロボット基盤スイートであるUniDexを紹介する。
UniDex-Dataset、UniDex-VLA、UniDex-Capは、ユニバーサルデキスタラス操作のためのスケーラブルな基盤スイートを提供する。
論文 参考訳(メタデータ) (2026-03-23T17:49:12Z) - DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos [56.64773686434068]
DexImitは、人間の操作映像を物理的に妥当なロボットデータに変換する自動フレームワークである。
DexImitは、インターネットまたはビデオ生成モデルから、人間のビデオに基づいて大規模なロボットデータを生成することができる。
ツールの使用、長距離タスク、きめ細かい操作を含む多様な操作タスクを処理できる。
論文 参考訳(メタデータ) (2026-02-10T18:59:02Z) - H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation [27.585828712261232]
H-RDT(Human to Robotics Diffusion Transformer)は、人間の操作データを利用してロボット操作能力を向上する新しいアプローチである。
私たちの重要な洞察は、大規模なエゴセントリックな人間操作ビデオとペアの3Dハンドポーズアノテーションが、自然な操作戦略を捉えたリッチな行動優先を提供するということです。
本研究では,(1)大規模な人間操作データに対する事前トレーニング,(2)モジュール型アクションエンコーダとデコーダを用いたロボット固有のデータに対するクロスエボディメント微調整という2段階の訓練パラダイムを導入する。
論文 参考訳(メタデータ) (2025-07-31T13:06:59Z) - Human2LocoMan: Learning Versatile Quadrupedal Manipulation with Human Pretraining [38.559900728422875]
我々は,人間とロコマンの双方から収集したデータを活用して,四面体操作のためのクロス・エボディメント・模倣学習システムを提案する。
我々は,6つの実世界の操作タスクにおいて,平均成功率を41.9%向上させるシステムの有効性を検証した。
論文 参考訳(メタデータ) (2025-06-19T17:22:52Z) - DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning [42.88605563822155]
本稿では,人間の手による人型ロボットの人体実験からトラジェクトリを合成する大規模自動データ生成システムを提案する。
私たちは、たった60のソースの人間デモから、これらのタスク全体で21Kのデモを生成します。
また、実世界のヒューマノイド缶ソートタスクに、実世界のシミュレート・トゥ・リアルパイプラインを配置する。
論文 参考訳(メタデータ) (2024-10-31T17:48:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。