論文の概要: RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
- arxiv url: http://arxiv.org/abs/2607.06558v2
- Date: Sun, 12 Jul 2026 13:53:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 13:33:35.675928
- Title: RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
- Title(参考訳): RynnWorld-Teleop:デジタル遠隔操作のためのアクションコンディション世界モデル
- Authors: Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li,
- Abstract要約: 本稿では,実際のロボットを生成世界モデルに置き換えることで,物理的な制約からデータ収集を分離するパラダイムであるデジタル遠隔操作を紹介する。
我々は、このパラダイムをRynnWorld-Teleopでインスタンス化する。これは、深度対応の骨格条件、ビデオ拡散変換器におけるプログレッシブな人間とロボットのトレーニング、自動回帰蒸留を統合するシステムである。
このパイプラインは生成プロセスを単一パスの推論に圧縮し、単一のH100 GPU上で40以上のFPS、リアルタイムインタラクティブな生成を可能にする。
- 参考スコア(独自算出の注目度): 48.828787848144806
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling robot learning requires massive, diverse trajectory data, yet collection is currently bottlenecked by physical teleoperation, where every demonstration binds operator time to specific hardware and workspaces. We introduce digital teleoperation, a paradigm that decouples data collection from physical constraints by replacing the real robot with a generative world model. In this framework, an operator's hand-pose stream drives a robot-centric generative world model to synthesize high-fidelity egocentric videos from a single reference image. The recorded pose stream serves as an embodiment-agnostic action label transferable to any target robot via standard retargeting, yielding complete state-action trajectories for imitation learning independent of physical hardware. We instantiate this paradigm in RynnWorld-Teleop, a system that integrates depth-aware skeletal conditioning, progressive human-to-robot training on a video Diffusion Transformer, and streaming autoregressive distillation. This pipeline compresses the generative process into a single-pass inference, enabling 40+ FPS, real-time interactive generation on a single H100 GPU. Policies trained exclusively on RynnWorld-Teleop-generated data achieve effective zero-shot Sim2Real transfer across dexterous and diverse bimanual tasks. Moreover, augmenting real-world datasets with our digitally teleoperated data consistently improves success rates, demonstrating that RynnWorld-Teleop serves as a high-fidelity, scalable data engine for the next generation of robotic agents.
- Abstract(参考訳): ロボット学習のスケーリングには膨大な多様な軌跡データが必要だが、現在は物理的な遠隔操作によって収集がボトルネックになっている。
本稿では,実際のロボットを生成世界モデルに置き換えることで,物理的な制約からデータ収集を分離するパラダイムであるデジタル遠隔操作を紹介する。
この枠組みでは、操作者の手動ストリームがロボット中心の生成世界を駆動し、単一の参照画像から高忠実な自我中心の映像を合成する。
記録されたポーズストリームは、標準的なリターゲティングを介して任意の対象ロボットに移動可能なエンボディメント非依存アクションラベルとして機能し、物理ハードウェアに依存しない模倣学習のための完全な状態動作軌跡を提供する。
我々は、このパラダイムをRynnWorld-Teleopでインスタンス化する。これは、深度対応の骨格条件、ビデオ拡散変換器におけるプログレッシブな人間とロボットのトレーニング、自動回帰蒸留を統合するシステムである。
このパイプラインは生成プロセスを単一パスの推論に圧縮し、単一のH100 GPU上で40以上のFPS、リアルタイムインタラクティブな生成を可能にする。
RynnWorld-Teleop生成データに専用に訓練されたポリシーは、デクスタラスで多様なバイマニュアルタスク間で効果的なゼロショットSim2Real転送を実現する。
さらに、我々のデジタルで遠隔操作されたデータによって現実世界のデータセットを拡大することは、成功率を継続的に向上させ、RynnWorld-Teleopが次世代のロボットエージェントのための高忠実でスケーラブルなデータエンジンとして機能することを示した。
関連論文リスト
- EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning [10.780924973366737]
EgoInfinityは、ロボットの獲得と学習のためのWebスケールデータ生成を可能にする、汎用的な4Dハンドオブジェクトインタラクションデータエンジンである。
EgoInfinity(エゴインフィニティ)は、知覚、セグメンテーション、再構築、相互認識の洗練、そして従来の計算不可能なビデオ対アクション問題を自動化するための、モジュール式エンジンである。
論文 参考訳(メタデータ) (2026-06-16T00:44:16Z) - DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos [110.98100817695307]
私たちはDreamDojoを紹介します。DreamDojoは、多種多様なインタラクションと、エゴセントリックな人間ビデオの44万時間から厳密なコントロールを学ぶ基礎的な世界モデルです。
本研究は, 遠隔操作, 政策評価, モデルベース計画など, 生成的世界モデルに基づくいくつかの重要な応用を可能にする。
論文 参考訳(メタデータ) (2026-02-06T18:49:43Z) - AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis [33.90053396451562]
AnchorDreamは、ロボットデータ合成のための事前学習されたビデオ拡散モデルを再利用した、エンボディメントを意識した世界モデルである。
本手法は,環境モデリングを必要とせず,大規模で多様な高品質なデータセットにスケールする。
実験の結果、生成されたデータは下流の政策学習において一貫した改善をもたらし、シミュレータのベンチマークでは36.4%、現実世界の研究ではほぼ2倍の性能を示した。
論文 参考訳(メタデータ) (2025-12-12T18:59:45Z) - RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video [56.9581053843815]
画像とビデオにおけるロボットセグメンテーションの基礎モデルであるRobotSegを紹介する。
ロボットへの適応の欠如、手動のプロンプトへの依存、フレーム単位のトレーニングマスクアノテーションの必要性に対処する。
それは、画像とビデオの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-11-28T07:51:02Z) - ORV: 4D Occupancy-centric Robot Video Generation [33.360345403049685]
遠隔操作を通じて現実世界のロボットシミュレーションデータを取得することは、時間と労力のかかることで有名だ。
ORVは,4次元のセマンティック・コンカレンシー・シーケンスをきめ細かな表現として利用した,作業中心のロボットビデオ生成フレームワークである。
ORVは、占有率に基づく表現を活用することにより、時間的一貫性と正確な制御性を確保しつつ、シミュレーションデータをフォトリアリスティックなロボットビデオにシームレスに変換することができる。
論文 参考訳(メタデータ) (2025-06-03T17:00:32Z) - DreamGen: Unlocking Generalization in Robot Learning through Video World Models [120.25799361925387]
DreamGenは、ニューラルトラジェクトリを通じて行動や環境を一般化するロボットポリシーをトレーニングするためのパイプラインだ。
私たちの研究は、手作業によるデータ収集を超えて、ロボット学習をスケールするための、有望な新たな軸を確立します。
論文 参考訳(メタデータ) (2025-05-19T04:55:39Z) - IRASim: A Fine-Grained World Model for Robot Manipulation [24.591694756757278]
本稿では,ロボットとオブジェクトのインタラクションの詳細を詳細に表現したビデオを生成する新しい世界モデルIRASimを提案する。
拡散変圧器を訓練し、各変圧器ブロック内に新しいフレームレベル動作条件モジュールを導入し、アクションフレームアライメントを明示的にモデル化し強化する。
論文 参考訳(メタデータ) (2024-06-20T17:50:16Z) - RT-1: Robotics Transformer for Real-World Control at Scale [98.09428483862165]
我々は,有望なスケーラブルなモデル特性を示す,ロボティクストランスフォーマーと呼ばれるモデルクラスを提示する。
実世界の課題を遂行する実ロボットの大規模データ収集に基づいて,様々なモデルクラスと,データサイズ,モデルサイズ,データの多様性の関数として一般化する能力について検証した。
論文 参考訳(メタデータ) (2022-12-13T18:55:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。