論文の概要: AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization
- arxiv url: http://arxiv.org/abs/2608.29242v2
- Date: Tue, 01 Sep 2026 11:29:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.617456
- Title: AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization
- Title(参考訳): AnyWorld: クロス・エンボディメント・ジェネリゼーションのための要因付きエゴセントリック・ワールドモデル
- Authors: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu,
- Abstract要約: 我々は,クロス・エボディメント・ワールド・モデリング・フレームワークであるAnyWorldを提案する。
私たちのモデルは、アクション、カメラ、エンボディメントへのインタラクションを分解します。
大規模なヒューマンインタラクション事前トレーニングでモデルをトレーニングする。
- 参考スコア(独自算出の注目度): 88.25615187835321
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Collecting contact-rich robot experiences at scale remains a major bottleneck for generalizable manipulation. Beyond data quantity, robot learning also requires diverse experiences across embodiments, viewpoints, and scenes. Human egocentric videos provide abundant physical interactions, but each video captures only a narrow slice of experience under a single body, camera trajectory, and environment. We propose AnyWorld, a cross-embodiment world modeling framework that expands a single human interaction into diverse robot-native rollouts without paired human-robot demonstrations. Our model factorizes an interaction into action, camera, and embodiment: action controls capture the motion structure, camera controls specify viewpoint evolution, and the target embodiment context defines the acting body and its interaction geometry. This formulation enables independent recomposition of embodiment, viewpoint, and scene factors, allowing a single model to generate many robot-domain experiences while preserving the underlying dynamics and object interactions. We train the model with large-scale human interaction pretraining followed by mixed-embodiment fine-tuning. Experiments show that our model supports controllable recomposition across embodiments, viewpoints, and scenes, and we further demonstrate that the generated data can improve manipulation performance on the RoboCasa GR1 tabletop benchmark and a real IRON humanoid robot. Beyond aggregate gains, we test whether unpaired human experience can be recomposed into robot-native video-action pairs that target a policy gap. Controlled IRON interventions correct a spurious completion prior and establish language-grounded spatial target selection; an action-only counterfactual intervention fails to learn the latter reliably, showing that both action calibration and visual recomposition are necessary.
- Abstract(参考訳): 接触に富んだロボット体験を大規模に収集することは、一般化可能な操作の大きなボトルネックである。
データ量以外にも、ロボット学習には実施状況、視点、シーンにまたがる多様な経験が必要である。
人間の自我中心の動画は、豊富な物理的相互作用を提供するが、それぞれのビデオは、単一の身体、カメラの軌道、環境下でのわずかな経験しか捉えていない。
我々はAnyWorldを提案する。AnyWorldは、人間とロボットのペアのデモなしで、単一の人間とのインタラクションを多様なロボットネイティブのロールアウトに拡張する、クロス・エボデーション・ワールド・モデリングフレームワークである。
アクションコントロールは動作構造を捉え,カメラコントロールは視点の進化を規定し,対象の実施状況は動作体とその相互作用の幾何学を定義する。
この定式化により、エンボディメント、視点、シーンファクタの独立的な再構成が可能となり、基礎となるダイナミクスやオブジェクトの相互作用を保ちながら、単一のモデルが多数のロボットドメイン体験を生成できる。
大規模人的相互作用事前訓練と混合体微調整を併用したモデルを構築した。
実験により,本モデルは実施形態,視点,シーン間での制御可能な再構成をサポートし,生成したデータにより,RoboCasa GR1テーブルトップベンチマークと実IRONヒューマノイドロボットの操作性能が向上することを示した。
集合的なゲイン以外にも、未経験の人間体験を、ポリシーギャップを目標とするロボットネイティブなビデオアクションペアに再分解できるかどうかをテストする。
制御されたIRONの介入は、事前の急激な完了を補正し、言語に基づく空間的選択を確立する。
関連論文リスト
- H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models [56.60098789696351]
H2R-Benchは、人間とロボットの相互操作ビデオ生成を評価するためのベンチマークである。
各ベンチマークインスタンスには、人間のデモビデオ、ターゲットの実施制約、ソース地上アノテーションが含まれている。
我々は、6つの操作ファミリーと2つのロボットエボディメントで11の最先端のビデオ生成モデルをベンチマークした。
論文 参考訳(メタデータ) (2026-08-13T10:14:33Z) - RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation [18.992624318431417]
本稿では,1つの自我中心のRGB-D観測から全身のヒューマノイド操作スキルを自動的に合成するフレームワークであるRoboReactを紹介する。
RoboReactは人間の操作ビデオを生成し、深度対応の3D再構成を通じて幾何学的相互作用を抽出し、手動物体の相互作用を保ちながら、それらを高DoFのヒューマノイドプラットフォームに再ターゲットする。
実際のヒューマノイドロボットの実験では、RoboReactはさまざまなオブジェクト構成をまたがって一般化し、遠隔操作や人間によるデモンストレーションを必要とせず、実行障害から堅牢に回復する。
論文 参考訳(メタデータ) (2026-08-04T09:37:06Z) - Robot-Factored World Models via Robot Rendering [25.12876640584098]
アクション条件付きビデオワールドモデルは、初期観測と行動信号から将来の観測を予測する。
本研究では,ロボット特異的な2つの要素を世界モデル外へ移動させるロボット駆動世界モデルを提案する。
実験により, レンダリングインタフェースはベクトル条件付きベースラインより優れており, 未知のロボットエンボディメント推論に一般化されていることがわかった。
論文 参考訳(メタデータ) (2026-07-24T17:59:57Z) - Masked Visual Actions for Unified World Modeling [96.12988421978463]
Masked Visual Actionsは、ビデオ内の任意の実体の部分的に明らかな軌跡としてアクションを表現するピクセル空間制御インタフェースである。
Revealing Robot Motionは、このモデルをフォワードダイナミクスモデルとして機能させ、低レベルのロボット動作に対するシーンの反応を予測する一方で、望ましい物体の動きを明らかにすることにより、同じモデルがロボットの動作をその結果と一致させる。
論文 参考訳(メタデータ) (2026-07-21T17:59:11Z) - EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration [67.13034606664333]
EgoHumanoidは、エゴセントリックな人間のデモを使って視覚言語アクションポリシーを共同訓練する最初のフレームワークである。
スケーラブルな人的データ収集のためのポータブルシステムを開発した。
論文 参考訳(メタデータ) (2026-02-10T18:59:03Z) - Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control [72.00655365269]
本稿では,協調的軌跡定式化を通じてオブジェクト間ダイナミクスをモデル化する新しいフレームワークであるRoboMasterを紹介する。
オブジェクトを分解する従来の方法とは異なり、我々のコアは、相互作用プロセスを3つのサブステージ(相互作用前、相互作用後、相互作用後)に分解することである。
提案手法は既存の手法よりも優れており,ロボット操作のための軌道制御ビデオ生成における最先端性能を確立している。
論文 参考訳(メタデータ) (2025-06-02T17:57:06Z) - Learning Predictive Models From Observation and Interaction [137.77887825854768]
世界との相互作用から予測モデルを学ぶことで、ロボットのようなエージェントが世界がどのように働くかを学ぶことができる。
しかし、複雑なスキルのダイナミクスを捉えるモデルを学ぶことは大きな課題である。
本研究では,人間などの他のエージェントの観察データを用いて,トレーニングセットを増強する手法を提案する。
論文 参考訳(メタデータ) (2019-12-30T01:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。