論文の概要: EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE
- arxiv url: http://arxiv.org/abs/2607.28243v1
- Date: Thu, 30 Jul 2026 14:06:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.586094
- Title: EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE
- Title(参考訳): EgoGenesis: オンライン Anchored Projective Memory と Action-3D RoPEによるエゴセントリックなワールドアクションモデリング
- Authors: Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang,
- Abstract要約: Egocentric Videoは、組み込みAIのためのリッチな操作エクスペリエンスを提供する。
しかし、シーン、オブジェクト、モーション、エンボディメントにまたがる多様なエゴセントリックなデータを集めることは、依然としてコストがかかる。
本稿では,制御可能な高品質な操作映像を合成するエゴセントリックなワールドアクションシミュレータを提案する。
- 参考スコア(独自算出の注目度): 11.752532474694481
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Egocentric video offers rich manipulation experience for embodied AI, yet collecting diverse egocentric data across scenes, objects, motions, and embodiments remains costly. We present \method, an egocentric world-action simulator that synthesizes controllable, high-quality manipulation videos to expand scarce real-world training data. \method{} builds on a pretrained video generation prior and introduces two geometry-aware conditioning mechanisms. Online Anchored Projective Memory (OAPM) preserves a first-frame 3D scene anchor while periodically refreshing a recent state during autoregressive generation. Action-3D Rotary Position Embedding (A3D-RoPE) encodes end-effector motion with camera-aware 3D rotary coordinates, injecting action geometry into skeleton-to-video cross-attention for precise control. Together, these components improve visual fidelity, geometric stability, and action alignment in long egocentric rollouts. Moreover, augmenting 400 real trajectories with 400 \method-generated trajectories improves out-of-distribution real-robot success from 77\% to 84\% on single-arm tasks and from 53\% to 70\% on dual-arm tasks, demonstrating that the synthesized data substantially improve downstream WAM generalization.
- Abstract(参考訳): Egocentric Videoは、エンボディドAIのためのリッチな操作エクスペリエンスを提供するが、シーン、オブジェクト、モーション、エンボディメントをまたいだ多様なエゴセントリックなデータを収集するのに、コストがかかる。
制御可能な高品質な操作映像を合成し、少ない実世界のトレーニングデータを拡張するエゴセントリックな世界アクションシミュレータである \method を提案する。
\method{}は事前訓練されたビデオ生成に基づいて構築され、2つの幾何学的条件付け機構を導入している。
Online Anchored Projective Memory (OAPM)は、自動回帰生成中に最新の状態を定期的に更新しながら、第1フレームの3Dシーンアンカーを保存する。
Action-3D Rotary Position Embedding (A3D-RoPE)は、カメラ対応の3D回転座標でエンドエフェクタ動作を符号化し、アクション幾何学をスケルトンとビデオのクロスアテンションに注入して正確な制御を行う。
これらのコンポーネントは、長いエゴセントリックなロールアウトにおいて、視覚的忠実度、幾何学的安定性、およびアクションアライメントを改善する。
さらに,400個の<method- generated trajectories を用いて400個の実軌道を増大させることにより,単腕タスクでは 77 % から 84 % に,両腕タスクでは 53 % から 70 % に向上し,合成データにより下流 WAM の一般化が著しく向上することを示した。
関連論文リスト
- ManiSplat: Manipulation Trajectory Synthesis from Monocular Video via Decoupled 3D Gaussian Splatting [28.256286705954846]
現実の観察から動的でインタラクティブな3Dシーンを再構築することは、コンピュータビジョンとロボティクスの基本的な課題である。
ロボットビデオから直接ガウスのデジタル双生児を制御可能で分離する統合フレームワークであるManiSplatを紹介した。
提案手法は,対話駆動型動的シーンを高忠実度かつ制御性で再構築し,下流ロボットタスクとポリシー学習を効果的に支援する。
論文 参考訳(メタデータ) (2026-06-09T09:55:58Z) - GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors [113.71148915419246]
GRAILは3Dアセット、シミュレーター対応シーン、およびビデオファンデーションモデル(VFM)の先行データで構成され、物理的環境を再構築したりロボットを遠隔操作したりすることなく対話を合成するデジタル生成パイプラインである。
GRAILは、オブジェクト形状、カメラパラメータ、メートル法スケール、環境深度、ロボットが提案する文字がビデオ生成の前に知られ、再構成中に再利用される、完全に定義された3D構成から始まる。
我々は、回復した動作をヒューマノイドロボットに再ターゲティングし、補完的なタスク・ジェネラル・モルフォロジー・トラッカーを訓練する。
GRAILは、ピックアップ、オブジェクト操作、着座にまたがる2万以上のシーケンスを生成する
論文 参考訳(メタデータ) (2026-06-03T17:57:45Z) - FunRec: Reconstructing Functional 3D Scenes from Egocentric Interaction Videos [134.8812117202239]
本稿では,エゴセントリックなRGB-Dインタラクションビデオから直接室内シーンの3次元ディジタル双対を再構成するFunRecを提案する。
本研究では,URDF/USDエクスポートのシミュレーション,手指のアベイランスマッピング,ロボットとシーンのインタラクションへの応用を実演する。
論文 参考訳(メタデータ) (2026-04-07T09:22:12Z) - Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints [87.13154261503168]
モーションコントロール可能なビデオ生成は、仮想現実と組み込みAIにおけるエゴセントリックなアプリケーションに不可欠である。
既存の手法は、しばしば3D一貫性のきめ細かい手話を実現するのに苦労する。
単一の参照フレームからエゴセントリックなビデオを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-12T10:02:23Z) - EgoReAct: Egocentric Video-Driven 3D Human Reaction Generation [84.37917777533963]
EgoReActは,エゴセントリックな映像ストリームからリアルタイムに3Dアライメントされた人間の反応運動を生成する最初のフレームワークである。
EgoReAct は,従来の手法に比べて極めて高いリアリズム,空間整合性,生成効率を実現している。
論文 参考訳(メタデータ) (2025-12-28T06:44:05Z) - SpatialTrackerV2: 3D Point Tracking Made Easy [73.0350898700048]
SpaceTrackerV2はモノクロビデオのフィードフォワード3Dポイントトラッキング手法である。
これは、世界空間の3Dモーションをシーン幾何学、カメラエゴモーション、ピクセルワイドオブジェクトモーションに分解する。
このような異種データから幾何学と運動を共同で学習することで、SpatialTrackerV2は既存の3Dトラッキング方法よりも30%優れています。
論文 参考訳(メタデータ) (2025-07-16T17:59:03Z) - Ego3DT: Tracking Every 3D Object in Ego-centric Videos [20.96550148331019]
本稿では,エゴ中心映像からの物体の3次元再構成と追跡のための新しいゼロショット手法を提案する。
Ego3DTは,エゴ環境内のオブジェクトの検出とセグメンテーション情報を最初に識別し,抽出する新しいフレームワークである。
また,エゴ中心ビデオにおける物体の3次元追跡軌道を安定的に作成するための動的階層化機構を革新した。
論文 参考訳(メタデータ) (2024-10-11T05:02:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。