論文の概要: Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
- arxiv url: http://arxiv.org/abs/2610.01092v1
- Date: Thu, 01 Oct 2026 05:35:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.916585
- Title: Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
- Title(参考訳): Ego2Act:エゴ中心ビデオ生成におけるゴール指向マニピュレーションの評価
- Abstract要約: Ego2Actは、110の現実世界のタスクから2,640の動画を収録したゴール指向のベンチマークである。
Ego2Actは、映像生成モデルが、作業を実行するために手操作対象の現実的なエゴセントリックなビデオを生成することができるかどうかを評価する。
その結果、モデルが生成したシミュレーションは、しばしばステップをスキップまたは部分的に実行し、後続のステップに依存状態が失われることが判明した。
- 参考スコア(独自算出の注目度): 46.6894894489978
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video generation models are increasingly being explored as world simulators for embodied planning and learning. To do so effectively, these models must not only generate visually appealing frames, but also predict how environments dynamically evolve when executing goal-directed actions. While evaluating these capabilities is crucial, existing benchmarks focus mainly on single short actions or step-by-step instructions. This leaves multi-step physical reasoning underexplored, especially in egocentric video generation that requires planning to simulate proper execution to accomplish high-level goals by carrying out multiple real-world manipulations. We introduce Ego2Act, a goal-directed benchmark featuring 2,640 videos from 110 real-world tasks across day-to-day settings, varying object clutter and multi-step complexity. Given an initial scene image and a high-level goal, Ego2Act evaluates whether video generation models can produce realistic egocentric videos of a hand manipulating objects to carry out the task. To support scalable evaluation, we also introduce Ego2ActJudge, a reference-free evaluation pipeline that achieves better task completion and physics plausibility evaluation alignment with human consensus compared to relevant baselines. Our findings reveal that models' generated simulations often skip or partially execute steps, leaving later steps missing dependent states, which leads to unfulfilled goal. Furthermore, models consistently fail at fine-grained physical dynamics, particularly during complex object manipulation and persistent world modeling. We hope Ego2Act provides a rigorous testbed for advancing video models toward physically plausible, goal-directed simulation.
- Abstract(参考訳): ビデオ生成モデルは、具体化された計画と学習のための世界シミュレータとして、ますます研究されている。
効果的に行うためには、これらのモデルは視覚的に魅力的なフレームを生成するだけでなく、ゴール指向アクションの実行時に環境がどのように動的に進化するかを予測する必要がある。
これらの機能を評価することは重要だが、既存のベンチマークは主に単一のショートアクションやステップバイステップのインストラクションに重点を置いている。
このことは、特にエゴセントリックなビデオ生成において、複数の実世界の操作を実行することで、高いレベルの目標を達成するために適切な実行をシミュレートする必要がある、多段階の物理的推論を過小評価している。
Ego2Actはゴール指向のベンチマークで、110の現実世界のタスクから日々の設定、さまざまなオブジェクトのクラッタ、マルチステップの複雑さまで2,640のビデオを特徴付ける。
Ego2Actは、初期シーンイメージと高レベルな目標を前提として、映像生成モデルが作業を実行するために手操作対象の現実的なエゴセントリックなビデオを生成することができるかどうかを評価する。
Ego2ActJudgeも導入した。これは基準のない評価パイプラインで、タスクの完了と、人間によるコンセンサスとの整合性の評価を、関連するベースラインと比較して向上させる。
その結果、モデルが生成したシミュレーションは、しばしばステップをスキップまたは部分的に実行し、後続のステップに依存状態が欠落し、未満たのゴールに繋がることが明らかとなった。
さらに、モデルは、特に複雑なオブジェクト操作や永続的な世界モデリングにおいて、微粒な物理力学において一貫して失敗する。
Ego2Actは、物理的に妥当でゴール指向のシミュレーションに向けて、ビデオモデルを前進させるための厳格なテストベッドを提供してくれることを願っている。
関連論文リスト
- Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence [73.39562379177796]
LingBot-Videoは、インテリジェンスを具体化するための、DiTベースのビデオ事前訓練のパラダイムだ。
データの観点からは、標準的なインターネットビデオにロボット指向の広範な映像を付加するデータプロファイリングエンジンを構築する。
トレーニングの観点から,身体的合理性とタスク完了に関するアライメントを強制する多次元報酬システムを開発する。
論文 参考訳(メタデータ) (2026-07-08T17:33:40Z) - LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model [14.98308724969322]
LOMEは、入力画像、テキストプロンプト、フレームごとのヒューマンアクションに条件付けされたビデオとして、現実的な人間とオブジェクトのインタラクションを生成することができる。
LOMEは、空間的人間の行動を共同で推定することで、オブジェクト操作に強力で正確なアクションガイダンスを注入する。
LOMEは、シミュレーション環境に制限されずに、AR/VR体験とスケーラブルなロボットトレーニングの道を開く。
論文 参考訳(メタデータ) (2026-03-28T23:58:29Z) - EgoForge: Goal-Directed Egocentric World Simulator [26.712565464146937]
EgoForgeはゴール指向の世界シミュレータで、最小限の静的入力から一対一のビデオロールアウトを生成する。
VideoDiffusionNFTは、拡散サンプリング中の目標完了、時間的因果性、シーンの一貫性、知覚的忠実度を最適化する軌道レベルの報酬誘導改良である。
論文 参考訳(メタデータ) (2026-03-20T17:46:55Z) - Walk through Paintings: Egocentric World Models from Internet Priors [65.30611174953958]
本稿では,エゴセントリック・ワールド・モデル(EgoWM)について述べる。
我々は、スクラッチからトレーニングするよりも、インターネット規模のビデオモデルのリッチワールドを再利用し、軽量なコンディショニング層を通じてモーターコマンドを注入する。
当社のアプローチは,3-DoF移動ロボットから25-DoFヒューマノイドまで,エボディメントやアクションスペースを自然に拡張する。
論文 参考訳(メタデータ) (2026-01-21T18:59:32Z) - Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals [15.286299359279509]
Goal Forceを使えば、明示的な力ベクトルと中間ダイナミクスを使って目標を定義することができる。
我々は、合成因果プリミティブのキュレートされたデータセットに基づいて、ビデオ生成モデルを訓練する。
以上の結果から,映像生成を基礎的な物理相互作用で基礎づけることで,暗黙的な神経物理シミュレータとしてモデルが現れる可能性が示唆された。
論文 参考訳(メタデータ) (2026-01-09T15:23:36Z) - EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos [25.047225764745978]
EgoGraspは,世界空間のハンドオブジェクトインタラクション(W-HOI)を,野生のダイナミックカメラを用いて,エゴセントリックなモノクロビデオから再構築する最初の方法である。
実験では,W-HOI再建における最先端性能を実現する手法を実証した。
論文 参考訳(メタデータ) (2026-01-03T03:08:48Z) - Do-Undo: Generating and Reversing Physical Actions in Vision-Language Models [57.71440995598757]
我々は,視覚言語モデルにおける重要なギャップに対処するために,Do-Undoタスクとベンチマークを導入する。
Do-Undoは、物理的な行動の結果をシミュレートし、それを正確に反転させるモデルを必要とし、視覚の世界における真の原因と効果を反映している。
論文 参考訳(メタデータ) (2025-12-15T18:03:42Z) - Whole-Body Conditioned Egocentric Video Prediction [98.94980209293776]
我々は、人間行動(PEVA)からエゴ中心のビデオを予測するモデルを訓練する。
身体の関節階層によって構成される運動的ポーズの軌跡を条件にすることで,人間の身体行動が1対1の視点から環境をどう形成するかをシミュレートする。
我々の研究は、複雑な現実世界の環境をモデル化し、人間の視点から映像を予測するエージェントの振る舞いを具体化するための最初の試みである。
論文 参考訳(メタデータ) (2025-06-26T17:59:59Z) - PlayerOne: Egocentric World Simulator [73.88786358213694]
PlayerOneは、最初のエゴセントリックなリアルワールドシミュレータである。
それは、エゴセントリックなビデオを生成し、エゴセントリックなカメラで捉えたユーザーの実際のシーンの人間の動きと厳密に一致している。
論文 参考訳(メタデータ) (2025-06-11T17:59:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。