論文の概要: Video2World: Benchmarking Coding Agents for Interactive World Modeling from Embodied Videos
- arxiv url: http://arxiv.org/abs/2610.04432v1
- Date: Sat, 03 Oct 2026 10:46:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.367517
- Title: Video2World: Benchmarking Coding Agents for Interactive World Modeling from Embodied Videos
- Title(参考訳): Video2World: エンボディードビデオからのインタラクティブワールドモデリングのためのベンチマークコーディングエージェント
- Abstract要約: 実世界の観測からインタラクティブなシミュレータを構築することは、エンボディドデータをスケールするための有望な方法である。
エージェントがエンボディ映像を観察し、対応する環境とロボットの動作を構築し、実行フィードバックによって結果を反復的に洗練するソフトウェアエンジニアリングタスクとして、エフェノミクスビデオ・シミュレーションを定式化する。
Video2Worldは、幾何学的忠実度、動的忠実度、機能的正しさ、空間的知覚、物理的推論、実行可能相互作用に沿った世界を再構成する。
- 参考スコア(独自算出の注目度): 44.02553324785577
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Building interactive simulators from real-world observations is a promising way to scale embodied data, but current pipelines still rely heavily on manual environment construction and calibration. We study whether frontier foundation models and coding agents can automate this process end to end. We formulate \emph{autonomous video-to-simulation} as a software engineering task in which an agent observes an embodied video, constructs the corresponding simulated environment and robot behavior, and iteratively refines the result through execution feedback. To evaluate this capability, we introduce \textbf{Video2World}, a benchmark comprising 222 reconstruction instances derived from 189 robot and human demonstration videos. Video2World measures reconstructed worlds along geometric fidelity, dynamic fidelity, and functional correctness, capturing spatial perception, physical reasoning, and executable interaction. Evaluating 9 frontier coding-agent systems reveals a sharp improvement in Task success beginning with Claude Opus 5, rising from below 5\% to over 15\%, while substantial gaps to human-assisted reconstruction remain. We further find that worlds that look better could work worse: better visual fidelity does not always lead to higher task success. This echoes the broader gap between perceptual realism and factual correctness observed in generative models.
- Abstract(参考訳): 実世界の観測からインタラクティブなシミュレータを構築することは、エンボディドデータをスケールするための有望な方法だが、現在のパイプラインは依然として手動の環境構築と校正に大きく依存している。
我々は、フロンティア基礎モデルとコーディングエージェントがこのプロセスをエンドツーエンドで自動化できるかどうか検討する。
エージェントが映像を観察し、それに対応する環境とロボットの動作を構築し、実行フィードバックによって結果を反復的に洗練するソフトウェアエンジニアリングタスクとして「emph{autonomous video-to-simulation」を定式化する。
この能力を評価するために,189個のロボットと人体デモビデオから得られた222個の再構成例からなるベンチマークである \textbf{Video2World} を導入する。
Video2Worldは、幾何学的忠実度、動的忠実度、機能的正しさ、空間的知覚、物理的推論、実行可能相互作用に沿った世界を再構成する。
9つのフロンティアコーディングエージェントシステムの評価は、Claude Opus 5から始まるタスク成功の急激な改善を示している。
より良い視覚的忠実さは、必ずしもより高いタスクの成功をもたらすとは限らない。
これは、知覚的リアリズムと生成モデルで観察される事実的正しさの間の広いギャップを反映している。
関連論文リスト
- Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents [42.18672329354181]
textitAgentic Real2Simは視覚言語エージェントを用いた物理世界モデリングのためのフレームワークである。
我々は,剛体オブジェクトの操作,変形性オブジェクトのインタラクション,ヒューマノイドモーションシーンにおけるエージェントReal2Simの評価を行った。
フレームワークのエージェント的決定は、フロンティアモデルのコストのごく一部で、オープンウェイトなVLMバックエンドによって駆動される。
論文 参考訳(メタデータ) (2026-07-21T15:23:38Z) - ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation [90.4702774169675]
本稿では,古典シミュレーションとニューラルシミュレーションを組み合わせた合成シミュレーションというハイブリッド手法を提案する。
提案手法では,少数の実世界のデータを活用するクローズドループ・リアル・シモン・リアル・データ拡張パイプラインを利用する。
我々はニューラルシミュレーターをトレーニングし、古典的なシミュレーションビデオを現実世界の表現に変換し、現実の環境で訓練されたポリシーモデルの精度を向上させる。
論文 参考訳(メタデータ) (2026-04-13T12:25:45Z) - DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos [110.98100817695307]
私たちはDreamDojoを紹介します。DreamDojoは、多種多様なインタラクションと、エゴセントリックな人間ビデオの44万時間から厳密なコントロールを学ぶ基礎的な世界モデルです。
本研究は, 遠隔操作, 政策評価, モデルベース計画など, 生成的世界モデルに基づくいくつかの重要な応用を可能にする。
論文 参考訳(メタデータ) (2026-02-06T18:49:43Z) - Mirage2Matter: A Physically Grounded Gaussian World Model from Video [87.9732484393686]
我々は、グラフィック駆動の世界モデリングおよびシミュレーションフレームワークであるSimulate Anythingを紹介する。
実世界の環境を3次元ガウススプレイティング(3DGS)による写実的シーン表現に再構築する。
次に、生成モデルを利用して、物理的に現実的な表現を復元し、精度校正ターゲットを介してシミュレーション環境に統合する。
論文 参考訳(メタデータ) (2026-01-24T07:43:57Z) - Rethinking Video Generation Model for the Embodied World [26.174517437895616]
RBenchは5つのタスク領域と4つの異なる実施形態でロボット指向のビデオ生成を評価するように設計されている。
25個の代表モデルの評価は、身体的現実的なロボット行動の生成において重大な欠陥を浮き彫りにしている。
改良された4段階のデータパイプラインを導入し、400万の注釈付きビデオクリップを備えたビデオ生成のための、最大のオープンソースロボットデータセットであるRoVid-Xを開発した。
論文 参考訳(メタデータ) (2026-01-21T18:59:18Z) - Simulating the Visual World with Artificial Intelligence: A Roadmap [48.64639618440864]
ビデオ生成は、視覚的に魅力的なクリップを生成するものから、インタラクションをサポートし、物理的な可視性を維持する仮想環境を構築するものへとシフトしている。
この調査は、この進化の体系的な概要を提供し、現代のビデオ基盤モデルを2つのコアコンポーネントの組み合わせとして概念化した。
4世代にわたる映像生成の進展を追究し,本質的な物理的妥当性を具現化した映像生成モデルを構築した。
論文 参考訳(メタデータ) (2025-11-11T18:59:50Z) - Reactive Long Horizon Task Execution via Visual Skill and Precondition
Models [59.76233967614774]
シミュレーションで学習したモデルを用いて、単純なタスクプランナの構成要素をグラウンド化することで、見知らぬロボットタスクを達成できるシミュレート・トゥ・リアル・トレーニングのアプローチについて述べる。
シミュレーションでは91.6%から98%,実世界の成功率は10%から80%に増加した。
論文 参考訳(メタデータ) (2020-11-17T15:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。