論文の概要: World Observer: Joint Actor-Observer Generation for Persistent World Modeling
- arxiv url: http://arxiv.org/abs/2610.02162v1
- Date: Thu, 01 Oct 2026 17:53:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.35913
- Title: World Observer: Joint Actor-Observer Generation for Persistent World Modeling
- Title(参考訳): World Observer: 永続的世界モデリングのためのジョイントアクタ・オブザーバ生成
- Abstract要約: 本稿では,エージェント中心の視点のアクターを共同で生成することで,行動から観察を分離するWorld Observerを紹介する。
これにより、アクターの視点を残したオブジェクトはオブザーバ内で視覚的に進化し続けるため、更新された状態は再突入時に反映される。
World Observerは視界外ダイナミクスを大幅に改善すると同時に、視覚的忠実度、カメラ制御、および3Dアテンデンスに競争力を維持している。
- 参考スコア(独自算出の注目度): 32.95286817329024
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How can a world model continuously observe regions beyond the actor's current view? Video world models simulate how an environment evolves from an agent's actions, yet remain actor-centric. Once an object leaves the actor's view, they lose direct evidence of its evolution, often failing to preserve its state and dynamics upon re-entry. To address this, we introduce World Observer, which decouples observing from acting by jointly generating a perspective actor for the agent-centric view with one or more panoramic observers that watch selected world regions. This allows objects that leave the actor's view to remain visually evolving in an observer, so their updated states are reflected when they re-enter. We ground the actor and observers by warping from a shared panoramic source for explicit geometric correspondence, and introduce an Observer Sink of high-resolution perspective references to restore fine appearance upon re-entry. Since the observers are decoupled from the actor, they can be placed freely across the scene, extended to multiple locations for broader coverage, and driven by control signals to steer out-of-view evolution. To evaluate out-of-view evolution, we further introduce world-space metrics and a benchmark spanning real and synthetic scenes. World Observer substantially improves out-of-view dynamics while remaining competitive in visual fidelity, camera control, and 3D adherence.
- Abstract(参考訳): 世界モデルはアクターの現在の視点を超えた領域を継続的に観察できるのか?
ビデオワールドモデルは、エージェントのアクションから環境がどのように進化するかをシミュレートするが、アクター中心のままである。
オブジェクトがアクターの視点を離れると、それらは進化の直接的な証拠を失い、しばしば再突入時に状態とダイナミクスを保たない。
そこで本研究では,エージェント中心の視点俳優を,選択された世界地域を観察する1人以上のパノラマオブザーバと共同で生成することで,行動の観察から切り離すWorld Observerを紹介した。
これにより、アクターのビューを残したオブジェクトはオブザーバ内で視覚的に進化し続けることができるため、再突入時に更新された状態が反映される。
アクターとオブザーバは、共有パノラマ音源からゆがみ、鮮明な幾何学的対応を図り、高解像度の視点参照のオブザーバシンクを導入し、再突入時に微細な外観を復元する。
オブザーバーはアクターから切り離されるため、シーンを自由に配置でき、広い範囲でカバーするために複数の場所に拡張できる。
アウト・オブ・ビューの進化を評価するために,実シーンと合成シーンにまたがる世界空間メトリクスとベンチマークを導入する。
World Observerは視界外ダイナミクスを大幅に改善すると同時に、視覚的忠実度、カメラ制御、および3Dアテンデンスに競争力を維持している。
関連論文リスト
- Code Plans, Diffusion Renders: Open-Ended Generative World Modeling [82.36042129562516]
我々は世界モデリングの新しいパラダイムである textbfCoDeR を紹介する。
本システムは,コードによる実行可能世界を明示的に構築し,映像生成モデルを用いて視覚的実現を行う。
論文 参考訳(メタデータ) (2026-09-22T14:12:15Z) - World in World: Explore the World with World Models [5.1244963637555285]
我々は、不均一な制御証拠をクリーンな視覚状態に変換するトレーニング不要な推論時間インターフェースであるWorld in Worldを提示する。
我々は、様々な視点の変化の下で、カメラ制御されたビデオリレンダリングによるワールド・イン・ワールドの評価を行った。
論文 参考訳(メタデータ) (2026-09-10T13:42:26Z) - WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity [75.96851880065331]
ビジュアル品質、制御の整合性、空間整合性、世界反応性の4つのレベルにまたがる診断ベンチマークであるWorldExamを紹介した。
8つのタスクにまたがる1,474のケースで構成され、カメラ、アクション、言語駆動モデルパラダイムの統一的な評価をサポートする。
カメラ駆動型モデルはカメラ制御に優れるが,インターフェースは動的相互作用をサポートしていない。
論文 参考訳(メタデータ) (2026-08-03T17:59:54Z) - Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers [50.3000377325823]
We present WorldWeaver, a streaming multi-agent video diffusion model that a rollout with cross-agent world state registers。
これらのレジスタには、個々のエージェントの状態、鳥眼ビューを含むグローバルステートビュー、シーンテキストの監視信号が配置されている。
2エージェントのMinecraftビデオ生成の実験では、明示的な世界状態モデリングが論理的一貫性と生成品質を向上させることが示されている。
論文 参考訳(メタデータ) (2026-07-23T17:59:58Z) - WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory [106.28234880163723]
WorldDirectorは、高度に制御可能なビデオワールドモデルフレームワークである。
我々のフレームワークは、視覚生成から意味的な動きのオーケストレーションを明示的に分離する。
長時間の視界外から再突入しても,動的実体の正確な視覚的アイデンティティを保たせることができた。
論文 参考訳(メタデータ) (2026-07-02T17:59:59Z) - Current World Models Lack a Persistent State Core [18.34296893231955]
世界モデルはますます、人工知能への決定的な一歩と見なされている。
それらは、観測から切り離された、時間とともに進化し続ける内部的な世界状態を必要とします。
textbfWRBenchは、カメラの動きを可観測性への介入として扱う最初の体系的診断ベンチマークである。
論文 参考訳(メタデータ) (2026-06-18T17:55:15Z) - AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization [79.26935895370191]
AnchorWorldは、対話の整合性を強化することで、エゴセントリックなシミュレーションを促進するフレームワークである。
補助訓練監督は、エージェントのファーストパーソンセンタリウムから切り離された視点を取り入れている。
我々は、自己進化する世界をカスタマイズするためのシンプルで効果的なメカニズムを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:43:13Z) - MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data [125.43597497646444]
MetaWorldは、マルチエージェントビデオワールドモデルをシングルビュービデオから直接オープンドメイン環境にスケールする新しいフレームワークである。
クロスビューの一貫性とアイデンティティの整合性を向上し、マルチエージェントビデオワールドモデリングのための高度にスケーラブルで物理駆動のパラダイムを確立する。
論文 参考訳(メタデータ) (2026-06-01T18:20:20Z) - LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models [32.92934803081681]
近年の世代別ビデオワールドモデルは、視覚環境の進化をシミュレートすることを目的としており、観察者はカメラ制御によってシーンをインタラクティブに探索することができる。
彼らは、世界は観察者の視野内でしか進化しないと暗黙的に仮定している。
オブジェクトがオブザーバの視点を離れると、その状態はメモリ内で"凍結"され、その後同じ領域を再考しても、その間に発生すべき出来事を反映できないことがしばしばある。
永続的な世界進化をサポートするために,ビデオワールドモデルを拡張する新しいフレームワークであるLiveWorldを提案する。
論文 参考訳(メタデータ) (2026-03-07T10:31:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。