論文の概要: Wonder: Video World Model Done Better
- arxiv url: http://arxiv.org/abs/2607.26037v1
- Date: Tue, 28 Jul 2026 17:45:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.952893
- Title: Wonder: Video World Model Done Better
- Title(参考訳): ワンダーマン:ビデオワールドモデルの方が良い
- Abstract要約: We present Wonder, a general-purpose video world model for real-time, camera-controllable world exploration。
画像や条件付きビデオが与えられたWonderは、ユーザがカメラを動かして対話的にナビゲートできるプレイ可能な世界を構築する。
本研究では、空間的に整列した動きと向きを与える高密度座標場を用いた新しいカメラコンディショニングを提案する。
- 参考スコア(独自算出の注目度): 70.28870858365214
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Wonder, a general-purpose video world model for real-time, camera-controllable world exploration. Given an image or a conditional video, Wonder constructs a playable world where users can navigate interactively by moving the camera, discovering unseen regions, and revisiting previously observed areas in real time and over a long-term horizon. Achieving this capability requires a system-level co-design of control method, memory mechanism, and training strategy. We introduce a novel camera conditioning with a dense coordinate field whose renderings provide spatially aligned motion and orientation cues, allowing the model to interpret camera motion directly as visual evidence. To support fast and precise memory retrieval over a growing generation context, we propose an efficient sparse attention-based memory mechanism, enabling the model to selectively attend to a small set of relevant context tokens at inference time, regardless of actual context length. We further develop several techniques to rectify the self-forcing-style distillation pipeline, improving the student model's ability to respect control signals, as well as maintaining diverse generation modes and long-term memory from the teacher. Together, these components enable Wonder to synthesize diverse, minute-scale videos at 16 FPS while preserving coherent geometry, appearance, and dynamics across long rollouts. Beyond image-to-video generation, Wonder naturally supports video-conditioned generation, allowing existing dynamic scenes to be re-shot in real time.
- Abstract(参考訳): We present Wonder, a general-purpose video world model for real-time, camera-controllable world exploration。
画像や条件付きビデオが与えられたWonderは、カメラを動かしたり、目に見えない領域を発見したり、観察された領域をリアルタイムで、長期的な地平線上で再考することで、対話的にナビゲートできるプレイ可能な世界を構築する。
この能力を達成するには、システムレベルの制御方法、メモリメカニズム、トレーニング戦略の共設計が必要である。
本研究では、空間的に整列した動きと向きの手がかりを提供する高密度座標場を用いた新しいカメラコンディショニングを導入し、視覚的証拠として直接カメラの動きを解釈できるようにする。
生成コンテキストにおける高速かつ高精度なメモリ検索を支援するため,本研究では,実際のコンテキスト長に関わらず,モデルが推論時に,関連するコンテキストトークンの小さなセットに選択的に出席できるようにする,効率的なスパースアテンションベースのメモリ機構を提案する。
さらに, 自己強制型蒸留パイプラインの修正, 制御信号の尊重能力の向上, 教師からの多種多様な生成モードと長期記憶の維持など, 様々な手法が開発されている。
これらのコンポーネントを組み合わせることで、Wonderは16 FPSで多種多様なミニスケールのビデオを合成し、コヒーレントな幾何学、外観、そして長いロールアウトのダイナミックスを保存することができる。
画像からビデオへの生成以外にも、Wonderは自然にビデオコンディション生成をサポートしており、既存のダイナミックシーンをリアルタイムで再撮影することができる。
関連論文リスト
- Sekai2: From World Exploration to Interactive World Modeling [22.57939715452233]
Sekai2(セカイ2)は、セカイの世界探査映像をインタラクティブな世界モデリングへ運ぶマルチソースのリアルワールドビデオデータセットである。
リリースには128,892のクリップが含まれている。
すべてのクリップには、被写体の動き、環境のダイナミクス、静的なシーンの内容、カメラの振る舞いを区別する、リリースされたカメラの軌跡と階層的なアノテーションが含まれており、結果として649,597の時間的接地セグメントが生成される。
論文 参考訳(メタデータ) (2026-08-10T11:23:01Z) - Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control [56.828569670698975]
デレクシング・ザ・ワールド(Directing the World)は、人体動作とカメラ軌道制御を備えた、制御可能な世界モデルビデオ生成のための高速自動回帰フレームワークである。
私たちのキーとなるアイデアは、前もって統合された自己回帰ビデオを保持しながら、制御学習を分離することです。
人間の動作制御のために、t誘導型動的投射機構と洗練されたモーション-CFG戦略を設計する。
論文 参考訳(メタデータ) (2026-06-26T11:08:09Z) - OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation [42.159343032593014]
制御可能なパノラマビデオ生成フレームワークであるOmniRoamを提案する。
本フレームワークは,パノラマ表現の長期的・時間的一貫性と,フレーム単位のシーンのリッチなカバレッジを活用している。
実験により、我々のフレームワークは、視覚的品質、制御可能性、長期的なシーンの一貫性の観点から、常に最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2026-03-31T17:59:33Z) - Plenoptic Video Generation [80.3116444692858]
PlenopticDreamerは、同期時間記憶を維持するために生成幻覚を同期するフレームワークである。
中心となる考え方は、マルチインアウトのビデオ条件付きモデルを自己回帰的にトレーニングすることだ。
トレーニングでは,コンバージェンス向上のためのコンテキストスケーリング,エラー蓄積による幻覚への自己条件付け,拡張ビデオ生成をサポートする長時間ビデオコンディショニング機構が組み込まれている。
論文 参考訳(メタデータ) (2026-01-08T18:58:32Z) - RELIC: Interactive Video World Model with Long-Horizon Memory [74.81433479334821]
真のインタラクティブな世界モデルは、リアルタイムの長距離ストリーミング、一貫した空間記憶、正確なユーザ制御を必要とする。
この3つの課題を完全に解決する統合フレームワークであるRELICを紹介します。
単一の画像とテキスト記述が与えられた後、RELICは任意のシーンをリアルタイムにメモリを意識した長期探索を可能にする。
論文 参考訳(メタデータ) (2025-12-03T18:29:20Z) - Video World Models with Long-term Spatial Memory [110.530715838396]
本稿では,ビデオワールドモデルの長期的整合性を高める新しい枠組みを提案する。
我々のフレームワークは、長期空間記憶から情報を保存・取得する機構を含んでいる。
評価の結果,関連するベースラインに比べて品質,一貫性,コンテキスト長が向上した。
論文 参考訳(メタデータ) (2025-06-05T17:42:34Z) - Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated Attention [62.2447324481159]
Caviaはカメラ制御可能なマルチビュービデオ生成のための新しいフレームワークである。
我々のフレームワークは、空間的および時間的注意モジュールを拡張し、視点と時間的一貫性を改善します。
Caviaは、ユーザーが物体の動きを取得しながら、異なるカメラの動きを特定できる最初の製品だ。
論文 参考訳(メタデータ) (2024-10-14T17:46:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。