論文の概要: Sekai2: From World Exploration to Interactive World Modeling
- arxiv url: http://arxiv.org/abs/2608.09449v2
- Date: Tue, 11 Aug 2026 09:05:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.738343
- Title: Sekai2: From World Exploration to Interactive World Modeling
- Title(参考訳): Sekai2: World Exploration から Interactive World Modeling へ
- Authors: Kang He, Wenshuo Peng, Zihui Gao, Jiaming Tan, Kaipeng Zhang, Yongtao Ge,
- Abstract要約: Sekai2(セカイ2)は、セカイの世界探査映像をインタラクティブな世界モデリングへ運ぶマルチソースのリアルワールドビデオデータセットである。
リリースには128,892のクリップが含まれている。
すべてのクリップには、被写体の動き、環境のダイナミクス、静的なシーンの内容、カメラの振る舞いを区別する、リリースされたカメラの軌跡と階層的なアノテーションが含まれており、結果として649,597の時間的接地セグメントが生成される。
- 参考スコア(独自算出の注目度): 22.57939715452233
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video world models must capture how scenes evolve over time and across viewpoints. Training them for long-horizon generation and camera control therefore benefits from long videos paired with camera trajectories and temporally grounded semantics. Existing corpora rarely offer the three together: large-scale web video provides broad visual diversity but no trajectories or time-aligned text, while pose-annotated datasets are typically short-range or reconstruction-oriented. We introduce Sekai2, a multi-source real-world video dataset that carries the world-exploration footage of Sekai toward interactive world modeling. The release contains 128,892 clips totaling 2,826 hours from 10,428 source videos across 113 countries or regions, and is deliberately weighted toward sustained observation: under a common 120-second decomposition, 43,594 segments reach the full two minutes and account for 51.4% of all footage. Every clip includes a released camera trajectory and hierarchical annotations disentangling subject motion, environment dynamics, static scene content, and camera behavior, resulting in 649,597 temporally grounded segments. Crucially, we further introduce 982 panoramic sequences captured along non-linear trajectories with loops and revisits. These revisits provide repeated observations of the same locations across time and viewpoints, offering essential supervision for learning persistent scene representations, long-term spatial memory, and geometrically consistent world models. Corpus-scale analyses demonstrate complete pose-and-caption coverage, broad geographic and semantic diversity, varied camera trajectories, and highly non-redundant temporal descriptions. Together, these properties make Sekai2 a scalable resource for long-horizon video generation, camera-controllable synthesis, and interactive world-model pre-training.
- Abstract(参考訳): ビデオワールドモデルは、時間と視点をまたいだシーンの進化を捉えなければならない。
そのため、長距離生成とカメラ制御のためのトレーニングは、カメラの軌跡と時間的接地による意味論を組み合わせた長いビデオの恩恵を受ける。
大規模なウェブビデオは幅広い視覚的多様性を提供するが、軌跡や時間順のテキストは提供しない。
本稿では,セカイの世界探索映像をインタラクティブな世界モデリングへ向けたマルチソース実世界のビデオデータセットSekai2を紹介する。
リリースには128,892本のクリップが113か国または地域で10,428本のソースビデオから合計2,826時間含まれており、120秒間の一般的な分解では43,594本のセグメントが全2分間に到達し、全映像の51.4%を占めている。
すべてのクリップには、被写体の動き、環境のダイナミクス、静的なシーンの内容、カメラの振る舞いを区別する、リリースされたカメラの軌跡と階層的なアノテーションが含まれており、結果として649,597の時間的接地セグメントが生成される。
重要な点として,ループやリビジットを伴う非線形軌道に沿って捕獲された922個のパノラマ配列についても紹介する。
これらの改訂は、時間と視点で同じ場所を何度も観察し、永続的なシーン表現、長期空間記憶、幾何学的に一貫した世界モデルを学ぶための重要な監督を提供する。
コーパススケール分析では、完全なポーズ・アンド・キャプションのカバレッジ、広い地理的およびセマンティックな多様性、様々なカメラ軌跡、そして非常に非冗長な時間的記述が示される。
これらの特性により、Sekai2は長期ビデオ生成、カメラ制御可能な合成、インタラクティブなワールドモデル事前学習のためのスケーラブルなリソースとなる。
関連論文リスト
- Wonder: Video World Model Done Better [70.28870858365214]
We present Wonder, a general-purpose video world model for real-time, camera-controllable world exploration。
画像や条件付きビデオが与えられたWonderは、ユーザがカメラを動かして対話的にナビゲートできるプレイ可能な世界を構築する。
本研究では、空間的に整列した動きと向きを与える高密度座標場を用いた新しいカメラコンディショニングを提案する。
論文 参考訳(メタデータ) (2026-07-28T17:45:25Z) - SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations [88.8747004592363]
SceneScribe-1Mは新しい大規模多時間ビデオデータセットである。
そこには100万本のビデオが含まれており、それぞれに詳細なテキスト記述、正確なパラメータ、深度マップ、一貫性のある3Dポイントトラックなどが含まれている。
SceneScribe-1Mの汎用性と価値は、単眼深度推定、シーン再構成動的点追跡、テキスト・ビデオ合成などの生成タスク、カメラ制御の有無にかかわらず、幅広い下流タスクのベンチマークを確立することで示される。
論文 参考訳(メタデータ) (2026-04-09T08:59:33Z) - OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation [42.159343032593014]
制御可能なパノラマビデオ生成フレームワークであるOmniRoamを提案する。
本フレームワークは,パノラマ表現の長期的・時間的一貫性と,フレーム単位のシーンのリッチなカバレッジを活用している。
実験により、我々のフレームワークは、視覚的品質、制御可能性、長期的なシーンの一貫性の観点から、常に最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2026-03-31T17:59:33Z) - WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling [63.37476802589492]
We present WorldReel, a 4D video that are native-temporally consistent。
WorldReelは、ポイントマップ、カメラ軌道、高密度フローを含む4Dシーン表現と共にフレームを生成する。
We believe that WorldReel bring video generation to 4D-consistent world modeling。
論文 参考訳(メタデータ) (2025-12-08T18:54:12Z) - SpatialVID: A Large-Scale Video Dataset with Spatial Annotations [58.01259302233675]
SpaceVIDは、さまざまなシーン、カメラの動き、フレームごとのカメラポーズ、奥行き、動き指示などの密集した3Dアノテーションを備えた、Wildのビデオのデータセットである。
21,000時間以上の生のビデオを収集し、階層的なフィルタリングパイプラインを通して270万のクリップに処理します。
その後のアノテーションパイプラインは、カメラポーズ、深度マップ、ダイナミックマスク、構造化キャプション、シリアライズされたモーションインストラクションなど、これらのクリップを詳細な空間的および意味的な情報で強化する。
論文 参考訳(メタデータ) (2025-09-11T17:59:31Z) - Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation [66.95956271144982]
本稿では,単一画像から一貫した3Dポイントクラウドシーケンスを生成する新しいビデオ拡散フレームワークであるVoyagerを紹介する。
既存のアプローチとは異なり、Voyagerはフレーム間で固有の一貫性を持って、エンドツーエンドのシーン生成と再構築を実現している。
論文 参考訳(メタデータ) (2025-06-04T17:59:04Z) - DropletVideo: A Dataset and Approach to Explore Integral Spatio-Temporal Consistent Video Generation [20.512252799625685]
S時間一貫性はビデオ生成において重要な研究課題である。
本稿では,プロット進行とカメラ技術との相乗性を考慮した積分時間整合性を導入する。
ビデオ生成時の動的時間的コヒーレンス保存に優れたDropletVideoモデルを開発し,訓練する。
論文 参考訳(メタデータ) (2025-03-08T04:37:38Z) - PointOdyssey: A Large-Scale Synthetic Dataset for Long-Term Point
Tracking [90.29143475328506]
本稿では,大規模合成データセットとデータ生成フレームワークであるPointOdysseyを紹介する。
私たちのゴールは、自然主義的な動きを持つ長いビデオに重点を置いて、最先端の技術を推し進めることです。
実世界のモーションキャプチャーデータを用いて変形可能なキャラクタをアニメーション化し、モーションキャプチャー環境に合わせて3Dシーンを構築し、リアルビデオ上で構造から抽出したトラジェクトリを用いてカメラ視点を描画する。
論文 参考訳(メタデータ) (2023-07-27T17:58:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。