論文の概要: Streaming4D: Accelerate 4D World Models via Block-wise Video Generation and Incremental Reconstruction
- arxiv url: http://arxiv.org/abs/2609.00610v1
- Date: Tue, 01 Sep 2026 02:49:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.246873
- Title: Streaming4D: Accelerate 4D World Models via Block-wise Video Generation and Incremental Reconstruction
- Title(参考訳): Streaming4D: ブロックワイドビデオ生成とインクリメンタル再構成による4次元世界モデルの高速化
- Authors: Xiaoyan Liu, Jiaxin Liu, Kangrui Li, Sifan Zhou,
- Abstract要約: Streaming4Dは、時間的ビデオブロックを生成し、各ブロックの再構築をトリガーする。
このアプローチにより、世界表現はビデオストリームでオンラインで進化し、幾何学的忠実さを維持しながらフィードバックのレイテンシを低減することができる。
- 参考スコア(独自算出の注目度): 16.153148517321604
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current 4D generation paradigms are often bottlenecked by a sequential decoupling design: video is generated first, followed by 3D reconstruction, leading to high interaction latency. This limits applications in interactive real-time scenarios. To this end, we propose \textbf{Streaming4D}, a tightly coupled synchronous pipeline that integrates block-wise autoregressive video generation with incremental 3D reconstruction. Unlike traditional frame-by-frame emission and delayed geometry recovery, Streaming4D generates temporal video blocks and immediately triggers reconstruction for each completed block, enabling parallel execution between synthesis and geometric updates. This approach allows the world representation to evolve online with the video stream, reducing feedback latency while preserving geometric fidelity. We instantiate \textbf{Streaming4D} using a Self-Forcing-style autoregressive generator and an incremental reconstruction backend. Experiments show consistent runtime improvements across resolutions on a single RTX 4090 (1.24$\times$ speedup), while maintaining high-quality 4D geometry and multi-view consistency.
- Abstract(参考訳): 現在の4D生成パラダイムは、多くの場合、シーケンシャルなデカップリング設計によってボトルネックとなる。
これにより、インタラクティブなリアルタイムシナリオでのアプリケーションの利用が制限される。
この目的のために,ブロックワイズ自動回帰ビデオ生成とインクリメンタルな3D再構成を統合した,密結合型同期パイプラインである \textbf{Streaming4D} を提案する。
従来のフレーム単位のエミッションや遅延幾何回復とは異なり、Streaming4Dは時間的ビデオブロックを生成し、各ブロックの再構築を即座にトリガし、合成と幾何学的更新の並列実行を可能にする。
このアプローチにより、世界表現はビデオストリームでオンラインで進化し、幾何学的忠実さを維持しながらフィードバックのレイテンシを低減することができる。
自己強制型自己回帰生成器と漸進的再構築バックエンドを用いて, \textbf{Streaming4D} をインスタンス化する。
実験では、単一のRTX 4090 (1.24$\times$ speedup)の解像度で一貫したランタイム改善が示され、高品質な4D幾何とマルチビューの一貫性が維持されている。
関連論文リスト
- IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer [64.5765465030666]
オンライン4Dシーン理解のためのストリーミングインスタンスグラウンド幾何変換器IGGT4Dを提案する。
IGGT4Dは、ビデオフレームを逐次処理し、因果時空間モデリングを通じて歴史的コンテキストを再利用し、カメラモーション、幾何学、オブジェクトアイデンティティの統一表現を漸進的に更新する。
3次元再構成、ポーズ推定、例空間追跡、オープンボキャブラリセグメンテーションの実験は、IGGT4Dが既存のストリーミングベースラインより優れていることを示した。
論文 参考訳(メタデータ) (2026-07-21T16:00:01Z) - 4RC: 4D Reconstruction via Conditional Querying Anytime and Anywhere [77.83037497484366]
単眼ビデオからの4次元再構成のための統合フィードフォワードフレームワークである4RCを提案する。
4RCは、密集したシーン形状と動きのダイナミクスを共同でキャプチャする総体的な4D表現を学習する。
論文 参考訳(メタデータ) (2026-02-10T18:57:04Z) - Joint 3D Geometry Reconstruction and Motion Generation for 4D Synthesis from a Single Image [88.71287865590273]
そこでTrajScene-60Kについて紹介する。
拡散型4次元シーン軌道生成装置(4D-STraG)を提案する。
次に、4Dポイントトラック表現から任意のカメラトラジェクトリでビデオをレンダリングする4Dビュー合成モジュール(4D-Vi)を提案する。
論文 参考訳(メタデータ) (2025-12-04T17:59:10Z) - SyncTrack4D: Cross-Video Motion Alignment and Video Synchronization for Multi-Video 4D Gaussian Splatting [50.69165364520998]
実世界の非同期ビデオ集合を扱うために, マルチビデオ4Dガウススプラッティング (4DGS) 方式を提案する。
SyncTrack4Dは、4DGSの同時同期と4DGS再構成のためのキューとして動的シーンの高密度な4Dトラック表現を直接活用する。
我々はPanoptic Studio と SyncNeRF Blender に対するアプローチを評価し,0.26 フレーム以下の平均時間誤差でサブフレーム同期精度を示し,高忠実度 4D 再構成は26.3 PSNR スコアに達した。
論文 参考訳(メタデータ) (2025-12-03T23:05:01Z) - ShapeGen4D: Towards High Quality 4D Shape Generation from Videos [85.45517487721257]
ビデオからエンドツーエンドに1つの動的3次元表現を合成する,ネイティブなビデオから4次元の形状生成フレームワークを提案する。
本手法は,フレームごとの最適化を行なわずに,非剛性運動,体積変化,および位相遷移を正確にキャプチャする。
論文 参考訳(メタデータ) (2025-10-07T17:58:11Z) - Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-view Videos [27.595035122927204]
本研究では,非校正されたスパースビュー映像からの時間的整列表現を効率よく校正するフィードフォワード4次元人間の再構成とモデルを提案する。
新たに,隣接する2つのフレーム間の3次元ガウス運動の高密度な動きを予測するための動き予測モジュールを設計した。
実験では、ドメイン内データセットとドメイン外データセットの両方において、モデルの有効性を示す。
論文 参考訳(メタデータ) (2025-09-29T02:47:14Z) - 4D Driving Scene Generation With Stereo Forcing [62.47705572424127]
現在の生成モデルは、時間外挿と空間的新規ビュー合成(NVS)をシーンごとの最適化なしで同時にサポートする動的4D駆動シーンの合成に苦慮している。
PhiGenesisは、幾何学的・時間的整合性を持った映像生成技術を拡張する4次元シーン生成のための統合フレームワークである。
論文 参考訳(メタデータ) (2025-09-24T15:37:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。