論文の概要: UniDynamics: Event-RGB Fusion for Unified Future 4D Dynamic Scene Generation
- arxiv url: http://arxiv.org/abs/2610.03473v1
- Date: Fri, 02 Oct 2026 15:46:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.458069
- Title: UniDynamics: Event-RGB Fusion for Unified Future 4D Dynamic Scene Generation
- Title(参考訳): UniDynamics: 統合された4D動的シーン生成のためのイベントRGBフュージョン
- Abstract要約: 1つのイベント-RGBペアから将来の4Dダイナミックシーン(RGB,深さ,光フロー)を生成するための拡散ベースのフレームワークであるUniDynamicsを提案する。
イベントストリームを活用して、単一RGBに先立って代替動作を提供し、マルチモーダル外挿による生成を通して幾何学的および運動的制約を強制する。
VKitti2とDSECの実験は最先端の性能を示し、高品質で時間的に整合性があり、4D一貫性のある将来の予測を生み出している。
- 参考スコア(独自算出の注目度): 35.8055329311088
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose UniDynamics, a diffusion-based framework for future 4D dynamic scenes (RGB, depth, and optical flow) generation from a single event-RGB pair, without requiring long histories or control priors as in existing methods, while explicitly modeling future motion fields. The core idea is to leverage event streams to offer an alternative motion prior for single-RGB extrapolation, and to enforce geometric and motion constraints throughout generation via multimodal modeling. Specifically, we design an Event Latent Enhancement (ELE) module to align and enhance event latents into diffusion-injectable conditioning features, providing robust initial motion priors and reliable texture/structure cues. We further introduce a Perceptual Dynamics Space (PDS) embedded in the multi-scale U-Net, which decouples and adaptively interacts depth and flow while continuously feeding back constraints to appearance features, improving geometric-motion consistency for physically plausible and spatiotemporally coherent prediction. Experiments on VKitti2 and DSEC demonstrate state-of-the-art performance, producing high-quality, temporally coherent, and 4D-consistent future predictions, especially under challenging high-speed motion blur.
- Abstract(参考訳): 将来の4Dダイナミックシーン(RGB,深さ,光フロー)を単一のイベント-RGBペアから生成するための拡散ベースのフレームワークであるUniDynamicsを提案する。
中心となる考え方は、イベントストリームを活用して、単一RGB外挿に先立って代替のモーションを提供し、マルチモーダルモデリングを通じて世代を通して幾何学的および運動的制約を強制することである。
具体的には,イベント遅延拡張(ELE)モジュールを設計し,イベント遅延を拡散注入可能な条件付け機能に調整・拡張し,堅牢な初期動作と信頼性の高いテクスチャ/構造的手がかりを提供する。
さらに、マルチスケールU-Netに埋め込まれた知覚ダイナミクス空間(PDS)を導入し、外見上の制約を連続的にフィードバックしながら、深度と流れを分離し、適応的に相互作用し、物理的に可塑性かつ時空間的に一貫性のある予測のための幾何運動整合性を改善する。
VKitti2とDSECの実験は最先端の性能を示し、特に高速な動きのぼかしに挑戦して、高品質で時間的コヒーレントで4D一貫性のある将来の予測を生成する。
関連論文リスト
- WAM4D: Fast 4D World Action Model via Spatial Register Tokens [52.16661403052964]
WAM4Dは,軽量空間レジスタトークンを用いた高速4次元世界アクションモデルである。
WAM4Dは空間的整合性を向上し,効率的な推論を維持しつつ,競争力のある動作予測を実現する。
論文 参考訳(メタデータ) (2026-06-12T02:49:34Z) - Envision4D: Envisioning Visual Futures via Feed-forward 4D Gaussian Splatting for Autonomous Driving [22.824000058639125]
Envision4Dは、ポーズのない将来の外挿のための、完全に自己管理されたフィードフォワードフレームワークである。
Future Pose Predictionモジュールは、イテレーティブなdenoisingプロセスを通じて、将来のカメラパラメータを推測する。
In-layer Temporal Attention and Conditioned Motion Liftingは、非常に不確実な外挿過程をロバストマッピングに変換する。
論文 参考訳(メタデータ) (2026-06-09T10:04:38Z) - EventGait: Towards Robust Gait Recognition with Event Streams [50.890621860023]
イベントカメラは、マイクロ秒時間分解能と高ダイナミックレンジを提供し、自然にロバストなダイナミックキューをキャプチャし、静的ノイズを抑制する。
イベントの利点を保ちながら、動きと形状を別々にモデル化する、エンドツーエンドのデュアルストリームフレームワークである textbfEventGait を提案する。
当社のアプローチでは,イベント駆動歩行分析の堅牢性と可能性を強調し,合成および実世界の歩行ベンチマークに新たな技術状況が設定されている。
論文 参考訳(メタデータ) (2026-05-21T08:12:04Z) - Dynamic Pondering Sparsity-aware Mixture-of-Experts Transformer for Event Stream based Visual Object Tracking [44.11576998237289]
RGBベースのトラッカーは、低照度や高速モーションなどの困難な撮像条件に対して脆弱である。
イベントカメラは、ピクセルワイドの明るさ変化を捉え、高いダイナミックレンジと高時間分解能を提供することで、有望な代替手段を提供する。
複数の時間スケールにまたがるイベント密度変動を明示的にモデル化するイベント空間認識追跡フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-07T12:25:03Z) - Resonance4D: Frequency-Domain Motion Supervision for Preset-Free Physical Parameter Learning in 4D Dynamic Physical Scene Simulation [53.141181758015186]
Resonance4Dは3次元ガウス散乱と物質点法を結合した物理駆動4次元動的シミュレーションフレームワークである。
我々の重要な洞察は、動的整合性は、相補的領域における共同的拘束運動によって、高密度時間発生なしに強制できるということである。
Resonance4Dは、ピークGPUメモリを35,GB以上から20GB程度に削減しつつ、強力な物理忠実性と運動の整合性を実現する。
論文 参考訳(メタデータ) (2026-04-02T13:00:22Z) - PEGS: Physics-Event Enhanced Large Spatiotemporal Motion Reconstruction via 3D Gaussian Splatting [8.672740691555736]
PEGSは3D Gaussian Splattingパイプライン内でのイベントストリーム拡張と物理プライオリティを統合するフレームワークである。
本稿では,加速度制約を通した物理的妥当性を強制する3段階の監視手法を提案する。
また、さまざまなデータセットにまたがる自然な高速な動きをターゲットとした、最初のRGB-Eventペアも提供します。
論文 参考訳(メタデータ) (2025-11-21T10:27:51Z) - 4D-MoDe: Towards Editable and Scalable Volumetric Streaming via Motion-Decoupled 4D Gaussian Compression [45.0749499664284]
スケーラブルで編集可能なビデオストリーミング用に設計された4Dガウス圧縮フレームワークである4D-MoDeを提案する。
本手法では,静的な背景を動的フォアグラウンドから明示的に分離する階層表現を導入する。
複数のデータセットの実験では、4D-MoDeは、ストレージコストの桁違いで競争力のある再構築品質を一貫して達成している。
論文 参考訳(メタデータ) (2025-09-22T08:35:46Z) - EGVD: Event-Guided Video Diffusion Model for Physically Realistic Large-Motion Frame Interpolation [16.22243283808375]
Event-Guided Video Diffusion Model (EGVD) は、事前訓練された安定したビデオ拡散モデルの強力な先行性を活用する新しいフレームワークである。
提案手法は,RGBフレームとイベント信号とを効果的に統合して拡散過程を導出するマルチモーダル運動条件生成器(MMCG)を特徴とする。
実データとシミュレーションデータの両方の実験により、EGVDは大きな動きを扱う既存の手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2025-03-26T06:33:32Z) - Event-boosted Deformable 3D Gaussians for Dynamic Scene Reconstruction [50.873820265165975]
本稿では,高時間分解能連続運動データと動的シーン再構成のための変形可能な3D-GSを併用したイベントカメラについて紹介する。
本稿では、3次元再構成としきい値モデリングの両方を大幅に改善する相互強化プロセスを作成するGS-Thresholdジョイントモデリング戦略を提案する。
提案手法は,合成および実世界の動的シーンを用いた最初のイベント包摂型4Dベンチマークであり,その上で最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-11-25T08:23:38Z) - Diffusion4D: Fast Spatial-temporal Consistent 4D Generation via Video Diffusion Models [116.31344506738816]
高速でスケーラブルな4Dコンテンツ生成のための新しいフレームワーク textbfDiffusion4D を提案する。
ダイナミックな3Dアセットの軌道ビューを合成できる4D対応ビデオ拡散モデルを開発した。
提案手法は, 生成効率と4次元幾何整合性の観点から, 従来の最先端技術を超えている。
論文 参考訳(メタデータ) (2024-05-26T17:47:34Z) - Motion2VecSets: 4D Latent Vector Set Diffusion for Non-rigid Shape Reconstruction and Tracking [52.393359791978035]
Motion2VecSetsは点雲列からの動的表面再構成のための4次元拡散モデルである。
グローバルな潜在符号の代わりに、潜在集合で4Dダイナミクスをパラメータ化する。
時間的コヒーレントな物体追跡のために、変形潜在集合を同期的に認知し、複数のフレーム間で情報を交換する。
論文 参考訳(メタデータ) (2024-01-12T15:05:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。