論文の概要: Marrying Optimal Transport and ODEs for Unified Continuous-Time 4D Reconstruction and Tracking
- arxiv url: http://arxiv.org/abs/2608.09613v1
- Date: Mon, 10 Aug 2026 13:55:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.293624
- Title: Marrying Optimal Transport and ODEs for Unified Continuous-Time 4D Reconstruction and Tracking
- Title(参考訳): 連続4次元再構成と追跡のための最適輸送とODEの結婚
- Abstract要約: 既存の4D再構成と点追跡のアプローチは、通常は幾何学に依存しているか、単に整数のタイムスタンプで予測するだけである。
連続速度場を学習することでこれらのタスクを統一するフレームワークであるUni4Rを提案する。
この連続速度場は、4次元再構成と点追跡の両方に相互に利益をもたらすキネマティック先行として機能する。
- 参考スコア(独自算出の注目度): 16.32102067142294
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing unified 4D reconstruction and point tracking approaches typically rely on heuristic interpolations or just predict at integer timestamps, lacking kinematic coherence and failing to model dynamics at any arbitrary timestamp. In this paper, we propose Uni4R, a framework that unifies these tasks by learning continuous velocity fields through the synergy of Optimal Transport (OT) and Ordinary Differential Equation (ODE). Importantly, this continuous velocity field acts as a kinematic prior that mutually benefits both 4D reconstruction and point tracking. Specifically, we propose the Flow Matching Guided Decoder (FMGD). A global velocity branch first extracts anchor features that capture the global dynamic state of the sequence. Then, FMGD leverages Flow Matching (FM) theory to formulate a probability path defined by OT on the anchor feature manifold, instantiating it as FM-guided velocity features for velocity prediction. This establishes a robust kinematic inductive bias. Meanwhile, a point reconstruction branch provides geometric features. The local velocity prediction module then joint above features and time embeddings, to decode velocities at arbitrary timestamps. To overcome the absence of high-quality ground-truth velocities in fractional frames, we propose an integral-consistency training strategy. This strategy uses an ODE solver to integrate velocities to recover target pointmaps, enabling the model to be supervised end-to-end directly from integer timestamps. Experimental results demonstrate that Uni4R achieves SOTA performance in both 4D reconstruction and point tracking, and achieves SOTA in our new kinematics-aware benchmark at continuous time.
- Abstract(参考訳): 既存の4D再構成と点追跡のアプローチは、通常はヒューリスティックな補間や整数のタイムスタンプでの予測に頼っており、キネマティックコヒーレンスに欠け、任意のタイムスタンプで力学をモデル化できない。
本稿では, 最適輸送(OT)と正規微分方程式(ODE)の相乗効果によって連続速度場を学習し, これらのタスクを統一するフレームワークであるUni4Rを提案する。
重要なことに、この連続速度場は、4次元再構成と点追跡の両方に相互に利益をもたらすキネマティックな前兆として機能する。
具体的には,フローマッチングガイドデコーダ(FMGD)を提案する。
グローバル速度分岐は、まず、シーケンスのグローバルな動的状態をキャプチャするアンカー特徴を抽出する。
次に、FMGDはフローマッチング(FM)理論を利用して、アンカー特徴多様体上でOTによって定義される確率経路を定式化し、速度予測のためのFM誘導速度特徴としてインスタンス化する。
これにより、強いキネマティックな帰納バイアスが成立する。
一方、点再構成部は幾何学的特徴を提供する。
局所速度予測モジュールは、任意のタイムスタンプで速度をデコードするために、その上の特徴と時間埋め込みを結合する。
分数フレームにおける高品質な接地速度の欠如を克服するために,積分整合性トレーニング戦略を提案する。
この戦略では、ODEソルバを使用して、ターゲットのポイントマップを復元する速度を統合することで、モデルを整数のタイムスタンプから直接、エンドツーエンドで教師することが可能になる。
実験の結果、Uni4Rは4次元再構成と点追跡の両方でSOTA性能を達成し、新しいキネマティクス・アウェア・ベンチマークで連続的にSOTAを実現していることがわかった。
関連論文リスト
- MotionMAR: Multi-scale Auto-Regressive Human Motion Reconstruction from Sparse Observations [51.837372131319285]
MotionMARは、スパース観測からの運動再構成のためのフレームワークである。
まず、人間の動きのグローバルな軌跡を推定し、時間的詳細を徐々に洗練する。
MotionMARは、AMASSデータセット上で最先端の精度を達成する。
論文 参考訳(メタデータ) (2026-06-22T08:15:56Z) - Trajectory-Consistent Flow Matching for Robust Visuomotor Policy Learning [1.7616042687330642]
フローマッチングポリシは、ノイズを動作に伝達する連続速度場を学習し、ロボット操作のための決定論的推論を可能にする。
標準トレーニングは、軌道の複雑な誤りを引き起こすミスマッチである、そのフィールドの数値的な統合を必要とする間、ポイントワイドな速度目標を最適化する。
本研究では,(1)全時間間隔にわたって時間的監督を均一に行う補助的整流流速度回帰,(2)軌道上の速度場の統合的変位を監督する多段階軌道整合性トレーニング,(3)時間的滑らかさを強制する速度場正規化の4つの補完策を提案する。
論文 参考訳(メタデータ) (2026-05-08T21:44:10Z) - Trace Anything: Representing Any Video in 4D via Trajectory Fields [98.85848134960172]
軌道場 (Trajectory Field) は、各フレーム内の各ピクセルに時間の連続した3次元軌跡関数を割り当てる密集写像である。
我々は,1つのフィードフォワードパスで軌道場全体を予測するニューラルネットワークであるTrace Anythingを紹介する。
私たちは、新しいプラットフォームからのデータを含む大規模な4Dデータに基づいて、Trace Anythingモデルをトレーニングしました。
論文 参考訳(メタデータ) (2025-10-15T17:59:04Z) - Graph Flow Matching: Enhancing Image Generation with Neighbor-Aware Flow Fields [19.09766809443072]
フローマッチングはサンプル生成を,データにノイズを伝達する連続時間速度場学習として使用する。
学習速度を反応項に分解する軽量な拡張であるグラフフローマッチングを提案する。
事前訓練された変分オートエンコーダの潜伏空間で作動する。
論文 参考訳(メタデータ) (2025-05-30T10:17:50Z) - Learning Spatio-Temporal Dynamics for Trajectory Recovery via Time-Aware Transformer [9.812530969395906]
現実世界の応用では、GPSトラジェクトリはサンプリングレートが低く、連続する点の間に大きく不規則な間隔があることが多い。
本稿では,軌道サンプリング率の向上をめざして,地図制約のトラジェクトリリカバリの課題に対処する。
論文 参考訳(メタデータ) (2025-05-20T03:09:17Z) - St4RTrack: Simultaneous 4D Reconstruction and Tracking in the World [106.91539872943864]
St4RTrackは、RGB入力から世界座標フレーム内の動的ビデオコンテンツを同時に再構成し、追跡するフレームワークである。
静的および動的シーン幾何学の両方をキャプチャして、同じ世界において、同時に両方のポイントマップを予測する。
統合されたデータ駆動フレームワークの有効性と効率を実証し、世界フレームの再構築と追跡のための新しい広範囲なベンチマークを構築します。
論文 参考訳(メタデータ) (2025-04-17T17:55:58Z) - Driv3R: Learning Dense 4D Reconstruction for Autonomous Driving [116.10577967146762]
マルチビュー画像シーケンスからフレーム単位のポイントマップを直接回帰するフレームワークであるDriv3Rを提案する。
我々は4次元フロー予測器を用いてシーン内の移動物体を識別し、これらの動的領域の再構築をより重視する。
Driv3Rは4D動的シーン再構築において従来のフレームワークより優れており、推論速度は15倍高速である。
論文 参考訳(メタデータ) (2024-12-09T18:58:03Z) - StreamYOLO: Real-time Object Detection for Streaming Perception [84.2559631820007]
将来を予測する能力を備えたモデルを提供し、ストリーミング知覚の結果を大幅に改善する。
本稿では,複数の速度を駆動するシーンについて考察し,VasAP(Velocity-Awared streaming AP)を提案する。
本手法は,Argoverse-HDデータセットの最先端性能を実現し,SAPとVsAPをそれぞれ4.7%,VsAPを8.2%改善する。
論文 参考訳(メタデータ) (2022-07-21T12:03:02Z) - Learning Spatio-Temporal Transformer for Visual Tracking [108.11680070733598]
本稿では,エンコーダ・デコーダ変換器をキーコンポーネントとする新しいトラッキングアーキテクチャを提案する。
メソッド全体がエンドツーエンドであり、コサインウィンドウやバウンディングボックススムーシングのような後処理ステップは不要である。
提案されたトラッカーは、Siam R-CNNよりも6倍速いリアルタイム速度を実行しながら、5つのチャレンジングな短期および長期ベンチマークで最先端のパフォーマンスを実現します。
論文 参考訳(メタデータ) (2021-03-31T15:19:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。