論文の概要: DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs
- arxiv url: http://arxiv.org/abs/2607.12503v1
- Date: Tue, 14 Jul 2026 08:35:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.087375
- Title: DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs
- Title(参考訳): DynTrace:MLLMにおける4次元時空間推論のための動的物体の追跡
- Authors: Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang,
- Abstract要約: 4次元時間的推論は、動的世界を理解し、具体的相互作用を可能にするために不可欠である。
現在のモデルはスパースフレームレベルの観測に依存しており、連続的なダイナミックキューを断片化している。
2つの相補的要素を持つ4次元時間的推論のためのトレーニング不要フレームワークDynTraceを提案する。
- 参考スコア(独自算出の注目度): 41.4243802276804
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 4D spatio-temporal reasoning, jointly modeling 3D spatial structure and temporal evolution, is essential for understanding dynamic worlds and enabling embodied interaction. While current Multimodal Large Language Models (MLLMs) show strong capabilities in static scene understanding and coarse-grained 4D tasks, they still have notable limitations in continuous dynamic scene perception, especially in tracking dynamic object evidence for coherent 4D spatio-temporal reasoning. This shortcoming stems mainly from relying on sparse frame-level observations, fragmenting continuous dynamic cues and leaving models unable to disentangle genuine object dynamics from camera-induced apparent motion. Inspired by humans tracking dynamic cues while compensating for viewpoint changes, we propose DynTrace, a training-free framework for 4D spatio-temporal reasoning with two complementary components. Dynamic Trajectory Visualization (DTV) reprojects world-coordinate trajectories onto the image plane, providing geometry-informed visual priors that disentangle genuine object dynamics from camera-induced apparent motion. Meanwhile, the Dynamic Trace Token (DT-Token), organized into a Dynamic Trace Graph (DTG), tracks object-level dynamic cues, trace evolution, and key moments, maintaining continuous dynamic object evidence for coherent 4D reasoning. Together, these two components equip MLLMs with continuously tracked dynamic object evidence, grounded in geometry-informed visual priors and structured spatio-temporal traces. DynTrace consistently improves open-source MLLMs, achieving state-of-the-art results on Dyn-Bench, VLM4D, and DSI-Bench, validating the importance of tracking dynamic object evidence for robust 4D spatio-temporal reasoning.
- Abstract(参考訳): 3次元空間構造と時間的進化を共同でモデル化した4次元時空間推論は、動的世界を理解し、具体的相互作用を可能にするために不可欠である。
現在のMLLM(Multimodal Large Language Models)は静的シーン理解と粗粒度の4Dタスクにおいて強力な能力を示すが、連続的な動的シーン知覚において、特にコヒーレントな4D時空間推論のための動的オブジェクトの証拠を追跡する際には、注目すべき制限がある。
この欠点は、主にスパースフレームレベルの観測に依存し、連続的なダイナミックなキューを断片化し、カメラによって引き起こされる見かけの運動から真のオブジェクトのダイナミクスをアンタングルできないモデルを残すことに起因する。
視線変化を補いながら動的手がかりを追尾する人間にインスパイアされたDynTraceは,2つの相補的成分を持つ4次元時空間推論のためのトレーニング不要なフレームワークである。
ダイナミック軌道可視化 (Dynamic Trajectory Visualization, DTV) は、画像面に世界座標の軌道を投影し、幾何学的にインフォームドされた視覚的先行情報を提供し、カメラが引き起こした見かけの運動から真の物体のダイナミクスを遠ざける。
一方、Dynamic Trace Token(DT-Token)は、Dynamic Trace Graph(DTG)に編成され、オブジェクトレベルの動的キュー、トレースの進化、キーモーメントを追跡し、コヒーレントな4D推論のための継続的な動的オブジェクト証拠を維持する。
これら2つのコンポーネントは、幾何学的インフォームドな視覚的先行と構造化された時空間的トレースに基づいて、連続的に追跡された動的物体の証拠をMLLMに装備する。
DynTraceはオープンソースMLLMを継続的に改善し、Dyn-Bench、VLM4D、DSI-Benchの最先端結果を達成し、堅牢な4D時空間推論のための動的オブジェクトエビデンスを追跡することの重要性を検証する。
関連論文リスト
- WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory [106.28234880163723]
WorldDirectorは、高度に制御可能なビデオワールドモデルフレームワークである。
我々のフレームワークは、視覚生成から意味的な動きのオーケストレーションを明示的に分離する。
長時間の視界外から再突入しても,動的実体の正確な視覚的アイデンティティを保たせることができた。
論文 参考訳(メタデータ) (2026-07-02T17:59:59Z) - LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue [4.481491966887467]
最近のモデル(LMM)は、画像の理解においてますます能力を高めつつも、4次元の連続的動的推論を維持するのに苦戦している。
そこで本研究では,提案する3次元トラジェクトリを,短いクリップ全体あるいはより長いクリップの特定のセグメントに返却しながら,問合せに応答しなければならない新しいタスクを提案する。
Track4-Trackの実験では、強いベースラインよりも一貫した改善が示されており、動的状態モデリングはLMMにおける4次元動的推論を引き出すのに有用な設計原理であることを示唆している。
論文 参考訳(メタデータ) (2026-05-19T05:35:13Z) - Syn4D: A Multiview Synthetic 4D Dataset [92.50132053229817]
モノクロビデオからの動的シーンの3D再構成と追跡は、コンピュータビジョンにおいて重要な課題である。
この制限に対処するために、マルチビュー合成動的シーンであるSyn4Dを紹介する。
Syn4Dの主な特徴は、任意のピクセルを3Dに切り離すことである。
論文 参考訳(メタデータ) (2026-05-06T17:59:55Z) - Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World [49.80040477190479]
人間は物理的4Dの世界に住み、幾何学的構造と意味的内容は時間とともに進化する。
さまざまな実世界および合成ビデオデータセットから構築された大規模ベンチマークであるDyn-Benchを紹介した。
既存のモデルでは,時間的推論と動的オブジェクトグラウンドの両面において,高い性能を同時に維持できないことがわかった。
論文 参考訳(メタデータ) (2026-03-13T07:42:16Z) - DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving [36.56424549984779]
本稿では,VGGTを静的な3次元知覚から動的4次元再構成まで拡張する統合フィードフォワードフレームワークを提案する。
我々のゴールは、フィードフォワード3Dモデル内の点運動を動的かつ時間的コヒーレントな方法でモデル化することである。
自律走行データセットの実験では、DynamicVGGTは復元精度において既存の手法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2026-03-09T11:24:14Z) - C4D: 4D Made from 3D through Dual Correspondences [77.04731692213663]
時間的対応を利用して既存の3次元再構成を4Dに拡張するフレームワークであるC4Dを紹介する。
C4Dは、短期光学フローと長期点追跡の2種類の対応をキャプチャする。
我々は、追加の移動情報を提供する動的認識ポイントトラッカーを訓練する。
論文 参考訳(メタデータ) (2025-10-16T17:59:06Z) - Understanding Dynamic Scenes in Ego Centric 4D Point Clouds [7.004204907286336]
EgoDynamic4Dは、非常にダイナミックなシーンに関する新しいQAベンチマークである。
エージェントの動作,人間と物体の相互作用予測,関係,軌道の理解,時間・因果推論,詳細な指標を含む12の動的QAタスクを設計する。
提案手法は,エゴ中心の動的シーン理解のためのマルチモーダル時間モデルの有効性を検証し,ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2025-08-10T09:08:04Z) - MotionTrack: Learning Motion Predictor for Multiple Object Tracking [68.68339102749358]
本研究では,学習可能なモーション予測器を中心に,新しいモーショントラッカーであるMotionTrackを紹介する。
実験結果から、MotionTrackはDancetrackやSportsMOTといったデータセット上での最先端のパフォーマンスを示す。
論文 参考訳(メタデータ) (2023-06-05T04:24:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。