論文の概要: DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer
- arxiv url: http://arxiv.org/abs/2608.18498v1
- Date: Wed, 19 Aug 2026 03:44:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.269377
- Title: DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer
- Title(参考訳): DyG$^2$T:3次元ガウス時空間粒子グラフ変換器を用いた物体ダイナミクスのモデル化
- Authors: Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang,
- Abstract要約: DyG$2$Tは動的モデリングフレームワークで、キーポイント表現を空間的に完了し、時間的に識別することでオブジェクトの運動軌跡を推定する。
合成データセットと実世界のデータセットの両方の実験は、DyG$2$Tが正確な動的モデリングと推論を実現することを示した。
- 参考スコア(独自算出の注目度): 86.4618122245946
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modeling object dynamics from limited visual observations is a fundamental problem for enabling accurate motion trajectory prediction in embodied interaction scenarios. Existing dynamics modeling methods first compress reconstructed particle representations into sparse Key Points and model their evolution using locally constrained interactions, thereby discarding fine-grained local details and obscuring discriminative interaction modeling across spatial and temporal scales, leading to drifting trajectories and inaccurate appearance prediction. To tackle these issues, we propose DyG$^2$T, a dynamics modeling framework that infers object motion trajectories by spatially completing and temporally discriminating Key Point representations and modeling multi-scale interaction over particle graphs. Spatially, DyG$^2$T enriches each Key Point by aggregating neighboring raw particle positions to recover fine-grained local details, while explicitly encoding relative offsets among Key Points to enhance geometric structure perception. Temporally, we introduce a Temporal Disentangling Network (TDN) to identify dominant cross-frame variations in latent space and amplify inter-frame differences, yielding temporally discriminative representations that are subsequently aggregated via Temporal Attention to capture frame-wise temporal evolution cues. For comprehensive interaction modeling, a Particle Graph Transformer leverages global attention to preserve discriminative long-range dependencies among Key Points, mitigating representation homogenization induced by locality-constrained modeling and providing a robust basis for accurate trajectory prediction. Experiments on both synthetic and real-world datasets demonstrate that DyG$^2$T achieves accurate dynamics modeling and reasoning, and exhibits strong cross-object and real-world generalization.
- Abstract(参考訳): 限られた視覚的観測から物体力学をモデル化することは、具体的相互作用シナリオにおける正確な運動軌跡予測を可能にするための根本的な問題である。
既存の動的モデリング手法は、まず再構成された粒子表現をスパースキーポイントに圧縮し、局所的に制約された相互作用を用いてそれらの進化をモデル化することで、きめ細かい局所的詳細を破棄し、空間的および時間的スケールで識別的相互作用をモデル化し、漂流軌道と不正確な外観予測をもたらす。
このような問題に対処するために、DyG$2$Tという動的モデリングフレームワークを提案し、空間的にキーポイント表現を識別し、粒子グラフ上でのマルチスケール相互作用をモデル化することで、オブジェクトの運動軌跡を推定する。
空間的には、DyG$^2$Tは、隣接する原粒子の位置を集約して局所的な微細な詳細を復元し、キーポイント間の相対オフセットを明示的に符号化し、幾何学的構造知覚を高めることで各キーポイントを豊かにする。
テンポラル・ディペンタングリング・ネットワーク(TDN)を導入し,フレーム間差を増幅し,時間的に区別された表現を時間的注意によって集約し,フレームの時間的進化を捉える。
包括的相互作用モデリングにおいて、Particle Graph Transformerは、キーポイント間の識別的長距離依存性を保ち、局所性制約による表現同化を緩和し、正確な軌道予測のための堅牢な基盤を提供する。
合成と実世界の両方のデータセットの実験は、DyG$^2$Tが正確な動的モデリングと推論を実現し、強いクロスオブジェクトと実世界の一般化を示すことを示した。
関連論文リスト
- Meta Dynamic Graph for Traffic Flow Prediction [4.6060644265855775]
動的メタグラフ(MetaDG)と呼ばれる交通予測のためのフレームワークを提案する。
ノード表現の動的グラフ構造をモデル時間力学に明示的に活用する。
4つの実世界のデータセットに対する大規模な実験は、MetaDGの有効性を検証する。
論文 参考訳(メタデータ) (2026-01-15T12:15:54Z) - SAMPO:Scale-wise Autoregression with Motion PrOmpt for generative world models [42.814012901180774]
textbfSAMPOは、フレーム内生成のための視覚的自己回帰モデリングと、次のフレーム生成のための因果モデリングを組み合わせたハイブリッドフレームワークである。
動作条件付きビデオ予測とモデルベース制御において,SAMPOが競合性能を発揮することを示す。
また、SAMPOのゼロショット一般化とスケーリング挙動を評価し、未知のタスクに一般化する能力を示す。
論文 参考訳(メタデータ) (2025-09-19T02:41:37Z) - EMoTive: Event-guided Trajectory Modeling for 3D Motion Estimation [59.33052312107478]
イベントカメラは、シーン変化に対する連続的適応ピクセルレベル応答による3次元モーション推定の可能性を提供する。
本稿では,イベント誘導パラメトリック曲線を用いた一様軌道をモデル化するイベントベースフレームワークであるEMoveについて述べる。
動作表現には,事象誘導下での空間的特徴と時間的特徴を融合する密度認識適応機構を導入する。
最終3次元運動推定は、パラメトリック軌道、流れ、深度運動場の多時間サンプリングによって達成される。
論文 参考訳(メタデータ) (2025-03-14T13:15:54Z) - Degrees of Freedom Matter: Inferring Dynamics from Point Trajectories [28.701879490459675]
ニューラルネットワークによってパラメータ化された暗黙の運動場を学習し、同一領域内の新規点の動きを予測することを目的とする。
我々は、SIRENが提供する固有正則化を活用し、入力層を変更して時間的に滑らかな運動場を生成する。
実験では, 未知点軌道の予測におけるモデルの性能評価と, 変形を伴う時間メッシュアライメントへの応用について検討した。
論文 参考訳(メタデータ) (2024-06-05T21:02:10Z) - Local-Global Information Interaction Debiasing for Dynamic Scene Graph
Generation [51.92419880088668]
マルチタスク学習に基づく新しいDynSGGモデルDynSGG-MTLを提案する。
長期的人間の行動は、大域的な制約に適合する複数のシーングラフを生成するためにモデルを監督し、尾の述語を学べないモデルを避ける。
論文 参考訳(メタデータ) (2023-08-10T01:24:25Z) - STONet: A Neural-Operator-Driven Spatio-temporal Network [38.5696882090282]
グラフベースのグラフ時間ニューラルネットワークは、不規則にサンプリングされた離散点間の空間依存性をモデル化するのに有効である。
本稿では,空間連続的な物理量の力学を規定するメカニズムを学習する,PDEのためのニューラル演算子に基づく時間的枠組みを提案する。
実験では,空間的連続的な物理量の予測におけるモデルの性能と,時間的不規則なデータの処理能力に優れていた。
論文 参考訳(メタデータ) (2022-04-18T17:20:12Z) - Disentangling and Unifying Graph Convolutions for Skeleton-Based Action
Recognition [79.33539539956186]
本稿では,マルチスケールグラフ畳み込みと,G3Dという空間時間グラフ畳み込み演算子を結合する簡単な方法を提案する。
これらの提案を結合することにより,MS-G3Dという強力な特徴抽出器を開発し,そのモデルが3つの大規模データセット上で従来の最先端手法より優れていることを示す。
論文 参考訳(メタデータ) (2020-03-31T11:28:25Z) - A Spatial-Temporal Attentive Network with Spatial Continuity for
Trajectory Prediction [74.00750936752418]
空間連続性をもつ空間時間減衰ネットワーク(STAN-SC)という新しいモデルを提案する。
まず、最も有用かつ重要な情報を探るために、空間的時間的注意機構を提示する。
第2に、生成軌道の空間的連続性を維持するために、シーケンスと瞬間状態情報に基づく共同特徴系列を実行する。
論文 参考訳(メタデータ) (2020-03-13T04:35:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。