論文の概要: Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.01059v1
- Date: Tue, 01 Sep 2026 10:54:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.590128
- Title: Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models
- Title(参考訳): Dyn-3D:視覚言語モデルにおけるエゴ運動の曖昧さの解消と解決
- Authors: Jiayu Ding, Zhuodong Liu, Lei Zhang, Manyu Xiong, Hongbo Jin, Haoran Tang, Hongbo Zhang, Changen Zhu, Wenbo Xing,
- Abstract要約: 実写3次元レンダリングを用いた実写特性から視覚的変化を厳密に分離するベンチマークであるDyn-3Dを導入する。
計量物理基底真理をポリシー最適化に組み込むことで、TempoVistaは3D空間の視覚的表現を明確に定義する。
- 参考スコア(独自算出の注目度): 11.352994779962208
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: As Vision-Language Models (VLMs) tackle dynamic 3D spatial reasoning, ego-motion perception becomes essential to resolve monocular scale ambiguity. However, current models often overfit to smooth trajectory priors rather than genuinely understanding physical motion. Consequently, their spatial reasoning degrades severely under large displacements, a phenomenon we term Kinematic Collapse. This failure stems from spurious visual-motion correlations in natural videos and a lack of explicit physical supervision. To evaluate this, we introduce Dyn-3D, a benchmark using counterfactual 3D rendering to rigorously decouple visual changes from true kinematic properties. Furthermore, we propose the TempoVista framework, featuring the Kinematic-GSPO algorithm. By embedding metric physical ground truth into policy optimization, TempoVista explicitly grounds visual representations in 3D space. Experiments demonstrate that our approach significantly improves both motion estimation and robust spatial reasoning by utilizing camera dynamics as an effective geometric calibration signal.
- Abstract(参考訳): 視覚言語モデル(VLM)はダイナミックな3次元空間推論に取り組むため、単分子スケールの曖昧さを解決するためにエゴモーション知覚が不可欠となる。
しかし、現在のモデルは、物理運動を真に理解するよりも、スムーズな軌道前処理に過度に適合することが多い。
その結果、空間的推論は大きな変位の下で著しく劣化し、この現象はキネマティック崩壊(Kinematic Collapse)と呼ばれる。
この失敗は、自然ビデオにおける刺激的な視覚と運動の相関と、明確な物理的監督の欠如に起因している。
これを評価するために,実写3次元レンダリングを用いた実写特性から視覚的変化を厳密に分離するベンチマークDyn-3Dを導入する。
さらに,Kinematic-GSPOアルゴリズムを特徴とするTempoVistaフレームワークを提案する。
計量物理基底真理をポリシー最適化に組み込むことで、TempoVistaは3D空間の視覚的表現を明確に定義する。
カメラダイナミックスを有効幾何キャリブレーション信号として利用することにより,動作推定とロバストな空間推論の両方を大幅に改善することを示す。
関連論文リスト
- Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection [0.14323566945483496]
本稿では,映像由来の監視信号から直接,暗黙的な3次元物理力学を学習するための自己次元フレームワークを提案する。
予測ボトルネックを2次元画像空間から3次元容積潜在空間にシフトすることで、この問題に対処する。
トレーニングや推論のための明示的な古典的シミュレータに依存する最先端のハイブリッドモデルとは異なり、当社のアーキテクチャは、高教師付きV-JEPA機能内の物質状態を暗黙的に追跡する。
論文 参考訳(メタデータ) (2026-06-24T22:06:35Z) - Kinematics-Driven Gaussian Shape Deformation for Blurry Monocular Dynamic Scenes [32.40228197424996]
Kinematics-GSは運動整合変形をモデル化するキネマティクス対応フレームワークである。
最適化を安定させるために,シーンを動的および静的なコンポーネントに分解する。
また、非剛体運動を示す変形性および弾性物体の挑戦的な実世界のデータセットも導入する。
論文 参考訳(メタデータ) (2026-05-09T03:01:17Z) - MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models [45.450035386882824]
視覚言語モデル(VLM)は、標準的なビデオタスクではうまく機能するが、運動力学や空間的相互作用を含む物理駆動推論に苦慮する。
本稿では,物理世界のコンテキストキューをVLMの知覚,理解,推論に合わせた解釈可能な表現に変換することによって,このギャップに対処するアプローチを提案する。
論文 参考訳(メタデータ) (2025-11-23T09:43:44Z) - Forecasting Future Videos from Novel Views via Disentangled 3D Scene Representation [54.60804602905519]
我々は、階層化されたシーン形状、動き予測、新しいビュー合成を一緒にモデル化することを目的として、絡み合った表現を学習する。
本手法では,2次元のシーンを3次元の点群に持ち上げることによって,シーン形状をシーンの動きから切り離す。
将来の3次元シーンの動作をモデル化するために,まず自我運動を予測し,その後に動的物体の残留運動を予測する2段階のアンタングル手法を提案する。
論文 参考訳(メタデータ) (2024-07-31T08:54:50Z) - Shape of Motion: 4D Reconstruction from a Single Video [42.42669078777769]
本稿では,世界座標フレーム内の3次元運動軌跡を明示的かつ永続的に特徴付ける,ジェネリックダイナミックシーンの再構築手法を提案する。
まず,コンパクトなSE(3)モーションベースでシーンの動きを表現することで,3次元動作の低次元構造を利用する。
第2に,単眼深度マップや長距離2Dトラックなどの既成データ駆動の先行データを利用して,これらのノイズを効果的に処理する方法を考案する。
論文 参考訳(メタデータ) (2024-07-18T17:59:08Z) - DO3D: Self-supervised Learning of Decomposed Object-aware 3D Motion and
Depth from Monocular Videos [76.01906393673897]
本研究では,モノクラービデオから3次元運動と深度を協調的に学習する自己教師手法を提案する。
本システムでは,深度を推定する深度推定モジュールと,エゴモーションと3次元物体の動きを推定する新しい分解対象3次元運動推定モジュールを備える。
我々のモデルは評価されたすべての設定において優れたパフォーマンスを提供する。
論文 参考訳(メタデータ) (2024-03-09T12:22:46Z) - Decoupling Dynamic Monocular Videos for Dynamic View Synthesis [50.93409250217699]
動的モノクロビデオからの動的ビュー合成の課題を教師なしで解決する。
具体的には、動的物体の運動を物体の動きとカメラの動きに分離し、教師なし表面の整合性およびパッチベースのマルチビュー制約によって規則化する。
論文 参考訳(メタデータ) (2023-04-04T11:25:44Z) - 3D-OES: Viewpoint-Invariant Object-Factorized Environment Simulators [24.181604511269096]
本稿では、3次元ニューラルシーン表現空間におけるオブジェクトとエージェントの相互作用によるシーン変化を予測できる動作条件動的モデルを提案する。
この空間では、オブジェクトは互いに干渉せず、その外観は時間と視点にわたって持続する。
本モデルでは,対話対象の個数や外観,カメラ視点の多様さにまたがる予測をよく一般化することを示す。
論文 参考訳(メタデータ) (2020-11-12T16:15:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。