論文の概要: Self-Supervised Learning of Structured Dynamics from Videos
- arxiv url: http://arxiv.org/abs/2607.21576v1
- Date: Thu, 23 Jul 2026 17:55:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.512612
- Title: Self-Supervised Learning of Structured Dynamics from Videos
- Title(参考訳): ビデオからの構造化ダイナミクスの自己教師付き学習
- Authors: Lukas Knobel, Andrew Zisserman, Yuki M. Asano,
- Abstract要約: 予め訓練した画像ビジョン変換器の凍結した特徴から、構造化された動き表現を復元できるかどうかを検討する。
本研究では、時間変化の主源を残留力学から明確に分離する構造ダイナミクスモデル(SDM)を提案する。
ProbeMotionのSDMは、カメラモーション、オブジェクトモーション、複合ダイナミクスを備えた合成ビデオと実ビデオにまたがる新しい評価スイートである。
- 参考スコア(独自算出の注目度): 76.23834498074805
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding motion in video is a fundamental challenge for visual learning, as frame-to-frame change entangles two sources of dynamics: camera motion and object motion. This decomposition has remained underexplored in representation learning, partly because these factors are tightly coupled in natural videos and difficult to supervise separately. Yet recovering it is important for learning robust motion representations that separate meaningful object dynamics from camera-induced variation. We study whether such structured motion representations can be recovered from frozen features of a pretrained image vision transformer. We propose the Structured Dynamics Model (SDM), which explicitly separates the dominant source of temporal change from residual dynamics through future-feature prediction, rather than representing video change with a single entangled latent or with unstructured, spatially dense transition tokens. Training combines self-supervised learning on real video with weak supervision of scene dynamics on synthetic Kubric data. We evaluate SDM on ProbeMotion, a new evaluation suite spanning synthetic and real videos with camera motion, object motion, and combined dynamics. SDM outperforms backbone baselines using global CLS or average-pooled features, and compares favorably to strongly supervised representations such as VGGT on several probes, despite using substantially weaker supervision. These results suggest that pretrained image models can be readily repurposed into structured video-dynamics representations, providing a useful inductive bias for learning and analyzing latent video dynamics.
- Abstract(参考訳): フレーム・ツー・フレームの変更は、カメラの動きと物体の動きという2つの動力学の源を絡み合わせる。
この分解は、これらの要因が自然ビデオに強く結びついており、個別に監督することが難しいこともあって、表現学習において過小評価されている。
しかし、カメラによる変動から意味のある物体のダイナミクスを分離するロバストな動き表現を学ぶためには、回復が重要である。
本研究では、予め訓練された画像ビジョン変換器の凍結した特徴から、そのような構造化された動き表現を復元できるかどうかを検討する。
本研究では,1つのエンタングルトや非構造的,空間的に密度の高い遷移トークンで映像変化を表現するのではなく,時間的変化の主源を残差力学から未来的予測を通じて明確に分離する構造的ダイナミクスモデルを提案する。
トレーニングは、実ビデオにおける自己教師付き学習と、合成クブリックデータにおけるシーンダイナミクスの弱い監督を組み合わせる。
ProbeMotionのSDMは、カメラモーション、オブジェクトモーション、複合ダイナミクスを備えた合成ビデオと実ビデオにまたがる新しい評価スイートである。
SDMはグローバルなCLSや平均プール機能を用いてバックボーンベースラインを上回り、より弱い監督手法を用いているにもかかわらず、VGGTのような複数のプローブ上の強い監督された表現と比較して好適である。
これらの結果は,事前学習した画像モデルを構造化された映像力学表現に容易に再利用することができ,遅延映像力学の学習と解析に有用な帰納的バイアスをもたらすことを示唆している。
関連論文リスト
- Learning Explicit Physical Parameter Control and Benchmarking for Video Generation [21.331326205371628]
本稿では,物体レベルの力,質量,摩擦,再生,シーンレベルの重力を条件とした物理誘導映像拡散モデルPhyParamを提案する。
また、PhyParam-Benchは、画像とビデオの生成における物理法則の整合性を示すベンチマークである。
論文 参考訳(メタデータ) (2026-07-21T10:06:55Z) - Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videos [30.202149567220356]
既存の方法は通常、エージェントを不可分な実体として扱い、世界中の動きパターンをモデル化する。
本稿では,移動可能な局所運動表現を学習するためのデコンストラクト・コンストラクト・パラダイムを提案する。
本手法は, 多様なロボット制御・操作タスクに効果的に移行し, 試料効率と性能を大幅に向上させる。
論文 参考訳(メタデータ) (2026-07-01T11:36:27Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - From Static to Dynamic: Exploring Self-supervised Image-to-Video Representation Transfer Learning [79.76998842796515]
微調整重モジュールは、ビデオ間のセマンティックセマンティックセパビリティを損なう可能性がある。
本稿では,一貫性・セパビリティ・トレードオフ・トランスファー学習フレームワークを提案する。
8つの画像事前学習モデルの実験では、複数のレベルのビデオタスクで一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-03-27T16:56:50Z) - Midway Network: Learning Representations for Recognition and Motion from Latent Dynamics [11.610274121239051]
そこで我々は,自然ビデオのみから,物体認識と動作理解の両面での強力な視覚表現を初めて学習する,新たな自己教師型学習アーキテクチャであるMidway Networkを紹介する。
本研究では,従来の自己教師付き学習手法と比較して,セマンティックセグメンテーションと光フロータスクの両方において高い性能を発揮することを示す。
論文 参考訳(メタデータ) (2025-10-07T04:07:44Z) - Inferring Dynamic Physical Properties from Video Foundation Models [94.35979242947873]
ビデオから動的物理特性を予測するタスクについて検討する。
時間的情報を必要とする物理的特性として,バウンディング物体の弾性,流動液体の粘度,表面を滑り落ちる物体の動的摩擦について考察する。
論文 参考訳(メタデータ) (2025-10-02T17:59:50Z) - SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation [56.90807453045657]
SynMotion(シンモクション)は、セマンティックガイダンスと視覚適応を併用した動画生成モデルである。
意味レベルでは、主観と動きの表現をアンタングルする二項意味理解機構を導入する。
視覚レベルでは、効率的なモーションアダプタをトレーニング済みのビデオ生成モデルに統合し、動きの忠実度と時間的コヒーレンスを高める。
論文 参考訳(メタデータ) (2025-06-30T10:09:32Z) - InterDyn: Controllable Interactive Dynamics with Video Diffusion Models [50.38647583839384]
我々は、初期フレームと駆動対象またはアクターの動作を符号化する制御信号が与えられたインタラクティブな動画像を生成するフレームワークであるInterDynを提案する。
我々の重要な洞察は、大規模なビデオ生成モデルは、大規模ビデオデータからインタラクティブなダイナミクスを学習し、ニューラルと暗黙の物理シミュレーターの両方として機能できるということです。
論文 参考訳(メタデータ) (2024-12-16T13:57:02Z) - Unfolding Videos Dynamics via Taylor Expansion [5.723852805622308]
ビデオの自己教師型動的学習戦略について紹介する: インスタンス識別のためのビデオ時間差分法(ViDiDi)
ViDiDiは、フレームシーケンスの時間的デリバティブのさまざまな順序を通して、ビデオの異なる側面を観察する。
ViDiDiは、ビデオとその時間微分を一貫した埋め込みにエンコードする単一のニューラルネットワークを学習する。
論文 参考訳(メタデータ) (2024-09-04T01:41:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。