論文の概要: DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics
- arxiv url: http://arxiv.org/abs/2607.04112v1
- Date: Sun, 05 Jul 2026 04:44:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.832167
- Title: DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics
- Title(参考訳): DynaVieW:階層的視覚ダイナミクスを理解するためのスキーマガイド型世界モデリング
- Abstract要約: 視覚的動的予測とシミュレーションに最適化された動的スキーマ誘導世界モデルDynaVieWを提案する。
DynaVieWは、インターリーブされた状態遷移シーケンスを学習することで、視覚力学の深い理解を実現する。
- 参考スコア(独自算出の注目度): 48.50132043594263
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal LLMs struggle to systematically model the temporal evolution of visual scenes in videos or multi-image sequences. Such inputs require models to predict or simulate multiple levels of dynamic constituents, such as actions taken in the visual sequence, and the associated changes to the visual environment that result. To address this challenge, we propose a dynamic schema-guided world model, DynaVieW, optimized for visual dynamic prediction and simulation. DynaVieW achieves an in-depth understanding of visual dynamics by learning interleaved state-transition sequences, where states cover broad visual scenes from video keyframes, and transitions capture comprehensive dynamic constituents within a hierarchical schema. DynaVieW jointly models transition prediction and state simulation under a mixture-of-experts architecture, with a cross-expert selective attention and a schema token re-weighted loss, to ensure effective and robust learning. DynaVieW's understanding of visual dynamics boosts its downstream performance in visual narrative creation and world simulation, showing improved consistency, controllability, and instruction-following.
- Abstract(参考訳): マルチモーダルLLMは、ビデオやマルチイメージシーケンスにおける視覚シーンの時間的進化を体系的にモデル化するのに苦労する。
このような入力は、視覚的シーケンスで取られたアクションや、その結果となる視覚環境の変化など、複数のレベルの動的成分を予測またはシミュレートするモデルを必要とする。
この課題に対処するために,視覚的動的予測とシミュレーションに最適化された動的スキーマ誘導世界モデルDynaVieWを提案する。
DynaVieWは、インターリーブされた状態遷移シーケンスを学習することで、視覚力学の深い理解を実現している。
DynaVieWは、クロスエキスパートの選択的な注意とスキーマトークンの再重み付き損失を伴って、専門家の混在したアーキテクチャの下での遷移予測と状態シミュレーションを共同でモデル化し、効果的で堅牢な学習を保証する。
DynaVieWの視覚力学に対する理解は、ビジュアルな物語作成と世界シミュレーションにおける下流のパフォーマンスを高め、一貫性、制御可能性、命令追従を改善した。
関連論文リスト
- Self-Supervised Learning of Structured Dynamics from Videos [76.23834498074805]
予め訓練した画像ビジョン変換器の凍結した特徴から、構造化された動き表現を復元できるかどうかを検討する。
本研究では、時間変化の主源を残留力学から明確に分離する構造ダイナミクスモデル(SDM)を提案する。
ProbeMotionのSDMは、カメラモーション、オブジェクトモーション、複合ダイナミクスを備えた合成ビデオと実ビデオにまたがる新しい評価スイートである。
論文 参考訳(メタデータ) (2026-07-23T17:55:07Z) - FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning [65.42201665046505]
現在のビデオ理解モデルは、各質問の特定の推論条件にかかわらず、固定されたフレームサンプリング戦略に依存し、所定の視覚入力を処理する。
この静的アプローチは、視覚的エビデンスを適応的に収集する能力を制限し、広範囲の時間的カバレッジやきめ細かい空間的詳細を必要とするタスクにおいて、最適以下のパフォーマンスをもたらす。
Frame-Interleaved Chain-of-Thought (FiCOT)を通して、モデルが推論中に視覚情報を動的に要求することを可能にする強化学習で訓練されたエンドツーエンドフレームワークであるFrameMindを紹介する。
従来のアプローチとは異なり、FrameMindは複数のターンで動作し、モデルがテキスト推論とアクティブな視覚知覚を交互に切り替え、ツールを使って抽出する。
論文 参考訳(メタデータ) (2025-09-28T17:59:43Z) - VisionLaw: Inferring Interpretable Intrinsic Dynamics from Visual Observations via Bilevel Optimization [3.131272328696594]
VisionLawは、視覚的な観察から固有の力学の解釈可能な表現を推論する二段階最適化フレームワークである。
既存の最先端手法を著しく上回り、新しいシナリオにおける対話型シミュレーションの強力な一般化を示す。
論文 参考訳(メタデータ) (2025-08-19T12:52:16Z) - Pre-Trained Video Generative Models as World Simulators [59.546627730477454]
本研究では,事前学習した映像生成モデルを制御可能な世界シミュレータに変換するための動的世界シミュレーション(DWS)を提案する。
条件付き動作と生成した視覚的変化の正確なアライメントを実現するために,軽量で普遍的な動作条件付きモジュールを導入する。
実験により、DWSは拡散モデルと自己回帰変換モデルの両方に汎用的に適用可能であることが示された。
論文 参考訳(メタデータ) (2025-02-10T14:49:09Z) - Controllable Video Generation by Learning the Underlying Dynamical
System with Neural ODE [7.330875731393098]
動的システムを学ぶことによって制御可能なビデオを生成することは、コンピュータビジョンコミュニティにおいて重要で未発見のトピックである。
本稿では,静的画像とテキストキャプションから高制御可能なビデオを生成するための新しいフレームワークTiV-ODEを提案する。
論文 参考訳(メタデータ) (2023-03-09T15:13:51Z) - TCL: Transformer-based Dynamic Graph Modelling via Contrastive Learning [87.38675639186405]
我々は,動的に進化するグラフを連続的に扱う,TCLと呼ばれる新しいグラフニューラルネットワークアプローチを提案する。
我々の知る限りでは、これは動的グラフ上の表現学習にコントラスト学習を適用する最初の試みである。
論文 参考訳(メタデータ) (2021-05-17T15:33:25Z) - Neural Scene Flow Fields for Space-Time View Synthesis of Dynamic Scenes [70.76742458931935]
本稿では,動的シーンを外観・幾何学・3次元シーン動作の時間変化連続関数としてモデル化する新しい表現を提案する。
私たちの表現は、観測された入力ビューに適合するようにニューラルネットワークを介して最適化されます。
我々の表現は、細い構造、ビュー依存効果、自然な動きの度合いなどの複雑な動的シーンに利用できることを示す。
論文 参考訳(メタデータ) (2020-11-26T01:23:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。