論文の概要: ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow
- arxiv url: http://arxiv.org/abs/2607.28362v1
- Date: Thu, 30 Jul 2026 15:28:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.623684
- Title: ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow
- Title(参考訳): ShadowDancer:ビデオからUnified Dynamics Representationを学習して、どんなアクションでもビデオワールドモデルを教える
- Authors: Jin Cao, Zian Meng, Kaipeng Zhang,
- Abstract要約: 我々は、インタラクティブなビデオワールドモデルの任意のアクション、フレームレベル制御に対する新しいアプローチであるShadowDancerを提示する。
既存のインターフェイスはアクションを緩やかにエンコードし、モデルが即興的に展開する方法を残したり、構造化された信号を通じて正確にエンコードしたりする。
ShadowDancer氏はこれを,2つの重要なイノベーション – シャドウペア,独立して再サンプリングされた外観の下で同じダイナミクスを再生するビデオペア,シャドウ間の予測 – で対処する。
- 参考スコア(独自算出の注目度): 24.623235518370695
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present ShadowDancer, a novel approach to any-action, frame-level control of interactive video world models. The obstacle is representational: existing interfaces either encode an action loosely, leaving how it unfolds for the model to improvise, or encode it exactly through structured signals that serve one family and are hard to acquire, so precise control across diverse dynamics remains impractical. Demonstration videos are the natural remedy, specifying any dynamics frame by frame; yet a video shows its dynamics only through one particular appearance, a single shadow of the underlying dynamics, so actions learned from demonstrations transfer poorly to new scenes. ShadowDancer addresses this with two key innovations: (1) shadow pairs, video pairs that replay the same dynamics under independently resampled appearance, constructed at scale by our Shadow Library, so that a dynamics family becomes controllable exactly when such pairs can be constructed for it; and (2) cross-shadow prediction, which learns actions by predicting one shadow from the other, so that whatever the pairing resamples is discarded by construction and whatever it preserves becomes the action, yielding a unified dynamics representation that drives a block-causal world model. Any demonstrated clip thus becomes a reusable action asset, replayed in new environments without action labels, motion estimators, or fine-tuning. Experiments demonstrate improved action transfer and long action rollout over strong latent-action and interactive world model baselines across diverse dynamics families, with an average blinded win rate of 86% in rollout comparisons. We show video results at https://ShadowDancer-1.github.io
- Abstract(参考訳): 我々は、インタラクティブなビデオワールドモデルの任意のアクション、フレームレベル制御に対する新しいアプローチであるShadowDancerを提示する。
既存のインターフェイスは、アクションを緩やかにエンコードし、モデルが即興的に展開する方法を残すか、あるいは1つのファミリーに仕え、取得が困難である構造化信号を通じて正確にエンコードする。
デモビデオは自然な治療であり、フレームごとにダイナミックスフレームを指定しますが、ビデオはそのダイナミックスを1つの特定の外観、基礎となるダイナミックスの1つの影を通してのみ表示します。
シャドーペア、ビデオペア、独立して再サンプリングされた外観の下で同じダイナミクスを再生するビデオペアは、シャドウライブラリーによって大規模に構築され、そのようなペアが構築可能な場合に正確に動的ファミリーが制御可能になる。
したがって、デモされたクリップは再利用可能なアクションアセットとなり、アクションラベル、モーション推定器、微調整なしで新しい環境で再生される。
実験では、多種多様なダイナミクスファミリーにわたる強力な潜在動作とインタラクティブな世界モデルベースラインに対して、アクション転送と長時間のロールアウトが改善され、ロールアウト比較では平均86%の視覚的勝利率が得られた。
ビデオの結果はhttps://ShadowDancer-1.github.ioで公開しています。
関連論文リスト
- Self-Supervised Learning of Structured Dynamics from Videos [76.23834498074805]
予め訓練した画像ビジョン変換器の凍結した特徴から、構造化された動き表現を復元できるかどうかを検討する。
本研究では、時間変化の主源を残留力学から明確に分離する構造ダイナミクスモデル(SDM)を提案する。
ProbeMotionのSDMは、カメラモーション、オブジェクトモーション、複合ダイナミクスを備えた合成ビデオと実ビデオにまたがる新しい評価スイートである。
論文 参考訳(メタデータ) (2026-07-23T17:55:07Z) - ActionParty: Multi-Subject Action Binding in Generative Video Games [117.52562594944679]
ActionPartyは、ゲーム生成のための制御可能な多目的世界モデルである。
46の多様な環境において最大7人のプレイヤーを同時に制御できる最初のビデオワールドモデルを実証する。
論文 参考訳(メタデータ) (2026-04-02T17:59:58Z) - DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data [51.316274891736164]
DynaVidは、トレーニングで合成モーションデータを活用するビデオ合成フレームワークである。
ダイナミックモーション生成とカメラモーション制御において,DynaVidはリアリズムと制御性を向上することを示す。
論文 参考訳(メタデータ) (2026-04-02T06:12:38Z) - Dexterous World Models [24.21588354488453]
Dexterous World Model (DWM) はシーンアクション条件付きビデオ拡散フレームワークである。
本稿では,DWMが時間的コヒーレントな映像を生成する方法を示す。
実験により、DWMは、つかむ、開く、動く物体など、現実的で物理的に妥当な相互作用を可能にすることが示されている。
論文 参考訳(メタデータ) (2025-12-19T18:59:51Z) - SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation [56.90807453045657]
SynMotion(シンモクション)は、セマンティックガイダンスと視覚適応を併用した動画生成モデルである。
意味レベルでは、主観と動きの表現をアンタングルする二項意味理解機構を導入する。
視覚レベルでは、効率的なモーションアダプタをトレーニング済みのビデオ生成モデルに統合し、動きの忠実度と時間的コヒーレンスを高める。
論文 参考訳(メタデータ) (2025-06-30T10:09:32Z) - Video Creation by Demonstration [59.389591010842636]
我々は、条件付き将来のフレーム予測によってラベルなしビデオから学習する自己教師型トレーニングアプローチである$delta$-Diffusionを提案する。
映像基盤モデルと外観ボトルネック設計を併用して,実演映像から動作遅延を抽出し,生成プロセスの条件付けを行う。
実証的に、$delta$-Diffusionは人間の好みと大規模マシン評価の両方の観点から、関連するベースラインを上回っている。
論文 参考訳(メタデータ) (2024-12-12T18:41:20Z) - Puppet-Master: Scaling Interactive Video Generation as a Motion Prior for Part-Level Dynamics [79.4785166021062]
本稿では,対話型ビデオジェネレータPuppet-Masterを紹介した。
Puppet-Masterは、他のモーションコンディショニングビデオジェネレータとは異なり、パートレベルのモーションを生成することを学習している。
Puppet-Masterはドメイン外の実際のイメージを一般化し、実世界のベンチマークで既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-08-08T17:59:38Z) - Learn the Force We Can: Enabling Sparse Motion Control in Multi-Object
Video Generation [26.292052071093945]
単一のフレームとスパース動作入力からビデオを生成する教師なしの手法を提案する。
我々の訓練されたモデルは、目に見えない現実的なオブジェクト間相互作用を生成できる。
ヨダは、制御性と映像品質の両面において、先行するアートビデオ生成の状況と同等かそれ以上であることを示す。
論文 参考訳(メタデータ) (2023-06-06T19:50:02Z) - STaR: Self-supervised Tracking and Reconstruction of Rigid Objects in
Motion with Neural Rendering [9.600908665766465]
本稿では,マルチビューRGB動画のリジッドモーションによる動的シーンの自己監視追跡と再構成を,手動アノテーションなしで行う新しい手法であるSTaRについて述べる。
本手法は,空間軸と時間軸の両方で新規性を測定するフォトリアリスティック・ノベルビューを描画できることを示した。
論文 参考訳(メタデータ) (2020-12-22T23:45:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。