論文の概要: TARS: Timestep-Aware Data Scaling for 3D-Free Video Re-Shooting
- arxiv url: http://arxiv.org/abs/2607.28261v1
- Date: Thu, 30 Jul 2026 14:18:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.604517
- Title: TARS: Timestep-Aware Data Scaling for 3D-Free Video Re-Shooting
- Title(参考訳): TARS:3Dフリービデオ再撮影のためのタイムステップ対応データスケーリング
- Authors: Jiwen Liu, Shujuan Li, Xiaohan Li, Zijie Meng, Xinyue Liu, Yulong Xu, Yan Zhou, Guoxin Zhang,
- Abstract要約: ビデオの再撮影は、コントロール可能なカメラモーションと視点でビデオを再生することを目的としている。
TARSは従来の方法よりも正確で時間的に一貫したカメラ制御を提供する。
- 参考スコア(独自算出の注目度): 17.23436401314677
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video re-shooting aims to regenerate videos with controllable camera motion and viewpoint. Existing methods rely on explicit 3D priors, which are limited by reconstruction quality and often perform poorly when synthesizing previously unseen regions, or on paired videos with different camera trajectories, whose scarcity hinders generalization. We revisit video re-shooting through text-driven semantic viewpoint specification, enabling control over shot scale, viewing angle, and first-/third-person perspective. To this end, we propose TARS, a 3D-free video re-shooting paradigm. Timestep-wise sensitivity analysis reveals that camera motion is primarily established during high-noise stages, where coarse spatiotemporal structures are formed. Based on this insight, we introduce self-supervised training to learn camera dynamics and fundamental visual representations without paired re-shooting data or 3D reconstruction. Through data scaling and joint textual-camera conditioning, TARS supports robust camera and viewpoint control, plausibly synthesizing regions beyond the source view under large camera motions while enabling reverse-angle re-shooting and perspective switching. Extensive experiments show that TARS provides more accurate and temporally consistent camera control than prior methods. Project Page: https://ymlinfeng.github.io/TARS.github.io/
- Abstract(参考訳): ビデオの再撮影は、コントロール可能なカメラモーションと視点でビデオを再生することを目的としている。
既存の方法は、復元品質によって制限され、以前は目に見えない領域を合成する際には、しばしば性能が良くない明示的な3Dプリエントや、カメラの軌跡が異なるペアビデオに依存しており、その不足は一般化を妨げている。
テキスト駆動型セマンティック・パースペクティブ・仕様を用いて、ビデオの再撮影を再考し、ショットスケール、視角、一対三のパースペクティブの制御を可能にする。
そこで本研究では,3Dフリービデオ再撮影パラダイムであるTARSを提案する。
時間的感度分析により、粗い時空間構造が形成される高雑音の段階では主にカメラの動きが成立することが明らかとなった。
この知見に基づいて、ペアの再撮影データや3D再構成を使わずに、カメラダイナミクスや基本的な視覚表現を学習するための自己指導型トレーニングを導入する。
データスケーリングと共同のテキストカメラコンディショニングにより、TARSは堅牢なカメラと視点制御をサポートし、大きなカメラモーションの下で、ソースビューを超えた領域を確実に合成し、逆角の再撮影と視点切り替えを可能にした。
大規模な実験により、TARSは以前の方法よりも正確で時間的に一貫したカメラ制御を提供することが示された。
Project Page: https://ymlinfeng.github.io/TARS.github.io/
関連論文リスト
- CamPilot: Improving Camera Control in Video Diffusion Model with Efficient Camera Reward Feedback [43.174121093566264]
我々は、Reward Feedback Learningを構築し、カメラの制御性をさらに向上することを目指している。
現在の報酬モデルには、ビデオカメラのアライメントを評価する能力がない。
本稿では,映像遅延を3次元表現にデコードして報酬量子化を行う,効率的なカメラ対応3Dデコーダを提案する。
論文 参考訳(メタデータ) (2026-01-22T18:59:56Z) - GaVS: 3D-Grounded Video Stabilization via Temporally-Consistent Local Reconstruction and Rendering [54.489285024494855]
ビデオの安定化は、元のユーザの動きの意図を保ちながら、望ましくないシャキネスを除去するので、ビデオ処理に欠かせない。
既存のアプローチは、運用するドメインによって、ユーザエクスペリエンスを低下させるいくつかの問題に悩まされます。
ビデオの安定化を時間的に一貫性のある局所的再構成とレンダリングのパラダイムとして再構成する,新しい3Dグラウンドアプローチである textbfGaVS を紹介する。
論文 参考訳(メタデータ) (2025-06-30T15:24:27Z) - AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers [66.29824750770389]
カメラの動きを第一原理の観点から分析し、正確な3Dカメラ操作を可能にする洞察を明らかにする。
これらの知見を合成して、高度な3Dカメラ制御(AC3D)アーキテクチャを設計する。
論文 参考訳(メタデータ) (2024-11-27T18:49:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。