論文の概要: SemCam: Semantic Camera Motion Control for Video Generation
- arxiv url: http://arxiv.org/abs/2610.05141v1
- Date: Sun, 04 Oct 2026 11:41:08 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:26:52.034466
- Title: SemCam: Semantic Camera Motion Control for Video Generation
- Title(参考訳): SemCam:ビデオ生成のためのセマンティックカメラモーション制御
- Abstract要約: SemCamは、参照ビデオとターゲットモーションラベルが所望の被写体相対カメラの振る舞いを指定するビデオ対ビデオタスクである。
我々は,8つのセマンティックカメラ動作をカバーする661対のビデオを構築した。
SemCamのセマンティックモーションの成功率は68.6%であり、Vista4Dは45.3%である。
- 参考スコア(独自算出の注目度): 44.47956518827103
- License:
- Abstract: Controlling the camera relative to a moving subject in an existing video is challenging: behaviors such as maintaining a frontal view require the camera to adapt to the subject's changing position and orientation, making the desired trajectory difficult to specify in advance. Existing camera-controlled video-to-video methods typically rely on explicit trajectories or reference motions, which do not directly express these dynamic camera--subject relationships. We introduce semantic camera motion control, a novel video-to-video task in which a reference video and a target motion label specify the desired subject-relative camera behavior without an explicit target trajectory. Our method, SemCam, learns to realize this behavior while preserving source content. It combines shared-basis low-rank adaptation with motion-conditioned modulation, while a background-consistency loss encourages fidelity in regions visible in both reference and target videos. We construct 661 paired videos covering eight semantic camera behaviors and evaluate on a separate 109-scene benchmark using subject-relative motion metrics, appearance measures, and a user study. SemCam achieves a semantic-motion success rate of 68.6%, compared with 45.3% for Vista4D, the strongest evaluated baseline, while maintaining comparable subject identity preservation.
- Abstract(参考訳): 前方視の維持などの動作は、カメラが被写体の位置や向きを変えることを必要とし、望まれる軌跡を事前に特定することが困難になる。
既存のカメラ制御ビデオ・ツー・ビデオ方式は、通常、これらの動的なカメラ・オブジェクトの関係を直接表現しない明示的な軌跡や参照動作に依存している。
そこで本研究では,対象の映像と対象の動画ラベルが,対象の具体的な軌跡を示さずに,目的のカメラ動作を規定するビデオ対ビデオタスクであるセマンティックカメラのモーションコントロールを導入する。
本手法は,ソースコンテンツを保存しながら,この動作を実現する方法であるSemCamを学習する。
共有基底の低ランク適応と運動条件の変調を組み合わせ、バックグラウンド一貫性の喪失は参照ビデオとターゲットビデオの両方で見える領域の忠実度を促進する。
我々は,8つのセマンティックカメラ動作をカバーする661枚のペアビデオを作成し,被写体相対運動測定値,外観測定値,ユーザスタディを用いて,異なる109シーンのベンチマークで評価した。
SemCamのセマンティックモーションの成功率は68.6%であり、Vista4Dの45.3%は最強の評価基準である。
関連論文リスト
- TriMotion: Modality-Agnostic Camera Control for Video Generation [65.5913929253637]
TriMotionは、カメラ制御ビデオ生成のためのフレームワークで、ビデオ、ポーズ、テキスト入力をマッピングし、同じカメラ軌跡を共有モーション埋め込み空間に記述する。
また,TriMotionは3つのモダリティ全てを対象とするカメラ軌跡を正確に追従する高品質なビデオを生成する。
論文 参考訳(メタデータ) (2026-06-18T16:07:05Z) - ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation [34.51506212196978]
ActCamは、動画生成のためのゼロショット方式で、ドライブビデオから新しいシーンにキャラクタの動きを共同で転送する。
シーン深度とキャラクタポーズの条件付けを受け入れる事前訓練された画像間拡散モデルを構築した。
ActCamは、ポーズのみの制御や、他のポーズやカメラの手法と比較して、カメラの付着性や動きの忠実性を改善する。
論文 参考訳(メタデータ) (2026-05-07T17:59:58Z) - MoRight: Motion Control Done Right [71.36903230523589]
両制約に対処する統合フレームワークであるMoRightを紹介した。
オブジェクトの動きは標準静的ビューで指定され、任意のターゲットカメラ視点に転送される。
3つのベンチマークの実験では、生成品質、動作制御性、相互作用認識における最先端のパフォーマンスが示されている。
論文 参考訳(メタデータ) (2026-04-08T17:59:22Z) - MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation [30.528654507198052]
本稿では,カメラとオブジェクトの動作を,対応する画素の運動に変換することによって統合する新しいアプローチを提案する。
我々のモデルはSOTA法よりも大きなマージンで優れている。
論文 参考訳(メタデータ) (2025-09-25T13:06:12Z) - Image Conductor: Precision Control for Interactive Video Synthesis [90.2353794019393]
映画製作とアニメーション制作は、しばしばカメラの遷移と物体の動きを調整するための洗練された技術を必要とする。
イメージコンダクタ(Image Conductor)は、カメラトランジションとオブジェクトの動きを正確に制御し、単一の画像からビデオアセットを生成する方法である。
論文 参考訳(メタデータ) (2024-06-21T17:55:05Z) - MotionMaster: Training-free Camera Motion Transfer For Video Generation [48.706578330771386]
本稿では,映像中のカメラの動きと物体の動きをアンハングリングする,トレーニング不要な動画移動モデルを提案する。
我々のモデルは、効果的にカメラオブジェクトの動きを分離し、分離されたカメラの動きを広範囲の制御可能なビデオ生成タスクに適用することができる。
論文 参考訳(メタデータ) (2024-04-24T10:28:54Z) - Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion [34.404342332033636]
我々は、カメラのパンやズームの動きだけでなく、複数のオブジェクトのモーションを独立して指定できるシステムであるDirect-a-Videoを紹介した。
カメラの動きの定量的なパラメータを解釈するために,新しい時間的クロスアテンション層を導入する。
どちらのコンポーネントも独立して動作し、個別または複合的な制御を可能にし、オープンドメインシナリオに一般化することができる。
論文 参考訳(メタデータ) (2024-02-05T16:30:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。