論文の概要: CameraEditor: Camera-Controlled Image Editing via Video-Prior Sequential Modeling
- arxiv url: http://arxiv.org/abs/2609.01479v1
- Date: Tue, 01 Sep 2026 16:16:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.831126
- Title: CameraEditor: Camera-Controlled Image Editing via Video-Prior Sequential Modeling
- Title(参考訳): カメラ編集:ビデオピアシークエンシャルモデリングによるカメラ制御画像編集
- Authors: Xin Shen, Chengyou Jia, Keshuo Xing, Zifeng Zhu, Changliang Xia, Bowen Ping, Zhuohang Dang, Hangwei Qian, Minnan Luo,
- Abstract要約: カメラパラメータは、任意の画像の幾何学的視点と外観を決定する上で重要な役割を果たす。
最近の画像編集モデルは、セマンティックおよびスタイリスティックな操作が優れているが、明示的なカメラパラメータ制御に苦慮している。
本稿では,空間問題からのカメラ制御編集を時間的シーケンス予測タスクに再構成するフレームワークであるCameraEditorを紹介する。
- 参考スコア(独自算出の注目度): 33.2078327357266
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Beyond semantic content, camera parameters play a pivotal role in dictating the geometric perspective and appearance of any given image. While recent image editing models excel at semantic and stylistic manipulation, they struggle with explicit camera parameter control. When handling large perspective shifts, instruction-driven models face a dilemma: they either suffer from structural tearing or generate conservative outputs that ignore geometric instructions. To address this, we introduce CameraEditor, a framework that reformulates camera-controlled editing from a spatial problem into a temporal sequence prediction task. By leveraging the temporal coherence of video diffusion models, our approach integrates an explicit geometric perception module with a dynamic reference routing mechanism. This allows us to construct geometrically rigorous visual reference pairs via dynamic panorama cropping, overcoming the ambiguity of text-based instructions. Furthermore, CameraEditor strategically inserts intermediate transition frames to decompose large perspective shifts, providing a robust temporal buffer that preserves content identity and spatial coherence. We construct a training dataset of 5,760 instances. As an independent contribution, we introduce CamEditor-Bench, a model-agnostic evaluation suite of 462 test cases. Extensive experiments demonstrate that CameraEditor achieves state-of-the-art camera control precision and source identity preservation, outperforming existing methods.
- Abstract(参考訳): セマンティックコンテンツ以外にも、カメラパラメータは、任意の画像の幾何学的視点と外観を決定する上で重要な役割を果たす。
最近の画像編集モデルはセマンティックやスタイリスティックな操作が優れているが、明示的なカメラパラメータ制御に苦慮している。
大きな視点シフトを扱う場合、命令駆動モデルはジレンマに直面し、構造的なひび割れに悩まされるか、幾何学的な指示を無視した保守的な出力を生成する。
そこで本稿では,空間問題からのカメラ制御編集を時間的シーケンス予測タスクに再構成するフレームワークであるCameraEditorを紹介する。
ビデオ拡散モデルの時間的コヒーレンスを活用することにより,ダイナミックな参照ルーティング機構と明示的な幾何学的知覚モジュールを統合する。
これにより、動的パノラマトリミングによって幾何学的に厳密な視覚参照ペアを構築することができ、テキストベースの指示のあいまいさを克服できる。
さらに、CameraEditorは、中間遷移フレームを戦略的に挿入して、大きな視点シフトを分解し、コンテンツアイデンティティと空間コヒーレンスを保存する堅牢な時間バッファを提供する。
5,760インスタンスのトレーニングデータセットを構築します。
独立したコントリビューションとして,462のテストケースのモデルに依存しない評価スイートCamEditor-Benchを紹介する。
大規模な実験により、CameraEditorは最先端のカメラ制御精度とソースアイデンティティの保存を達成し、既存の手法より優れていることが示された。
関連論文リスト
- CameraAnything: Refilming Videos with Arbitrary Camera Control [104.67227614978822]
我々は、カメラ制御ビデオ編集のための最初の統合フレームワークであるCameraAnythingを紹介する。
内在型と外在型の両方のカメラパラメータのジョイントコントロールを可能にする。
調整されたトレーニング戦略により、CameraAnythingは、任意の視点制御、焦点長調整、解像度適応、および1世代プロセス内の複数ショット遷移による表現力のあるビデオ再撮影を可能にする。
論文 参考訳(メタデータ) (2026-07-27T15:55:08Z) - GeoStream: Toward Precise Camera Controlled Streaming Video Generation [85.01823220801256]
既存のアプローチはカメラの動きを暗黙的に学習し、アウト・オブ・ディストリビューション・トラジェクトリの下で不正確な制御をもたらす。
厳密な幾何学的条件付けにより制御性が向上するが、既存の手法は非自己回帰的である。
自動回帰ストリーミングビデオ生成における高精度なメカニカルカメラ制御を実現するフレームワークであるGeoStreamを提案する。
論文 参考訳(メタデータ) (2026-06-13T07:18:04Z) - DeltaCam: Differential Intrinsic Camera Modeling for Video Generation [8.590252585822439]
ビデオ拡散フレームワークであるDeltaCamを導入し、絶対状態ではなく、カメラの動きと内在性の変化を相対的に変化させることにより、カメラの挙動をモデル化する。
我々は,この枠組みを実世界の映像に拡張する2つのメカニズムとして,実際の画像・メタデータペアの制御を精密な撮影マッチングのために微調整し,暗黙的なビデオ・ビデオ間通信のための非絡み合った埋め込みを抽出する。
論文 参考訳(メタデータ) (2026-05-24T21:39:54Z) - CalibAnyView: Beyond Single-View Camera Calibration in the Wild [59.66873936532375]
カメラキャリブレーションは、信頼性の高い幾何学的知覚の基本的な前提条件である。
近年の学習に基づく手法では、単一ビューの校正には有望な結果が得られたが、本質的に複数のビューにまたがる幾何的整合性は無視されている。
任意の数の入力ビューをサポートする統一的な定式化であるCalibAnyViewを紹介します。
論文 参考訳(メタデータ) (2026-05-14T09:32:12Z) - UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models [20.550231658763085]
カメラ制御可能な画像編集は、カメラポーズの異なるシーンの新しいビューを合成することを目的としている。
既存の方法は、表現レベルで点雲を注入するなど、断片化された幾何学的ガイダンスに依存している。
カメラ制御可能な新しい編集フレームワークUniGeoを提案する。
論文 参考訳(メタデータ) (2026-04-19T18:11:08Z) - World-Shaper: A Unified Framework for 360° Panoramic Editing [57.174341220144605]
既存の視点に基づく画像編集手法ではパノラマの空間構造をモデル化できない。
一つの編集中心の設計にパノラマ生成と編集をブリッジする統合幾何認識フレームワークであるWorld-Shaperを提案する。
本手法はSOTA法と比較して, 幾何的整合性, 編集精度, テキスト制御性に優れる。
論文 参考訳(メタデータ) (2026-01-30T19:38:54Z) - Generative Photographic Control for Scene-Consistent Video Cinematic Editing [75.45726688666083]
CineCtrlはプロのカメラパラメータを細かく制御する最初の映像編集フレームワークである。
本稿では、カメラの動きを写真入力から切り離すための分離されたクロスアテンション機構を提案する。
本モデルでは,ユーザの指定した写真カメラ効果を正確に制御した高忠実度ビデオを生成する。
論文 参考訳(メタデータ) (2025-11-17T03:17:23Z) - CamPVG: Camera-Controlled Panoramic Video Generation with Epipolar-Aware Diffusion [31.032317079295762]
CamPVGは、正確なカメラポーズによってガイドされるパノラマビデオ生成のための初めての拡散ベースのフレームワークである。
球面投影に基づくパノラマ画像とクロスビュー特徴集計のためのカメラ位置符号化を実現する。
提案手法は,パノラマ映像生成における既存の手法をはるかに超え,カメラトラジェクトリーと整合した高品質なパノラマ映像を生成する。
論文 参考訳(メタデータ) (2025-09-24T10:34:24Z) - Vid-CamEdit: Video Camera Trajectory Editing with Generative Rendering from Estimated Geometry [41.904066758259624]
ビデオカメラトラジェクトリ編集のための新しいフレームワークであるVid-CamEditを紹介する。
我々のアプローチは、時間的に一貫した幾何を推定する2つのステップと、この幾何学によって導かれる生成的レンダリングからなる。
論文 参考訳(メタデータ) (2025-06-16T17:02:47Z) - VASE: Object-Centric Appearance and Shape Manipulation of Real Videos [108.60416277357712]
本研究では,オブジェクトの外観と,特にオブジェクトの精密かつ明示的な構造的変更を実行するために設計された,オブジェクト中心のフレームワークを紹介する。
我々は,事前学習した画像条件拡散モデル上にフレームワークを構築し,時間次元を扱うためのレイヤを統合するとともに,形状制御を実現するためのトレーニング戦略とアーキテクチャ修正を提案する。
我々は,画像駆動映像編集タスクにおいて,最先端技術に類似した性能を示し,新しい形状編集機能を示す手法について検討した。
論文 参考訳(メタデータ) (2024-01-04T18:59:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。