論文の概要: VicEdit: Learning to Edit Videos from Visual In-Context Examples
- arxiv url: http://arxiv.org/abs/2608.16745v1
- Date: Mon, 17 Aug 2026 15:55:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.787615
- Title: VicEdit: Learning to Edit Videos from Visual In-Context Examples
- Title(参考訳): VicEdit: Visual In-Contextの例からビデオの編集を学ぶ
- Authors: Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang,
- Abstract要約: テキストによる指示からマルチモーダルな視覚誘導までの映像編集を高める新しいパラダイムであるVisual In-context Editingを提案する。
VicEdit-400Kは、ビジュアルなテキスト内ビデオ編集のための最初の大規模データセットである。
VicEditは、基本的な命令編集とビジュアル・イン・コンテクスト編集の両方で最先端のパフォーマンスを実現する。
- 参考スコア(独自算出の注目度): 122.14105395087746
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite progress in instruction-based video editing, unimodal textual instructions inherently struggle to convey fine-grained textures and complex dynamics. To bridge this perceptual gap, we propose Visual In-context Editing, a new paradigm elevating video editing from textual instructions to multi-modal visual guidance encompassing single image, image pair, and video pair. To facilitate this paradigm, we curate VicEdit-400K, the first large-scale dataset for visual in-context video editing. We develop an automated pipeline to generate 400K high-quality samples across ten task types, ensuring superior visual fidelity and semantic consistency through multi-dimensional filtering. Leveraging this foundation, we introduce VicEdit, a unified framework to bridge visual and textual contexts. To adaptively extract editing semantics from heterogeneous references, we design Modality-Adaptive Semantic Distillation, which produces modality-specific semantic tokens from visual references. These tokens are then synergistically integrated with textual instructions through Dual-Context Injection, enabling the generation process to benefit from both visual and textual signals. Extensive evaluations on VicEditBench demonstrate that VicEdit achieves state-of-the-art performance across both basic instruction editing and visual in-context editing tasks, establishing visual in-context learning as a powerful and controllable paradigm for video editing.
- Abstract(参考訳): 命令ベースのビデオ編集の進歩にもかかわらず、単文の指示は本質的に、きめ細かいテクスチャや複雑なダイナミクスを伝えるのに苦労している。
このギャップを埋めるために,テキストからの映像編集から,単一画像,画像ペア,ビデオペアを含むマルチモーダル視覚誘導まで,新たなパラダイムであるVisual In-context Editingを提案する。
このパラダイムを実現するために、視覚内ビデオ編集のための大規模なデータセットであるVicEdit-400Kをキュレートする。
10種類のタスクタイプにまたがって400Kの高品質なサンプルを生成する自動パイプラインを開発し、多次元フィルタリングによる視覚的忠実度とセマンティック一貫性を確保する。
この基盤を活用して、視覚とテキストのコンテキストをブリッジする統合フレームワークであるVicEditを導入します。
不均一な参照から編集意味を適応的に抽出するために、視覚参照からモダリティ固有の意味トークンを生成するモダリティ適応セマンティック蒸留(Modality-Adaptive Semantic Distillation)を設計する。
これらのトークンは、Dual-Context Injectionを通じてテキスト命令と相乗的に統合され、生成プロセスは視覚的信号とテキスト的信号の両方から恩恵を受けることができる。
VicEditBenchの広範囲な評価は、VicEditが基本的な命令編集と視覚内テキスト編集の両方で最先端のパフォーマンスを達成し、映像編集の強力な制御可能なパラダイムとして視覚内テキスト学習を確立していることを示している。
関連論文リスト
- FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry [3.8989988029821396]
単一モデルにおける映像・映像のモダリティ生成と編集の両機能の統合について検討する。
我々は,画像編集サンプルから対応する映像編集サンプルを直接リアルタイムで生成できる画素対時整流場を開発した。
論文 参考訳(メタデータ) (2026-07-20T17:58:03Z) - Text-Vision Co-Instructed Image Editing [11.968553566506626]
本稿では,テキスト・ビジョン・コインストラクテッド・イメージ編集について紹介する。
意味的意図と空間的制約を統合することで、TV-Editはより正確な空間制御、命令のあいまいさの低減、テキストのみやドラッグベースの代替よりも構造的一貫性の強化につながる。
論文 参考訳(メタデータ) (2026-06-15T14:16:05Z) - Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance [55.32799307123252]
本稿では,既存のビデオ編集ペアを高忠実度トレーニング四重項に変換するスケーラブルなデータ生成パイプラインを提案する。
本稿では,学習可能なクエリと参照セマンティックガイダンスのための潜在視覚特徴を相乗化する統合編集アーキテクチャKiwi-Editを提案する。
論文 参考訳(メタデータ) (2026-03-02T18:46:28Z) - EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning [58.53074381801114]
イメージとビデオの生成と編集を単一のモデルで統合したフレームワークであるEditVerseを紹介する。
テキスト、画像、ビデオなどのすべてのモダリティを統一されたトークンシーケンスとして表現することで、EditVerseは、堅牢なインコンテキスト学習を実現するために自己アテンションを活用する。
多様なタスクや解像度をカバーする命令ベースのビデオ編集のための最初のベンチマークであるEditVerseBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T17:59:30Z) - Visual Instruction Inversion: Image Editing via Visual Prompting [34.96778567507126]
本稿では,視覚的プロンプトによる画像編集手法を提案する。
テキストと画像の拡散モデルのリッチで事前訓練された編集機能を利用して、視覚的なプロンプトを編集命令に反転させる。
論文 参考訳(メタデータ) (2023-07-26T17:50:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。