論文の概要: FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry
- arxiv url: http://arxiv.org/abs/2607.18227v1
- Date: Mon, 20 Jul 2026 17:58:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.730964
- Title: FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry
- Title(参考訳): FlowMimic: オンラインビデオ編集データ生成とモダリティミミクスのためのPixel-pairワープフローフィールドによるマスクのないビジュアル編集と生成
- Abstract要約: 単一モデルにおける映像・映像のモダリティ生成と編集の両機能の統合について検討する。
我々は,画像編集サンプルから対応する映像編集サンプルを直接リアルタイムで生成できる画素対時整流場を開発した。
- 参考スコア(独自算出の注目度): 3.8989988029821396
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In line with the prevailing direction of vision research, we explore the integration of both generation and editing capabilities for video and image modalities within a single model. Current approaches to collecting video editing data typically depend on labour-intensive, time-consuming curated procedures--involving object mask annotation, the use of error-introducing pair synthesis via I2V model and ControlNet-like guidance, and VLM-based quality filtering or refinement--and demonstrate limited task scalability. As a result, the diversity of editing tasks remains substantially narrower than that available for image editing models. We develop a pixel-pair temporal warped flow field that can directly generate corresponding video editing samples in real time from image editing samples, and we demonstrate across multiple levels of video editing tasks that a model can learn video editing using only such data. We regard the image modality as a particular form of the video modality. Accordingly, we design a modality mimic generation loss and a modality mimic editing loss to relatively align the capabilities--and thereby the output distributions--of the two modalities through mutual imitation. Moreover, language-based visual editing entails the comprehension of the editing instruction and the reference visual content, the localization of the region corresponding to that instruction within the reference visual contents, and the modification of that region alone. Existing approaches predominantly rely on external aids, such as fine-tuning an additional MLLM or explicitly supplying a mask sequence as auxiliary input during inference. In contrast, we aspire for the model to internalize this capability. To that end, we introduce sense-related tasks--for instance, referring expression segmentation--along with corresponding editing-region-aware latent-level loss and attention-level loss.
- Abstract(参考訳): 視覚研究の主流方向に合わせて,単一のモデルにおける映像と画像のモダリティの生成と編集の両機能の統合について検討する。
ビデオ編集データの収集への現在のアプローチは、通常、労働集約的で時間を要するキュレートされた手順、オブジェクトマスクアノテーションの関与、I2VモデルとControlNetのようなガイダンスによるエラー導入ペア合成の使用、VLMベースの品質フィルタリングや精細化、およびタスクのスケーラビリティの制限などに依存している。
その結果、編集タスクの多様性は、画像編集モデルで利用可能なタスクよりも大幅に狭められている。
我々は,画像編集サンプルから,対応する映像編集サンプルを直接リアルタイムで生成できる画素対時流場を開発し,モデルがそのようなデータのみを用いて映像編集を学習できる複数のレベルの映像編集タスクを実演する。
我々は、画像モダリティをビデオモダリティの特定の形態とみなす。
そこで本研究では,モダリティの模倣生成損失とモダリティの模倣編集損失を設計し,2つのモダリティの出力分布を相互の模倣により相対的に調整する。
さらに、言語ベースのビジュアル編集は、編集命令と参照視覚内容の理解、参照視覚内容内のその命令に対応する領域の局所化、および、その領域のみの変更を含む。
既存のアプローチは主に外部援助に依存しており、追加のMLLMを微調整したり、推論中にマスクシーケンスを補助入力として明示的に供給したりしている。
対照的に、私たちはモデルがこの機能を内部化することを期待しています。
そこで本研究では,認識関連タスク,例えば表現のセグメンテーション(セグメンテーション)を,対応する編集領域レベルの損失や注意レベルの損失と合わせて導入する。
関連論文リスト
- VicEdit: Learning to Edit Videos from Visual In-Context Examples [122.14105395087746]
テキストによる指示からマルチモーダルな視覚誘導までの映像編集を高める新しいパラダイムであるVisual In-context Editingを提案する。
VicEdit-400Kは、ビジュアルなテキスト内ビデオ編集のための最初の大規模データセットである。
VicEditは、基本的な命令編集とビジュアル・イン・コンテクスト編集の両方で最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-08-17T15:55:40Z) - LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing [45.1196749483108]
我々は,大規模で高品質な画像編集データをビデオデータセットとともに活用し,編集能力を増強する共同トレーニングフレームワークであるLIVEを提案する。
フレームワイドなトークンノイズ戦略を導入し、特定のフレームの潜伏を推論トークンとして扱い、大規模な事前学習ビデオ生成モデルを活用して、妥当な時間変換を生成する。
画像編集に多いが、既存のビデオデータセットでは不十分な60以上の課題を含む総合的な評価ベンチマークをキュレートする。
論文 参考訳(メタデータ) (2026-04-18T15:09:01Z) - Taming Flow-based I2V Models for Creative Video Editing [64.67801702413122]
ビデオ編集は、ユーザーの意図に応じてビデオを編集することを目的としているが、まだまだ課題だ。
既存の画像条件付きビデオ編集手法の多くは、モデル固有の設計の逆変換を必要とするか、あるいは広範囲の最適化を必要とする。
Inversion-Free 方式である IF-V2V を提案し,ビデオ編集のためのオフザシェルフフローマッチングベースの I2V モデルを,計算オーバーヘッドの大きいものに適応させる。
論文 参考訳(メタデータ) (2025-09-26T05:57:04Z) - EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning [58.53074381801114]
イメージとビデオの生成と編集を単一のモデルで統合したフレームワークであるEditVerseを紹介する。
テキスト、画像、ビデオなどのすべてのモダリティを統一されたトークンシーケンスとして表現することで、EditVerseは、堅牢なインコンテキスト学習を実現するために自己アテンションを活用する。
多様なタスクや解像度をカバーする命令ベースのビデオ編集のための最初のベンチマークであるEditVerseBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T17:59:30Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - UNIC: Unified In-Context Video Editing [76.76077875564526]
UNIC(Unified In-Context Video Editing)は、単一のモデル内でさまざまなビデオ編集タスクをコンテキスト内で統一するフレームワークである。
本稿では,一貫した時間的位置エンコーディングを容易にするタスク認識型RoPEと,モデルの異なる編集タスクを明確に区別する条件バイアスを導入する。
その結果、我々の統合された手法は各タスクにおいて優れた性能を発揮し、創発的なタスク構成能力を示すことがわかった。
論文 参考訳(メタデータ) (2025-06-04T17:57:43Z) - MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation [55.101611012677616]
拡散ベースのテキスト・トゥ・イメージ(T2I)モデルは,グローバルビデオ編集タスクにおいて顕著な結果を示した。
我々は、オープンドメインビデオ編集のための事前訓練されたT2Iモデル上に構築された、チューニング不要なMAEフレームワークであるMAKIMAを紹介する。
論文 参考訳(メタデータ) (2024-12-28T02:36:51Z) - I2VEdit: First-Frame-Guided Video Editing via Image-to-Video Diffusion Models [18.36472998650704]
本稿では,1フレームからビデオ全体への編集を事前学習した画像対ビデオモデルを用いてプロパガンダすることで,画像編集ツールをビデオに適用可能にする,新しい汎用的ソリューションを提案する。
I2VEditと呼ばれる本手法は,編集範囲に応じて映像の視覚的・運動的整合性を適応的に保持する。
論文 参考訳(メタデータ) (2024-05-26T11:47:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。