論文の概要: MiVE: Multiscale Vision-language features for reference-guided video Editing
- arxiv url: http://arxiv.org/abs/2605.14664v1
- Date: Thu, 14 May 2026 10:19:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-16 00:43:04.116448
- Title: MiVE: Multiscale Vision-language features for reference-guided video Editing
- Title(参考訳): MiVE:参照誘導ビデオ編集のためのマルチスケールビジョン言語機能
- Authors: Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu,
- Abstract要約: 我々は、VLMをマルチスケール特徴抽出器として再利用するフレームワークであるMiVE(Multiscale Vision- language features for reference-guided video Editing)を提案する。
実験により、MiVEは人間の嗜好において最高にランク付けし、学術的手法と商業システムの両方を上回り、最先端のパフォーマンスを達成することが実証された。
- 参考スコア(独自算出の注目度): 31.68670789147968
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reference-guided video editing takes a source video, a text instruction, and a reference image as inputs, requiring the model to faithfully apply the instructed edits while preserving original motion and unedited content. Existing methods fall into two paradigms, each with inherent limitations: decoupled encoders suffer from modality gaps when processing instructions and visual content independently, while unified vision-language encoders lose fine-grained spatial details by relying solely on final-layer representations. We observe that VLM layers encode complementary information hierarchically -- early layers capture localized spatial details essential for precise editing, while deeper layers encode global semantics for instruction comprehension. Building on this insight, we present MiVE (Multiscale Vision-language features for reference-guided video Editing), a framework that repurposes VLMs as multiscale feature extractors. MiVE extracts hierarchical features from Qwen3-VL and integrates them into a unified self-attention Diffusion Transformer, eliminating the modality mismatch inherent in cross-attention designs. Experiments demonstrate that MiVE achieves state-of-the-art performance by ranking highest in human preference, outperforming both academic methods and commercial systems.
- Abstract(参考訳): 参照誘導ビデオ編集は、ソースビデオ、テキストインストラクション、参照イメージを入力として取り、モデルがオリジナルのモーションと未編集コンテンツを保存しながら、指示された編集を忠実に適用する必要がある。
切り離されたエンコーダは命令と視覚的コンテンツを独立に処理する際のモダリティギャップに悩まされ、一方、統合された視覚言語エンコーダは最終層表現にのみ依存して細粒度の空間的詳細を失う。
我々は、VLM層が補完情報を階層的にエンコードしているのを観察し、初期の層は正確な編集に必要な局所的な空間的詳細をキャプチャし、深い層は命令理解のためのグローバルなセマンティクスをエンコードしている。
この知見に基づいて,VLMをマルチスケール特徴抽出器として再利用するフレームワークであるMiVE(Multiscale Vision- language features for reference-guided video Editing)を提案する。
MiVEはQwen3-VLから階層的特徴を抽出し、それらを統合された自己アテンション拡散変換器に統合し、相互アテンション設計に固有のモダリティミスマッチを除去する。
実験により、MiVEは人間の嗜好において最高にランク付けし、学術的手法と商業システムの両方を上回り、最先端のパフォーマンスを達成することが示された。
関連論文リスト
- Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning [5.85033069870214]
動的埋め込みと階層型視覚特徴の融合に基づく効率的な視覚言語微調整法を提案する。
少数のパラメータのみを微調整することで、DEHVFはクロスモーダル情報の正確なアライメントと補完を実現する。
論文 参考訳(メタデータ) (2025-08-25T03:57:46Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding [79.43306110124875]
AlignVLMは視覚的特徴をテキスト埋め込みの重み付き平均値にマッピングする視覚テキストアライメント手法である。
実験の結果,AlignVLMは先行アライメント法と比較して最先端の性能を実現していることがわかった。
論文 参考訳(メタデータ) (2025-02-03T13:34:51Z) - VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval [8.908777234657046]
大規模言語モデルと視覚言語モデル(LLM/LVLM)は、様々な領域で広く普及している。
ここでは、(i)Convolutional ProjectionとFeature Refinementモジュールを通してこれらの制限に対処する新しいHD/MRフレームワークであるVideoLightsを提案する。
QVHighlights、TVSum、Charades-STAベンチマークに関する総合的な実験は、最先端のパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-12-02T14:45:53Z) - BRAVE: Broadening the visual encoding of vision-language models [48.41146184575914]
視覚言語モデル(VLM)は、例えばCLIPのような視覚エンコーダと、下流タスクを解決するために符号化された特徴を解釈する言語モデル(LM)で構成されている。
目覚しい進歩にもかかわらず、VLMは視覚エンコーダの限られた能力のためにいくつかの欠点に直面している。
BRAVEは,複数の凍結エンコーダの特徴をより汎用的な表現に集約し,凍結したLMへの入力として直接供給することができる。
論文 参考訳(メタデータ) (2024-04-10T17:59:45Z) - Deeply Interleaved Two-Stream Encoder for Referring Video Segmentation [87.49579477873196]
まず,CNNに基づく視覚特徴とトランスフォーマーに基づく言語特徴を階層的に抽出する2ストリームエンコーダを設計する。
視覚言語相互誘導(VLMG)モジュールをエンコーダに複数回挿入し,多モード特徴の階層的および進行的融合を促進する。
フレーム間の時間的アライメントを促進するために,言語誘導型マルチスケール動的フィルタリング(LMDF)モジュールを提案する。
論文 参考訳(メタデータ) (2022-03-30T01:06:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。