論文の概要: ALIVE: Interaction-Aligned Object Insertion for First-Frame-Guided Video Editing
- arxiv url: http://arxiv.org/abs/2610.08779v1
- Date: Tue, 06 Oct 2026 17:58:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.163153
- Title: ALIVE: Interaction-Aligned Object Insertion for First-Frame-Guided Video Editing
- Title(参考訳): ALIVE: ファーストフレームガイド映像編集のための対話型オブジェクト挿入
- Abstract要約: ALIVEは、挿入されたオブジェクトを、ソースビデオの内容とのコヒーレントな相互作用を通じて「アクティブ」にする。
3Dレンダリング、モデル生成、実世界のビデオとROSEの一般的な編集ペアを組み合わせた35,800の編集ペアをキュレートする。
本稿では,インタラクションの忠実度,ソース保存,視覚的コヒーレンスを評価するためのALIVE-Interactionベンチマークを提案する。
- 参考スコア(独自算出の注目度): 47.70225968315592
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current video editors can insert objects but often struggle to make them participate in interactions such as being picked up or manipulated. We introduce ALIVE, a framework that makes inserted objects "alive" through coherent interactions with the source video's contents, using an edited first frame and an instruction naming only the added object. We curate 35,800 editing pairs combining 3D-rendered, model-generated, and real-world videos with general editing pairs from ROSE. Each pair differs in the target object's presence while preserving the surrounding action, teaching editors coordinated object behavior and source preservation. We further train a vision-language model (VLM) to predict interaction guidance from the same inputs. We introduce the ALIVE-interaction benchmark to assess interaction fidelity, source preservation, and visual coherence using a unified VLM-based protocol, and evaluate on the general video object insertion benchmark. Without VLM guidance, ALIVE improves Overall over the strongest evaluated baseline by 43.9% and 4.4% on the two benchmarks, respectively. VLM-predicted guidance further improves the ALIVE-interaction score by 0.95 points without additional user inputs.
- Abstract(参考訳): 現在のビデオエディタはオブジェクトを挿入できるが、多くの場合、ピックアップや操作といったインタラクションに参加するのに苦労する。
我々は、編集された第1フレームと追加されたオブジェクトのみを命名して、ソースビデオの内容とのコヒーレントなインタラクションを通じて挿入対象を"生き続ける"ためのフレームワークであるALIVEを紹介する。
3Dレンダリング、モデル生成、実世界のビデオとROSEの一般的な編集ペアを組み合わせた35,800の編集ペアをキュレートする。
それぞれのペアは、周囲の動作を保存しながら、対象のオブジェクトの存在によって異なり、編集者は、オブジェクトの振る舞いとソースの保存を調整した。
さらに視覚言語モデル(VLM)をトレーニングし、同じ入力からインタラクションガイダンスを予測する。
我々は、VLMベースの統一プロトコルを用いて、インタラクションの忠実度、ソース保存、視覚的コヒーレンスを評価するためのALIVE-interactionベンチマークを導入し、一般的なビデオオブジェクト挿入ベンチマークで評価する。
VLMガイダンスがなければ、ALIVEは2つのベンチマークでそれぞれ43.9%と4.4%という最強の評価基準を総合的に改善する。
VLM予測ガイダンスは、追加のユーザ入力なしでALIVE-Interactionスコアを0.95ポイント改善する。
関連論文リスト
- VOR-Bench: A Human Perception-Driven Benchmark for Video Object Removal [41.67024349583551]
VORベンチ(VOR Bench)を導入し、3つの統合コンポーネントによるVOR評価を向上する。
まず、VORデータセット(VORD)を、ペア化された編集ビデオと落書きマスクの両方を提供する最初のベンチマークデータセットとして提示する。
第2に、現実的なモーション対応Paired-Video Acquisition FrameworkであるrMPAFを開発する。
第3に,マスク誘導型VORに特化して設計されたVLMに基づく最初の知覚駆動型スコアリングモデルであるVOR-MDSMを紹介する。
論文 参考訳(メタデータ) (2026-09-15T09:08:00Z) - InterRVOS: Interaction-aware Referring Video Object Segmentation [44.55538737075162]
インタラクションのモデリングに焦点をあてた新しいタスクであるInterRVOS(Interaction-Aware Referring Video Object)を紹介する。
モデルはアクターとターゲットオブジェクトを別々に分割し、相互作用におけるそれらの非対称的な役割を反映する必要がある。
本稿では,127K以上のアノテート表現を持つ大規模データセットであるInterRVOS-127Kについて述べる。
論文 参考訳(メタデータ) (2025-06-03T01:16:13Z) - IAAO: Interactive Affordance Learning for Articulated Objects in 3D Environments [56.85804719947]
IAAOは知的エージェントのための明示的な3Dモデルを構築するフレームワークで,対話を通して環境内の明瞭な物体の理解を得る。
マスク特徴とビュー一貫性ラベルを多視点画像から抽出し,まず3次元ガウススティング(3DGS)を用いて各オブジェクト状態の階層的特徴とラベルフィールドを構築する。
次に、3Dガウスプリミティブ上でオブジェクトと部分レベルのクエリを実行し、静的および明瞭な要素を識別し、大域的な変換と局所的な調音パラメータをアベイランスとともに推定する。
論文 参考訳(メタデータ) (2025-04-09T12:36:48Z) - HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness [57.18183962641015]
本稿では,自己指導型ビデオ編集フレームワークHOI-Swapについて紹介する。
第1ステージでは、HOI認識を備えた単一フレームでのオブジェクトスワップに焦点を当てている。
第2ステージは、シーケンス全体にわたって単一フレームの編集を拡張する。
論文 参考訳(メタデータ) (2024-06-11T22:31:29Z) - Training-Free Robust Interactive Video Object Segmentation [82.05906654403684]
対話型ビデオオブジェクトセグメンテーション(I-PT)のためのトレーニングフリープロンプトトラッキングフレームワークを提案する。
スパースポイントとボックストラッキングを共同で採用し、不安定なポイントをフィルタリングし、オブジェクトワイズ情報をキャプチャします。
我々のフレームワークは、人気のあるVOSデータセット上で、ゼロショットビデオセグメンテーションの堅牢な結果を示してきた。
論文 参考訳(メタデータ) (2024-06-08T14:25:57Z) - Contrastive Transformation for Self-supervised Correspondence Learning [120.62547360463923]
野生のラベルのない動画を用いて,視覚的対応の自己監督学習について検討する。
本手法は,信頼性の高い対応推定のための映像内および映像間表現関連を同時に検討する。
我々のフレームワークは、近年の視覚的タスクにおける自己監督型対応手法よりも優れています。
論文 参考訳(メタデータ) (2020-12-09T14:05:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。