論文の概要: Aurora: Unified Video Editing with a Tool-Using Agent
- arxiv url: http://arxiv.org/abs/2605.18748v1
- Date: Mon, 18 May 2026 17:59:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:50.230736
- Title: Aurora: Unified Video Editing with a Tool-Using Agent
- Title(参考訳): Aurora:ツール使用エージェントによる統一ビデオ編集
- Authors: Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo,
- Abstract要約: 本稿では,ツール拡張視覚言語モデル(VLM)エージェントであるAuroraについて紹介する。
我々は、VLMエージェントを教師付きデータで訓練し、完全な編集計画と参照画像の選択を行う。
AgentEdit-Benchと既存の2つのビデオ編集ベンチマークの実験は、Auroraが命令のみのベースラインよりも改善していることを示している。
- 参考スコア(独自算出の注目度): 43.67920764931069
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent video editing models have converged on a unified conditioning design: a single diffusion transformer jointly consumes text, source video, and reference images, and one set of weights covers replacement, removal, style transfer, and reference-driven insertion. The design is flexible, but it assumes that the user already provides model-ready text, reference images, and spatial grounding for local edits, which real requests often omit. We present Aurora, an agentic video editing framework that pairs a tool-augmented vision-language model (VLM) agent with a unified video diffusion transformer. The VLM agent maps a raw user request to a structured edit plan aligned with the transformer's conditioning channels, thereby resolving textual and visual underspecification before generation. We train the VLM agent with supervised data for complete edit planning and reference-image selection, together with preference pairs for robust tool use and instruction refinement. We introduce AgentEdit-Bench to evaluate agent-enhanced video editing under textual and visual underspecification. Experiments on AgentEdit-Bench and two existing video editing benchmarks show that Aurora improves over instruction-only baselines and that the VLM agent transfers to compatible frozen video editing models. Project page: https://yeates.github.io/Aurora-Page
- Abstract(参考訳): 最近のビデオ編集モデルは統一された条件付け設計に集約されており、単一の拡散変換器はテキスト、ソースビデオ、参照イメージを共同で消費し、1組の重みは置換、除去、スタイル転送、参照駆動挿入をカバーしている。
設計は柔軟だが、ユーザーが既にローカル編集のためにモデル対応のテキスト、参照画像、空間的グラウンドを提供すると仮定している。
本稿では,ツール拡張視覚言語モデル(VLM)エージェントと統合ビデオ拡散変換器を組み合わせたエージェントビデオ編集フレームワークであるAuroraを紹介する。
VLMエージェントは、生のユーザ要求をトランスフォーマーのコンディショニングチャネルに整合した構造化された編集計画にマッピングすることにより、生成前のテキストおよび視覚的不特定を解消する。
我々は、VLMエージェントに、完全な編集計画と参照イメージ選択のための教師付きデータと、堅牢なツールの使用と命令修正のための好みペアをトレーニングする。
我々は,テキストおよび視覚的不特定の下でのエージェント強化ビデオ編集を評価するために,AgentEdit-Benchを導入した。
AgentEdit-Benchと既存の2つのビデオ編集ベンチマークの実験では、Auroraは命令のみのベースラインよりも改善され、VLMエージェントは互換性のあるフリーズビデオ編集モデルに転送される。
プロジェクトページ: https://yeates.github.io/Aurora-Page
関連論文リスト
- EasyV2V: A High-quality Instruction-based Video Editing Framework [108.78294392167017]
キャプションemphEasyV2Vは、命令ベースのビデオ編集のためのフレームワークである。
EasyV2Vは、例えば video+text、 video+mask+reference+、最先端のビデオ編集結果などの柔軟な入力で動作する。
論文 参考訳(メタデータ) (2025-12-18T18:59:57Z) - EditDuet: A Multi-Agent System for Video Non-Linear Editing [24.334561615501105]
本稿では,映像編集のコアタスクを自動化し,シーケンシャルな意思決定プロセスとして定式化することを提案する。
エディターは、自然言語の指示とともにビデオクリップのコレクションを入力とし、ビデオ編集ソフトウェアで一般的に見られるツールを使用して、編集されたシーケンスを生成する。
提案システムでは,ユーザスタディを通じて質的,定量的に映像シーケンスを出力し,カバー範囲,時間制約満足度,人的嗜好の面で既存手法を著しく上回る結果を得た。
論文 参考訳(メタデータ) (2025-09-13T00:27:02Z) - LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning [8.077442711429317]
第一フレーム制御は第一フレームの制御を提供するが、その後のフレームの柔軟性には欠ける。
フレキシブルなビデオ編集のための2Vモデルに適応するマスクベースのLoRA(Low-Rank Adaptation)手法を提案する。
実験結果から,本手法はベースライン法よりも優れた映像編集性能が得られることがわかった。
論文 参考訳(メタデータ) (2025-06-11T18:03:55Z) - VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation [70.87745520234012]
本稿では,VEGGIEを紹介する。VEGGIEは,多様なユーザインストラクションに基づいて,ビデオコンセプトの編集,グラウンド化,推論を統一する,シンプルなエンドツーエンドフレームワークである。
VEGGIEは、異なる編集スキルを持つ指導ビデオ編集において高い性能を示し、汎用モデルとして最高の指導ベースラインを達成している。
論文 参考訳(メタデータ) (2025-03-18T15:31:12Z) - A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model [10.736207095604414]
まず、シーン固有の特徴を抽出する以前の作品とは異なり、事前学習された視覚言語モデル(VLM)を活用する。
また,RLをベースとした編集フレームワークを提案し,編集問題を定式化し,仮想エディタを訓練し,より優れた編集判断を行う。
論文 参考訳(メタデータ) (2024-11-07T18:20:28Z) - MotionEditor: Editing Video Motion via Content-Aware Diffusion [96.825431998349]
MotionEditorはビデオモーション編集のための拡散モデルである。
新たなコンテンツ対応モーションアダプタをControlNetに組み込んで、時間的モーション対応をキャプチャする。
論文 参考訳(メタデータ) (2023-11-30T18:59:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。