論文の概要: Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
- arxiv url: http://arxiv.org/abs/2606.30599v2
- Date: Tue, 30 Jun 2026 16:06:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.737887
- Title: Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
- Title(参考訳): Goku: インストラクションベースのビデオ編集のための100万規模のユニバーサルデータセットとベンチマーク
- Abstract要約: 本稿では,200万の高品質な命令整列ビデオ編集ペアを特徴とする大規模データセットを提案する。
タスク境界を基本的な外観編集からマルチタスクや構造操作まで拡張したのは、これが初めてである。
包括的なビデオ編集ベンチマークであるGoku-Benchも提案されている。
- 参考スコア(独自算出の注目度): 25.928036537242917
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing instruction-based video editing datasets commonly focus on single-task appearance editing, failing to meet the complex creative demands of real-world scenarios. To bridge this gap, we present Goku, a large-scale dataset featuring 2 million high-quality, instruction-aligned video editing pairs, which is the first to extend task boundaries from basic appearance editing to multi-task and structural manipulations(e.g., precise control of subject movement). To tackle the data synthesis challenges inherent in these complex tasks, we design an efficient data synthesis pipeline that decomposes complex edits into controllable sub-problems and introduce a progressive filtering system for data reliability throughout the whole process. Furthermore, we explore the optimal network structures on Goku, and propose Goku-Edit. To deeply comprehend complex editing instructions, Goku-Edit leverages an MLLM as its text encoder and adopts a decoupled dual-branch design: a dedicated mask branch handles structural control, freeing the main branch for appearance rendering. A comprehensive video editing benchmark, Goku-Bench, is also proposed with 1,000 human-verified test cases and 7 novel editing-specific metrics. Evaluated on Goku-Bench, Goku-Edit obtains up to +8% improvement on other open-source models in terms of instruction following.
- Abstract(参考訳): 既存の命令ベースのビデオ編集データセットは、一般的にシングルタスクの外観編集に重点を置いており、現実のシナリオの複雑な創造的な要求を満たすことができない。
このギャップを埋めるために、Gokuは200万の高品質な命令整列ビデオ編集ペアを備えた大規模データセットで、基本的な外観編集からマルチタスク、構造操作(例えば、被験者の動きの正確な制御)までタスク境界を拡張する最初のものである。
これらの複雑なタスクに固有のデータ合成の課題に対処するために、複雑な編集を制御可能なサブプロブレムに分解する効率的なデータ合成パイプラインを設計し、プロセス全体を通してデータ信頼性のためのプログレッシブフィルタリングシステムを導入する。
さらに、Goku上での最適ネットワーク構造を探索し、Goku-Editを提案する。
複雑な編集命令を深く理解するために、Goku-EditはMLLMをテキストエンコーダとして利用し、分離されたデュアルブランチ設計を採用する。
包括的なビデオ編集ベンチマークであるGoku-Benchも提案されている。
Goku-Benchで評価すると、Goku-Editは他のオープンソースモデルよりも最大8%改善されている。
関連論文リスト
- VicEdit: Learning to Edit Videos from Visual In-Context Examples [122.14105395087746]
テキストによる指示からマルチモーダルな視覚誘導までの映像編集を高める新しいパラダイムであるVisual In-context Editingを提案する。
VicEdit-400Kは、ビジュアルなテキスト内ビデオ編集のための最初の大規模データセットである。
VicEditは、基本的な命令編集とビジュアル・イン・コンテクスト編集の両方で最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-08-17T15:55:40Z) - CoVEBench: Can Video Editing Models Handle Complex Instructions? [26.871333176496126]
CoVEBenchは、416のキュレートされたソースビデオ、626のマルチポイント編集命令、9,990のきめ細かいチェックリスト項目からなる合成ビデオ編集ベンチマークである。
MLLM-judged命令コンプライアンスとビデオ忠実度によるモデルの評価と、ビデオ品質の自動測定を行う。
論文 参考訳(メタデータ) (2026-06-07T02:29:41Z) - DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing [17.53577850169204]
ビデオマッシュアップ作成は、既存の映像を再構成して、魅力的なオーディオ視覚体験を作り出す複雑なビデオ編集パラダイムである。
マルチモーダルコヒーレンシー満足度問題(MMCSP)としてビデオマッシュアップ生成を定式化し,DIRECTフレームワークを提案する。
階層的なマルチエージェントフレームワークは,この課題を3つのカスケードレベルに分解する。ソースを意識したグローバルな構造アンカーのためのスクリーンライタ,適応的な編集意図とガイダンスをインスタンス化するディレクタ,微粒な最適化によるインテントガイド付きショットシーケンス編集のためのエディタ。
論文 参考訳(メタデータ) (2026-04-06T17:26:04Z) - Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance [55.32799307123252]
本稿では,既存のビデオ編集ペアを高忠実度トレーニング四重項に変換するスケーラブルなデータ生成パイプラインを提案する。
本稿では,学習可能なクエリと参照セマンティックガイダンスのための潜在視覚特徴を相乗化する統合編集アーキテクチャKiwi-Editを提案する。
論文 参考訳(メタデータ) (2026-03-02T18:46:28Z) - EasyV2V: A High-quality Instruction-based Video Editing Framework [108.78294392167017]
キャプションemphEasyV2Vは、命令ベースのビデオ編集のためのフレームワークである。
EasyV2Vは、例えば video+text、 video+mask+reference+、最先端のビデオ編集結果などの柔軟な入力で動作する。
論文 参考訳(メタデータ) (2025-12-18T18:59:57Z) - In-Context Learning with Unpaired Clips for Instruction-based Video Editing [51.943707933717185]
我々は、命令ベースのビデオ編集のための低コストの事前学習戦略を導入する。
本フレームワークは,まず約100万本のビデオクリップを事前学習し,基本的な編集概念を学習する。
本手法は命令アライメントと視覚的忠実度の両方において既存の命令ベースビデオ編集手法を超越する。
論文 参考訳(メタデータ) (2025-10-16T13:02:11Z) - CompBench: Benchmarking Complex Instruction-guided Image Editing [63.347846732450364]
CompBenchは複雑な命令誘導画像編集のための大規模なベンチマークである。
本稿では,タスクパイプラインを調整したMLLM-ヒューマン協調フレームワークを提案する。
編集意図を4つの重要な次元に分割する命令分離戦略を提案する。
論文 参考訳(メタデータ) (2025-05-18T02:30:52Z) - V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes [29.80140472486948]
V$2$Editは、インストラクション誘導ビデオと3Dシーン編集のためのトレーニング不要のフレームワークである。
複雑な編集タスクを単純なサブタスクに分解するプログレッシブ戦略を導入する。
V$2$Edit を "render-edit-reconstruct" プロセスで 3D シーン編集に拡張し,高品質な 3D 一貫性のある編集を可能にする。
論文 参考訳(メタデータ) (2025-03-13T17:59:55Z) - CCEdit: Creative and Controllable Video Editing via Diffusion Models [58.34886244442608]
CCEditは拡散モデルに基づく多用途な生成ビデオ編集フレームワークである。
我々のアプローチは、構造と外観制御を分離する新しいトリデントネットワーク構造を用いる。
ユーザスタディでは,CCEditと8つの最先端のビデオ編集手法を比較した。
論文 参考訳(メタデータ) (2023-09-28T15:03:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。