論文の概要: OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing
- arxiv url: http://arxiv.org/abs/2608.05049v1
- Date: Wed, 05 Aug 2026 16:58:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.018687
- Title: OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing
- Title(参考訳): OmniEdit-Bench: インストラクションベースのビデオ編集のための総合ベンチマーク
- Authors: Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao,
- Abstract要約: 命令ベースのビデオ編集(IVE)のための包括的かつ構造化されたベンチマークを導入する。
本ベンチマークでは,編集タスクを空間,時間,音声,参照ベースの編集など,複数のビデオ特化次元に分解する。
本研究では,4つの相補的な次元(精度,保存性,リアリズム,一貫性)から編集品質を評価する評価フレームワークを提案する。
- 参考スコア(独自算出の注目度): 53.21868575804758
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Instruction-based video editing (IVE) is an emerging field with broad applications, yet evaluating editing models remains challenging. Existing benchmarks suffer from two major limitations: limited task coverage inherited from image editing, which overlooks video-specific dimensions, and inadequate metrics that fail to measure instruction fidelity, allowing incorrect edits to receive high scores due to strong visual priors from the original video. To address these issues, we introduce a comprehensive and structured benchmark for IVE. Our benchmark decomposes editing tasks into multiple video-specific dimensions, including spatial, temporal, audio, and reference-based editing, extending beyond conventional frame-level evaluation. It also distinguishes explicit and implicit instructions and incorporates reasoning-based scenarios to better reflect real-world requirements. Furthermore, we propose an evaluation framework that assesses editing quality from four complementary dimensions: accuracy, preservation, realism, and consistency, using both human judgments and state-of-the-art vision-language models. To emphasize instruction fidelity, we introduce an accuracy-aware penalty mechanism that conditions other scores on accuracy, preventing visually plausible but incorrect edits from receiving inflated evaluations. Extensive experiments on representative open-source and commercial models show that current IVE models remain far from satisfactory. OmniEdit-Bench provides a comprehensive and reliable testbed for evaluating instruction-based video editing and offers insights into future research directions.
- Abstract(参考訳): インストラクションベースのビデオ編集(IVE)は、幅広いアプリケーションを持つ新興分野であるが、編集モデルの評価は依然として難しい。
既存のベンチマークには2つの大きな制限がある: 画像編集から受け継いだ限られたタスクカバレッジは、ビデオ特有の次元を見落としている。
これらの問題に対処するために、IVEの総合的かつ構造化されたベンチマークを導入する。
本ベンチマークでは,従来のフレームレベルの評価を超えて,空間的,時間的,音声的,参照に基づく編集を含む,複数のビデオ特化次元に編集タスクを分解する。
また、明示的で暗黙的な指示を区別し、推論に基づくシナリオを組み込んで現実世界の要求をよりよく反映する。
さらに、人間の判断と最先端の視覚言語モデルの両方を用いて、精度、保存性、リアリズム、一貫性の4つの相補的な次元から編集品質を評価する評価フレームワークを提案する。
命令の忠実さを強調するために,他のスコアを精度で条件付けし,視認性が高いが不正な編集が膨らませられた評価を受けるのを防止できる精度対応のペナルティ機構を導入する。
代表的なオープンソースおよび商用モデルに関する大規模な実験は、現在のIVEモデルは満足できないままであることを示している。
OmniEdit-Benchは、命令ベースのビデオ編集を評価するための包括的で信頼性の高いテストベッドを提供し、将来の研究方向性に関する洞察を提供する。
関連論文リスト
- VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects [34.23919867305323]
VEFX-Datasetは5,049本の動画編集例を含む人称注釈付きデータセットである。
VEFX-Rewardはビデオ編集品質評価に特化した報酬モデルである。
VEFX-Benchは、編集システムの標準化比較のための300のキュレートされたビデオプロンプトペアのベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T17:28:24Z) - GEditBench v2: A Human-Aligned Benchmark for General Image Editing [58.86807672117726]
GEditBench v2は、23のタスクにまたがる1200の現実世界のユーザクエリを備えた包括的なベンチマークである。
また、視覚的整合性を評価するためのオープンソースのペアワイドアセスメントモデルであるPVC-Judgeを提案する。
PVC-Judgeは、オープンソースモデルの最先端評価性能を達成し、平均してGPT-5.1を超えている。
論文 参考訳(メタデータ) (2026-03-30T15:08:32Z) - CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning [98.98349220451216]
CoEditor++は、編集を"編集する方法"と"編集方法"に分解する、トレーニング不要のフレームワークである。
我々は,CoEditor++が編集タスクと編集タスクの両方において,最先端のパフォーマンスを実現することを示す。
以上の結果から,認知中心型画像編集の可能性が示唆された。
論文 参考訳(メタデータ) (2026-01-31T12:20:46Z) - ReViSE: Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning [57.08352504712699]
ビデオ統合モデルは、理解と生成において強力な能力を示すが、理性に富んだビジュアル編集に苦慮している。
本稿では,Reason-Informed Video Editing (RVE)タスクを紹介する。
一つのアーキテクチャ内で生成と評価を統一するフレームワークであるReViSEを提案する。
論文 参考訳(メタデータ) (2025-12-10T18:57:09Z) - IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment [108.8652018167452]
IVEBenchは、命令誘導ビデオ編集アセスメント用に特別に設計されたベンチマークスイートである。
様々な600の高品質なソースビデオのデータベースからなり、7つのセマンティックディメンションにまたがり、32フレームから1,024フレームの動画をカバーしている。
IVEBenchは、映像品質、命令順守、映像忠実度を含む3次元評価プロトコルを確立する。
論文 参考訳(メタデータ) (2025-10-13T17:27:08Z) - EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing Models [16.045012576543474]
テキストベースのビデオ編集は有望な分野として現れ、テキストプロンプトに基づいたビデオの正確な修正を可能にしている。
既存の評価は限定的で一貫性がなく、通常、全体的なパフォーマンスを単一のスコアで要約する。
テキストベースのビデオ編集モデルの総合評価ベンチマークであるEditBoardを提案する。
論文 参考訳(メタデータ) (2024-09-15T08:43:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。