論文の概要: MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing
- arxiv url: http://arxiv.org/abs/2607.25300v1
- Date: Tue, 28 Jul 2026 05:24:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.719091
- Title: MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing
- Title(参考訳): MEDit-Bench: メッセージ駆動ナラティブビデオ編集を評価するデータセット
- Authors: Katsuya Ogata, Zongshang Pang, Mayu Otani, Yuta Nakashima,
- Abstract要約: 本稿では,メッセージ駆動のビデオ編集を評価するためのデータセットとベンチマークを提案する。
異なるメッセージが同じソースからかなり異なる編集をもたらすことが分かりました。
最先端のMLLMと強化された微調整ベースラインを用いた実験では、全てのモデルがより厳格な基準で人間に遅れることが示されている。
- 参考スコア(独自算出の注目度): 19.20156418373185
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video editing is fundamentally message-driven: even from the same source footage, the selected shots change depending on the narrative the editor wishes to convey. Benchmarks for a closely related task, video summarization, reduce editorial intent to a single, message-agnostic notion of saliency and thus do not account for this diversity. For evaluating message-driven video editing, we present \textbf{MEDit-Bench}, a dataset and benchmark, which pairs long-form videos with multiple editing messages and multiple professionally produced edits per message, demonstrating that different messages yield substantially different edits from the same source. We define an automatic evaluation protocol based on temporal alignment metrics, and find that an LLM-as-a-judge preference, a natural proxy for narrative quality, is unreliable for this task due to severe position bias. We additionally annotate each message with ambiguity and contextfulness scores, and show that both dimensions negatively correlate with model performance, establishing message difficulty as a meaningful stratification factor. Experiments with state-of-the-art MLLMs and reinforcement fine-tuned baselines show that while strong models approach human temporal alignment at lenient thresholds, all models fall behind humans at stricter criteria. A human perceptual study further confirms a large quality gap, with professional human edits remaining consistently preferred over model outputs.
- Abstract(参考訳): ビデオ編集は基本的にメッセージ駆動であり、同じソース映像からでも、選択されたショットは、編集者が伝えたい物語によって変化する。
密接な関連するタスクのベンチマーク、ビデオ要約、単一のメッセージに依存しないサリエンシの概念に対する編集意図の減少、したがってこの多様性を説明できない。
メッセージ駆動のビデオ編集を評価するために,複数の編集メッセージと複数のプロが作成した複数の編集とを組み合わせたデータセットとベンチマークである‘textbf{MEDit-Bench} を提示し,異なるメッセージが同一ソースから実質的に異なる編集を生成することを示した。
我々は,時間的アライメントの指標に基づいて自動評価プロトコルを定義し,物語品質の自然なプロキシであるLCM-as-a-judgeが,重度位置バイアスのため,このタスクには信頼できないことを発見した。
さらに、各メッセージにあいまいさとコンテキストフルネススコアを付加し、両次元がモデル性能と負の相関関係を示し、メッセージの難易度を有意義な成層化因子として確立する。
最先端のMLLMと強化された微調整ベースラインを用いた実験では、強いモデルは人間の時間的アライメントに高い閾値で近づくが、全てのモデルはより厳格な基準で人間に遅れる。
人間の知覚学的研究は、プロの人間の編集がモデル出力よりも一貫して好まれているため、大きな品質格差をさらに確認する。
関連論文リスト
- VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects [34.23919867305323]
VEFX-Datasetは5,049本の動画編集例を含む人称注釈付きデータセットである。
VEFX-Rewardはビデオ編集品質評価に特化した報酬モデルである。
VEFX-Benchは、編集システムの標準化比較のための300のキュレートされたビデオプロンプトペアのベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T17:28:24Z) - Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach [48.01137214342501]
テキスト誘導画像編集手法の体系的評価のためのベンチマークであるTIEditを紹介する。
信頼性の高い主観的評価を得るために、20人の専門家が採用され、307,200人の主観的評価が得られる。
さらに,隠蔽表現の中間層探索により編集品質を推定するLCMベースの評価器であるEditProbeを提案する。
論文 参考訳(メタデータ) (2026-03-20T09:05:10Z) - NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models [8.6767620170781]
ビデオ大言語モデル(ビデオLLM)は、最近、キャプション、要約、質問応答といったタスクにおいて、強力なパフォーマンスを実現している。
多くのモデルやトレーニング手法は、物語の一貫性を高めるためにイベント間の連続性を明示的に奨励する。
我々は、このバイアスを、物語を先に呼ぶ2つの誤りの鍵となる要因として挙げる:幻覚(幻覚)、非存在事象、または既存の事象が誤って解釈される場合、そして、事実事象が周囲の状況と不一致しているため抑制される場合である。
論文 参考訳(メタデータ) (2025-11-09T17:41:11Z) - Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models [51.67019924750931]
Video-LevelGaugeは、大規模ビデオ言語モデル(LVLM)における位置バイアスを評価するために設計されたベンチマークである。
我々は、標準化されたプローブとカスタマイズされたコンテキスト設定を採用し、コンテキスト長、プローブ位置、コンテキストタイプを柔軟に制御できる。
ベンチマークでは、複数のタイプにまたがる438の動画を手動でキュレートし、117の高品質なマルチチョイスの質問と120のオープンエンドの質問を得た。
論文 参考訳(メタデータ) (2025-08-27T07:58:16Z) - Multi-round, Chain-of-thought Post-editing for Unfaithful Summaries [10.712226955584798]
近年の大規模言語モデル (LLM) は、自然言語理解および生成タスクの実行において顕著な能力を示している。
ニュース要約における忠実度評価におけるLCMの使用について検討し,人的判断と強い相関関係が得られた。
我々は、生成した要約とソース・ニュース・ドキュメントの現実的矛盾を特定・修正するための様々なチェーン・オブ・シークレット・プロンプトを実験した。
論文 参考訳(メタデータ) (2025-01-20T04:55:43Z) - VE-Bench: Subjective-Aligned Benchmark Suite for Text-Driven Video Editing Quality Assessment [6.627422081288281]
本稿では,テキスト駆動ビデオ編集の評価に適したベンチマークスイートであるVE-Benchを紹介する。
このスイートには、ビデオ編集のためのビデオ品質アセスメント(VQA)データベースであるVE-Bench DBが含まれている。
VE-Bench QAは、テキストビデオアライメントと、ソースと編集されたビデオ間の関連モデリングに焦点を当てている。
論文 参考訳(メタデータ) (2024-08-21T09:49:32Z) - VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs [64.60035916955837]
VANE-Benchはビデオの異常や矛盾を検出するためのビデオLMMの熟練度を評価するために設計されたベンチマークである。
我々のデータセットは、既存の最先端のテキスト・ビデオ生成モデルを用いて合成された一連のビデオから構成される。
我々は、このベンチマークタスクにおいて、オープンソースとクローズドソースの両方で既存の9つのビデオLMMを評価し、ほとんどのモデルが微妙な異常を効果的に識別するのに困難に直面することを発見した。
論文 参考訳(メタデータ) (2024-06-14T17:59:01Z) - Models See Hallucinations: Evaluating the Factuality in Video Captioning [57.85548187177109]
ビデオキャプションにおける実感の人間による評価を行い、2つの注釈付き実感データセットを収集する。
モデル生成文の57.0%に事実誤りがあり、この分野では深刻な問題であることを示す。
本稿では,映像キャプションの事実性評価において,従来の指標より優れていたモデルベース事実性指標FactVCを提案する。
論文 参考訳(メタデータ) (2023-03-06T08:32:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。