論文の概要: CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models
- arxiv url: http://arxiv.org/abs/2608.04302v1
- Date: Wed, 05 Aug 2026 00:20:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.66436
- Title: CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models
- Title(参考訳): CLIP-CC-Bench:ビデオ言語モデルにおけるパラグラフレベルビデオ記述の評価
- Authors: Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack,
- Abstract要約: CLIP-CC-Benchは5時間の映画コンテンツから構築した長文ビデオ記述のための評価スイートである。
評価スイートは、信頼性と単一モデルのバイアスを高めるために、5つの最先端の埋め込みモデルのアンサンブルを使用する。
このフレームワークを用いて、17の最先端ビデオ言語モデルを評価し、Borda集約ランキングとCLIP-CC-Benchの平均スコアの両方を報告する。
- 参考スコア(独自算出の注目度): 3.1498833540989413
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benchmarking video-language models has largely focused on short clips and single-sentence metrics, leaving open whether current systems can generate accurate long-form, paragraph-level descriptions. We introduce CLIP-CC-Bench, an evaluation suite for long-form video description built from 5 hours of movie content segmented into 90-second clips, each paired with an expert-written paragraph-style reference. The evaluation suite employs an ensemble of five state-of-the-art LLM-based embedding models to increase reliability and mitigate single-model bias, and applies two complementary methodologies: (i) coarse-grained semantic matching and (ii) fine-grained semantic matching to compare model-generated descriptions against CLIP-CC-Bench references. Using this framework, we evaluate 17 state-of-the-art video-language models and report both their Borda-aggregated rankings and their average scores on CLIP-CC-Bench. We further quantify the protocol's internal reliability through inter-judge agreement and bootstrap ranking stability. We release standardized evaluation scripts, model outputs, and aggregation tools at https://github.com/Multimodal-Intelligence-Lab/CLIP-CC-Bench to support reproducibility. CLIP-CC-Bench provides a practical evaluation framework for long-form video description, filling a gap left by existing short-clip and QA-only benchmarks.
- Abstract(参考訳): ビデオ言語モデルのベンチマークは、主にショートクリップとシングルセンスのメトリクスに焦点を当てており、現在のシステムが正確な長文、段落レベルの記述を生成できるかどうかを公開している。
CLIP-CC-Benchは5時間分の映画コンテンツを90秒のクリップに分割し,それぞれが専門家が作成した段落スタイルの参照と組み合わせた長文ビデオ記述のための評価スイートである。
評価スイートは、信頼性を高め、単一モデルバイアスを軽減するために、5つの最先端LCMベースの埋め込みモデルをアンサンブルし、2つの補完的方法論を適用している。
i)粗い粒度のセマンティックマッチングと
(II)CLIP-CC-Bench参照に対するモデル生成記述を比較するための微粒なセマンティックマッチング。
このフレームワークを用いて、17の最先端ビデオ言語モデルを評価し、Borda集約ランキングとCLIP-CC-Benchの平均スコアの両方を報告する。
プロトコルの内部信頼性をさらに定量化するためには、Judge間合意とブートストラップランキングの安定性について検討する。
我々は、再現性をサポートするために、標準化された評価スクリプト、モデル出力、集約ツールをhttps://github.com/Multimodal-Intelligence-Lab/CLIP-CC-Benchでリリースします。
CLIP-CC-Benchは、既存のショートクリップとQAのみのベンチマークで残されたギャップを埋める、長めのビデオ記述のための実践的な評価フレームワークを提供する。
関連論文リスト
- Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs [81.04673240949074]
強化学習は、大規模言語モデルの推論能力を改善した。
結果のみの報酬をビデオマルチモーダルな大規模言語モデルに適用することは、どの視覚的証拠が答えを支持するべきかを限定的なガイダンスを提供する。
本稿では,エビデンス対応ビデオ推論のための時間アノテーションフリープロセスレベル報酬フレームワークであるConsensus Frame GRPOを紹介する。
論文 参考訳(メタデータ) (2026-06-16T19:42:54Z) - UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs [19.634771714749544]
We present UniEditBench, a unified benchmark for image and video editing。
UniEditBenchは、共有プロトコルの下で再構成と命令駆動のメソッドをサポートする。
我々は,高容量MLLM判定器を軽量4B/8B評価器に蒸留し,ビデオの構造的忠実度,テキストアライメント,背景整合性,自然性,時間空間的一貫性を多次元的に評価する。
論文 参考訳(メタデータ) (2026-04-17T09:21:48Z) - LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization [20.692871849527815]
LongVPOは、視覚コンテキストモデルで、長いビデオアノテーションを使わずに、超長い動画を堅牢に理解することを可能にするフレームワークである。
合成サンプルは16Kで、人為的なラベルはないが、LongVPOは複数のロングビデオベンチマークで最先端のオープンソースモデルを上回っている。
論文 参考訳(メタデータ) (2026-02-02T17:03:37Z) - VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics [83.61875204972465]
ビデオ接続(Video Connecting)は,ビデオクリップの開始と終了の間にスムーズな中間映像コンテンツを生成するタスクである。
このギャップを埋めるため、私たちはビデオ接続に特化した新しいベンチマークであるVC-Benchを提案しました。
VC-Benchは、ビデオ品質スコアVQS、スタート-エンド一貫性スコアSECS、トランジッションスムースネススコアSSの3つの中核的な側面に焦点を当てている。
論文 参考訳(メタデータ) (2026-01-27T06:15:12Z) - SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding [56.78088668917983]
SVBenchは時間的マルチターン質問応答チェーンを用いた先駆的ベンチマークである。
半自動アノテーションパイプラインを設計し、49,979対のQA(QA)と1,353本のストリーミングビデオを取得する。
対話とストリーミング評価の14モデルから得られた実験結果から, クローズドソースのGPT-4oは他より優れているが, 大部分のオープンソースLVLMは, 長文のストリーミングビデオ理解に苦慮していることがわかった。
論文 参考訳(メタデータ) (2025-02-15T14:29:44Z) - CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval [24.203328970223527]
本稿では,詳細な動画キャプションと検索のためのベンチマークであるCaReBenchを紹介する。
同様に、ビデオごとに手動で分離された空間アノテーションと時間アノテーションを提供する。
この設計に基づいて、ビデオ検索とビデオキャプションタスクに特化して、ReBiasとCapSTという2つの評価指標を導入する。
論文 参考訳(メタデータ) (2024-12-31T15:53:50Z) - EvalCrafter: Benchmarking and Evaluating Large Video Generation Models [70.19437817951673]
これらのモデルはしばしば、マルチアスペクト能力を持つ非常に大きなデータセットで訓練されているので、単純な指標から大きな条件生成モデルを判断することは困難である、と我々は主張する。
我々のアプローチは、テキスト・ツー・ビデオ生成のための700のプロンプトの多種多様な包括的リストを作成することである。
そこで我々は、視覚的品質、コンテンツ品質、動作品質、テキスト・ビデオアライメントの観点から、慎重に設計されたベンチマークに基づいて、最先端のビデオ生成モデルを評価する。
論文 参考訳(メタデータ) (2023-10-17T17:50:46Z) - OnlineRefer: A Simple Online Baseline for Referring Video Object
Segmentation [75.07460026246582]
ビデオオブジェクトセグメンテーション(RVOS)は、人間の指示に従ってビデオ内のオブジェクトをセグメンテーションすることを目的としている。
現在の最先端のメソッドはオフラインパターンに陥り、各クリップが独立してテキスト埋め込みと相互作用する。
明示的なクエリ伝搬を用いたシンプルなオンラインモデルである OnlineRefer を提案する。
論文 参考訳(メタデータ) (2023-07-18T15:43:35Z) - A CLIP-Hitchhiker's Guide to Long Video Retrieval [84.36155238161462]
長いビデオ検索のための画像テキストモデルの適応性について検討する。
近年の研究では,CLIPを用いた映像検索における最先端性能が実証されている。
クエリスコーディングによるフレーム埋め込みの重み付き平均値の単純かつ効果的なベースラインは、大きな改善であることがわかった。
論文 参考訳(メタデータ) (2022-05-17T17:26:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。