論文の概要: Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
- arxiv url: http://arxiv.org/abs/2608.25529v1
- Date: Wed, 26 Aug 2026 08:35:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.687264
- Title: Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
- Title(参考訳): Video-IFBench: ビデオ理解シナリオにおけるマルチモーダルLLMの指示追従の評価
- Abstract要約: 本稿では,ビデオ理解における指示に従うためのベンチマークであるVideo-IFBenchを紹介する。
単一タスク,マルチタスク,選択,ネスト命令を含む4つのテンプレートを持つ命令分類法を開発した。
我々は,MLLM,プログラム処理,人体検証を組み合わせた半自動データ構築パイプラインを構築し,1.5Kのサンプルを得た。
- 参考スコア(独自算出の注目度): 61.926801508808616
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) have shown strong performance in video understanding. However, their ability to follow instructions in this domain remains under-explored. Real-world video understanding requires models not only to interpret video content correctly, but also to satisfy diverse user-specified constraints. Existing benchmarks focus primarily on task accuracy rather than instruction adherence, leaving this capability insufficiently evaluated. To address this gap, we introduce Video-IFBench, a comprehensive benchmark for evaluating instruction following in video understanding, where models must satisfy diverse user-specified constraints, including those grounded in visual and audio content. We develop an instruction taxonomy with four templates, including single-task, multi-task, selection, and nested instructions, covering 32 task types and 39 manually designed constraint categories spanning both semantic and format requirements. To reduce annotation cost, we build a semi-automatic data construction pipeline that combines MLLMs, programmatic processing, and human verification, resulting in 1.5K samples. We conduct a large-scale evaluation of more than 20 recent MLLMs and show that video instruction following remains challenging for current models, especially for instructions with many constraints, semantic constraints, or complex conditional structures that require selecting the correct branch or path based on video content. We hope our work will facilitate future research on instruction following in video understanding scenarios.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は,ビデオ理解において高い性能を示す。
しかし、この領域での指示に従う能力は未解明のままである。
実世界のビデオ理解には、ビデオコンテンツを正しく解釈するだけでなく、多様なユーザー指定制約を満たすためのモデルが必要である。
既存のベンチマークでは、命令の順守よりもタスクの正確性に重点を置いており、この能力は十分に評価されていない。
このギャップに対処するために、ビデオ理解における指示に従うための総合的なベンチマークであるVideo-IFBenchを導入する。
単一タスク,マルチタスク,選択,ネストした命令を含む4つのテンプレートを備えた命令分類法を開発し,32のタスクタイプと39の制約カテゴリを,意味的および形式的要件にまたがる手作業で設計した。
アノテーションコストを削減するため,MLLM,プログラム処理,人体検証を組み合わせた半自動データ構築パイプラインを構築し,1.5Kサンプルを得た。
本稿では,近年20以上のMLLMの大規模評価を行い,特に制約の多い命令,セマンティック制約,あるいはビデオコンテンツに基づいて正しい分岐やパスを選択する必要がある複雑な条件構造について,現状のモデルでは引き続きビデオ命令に従うことが課題であることを示す。
我々は,映像理解のシナリオにおける指導の今後の研究を促進することを願っている。
関連論文リスト
- How Far Are Video Models from True Multimodal Reasoning? [32.10821745418955]
CLVG-Benchは、ビデオモデルのゼロショット推論能力を調査するために設計された評価フレームワークである。
高品質で手動で注釈付けされたメタデータが6つのカテゴリと47のサブカテゴリにまたがっている。
最小限のアノテーションを用いて人間の専門家の認識と一致した適応的ビデオ評価器(AVE)を提案する。
論文 参考訳(メタデータ) (2026-04-21T08:04:02Z) - Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding [98.3098451637867]
Video-MME-v2は、ビデオ理解の堅牢性と忠実さを厳格に評価するために設計された総合的なベンチマークである。
データ品質を保証するため、Video-MME-v2は厳格に制御された人間のアノテーションパイプラインを通して構築される。
論文 参考訳(メタデータ) (2026-04-06T17:59:56Z) - IF-VidCap: Can Video Caption Models Follow Instructions? [44.2412700621584]
制御可能なビデオキャプションを評価するための新しいベンチマークであるIF-VidCapを紹介する。
IF-VidCapには、フォーマットの正しさとコンテンツの正しさの2つの側面でキャプションを評価する、体系的なフレームワークが組み込まれている。
論文 参考訳(メタデータ) (2025-10-21T15:25:08Z) - CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval [24.203328970223527]
本稿では,詳細な動画キャプションと検索のためのベンチマークであるCaReBenchを紹介する。
同様に、ビデオごとに手動で分離された空間アノテーションと時間アノテーションを提供する。
この設計に基づいて、ビデオ検索とビデオキャプションタスクに特化して、ReBiasとCapSTという2つの評価指標を導入する。
論文 参考訳(メタデータ) (2024-12-31T15:53:50Z) - Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs [20.168429351519055]
ビデオ理解はマルチモーダル大言語モデル(LMLM)にとって重要な次のステップである
合成ビデオ生成によるベンチマーク構築フレームワークであるVideoNIAH(Video Needle In A Haystack)を提案する。
我々は、プロプライエタリモデルとオープンソースモデルの両方を包括的に評価し、ビデオ理解能力の重大な違いを明らかにする。
論文 参考訳(メタデータ) (2024-06-13T17:50:05Z) - Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning [102.54669633984278]
本稿では,微細な時間的理解作業を実現するためのビデオLLMであるMomentorを提案する。
Moment-10MでMomentorをトレーニングし、セグメントレベルの推論とローカライゼーションを可能にします。
論文 参考訳(メタデータ) (2024-02-18T03:04:38Z) - MVBench: A Comprehensive Multi-modal Video Understanding Benchmark [63.14000659130736]
本稿では、MVBenchという総合的なマルチモーダルビデオ理解ベンチマークを紹介する。
まず、これらの時間的タスクを定義するための新しい静的-動的手法を提案する。
そして,タスク定義に従って,公開ビデオアノテーションを複数選択QAに自動的に変換し,各タスクを評価する。
論文 参考訳(メタデータ) (2023-11-28T17:59:04Z) - VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools [44.78291853329394]
textbfVidCoMは、Large Language Models (LLM)を活用して、軽量なビジュアルツールを使用して動画を推論する高速適応フレームワークである。
InsOVERアルゴリズムは、言語命令の分解とビデオイベントの間の効率的なハンガリー語マッチングに基づいて、対応するビデオイベントを特定する。
論文 参考訳(メタデータ) (2023-10-16T17:05:56Z) - LAVENDER: Unifying Video-Language Understanding as Masked Language
Modeling [102.42424022921243]
Masked Language Modeling (MLM) は、すべての事前学習および下流タスクの共通インターフェースとして使用される。
実験により、この統合フレームワークは14のVidLベンチマークで競合性能を達成することが示された。
論文 参考訳(メタデータ) (2022-06-14T20:43:25Z) - Video Understanding as Machine Translation [53.59298393079866]
我々は、単一の統合フレームワークを用いて、様々なダウンストリームビデオ理解タスクに取り組む。
映像分類(EPIC-Kitchens)、質問応答(TVQA)、キャプション(TVC, YouCook2, MSR-VTT)など、いくつかのダウンストリームタスクにおいて、現状よりもパフォーマンスの向上が報告されている。
論文 参考訳(メタデータ) (2020-06-12T14:07:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。