Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
Abstractの概要
Video-IFBenchは、単なる回答の正確性を測定するだけでなく、動画理解環境においてマルチモーダル大規模言語モデル(MLLM)がどれだけ適切に指示に従えるかを評価するために設計されたベンチマークです。本ベンチマークは、タスク構成や条件の複雑さの異なるレベルを網羅するため、単一タスク、マルチタスク、選択、ネスト構造という4つの指示テンプレートを採用しています。意味的制約とフォーマット制約の両方を含む32種類のタスクタイプと39種類の応答制約カテゴリにまたがり、MLLMによる抽出、プログラム処理、人間による検証を組み合わせた半自動パイプラインによって構築されています。最終的なベンチマークには、多様な領域にわたる700本以上の公開動画から抽出された1,500件のサンプルが含まれており、LLM-as-Judgeと決定論的検証を組み合わせたハイブリッドプロトコルによって評価されます。
新規性
本研究の主な新規性は、従来の動画ベンチマークやマルチモーダル指示追従ベンチマークでは体系的に評価されてこなかった、動画理解における指示追従能力に特化したベンチマークを導入した点にあります。また、複雑な条件付き指示構造を動画に根ざした意味的制約やハイブリッド評価パイプラインと統合している点も特徴的です。
成果
20以上の最新MLLMを対象とした評価において、現在のシステムにとって動画における指示追従は依然として困難であることが判明しました。全体で最も強力なモデルであるGemini-3-ProはTCSR 76.5およびTISR 54.5を達成し、最良のオープンソースモデルであるQwen3.5-397B-A17B-ThinkはTCSR 69.6およびTISR 46.1を達成しました。制約が多い指示、意味的制約、より深いネスト構造、選択タスクにおけるより多くの候補分岐が存在する場合に、性能が著しく低下します。
論文の注目点
- Video-IFBenchは、単一・マルチ・選択・ネストという4つのテンプレートを用いて、動画理解における指示への忠実性を対象としています。
- 本ベンチマークには、700本以上の動画から得られた人間検証済みの1,500サンプルが含まれ、意味的要件およびフォーマット要件にまたがる32のタスクタイプと39の制約カテゴリを網羅しています。
- 実証的分析により、現在のMLLMは制約が多い指示や条件依存の指示において特に脆弱であり、高い動画理解精度が必ずしも忠実な指示追従を保証するわけではないことが示されています。
参考リンク
- arXiv: https://arxiv.org/abs/2608.25529v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2608.25529v1
- Hugging Face Papers: https://huggingface.co/papers/2608.25529
- Project: https://alexios-hub.github.io/Video-IFBench/