論文の概要: VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning
- arxiv url: http://arxiv.org/abs/2604.03701v1
- Date: Sat, 04 Apr 2026 12:10:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.730234
- Title: VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning
- Title(参考訳): VidNum-1.4K:ビデオベース数値推論のための総合ベンチマーク
- Authors: Shaoyang Cui, Lingbei Meng,
- Abstract要約: ビデオベースの数値推論は、ビジョン・ランゲージ・モデル(VLM)が真に現実世界の力学を「理解」しているかどうかをテストするための最前線である。
我々は1,379人の厳密な人間によるビデオ検索ペアからなる総合的なビデオQAベンチマークであるVidNum-1.4Kを紹介した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video-based numerical reasoning provides a premier arena for testing whether Vision-Language Models (VLMs) truly "understand" real-world dynamics, as accurate numerical deduction necessitates a profound grasp of temporal events, object permanence, and compositional logic beyond superficial pattern matching. However, existing benchmarks are often confined to narrow domains, such as repetitive athletic motions, or treat simple counting merely as a superficial regression task, failing to assess multi-step numerical logic within the inherent complexity of real-world multimedia content. We introduce VidNum-1.4K, a comprehensive VideoQA benchmark comprising 1,379 strictly human-annotated video-question pairs designed to evaluate genuine numerical reasoning across highly diverse environments, encompassing object, action, and event quantification. The VidNum-1.4K is uniquely structured into a three-level hierarchy that evolves from direct visual perception to video-based compositional numerical reasoning, requiring models to perform arithmetic operations, comparisons, and logical deductions grounded in temporal evidence. Our evaluations across a diverse suite of state-of-the-art VLMs reveal a striking reasoning gap: while the Gemini-3.1-pro barely reaches a 60% accuracy threshold, representative open-source families struggle heavily in the 25%--45% range. These findings demonstrate that current VLMs still lack a stable "internal world model", positioning VidNum-1.4K as a demanding diagnostic testbed for the next generation of numerical video intelligence.
- Abstract(参考訳): ビデオベースの数値推論は、視覚言語モデル(VLM)が実世界の力学を真に「理解」しているかをテストするための第一の場を提供する。
しかし、既存のベンチマークは、繰り返しの運動運動のような狭い領域に限定されたり、単に表面回帰タスクとして単純なカウントを扱い、実世界のマルチメディアコンテンツの本質的な複雑さの中で、多段階の数値論理を評価できない場合が多い。
オブジェクト,アクション,イベント定量化を含む多種多様な環境における真の数値推論を評価するために設計された1,379の厳密な人間アノテーション付きビデオ検索ペアからなる総合的ビデオQAベンチマークであるVidNum-1.4Kを紹介した。
VidNum-1.4Kは、直接視覚認識からビデオベースの構成的数値推論へと進化し、時間的エビデンスに基づく算術演算、比較、論理的推論を行う必要がある。
Gemini-3.1-proは60%の精度のしきい値にしか達しませんが、オープンソースの代表的家族は25%から45%の範囲で苦戦しています。
これらの結果は、現在のVLMにはまだ安定した「内部世界モデル」が欠如していることを示し、VidNum-1.4Kは次世代の数値ビデオインテリジェンスに必要な診断テストベッドとして位置づけられている。
関連論文リスト
- PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning [63.52215283384644]
本稿では,知覚中心のビデオ推論のベンチマークであるPerceptionCompを紹介する。
ベンチマークには、さまざまなドメインの279のビデオに関する1,114の非常に複雑な質問が含まれている。
人間の研究によると、PerceptionCompは、かなりのテスト時間思考と繰り返し知覚ステップを必要とする。
論文 参考訳(メタデータ) (2026-03-27T17:54:36Z) - CVBench: Evaluating Cross-Video Synergies for Complex Multimodal Understanding and Reasoning [11.478276629279526]
CVBenchは,ビデオ間のリレーショナル推論を厳格に評価するために設計された,最初の総合的なベンチマークである。
CVBenchは、クロスビデオオブジェクトアソシエーション、クロスビデオイベントアソシエーション、クロスビデオ複合推論の3層にまたがる1000の質問応答ペアで構成されている。
5つのドメインの異なるビデオクラスタから構築されたこのベンチマークは、ダイナミックな視覚的コンテキストにまたがる情報を合成するモデルに挑戦する。
論文 参考訳(メタデータ) (2025-08-27T03:29:35Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning [54.47710436807661]
MORSE-500(MORSE-500)は、6つの補足的推論カテゴリにまたがる500の完全スクリプト化されたクリップを埋め込んだビデオベンチマークである。
各インスタンスは、決定論的Pythonスクリプト(Manim、Matplotlib、MoviePy)、生成ビデオモデル、実際の映像を使用して生成される。
一度飽和すると時代遅れになる静的ベンチマークとは異なり、MORSE-500は進化するために構築されている。
論文 参考訳(メタデータ) (2025-06-05T19:12:45Z) - TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models [75.42002690128486]
TemporalBenchは、ビデオの微細な時間的理解を評価するための新しいベンチマークだ。
ビデオクリップの時間的ダイナミクスを詳述した2Kの高品質な人間のアノテーションから派生した10KのビデオQ&Aペアで構成されている。
GPT-4oのような最先端のモデルは、TemporalBench上で38.5%の質問応答精度しか達成していない。
論文 参考訳(メタデータ) (2024-10-14T17:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。