論文の概要: MVVBench: Benchmarking 4D Reasoning in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.30952v1
- Date: Fri, 25 Sep 2026 08:02:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.286334
- Title: MVVBench: Benchmarking 4D Reasoning in Vision-Language Models
- Title(参考訳): MVVBench:ビジョンランゲージモデルにおける4D推論のベンチマーク
- Abstract要約: MVVBenchは、実世界のマルチカメラデータセットから構築されたマルチビュービデオ推論のベンチマークである。
それぞれの質問は、指定された入力セットの任意の単一ビューから答えられず、大多数は、任意の単一モーメントからさらに答えられません。
MVVBenchは様々なダイナミックシーンにまたがり、暗黙の/明示的な識別、暗黙の/明示的な相対距離、相対的なカメラポーズ、作曲の計数という6つの能力を探索する。
- 参考スコア(独自算出の注目度): 34.87357755391106
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multi-view video understanding requires integrating spatial and temporal evidence across multiple, often non-overlapping camera streams: tracking entities as they transition between viewpoints, aligning events across time, and reasoning about latent 4D continuity rather than any single visible frame. We introduce MVVBench, a benchmark for multi-view video reasoning built from real world multi camera datasets. Questions are curated to be monocular-ambiguous along both the view and the temporal axis: each question is unanswerable from any single view in the designated input set, and the majority are further unanswerable from any single moment. Each question becomes uniquely solvable only by jointly reasoning across views and across time. MVVBench spans diverse dynamic scenes and probes six capabilities: implicit/explicit attribute identification, implicit/explicit relative distance, relative camera pose, and compositional counting, with human-authored QA and rigorous verification. Beyond benchmarking, we provide an extensive analysis of when and why current vision language models succeed or fail, characterizing errors due to temporal mis-localization, cross-view identity breaks, and brittle multi-hop reasoning. We then study inference-time elicitation strategies that unlock latent multi-view competence---task-specific chain-of-thought scaffolds and structured cross-view evidence aggregation---yielding substantial gains without retraining. Finally, we present preliminary evidence that reinforcement learning with verifiable rewards can elicit some latent multi-view competence in the base model, pointing to training-time approaches as a promising direction for future work. Together, MVVBench offers a rigorous evaluation of 4D multi-view reasoning and a foundation for future progress toward reliable embodied perception.
- Abstract(参考訳): 多視点ビデオ理解には、複数の、しばしば重複しないカメラストリームに空間的および時間的証拠を統合する必要がある。
実世界のマルチカメラデータセットから構築したマルチビュービデオ推論のベンチマークであるMVVBenchを紹介する。
質問は、ビューと時間軸の両方に沿って単分子的曖昧であるようにキュレートされる:各質問は指定された入力セットの任意の単一ビューからは解決不可能であり、大多数は任意の単一モーメントからさらに解決不能である。
それぞれの質問は、ビューと時間にまたがる共同推論によってのみ、一意に解決できるようになります。
MVVBenchは、様々な動的なシーンにまたがり、暗黙的/明示的属性識別、暗示的/明示的相対距離、相対カメラポーズ、構成的数え上げという6つの機能、人間によるQAと厳密な検証の6つを探索する。
ベンチマークの他に、現在のビジョン言語モデルがいつ、なぜ成功したか、なぜ失敗したのかを広範囲に分析し、時間的ミスローカライゼーション、クロスビューアイデンティティーのブレーク、不安定なマルチホップ推論によるエラーを特徴付ける。
次に、潜在多視点能力の解き放つ推論時推論戦略、すなわち、タスク固有のチェーン・オブ・シンク足場と、構造化されたクロスビューエビデンス(アグリゲーション)について検討する。
最後に、検証可能な報酬を伴う強化学習がベースモデルに潜伏する多視点能力を引き出すことができるという予備的証拠を提示する。
MVVBenchは、4次元多視点推論の厳密な評価と、信頼性のある具体的知覚に向けた将来の進歩の基礎を提供する。
関連論文リスト
- CrossModalQA: A Cross-modal and Multi-hop Benchmark for Multimodal Retrieval-augmented Generation [15.857678905969273]
CrossModalQAは、異種コーパス上のマルチモーダル検索と推論を評価するためのオープンドメインベンチマークである。
視覚からテキストへの道、テキストからテキストへの道、視覚からテキストへの道、複数画像の交叉、画像集合の推論の5つの相補的推論経路を網羅している。
論文 参考訳(メタデータ) (2026-08-31T16:00:59Z) - Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events [52.031070006859544]
ビデオマルチモーダル大言語モデル(MLLM)は、一般的なビデオ理解と長大なビデオ理解を急速に進歩させてきたが、短い回答クリティカルな視覚的証拠を保存できる能力はいまだに未発見のままである。
本稿では,映像MLLMの時間的忠実度を時間的視覚的事象理解によって診断するためのベンチマークであるMoment-Videoを紹介する。
論文 参考訳(メタデータ) (2026-06-01T17:32:20Z) - A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding [69.31609753061137]
マルチモーダルな大規模言語モデルはシングルビデオ理解において高いパフォーマンスを達成しているが、複数のビデオにまたがる推論能力は依然として限られている。
既存のアプローチでは、複数のビデオを1つの入力にまとめて直接推論を行い、トレーニングと推論のミスマッチを導入する。
現在のマルチビデオベンチマークでは、主にイベントレベルの比較を強調しており、アイデンティティレベルのマッチング、きめ細かい識別、構造化されたマルチステップ推論が過小評価されている。
視覚ツール,タスク固有のスキル,コンフリクト対応検証機構を統合した,多視点理解のためのスキル強化型エージェントフレームワークSAMAを提案する。
論文 参考訳(メタデータ) (2026-03-16T02:09:48Z) - Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning [18.15310805625469]
マルチモーダルビデオ言語モデル(Video-LMs)を評価するための新しいベンチマークであるKnow-Showを提案する。
Know-Showは、空間的(人、物、人、物)と時間的次元の5つのシナリオからなる単一の評価枠組み内での推論と局所化を統一する。
Charades、Action Genome、Ego4Dから2.5万の人間の言語質問で作られたこのベンチマークは、現在のビデオ-LMと人間の推論の間に大きなギャップを露呈している。
このギャップを埋めるために、我々は、きめ細かい接地でビデオ-LMを増強するトレーニング不要なプラグインであるGRAMを提案する。
論文 参考訳(メタデータ) (2025-12-05T08:15:49Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models [55.48403691519395]
トマト(Tomato)は、ビデオ理解におけるMFMの時間的推論能力を厳格に評価するための新しいベンチマークである。
TOMATOは、6つのタスクにまたがる1,484件の注意深いキュレーションと人間による注釈付き質問で構成されている。
総合評価の結果, 人体モデルの性能差は57.3%であり, 最良性能モデルでは57.3%であった。
論文 参考訳(メタデータ) (2024-10-30T17:50:23Z) - MERLOT: Multimodal Neural Script Knowledge Models [74.05631672657452]
我々はMERLOTを紹介した。MERLOTは、翻訳された音声で何百万ものYouTubeビデオを視聴することで、マルチモーダルなスクリプト知識を学習するモデルである。
MERLOTは、時間的コモンセンスの強力なアウトオブボックス表現を示し、12の異なるビデオQAデータセット上で最先端のパフォーマンスを達成する。
Visual Commonsense Reasoning では、MERLOT が80.6%の精度で正解し、同じ大きさの最先端のモデルを3%以上上回っている。
論文 参考訳(メタデータ) (2021-06-04T17:57:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。