論文の概要: ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?
- arxiv url: http://arxiv.org/abs/2607.20868v1
- Date: Thu, 23 Jul 2026 02:49:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.266057
- Title: ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?
- Title(参考訳): ViSTR-Bench: MLLMは動的シーンで連続的な視覚的キューから推論できるか?
- Abstract要約: ViSTR-Benchは、MLLMが動的シーンにおける連続的な視覚的手がかりから質的推論を行うことができるかどうかを体系的に評価するために設計された評価スイートである。
ベンチマークは15の異なるサブタスクと、さまざまなテーブルトップ、屋内、屋外のシナリオにまたがる高品質のビデオ質問応答ペアで構成されている。
- 参考スコア(独自算出の注目度): 43.007245223642606
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have achieved remarkable success across diverse expert-level tasks, but they still struggle with fundamental abilities that humans naturally develop through continuous observation of the real world, such as spatial perception and dynamic reasoning. Recent studies have recognized this gap and introduced dedicated benchmarks to evaluate the spatial-temporal capabilities of MLLMs. However, existing benchmarks mostly focus on static scenes or require exact quantitative predictions, leaving intuitive reasoning from temporal cues largely underexplored. In this paper, we introduce the Visual Spatial-Temporal Reasoning Benchmark (ViSTR-Bench), a novel evaluation suite designed to systematically assess whether MLLMs can perform qualitative reasoning from continuous visual cues in dynamic scenes. Guided by the principles of temporal emphasis, reasoning orientation, and qualitative evaluation, ViSTR-Bench establishes a comprehensive four-dimensional evaluations covering Motion Perception, Spatial Relations, Outcome Prediction, and Physical Dynamics. The benchmark comprises 15 distinct subtasks and 1,340 high-quality video question-answer pairs spanning diverse tabletop, indoor, and outdoor scenarios. Extensive evaluations of a broad spectrum of state-of-the-art proprietary, open-source, and specialized spatial MLLMs reveal that, despite their strong general video understanding capabilities, current models still face substantial bottlenecks in complex spatial-temporal reasoning and remain far below human performance.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、様々な専門家レベルのタスクにおいて顕著な成功を収めてきたが、空間認識や動的推論といった現実世界の継続的な観察を通じて人間が自然に発達する基本的な能力に苦戦している。
近年の研究では、このギャップを認識し、MLLMの時空間能力を評価するための専用のベンチマークを導入している。
しかし、既存のベンチマークは主に静的なシーンに焦点を当てたり、正確な定量的な予測を必要とし、時間的手がかりからの直感的な推論はほとんど探索されていない。
本稿では,MLLMが動的シーンにおける連続的な視覚的手がかりから質的推論を行うことができるかどうかを体系的に評価する新しい評価スイートである視覚空間時間推論ベンチマーク(ViSTR-Bench)を紹介する。
時間的強調、推論の方向性、質的評価の原則によって、ViSTR-Benchはモーション・パーセプション、空間関係、アウトカム予測、物理力学に関する総合的な4次元評価を定めている。
ベンチマークは15の異なるサブタスクと、さまざまなテーブルトップ、屋内、屋外のシナリオにまたがる高品質のビデオ質問応答ペアで構成されている。
最先端のプロプライエタリ、オープンソース、特殊空間MLLMの広範な評価は、その強力な一般的なビデオ理解能力にもかかわらず、現在のモデルは複雑な時空間推論において重大なボトルネックに直面しており、人間のパフォーマンスよりはるかに低いままであることを示している。
関連論文リスト
- Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World [49.80040477190479]
人間は物理的4Dの世界に住み、幾何学的構造と意味的内容は時間とともに進化する。
さまざまな実世界および合成ビデオデータセットから構築された大規模ベンチマークであるDyn-Benchを紹介した。
既存のモデルでは,時間的推論と動的オブジェクトグラウンドの両面において,高い性能を同時に維持できないことがわかった。
論文 参考訳(メタデータ) (2026-03-13T07:42:16Z) - REM: Evaluating LLM Embodied Spatial Reasoning through Multi-Frame Trajectories [19.741468026765062]
本稿では,空間推論のための制御可能な3次元環境を用いたベンチマークREM(Reasoning over Embodied Multi-Frame Trajectories)を紹介する。
REMは、オブジェクトの永続性/識別、空間的関係、動的エンボディされた視点における数値的追跡などの重要な側面を体系的に評価する。
評価の結果、最高の性能を示す現在のモデルでは、全体的な性能が期待できるが、人間によって容易に扱える程度の複雑性レベルでは信頼性が低下していることがわかった。
論文 参考訳(メタデータ) (2025-11-30T05:20:22Z) - 11Plus-Bench: Demystifying Multimodal LLM Spatial Reasoning with Cognitive-Inspired Analysis [54.24689751375923]
本研究では,最先端MLLMの空間的推論能力を評価するためのシステム評価フレームワークを提案する。
14個のMLLMの実験と人間の評価により、現在のMLLMは空間認知の早期の兆候を示すことが明らかとなった。
これらの知見は,現在のMLLMの空間的推論能力の出現能力と限界の両方を浮き彫りにしている。
論文 参考訳(メタデータ) (2025-08-27T17:22:34Z) - VLM4D: Towards Spatiotemporal Awareness in Vision Language Models [66.833085504228]
V4DLMは視覚言語モデル(VLM)を評価するために設計された最初のベンチマークである。
本ベンチマークは,質問応答対を慎重にキュレートした,多様な実世界および合成ビデオで構成されている。
我々は,既存のモデルにおける基本的欠陥を浮き彫りにして,人間のベースラインと比較して重要なパフォーマンスギャップを識別する。
論文 参考訳(メタデータ) (2025-08-04T06:06:06Z) - SpatialViz-Bench: An MLLM Benchmark for Spatial Visualization [44.427830927596204]
SpaceViz-Benchは4つのサブ能力にまたがる12のタスクを持つ空間視覚化のための総合的なベンチマークである。
33種類の最先端MLLMを評価した結果,多彩な性能の変動がみられ,反直感的な結果が得られた。
論文 参考訳(メタデータ) (2025-07-10T10:27:20Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models [84.27290155010533]
本稿では,視覚中心型多機能ゲーム評価(V-MAGE)について紹介する。
V-MAGEは、30以上の慎重に構築された評価シナリオからなる5つの異なるビデオゲームを特徴としている。
V-MAGEは、動的かつインタラクティブな設定において、MLLMの視覚的および推論能力を改善するために実行可能な洞察を提供する。
論文 参考訳(メタデータ) (2025-04-08T15:43:01Z) - STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding? [15.419733591210514]
MLLM(Multimodal Large Language Models)は、Embodied AIとAutonomous Drivingのためのエンドツーエンドソリューションである。
MLLMの時空間的理解を評価するためのベンチマークであるSTI-Benchを紹介する。
私たちのベンチマークでは、デスクトップ、屋内、屋外のシナリオにまたがる幅広いロボットと車両の操作を網羅しています。
論文 参考訳(メタデータ) (2025-03-31T06:30:35Z) - Reframing Spatial Reasoning Evaluation in Language Models: A Real-World Simulation Benchmark for Qualitative Reasoning [4.422649561583363]
言語モデル(LM)における空間推論評価のための新しいベンチマークを提案する。
現実的な3Dシミュレーションデータに基づいており、様々なオブジェクトとそれらの空間的関係を持つ一連の多様な部屋レイアウトを提供する。
重要なコントリビューションは、論理ベースの一貫性チェックツールです。
論文 参考訳(メタデータ) (2024-05-23T21:22:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。