論文の概要: EgoExo-Next:Benchmarking Vision-Language Models on Visual-Option Next-State and Cross-View Reasoning
- arxiv url: http://arxiv.org/abs/2610.04506v1
- Date: Sat, 03 Oct 2026 13:09:37 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:45:13.698055
- Title: EgoExo-Next:Benchmarking Vision-Language Models on Visual-Option Next-State and Cross-View Reasoning
- Title(参考訳): EgoExo-Next:Visual-Optionの次世代およびクロスビュー推論によるビジョンランゲージモデルのベンチマーク
- Abstract要約: EgoExo-Nextは動的視覚状態推論のためのビジュアルオプションベンチマークである。
EgoExo-Nextには、6つの公的なエゴ中心およびエゴ中心のエゴ外部ビデオソースからの2,503人の人間による4つのチョイス質問が含まれている。
- 参考スコア(独自算出の注目度): 18.10733685716474
- License:
- Abstract: Vision-language models (VLMs) are increasingly evaluated for egocentric and cross-view video reasoning, yet existing benchmarks largely focus on semantic event understanding, temporal relations, or correspondence between already observed views, leaving their ability to reason directly about future visual states underexplored. We introduce EgoExo-Next, a visual-option benchmark for dynamic visual-state reasoning, where models must identify how an observed action trajectory subsequently appears rather than predict only an action label or textual description. EgoExo-Next contains 2,503 human-curated four-choice questions from six public egocentric and ego--exo video sources and comprises four interconnected subtasks that evaluate egocentric next-state prediction, bidirectional ego--exo state correspondence, exocentric next-state prediction, and their composition in Ego-to-Exo Next-State. Extensive evaluation of proprietary, open-source, and spatial reasoning VLMs reveals a substantial human--model gap, with the best model achieving 43.81\% average accuracy compared with 98.55\% for humans, and the largest degradation occurring on the composed Ego-to-Exo task. These results suggest that current VLMs remain substantially limited in dynamic visual-state reasoning, particularly when temporal progression and cross-view reasoning must be composed. The benchmark is publicly available at \url{https://huggingface.co/datasets/yutongli2024/EgoExo-Next}.
- Abstract(参考訳): 視覚言語モデル(VLM)は、エゴセントリックでクロスビューなビデオ推論のためにますます評価されているが、既存のベンチマークは、主にセマンティックなイベント理解、時間的関係、あるいは既に観察されているビュー間の対応に焦点を当てており、将来の視覚状態について直接推論する能力を残している。
動的視覚状態推論のためのビジュアルオプションベンチマークであるEgoExo-Nextを導入する。
EgoExo-Nextは、Ego-to-Exoの次の状態予測、双方向のego-exo状態対応、ego-to-exoの次の状態予測、およびそれらの構成を評価する4つの相互接続されたサブタスクで構成されている。
プロプライエタリ、オープンソース、空間推論VLMの大規模評価は、人間の平均精度が 43.81 % であるのに対して、人間にとっては98.55 % であり、合成されたエゴ・トゥ・エクソタスクで発生する最大の劣化率である。
これらの結果から,現在のVLMは動的視覚状態推論において,特に時間的進行と相互視的推論を構成する必要がある場合に,著しく制限されていることが示唆された。
ベンチマークは \url{https://huggingface.co/datasets/yutongli2024/EgoExo-Next} で公開されている。
関連論文リスト
- Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting [28.28260281993948]
本稿では,エゴセントリックな3Dハンドポース予測タスクを提案する。
視覚的観察、言語指導、ポーズ状態から将来のEgo 3Dハンドポーズを予測することを目的としている。
Egoビューにおける視野の制限やダイナミックな動きを克服するために,Exo2EgoPoseというフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-17T12:05:07Z) - EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding [12.811023931580523]
EgoSATは、ストリーミング設定におけるエゴセントリックなビデオ推論のための、最初の包括的なベンチマークである。
現代の視覚言語モデル(VLM)の能力を評価するために設計された。
EgoSATには165時間のエゴセントリックな映像が1,997本、高品質な質問応答対が約4,800本ある。
論文 参考訳(メタデータ) (2026-06-23T10:59:25Z) - EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning [63.010793398283134]
本研究では,多モーダルな言語モデルが,エゴセントリックな視点から行動の長期的物理的帰結を確実に推論できるかどうかを考察する。
EXPLORE-Benchは,様々なシナリオにまたがる実の1人称ビデオから算出したベンチマークである。
プロプライエタリでオープンソースのMLLMの実験では、人間にとって大きなパフォーマンスギャップが示される。
論文 参考訳(メタデータ) (2026-03-10T14:33:44Z) - Ego-centric Predictive Model Conditioned on Hand Trajectories [52.531681772560724]
自我中心のシナリオでは、次の行動とその視覚的結果の両方を予測することは、人間と物体の相互作用を理解するために不可欠である。
我々は,エゴセントリックなシナリオにおける行動と視覚的未来を共同でモデル化する,統合された2段階予測フレームワークを提案する。
我々のアプローチは、エゴセントリックな人間の活動理解とロボット操作の両方を扱うために設計された最初の統一モデルである。
論文 参考訳(メタデータ) (2025-08-27T13:09:55Z) - IQBench: How "Smart'' Are Vision-Language Models? A Study with Human IQ Tests [1.1142124321313052]
標準化されたビジュアルIQテストにおいてビジョン言語モデルを評価するために設計された新しいベンチマークである*IQBench*を紹介する。
我々はVLMの推論能力を評価することに集中しており、最終的な予測の精度よりも重要であると我々は主張する。
論文 参考訳(メタデータ) (2025-05-17T13:24:08Z) - Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions? [48.702973928321946]
Egocentric Video-Language Pretrainingは、一対一のシナリオにおける手動対話の理解を促進するための重要なステップである。
既存のテストベッドでの成功にもかかわらず、現在のEgoVLMは簡単な修正によって容易に誤認できることがわかった。
EgoVLMは手動オブジェクトの相互作用を本当に理解していますか?
論文 参考訳(メタデータ) (2024-05-28T00:27:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。