論文の概要: EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
- arxiv url: http://arxiv.org/abs/2605.19559v1
- Date: Tue, 19 May 2026 09:02:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:09.2195
- Title: EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
- Title(参考訳): EgoCoT-Bench:MLLMのための思考推論の基盤と検証可能な操作中心チェーンのベンチマーク
- Authors: Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang,
- Abstract要約: EgoT-Benchは、接地的で検証可能な操作中心の推論のための微細なエゴセントリックなベンチマークである。
EgoT-Benchは、3,172対のQAペアを351対の自我中心の振り返りビデオで構成している。
- 参考スコア(独自算出の注目度): 23.973683864983272
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid development of Multimodal Large Language Models (MLLMs) has led to growing interest in egocentric video understanding, specifically the ability for MLLMs to recognize fine-grained hand-object interactions, track object state changes over time, and reason about manipulative processes in dynamic environments from a first-person perspective. However, existing egocentric video benchmarks suffer from \textbf{limited grounded rationale evaluation}, offering limited support for fine-grained operation-centric reasoning and rarely examining whether model rationales are grounded in explicit spatio-temporal evidence. To address this gap, we introduce \textbf{EgoCoT-Bench}, a fine-grained egocentric benchmark for grounded and verifiable operation-centric reasoning with explicit step-by-step rationale annotations. Overall, EgoCoT-Bench comprises 3,172 verifiable QA pairs over 351 egocentric videos separated into four task groups for a total of 12 sub-task groups, encompassing perception and retrospection, anticipation, and high-level reasoning. The benchmark is constructed through a spatio-temporal scene graphs (STSG) guided generation framework and is further refined by human annotators to ensure correctness, egocentric relevance and fine-grained quality. Experimental results show continuing difficulties with egocentric fine-grained reasoning and further reveal that many multimodal models produce explanations that are answer-correct, but have evidence that is inconsistent with the answer. We hope EgoCoT-Bench can serve as a useful testbed for grounded and verifiable reasoning in egocentric video understanding. Project page and supplementary materials are available at: https://dstardust.github.io/EgoCoT/.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)の急速な発展により、エゴセントリックなビデオ理解への関心が高まり、特にMLLMは、細粒度のハンドオブジェクトの相互作用を認識し、時間とともにオブジェクトの状態の変化を追跡し、一人称視点から動的環境における操作的プロセスの推論を行うことができるようになった。
しかし、既存のエゴセントリックビデオベンチマークは「textbf{limited grounded rationale evaluation」に苦しめられ、細かい操作中心の推論を限定的にサポートし、モデルの有理が明示的な時空間的証拠に根拠づけられているかどうかを調査することは滅多にない。
このギャップに対処するために、明示的なステップ・バイ・ステップの有理アノテーションを持つ、接地的で検証可能な操作中心推論のための詳細なエゴセントリックなベンチマークである \textbf{EgoCoT-Bench} を導入する。
全体として、EgoCoT-Benchは3,172対の検証可能なQAペアを4つのタスクグループに分け、12のサブタスクグループに分け、知覚と振り返り、予測、高レベルの推論を含む。
このベンチマークは、STSG(Spatio-temporal scene graphs)ガイド付き生成フレームワークによって構築され、人間のアノテータによってさらに洗練され、正確性、エゴセントリックな関連性、きめ細かい品質が保証される。
実験の結果、エゴセントリックな微粒な推論の難しさが続き、さらに多くのマルチモーダルモデルが答えの正確さを説明できるが、答えに矛盾する証拠を持っていることが明らかとなった。
EgoCoT-Benchは、エゴセントリックなビデオ理解において、根拠と検証可能な推論のための便利なテストベッドとして機能することを願っている。
プロジェクトページと追加資料は、https://dstardust.github.io/EgoCoT/.com/で入手できる。
関連論文リスト
- Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding [54.691865975180576]
Minerva-Egoは、エゴセントリックな視覚的推論を評価するためのベンチマークである。
ベンチマーク実験では、最先端のモデルには人間のパフォーマンスに大きなギャップがあることが示されている。
論文 参考訳(メタデータ) (2026-05-14T19:12:20Z) - Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision [22.502853661316028]
EgoPoint-Benchは、egocentric viewにおけるマルチモーダルポインティング推論の評価と強化を目的とした総合的な質問応答ベンチマークである。
合成データに微調整を施したモデルが,性能向上とロバストなsim-to-realの一般化を実現していることを示す。
この研究は、空間的に意識された監視の重要性を強調し、正確な自我中心のAIアシスタントへのスケーラブルなパスを提供する。
論文 参考訳(メタデータ) (2026-04-23T09:15:42Z) - EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning [63.010793398283134]
本研究では,多モーダルな言語モデルが,エゴセントリックな視点から行動の長期的物理的帰結を確実に推論できるかどうかを考察する。
EXPLORE-Benchは,様々なシナリオにまたがる実の1人称ビデオから算出したベンチマークである。
プロプライエタリでオープンソースのMLLMの実験では、人間にとって大きなパフォーマンスギャップが示される。
論文 参考訳(メタデータ) (2026-03-10T14:33:44Z) - Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning [18.15310805625469]
マルチモーダルビデオ言語モデル(Video-LMs)を評価するための新しいベンチマークであるKnow-Showを提案する。
Know-Showは、空間的(人、物、人、物)と時間的次元の5つのシナリオからなる単一の評価枠組み内での推論と局所化を統一する。
Charades、Action Genome、Ego4Dから2.5万の人間の言語質問で作られたこのベンチマークは、現在のビデオ-LMと人間の推論の間に大きなギャップを露呈している。
このギャップを埋めるために、我々は、きめ細かい接地でビデオ-LMを増強するトレーニング不要なプラグインであるGRAMを提案する。
論文 参考訳(メタデータ) (2025-12-05T08:15:49Z) - EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT [56.24624833924252]
EgoThinkerは、時間的連鎖管理と2段階の学習カリキュラムを通じて、堅牢なエゴセントリック推論能力を備えたMLを支援するフレームワークである。
EgoThinkerは、複数のエゴセントリックなベンチマークで既存のメソッドよりも優れており、微粒な時間的ローカライゼーションタスクで大幅に改善されている。
論文 参考訳(メタデータ) (2025-10-27T17:38:17Z) - STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training [87.58996020705258]
Video Large Language Models (Video-LLMs) は近年,ビデオ理解タスクに強い派生性を示している。
ビデオLLMは、多段階の明示的時間的推論を必要とする構成的推論と、オブジェクトの関係、相互作用、イベントに苦労する。
本稿では,ビデオLLMが生ビデオから推論に富んだ微調整データを生成し,自己改善を実現するための,グラフ誘導型自己学習手法STEPを提案する。
論文 参考訳(メタデータ) (2024-11-29T11:54:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。