論文の概要: EgoProceVQA: A Novel Egocentric Procedural Understanding Task with Self-Skill-Exploration Agent
- arxiv url: http://arxiv.org/abs/2607.13792v1
- Date: Wed, 15 Jul 2026 12:55:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.776276
- Title: EgoProceVQA: A Novel Egocentric Procedural Understanding Task with Self-Skill-Exploration Agent
- Title(参考訳): EgoProceVQA: 自己スキル探索エージェントを用いた新しいエゴセントリック手続き理解タスク
- Abstract要約: Egocentric Procedural Understanding VQA task (EgoProceVQA)
EgoProceGenは、異なる質問タイプに適したQAデータを効率的に構築するデータ生成プラットフォームである。
EgoProceAgent - セルフスキル探索エージェントフレームワーク。
- 参考スコア(独自算出の注目度): 40.15272756472325
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Most daily activities are inherently procedural. However, existing evaluations for egocentric video understanding seldom address procedural understanding and largely overlook complex key-step-level reasoning under the widely used video question answering (VQA) paradigm for MLLMs. Such capabilities are crucial for building procedural AI assistants deployable on wearable devices. To bridge this gap, we introduce the Egocentric Procedural Understanding VQA task (EgoProceVQA), which systematically evaluates egocentric procedural reasoning abilities of current MLLMs and agents through six types of key-step-centric questions. Furthermore, we develop EgoProceGen, a data generation platform that efficiently constructs QA data tailored to different question types. Based on this platform, we build a benchmark with 3,600 questions, four common procedural scenarios, and 31 everyday procedural tasks. Evaluations on EgoProceVQA show that existing MLLMs and agents still have substantial room for improvement in procedural understanding. Therefore, we further propose EgoProceAgent, a self-skill-exploration agentic framework. We design a generic tool library for procedural understanding and a standardized sub-skill library shared across tools and models, enabling self-exploration without ground-truth supervision. By exploring how to compose and select sub-skills, the agent discovers effective skill strategies for diverse problems, and attains state-of-the-art performance among open-source models on multiple tasks. Together, our benchmark, generation platform, and agentic framework establish a unified foundation for EgoProceVQA. Project page: https://z1oong.github.io/EgoProceVQA/.
- Abstract(参考訳): ほとんどの日常活動は本質的に手続き的である。
しかし,従来の自己中心型ビデオ理解は手続き的理解にはほとんど対応せず,MLLMのVQAパラダイムの下では複雑なキーステップレベルの推論をほとんど見落としている。
このような機能は、ウェアラブルデバイスにデプロイ可能な手続き型AIアシスタントを構築する上で極めて重要である。
このギャップを埋めるために,6種類のキーステップ中心の質問を通じて,現行MLLMとエージェントのエゴセントリックな手続き的推論能力を体系的に評価するEgocent Procedural Understanding VQAタスク(EgoProceVQA)を導入する。
さらに,異なる質問タイプに適したQAデータを効率的に構築するデータ生成プラットフォームであるEgoProceGenを開発した。
このプラットフォームをベースとして,3600の質問,4つの一般的な手続きシナリオ,31の日常的な手続きタスクからなるベンチマークを構築しました。
EgoProceVQAの評価によると、既存のMLLMとエージェントは、手続き的理解を改善するための十分な余地を持っている。
そこで本研究では,自己スキル探索エージェントフレームワークであるEgoProceAgentを提案する。
我々は、手続き的理解のための汎用ツールライブラリと、ツールやモデル間で共有される標準化されたサブスキルライブラリを設計する。
エージェントは、サブスキルの作成と選択の方法を探ることで、多様な問題に対する効果的なスキル戦略を発見し、複数のタスクにおけるオープンソースのモデル間の最先端のパフォーマンスを達成する。
ベンチマーク、生成プラットフォーム、エージェントフレームワークとともに、EgoProceVQAの統一基盤を確立しました。
プロジェクトページ: https://z1oong.github.io/EgoProceVQA/
関連論文リスト
- EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI [24.612087629174656]
EgoErrorVQAタスクは、明示的な手続き的エラーモデリングを用いて、エゴセントリックな手続き的理解のために提案される。
エージェント2Agentプロトコルに基づくユーザフレンドリーな評価エージェントを開発した。
また、Adaptive Decoupled ReasoningフレームワークであるEgo-ADRを紹介します。
論文 参考訳(メタデータ) (2026-08-25T06:58:44Z) - From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents [69.07911499189129]
エージェントのメタ認知判断(Knowing)を自発的実行(Acting)から切り離して認知行動アライメントを評価するフレームワークであるKAPROを紹介する。
実験の結果,自己認識能力はタスク成功と強く相関するが,内部能力設定では著しく低下することがわかった。
プロプライエタリで推論指向のモデルは、より信頼性の高い認知ゲーティングを示します。
論文 参考訳(メタデータ) (2026-06-09T17:17:08Z) - MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents [54.48066948369172]
エンボディモデルが強力になるにつれ、人間は将来、職場や自宅で複数のエンボディAIエージェントと協力するようになる。
既存の課題には、ビデオ形式で個々の感覚入力を効果的に圧縮し、伝達することが含まれる。
われわれはまず,複数のエンボディエージェントから同時に収集された複数のロングホライズン・エゴセントリックなビデオを理解するという,新しい問題を正式に定義する。
論文 参考訳(メタデータ) (2026-03-10T15:48:35Z) - ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly [13.040491675077687]
組立活動に関する新しいマルチモーダルQAデータセットを提案する。
我々のデータセットであるProMQA-Assemblyは、391のQAペアで構成されており、人間の活動記録とその指導マニュアルのマルチモーダル理解を必要とする。
論文 参考訳(メタデータ) (2025-09-03T02:26:48Z) - Memento No More: Coaching AI Agents to Master Multiple Tasks via Hints Internalization [56.674356045200696]
本稿では,複雑なメモシステムや事前の高品質な実演データを必要としない,複数のタスクに対する知識とスキルを取り入れたAIエージェントの訓練手法を提案する。
このアプローチでは,エージェントが新たな経験を収集し,ヒントの形で人間から補正フィードバックを受け取り,このフィードバックを重みに組み込む,反復的なプロセスを採用している。
Llama-3をベースとしたエージェントに実装することで,数ラウンドのフィードバックの後,高度なモデルGPT-4oとDeepSeek-V3をタスクセットで性能向上させる手法の有効性を実証する。
論文 参考訳(メタデータ) (2025-02-03T17:45:46Z) - TaskBench: Benchmarking Large Language Models for Task Automation [82.2932794189585]
タスク自動化における大規模言語モデル(LLM)の機能を評価するためのフレームワークであるTaskBenchを紹介する。
具体的には、タスクの分解、ツールの選択、パラメータ予測を評価する。
提案手法は, 自動構築と厳密な人的検証を組み合わせることで, 人的評価との整合性を確保する。
論文 参考訳(メタデータ) (2023-11-30T18:02:44Z) - Attributed Question Answering: Evaluation and Modeling for Attributed
Large Language Models [68.37431984231338]
大規模言語モデル(LLM)は、直接の監督をほとんど必要とせず、様々なタスクにわたって印象的な結果を示している。
我々は、LLMが生成するテキストの属性に持つ能力は、この設定においてシステム開発者とユーザの両方にとって不可欠であると信じている。
論文 参考訳(メタデータ) (2022-12-15T18:45:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。