論文の概要: Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
- arxiv url: http://arxiv.org/abs/2606.29445v1
- Date: Sun, 28 Jun 2026 15:11:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.915654
- Title: Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
- Title(参考訳): 一般化鍵フレーム抽出によるビデオQAと映像誘導エージェントタスクのブリッジ
- Abstract要約: VG-GUI (Video-Guided GUI Benchmark) はMLLMベースのGUIエージェントがビデオチュートリアルに従うことができるかどうかを評価するための新しいベンチマークである。
本稿では,タスク関連性やシーンのダイナミクスを協調的に考慮して情報フレームを識別する抽出アルゴリズムであるTASKER(Task-driven And Scene-aware Keyframe searchER)を提案する。
- 参考スコア(独自算出の注目度): 7.87080098696763
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video understanding is a fundamental capability for multimodal intelligence, and recent Multimodal Large Language Models (MLLMs) have achieved remarkable performance on Video Question Answering (VideoQA) benchmarks. However, existing benchmarks primarily evaluate whether models can perceive shallow visual cues, while rarely examining whether MLLMs can learn deeper knowledge or procedural skills from video tutorials and generalize them to downstream long-horizon agentic tasks. To address this gap, we introduce VG-GUIBench (Video-Guided GUI Benchmark), a new benchmark designed to evaluate whether MLLM-based GUI agents can follow video tutorials to complete corresponding GUI interactive tasks. Furthermore, we observe that the performance of models on both VideoQA and video-guided agentic tasks critically depends on effective keyframe extraction. Based on this observation, we propose TASKER (Task-driven And Scene-aware Keyframe searchER), a keyframe extraction algorithm that jointly considers task relevance and scene dynamics to identify informative frames. Experimental results demonstrate that TASKER achieves significant performance improvements on both VideoQA and video-guided agentic task benchmarks, outperforming the best baseline by 2.0% on the EgoSchema fullset and 1.8% on the NExT-QA dataset, respectively. These results further highlight the potential of generalized keyframe extraction methods for video understanding tasks. Our code and data are available at https://github.com/VG-GUI-TASKER/VG-GUI-TASKER.
- Abstract(参考訳): ビデオ理解はマルチモーダルインテリジェンスの基本機能であり,近年のMLLM(Multimodal Large Language Models)はビデオ質問回答(Video Question Answering, VideoQA)ベンチマークで顕著なパフォーマンスを達成した。
しかし、既存のベンチマークでは、モデルが浅い視覚的手がかりを知覚できるかどうかを主に評価する一方で、MLLMがビデオチュートリアルからより深い知識や手続き的スキルを習得し、下流のロングホライゾンのエージェントタスクに一般化できるかどうかを調査することは稀である。
VG-GUIBench (Video-Guided GUI Benchmark) はMLLMベースのGUIエージェントがビデオチュートリアルに追従して対応するGUI対話タスクを完了できるかを評価するためのベンチマークである。
さらに,ビデオQAと映像誘導型エージェントタスクの両方のモデルの性能が,有効キーフレーム抽出に大きく依存していることが観察された。
そこで本研究では,タスク関連性とシーンダイナミクスを協調的に考慮し,情報フレームを特定するキーフレーム抽出アルゴリズムであるTASKER(Task-driven And Scene-aware Keyframe SearchER)を提案する。
実験の結果,TASKERはビデオQAとビデオ誘導型エージェントタスクベンチマークの両方で大幅な性能向上を実現し,EgoSchemaのフルセットでは2.0%,NEXT-QAデータセットでは1.8%で最高のベースラインを達成できた。
これらの結果は、ビデオ理解タスクのための一般化されたキーフレーム抽出手法の可能性をさらに強調する。
私たちのコードとデータはhttps://github.com/VG-GUI-TASKER/VG-GUI-TASKERで公開されています。
関連論文リスト
- Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors [0.0]
スクリーン上の学習行動は、学生が学習中にどのように情報を求め、利用し、生成するかについての貴重な洞察を提供する。
近年の視覚言語モデル(VLM)は、労働集約型手動コーディングを自動化する新しい機会を提供する。
本研究では,ビデオ解析におけるVLMベースのマルチエージェントシステムの有効性を実証し,マルチモーダルデータ解析のためのスケーラブルなフレームワークを提供する。
論文 参考訳(メタデータ) (2026-04-04T08:01:02Z) - MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks [67.31276358668424]
AV-HaystacksQAという新しいタスクを導入し、クエリに応答して、異なるビデオにまたがる有能なセグメントを識別し、それらをリンクして最も有意義な回答を生成する。
AVHaystacksは、マルチビデオ検索および時間的グラウンドタスクにおけるLMMの能力を評価するために設計された3100の注釈付きQAペアからなるオーディオビジュアルベンチマークである。
提案するAVHaystackのQAタスクにおけるBLEU@4およびGPT評価スコアの基準値よりも89%と65%の相対的な改善を実現し、モデルに依存しないマルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-08T06:34:29Z) - The Devil is in Temporal Token: High Quality Video Reasoning Segmentation [68.33080352141653]
ビデオ推論の方法は、ビデオ内のオブジェクトを表現するために単一の特別なトークンに大きく依存する。
エンドツーエンドの動画推論セグメンテーション手法であるVRS-HQを提案する。
提案手法の強い時間的推論とセグメンテーション能力について検討した。
論文 参考訳(メタデータ) (2025-01-15T03:17:24Z) - CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval [24.203328970223527]
本稿では,詳細な動画キャプションと検索のためのベンチマークであるCaReBenchを紹介する。
同様に、ビデオごとに手動で分離された空間アノテーションと時間アノテーションを提供する。
この設計に基づいて、ビデオ検索とビデオキャプションタスクに特化して、ReBiasとCapSTという2つの評価指標を導入する。
論文 参考訳(メタデータ) (2024-12-31T15:53:50Z) - VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection [61.54044967253421]
空間的詳細と時間的コヒーレンスを保持するビデオQAペアを特徴とする,新しいデータセットであるVideoEspressoを紹介する。
GPT-4o を用いた QA ペア生成にあたり, 冗長性を抑えるためにセマンティック・アウェア法を用いて構成パイプラインを構築した。
フレームセレクタと2段階の命令微調整推論LVLMを備えたハイブリッドLVLM協調フレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-22T08:33:36Z) - Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs [20.168429351519055]
ビデオ理解はマルチモーダル大言語モデル(LMLM)にとって重要な次のステップである
合成ビデオ生成によるベンチマーク構築フレームワークであるVideoNIAH(Video Needle In A Haystack)を提案する。
我々は、プロプライエタリモデルとオープンソースモデルの両方を包括的に評価し、ビデオ理解能力の重大な違いを明らかにする。
論文 参考訳(メタデータ) (2024-06-13T17:50:05Z) - VaQuitA: Enhancing Alignment in LLM-Assisted Video Understanding [63.075626670943116]
本稿では,映像情報とテキスト情報の相乗効果を向上するための最先端フレームワークであるVaQuitAを紹介する。
データレベルでは、フレームを均一にサンプリングする代わりに、CLIPスコアランキングでガイドされるサンプリング手法を実装している。
機能レベルでは、Visual-Query Transformerと一緒にトレーニング可能なVideo Perceiverを統合します。
論文 参考訳(メタデータ) (2023-12-04T19:48:02Z) - MVBench: A Comprehensive Multi-modal Video Understanding Benchmark [63.14000659130736]
本稿では、MVBenchという総合的なマルチモーダルビデオ理解ベンチマークを紹介する。
まず、これらの時間的タスクを定義するための新しい静的-動的手法を提案する。
そして,タスク定義に従って,公開ビデオアノテーションを複数選択QAに自動的に変換し,各タスクを評価する。
論文 参考訳(メタデータ) (2023-11-28T17:59:04Z) - Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating
Video-based Large Language Models [81.84810348214113]
ビデオベースの大規模言語モデル(Video-LLMs)が最近導入され、認識と理解の基本的な改善と多様なユーザからの問い合わせの両方をターゲットにしている。
このようなモデルの開発を導くため、堅牢で包括的な評価システムの構築が重要となる。
本稿では,ビデオLLMの評価に特化して設計されたツールキットとともに,新しい総合的なベンチマークであるtextitVideo-Benchを提案する。
論文 参考訳(メタデータ) (2023-11-27T18:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。