論文の概要: MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding
- arxiv url: http://arxiv.org/abs/2608.04587v1
- Date: Wed, 05 Aug 2026 08:50:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.788248
- Title: MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding
- Title(参考訳): MetaVideoAgent: 長時間のビデオ理解のための自動ビデオエージェント進化
- Authors: Benlei Cui, Ruize Wang, Junjie Li, Jinhao Chen, Longtao Huang, Yinghao Chen, Yuwen Zhai, Jingqun Tang, Ruijian Jia, Weiwei Wu, Pengfei Sun, Haiwen Hong,
- Abstract要約: ターゲット配信のためのビデオエージェントを自動的に進化させるフレームワークであるMetaVideoAgentを紹介する。
サンプルの少ないフレームから情報密度とエビデンス要件をプロファイルし、初期設計をガイドする。
根拠に基づくゴールドパスを構築し、学生の軌跡を監査し、サンプル間で繰り返し発生する障害を集約し、それらを責任あるモジュールに属性付けする。
MetaVideoAgentはディストリビューション毎に4回の進化を繰り返し、すべての初期エージェントを改善し、マクロ平均精度を38.44%から51.47%に引き上げる。
- 参考スコア(独自算出の注目度): 26.75930024542367
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-form video understanding requires locating sparse, question-relevant evidence in long, multimodal videos. Real-world video distributions differ in modality-specific information density, content structure, and evidence patterns, causing fixed video-agent designs to incur redundant processing or fail when mismatched. Extending automated agent evolution from text to video is challenging because full long-video execution makes candidate validation expensive, failures propagate across coupled evidence-processing stages, and complex preprocessing, perception tools, and localization strategies make code-level updates difficult to implement reliably. We introduce MetaVideoAgent, a framework that automatically evolves a video agent for a target distribution. It profiles information density and evidence requirements from sparsely sampled frames and associated queries to guide initial design, then compresses localized failures into independently executable minimal validation tasks. It constructs evidence-grounded Gold Paths, audits Student trajectories, aggregates recurring failures across samples, and attributes them to responsible modules. A modular agent representation constrains each update to the primary responsible module and its necessary dependencies. We further introduce VA-EvoBench, covering eight video distributions with separate evolution and held-out splits. With four evolution iterations per distribution, MetaVideoAgent improves every initial agent and raises macro-average accuracy from 38.44% to 51.47%, at an average evolution cost of 3.54M tokens per distribution. The evolved agents outperform the strongest prior fixed-design video agent by 6.39 percentage points while using the fewest tokens and video frames per question among the compared video agents. We will release all code and data to support reproducible research.
- Abstract(参考訳): ロングフォームなビデオ理解には、長いマルチモーダルなビデオにおいて、スパースで質問に関係のある証拠を見つける必要がある。
実世界のビデオ配信は、モダリティ固有の情報密度、コンテンツ構造、エビデンスパターンが異なるため、固定されたビデオエージェントの設計が冗長な処理を発生させるか、ミスマッチ時に失敗する。
テキストからビデオへの自動エージェントの進化の拡張は、完全な長時間ビデオ実行によって候補検証が高価になり、エビデンス処理の段階をまたいだ障害が伝播し、複雑な前処理、認識ツール、ローカライゼーション戦略がコードレベルの更新を確実に実装することが難しくなるため、難しい。
ターゲット配信のためのビデオエージェントを自動的に進化させるフレームワークであるMetaVideoAgentを紹介する。
少量のサンプルフレームと関連するクエリから情報密度とエビデンス要件をプロファイルし、初期設計をガイドし、ローカライズされた障害を独立した最小限の検証タスクに圧縮する。
根拠に基づくゴールドパスを構築し、学生の軌跡を監査し、サンプル間で繰り返し発生する障害を集約し、それらを責任あるモジュールに属性付けする。
モジュールエージェント表現は、各更新をプライマリ責任モジュールとその必要な依存関係に制約する。
さらにVA-EvoBenchを導入し、8つの動画配信を別途展開し、分割を保留する。
MetaVideoAgentはディストリビューション毎に4回の進化を繰り返し、すべての初期エージェントを改善し、マクロ平均精度を38.44%から51.47%に引き上げる。
進化したエージェントは、比較されたビデオエージェントの中で最も少ないトークンとビデオフレームを使用しながら、最強の固定設計ビデオエージェントを6.39ポイント上回る。
再現可能なリサーチをサポートするため、すべてのコードとデータを公開します。
関連論文リスト
- VideoAgent: All-in-One Framework for Video Understanding and Editing [26.019384130449733]
VideoAgentはビデオ編集のためのオールインワンのエージェントフレームワークである。
我々は、コヒーレントな物語のための撮影計画エージェントを用いた自動撮影を作成する。
Intent parsing filters relevant tools while textual-gradient graph optimizationsasse editing pipelines。
論文 参考訳(メタデータ) (2026-06-22T13:37:08Z) - SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration [6.451186120567798]
VideoQAは、ビデオシーケンスの複雑なダイナミクスをキャプチャするために、空間的、時間的、意味的な情報を統合する必要がある、困難なタスクである。
本稿では,ビデオQAのためのストーリーライン誘導型クロスモーダルマルチエージェントフレームワークであるSVAgentを提案する。
実験により,SVAgentは映像理解において人間のようなストーリーライン推論をエミュレートすることにより,優れた性能と解釈性を実現することが示された。
論文 参考訳(メタデータ) (2026-04-06T18:30:50Z) - VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding [9.415923244280542]
VideoBrainは、Vision-Language Modelsが学習したサンプリングポリシーを通じて視覚情報を適応的に取得することを可能にするエンドツーエンドフレームワークである。
提案手法は,ビデオ間の意味検索を行うCLIPエージェントと,時間間隔内での高密度サンプリングを行うUniformエージェントの2つの補完エージェントを特徴とする。
論文 参考訳(メタデータ) (2026-02-04T00:08:35Z) - Video-BrowseComp: Benchmarking Agentic Video Research on Open Web [64.53060049124961]
Video-BrowseCompは、オープンウェブのエージェントによるビデオ推論に適した210の質問からなるベンチマークである。
これは時間的視覚的証拠に必須に依存しており、回答はテキスト検索のみでは導き出せないことを保証している。
初のオープンWebビデオ調査ベンチマークとして、Video-BrowseCompは、受動的知覚を越えて、プロアクティブなビデオ推論へと分野を前進させた。
論文 参考訳(メタデータ) (2025-12-28T19:08:27Z) - LongVideoAgent: Multi-Agent Reasoning with Long Videos [69.28914905197426]
本稿では,主LLMが問題関連セグメントの局所化のために接地エージェントをコーディネートするマルチエージェントフレームワークと,対象とするテキスト観察を抽出する視覚エージェントを提案する。
マスターエージェントは、ステップ制限で計画し、簡潔で正確で効率的なマルチエージェント協調を促進するために強化学習で訓練されている。
テレビQA/TVQA+から集約したエピソードレベルのデータセットであるLongTVQAとLongTVQA+では,マルチエージェントシステムは強力な非エージェントベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-12-23T18:59:49Z) - LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling [87.98096428508181]
LongVTは、Multimodal Chain-of-Tool-Thoughtを通じて"Thinking with Long Videos"を可能にするエンドツーエンドのエージェントフレームワークである。
我々は、LMM固有の時間的接地機能を利用して、特定のビデオクリップをズームインし、よりきめ細かいビデオフレームを再サンプリングするネイティブビデオトリミングツールを開発した。
トレーニングデータセットは, ツール統合型冷間始動微調整用247.9K試料, エージェント強化学習用1.6K試料, エージェント強化微調整用15.4K試料からなる。
論文 参考訳(メタデータ) (2025-11-25T19:22:48Z) - Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding [60.88843818016968]
長時間のビデオ理解は時間空間の複雑さと質問応答の難しさによって大きな課題を呈する。
セグメント化されたビデオクリップ上でのエージェント検索戦略を活用するために,Deep Video Discovery (DVD) エージェントを提案する。
当社のDVDエージェントは,LVBenchデータセット上での最先端性能を実現し,74.2%の精度を実現した。
論文 参考訳(メタデータ) (2025-05-23T16:37:36Z) - VideoMultiAgents: A Multi-Agent Framework for Video Question Answering [11.514596823413736]
Video Question Answering (VQA) は本質的にマルチモーダル推論に依存している。
本稿では,視覚,シーングラフ解析,テキスト処理などの特殊エージェントを統合するフレームワークであるVideoMultiAgentsを紹介する。
提案手法は, 対象, 行動, 時間的遷移をハイライトするキャプションを生成する, 質問誘導キャプション生成を補足する。
論文 参考訳(メタデータ) (2025-04-25T22:08:09Z) - OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-Conquer [14.503628667535425]
広範なビデオの処理は、膨大なデータと処理要求のために大きな課題をもたらします。
我々はOmAgentを開発し、特定のクエリの関連ビデオフレームを効率的に保存し、検索する。
自律推論が可能なDivide-and-Conquer Loopを備えている。
より高度な自律性と堅牢なツールコールシステムを備えており、さらに複雑なタスクを達成できます。
論文 参考訳(メタデータ) (2024-06-24T13:05:39Z) - MIST: Multi-modal Iterative Spatial-Temporal Transformer for Long-form
Video Question Answering [73.61182342844639]
我々は,MIST(Multi-modal Iterative Spatial-temporal Transformer)と呼ばれる新しいモデルを導入する。
MISTは、従来の密集時空間自己アテンションをカスケードセグメントと領域選択モジュールに分解する。
異なる粒度の視覚概念は、アテンションモジュールを通して効率的に処理される。
論文 参考訳(メタデータ) (2022-12-19T15:05:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。