論文の概要: Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
- arxiv url: http://arxiv.org/abs/2608.23329v1
- Date: Mon, 24 Aug 2026 14:42:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:44.156511
- Title: Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
- Title(参考訳): ビデオを超えて考える:オープンワールドのビデオエージェントのためのビデオ推論とディープリサーチを統一する
- Authors: Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song,
- Abstract要約: 我々は,ビデオトリミング,マルチモーダル検索,Webページブラウジングを協調する統合ビデオディープリサーチフレームワークであるVideoRoverを紹介する。
ビデオ検索のペアが与えられたら、VideoRoverはそれぞれのツールの結果を使って次のアクションを選択する。
この機能を開発するために,26KのSFTトラジェクトリと3Kの挑戦的RLインスタンスを生成する自動データキュレーションパイプラインを構築した。
- 参考スコア(独自算出の注目度): 50.19371565624241
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-world video understanding often requires a model to locate sparse visual evidence and acquire external knowledge that is absent from the video and its parametric memory. While Thinking-with-Videos enables active temporal perception and Deep Research supports multi-step information seeking, the two capabilities are typically developed in isolation. We introduce VideoRover, a unified Video Deep Research framework that iteratively coordinates video cropping, multimodal search, and webpage browsing. Given a video-question pair, VideoRover uses each tool result to select the next action, so localized video clips guide external retrieval and retrieved evidence triggers further video inspection and verification. To develop this capability, we construct an automated data curation pipeline, producing 26K verified SFT trajectories and 3K challenging RL instances. We also introduce VideoRover-Bench, a benchmark stratified by video duration and research difficulty. Experiments on VideoDR and VideoRover-Bench show that our VideoRover-8B-RL achieves performance comparable to proprietary models in the direct-answer setting without tool use while outperforming larger open-source models equipped with the same tool suite. Ablation studies and training dynamics further validate the complementary roles of active video grounding, external retrieval, and long-horizon reinforcement learning.
- Abstract(参考訳): オープンワールドの映像理解は、しばしば、希少な視覚的証拠を見つけ出し、ビデオとそのパラメトリックメモリから欠落する外部知識を取得するためのモデルを必要とする。
Thinking-with-Videosはアクティブな時間知覚を可能にし、Deep Researchは多段階情報検索をサポートしているが、この2つの機能は一般的に独立して開発されている。
本稿では,ビデオトリミング,マルチモーダル検索,Webページブラウジングを反復的にコーディネートする統合ビデオディープリサーチフレームワークであるVideoRoverを紹介する。
ビデオ検索のペアが与えられたら、VideoRoverはそれぞれのツールの結果を使って次のアクションを選択する。
この機能を開発するために,26KのSFTトラジェクトリと3Kの挑戦的RLインスタンスを生成する自動データキュレーションパイプラインを構築した。
また、ビデオの長さと研究の難しさによって階層化されたベンチマークであるVideoRover-Benchについても紹介する。
VideoDRとVideoRover-Benchの実験によると、私たちのVideoRover-8B-RLは、ツールを使わずに、プロプライエタリなモデルに匹敵するパフォーマンスを実現しています。
アブレーション研究とトレーニングのダイナミクスは、アクティブビデオグラウンド、外部検索、長期強化学習の相補的役割をさらに検証する。
関連論文リスト
- VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning [55.2367119060441]
ビデオ理解は、クローズドコンテクストの知覚を超えて、オープンワールドのエビデンス探索へと移行している。
既存のマルチモーダル検索エージェントは主に静的画像をターゲットにしており、現在のVDRベンチマークはテキスト中心の検索に依存している。
本稿では,VDRのマルチツール推論による視覚言語モデルを実現するクローズドループエージェントフレームワークであるVideoSearcherを提案する。
論文 参考訳(メタデータ) (2026-07-03T03:50:09Z) - Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning [32.71093573332936]
VideoDRは、オープンウェブ環境でビデオエージェントを研究するための最初のビデオディープリサーチベンチマークである。
VideoDRは、ビデオ条件付きオープンドメインのビデオ質問応答、クロスフレームの視覚的アンカー抽出、インタラクティブなWeb検索、共同ビデオとWebのエビデンスに対するマルチホップ推論などに焦点を当てている。
論文 参考訳(メタデータ) (2026-01-11T15:07:37Z) - Video-BrowseComp: Benchmarking Agentic Video Research on Open Web [64.53060049124961]
Video-BrowseCompは、オープンウェブのエージェントによるビデオ推論に適した210の質問からなるベンチマークである。
これは時間的視覚的証拠に必須に依存しており、回答はテキスト検索のみでは導き出せないことを保証している。
初のオープンWebビデオ調査ベンチマークとして、Video-BrowseCompは、受動的知覚を越えて、プロアクティブなビデオ推論へと分野を前進させた。
論文 参考訳(メタデータ) (2025-12-28T19:08:27Z) - Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding [60.88843818016968]
長時間のビデオ理解は時間空間の複雑さと質問応答の難しさによって大きな課題を呈する。
セグメント化されたビデオクリップ上でのエージェント検索戦略を活用するために,Deep Video Discovery (DVD) エージェントを提案する。
当社のDVDエージェントは,LVBenchデータセット上での最先端性能を実現し,74.2%の精度を実現した。
論文 参考訳(メタデータ) (2025-05-23T16:37:36Z) - VideoMind: A Chain-of-LoRA Agent for Long Video Reasoning [33.37714717781103]
VideoMindは、ビデオ理解のための新しいビデオ言語エージェントである。
ビデオの時間的推論に不可欠な機能を特定し,ロールベースのエージェントワークフローを開発する。
軽量なLoRAアダプタによるシームレスなロールスイッチングを実現する新しいChain-of-LoRA戦略を提案する。
論文 参考訳(メタデータ) (2025-03-17T17:59:33Z) - VideoRAG: Retrieval-Augmented Generation over Video Corpus [57.68536380621672]
VideoRAGは、クエリによる関連性に基づいて、動的にビデオを取得するフレームワークである。
VideoRAGは近年のLVLM(Large Video Language Models)を利用している。
我々は,ビデオRAGの有効性を実験的に検証し,関連するベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-01-10T11:17:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。