論文の概要: Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
- arxiv url: http://arxiv.org/abs/2608.03979v1
- Date: Tue, 04 Aug 2026 17:45:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.303602
- Title: Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
- Title(参考訳): Video-DeepResearch:次世代マルチモーダルディープリサーチエージェントを目指して
- Authors: Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao,
- Abstract要約: Video-DRは、ステージワイドツールアンロックを備えた分離された知覚時間パイプラインを備えている。
当社のフレームワークでは,教師付き微調整とグループ相対ポリシー最適化という2段階のトレーニングレシピを採用しています。
実験の結果,ビデオ検索DeepB-A3Bでは64.0%の精度で新たな最先端技術が確立された。
- 参考スコア(独自算出の注目度): 81.19460113054048
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce Video-DeepResearch (Video-DR), extending multimodal agents from static images to continuous video streams, a setting that demands dense spatiotemporal grounding coupled with open-web exploration. Preliminary evaluations reveal two critical bottlenecks in current models: (1) modality bias, where agents bypass visual tools in favor of textual search, and (2) parametric knowledge leakage, where models rely on internal memory rather than genuine tool-augmented execution. To address these challenges, we propose Video-DR, featuring a decoupled perception-exploration pipeline with stage-wise tool unlocking that compels exhaustive cross-frame visual grounding prior to web retrieval. Our framework adopts a two-stage training recipe: supervised fine-tuning followed by Group Relative Policy Optimization (GRPO), enabling autonomous exploration that breaks the imitation-learning ceiling. Furthermore, we curate Video-DR-Bench, a human-AI collaborative benchmark comprising 200 complex, multi-hop VQA instances. Empirical results demonstrate that our Video-DeepResearch-35B-A3B establishes a new state-of-the-art of 64.0% average accuracy, surpassing proprietary Claude-4.5-Sonnet (59.0%) by 5.0 points and significantly outperforming GPT-5 (52.5%) and Gemini 2.5 Pro (57.5%). The 30B-A3B variant achieves 59.3%, competitive with Claude-4.5-Sonnet and demonstrating the effectiveness of our training paradigm even at compact scale. Code: https://github.com/Osilly/Vision-DeepResearch.
- Abstract(参考訳): 静的な画像から連続的なビデオストリームへのマルチモーダルエージェントの拡張であるVideo-DeepResearch(Video-DR)を紹介した。
予備評価では,(1)モダリティバイアス,(2)テキスト検索に代えて視覚ツールをバイパスするエージェント,(2)パラメトリック知識リーク,(2)モデルが真のツール拡張実行ではなく内部メモリに依存するモデル,の2つの重要なボトルネックが明らかになった。
これらの課題に対処するために、Web検索に先立って、網羅的なクロスフレーム視覚的グラウンドを補完するステージワイドツールアンロックを備えた、分離された知覚探索パイプラインを備えたVideo-DRを提案する。
監視された微調整とグループ相対政策最適化(GRPO)により、模倣学習天井を破る自律的な探索を可能にする。
さらに,200の複雑なマルチホップVQAインスタンスからなる人間とAIの協調ベンチマークであるVideo-DR-Benchをキュレートする。
実証実験の結果、ビデオディープリサーチ-35B-A3Bは64.0%の精度で新しい最先端技術を確立し、プロプライエタリなClaude-4.5-Sonnet(59.0%)を5.0ポイント上回り、GPT-5(52.5%)とGemini 2.5 Pro(57.5%)を大きく上回った。
30B-A3Bは59.3%の精度でClaude-4.5-Sonnetと競合し、コンパクトスケールでもトレーニングパラダイムの有効性を示す。
コード:https://github.com/Osilly/Vision-DeepResearch
関連論文リスト
- Kwai Keye-VL-2.0 Technical Report [53.82434681649277]
Keye-VL-2.0は、長期ビデオ理解とエージェントインテリジェンスを促進するために設計されたマルチモーダル基盤モデルである。
DeepSeek Sparse Attention (DSA)をGQAベースのマルチモーダルアーキテクチャに適応したのは,これが初めてである。
コンテクスト-RLとビデオ-RLを併用したMOPD(Cross-Modal Multi-Teacher On-Policy Distillation)は破滅的忘れのアルゴリズム的ジレンマを克服する。
論文 参考訳(メタデータ) (2026-06-09T09:58:08Z) - Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning [28.87800134659646]
Video-o3は、優れた視覚的手がかりの反復的な発見をサポートする新しいフレームワークである。
Video-o3は最先端の手法を大幅に上回り、MLVUでは72.1%、Video-Holmesでは46.5%の精度を達成している。
論文 参考訳(メタデータ) (2026-01-30T17:47:30Z) - Video-BrowseComp: Benchmarking Agentic Video Research on Open Web [64.53060049124961]
Video-BrowseCompは、オープンウェブのエージェントによるビデオ推論に適した210の質問からなるベンチマークである。
これは時間的視覚的証拠に必須に依存しており、回答はテキスト検索のみでは導き出せないことを保証している。
初のオープンWebビデオ調査ベンチマークとして、Video-BrowseCompは、受動的知覚を越えて、プロアクティブなビデオ推論へと分野を前進させた。
論文 参考訳(メタデータ) (2025-12-28T19:08:27Z) - Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs [7.3517692707289415]
本稿では2つの特殊モデルからなるエージェントシステムであるFathom-DeepResearchを紹介する。
ひとつは、ライブWeb検索とターゲットWebページクエリによるエビデンスベースの調査に最適化された、DeepSearchモデルであるFathom-Search-4Bである。
2つ目は、Qwen3-4Bから訓練されたFathom-Synthesizer-4Bである。
論文 参考訳(メタデータ) (2025-09-28T22:58:11Z) - VideoScore2: Think before You Score in Generative Video Evaluation [69.43069741467603]
VideoScore2は、視覚的品質、テキスト・ツー・ビデオのアライメント、物理的/常識的一貫性を明確に評価する多次元、解釈可能、そして人間によるアライメントフレームワークである。
我々のモデルは、27,168人の注釈付きビデオを含む大規模なデータセットVideoFeedback2で訓練されている。
論文 参考訳(メタデータ) (2025-09-26T18:09:03Z) - T*: Re-thinking Temporal Search for Long-Form Video Understanding [66.72243342954823]
現在の時間探索法は、Longvideobenchサブセットで2.1%の時間F1スコアしか達成していない。
画像中の視覚探索に触発されて,空間探索として高価な時間探索を再構成する軽量な時間探索フレームワークT*を提案する。
大規模な実験により、T*と既存の方法を統合することにより、SOTAの長めのビデオ理解が大幅に向上することが示された。
論文 参考訳(メタデータ) (2025-04-03T04:03:10Z) - CapST: Leveraging Capsule Networks and Temporal Attention for Accurate Model Attribution in Deep-fake Videos [9.209808258321559]
特定の生成モデルやエンコーダにディープフェイクを加えることは、法医学的な分析に不可欠であり、ソースと調整された対策を可能にする。
本研究では、異なるモデル(DFDM)からのディープフェイクとGANGen-Detectionの2つのデータセットを用いたディープフェイクビデオのモデル属性問題について検討する。
本稿では,Truncated VGG19ネットワークを統合した新しいCapsule-Spatial-Cap(CapST)モデルを提案する。
論文 参考訳(メタデータ) (2023-11-07T08:05:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。