論文の概要: Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA
- arxiv url: http://arxiv.org/abs/2607.16189v1
- Date: Fri, 17 Jul 2026 17:59:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.930886
- Title: Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA
- Title(参考訳): 木としての動画検索:地上ビデオQAのための自己補正エージェント
- Abstract要約: グラウンドドロングビデオ質問応答(Grounded LVQA)では、長いビデオに関する質問に答えると同時に、その答えを支持する短いエビデンス間隔をローカライズする必要がある。
最近のエージェント的手法では、このタスクを、粗い粒度の絞り込みをサポートする単一の crop_video(start, end) アクションでマルチターン探索とみなしている。
適応時間木上の反復的自己修正探索としてLVQAをキャストするフレームワークであるVideoTreeSearch(VTS)を提案する。
- 参考スコア(独自算出の注目度): 64.65523062099061
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Grounded long-video question answering (Grounded LVQA) requires answering a question about a long video while localizing the short evidence interval that supports the answer. Recent agentic methods frame this task as multi-turn exploration with a single crop_video(start, end) action, which supports coarse-to-fine narrowing but provides no primitive for fine-to-coarse backtracking. As a result, these agents typically converge prematurely and cannot recover from an early mistake. We propose VideoTreeSearch (VTS), a framework that casts grounded LVQA as iterative self-correcting search over an adaptive temporal tree. VTS constructs a non-uniform tree from visual scene boundaries so that each node corresponds to a semantically coherent segment, and trains an agent to navigate the tree through four discrete operations: zoom_in, zoom_out, shift, and answer. These operations expose backtracking and recovery as explicit, learnable primitives rather than implicit behaviors. To train this navigation, we introduce a trajectory synthesis pipeline that produces multi-step paths through the tree, including deliberate detours into incorrect branches followed by recovery. We use these trajectories for supervised fine-tuning, followed by reinforcement learning with grounding and answer-accuracy rewards. On three Grounded LVQA benchmarks (CG-Bench, Haystack-LVBench, Haystack-Ego4D), VTS outperforms the strongest prior agentic methods by +12.5 mIoU on CG-Bench and +7.4 T-F1 on Haystack-Ego4D. The learned policy also transfers to general long-video QA, surpassing all prior agentic baselines on Video-MME, MLVU, and LVBench by up to +7.1 accuracy points. Ablations confirm that self-correcting hierarchical search is the central mechanism behind these gains: removing either adaptive descent or explicit backtracking substantially degrades performance. Code is available at https://github.com/CeeZh/VTS.
- Abstract(参考訳): グラウンドドロングビデオ質問応答(Grounded LVQA)では、長いビデオに関する質問に答えると同時に、その答えを支持する短いエビデンス間隔をローカライズする必要がある。
最近のエージェント的手法では、このタスクを1つの crop_video(start, end) アクションでマルチターン探索と定義している。
結果として、これらのエージェントは通常、早めに収束し、早期のミスから回復することができない。
適応時間木上の反復的自己修正探索としてLVQAをキャストするフレームワークであるVideoTreeSearch(VTS)を提案する。
VTSは、視覚的なシーン境界から一様でないツリーを構築し、各ノードが意味的に一貫性のあるセグメントに対応するようにし、エージェントを訓練して4つの個別操作( zoom_in, zoom_out, shift, answer)を通してツリーをナビゲートする。
これらの操作は、暗黙の振る舞いではなく、明示的で学習可能なプリミティブとして、バックトラックとリカバリを公開する。
このナビゲーションを訓練するために,木を通る多段階経路を生成する軌道合成パイプラインを導入する。
これらのトラジェクトリを教師付き微調整に使用し,続いて接地と回答精度の報奨による強化学習を行った。
3つのグラウンドドLVQAベンチマーク(CG-Bench、Haystack-LVBench、Haystack-Ego4D)において、VTSはCG-Benchで+12.5 mIoU、Haystack-Ego4Dで+7.4 T-F1で最強のエージェント手法より優れている。
学習されたポリシーは、ビデオMME、MLVU、LVBenchの以前のエージェントベースラインを最大7.1の精度で上回る一般的な長ビデオQAにも移行する。
アブレーションは、自己修正階層探索がこれらのゲインの背後にある中心的なメカニズムであることを確認した。
コードはhttps://github.com/CeeZh/VTS.comで入手できる。
関連論文リスト
- Evidence-Backed Video Question Answering [90.93225758130426]
既存の説明可能性の取り組みは、テキストの合理性やまばらなバウンディングボックスに依存している。
E-VQA(Evidence-Backed Video Question Answering)を提案する。
これをサポートするために,識別的および生成的画素レベルのグラウンド化のための最初の人為的検証ベンチマークST-Evidenceを導入する。
論文 参考訳(メタデータ) (2026-07-13T17:49:10Z) - VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority [10.961731621875918]
長いビデオの質問応答には、非常に冗長なコンテンツの中で、スパースでタイムインスペクションされた視覚的証拠を見つける必要がある。
既存のLVUエージェントが「エビデンスミスアライメント」を提示できることを示す。
本稿では,画素レベルの検証において,解答権限とゲートの最終的な解答とを分離した分離型プランナー・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T10:37:49Z) - LongVideoAgent: Multi-Agent Reasoning with Long Videos [69.28914905197426]
本稿では,主LLMが問題関連セグメントの局所化のために接地エージェントをコーディネートするマルチエージェントフレームワークと,対象とするテキスト観察を抽出する視覚エージェントを提案する。
マスターエージェントは、ステップ制限で計画し、簡潔で正確で効率的なマルチエージェント協調を促進するために強化学習で訓練されている。
テレビQA/TVQA+から集約したエピソードレベルのデータセットであるLongTVQAとLongTVQA+では,マルチエージェントシステムは強力な非エージェントベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-12-23T18:59:49Z) - MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering [64.46361702927457]
Grounded Video Question Answering (Grounded VideoQA) では、テキストによる回答と明確な視覚的証拠の整合が必要である。
本研究では,ビデオグラウンド,質問応答,回答反射,集約を統一するMulti-Path AgenticアプローチであるMUPAを提案する。
論文 参考訳(メタデータ) (2025-06-22T15:39:02Z) - VideoExplorer: Think With Videos For Agentic Long-Video Understanding [117.68219930263153]
ロングビデオ理解はコンピュータビジョンにおいて難しい問題である。
ビデオによる思考の原則に基づくフレームワークであるVideoExplorerを提案する。
静的なコンテキストを推論する代わりに、VideoExplorerは、サブクエストを反復的に定式化し、関連するモーメントを特定し、タスク指向で時間的にスケーラブルなビデオ理解を実行する。
論文 参考訳(メタデータ) (2025-06-12T15:39:10Z) - ViQAgent: Zero-Shot Video Question Answering via Agent with Open-Vocabulary Grounding Validation [49.1574468325115]
本研究は、ゼロショットビデオ質問応答(VideoQA)のためのLCMブラインドエージェントを提案する。
Chain-of-Thoughtフレームワークと、YOLO-Worldと組み合わせて、オブジェクトのトラッキングとアライメントを強化する。
このアプローチは、NExT-QA、iVQA、ActivityNet-QAベンチマークのパフォーマンスを向上した、ビデオQAおよびビデオ理解における新しい最先端技術を確立する。
論文 参考訳(メタデータ) (2025-05-21T18:32:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。