論文の概要: VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority
- arxiv url: http://arxiv.org/abs/2605.12571v1
- Date: Tue, 12 May 2026 10:37:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.586792
- Title: VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority
- Title(参考訳): VideoSEAL: アンサー機関の分離によるエージェント的長時間ビデオ理解における証拠の誤認識の軽減
- Abstract要約: 長いビデオの質問応答には、非常に冗長なコンテンツの中で、スパースでタイムインスペクションされた視覚的証拠を見つける必要がある。
既存のLVUエージェントが「エビデンスミスアライメント」を提示できることを示す。
本稿では,画素レベルの検証において,解答権限とゲートの最終的な解答とを分離した分離型プランナー・フレームワークを提案する。
- 参考スコア(独自算出の注目度): 10.961731621875918
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long video question answering requires locating sparse, time-scattered visual evidence within highly redundant content. Although current MLLMs perform well on short videos, long videos introduce long-horizon search and verification, which often necessitates multi-turn, agentic interaction. We show that existing LVU agents can exhibit "evidence misalignment": they produce correct answers that are not supported by the retrieved or inspected evidence. To characterize this failure, we introduce two diagnostics (temporal groundedness and semantic groundedness) and use them to reveal two pressures that amplify misalignment: prompt pressure from shared-context saturation at inference time and reward pressure from outcome-only optimization during training. These findings point to a structural root cause: the coupled agent paradigm conflates long-horizon planning with answer authority. We therefore propose the decoupled planner-inspector framework, which separates planning from answer authority and gates final answering on pixel-level verification. Across four long-video benchmarks, our framework improves both answer accuracy and evidence alignment, achieving 55.1% on LVBench and 62.0% on LongVideoBench while producing interpretable search trajectories. Moreover, the decoupled architecture scales consistently with increased search budgets and supports plug-and-play upgrades of the MLLM backbone without retraining the planner. Code and models are available at https://github.com/Echochef/VideoSEAL.
- Abstract(参考訳): 長いビデオの質問応答は、非常に冗長なコンテンツの中で、スパースで時間散らばった視覚的証拠を見つける必要がある。
現在のMLLMは、短いビデオではうまく機能するが、長いビデオは長い水平探索と検証を導入し、しばしばマルチターン、エージェント間相互作用を必要とする。
既存のLVUエージェントは、検索された証拠や検査された証拠に支えられていない正しい回答を導き出す「証拠の誤り」を提示できることを示す。
この障害を特徴付けるために,2つの診断手法(時間的基盤性,意味的基盤性)を導入し,誤認識を増幅する2つの圧力を明らかにする。
これらの知見は構造的根本原因を示唆している: 結合エージェントのパラダイムは、答えの権威と長い水平計画が混ざり合っている。
そこで我々は,画素レベルの検証において,解答権限とゲートの最終的な解答からプランニングを分離する分離型プランナー・インスペクタ・フレームワークを提案する。
LVBenchでは55.1%,LongVideoBenchでは62.0%,解釈可能な検索トラジェクトリでは62.0%であった。
さらに、分離されたアーキテクチャは検索予算の増加とともに一貫してスケールし、プランナーを再訓練することなくMLLMバックボーンのプラグアンドプレイアップグレードをサポートする。
コードとモデルはhttps://github.com/Echochef/VideoSEAL.comで公開されている。
関連論文リスト
- VideoScout: Learning Agentic Active Exploration with Adaptive Reasoning Pacing for Long Video Understanding [61.00809248898572]
ロングビデオ理解(英: Long video understanding)とは、エージェントが時間軸に沿って回転してビデオを読み取る問題である。
適応推論によるSEAパラダイムをインスタンス化するマルチターン推論エージェントである textbfVideoScout を提案する。
長いビデオ理解と推論のベンチマーク実験により、我々の7Bモデルは、既存の訓練された7Bエージェントモデルと比較して、強い性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-09-14T14:04:03Z) - Online Video Agent Harness for Long Video Understanding [35.044765942623876]
長いビデオ理解は、しばしば視覚的な針・ア・ヘイスタック問題のように振る舞う。
既存のビデオエージェントは、クエリに依存しないオフライン前処理やアドホックツールセットに依存することが多い。
我々は、ビデオ理解のための純粋にオンラインビデオエージェントであるVideoXAgentを紹介する。
論文 参考訳(メタデータ) (2026-09-11T13:13:03Z) - Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos [50.28847179290796]
PACEは、長期的な証拠取得のためのファクター誘導フレームワークである。
オープンソースのQwen3-VLバックボーンを持つMMR-Vでは、PACEは42.6%の精度を達成している。
論文 参考訳(メタデータ) (2026-08-26T19:38:17Z) - Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA [64.65523062099061]
グラウンドドロングビデオ質問応答(Grounded LVQA)では、長いビデオに関する質問に答えると同時に、その答えを支持する短いエビデンス間隔をローカライズする必要がある。
最近のエージェント的手法では、このタスクを、粗い粒度の絞り込みをサポートする単一の crop_video(start, end) アクションでマルチターン探索とみなしている。
適応時間木上の反復的自己修正探索としてLVQAをキャストするフレームワークであるVideoTreeSearch(VTS)を提案する。
論文 参考訳(メタデータ) (2026-07-17T17:59:27Z) - Evidence-Backed Video Question Answering [90.93225758130426]
既存の説明可能性の取り組みは、テキストの合理性やまばらなバウンディングボックスに依存している。
E-VQA(Evidence-Backed Video Question Answering)を提案する。
これをサポートするために,識別的および生成的画素レベルのグラウンド化のための最初の人為的検証ベンチマークST-Evidenceを導入する。
論文 参考訳(メタデータ) (2026-07-13T17:49:10Z) - Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding [25.82963105515627]
VideoHV-Agentは、構造化仮説検証プロセスとしてビデオ質問応答を再構成するフレームワークである。
ビデオHV-Agentは,解釈性の向上,論理的音質の向上,計算コストの低減を実現し,最先端の精度を実現する。
論文 参考訳(メタデータ) (2026-03-05T09:16:07Z) - Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding [38.87967229483403]
Video-TwGは、新しいThink-with-Groundingパラダイムを採用したカリキュラム強化フレームワークである。
Video-TwGは、複雑な補助モジュールや注釈付き推論トレースに頼ることなく、簡単にエンドツーエンドでトレーニングすることができる。
提案アルゴリズムは, 微粒な接地報酬, 自己確認擬似報酬, 精度保証機構を特徴とする。
論文 参考訳(メタデータ) (2026-02-21T03:16:23Z) - LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling [87.98096428508181]
LongVTは、Multimodal Chain-of-Tool-Thoughtを通じて"Thinking with Long Videos"を可能にするエンドツーエンドのエージェントフレームワークである。
我々は、LMM固有の時間的接地機能を利用して、特定のビデオクリップをズームインし、よりきめ細かいビデオフレームを再サンプリングするネイティブビデオトリミングツールを開発した。
トレーニングデータセットは, ツール統合型冷間始動微調整用247.9K試料, エージェント強化学習用1.6K試料, エージェント強化微調整用15.4K試料からなる。
論文 参考訳(メタデータ) (2025-11-25T19:22:48Z) - VideoExplorer: Think With Videos For Agentic Long-Video Understanding [117.68219930263153]
ロングビデオ理解はコンピュータビジョンにおいて難しい問題である。
ビデオによる思考の原則に基づくフレームワークであるVideoExplorerを提案する。
静的なコンテキストを推論する代わりに、VideoExplorerは、サブクエストを反復的に定式化し、関連するモーメントを特定し、タスク指向で時間的にスケーラブルなビデオ理解を実行する。
論文 参考訳(メタデータ) (2025-06-12T15:39:10Z) - ViQAgent: Zero-Shot Video Question Answering via Agent with Open-Vocabulary Grounding Validation [49.1574468325115]
本研究は、ゼロショットビデオ質問応答(VideoQA)のためのLCMブラインドエージェントを提案する。
Chain-of-Thoughtフレームワークと、YOLO-Worldと組み合わせて、オブジェクトのトラッキングとアライメントを強化する。
このアプローチは、NExT-QA、iVQA、ActivityNet-QAベンチマークのパフォーマンスを向上した、ビデオQAおよびビデオ理解における新しい最先端技術を確立する。
論文 参考訳(メタデータ) (2025-05-21T18:32:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。