論文の概要: Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos
- arxiv url: http://arxiv.org/abs/2608.26355v1
- Date: Wed, 26 Aug 2026 19:38:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.166126
- Title: Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos
- Title(参考訳): 正しい証拠を見つける:長いビデオのための因子誘導粗相関推論
- Authors: Baixuan Xu, Yinyui Xu, Tianshi Zheng, Zhaowei Wang, Weiqi Wang, Haochen Shi, Jiayu Liu, Qing Zong, Xiyu Ren, Xinyu Geng, Zhitao He, Yangqiu Song,
- Abstract要約: PACEは、長期的な証拠取得のためのファクター誘導フレームワークである。
オープンソースのQwen3-VLバックボーンを持つMMR-Vでは、PACEは42.6%の精度を達成している。
- 参考スコア(独自算出の注目度): 50.28847179290796
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While LVLMs rapidly improve, long-video question answering still remains challenging: relevant evidence is sparse, and question-relevant context often fails to provide cues that discriminate the correct answer from plausible alternatives. Diagnostic analysis on a manually annotated subset of MMR-V shows that prior agentic systems substantially improve cue retrieval over direct VLM inference yet fail to achieve a corresponding gain in answer accuracy, indicating that the bottleneck lies in option-discriminative evidence rather than topical relevance alone. We propose PACE (Progressive Acquisition of Critical Evidence), a factor-guided framework for long-video evidence acquisition. PACE proceeds in two stages: it first indexes clip-level descriptions guided by question-derived factors without observing the candidate answers; it then uses the candidate answers to derive contrastive cues and queries the index for verification. On MMR-V with the open-source Qwen3-VL backbone, PACE achieves 42.6% accuracy, outperforming direct inference and prior agentic baselines including Deep Video Discovery (DVD). On the same diagnostic subset, PACE recovers 66.9% of the annotated cues, providing empirical evidence that its gains are associated with improved evidence recovery rather than stronger answer-side priors alone. Consistent gains over DVD on LVBench, Video-MME, EgoSchema, and LongVideoBench suggest that option-aware evidence acquisition transfers beyond MMR-V. Code is available at https://github.com/HKUST-KnowComp/PACE.
- Abstract(参考訳): LVLMは急速に改善するが、長いビデオの質問応答は依然として困難なままであり、関連する証拠は希薄であり、質問関連コンテキストはしばしば、正しい答えを妥当な代替品と区別する手がかりを提供するのに失敗する。
手動でアノテートされたMMR-Vのサブセットの診断分析により、従来のエージェントシステムは直接のVLM推論よりもキュー検索を著しく改善するが、応答精度の相当な向上は得られず、ボトルネックは、トピックの関連性のみではなく、オプションの識別的なエビデンスにあることが示されている。
PACE(Progressive Acquisition of critical Evidence)は,長期的証拠取得のための要因誘導フレームワークである。
PACEは、まず、質問から導かれる要因によって導かれるクリップレベルの記述を、候補の回答を観察せずにインデックス化し、次に、候補回答を使用して、コントラスト的な手がかりを導出し、検証のためにインデックスをクエリする。
オープンソースのQwen3-VLバックボーンを持つMMR-Vでは、PSEは42.6%の精度で、直接推論とDeep Video Discovery (DVD)を含む以前のエージェントベースラインを上回っている。
同じ診断サブセットでは、PACEは注釈付きキューの66.9%を回復し、その利得がより強い回答側の先行よりも改善された証拠回復に結びついているという実証的な証拠を提供する。
LVBench、Video-MME、EgoSchema、LongVideoBenchのDVDでは、MMR-V以上のエビデンス獲得が認められている。
コードはhttps://github.com/HKUST-KnowComp/PACEで入手できる。
関連論文リスト
- Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models? [22.988311596447435]
ビジュアル検索強化生成(RAG)は、通常、検索されたエビデンスを拡張して、回答ページのカバレッジを改善する。
この仮定は拡散言語モデル(DLM)に当てはまらないことを示す。
トレーニング不要なエビデンス・アドミッションフレームワークであるEntropy-Based Candidate Filter (ECF)を提案する。
論文 参考訳(メタデータ) (2026-08-07T09:20:40Z) - EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence [48.314554375516366]
本稿では,Evidence-Grounded Video Question Answering Benchmark (EG-VQA)を紹介する。
EG-VQAは2,067本の動画と11,838本のQAペアで構成されている。
強力なプロプライエタリモデルでさえ、予測を正確に下ろすのに苦労しています。
我々は,明示的な監督によって訓練されたエビデンス基底推論モデルEG-Reasonerを提案する。
論文 参考訳(メタデータ) (2026-06-23T16:49:28Z) - VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority [10.961731621875918]
長いビデオの質問応答には、非常に冗長なコンテンツの中で、スパースでタイムインスペクションされた視覚的証拠を見つける必要がある。
既存のLVUエージェントが「エビデンスミスアライメント」を提示できることを示す。
本稿では,画素レベルの検証において,解答権限とゲートの最終的な解答とを分離した分離型プランナー・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T10:37:49Z) - Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval [70.47320120707029]
部分的関連性のあるビデオ検索は、部分的コンテンツのみを記述するテキストクエリを使って、未編集の動画を検索することを目的としている。
この設定では、曖昧なクエリはしばしばビデオ間のセマンティックなあいまいさを引き起こす。
我々は,多粒質のクロスモーダルな証拠を集約し,不確実性を定量化し,モデル化する階層的顕在的学習フレームワークであるHolmesを提案する。
論文 参考訳(メタデータ) (2026-05-07T12:06:13Z) - VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA [42.454642585543446]
ビデオテキストベースの視覚的質問応答 (Video TextVQA) は、ビデオに現れる視覚的テキストコンテンツについて推論することで質問に答えることを目的としている。
そこで本研究では,回答の前に関連事項を明示的にアンカーする質問誘導型エージェントフレームワークを提案する。
本研究は,ビデオテキストVQAの進行において,明示的なアンカーが重要な役割を担っていることを明らかにする。
論文 参考訳(メタデータ) (2026-05-06T13:01:52Z) - Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding [25.82963105515627]
VideoHV-Agentは、構造化仮説検証プロセスとしてビデオ質問応答を再構成するフレームワークである。
ビデオHV-Agentは,解釈性の向上,論理的音質の向上,計算コストの低減を実現し,最先端の精度を実現する。
論文 参考訳(メタデータ) (2026-03-05T09:16:07Z) - Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding [139.83981719664794]
LVU(Long Video Understanding)は、現実のクエリに答えることが、数時間の計算時間内に埋められた、時間的に分散されたキューと無関係なコンテンツに依存するため、難しい。
我々は,映像をインタラクティブな環境として扱うエビデンス検索フレームワークであるActive Video Perception(AVP)を,画素から直接クエリ関連エビデンスを取得する。
論文 参考訳(メタデータ) (2025-12-05T15:03:48Z) - ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering [54.72902502486611]
ReAG(Reasoning-Augmented Multimodal RAG)は、粗い部分ときめ細かい部分の検索と、無関係な通路をフィルタリングする批評家モデルを組み合わせた手法である。
ReAGは従来の手法よりも優れており、解答精度が向上し、検索された証拠に根ざした解釈可能な推論を提供する。
論文 参考訳(メタデータ) (2025-11-27T19:01:02Z) - Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding [56.45689495743107]
Vgentは、長いビデオ理解のためにLVLMを強化するグラフベースの検索推論拡張生成フレームワークである。
我々は,3つの長ビデオ理解ベンチマークを用いて,様々なオープンソースLVLMを用いてフレームワークの評価を行った。
論文 参考訳(メタデータ) (2025-10-15T19:14:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。