論文の概要: From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents
- arxiv url: http://arxiv.org/abs/2608.31005v2
- Date: Fri, 04 Sep 2026 09:45:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 13:53:00.4281
- Title: From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents
- Title(参考訳): インテントからエビデンスへ:ロングビデオエージェントのためのポリシステアリングマルチストラテジー検索
- Abstract要約: VESTAは、ルート条件付き取得・検証・統合ループとして組織された、トレーニング不要の長ビデオエージェントである。
時間的エビデンス台帳は、観測結果を適応的で圧縮された時間的位置、証明、カバレッジ、コンフリクト、検証結果、仮説支持の視点に集約する。
- 参考スコア(独自算出の注目度): 28.84798025130296
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing long-video agents acquire evidence through one uniform behavior, ignoring whether the required evidence is concentrated, requires broad occurrence coverage, or must discriminate competing hypotheses---which can cause failure before substantive reasoning begins. Prescribing a fine-grained solution procedure for every question is not a satisfactory remedy, as it restricts autonomous exploration. We propose VESTA, a training-free long-video agent organized as a route-conditioned acquire--verify--consolidate loop. Before exploration, an intent router infers an evidence-acquisition policy---focused, recall, or contrastive retrieval over a shared visual--speech scene index---together with an evidence-accounting policy that configures the evidence view maintained during exploration. Policy-steered retrieval yields provisional references that multimodal evidence operations convert into observations, while the Reasoner remains free to verify them, re-query using intermediate findings, or inspect regions outside the retrieved set. A temporal evidence ledger consolidates observations into an adaptive, compressed view of temporal location, provenance, coverage, conflicts, verification outcomes, and hypothesis support, exposing missing and unresolved evidence to guide subsequent acquisition; finalization prioritizes verified observations. On Video-MME-v2, VESTA improves average accuracy by 2.7 points over VideoARM and gains across all six reported metrics. On LongVideoBench, EgoSchema, and LVBench under shared query-time models, it improves by 6.9 points on the LongVideoBench long subset and 1.5 on LVBench, and matches VideoARM on EgoSchema.
- Abstract(参考訳): 既存のビデオエージェントは、1つの一様行動を通じて証拠を取得し、必要な証拠が集中しているかどうかを無視したり、広範な発生範囲を必要としたり、競合する仮説を識別しなければならない。
あらゆる質問に対してきめ細かい解法を規定することは、自律的な探索を制限するため、満足のいく治療法ではない。
経路条件付き取得-検証-統合ループとして構成されたトレーニング不要な長ビデオエージェントであるVESTAを提案する。
探索前、意図的ルータは、探索中に保持される証拠のビューを構成する証拠会計ポリシーを用いて、共有された視覚的シーンインデックスに対して、エビデンス獲得ポリシー-焦点を絞った、リコールまたはコントラスト的な検索を推論する。
政策ステアリングされた検索は、マルチモーダルなエビデンス操作が観察に変換されるという暫定的な参照を与える一方、Reasonerはそれらを検証したり、中間的な結果を使って再クエリしたり、検索された集合の外側の領域を検査したりすることができる。
時間的エビデンス台帳は、観察を適応的で圧縮された時間的位置、証明、カバレッジ、コンフリクト、検証結果、仮説支持に集約し、未解決の証拠を暴露し、その後の取得を導く。
Video-MME-v2では、VESTAはVideoARMよりも平均精度を2.7ポイント向上し、報告された6つのメトリクスすべてにまたがっている。
LongVideoBench、EgoSchema、LVBenchのクエリタイムモデルでは、LongVideoBenchのロングサブセットで6.9ポイント、LVBenchで1.5ポイント改善され、EgoSchemaでVideoARMにマッチする。
関連論文リスト
- Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos [50.28847179290796]
PACEは、長期的な証拠取得のためのファクター誘導フレームワークである。
オープンソースのQwen3-VLバックボーンを持つMMR-Vでは、PACEは42.6%の精度を達成している。
論文 参考訳(メタデータ) (2026-08-26T19:38:17Z) - REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering [25.519927761448603]
REVEALは、長いビデオ質問応答のためのルーリック誘導エージェントフレームワークである。
本稿では,視覚的コヒーレントな隣接フレームを自然なイベント単位にグループ化する適応型視覚類似性に基づく前処理パイプラインを提案する。
この構造化メモリ上に構築されたREVEALは、自動的に構築されたルーリックライブラリを使用して、検索された証拠が満足度基準を満たすかどうかを明示的に検証する。
論文 参考訳(メタデータ) (2026-08-09T09:55:42Z) - Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection [15.95488291516215]
マルチモーダルビデオ誤情報検出は、一般的に、全体論的ビデオ理解タスクとして定式化される。
マルチモーダルビデオ誤情報検出における抽出によるスパース・インタラクティブ・エビデンス検証のためのフレームワークであるSIEVEを提案する。
論文 参考訳(メタデータ) (2026-07-20T15:48:31Z) - EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence [48.314554375516366]
本稿では,Evidence-Grounded Video Question Answering Benchmark (EG-VQA)を紹介する。
EG-VQAは2,067本の動画と11,838本のQAペアで構成されている。
強力なプロプライエタリモデルでさえ、予測を正確に下ろすのに苦労しています。
我々は,明示的な監督によって訓練されたエビデンス基底推論モデルEG-Reasonerを提案する。
論文 参考訳(メタデータ) (2026-06-23T16:49:28Z) - VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority [10.961731621875918]
長いビデオの質問応答には、非常に冗長なコンテンツの中で、スパースでタイムインスペクションされた視覚的証拠を見つける必要がある。
既存のLVUエージェントが「エビデンスミスアライメント」を提示できることを示す。
本稿では,画素レベルの検証において,解答権限とゲートの最終的な解答とを分離した分離型プランナー・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T10:37:49Z) - Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval [70.47320120707029]
部分的関連性のあるビデオ検索は、部分的コンテンツのみを記述するテキストクエリを使って、未編集の動画を検索することを目的としている。
この設定では、曖昧なクエリはしばしばビデオ間のセマンティックなあいまいさを引き起こす。
我々は,多粒質のクロスモーダルな証拠を集約し,不確実性を定量化し,モデル化する階層的顕在的学習フレームワークであるHolmesを提案する。
論文 参考訳(メタデータ) (2026-05-07T12:06:13Z) - Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding [25.82963105515627]
VideoHV-Agentは、構造化仮説検証プロセスとしてビデオ質問応答を再構成するフレームワークである。
ビデオHV-Agentは,解釈性の向上,論理的音質の向上,計算コストの低減を実現し,最先端の精度を実現する。
論文 参考訳(メタデータ) (2026-03-05T09:16:07Z) - Video-BrowseComp: Benchmarking Agentic Video Research on Open Web [64.53060049124961]
Video-BrowseCompは、オープンウェブのエージェントによるビデオ推論に適した210の質問からなるベンチマークである。
これは時間的視覚的証拠に必須に依存しており、回答はテキスト検索のみでは導き出せないことを保証している。
初のオープンWebビデオ調査ベンチマークとして、Video-BrowseCompは、受動的知覚を越えて、プロアクティブなビデオ推論へと分野を前進させた。
論文 参考訳(メタデータ) (2025-12-28T19:08:27Z) - Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding [139.83981719664794]
LVU(Long Video Understanding)は、現実のクエリに答えることが、数時間の計算時間内に埋められた、時間的に分散されたキューと無関係なコンテンツに依存するため、難しい。
我々は,映像をインタラクティブな環境として扱うエビデンス検索フレームワークであるActive Video Perception(AVP)を,画素から直接クエリ関連エビデンスを取得する。
論文 参考訳(メタデータ) (2025-12-05T15:03:48Z) - VITED: Video Temporal Evidence Distillation [49.38292490256531]
そこで我々は,チェーン・オブ・エビデンス推論による複雑なビデオ質問応答について検討した。
モデルは、固定数のフレームを均一にサンプリングするため、多段階の推論に苦労する。
本稿では,既存のビデオQAデータセットをエビデンス・アソシエーション・チェーンで拡張するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-17T06:30:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。