論文の概要: REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering
- arxiv url: http://arxiv.org/abs/2608.08612v1
- Date: Sun, 09 Aug 2026 09:55:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.884302
- Title: REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering
- Title(参考訳): ReVEAL: 長時間ビデオによる質問応答の正確性検証のためのルーブリックガイドエージェント
- Abstract要約: REVEALは、長いビデオ質問応答のためのルーリック誘導エージェントフレームワークである。
本稿では,視覚的コヒーレントな隣接フレームを自然なイベント単位にグループ化する適応型視覚類似性に基づく前処理パイプラインを提案する。
この構造化メモリ上に構築されたREVEALは、自動的に構築されたルーリックライブラリを使用して、検索された証拠が満足度基準を満たすかどうかを明示的に検証する。
- 参考スコア(独自算出の注目度): 25.519927761448603
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, retrieval-augmented and memory-augmented methods have emerged as two promising paradigms for long-video question answering. However, existing methods typically rely on rigid, fixed-length temporal chunking (e.g., 10s) and static offline memory banks, which not only fragment coherent continuous events but also fail to adapt during real-time reasoning. Moreover, whether using multi-scale summaries or multimodal knowledge graphs, current approaches prioritize retrieval relevance while overlooking evidence sufficiency, often stopping to answer once only semantically relevant clues are retrieved, even when key temporal, causal, or fine-grained action evidence is still missing. To tackle these challenges, we propose REVEAL, a rubric-guided agent framework. As a foundation, we introduce an adaptive visual-similarity-based preprocessing pipeline that groups visually coherent adjacent frames into natural event units to construct an offline-online video memory---capturing global video context offline while dynamically maintaining question-conditioned memory online. Built upon this structured memory, REVEAL uses an automatically constructed rubric library to explicitly verify whether retrieved evidence satisfies sufficiency criteria, pinpoints missing clues upon verification failure, and directs targeted re-retrieval for complementary information. Without any extra training, REVEAL consistently outperforms both closed-source and open-source state-of-the-art methods across extensive experiments. These results show that explicitly verifying evidence sufficiency, rather than stopping at semantic relevance, retrieves the decisive clues that prior methods miss and yields more reliable long-video reasoning.
- Abstract(参考訳): 近年,長期ビデオ質問応答のための2つのパラダイムとして,検索・拡張・メモリ拡張手法が登場している。
しかし、既存のメソッドは通常、厳密で固定長の時間チャンキング(例:10s)と静的なオフラインメモリバンクに頼っている。
さらに、マルチスケールの要約やマルチモーダルな知識グラフを用いても、現在のアプローチでは、証拠の不十分さを乗り越えながら、検索関連性を優先し、重要な時間的、因果的、きめ細かなアクション証拠がまだ欠落している場合でも、意味的に関係した手がかりのみを検索すると、答えが止まることが多い。
これらの課題に対処するために,ルーリック誘導型エージェントフレームワークであるREVEALを提案する。
基礎として,視覚的コヒーレントな隣接フレームを自然なイベント単位にグループ化してオフラインのオンラインビデオメモリを構築するための適応的視覚類似性に基づく前処理パイプラインを導入し,オンライン上での質問条件付きメモリを動的に維持しながら,グローバルビデオコンテキストをオフラインでキャプチャする。
この構造化メモリ上に構築されたREVEALは、自動構築されたルーブリックライブラリを使用して、検索された証拠が満足度基準を満たしているかどうかを明示的に検証し、検証失敗の手がかりの欠如を指摘し、補完的な情報のためにターゲットの再検索を指示する。
余分なトレーニングがなければ、REVEALは幅広い実験を通じて、クローズドソースとオープンソースの両方の最先端の手法を一貫して上回ります。
これらの結果は, 意味的関連性に留意するよりも, 証拠の有効性を明確に検証することが, 先行手法がより信頼性の高い長ビデオ推論を欠いているという決定的な手がかりを回収することを示している。
関連論文リスト
- Navigating Sparse Evidence: Agentic Visual RAG via Explicit Context Selection and Consolidation [50.92223196290564]
明示的な証拠選択と統合のための統一エージェントループを提案する。
探索中、SCoREはクエリ関連観測とソースポインタのみを保守されたテキスト台帳に保持する。
終了時には、参照された元のイメージを再ロードし、答えの視覚的証拠を統合し、論理的なシーケンスにアレンジする。
論文 参考訳(メタデータ) (2026-09-14T16:11:35Z) - Beyond One-Shot Expansion: Contrastive Evidence Exploration for Multi-Hop Retrieval [19.37201042661162]
本研究では,エビデンス条件付き探索,パス特化コントラスト改善,カバレッジ対応ファイナルランキングを組み込んだ,トレーニング不要なマルチホップ検索フレームワークを提案する。
MuSiQue、HotpotQA、および2WikiMultihopQAの実験では、ベースラインよりも検索品質と下流QAパフォーマンスが一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-07T05:13:56Z) - SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering [8.538563236020947]
SAFE-Gは構造対応のFiveence-Guided Generationフレームワークである。
正確な証拠のローカライズと信頼できる推論を可能にする。
従来の手法を8.9%と3.5%で上回っている。
論文 参考訳(メタデータ) (2026-08-22T06:34:53Z) - MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents [26.87993979719045]
メモリ拡張LDMエージェントは通常、関連するメモリを検索し、直接回答モデルに入力することでクエリに応答する。
提案するMemChainは、検索した候補を応答対応アクティブメモリに変換する訓練後のメモリポリシーである。
MemChainは、クローズドソースとオープンウェイトフリートの両方の解答モデルにおいて、最先端のパフォーマンスを一貫して達成していることを示す。
論文 参考訳(メタデータ) (2026-07-27T07:37:43Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning [78.94047086588078]
長文推論のための LLM Harness として再帰的証拠を提案する。
長文推論を改善するための訓練不要推論法である。
128Kのコンテキスト長を持つ8つの長文データセットの実験は、エビデンスの利用を一貫して改善していることを示している。
論文 参考訳(メタデータ) (2026-07-02T17:59:26Z) - Governed Shared Memory for Multi-Agent LLM Systems [1.2178992475191557]
本稿では,フリートメモリの問題を定式化し,基礎的障害モードを4つ同定する。
システムレベルの明示的なプリミティブを定義する。スコープ付き検索,時間的スーパーセッション,プロファイランストラッキング,ポリシが支配するメモリ伝搬である。
これらのプリミティブは、プロダクションマルチテナントメモリサービスであるMemClawで実装され、ArgusFleet経由で評価される。
論文 参考訳(メタデータ) (2026-06-23T13:04:14Z) - MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory [80.97855900579512]
既存の評価では、エージェントが後続の推論に必要な視覚的証拠を保存するかどうかを検査することはめったにない。
メモリ性能を2次元から評価するフレームワークであるMemEyeを紹介する。
本フレームワークでは,8つのライフシナリオタスクにまたがる新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2026-05-14T17:37:52Z) - Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval [70.47320120707029]
部分的関連性のあるビデオ検索は、部分的コンテンツのみを記述するテキストクエリを使って、未編集の動画を検索することを目的としている。
この設定では、曖昧なクエリはしばしばビデオ間のセマンティックなあいまいさを引き起こす。
我々は,多粒質のクロスモーダルな証拠を集約し,不確実性を定量化し,モデル化する階層的顕在的学習フレームワークであるHolmesを提案する。
論文 参考訳(メタデータ) (2026-05-07T12:06:13Z) - All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution [20.68235182577703]
All-Memは明示的で非破壊的な統合を通じて構造化されたメモリバンクを維持している。
LLM診断器は定期的にオフラインで、SPLIT、MERGE、UPDATEの3つの演算子で実行される信頼性スコアトポロジ編集を提案する。
クエリ時には、タイプドリンクはホップバウンドで、アクティブアンカーから必要に応じてアーカイブされたエビデンスへの予算付き拡張を可能にする。
論文 参考訳(メタデータ) (2026-03-20T03:14:40Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。