論文の概要: DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding
- arxiv url: http://arxiv.org/abs/2608.07067v1
- Date: Fri, 07 Aug 2026 10:16:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.462601
- Title: DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding
- Title(参考訳): DocMemo:マルチモーダル文書理解のための確率的メモリガイド検索による動的エビデンス発見
- Abstract要約: 長い文書の理解には、数百ページにわたるまばらで異質な証拠を見つける必要がある。
動的エビデンス探索として長期文書推論を定式化するメモリガイドフレームワークDocMemoを提案する。
3つのベンチマーク実験の結果、DocMemoは最先端のパフォーマンスを実現し、構造化メモリの有効性と動的ページ信念の更新の有効性を検証した。
- 参考スコア(独自算出の注目度): 6.3805171496158195
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-document understanding requires locating sparse and heterogeneous evidence across hundreds of pages, yet existing systems remain limited by static retrieval and fragile cross-round memory. Mainstream single-round methods commit to a fixed top-$k$ page set at the outset and struggle to recover from early retrieval errors; recent iterative approaches allow multi-round evidence acquisition, but they do not investigate the propagation mechanism of cross-round states, making it difficult to track the dynamic changes in page relevance. To address these limitations, we propose DocMemo, a memory-guided framework that formulates long-document reasoning as dynamic evidence exploration. DocMemo maintains a tri-level retrieval state consisting of Document Schema Memory, Page Belief Memory, and Question Episodic Memory, which respectively capture structural priors, dynamic relevance estimation, and query-specific reasoning trajectories. During reasoning, DocMemo continuously refines cross-round page selection through Bayesian page belief updating with Thompson sampling, spatial proximity propagation, and structure-aware adaptive-granularity evidence access, while supplementing page-level evidence with fine-grained visual regions. Experiments on 3 benchmarks show that DocMemo achieves state-of-the-art performance and validate the efficacy of structured memory and dynamic page belief updating. Code is available at https://github.com/Harrygof/DocMemo.
- Abstract(参考訳): 長い文書の理解には数百ページにわたるスパースと異質な証拠の発見が必要であるが、既存のシステムは静的検索と脆弱なクロスラウンドメモリによって制限されている。
近年の反復的手法では,複数ラウンドのエビデンス取得が可能となっているが,クロスラウンド状態の伝播機構は調査されていないため,ページ関連性の動的変化の追跡が困難である。
これらの制約に対処するために,動的エビデンス探索として長期文書推論を定式化するメモリ誘導フレームワークDocMemoを提案する。
DocMemoはDocument Schema Memory, Page Belief Memory, Question Episodic Memoryで構成される3段階の検索状態を維持しており,それぞれが構造的事前情報,動的関連性推定,クエリ固有の推論トラジェクトリをキャプチャする。
推論中、DocMemoは、トンプソンサンプリング、空間的近接伝播、構造に適応した粒度証拠へのアクセスでベイズページの信念を更新し、ページレベルの証拠をきめ細かな視覚領域で補いながら、ページ間のページ選択を継続的に洗練する。
3つのベンチマーク実験の結果、DocMemoは最先端のパフォーマンスを実現し、構造化メモリの有効性と動的ページ信念の更新の有効性を検証した。
コードはhttps://github.com/Harrygof/DocMemoで入手できる。
関連論文リスト
- Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding [64.34948094316685]
latentStreamは、ストリーミングメモリをストア・アンド・レトリーブから検索・インターナライズへシフトする、プログレッシブな潜伏型ワーキングメモリフレームワークです。
LatentStreamは、既存のオンラインおよびオフラインビデオベンチマークで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2026-09-03T17:28:14Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - Trace Only What You Need: Structure-Aware On-Demand Hypergraph Memory for Long-Document Question Answering [11.17007249581283]
長い文書の質問応答は、長い文書に散在する証拠を推論するために大きな言語モデルを必要とする。
既存の構造化RAG手法には,コストのかかるクエリ非依存の知識組織,オリジナルドキュメント構造の使用不足,歴史的推論経験の再利用の3つの制限がある。
本稿では、問合せトリガードナレッジ組織、文書構造認識、経験誘導推論をサポートする長期文書QAのためのマルチエージェントRAGフレームワークDocTraceを提案する。
論文 参考訳(メタデータ) (2026-06-09T14:29:06Z) - Infini Memory: Maintainable Topic Documents for Long-Term LLM Agent Memory [19.802226925602927]
長期的なLLMエージェントは、変化する事実を追跡し、セッション間で関連する証拠を提供する、永続的なメモリを必要とする。
Infini Memoryは、エージェントメモリをトピック構造化文書として扱う、保守可能なテキストベースの永続メモリアーキテクチャである。
論文 参考訳(メタデータ) (2026-06-09T10:31:51Z) - Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents [51.30250860677378]
本稿では,連想記憶グラフとアクティブな再構成機構を組み合わせたフレームワークであるMRAgentを提案する。
Cue-Tag-Contentグラフ上で実行することで,メモリアクセスに直接推論を統合する。
LoCoMoベンチマークとLongMemEvalベンチマークの実験は、強いベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-06-04T11:29:46Z) - MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA [23.25080415779712]
本稿では,長期文書QAを3つの特殊エージェントに分解するメモリ・アウェア・リファインメント・エージェント・フレームワークを提案する。
イテレーションを通じてエージェントは、完全に蓄積されたインタラクション履歴ではなく、動的に更新された構造化メモリに依存する。
MMLongBench-DocとDocBenchの実験により、MARDocは、同じバックボーンベースラインよりも優れた結果が得られることが示された。
論文 参考訳(メタデータ) (2026-06-04T06:23:01Z) - HMARS: A Hierarchical Multi-Agent Memory System for Long-Context Reasoning [17.783618926697066]
長いコンテキスト推論は、文書、対話、相互作用履歴に散在する証拠にアクセス、検索、統合するモデルを必要とする。
本研究では,長いコンテキストをフラットな検索コーパスではなく管理メモリとして扱う階層型マルチエージェントメモリシステムであるHMARSを提案する。
論文 参考訳(メタデータ) (2026-06-03T07:15:11Z) - MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory [80.97855900579512]
既存の評価では、エージェントが後続の推論に必要な視覚的証拠を保存するかどうかを検査することはめったにない。
メモリ性能を2次元から評価するフレームワークであるMemEyeを紹介する。
本フレームワークでは,8つのライフシナリオタスクにまたがる新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2026-05-14T17:37:52Z) - Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA [71.42483000929614]
複数ページのドキュメント 視覚的質問回答は、長い、視覚的に密集したドキュメントにおける意味論、レイアウト、および視覚的要素の推論を必要とする。
我々は,多ページDocVQAをシーケンシャルエビデンスアグリゲーションとしてキャストするtextbfOCRフリーエージェントフレームワークであるDoc-$V*$を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:12:27Z) - Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking [58.69615583599489]
Deliberate Thinking based Retriever (Debater) は、段階的な思考プロセスを導入することで文書表現を強化する新しいアプローチである。
Debaterは、いくつかのベンチマークで既存のメソッドよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-02-18T15:56:34Z) - DAPR: A Benchmark on Document-Aware Passage Retrieval [57.45793782107218]
我々は,このタスクemphDocument-Aware Passage Retrieval (DAPR)を提案する。
State-of-The-Art(SoTA)パスレトリバーのエラーを分析しながら、大きなエラー(53.5%)は文書コンテキストの欠如に起因する。
提案するベンチマークにより,検索システムの開発・比較を今後行うことができる。
論文 参考訳(メタデータ) (2023-05-23T10:39:57Z) - Natural Logic-guided Autoregressive Multi-hop Document Retrieval for
Fact Verification [21.04611844009438]
マルチホップ検索のための新しい検索・参照手法を提案する。
知識ソース内の文書と、以前検索された文書から文を共同でスコアする検索器で構成されている。
証拠が十分であると判断された場合、検索プロセスを動的に終了する証明システムによってガイドされる。
論文 参考訳(メタデータ) (2022-12-10T11:32:38Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。