論文の概要: DoPR: Reusable Compressed Document Prefixes for Efficient LLM Reranking
- arxiv url: http://arxiv.org/abs/2609.03311v1
- Date: Thu, 03 Sep 2026 03:02:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.898812
- Title: DoPR: Reusable Compressed Document Prefixes for Efficient LLM Reranking
- Title(参考訳): DoPR: 効率的なLLMリグレードのための再使用可能な圧縮ドキュメントプレフィックス
- Abstract要約: 大規模言語モデル(LLM)は効果的な再ランカであるが、ポイントワイドで同じドキュメントを異なるクエリで繰り返し処理する。
オンライン更新からオフライン文書処理を分離する圧縮文書プレフィックスフレームワークである textbfDoPR を提案する。
DoPRは最大8.0$times$オンラインドキュメント側メモリ削減と8.04$times$レイテンシスピードアップを実現し、マッチしたフルドキュメントリランカのNDCG@10の平均値の1.1%-99.5%を維持している。
- 参考スコア(独自算出の注目度): 43.35035343197748
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are effective rerankers, but pointwise reranking repeatedly processes the same document across different queries, causing substantial redundant document-side computation. We propose \textbf{DoPR}, a compressed document prefix framework that decouples offline document processing from online reranking. DoPR first selects query-independent document representations and converts them into compressed document prefix states, which are precomputed offline and reused whenever the document is retrieved. During online reranking, the model scores each query-document pair by processing only the query and scoring token, with document information supplied by the stored prefix states. This design reduces online cost through both document-side compression and cross-query prefix-state reuse. Experiments on TREC DL, BEIR, and BRIGHT with Qwen3 models from $0.6$B to $8$B show that DoPR achieves up to 8.0$\times$ online document-side memory reduction and up to 8.04$\times$ latency speedup, while retaining \textbf{97.1\%-99.5\%} of the average NDCG@10 of matched full-document rerankers.
- Abstract(参考訳): 大規模言語モデル(LLM)は効果的な再ランカであるが、ポイントワイドで同じドキュメントを異なるクエリで繰り返し処理することで、かなりの冗長なドキュメント側計算を引き起こす。
オフライン文書処理をオンライン更新から切り離す圧縮文書プレフィックスフレームワークである「textbf{DoPR}」を提案する。
DoPRは、まずクエリ非依存の文書表現を選択し、それらを圧縮された文書プレフィックス状態に変換し、文書が取得されるとオフラインで再利用される。
オンライン更新の間、モデルは、格納されたプレフィックス状態によって提供される文書情報とともに、クエリとスコアトークンのみを処理することにより、各クエリとドキュメントのペアをスコアする。
この設計により、ドキュメント側圧縮とクロスクエリプレフィックスステートの再利用によるオンラインコストが削減される。
TREC DL、BEIR、BRIGHT の Qwen3 モデルを 0.6$B から 8$B に比較すると、DoPR は最大8.0$\times$オンラインドキュメント側メモリ削減と8.04$\times$遅延スピードアップを実現し、マッチしたフルドキュメントリランダの平均 NDCG@10 の \textbf{97.1\%-99.5\% を維持している。
関連論文リスト
- DocPC: Document-Level Visual Retrieval via Representative Page Composition [18.502834715003928]
本稿では,代表ページ構成に基づく文書レベルのビジュアル検索フレームワークであるDocPCを提案する。
文書レベルで広く普及している多陽性の監督を扱うために,多陽性のコントラスト学習と小数にスケジュールされたリストワイズ最適化を組み合わせる。
DocPC-ColQwenはDocViRe上で44.09のNDCG@5を達成した。
論文 参考訳(メタデータ) (2026-08-26T06:46:44Z) - DEPT: Document Embedding Preservation Tuning for Unified Query Expansion and Retrieval [45.09142622162023]
大規模言語モデル(LLM)は、不特定クエリを拡張し、テキストを密度の高い表現としてエンコードする。
単一デコーダのみのLLMエンドツーエンドをトレーニングし、同じモデルで拡張を生成し、拡張されたクエリと候補ドキュメントの両方をエンコードする。
文書埋め込み保存チューニング(DEPT)を導入し、キャッシュされた初期埋め込みに近づいた文書埋め込みを調整したままにしておく。
論文 参考訳(メタデータ) (2026-08-18T10:52:08Z) - Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation [59.438696079345426]
DICEは、ドキュメントをチャンクに分割し、凍結したモデルで独立してエンコードし、それらを単一のベクタに集約する、トレーニング不要のドキュメントサイド戦略である。
LongEmbedでは、DICEは4つのバックボーン間の検索を改善し、4kトークンを超えるスライスで最大の利益を上げている。
12,779個のフィルターサンプルのうち、DICEは92.8%のケースで単一ベクトルベースラインよりも低いEDIが得られる。
論文 参考訳(メタデータ) (2026-06-17T07:44:04Z) - miniReranker: Efficient Multimodal Reranking through Visual Cache Reuse and Interaction Sparsity [21.54829080388454]
MLLM(Multimodal large language model)は、最近ポイントワイド・リランカとして大きな可能性を示している。
しかし、ポイントワイドリグレードは、クエリーとドキュメントのペア間で大幅に繰り返される計算に悩まされる。
本稿では,キャッシュ再利用の効率化と性能の見直しを両立させる,$textitvision-first$の定式化を提案する。
論文 参考訳(メタデータ) (2026-06-09T12:11:02Z) - MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA [71.42483000929614]
複数ページのドキュメント 視覚的質問回答は、長い、視覚的に密集したドキュメントにおける意味論、レイアウト、および視覚的要素の推論を必要とする。
我々は,多ページDocVQAをシーケンシャルエビデンスアグリゲーションとしてキャストするtextbfOCRフリーエージェントフレームワークであるDoc-$V*$を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:12:27Z) - SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement [17.272061289197342]
Document Visual Question Answering (DocVQA)は実用的で難しいタスクである。
最近の手法は、同様のRAG(Retrieval Augmented Generation)パイプラインに従う。
DocVQA用の拡張フレームワークであるSimpleDocを紹介します。
論文 参考訳(メタデータ) (2025-06-16T22:15:58Z) - Learning Diverse Document Representations with Deep Query Interactions
for Dense Retrieval [79.37614949970013]
そこで本研究では,問合せの深い文書表現を学習する高密度検索モデルを提案する。
本モデルでは,各文書に生成した擬似クエリをエンコードして,クエリインフォームド・マルチビュー文書表現を得る。
論文 参考訳(メタデータ) (2022-08-08T16:00:55Z) - Topic-Grained Text Representation-based Model for Document Retrieval [9.483212308046964]
TGTRは、文書検索のためのトピックグレードテキスト表現ベースのモデルである。
ドキュメント表現をオフラインに保存し、検索効率を保証します。
従来の単語の粒度ではなく、新しいトピックの粒度表現を使用することで、ストレージ要件を大幅に削減する。
論文 参考訳(メタデータ) (2022-07-11T06:31:21Z) - DC-BERT: Decoupling Question and Document for Efficient Contextual
Encoding [90.85913515409275]
近年のオープンドメイン質問応答は,BERT などの事前学習言語モデルを用いて顕著な性能向上を実現している。
本稿では,2つのBERTモデルを持つコンテキストエンコーディングフレームワークであるDC-BERTと,すべての文書を事前エンコードし,それらのエンコーディングをキャッシュするオフラインBERTを提案する。
SQuADオープンとNatural Questionsオープンデータセットでは、DC-BERTは文書検索の10倍のスピードアップを実現し、QAパフォーマンスのほとんど(約98%)を維持している。
論文 参考訳(メタデータ) (2020-02-28T08:18:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。