論文の概要: Robustness of IR Models to Collection Growth
- arxiv url: http://arxiv.org/abs/2608.23419v2
- Date: Tue, 25 Aug 2026 13:45:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.309342
- Title: Robustness of IR Models to Collection Growth
- Title(参考訳): IRモデルのコレクション成長に対するロバスト性
- Abstract要約: 本研究は概念を定式化し、2つのコレクションと無視可能なトピックオーバーラップを組み合わせて経験的に評価する。
我々は、IRモデルがコレクション内の他の文書にランク付けする方法が、非関連文書の追加に対するロバスト性において重要な役割を担っていると仮定する。
以上の結果から,MDDモデルもMDAモデルも非関連文書の追加に対して完全には堅牢ではないことが明らかとなった。
- 参考スコア(独自算出の注目度): 25.464465023775627
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Information Retrieval (IR) systems seek to identify relevant documents within a collection. In practical applications, collections are dynamic, with documents frequently added. We argue that ideally, a retriever's effectiveness should not decrease when non-relevant documents are added to a collection. This study formalises this concept and empirically evaluates it by merging two collections with negligible topic overlap. We hypothesise that the way an IR model conditions its ranking on other documents in a collection (e.g., the IDF component in BM25 or contextual documents in listwise rerankers) plays an important role in its robustness to the addition of non-relevant documents. We broadly classify models as those that do not depend on other documents (Multi-Document-Agnostic, MDA) and those that do (Multi-Document-Dependent, MDD). Our results show that neither MDD nor MDA models are fully robust to the addition of non-relevant documents, as all models exhibit some performance degradation. Interestingly, among the models we test, MDA is more effective than MDD for retrieval, whereas MDD and MDA rerankers are equally effective.
- Abstract(参考訳): 情報検索システム(IR)は、コレクション内で関連する文書を識別しようとする。
現実的なアプリケーションでは、コレクションは動的であり、ドキュメントは頻繁に追加されます。
我々は,コレクションに非関連文書を付加した場合,検索者の有効性が低下しないことを理想的に論じる。
この概念を定式化し、2つのコレクションと無視可能なトピックオーバーラップを組み合わせることで,実証的に評価する。
我々は、IRモデルがコレクション内の他の文書(BM25のIDFコンポーネントやリストワイズリランカのコンテキスト文書など)にランク付けする方法が、非関連文書の追加に対するロバスト性において重要な役割を担っていると仮定する。
我々は、モデルを他の文書に依存しないもの(Multi-Document-Agnostic, MDA)と、それを行うもの(Multi-Document-Dependent, MDD)に広く分類する。
以上の結果から,MDDモデルもMDAモデルも非関連文書の追加に対して完全には堅牢ではないことが明らかとなった。
興味深いことに、我々がテストしたモデルの中で、MDDはMDDよりも有効であるが、MDDとMDDのリランカーは同等に有効である。
関連論文リスト
- Improved Evidence Extraction for Document Inconsistency Detection with LLMs [10.610567456326235]
本稿では,新しい包括的エビデンス抽出指標と制約付きフィルタリングによる再試行フレームワークを提案する。
有望な実験結果で私たちの主張を支持します。
論文 参考訳(メタデータ) (2026-01-06T00:58:20Z) - Improving Document Retrieval Coherence for Semantically Equivalent Queries [63.97649988164166]
同じ文書を検索する際のモデルのコヒーレンスを改善する訓練DRにおける多段階ランク付け損失のバリエーションを提案する。
この損失は、多様だがセマンティックな等価なクエリのために検索されたトップkランクのドキュメント間の不一致を罰する。
論文 参考訳(メタデータ) (2025-08-11T13:34:59Z) - Docopilot: Improving Multimodal Models for Document-Level Understanding [87.60020625241178]
マルチモーダル文書の詳細な理解を支援するために,高品質な文書レベルデータセットDoc-750Kを提案する。
このデータセットには、さまざまなドキュメント構造、広範なクロスページ依存関係、および元のドキュメントから派生した実際の質問と回答のペアが含まれている。
データセットに基づいて、RAGに頼ることなく、文書レベルの依存関係を正確に処理できるネイティブなマルチモーダルモデルであるDocopilotを開発する。
論文 参考訳(メタデータ) (2025-07-19T16:03:34Z) - A Unified Retrieval Framework with Document Ranking and EDU Filtering for Multi-document Summarization [18.13855430873805]
現在の手法では、検索プロセスの後にトランケーションを適用してコンテキスト長に適合させる。
本稿では,クエリ選択と文書ランキングを統合した検索に基づく新しいフレームワークを提案する。
我々は、複数のMDSデータセット上でのフレームワークを評価し、ROUGEメトリクスの一貫した改善を実証した。
論文 参考訳(メタデータ) (2025-04-23T13:41:10Z) - Collapse of Dense Retrievers: Short, Early, and Literal Biases Outranking Factual Evidence [56.09494651178128]
検索モデルは、Retrieval-Augmented Generation (RAG)のような情報検索(IR)アプリケーションで一般的に使用される。
我々は、Dragon+やContrieverのようなリトリーバーに対する、短いドキュメントの好みなどのバイアスの影響を定量化する。
私たちは大きな脆弱性を発見し、リトリバーが短いドキュメント、早い位置、繰り返しのエンティティ、リテラルマッチを好んで、答えの存在を無視しながら表示します。
論文 参考訳(メタデータ) (2025-03-06T23:23:13Z) - ODSum: New Benchmarks for Open Domain Multi-Document Summarization [30.875191848268347]
Open- Domain Multi-Document Summarization (ODMDS) は、大量のドキュメントを一貫性のある簡潔な要約に集約するための重要なツールである。
我々は,クエリに基づく文書要約データセットをODMDSデータセットに処理するためのルールベース手法を提案する。
論文 参考訳(メタデータ) (2023-09-16T11:27:34Z) - Open Domain Multi-document Summarization: A Comprehensive Study of Model
Brittleness under Retrieval [42.73076855699184]
マルチドキュメント要約(MDS)は、一連のトピック関連の文書が入力として提供されると仮定する。
タスクを形式化し、既存のデータセット、レトリバー、要約器を使ってブートストラップすることで、より困難な設定について研究する。
論文 参考訳(メタデータ) (2022-12-20T18:41:38Z) - Document-Level Relation Extraction with Sentences Importance Estimation
and Focusing [52.069206266557266]
文書レベルの関係抽出(DocRE)は、複数の文の文書から2つのエンティティ間の関係を決定することを目的としている。
我々はDocREのための文重要度スコアと文集中損失を設計するSIEF(Sentence Estimation and Focusing)フレームワークを提案する。
2つのドメインの実験結果から、SIEFは全体的なパフォーマンスを改善するだけでなく、DocREモデルをより堅牢にします。
論文 参考訳(メタデータ) (2022-04-27T03:20:07Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z) - Augmenting Document Representations for Dense Retrieval with
Interpolation and Perturbation [49.940525611640346]
ドキュメント拡張(Document Augmentation for dense Retrieval)フレームワークは、ドキュメントの表現をDense Augmentationとperturbationsで強化する。
2つのベンチマークデータセットによる検索タスクにおけるDARの性能評価を行い、ラベル付き文書とラベルなし文書の密集検索において、提案したDARが関連するベースラインを大幅に上回っていることを示す。
論文 参考訳(メタデータ) (2022-03-15T09:07:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。