論文の概要: Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking
- arxiv url: http://arxiv.org/abs/2607.19747v2
- Date: Thu, 23 Jul 2026 03:28:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 16:18:54.642358
- Title: Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking
- Title(参考訳): 関連性中心検索を超えて:ルーブリック指向文書集合の選択とランク付け
- Abstract要約: 文書セットの品質は、下流生成の上限を決定する。
本稿では,完全アセスメント診断最適化フレームワークを提案する。
両方のシナリオにまたがって最先端の結果を維持する唯一の方法である。
- 参考スコア(独自算出の注目度): 16.033979748919535
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language models and AI agents become the primary consumers of search results, document set quality determines the upper bound of downstream generation. Yet existing evaluation systems remain confined to scoring documents independently and aggregating via nDCG, ignoring inter-document interactions (redundancy, conflict, complementarity) and unable to answer what makes one document set better than another. To address these issues, we propose a complete evaluate-diagnose-optimize framework. We design SetwiseEvalKit, a three-level, nine-dimension document set evaluation benchmark covering both short-form and long-form scenarios, comprising approximately 28K high-quality evaluation rubrics. We systematically evaluate 12 rerankers: even the best method achieves no more than 45% coverage, cross-document coordination dimensions are universally weak, and no single method maintains top performance across both settings. Building on this, we propose Rubric4Setwise, a training-free method that converts rubric-based evaluation criteria into document set selection signals, achieving the best downstream generation performance with fewer documents and search rounds. It is the only method that maintains state-of-the-art results across both scenarios, validating the effectiveness of closing the loop from evaluation to optimization.
- Abstract(参考訳): 大規模言語モデルとAIエージェントが検索結果の主要なコンシューマとなると、ドキュメントセットの品質が下流生成の上限を決定する。
しかし、既存の評価システムは、独立して文書を採点し、nDCGを介して集約し、文書間の相互作用(冗長性、矛盾、相補性)を無視し、ある文書を他の文書よりも良いものにする方法に答えることができない。
これらの問題に対処するため、我々は完全な評価-診断-最適化フレームワークを提案する。
本研究では,3レベル9次元文書集合評価ベンチマークであるSetwiseEvalKitを,約28Kの高品質評価ルーリックを含む短文シナリオと長文シナリオの両方を対象として設計する。
最適手法でさえ、カバー範囲が45%に満たないにもかかわらず、文書間の調整次元は普遍的に弱く、両方の設定で最高のパフォーマンスを維持する方法は存在しない。
そこで我々は,ルーブリックに基づく評価基準を文書選択信号に変換し,より少ない文書や検索ラウンドで最良なダウンストリーム生成性能を実現する,Rubric4Setwiseを提案する。
評価から最適化までループを閉じることの有効性を検証し、両方のシナリオで最先端の結果を維持する唯一の方法である。
関連論文リスト
- Deep Academic Survey: Stateful Agentic Closed-Loop Paradigm for Academic Survey Automation [60.151050016855834]
DASは出版指向の学術調査を作成するためのステートフルなエージェント・フレームワークである。
その鍵となる考え方は、再利用可能な紙分析とトピック固有の原稿構築を分離することである。
DASは4つの次元で最高点に達し、総合スコアは4.34であり、最強の競争相手は4.03である。
論文 参考訳(メタデータ) (2026-08-18T17:29:00Z) - DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark [48.84943754804533]
マルチモーダル文書には、テーブル、フィギュア、レイアウトなど、さまざまな要素が含まれている。
現在のアプローチでは、高精度の検索を実現するために、高密度の視覚埋め込みモデルと教師付きリランカを組み合わせるのが一般的である。
本稿では,レイアウトを意識したスパース埋め込み技術による視覚検索を支援するプラグイン・アンド・プレイフレームワークDocRetrieverを提案する。
論文 参考訳(メタデータ) (2026-05-28T14:50:53Z) - Beyond Chunk-Then-Embed: A Comprehensive Taxonomy and Evaluation of Document Chunking Strategies for Information Retrieval [37.055995647350784]
本稿では,文書チャンキングにおける先行研究を再現し,既存の戦略を統一する体系的枠組みを提案する。
評価の結果,最適なチャンキング戦略はタスク依存であることがわかった。
論文 参考訳(メタデータ) (2026-02-19T00:27:15Z) - ABCD-LINK: Annotation Bootstrapping for Cross-Document Fine-Grained Links [57.514511353084565]
我々は、最高のパフォーマンスのアプローチを選択し、文書間リンクに注釈を付けるための新しいドメインに依存しないフレームワークを提案する。
当社のフレームワークを2つの異なるドメイン – ピアレビューとニュース – に適用しています。
結果として得られた新しいデータセットは、メディアフレーミングやピアレビューなど、数多くのクロスドキュメントタスクの基礎を築いた。
論文 参考訳(メタデータ) (2025-09-01T11:32:24Z) - Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking [58.69615583599489]
Deliberate Thinking based Retriever (Debater) は、段階的な思考プロセスを導入することで文書表現を強化する新しいアプローチである。
Debaterは、いくつかのベンチマークで既存のメソッドよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-02-18T15:56:34Z) - JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking [81.88787401178378]
本稿では,文書関連性を評価する際に,人間の認知過程をエミュレートする新しいエージェント・リランカであるJiceRankを紹介する。
我々は,推論集約型BRIGHTベンチマークを用いて判定Rankを評価し,第1段階の検索手法よりも性能が大幅に向上したことを示す。
さらに、JiceRankは、人気の高いBEIRベンチマークの細調整された最先端リランカと同等に動作し、ゼロショットの一般化能力を検証している。
論文 参考訳(メタデータ) (2024-10-31T18:43:12Z) - Quam: Adaptive Retrieval through Query Affinity Modelling [15.3583908068962]
ユーザ情報要求に基づいて文書をランク付けする関連モデルを構築することは,情報検索とNLPコミュニティの中心的な課題である。
提案するQuamにより,適応検索の初期段階の統一的な視点を提案する。
提案手法であるQuamは,リコール性能を26%向上させる。
論文 参考訳(メタデータ) (2024-10-26T22:52:12Z) - Contextual Document Embeddings [77.22328616983417]
本稿では,コンテキスト化された文書埋め込みのための2つの補完手法を提案する。
第一に、文書近傍を明示的にバッチ内コンテキスト損失に組み込む別のコントラスト学習目標である。
第二に、隣接する文書情報をエンコードされた表現に明示的にエンコードする新しいコンテキストアーキテクチャ。
論文 参考訳(メタデータ) (2024-10-03T14:33:34Z) - Evaluating Retrieval Quality in Retrieval-Augmented Generation [21.115495457454365]
従来のエンドツーエンド評価手法は計算コストが高い。
本稿では,検索リストの各文書をRAGシステム内の大規模言語モデルで個別に利用するeRAGを提案する。
eRAGは、ランタイムを改善し、エンドツーエンド評価の最大50倍のGPUメモリを消費する、大きな計算上のアドバンテージを提供する。
論文 参考訳(メタデータ) (2024-04-21T21:22:28Z) - Document Provenance and Authentication through Authorship Classification [5.2545206693029884]
本稿では,単一文書と複数文書の分類のためのアンサンブルベースのテキスト処理フレームワークを提案する。
提案するフレームワークには,最先端のテキスト分類アルゴリズムがいくつか組み込まれている。
フレームワークは大規模なベンチマークデータセットで評価される。
論文 参考訳(メタデータ) (2023-03-02T12:26:03Z) - CODER: An efficient framework for improving retrieval through
COntextualized Document Embedding Reranking [11.635294568328625]
本稿では,最小計算コストで広範囲の検索モデルの性能を向上させるためのフレームワークを提案する。
ベース密度検索法により抽出された事前計算された文書表現を利用する。
実行時に第一段階のメソッドの上に無視可能な計算オーバーヘッドを発生させ、最先端の高密度検索手法と簡単に組み合わせられるようにする。
論文 参考訳(メタデータ) (2021-12-16T10:25:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。