論文の概要: Re-ranking and Late Interaction Drive Retrieval Quality: A Controlled Comparison of RAG Strategies for Scientific Question Answering
- arxiv url: http://arxiv.org/abs/2609.38473v1
- Date: Tue, 29 Sep 2026 20:04:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.697731
- Title: Re-ranking and Late Interaction Drive Retrieval Quality: A Controlled Comparison of RAG Strategies for Scientific Question Answering
- Title(参考訳): リグレードとレイト・インタラクション・ドライブの検索品質:科学質問応答のためのRAG戦略の比較
- Abstract要約: 科学的質問応答のための6つの検索方法の比較を行った。
全てのパイプラインは同じジェネレータ(Meta-Llama/Llama-3.1-8B-Instruct)、プロンプト、評価プロトコルを共有している。
LLM-as-a-judgeプロトコルを複数の品質次元に沿って,ゴールドペーパーの直接検索指標とともに評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-Augmented Generation (RAG) is now the standard way to ground Large Language Models (LLMs) in external knowledge, yet the design space of retrieval pipelines is large and the trade-offs between variants are not well understood, especially on domain-specific corpora at realistic scale. In this work, we present a controlled comparison of six retrieval strategies for scientific question answering: (i) classic top-k dense retrieval, (ii) LLM-based query rephrasing, (iii) query rephrasing followed by LLM-based reranking, (iv) multi-query fusion via Reciprocal Rank Fusion (RRF), (v) an agentic tool-call pipeline in which the generator decides for itself whether to retrieve, and (vi) late-interaction retrieval with ColBERTv2. All six pipelines share the same generator (Meta-Llama/Llama-3.1-8B-Instruct), prompt, and evaluation protocol; the five single-vector pipelines additionally share SPECTER2 embeddings and a Chroma vector store; and all six retrieve from the full corpus of 463,971 arXiv papers dated 2024-2025. To support reproducible, large-scale evaluation, we also release a synthetic question dataset of 19,484 problem-statement and methodology questions generated by Llama-3.1-8B-Instruct from a random sample of 10,000 papers across academic domains (query generation succeeded for 9,742 of them), and every strategy is evaluated on this same query set. We describe the architecture and implementation of each pipeline, release the code and the synthetic question dataset, and evaluate each strategy with an LLM-as-a-judge protocol along multiple quality dimensions, together with direct gold-paper retrieval metrics. The result is an open testbed for studying the cost and quality trade-offs of RAG design choices on a research-literature corpus, and a basis for future work on faithfulness, retrieval robustness, and agentic retrieval.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) は、現在、Large Language Models (LLM) を外部知識で構築する標準的な方法となっているが、検索パイプラインの設計空間は広く、特にドメイン固有コーパスにおいて、変種間のトレードオフがよく理解されていない。
本稿では,科学的質問応答のための6つの検索戦略の制御された比較について述べる。
(i)古典的なトップク密度検索
(ii) LLM ベースのクエリ・リフレッシング
三 照会後、LCMに基づく照会
(四)相互ランク核融合(RRF)によるマルチクエリ核融合
五 ジェネレータが回収するか否かを判断するエージェントツールコールパイプライン
(vi)ColBERTv2による遅延相互作用検索。
6つのパイプラインは同じジェネレータ(Meta-Llama/Llama-3.1-8B-Instruct)、プロンプトと評価プロトコル、SPECTER2埋め込みとクロマベクトルストア、2024-2025年に発行された463,971 arXivの完全なコーパスから6つのパイプラインが回収される。
Llama-3.1-8B-Instruct from a random sample of 10,000 papers across academic domain (query generation successfully to 9,742) and all strategy are evaluate on this same query set。
本稿では,各パイプラインのアーキテクチャと実装について述べるとともに,コードと合成質問データセットを公開し,各戦略を複数の品質次元に沿ってLLM-as-a-judgeプロトコルを用いて評価する。
その結果,研究文献コーパスにおけるRAG設計選択のコストと品質のトレードオフを調査するためのオープンテストベッドと,信頼性,検索堅牢性,エージェント検索に関する今後の研究の基盤となる。
関連論文リスト
- Multimodal Hybrid Retrieval-Augmented Generation for Scientific Document Understanding using Open-Source SLMs [45.88028371034407]
大規模言語モデルは、前もって微調整を行わずに、科学的文書からドメイン固有のキーオンに答えるときに幻覚を起こす傾向がある。
本稿では,これらの課題を解決するための高度なマルチモーダル検索型生成システムを提案する。
Qwen2-VL-2B-InstructはBERTScoreのクラウドベースモデルに匹敵する結果を得た。
論文 参考訳(メタデータ) (2026-07-06T08:32:09Z) - Test-Time Strategies for More Efficient and Accurate Agentic RAG [58.44913384057518]
Retrieval-Augmented Generation (RAG) システムは複雑なマルチホップ問題に直面している。
このような手法は、以前に処理された情報の反復的な検索を含む非効率性を導入することができる。
本稿では,これらの問題を軽減するために,サーチ-R1パイプラインに対するテスト時間修正について検討する。
論文 参考訳(メタデータ) (2026-03-12T19:18:59Z) - AILS-NTUA at SemEval-2026 Task 8: Evaluating Multi-Turn RAG Conversations [14.20669481486209]
我々はSemEval-2026タスク8(MTRAGEval)のためのAILS-NTUAシステムを提案する。
マルチターン検索拡張生成の3つのサブタスク、すなわち、経路検索(A)、基準接地応答生成(B)、エンドツーエンドRAG(C)のすべてに対処する。
統一アーキテクチャは、(i)クエリ-ダイバーシティ-オーバー・レトリバー-ダイバーシティ戦略と(ii)マルチステージ生成パイプラインという2つの原則に基づいて構築されています。
論文 参考訳(メタデータ) (2026-03-11T08:28:31Z) - Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage [89.58253972744531]
Retrieval-augmented Generation (RAG) システムは、文書検索と生成モデルを組み合わせて、レポート生成のような複雑な情報を求める課題に対処する。
我々は,上流の検索指標が,最終生成応答の情報カバレッジの信頼性の高い早期指標として機能するかどうかを検討する。
本研究は,トピックとシステムレベルの両方で生成した応答におけるカバレッジベース検索指標とナゲットカバレッジとの間に強い相関関係を示した。
論文 参考訳(メタデータ) (2026-03-09T18:20:20Z) - Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning [50.27838512822097]
我々は,グローバルRAG機能を評価するために設計された最初のベンチマークであるGlobalQAを紹介する。
我々は,チャンクレベルの検索によって構造的コヒーレンスを保存するマルチツール協調フレームワークであるGlobalRAGを提案する。
Qwen2.5-14Bモデルでは、GlobalRAGは最強のベースラインである1.51 F1と比較して6.63 F1を達成した。
論文 参考訳(メタデータ) (2025-10-30T07:29:14Z) - MSRS: Evaluating Multi-Source Retrieval-Augmented Generation [51.717139132190574]
多くの現実世界のアプリケーションは、複数のソースにまたがる情報を統合して要約する能力を必要としている。
本稿では、RAGシステムに対して異なるソース間で情報を統合するための評価ベンチマークを構築するためのスケーラブルなフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-28T14:59:55Z) - Never Come Up Empty: Adaptive HyDE Retrieval for Improving LLM Developer Support [0.5356944479760103]
我々は,300万以上のJavaおよびPython関連Stack Overflowポストの検索コーパスを構築し,回答を受け付けている。
開発者からの質問に答えるために様々なRAGパイプライン設計を評価し、正確で信頼性の高い応答を生成する上での有効性を評価した。
論文 参考訳(メタデータ) (2025-07-22T16:46:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。