論文の概要: Towards Self-Evolving Agentic Literature Retrieval
- arxiv url: http://arxiv.org/abs/2605.14306v1
- Date: Thu, 14 May 2026 03:17:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.598345
- Title: Towards Self-Evolving Agentic Literature Retrieval
- Title(参考訳): 自己進化型エージェント文学検索に向けて
- Authors: Yuwen Du, Tian Jin, Jing Kang, Xianghe Pang, Jingyi Chai, Tingjia Miao, Fenyi Liu, WenHao Wang, Sikai Yao, Yuzhi Zhang, Siheng Chen,
- Abstract要約: PaSaMasterは自己進化型エージェント文献検索システムである。
証拠を根拠としたレコメンデーションで、レコメンデーション付き紙のランク付けを行う。
検索を、生成ではなく、紙関連ランキングとして扱うことにより、幻覚源を防止する。
- 参考スコア(独自算出の注目度): 41.92839860163178
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language models reshape scientific research, literature retrieval faces a twofold challenge: ensuring source authenticity while maintaining a deep comprehension of academic search intents. While reliable, traditional keyword-centric search fails to capture complex research intents. Frontier LLMs can handle complex research intents, but their high cost and tendency to hallucinate remain key limitations. Here we introduce PaSaMaster, a self-evolving agentic literature retrieval system that produces relevance-scored paper rankings with evidence-grounded recommendations through iterative intent analysis, retrieval, and ranking. It is built on three key designs. First, it transforms literature retrieval from a one shot query--document matching problem into a search process that evolves over time, using ranked evidence to reveal gaps, refine intents, and guide follow-up searches. Second, it prevents hallucinated sources by treating retrieval as intent--paper relevance ranking rather than generation. Finally, PaSaMaster improves cost efficiency by separating planning from retrieval: a frontier LLM is used only for intent understanding, while large scale retrieval and relevance scoring are delegated to customized corpora and lightweight models. Evaluated on the PaSaMaster Benchmark across 38 scientific disciplines, our system exposes the severe inaccuracy and incompleteness of traditional keyword retrieval (improving F1-score by 15.6X) and the unreliability of generative LLMs (which exhibit hallucination rates up to 37.79%). Remarkably, PaSaMaster outperforms GPT-5.2 by 30.0% at a mere 1% of the computational cost while ensuring zero source hallucination: https://github.com/sjtu-sai-agents/PaSaMaster
- Abstract(参考訳): 大きな言語モデルが科学的研究を再構築するにつれ、文献検索は2つの課題に直面している。
信頼性はあるものの、従来のキーワード中心の検索は複雑な研究意図を捉えない。
フロンティアLSMは複雑な研究意図を扱えるが、その高いコストと幻覚の傾向は依然として重要な限界である。
本稿では,自己進化型エージェント文献検索システムPaSaMasterを紹介する。
3つの鍵となる設計を踏襲している。
まず、文献検索を1ショットのクエリマッチング問題から、時間とともに進化する検索プロセスに変換し、ランク付けされたエビデンスを使用してギャップを明らかにし、インテントを洗練し、フォローアップ検索をガイドする。
第2に、検索を、生成ではなく、紙関連ランキングとして扱うことにより、幻覚源を防止する。
最後に、PaSaMasterは、計画と検索を分離してコスト効率を向上させる:フロンティアLSMは意図理解にのみ使用され、大規模検索と妥当性スコアはカスタマイズされたコーパスと軽量モデルに委譲される。
従来のキーワード検索の正確さと不完全性(F1スコアを15.6倍に向上させる)、および生成LDMの信頼性(幻覚率37.79%)を明らかにする。
PaSaMasterは、計算コストのわずか1%でGPT-5.2を30.0%上回り、ソース幻覚をゼロにする。
関連論文リスト
- AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [55.70879973230979]
AutoResearchBenchは、自律的な科学文献発見のためのベンチマークである。
エージェントWebブラウジングに関する以前のベンチマークと比較すると、AutoResearchBenchは研究指向である。
最も強力なLCMでさえ、BrowseCompのような一般的なエージェントによるWebブラウジングベンチマークをほとんど征服したにもかかわらず、Deep Researchでは9.39%、Wide Researchでは9.31%の精度しか達成していない。
論文 参考訳(メタデータ) (2026-04-28T06:05:17Z) - SciNetBench: A Relation-Aware Benchmark for Scientific Literature Retrieval Agents [12.057215000080705]
本稿では,文献検索エージェントのためのSciNetBenchを提案する。
本ベンチマークでは,新しい知識構造を持つ論文のエゴ中心検索,学術的関係のペアワイド同定,科学的進化的軌道のパスワイド再構築の3つのレベルを体系的に評価した。
関係認識検索タスクの精度は20%以下に低下することが多く、現在の検索パラダイムの中核的な欠点が浮かび上がっている。
論文 参考訳(メタデータ) (2025-12-16T02:53:02Z) - BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent [74.10138164281618]
BrowseComp-Plus(BrowseComp-Plus)は、BrowseCompから派生したベンチマークである。
このベンチマークは、ディープリサーチエージェントと検索方法の総合的な評価とアンタングル解析を可能にする。
論文 参考訳(メタデータ) (2025-08-08T17:55:11Z) - Scientific Paper Retrieval with LLM-Guided Semantic-Based Ranking [23.23119083861653]
SemRankは効率的かつ効率的な紙検索フレームワークである。
クエリ理解と概念ベースのセマンティックインデックスを組み合わせる。
実験の結果、SemRankは様々なベースレトリバーの性能を一貫して改善していることがわかった。
論文 参考訳(メタデータ) (2025-05-27T22:49:18Z) - CoRank: LLM-Based Compact Reranking with Document Features for Scientific Retrieval [30.341167520613197]
第一段階の検索はしばしば科学的領域において最適でないため、関連する文書は下位にランクされる。
我々は、科学検索のためのトレーニング不要でモデルに依存しないフレームワークであるCoRankを提案する。
論文 参考訳(メタデータ) (2025-05-19T22:10:27Z) - JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking [81.88787401178378]
本稿では,文書関連性を評価する際に,人間の認知過程をエミュレートする新しいエージェント・リランカであるJiceRankを紹介する。
我々は,推論集約型BRIGHTベンチマークを用いて判定Rankを評価し,第1段階の検索手法よりも性能が大幅に向上したことを示す。
さらに、JiceRankは、人気の高いBEIRベンチマークの細調整された最先端リランカと同等に動作し、ゼロショットの一般化能力を検証している。
論文 参考訳(メタデータ) (2024-10-31T18:43:12Z) - LitSearch: A Retrieval Benchmark for Scientific Literature Search [48.593157851171526]
我々は,最近のMLおよびNLP論文に関する597のリアルな文献検索クエリからなる検索ベンチマークLitSearchを紹介する。
LitSearchのすべての質問は、高品質を保証するために専門家によって手作業で検査または編集された。
BM25と最先端の高密度リトリーバーの間には,24.8%の絶対差がみられた。
論文 参考訳(メタデータ) (2024-07-10T18:00:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。