論文の概要: Incremental Pooled LLM Evaluation for Cost-Effective Retrieval Model Selection
- arxiv url: http://arxiv.org/abs/2609.02745v1
- Date: Wed, 02 Sep 2026 15:47:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.455202
- Title: Incremental Pooled LLM Evaluation for Cost-Effective Retrieval Model Selection
- Title(参考訳): コスト効果のある検索モデル選択のための積極的LCM評価
- Authors: Max Nelson, Hanoz Bhathena, Aviral Joshi, Saket Sharma,
- Abstract要約: 本研究では,LLMが現在の候補システムで取得した文書の結合を判定するプール型LLM評価について検討する。
本手法は,高密度,スパース,ハイブリッド構成にまたがる11のシステムを用いた4つの検索ベンチマークで検証し,62の検索構成を財務ニュースQAシステムで比較するためにデプロイする。
プロダクションでは、ドキュメント重複は65-80%の判定再利用と4.9倍の低い評価コストをもたらし、チームは事前に評価された文書を再審査することなく新しい検索候補をベンチマークすることができる。
- 参考スコア(独自算出の注目度): 4.383171016550379
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Selecting a retrieval model for a production RAG system requires reliable comparative evaluation, but obtaining relevance judgments at scale is expensive and difficult to repeat as new candidate systems arrive. We study pooled LLM evaluation, in which an LLM judges the union of documents retrieved by the current set of candidate systems, and the pool is then expanded incrementally as new systems are introduced by judging only the new documents they contribute. These judgments are reused to evaluate all systems on a common basis. We validate this approach on four retrieval benchmarks with 11 systems spanning dense, sparse, and hybrid configurations, and deploy it to compare 62 retrieval configurations for a financial news QA system. Pooled LLM rankings correlate strongly with gold-standard evaluation across datasets, and 97% of pairwise system orderings are preserved once bootstrap uncertainty in the qrels is taken into account. In production, document overlap yields 65-80% judgment reuse and up to 4.9x lower evaluation cost, allowing teams to benchmark new retrieval candidates without re-judging previously assessed documents. These results suggest pooled LLM evaluation is a practical and cost-effective workflow for incremental retrieval model selection in deployed systems.
- Abstract(参考訳): 生産RAGシステムの検索モデルを選択するには、信頼性の高い比較評価が必要であるが、新しい候補システムが到着するにつれて、大規模に関連性判定を得ることは高価かつ困難である。
本研究では,LLMが現在の候補システムによって検索された文書の結合を判断し,新たに提案した文書のみを判断することで,プールを段階的に拡張する手法について検討する。
これらの判断は、すべてのシステムを共通のベースで評価するために再利用される。
本手法は,密度,疎度,ハイブリッド構成にまたがる11のシステムを対象とした4つの検索ベンチマークで検証し,金融ニュースQAシステムにおける62の検索構成を比較するためにデプロイする。
プール式LLMランキングはデータセット間のゴールドスタンダード評価と強く相関し,クレルのブートストラップ不確実性を考慮した場合,ペアワイズシステム注文の97%が保存される。
プロダクションでは、ドキュメント重複は65-80%の判定再利用と4.9倍の低い評価コストをもたらし、チームは事前に評価された文書を再審査することなく新しい検索候補をベンチマークすることができる。
これらの結果から,LLM評価のプール化は,デプロイシステムにおけるインクリメンタル検索モデル選択のための実用的で費用対効果の高いワークフローであることが示唆された。
関連論文リスト
- Do LLM-judges Align with Human Relevance in Cranfield-style Recommender Evaluation? [40.49875426230813]
本稿では,Large Language Models (LLM) がスケーラビリティ問題に対処するために,信頼性の高い自動判断器として機能するかどうかを検討する。
ML-32M-ext Cranfieldスタイルの映画レコメンデーションコレクションを用いて,既存の評価手法の限界について検討する。
よりリッチな項目メタデータとより長いユーザ履歴を組み合わせることでアライメントが向上し,LLM-judgeは人間によるランキングと高い合意を得ることがわかった。
論文 参考訳(メタデータ) (2025-11-28T16:10:39Z) - Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models [0.0]
本稿では,ベクトルベースエージェントRAGをハイブリッド検索とメタデータフィルタリングを用いて比較した最初の体系的評価を行う。
検索指標(MRR, Recall@5), LLM-as-a-judgeのペア比較, レイテンシ, 前処理コストを計測する。
以上の結果から,金融Q&Aシステムに先進的なRAG技術を適用することにより,検索精度,回答品質が向上し,生産における費用対効果のトレードオフが考慮されることが明らかとなった。
論文 参考訳(メタデータ) (2025-11-22T20:06:25Z) - Breaking the Lens of the Telescope: Online Relevance Estimation over Large Retrieval Sets [14.494301139974455]
本稿では,オンライン関連度推定という新たな手法を提案する。
オンライン関連度推定は、ランキングプロセスを通して、クエリの関連度推定を継続的に更新する。
TRECベンチマークの手法をハイブリッド検索と適応検索の2つのシナリオで検証する。
論文 参考訳(メタデータ) (2025-04-12T22:05:50Z) - Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference [63.03859517284341]
自動評価フレームワークは、人間の嗜好との整合性に基づいてLLMをランク付けすることを目的としている。
自動LLMベンチラは、入力セット、評価モデル、評価タイプ、集約方法の4つのコンポーネントから構成される。
論文 参考訳(メタデータ) (2024-12-31T17:46:51Z) - Self-Calibrated Listwise Reranking with Large Language Models [137.6557607279876]
大規模言語モデル (LLM) はシーケンシャル・ツー・シーケンス・アプローチによってタスクのランク付けに使用されている。
この階調のパラダイムは、より大きな候補集合を反復的に扱うためにスライディングウインドウ戦略を必要とする。
そこで本稿では,LLMを用いた自己校正リストのランク付け手法を提案する。
論文 参考訳(メタデータ) (2024-11-07T10:31:31Z) - RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework [66.93260816493553]
本稿では,様々なシナリオにまたがってRAGシステムを評価するためのフレームワークであるRAGvalを紹介する。
事実の正確性に焦点をあてて,完全性,幻覚,不適切性の3つの新しい指標を提案する。
実験結果から, RAGEvalは, 生成した試料の明瞭度, 安全性, 適合性, 豊かさにおいて, ゼロショット法とワンショット法より優れていた。
論文 参考訳(メタデータ) (2024-08-02T13:35:11Z) - RepEval: Effective Text Evaluation with LLM Representation [55.26340302485898]
RepEvalは、評価のためにLarge Language Models(LLM)表現の投影を利用するメトリクスである。
我々の研究は、LLM表現に埋め込まれたテキスト品質に関する情報の豊かさを強調し、新しいメトリクスの開発のための洞察を提供する。
論文 参考訳(メタデータ) (2024-04-30T13:50:55Z) - Evaluating Retrieval Quality in Retrieval-Augmented Generation [21.115495457454365]
従来のエンドツーエンド評価手法は計算コストが高い。
本稿では,検索リストの各文書をRAGシステム内の大規模言語モデルで個別に利用するeRAGを提案する。
eRAGは、ランタイムを改善し、エンドツーエンド評価の最大50倍のGPUメモリを消費する、大きな計算上のアドバンテージを提供する。
論文 参考訳(メタデータ) (2024-04-21T21:22:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。