論文の概要: BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
- arxiv url: http://arxiv.org/abs/2607.26497v2
- Date: Thu, 30 Jul 2026 07:49:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.26834
- Title: BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
- Title(参考訳): BM25が大規模に勝利 - 検索拡張世代パラダイムのスケールスタディ
- Abstract要約: Retrieval-augmented Generation (RAG) は語彙と密度の検索、グラフベースのインデックス、エージェント検索にまたがる。
約450倍の大きさの28層を厳密に営巣するコーパスサイズの変化について検討した。
公式な正確性、構築とクエリトークン、レイテンシを測定します。
- 参考スコア(独自算出の注目度): 22.909592273109453
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation (RAG) spans lexical and dense retrieval, graph-based indexing, and agentic search, but these paradigms are usually evaluated on different benchmarks at one corpus size, leaving their accuracy-cost scaling unclear. To bridge this gap, we present a controlled study that varies corpus size along 28 strictly nested tiers spanning roughly 450-fold, while holding questions and a fixed bedrock of relevant and adversarial documents unchanged. Under one reader model and one judging protocol, we measure official accuracy, construction and query tokens, and latency. The results reveal a scale-dependent crossover rather than an unconditional winner. File-System Agent leads at the smallest shared tiers, but its sequential exploration costs 39 times more query tokens at the bedrock and becomes less effective as the search space grows. Around 10 million corpus tokens, BM25 overtakes it and leads at every larger shared tier, with a margin approaching 20 points at full scale. BM25 also anchors the low-cost end of the Pareto frontier without LLM-based construction. Dense retrieval remains efficient but less accurate, whereas graph-based RAG encounters construction walls before deployment scale and its scalable variants remain below BM25 at shared tiers. Overall, corpus growth increasingly favors global candidate ranking: lexical retrieval is the strongest scalable default, while agentic reasoning works best after ranked discovery rather than in place of it.
- Abstract(参考訳): Retrieval-augmented Generation (RAG) は語彙と密度の検索、グラフベースのインデックス、エージェント検索にまたがるが、これらのパラダイムは通常、一つのコーパスサイズで異なるベンチマークで評価される。
このギャップを埋めるために,約450倍に及ぶ厳密なネスト層28のコーパスサイズを変化させるとともに,関連する文書と敵対文書の固定した岩盤を同時に保持する。
1つのリーダモデルと1つの判断プロトコルの下では、公式の精度、構築とクエリトークン、レイテンシを測定します。
その結果、無条件の勝者ではなく、スケール依存のクロスオーバーが明らかとなった。
ファイルシステムエージェントは最小の共有層をリードするが、シーケンシャルな探索は岩盤の39倍のクエリトークンを消費し、検索空間が拡大するにつれて効率が低下する。
約1000万のコーパストークンが、BM25に取って代わられ、すべての大きな共有層でリードし、マージンは全規模で20ポイントに近づいた。
BM25はまた、LPMをベースとした建設をせずにパレート・フロンティアの低コストの端を固定する。
密度検索は効率的だが精度は低いが、グラフベースのRAGは展開規模よりも前に建設の壁に遭遇し、拡張性のあるバリエーションはBM25以下である。
語彙検索は最もスケーラブルなデフォルトであり、エージェント推論は、その代わりではなく、ランク付けされた発見の後に最もうまく機能する。
関連論文リスト
- WARP: Wasserstein-Aligned RAG for Population Opinions [0.9882967349104086]
WARPは住民の意見分布の証拠を回収した。
我々は高密度、スパース、可変候補プールの3つの変種を開発する。
WARPのドメインマッチング型は、サブ秒レイテンシで少なくとも43%の分散エラーを減少させる。
論文 参考訳(メタデータ) (2026-08-24T06:41:23Z) - Data Quality over Capacity: Internalizing Documents into LoRA Adapters for Closed-Book QA [0.0]
LoRAによる4ビットGemma-4-e4bモデルの重みを直接調査する。
アダプタ容量が十分であれば、クローズドブックの精度において、トレーニングデータの品質が支配的なレバーであることが分かりました。
論文 参考訳(メタデータ) (2026-07-23T23:14:59Z) - Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale [22.13186135187399]
本研究は,2つのスケールの実践的検索者に対する文脈内検索に関する最初の体系的研究である。
最初にBlockSearchを紹介した。これは0.6BのLMレトリバーで、以前のLMベースラインよりもアーキテクチャとトレーニングが改善されている。
この分析により,注目ソフトマックスと文書レベルのスパースアテンションに長さ認識の調整を導入する。
論文 参考訳(メタデータ) (2026-07-01T23:38:25Z) - Towards Retrieving Interaction Spaces for Agentic Search [62.666902610940525]
最近の直接コーパス(DCI)の研究は、エージェントが5.4のインタラクションやファイル読み取りといったシェルツールを通じて生コーパスと対話できることを示している。
エージェント検索における検索の役割は, LLMコンテキストウィンドウに適合する文書を選択することだけではなく, インタラクション空間を構築することにある。
論文 参考訳(メタデータ) (2026-06-05T03:47:40Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality? [74.69723255239663]
グラウンドド・パーソナリティ・推論は、MLLMがそれぞれのビッグファイブ・格付けを、評価、推論、根拠の連鎖を通じて観察可能な証拠に固定することを要求する。
MM-OCEANは、人間の検証によるマルチエージェントパイプラインによって生成され、タイムスタンプによる行動観察、エビデンスに基づく特性分析、およびキューグラウンドMCQの7つのカテゴリがある。
この分析では、フィールド全体にわたって、正しい評価の51%が取得された手がかりに基づかず、ホリスティック・ギャラリング・レートは0-33.5%にしか達していないという顕著な偏見のギャップが明らかになった。
論文 参考訳(メタデータ) (2026-05-21T07:42:47Z) - Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory [1.081571058570587]
AlltoAllのディスパッチは、MoEの専門家並列性の主要なボトルネックである。
ワークロードに関する2つの仮定をテストするために、DODOCOを導入します。
EPのスケーリングは、各アーキテクチャの計測可能な範囲内で、専門家ごとの最大/平均トークン比を5%以上変更する。
論文 参考訳(メタデータ) (2026-05-20T10:14:00Z) - Measuring Maximum Activations in Open Large Language Models [60.3514350516308]
集中度, MoE, 視覚言語, 中間訓練, 命令調整型変異にまたがる8つのオープンファミリーから27個のチェックポイントで, グローバルおよび階層的に最大値を測定した。
最大アクティベーションサイズは、単純なサイズの副産物ではなく、ファミリー、アーキテクチャ、トレーニングステージに結びついているモデル特性である、と結論付けます。
論文 参考訳(メタデータ) (2026-05-15T03:31:51Z) - Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction [127.64173950476702]
エージェントが直接、汎用端末ツールを用いて、生コーパスを直接検索する直接コーパス間相互作用(DCI)について検討する。
このアプローチではオフラインインデックスを必要とせず、ローカルコーパスの進化に自然に適応する。
IRベンチマークとエンドツーエンドのエージェント検索タスク全体にわたって、この単純なセットアップは、強いスパース、密度、リランクベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-05-03T19:13:11Z) - Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI [0.0]
私たちはEnterpriseDocBenchを構築し、忠実さのパース、インデックス化の効率、検索の妥当性、生成の基盤化を推し進めました。
BM25、密封、ハイブリッドの3つのパイプラインを、すべて同じGPT-5ジェネレータで実行しました。
事実的正確性は85.5%だが、答えの完全性の平均は0.40である。
論文 参考訳(メタデータ) (2026-04-29T07:48:41Z) - Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems [0.0]
Retrieval-Augmented Generation (RAG) システムは、大きな言語モデルを外部知識ソースで拡張する。
特に、敵は、悪意のある文書が推論時に優先的に検索されるように、毒検索コーパスを付与することができる。
本研究では,最近のRAGパイプラインに対するグラデーション誘導コーパス中毒攻撃について検討し,検索層防御の評価を行った。
論文 参考訳(メタデータ) (2026-03-10T23:15:13Z) - Beyond the Needle's Illusion: Decoupled Evaluation of Evidence Access and Use under Semantic Interference at 326M-Token Scale [18.13756357502514]
我々は,326Mのメモリバンク上に構築された逆IAHスタイルのベンチマークであるEverMemBench-S(EMB-S)を紹介する。
完全なMemoryBankは、検索ベース(RAG)評価のために326万のトークンにまたがるが、各モデルのコンテキストウィンドウに適合するスケールでのみ、ネイティブの長期コンテキストモデルを評価する。
論文 参考訳(メタデータ) (2026-01-28T05:44:00Z) - Rerank Before You Reason: Analyzing Reranking Tradeoffs through Effective Token Cost in Deep Search Agents [50.212640395029744]
深層探索パイプラインにおける推論予算の配分について検討する。
BrowseComp-Plusベンチマークを用いて、モデルスケール、推論の労力、深度の再検討、トークン総コストのトレードオフを分析する。
論文 参考訳(メタデータ) (2026-01-20T18:38:35Z) - RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension [65.81339691942757]
RPC-Bench(RPC-Bench)は、高品質なコンピュータサイエンス論文のレビュー・リビューの交換から構築された大規模質問応答ベンチマークである。
我々は、科学研究の流れに沿ったきめ細かい分類を設計し、モデルがなぜ、何、どのように学術的な文脈で質問するかを理解し、答える能力を評価する。
論文 参考訳(メタデータ) (2026-01-14T11:37:00Z) - Relative Scaling Laws for LLMs [91.73497548097775]
スケーリング法則は、追加のデータ、パラメータ、計算によって言語モデルがどのように改善されるかを記述する。
相対的なスケーリング法則を導入し、テスト分布間のパフォーマンスギャップをスケールで追跡する。
これらの結果は、スケーリングは全体的なパフォーマンスを改善するが、普遍的等化器ではないことを示している。
論文 参考訳(メタデータ) (2025-10-28T16:55:22Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers [34.31192184496381]
デンスレトリバーとリランカーは、検索強化世代(RAG)パイプラインの中心である。
我々は,これらのコンポーネントがベースとする大規模言語モデル(LLM)をどの程度の事実的能力で継承するか,あるいは失うかを評価する。
全ての埋め込みモデルにおいて、クエリと正しい完了の間のコサイン類似度スコアは、間違ったものよりも著しく高い。
論文 参考訳(メタデータ) (2025-08-28T04:13:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。