論文の概要: RAG-Stack: Co-Optimizing RAG Serving Performance and Quality
- arxiv url: http://arxiv.org/abs/2608.03487v1
- Date: Tue, 04 Aug 2026 11:23:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.715188
- Title: RAG-Stack: Co-Optimizing RAG Serving Performance and Quality
- Title(参考訳): RAG-Stack: RAGのパフォーマンスと品質を最適化する
- Authors: Haiqiang Zhang, Yuanqing Lei, Wanting Li, Tao Zhang, Wenqi Jiang,
- Abstract要約: RAG-Stackは、様々なRAGアプリケーションとサービスシステムにわたる品質パフォーマンスのフロンティアを効率的に発見するためのフレームワークである。
RAG-Stackは、次のRAG構成を選択する反復的な設計空間探索アルゴリズムであるRAG-PEと、多様なRAGアルゴリズムのためのワークロード抽象化であるRAG-IRと、所定のハードウェア上で最適なデプロイメントとパフォーマンスを提供するパフォーマンスモデルであるRAG-CMで構成されている。
- 参考スコア(独自算出の注目度): 6.136913958841498
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation (RAG), which augments large language model (LLM) generation with information retrieved from databases, has become a widely used approach for knowledge-intensive applications. Modern RAG systems, however, expose many configuration choices, such as retrieval indexes, model selections, and how models invoke retrieval. Each configuration yields a different trade-off between answer quality and serving performance, making it challenging to choose the optimal setting for a specific application deployment. We present RAG-Stack, a framework for efficiently discovering quality-performance Pareto frontiers across diverse RAG applications and serving systems. RAG-Stack consists of RAG-PE, an iterative design-space exploration algorithm that selects the next RAG configuration to evaluate; RAG-IR, a workload abstraction for diverse RAG algorithms; and RAG-CM, a performance model that predicts the optimal deployment and serving performance on the given hardware. Together, these components allow RAG-Stack to search the joint algorithm-system configuration space without deploying every candidate and to transfer an existing Pareto frontier to a new serving system. Given the same number of optimization iterations across diverse datasets, the Pareto frontiers found by RAG-Stack cover 52.5% to 153.2% more of the normalized quality-performance space than those found by state-of-the-art configuration-search methods evaluated over the same RAG design space.
- Abstract(参考訳): データベースから取得した情報を用いて,大規模言語モデル(LLM)生成を増強する検索言語拡張世代(RAG)は,知識集約型アプリケーションにおいて広く利用されているアプローチとなっている。
しかし、現代のRAGシステムは、検索インデックス、モデル選択、モデルが検索を呼び出す方法など、多くの構成選択を公開している。
各構成は、応答品質とサービスパフォーマンスの間に異なるトレードオフをもたらし、特定のアプリケーションの配置に最適な設定を選択するのが困難になる。
本稿では,様々なRAGアプリケーションやサービスシステムにまたがる品質・パフォーマンスのParetoフロンティアを効率的に発見するフレームワークであるRAG-Stackを提案する。
RAG-Stackは、次のRAG構成を選択する反復的な設計空間探索アルゴリズムであるRAG-PEと、多様なRAGアルゴリズムのためのワークロード抽象化であるRAG-IRと、所定のハードウェア上で最適なデプロイメントとパフォーマンスを提供するパフォーマンスモデルであるRAG-CMで構成されている。
これらのコンポーネントを組み合わせることで、RAG-Stackは、すべての候補をデプロイすることなく、共同でアルゴリズム-システム構成空間を検索し、既存のParetoフロンティアを新しいサービスシステムに転送することができる。
多様なデータセットにまたがる最適化の繰り返しが同じ数あることを考えると、RAG-Stackが発見したParetoフロンティアは、同じRAG設計空間上で評価された最先端構成探索法よりも52.5%から153.2%の正規化された品質性能空間をカバーしている。
関連論文リスト
- RAISE: RAG Design as an Architecture Search Problem [16.431271020860443]
本稿では,RAGアーキテクチャ検索のためのフレームワークであるRAG Intelligence Search Engine (RAISE)を紹介する。
RAISEは、標準化された検索空間と予算の下でRAGパイプラインの最適化手法を評価する。
実験の結果,最適化性能はタスクに依存していることがわかった。
論文 参考訳(メタデータ) (2026-05-28T14:52:43Z) - RAGRouter-Bench: A Dataset and Benchmark for Adaptive RAG Routing [37.7721677767453]
適応型RAGルーティング用に設計された最初のデータセットとベンチマークであるRAG-Benchを紹介する。
RAG-Benchは、クエリコーパスの互換性の観点から検索を再考し、5つの代表的なRAGパラダイムを体系的評価のために標準化する。
DeepSeek-V3 と LLaMA-3.1-8B による実験は、単一のRAGパラダイムが普遍的に最適であることを示した。
論文 参考訳(メタデータ) (2026-01-30T20:38:11Z) - RAG-Stack: Co-Optimizing RAG Quality and Performance From the Vector Database Perspective [3.385836913732549]
Retrieval-augmented Generation (RAG) は、ベクトルデータベースの最も顕著な応用の1つである。
RAGシステムにおける品質-性能共最適化のための3ピラーブループリントであるRAG-Stackを提案する。
論文 参考訳(メタデータ) (2025-10-23T07:35:19Z) - HawkBench: Investigating Resilience of RAG Methods on Stratified Information-Seeking Tasks [102.72071523999169]
HawkBenchは、RAGのパフォーマンスを厳格に評価するために設計された、人間ラベル付きマルチドメインベンチマークである。
情報探索行動に基づくタスクの階層化により、HawkBenchはRAGシステムが多様なユーザニーズにどのように適応するかを体系的に評価する。
論文 参考訳(メタデータ) (2025-02-19T06:33:39Z) - FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research [70.6584488911715]
検索増強世代(RAG)は、かなりの研究関心を集めている。
既存のRAGツールキットは、しばしば重くて柔軟であり、研究者のカスタマイズのニーズを満たすことができない。
我々のツールキットは16の高度なRAGメソッドを実装し、38のベンチマークデータセットを収集し、整理した。
論文 参考訳(メタデータ) (2024-05-22T12:12:40Z) - RAGGED: Towards Informed Design of Scalable and Stable RAG Systems [51.171355532527365]
Retrieval-augmented Generation (RAG)は、外部知識を統合することで言語モデルを強化する。
RAGGEDは、RAGシステムを体系的に評価するためのフレームワークである。
論文 参考訳(メタデータ) (2024-03-14T02:26:31Z) - CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models [49.16989035566899]
Retrieval-Augmented Generation (RAG)は、大規模言語モデル(LLM)の能力を高める技術である。
本稿では,大規模かつ包括的なベンチマークを構築し,様々なRAGアプリケーションシナリオにおけるRAGシステムのすべてのコンポーネントを評価する。
論文 参考訳(メタデータ) (2024-01-30T14:25:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。