論文の概要: SAGE: SLO-Aware Adaptive Retrieval for Production RAG Systems
- arxiv url: http://arxiv.org/abs/2608.08237v1
- Date: Sat, 08 Aug 2026 17:05:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.734604
- Title: SAGE: SLO-Aware Adaptive Retrieval for Production RAG Systems
- Title(参考訳): SAGE: SLO-Aware Adaptive Retrieval for Production RAG Systems
- Abstract要約: 本稿では,クエリ毎の経路数kを動的に選択する学習SLO対応検索ポリシーであるSAGEを提案する。
Natural Questionsでは、5s P95レイテンシの下で、SAGEは95%のSLOコンプライアンスを達成し、最高の静的ベースライン(k)では30%、P95レイテンシを36%、検索コストを51%削減する。
- 参考スコア(独自算出の注目度): 12.570675776086608
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-Augmented Generation (RAG) systems in production operate under strict service level objectives (SLOs) on tail latency and infrastructure cost. However, standard retrieval pipelines rely on fixed retrieval budgets that ignore query difficulty, over-retrieving for easy queries and under-serving hard ones, forcing operators to trade answer quality against SLO compliance. This paper proposes SAGE, a learned SLO-aware adaptive retrieval policy that dynamically selects the number of passages k per query. SAGE uses lightweight features derived from initial retrieval (e.g., score distributions, rank gaps, lexical signals) and is trained offline via imitation learning from an oracle that approximates optimal latency-quality trade-offs. At inference, it adds no LLM calls and minimal overhead. On Natural Questions, under a 5s P95 latency SLO, SAGE achieves 95% SLO compliance versus 30% for the best static baseline (k=20), reduces P95 latency by 36% and retrieval cost by 51% with only 2 percentage points Exact Match (EM) loss. A single policy trained on Natural Questions generalizes across HotpotQA, UnSeenTimeQA, and four LLM families (Llama, Qwen, Mistral, Gemma), consistently yielding +45-52 point SLO improvements without quality degradation.
- Abstract(参考訳): Retrieval-Augmented Generation(RAG)システムは、テールレイテンシとインフラストラクチャコストに基づいて、厳格なサービスレベル目標(SLO)の下で運用されている。
しかし、標準的な検索パイプラインは、クエリの困難さやクエリの過剰な検索、ハードなものの不足を無視する固定された検索予算に依存しており、オペレータはSLO準拠に対して応答品質をトレードオフせざるを得ない。
本稿では,問合せ数kを動的に選択する学習型SLO適応型検索ポリシーであるSAGEを提案する。
SAGEは、初期検索(例えば、スコア分布、ランクギャップ、語彙信号)から派生した軽量な機能を使用し、最適なレイテンシ品質のトレードオフを近似するオラクルからの模倣学習を通じてオフラインでトレーニングされる。
推論では、LLM呼び出しは不要で、オーバーヘッドは最小限である。
Natural Questionsでは、SAGEは5s P95レイテンシSLOの下で、最高の静的ベースライン(k=20)で95%のSLO準拠を実現し、P95レイテンシを36%削減し、検索コストを51%削減する。
自然問題に関する単一のポリシーは、HotpotQA、UnSeenTimeQA、および4つのLLMファミリー(Llama、Qwen、Mistral、Gemma)にまたがって一般化され、品質劣化のない45-52ポイントのSLO改善を継続的に達成している。
関連論文リスト
- A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination [51.06539604709775]
本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
論文 参考訳(メタデータ) (2026-08-05T14:01:10Z) - When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling [1.0152838128195467]
衛星スケジューリングにおける深い強化学習のための適応的な報酬設計は、レギュラーアウェアの報酬重みが静的なよりも優れているという直感によって動機付けられている。
PPOは値関数収束のために定常的な報酬信号を必要とするため、ほぼ安定な報酬重み(342.1 Mbps)は慎重に調整された動的重み(103.396.8 Mbps)より優れていることを示す。
論文 参考訳(メタデータ) (2026-04-04T03:04:53Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - SLO-Conditioned Action Routing for Retrieval-Augmented Generation: Objective Ablation and Failure Modes [0.0]
この作業では、クエリ毎の制御を、検索深さと生成モード(ガードされている対auto)を選択する、あるいは拒否する、小さな個別アクションとしてモデル化する。
オフラインログデータセットは、それぞれのアクションと記録精度、トークンコスト、幻覚/拒絶指標、SLO重み付き報酬を実行することにより、SQuAD 2.0から構築される。
2つのシンプルな政策学習目標が評価され、国家ごとの最良の行動の教師付き分類と報酬重み付き変種が評価される。
論文 参考訳(メタデータ) (2025-12-27T15:37:53Z) - Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems [54.916243942641444]
大規模言語モデル(LLM)は、通信などの分野において、自動化の鍵となる存在として浮上している。
本研究では,問合せパイプラインによる意思決定を支援する,エッジクラウドに精通したLLMベースの知識システムについて検討する。
論文 参考訳(メタデータ) (2025-12-23T03:10:09Z) - MixLLM: Dynamic Routing in Mixed Large Language Models [57.309520357563215]
大規模言語モデル(LLM)は、最近、人工知能の可能性を秘めている。
問合せ-LLM代入のための動的コンテキスト帯域ベースのルーティングシステムであるMixLLMを開発した。
論文 参考訳(メタデータ) (2025-02-09T02:26:15Z) - Confident or Seek Stronger: Exploring Uncertainty-Based On-device LLM Routing From Benchmarking to Generalization [61.02719787737867]
大規模言語モデル(LLM)はますますエッジデバイスにデプロイされ、民主化されている。
1つの有望な解決策は不確実性に基づくSLMルーティングであり、SLM上での低信頼応答が発生すると、高い要求を強いLCMにオフロードする。
我々は1500以上の設定でSLMからLLMへの不確実性駆動型ルーティング戦略のベンチマークと一般化を包括的に調査する。
論文 参考訳(メタデータ) (2025-02-06T18:59:11Z) - Reconciling High Accuracy, Cost-Efficiency, and Low Latency of Inference
Serving Systems [0.0]
InfAdapterは、レイテンシSLOを満たすために、リソース割り当てでMLモデルの一連の変種を積極的に選択する。
SLO違反を減らし、業界で人気のオートスケーラと比較して、それぞれ65%と33%に値下げする。
論文 参考訳(メタデータ) (2023-04-21T11:19:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。