論文の概要: PACE: Perceived-Latency-Aware Cascading Service Routing and Filler Control for QoE-Efficient Retrieval-Augmented Dialogue Serving
- arxiv url: http://arxiv.org/abs/2609.10372v2
- Date: Thu, 10 Sep 2026 13:31:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 14:47:34.310515
- Title: PACE: Perceived-Latency-Aware Cascading Service Routing and Filler Control for QoE-Efficient Retrieval-Augmented Dialogue Serving
- Title(参考訳): PACE:QoE効率の良い検索音声対話における遅延対応カスケードサービスルーティングとフィラー制御
- Authors: Lin Huang, Yujuan Tan, Weisheng Li, Lixiang Zeng, Kun Yang, Yongzong Wang, Suihan Xiao,
- Abstract要約: PACEは、QoEの目的として知覚された時間対第一応答(PTFR)を形式化する検索拡張対話サービスのためのフレームワークである。
負荷適応型カスケードルータ、ジョイントパスフィラーコントローラ、ボラティリティ対応キャッシュインプットの3つのメカニズムが組み合わさっている。
- 参考スコア(独自算出の注目度): 20.078978298696466
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present the PACE, a framework for retrieval-augmented dialogue serving that formalizes Perceived Time-to-First-Response (PTFR) as a QoE objective and minimizes it under quality/cost constraints. Unlike prior work on cascaded routing, semantic caching, or adaptive retrieval, PACE jointly controls which answer source composes the response and what fills the waiting window. Deployed on a humanoid-robot sales service, it combines three mechanisms: a load-adaptive cascading router, a joint path-filler controller, and volatility-aware cache admission. On 75k CarQA requests, the cascade halves pure-LLM PTFR at P95 (0.29 vs 0.53s at c16). The adaptive controller reaches 0.41s P95, outperforming RAG by 2.4 times at high load with equal quality. The filler controller cuts calls by 94% with zero conflict. Volatility-aware admission reduces stale answers from 86% to 0%. A gating rule ensures the controller never worse than the baseline, with exposure bounded by one hold period. This is the first quantification of filler-answer conflict risk in deployed services.
- Abstract(参考訳): 本稿では,PTFR(Perceived Time-to-First-Response)をQoE目標として定式化し,品質・コスト制約下で最小化する検索拡張対話サービスフレームワークであるPACEを提案する。
カスケードルーティング、セマンティックキャッシュ、あるいは適応検索に関する以前の作業とは異なり、PACEはどの応答ソースが応答を構成し、何が待機ウィンドウを埋めるかを共同で制御する。
ヒューマノイドロボット販売サービスにデプロイされ、負荷適応型カスケーディングルータ、ジョイントパスフィラーコントローラ、ボラティリティ対応キャッシュアクセプションの3つのメカニズムを組み合わせる。
75kのCarQA要求では、カスケードは純粋なLLM PTFRをP95で半減する(c16では0.29対0.53)。
適応コントローラは0.41s P95に達し、RAGを同じ品質の高負荷で2.4倍の速度で上回る。
ファイラーコントローラは、コンフリクトゼロでコールを94%削減する。
ボラティリティを意識した入室は、古い回答を86%から0%に減少させる。
ゲーティング規則により、コントロールはベースラインよりも決して悪くなく、露光は1つのホールド期間で制限される。
これは、デプロイされたサービスにおけるフィラー・アンサー・コンフリクトのリスクの定量化である。
関連論文リスト
- From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - VQC-ZTI: Variational Quantum Control for Zero Trust Protection of the Tactile Internet [1.0334649765057298]
テキスタイルインターネットサービスは、物理的アクティベーションに直接サイバーイベントを関連付けるため、セキュリティ上の決定は制御経路を乱すことなくリスク差別を改善する。
本稿では、タクティルインターネットサービスのゼロトラスト保護のための分割平面フレームワークであるVQCZTIを提案する。
論文 参考訳(メタデータ) (2026-08-19T06:08:41Z) - A Self-Triggered Agentic Push Recommendation System [77.13502692161426]
プッシュ通知は、大規模プラットフォームにおける重要なレコメンデーションシナリオである。
本稿では,プロアクティブ・セルフトリガー・エンド・ツー・エンドのエージェント・プッシュ・レコメンデーションシステムを提案する。
STEPSはすでにDouyinに10億人以上のユーザーを抱えている。
論文 参考訳(メタデータ) (2026-08-03T09:20:53Z) - Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure [6.71937346130764]
DiLoCoスタイルのトレーニングは、時折外部同期の前に島々をローカルに列車に乗せることで通信を減らします。
このような船体に対する疑問は、外部マージがシステムコストに見合う価値があるのか、そして、事項を遅らせるためにエフェロウィンドウを選択するかどうかである。
このギャップを、スコアベースのコントローラであるWorkloadAware DiLoCoで埋めます。
論文 参考訳(メタデータ) (2026-06-24T05:57:19Z) - Reliability-Asymmetric Spacecraft Autonomy: Co-Designing a Capable Learned GNC Stack with a Verified, Adaptation-Aware Runtime Shield [2.28438857884398]
ルールベースの自律性は認証可能であるが不安定であり、学習された自律性は能力があるが検証するのは難しい。
AMPLE-GNCは3層誘導、ナビゲーション、制御スタックである。
文法制約付き復号化による事前訓練された360Mモデルの微調整は、ハードな出力値保証を与える。
我々は,有能な制御器であっても,ラッチングセーフホールドシールドが抑制可能であることを示す。
論文 参考訳(メタデータ) (2026-06-24T03:55:21Z) - ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning [0.0]
ZAPS-DAは、無視可能なフェーズラグと後処理のないデプロイ時のアクションジッタを低減するフレームワークである。
MetaDriveでは、ZAPS-DAはステアリングジッタを14-21x、スロットルジッタを3-5x削減する。
論文 参考訳(メタデータ) (2026-05-28T22:05:08Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - IMPACT-HOI: Supervisory Control for Onset-Anchored Partial HOI Event Construction [72.51952455865155]
我々は,エゴセントリックなプロシージャビデオに注釈を付けるための混合開始型フレームワークIMPACT-HOIを提案する。
IMPACT-HOIは、このタスクを部分的に指定され、オンセットされたイベント状態の漸進的な解決として捉えている。
9人の参加者によるユーザスタディでは、手動のアノテーションアクションが13.5%減少し、46.67%のイベントマッチレート、確認されたフィールド違反がゼロである。
論文 参考訳(メタデータ) (2026-05-03T01:37:40Z) - EverydayGPT: Confidence-Gated Routing for Efficient and Safe Hybrid GPT-RAG Conversational QA [0.0]
EverydayGPTは、信頼性保証ルーティング機構を中心に構築された軽量な会話型QAシステムである。
CGRは、高速なRAG抽出によって解決することで、クエリの85%に対してコストのかかるGPT経路の呼び出しを回避している。
システムは F1 = 0.226 +/- 0.004 を GPT のみの 0.171 と無条件の RAG の 0.210 と比較すると達成する。
論文 参考訳(メタデータ) (2026-04-24T12:44:26Z) - Bridging Large-Model Reasoning and Real-Time Control via Agentic Fast-Slow Planning [42.15812524999639]
Agentic Fast-Slow Planning(エージェント・ファスト・スロー・プランニング)は、知覚、推論、計画、そして自然の時間スケールをまたいだ制御を分離する階層的なフレームワークである。
エージェント高速スロープランニングは摂動下での堅牢性を向上し、純粋なMPCおよびA*誘導MPCベースラインと比較して、横方向偏差を最大45%減らし、完了時間を12%以上短縮することを示した。
論文 参考訳(メタデータ) (2026-04-02T06:34:29Z) - TARG: Training-Free Adaptive Retrieval Gating for Efficient RAG [46.122203287541005]
トレーニングフリーのAdaptive Retrieval Gating (TARG) は、ベースモデルからの短い非遅延ドラフトのみを使用していつ取得するかを決定する、単発のポリシーである。
NQ-Open、TriviaQA、PopQAでは、TARGは一貫して精度と効率のフロンティアをシフトさせる。
論文 参考訳(メタデータ) (2025-11-12T23:09:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。