論文の概要: From Monolithic Blending to Agentic Orchestration: Dynamic Response for Conversational Assistants at Scale
- arxiv url: http://arxiv.org/abs/2609.05758v2
- Date: Wed, 09 Sep 2026 01:43:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.130222
- Title: From Monolithic Blending to Agentic Orchestration: Dynamic Response for Conversational Assistants at Scale
- Title(参考訳): モノリシックブレンディングからエージェントオーケストレーションへ:大規模会話アシスタントの動的応答
- Authors: Cen Mia Zhao, Peng Wang, Chuan Shi, Yufeng Zhang, Ying Lyu, Wanmeng Ren, Robert Xue, Claire Na Cheng, Yashar Mehdad,
- Abstract要約: 本稿では,大規模な宿泊市場における顧客支援アシスタントの運用移行について報告する。
DRは、単一のQwen3-235B-A22Bブレンドレシーバーを、タイプされたツールよりも有界なReActオーケストレータに置き換える。
それぞれの効果は原因であり、アーキテクチャ効果は同一の再生回転で測定されたもののみであると主張する。
- 参考スコア(独自算出の注目度): 17.274780841826438
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Conversational assistants can blend retrieval, action selection, escalation, and wording in a single model path, or separate those roles. We report a production migration of a customer-support assistant at a large accommodation marketplace (millions of conversations per month, 11 languages, 10-second P90). Dynamic Response (DR) replaces a single Qwen3-235B-A22B blended responder with a bounded ReAct orchestrator over typed tools plus a smaller generator that writes from a backend-validated context contract. Because the migration also changed prompts, alignment, and serving, we attribute each effect to its cause and claim as architecture effects only those measured on identical replayed turns: typed entity selection moves the reservation selector to a precision-first operating point (precision 8.3% to 89.1%, recall 75.2% to 67.3%), and typed action IDs with a membership check remove observed structured-action hallucination (2.14% to 0.0%). A low-ramp A/B test reproduces the replay escalation reductions: hard-escalation responses fall from 5.60% to 3.08% and soft-escalation responses from 9.56% to 2.49%, while production handoff volume holds roughly steady; self-solve is directional (+5.1 points, 95% CI [-2, +12]). Serving optimizations cut orchestrator P90 latency from 3.87s to 2.24s on a GPU footprint reduced by roughly one-third, and self-hosting reduces estimated annual model-serving cost by more than an order of magnitude.
- Abstract(参考訳): 会話アシスタントは、検索、アクション選択、エスカレーション、単語を1つのモデルパスでブレンドしたり、それらの役割を分離することができる。
本稿では,大規模な宿泊市場における顧客支援アシスタントの運用移行について報告する(毎月数百万の会話,11言語,10秒のP90)。
Dynamic Response (DR)は、単一のQwen3-235B-A22Bブレンドレスポンダを、タイプされたツール上の境界付けられたReActオーケストレータと、バックエンド検証されたコンテキストコントラクトから書き込む小さなジェネレータに置き換える。
タイプドエンティティ選択は、予約セレクタを精度第一の操作点(精度8.3%から89.1%、リコール75.2%から67.3%)に移動させ、メンバシップチェック付きのタイプドアクションIDは、観察された構造化アクション幻覚(2.14%から0.0%)を除去する。
ハードエスカレーション反応は5.60%から3.08%に減少し、ソフトエスカレーション反応は9.56%から2.49%に減少し、プロダクションハンドオフ体積はほぼ一定であり、自己解決は方向性(+5.1ポイント、95% CI [-2, +12])である。
実際の最適化により、GPUフットプリントにおけるオーケストレータP90のレイテンシは3.87sから2.24sに約3分の1削減された。
関連論文リスト
- Instruction Duplication as an Inference-Time Control Primitive [0.003596046562524959]
手続き的命令は制御可能な言語モデルシステムの基本的要件である。
手続き的命令のみを繰り返す最小限のブラックボックス推論時間制御である命令重複を導入する。
論文 参考訳(メタデータ) (2026-09-03T16:05:21Z) - Chameleon: An Adaptive AI-Driven Honeypot Architecture Using Threat-Calibrated Particle Swarm Optimization and Semantic Deception Rapidly-Exploring Random Trees [0.0]
低コストの商用偽装製品は、応答エンジンがリアルタイムモデル駆動のフィードバックに結びついていないという、関連する弱点を共有している。
メカニズムは、両方の欠点に対処するために、オープンに分散されたアダプティブなハニーポットプラットフォームである。
論文 参考訳(メタデータ) (2026-08-15T20:30:14Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Output Vector Editing for Memorization Mitigation in Large Language Models [68.30351930772788]
大規模な言語モデルは、トレーニングデータからシーケンスを記憶し、再現し、プライバシ、著作権、セキュリティリスクを生み出す。
既存のニューロンレベルの緩和方法は、ニューロンの活性化をゼロにすることで編集を等しくするが、活性化はニューロンが関与するかどうかのみを制御する。
記憶継続に責任を負うニューロンの小さな集合を探索する制約最適化編集である出力ベクトル編集を提案する。
論文 参考訳(メタデータ) (2026-06-17T07:29:18Z) - Hierarchical Online Prompt Mutation with Dual-Loop Feedback for Guardrailed Evidence Document Generation: A Production-Evaluation Case Study [0.0]
HOPMは階層的なオンラインプロンプト突然変異フレームワークである。
本論文は、制御設定、サンプルサイズ、信頼区間、ペアテスト、プロンプトトークンカテゴリ、擬似コード、スキーマ、ルーリック、ガードレール分類、構築された例を含む。
論文 参考訳(メタデータ) (2026-05-31T22:17:44Z) - Human-Inspired Memory Architecture for LLM Agents [0.9507070656654629]
6つの認知機構からなる生体記憶アーキテクチャを提案する。
各メカニズムは、単純メモリ蓄積の特定の障害モードに対処する。
S層スケール(50セッション)では、デダップベースのコンソリデーションにより、好みのリコールが+13.3pp向上する。
論文 参考訳(メタデータ) (2026-05-08T22:52:37Z) - A Delta-Aware Orchestration Framework for Scalable Multi-Agent Edge Computing [0.0]
Synergistic Collapseは、100以上のエージェントをスケーリングすることで、個々の最適化が防止できない超線形パフォーマンスの低下を引き起こす。
これまでの研究は、指数的行動空間成長、空間的隣接エージェント間の計算冗長性、タスクに依存しないハードウェアスケジューリングなど、それぞれの要因に対処してきた。
1) 中間層活性化を記憶し入力デルタのみを演算する微分ニューラルキャッシング、(2) エージェントを優先度階層に整理し、調整の複雑さを O(n2) から O(n log n) へ6%未満の最適で減少させる臨界ベースのアクションスペースプラニング、の3つに同時に対処するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-22T02:54:35Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play [52.3079697845254]
evaは、オフラインとオンラインのRLポストトレーニングの両方で、言語モデルがトレーニングプロンプトを適応的に作成できるようにする最初の方法である。
我々は,エバが有効なRLキュリキュラを作成でき,アブレーションにまたがって堅牢であることを示す。
論文 参考訳(メタデータ) (2024-10-31T08:15:32Z) - Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter
Encoders for Natural Language Understanding Systems [63.713297451300086]
本研究では,700Mから9.3Bまでの非埋め込みパラメータ数を持つ事前学習エンコーダの大規模実験結果について述べる。
その後、17M-170Mパラメータからより小さなモデルに蒸留し、仮想アシスタントシステムの自然言語理解(NLU)コンポーネントに応用した。
論文 参考訳(メタデータ) (2022-06-15T20:44:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。