論文の概要: TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI
- arxiv url: http://arxiv.org/abs/2607.22465v1
- Date: Fri, 24 Jul 2026 16:29:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.180133
- Title: TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI
- Title(参考訳): TRACE-ROUTER:エージェントAIのためのタスク一貫性と適応型オンラインルーティング
- Abstract要約: 本稿では,タスクレベルのルーティングフレームワークであるTRACEについて述べる。
タスクの遅延フィードバックを活用することで、TRACEはワークロードに適応するルーティングポリシを学ぶ。
精度にマッチしたトレードオフを継続的に改善し、非レイテンシフロンティアポイントを達成します。
- 参考スコア(独自算出の注目度): 8.291830023781403
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Routing to select large language models (LLMs) with different cost-quality trade-offs has become a fundamental deployment feature of enterprise AI. Existing routers, primarily make independent routing decisions for each LLM call. However, agentic applications execute as long-horizon workflows whose quality is determined only by a delayed, task-level outcome. This mismatch prevents per-call routers from correctly attributing feedback to individual routing decisions. Towards mitigating this, we present TRACE-Router, a task-level routing framework that aligns routing with the unit of supervision. TRACE-Router assigns each task to a model once at admission using a contextual bandit, pins all subsequent LLM calls to the selected backend, and updates its policy using the task's terminal reward, jointly accounting for accuracy and latency. By leveraging delayed task feedback, TRACE-Router learns routing policies that adapt to the workload while avoiding explicit task-complexity estimation. Across three agentic benchmarks, TRACE-Router consistently improves the accuracy-latency trade-off, achieving non-dominated Pareto frontier points. On tau2-Bench, it outperforms latency-matched interpolation between individual models by 7-8 accuracy points, while on Terminal-Bench it achieves 7.1 higher accuracy points than the strongest single model baseline with 36% lower latency.
- Abstract(参考訳): さまざまなコスト品質のトレードオフを持つ大規模言語モデル(LLM)の選択をルーティングすることは、エンタープライズAIの基本的なデプロイメント機能になっています。
既存のルータは、LLMコール毎に独立したルーティング決定を行う。
しかしエージェントアプリケーションは、遅延したタスクレベルの結果によってのみ品質が決定されるロングホライゾンワークフローとして実行される。
このミスマッチは、呼び出し単位のルータが個々のルーティング決定にフィードバックを正しくもたらすのを防ぐ。
これを軽減するために,タスクレベルのルーティングフレームワークであるTRACE-Routerを提案する。
TRACE-Routerは、コンテクストのバンディットを使用して入場時に各タスクをモデルに割り当て、後続のLCMコールを選択されたバックエンドにピン留めし、タスクの端末報酬を使用してポリシーを更新し、精度とレイテンシを共同で説明する。
タスクフィードバックの遅延を活用することで、TRACE-Routerは、明示的なタスク複雑度推定を避けながら、ワークロードに適応するルーティングポリシーを学ぶ。
3つのエージェントベンチマークで、TRACE-Routerは精度とレイテンシのトレードオフを一貫して改善し、非支配的なパレートフロンティアポイントを達成する。
tau2-Benchでは、個々のモデル間の遅延整合補間を7~8の精度で上回り、Terminal-Benchでは36%のレイテンシで最強の単一モデルベースラインよりも7.1の精度で達成している。
関連論文リスト
- Agent-as-a-Router: Agentic Model Routing for Coding Tasks [54.00153674547733]
Agent-as-a-router (AC)はC-A-Fループとしてルーティングを形式化する(Context->Action->FeedbackContext)
ACは、分配タスクに対する最小の累積後悔を達成し、配布外エージェントプログラミングタスクに一般化する。
論文 参考訳(メタデータ) (2026-06-22T06:37:31Z) - Learning Agent Routing From Early Experience [55.88886987958933]
バウンダリ(Boundary)は、初期の行動経験とルーリック誘導推論を使用して、クエリに直接推論で答えるか、エージェントにエスカレートするかを決定する、トレーニング不要なルーティングフレームワークである。
また, 直接LLM推定よりも28.6%性能が向上し, 予測時間を60.6%短縮することを示した。
論文 参考訳(メタデータ) (2026-05-08T03:18:40Z) - The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project [30.96691028676722]
vLLM Semantic Routerプロジェクトは、信号駆動ルーティング、コンテキスト長プールルーティング、ルータパフォーマンスエンジニアリング、ポリシー競合検出、低レイテンシ組み込みモデル、カテゴリ認識セマンティックキャッシング、ユーザフィードバック駆動ルーティング適応、幻覚検出、プライバシーとジェイルブレイク保護のための階層的コンテンツ安全分類を対象とする一連の作業をリリースした。
本稿では,LLM推論最適化のための3次元フレームワークであるWorkload-Pool-Poolアーキテクチャについて述べる。
論文 参考訳(メタデータ) (2026-03-22T18:30:11Z) - Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization [58.59491516762626]
マルチエージェントシステム(MAS)のための効率的かつ解釈可能なルーティングフレームワークAMRO-Sを提案する。
AMRO-Sは、意味条件付き経路選択問題としてMASルーティングをモデル化し、3つのキーメカニズムを通してルーティング性能を向上させる。
5つの公開ベンチマークと高速ストレステストによる大規模な実験により、AMRO-Sは強いルーティングベースラインに対する品質-コストトレードオフを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-03-13T12:26:05Z) - TCAndon-Router: Adaptive Reasoning Router for Multi-Agent Collaboration [0.9564467981235256]
マルチエージェントシステム(MAS)は、高性能なインテリジェントアプリケーションを構築するための強力なパラダイムとなっている。
これらのシステム内では、特定のクエリを処理する専門家エージェントを決定するルータが、全体的なパフォーマンスにおいて重要な役割を果たす。
これらの課題に対処するため,マルチエージェント協調のための適応推論ルータTCAndon-TCARを提案する。
公開データセットと実際のエンタープライズデータの実験は、TARがルーティングの正確性を大幅に改善し、ルーティングの競合を低減し、あいまいなシナリオで堅牢であることを示している。
論文 参考訳(メタデータ) (2026-01-08T03:17:33Z) - Dr.LLM: Dynamic Layer Routing in LLMs [55.11953638340419]
Dr.LLMは、事前訓練されたモデルに軽量な層ごとのルータを装備し、ブロックをスキップ、実行、繰り返すように決定する、適合性のあるフレームワークである。
ARC(logic)とDART(math)では、Dr.LLMは平均で5つのレイヤを保存しながら、最大3.4%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-10-14T17:51:26Z) - ProxRouter: Proximity-Weighted LLM Query Routing for Improved Robustness to Outliers [14.831117443453165]
大規模言語モデル(LLM)クエリルータは、現代のAIプラットフォームにとって極めて重要である。
非パラメトリックルータにおけるバイアスと分散のバランスをとるために指数関数的に傾いたアグリゲーション機構を応用したProxを提案する。
論文 参考訳(メタデータ) (2025-10-10T20:28:14Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory [57.449129198822476]
RCRは、マルチエージェント大言語モデル(LLM)システムのためのロールアウェアコンテキストルーティングフレームワークである。
役割とタスクステージに基づいて、各エージェントに対して意味的に関連するメモリサブセットを動的に選択する。
軽量スコアリングポリシは、メモリ選択をガイドし、エージェント出力を共有メモリストアに統合する。
論文 参考訳(メタデータ) (2025-08-06T21:59:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。