論文の概要: Agentic Routing: The Harness-Native Data Flywheel
- arxiv url: http://arxiv.org/abs/2607.11399v1
- Date: Mon, 13 Jul 2026 11:05:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.444545
- Title: Agentic Routing: The Harness-Native Data Flywheel
- Title(参考訳): Agentic Routing:Harness-Native Data Flywheel
- Authors: Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang,
- Abstract要約: DRACOやPinchBenchなどのエージェントベンチマークにおけるシングルトンおよびマルチモデルルーティングに関する研究
エージェントルーティングは単なるコストコントロールではなく、エージェントネイティブなトレーニングのためのデータエンジンである、と氏は主張する。
- 参考スコア(独自算出の注目度): 35.444792826526
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model agents are increasingly executed not by a single model call, but by an execution harness that manages observation, context, control, action, state, and verification. At the same time, frontier and open models are becoming structurally specialized: a model that is strong at code editing, long-context recovery, tool use, mathematical reasoning, or low-latency response may not dominate on the other axes. This makes model selection inside an agent a core systems problem rather than a per-query serving trick. Existing routing methods mostly optimize single-turn cost-quality trade-offs and therefore miss the execution state, intermediate failures, and feedback loops that make agents different from chat completion. We propose Harness-Native agentic routing, a step-level routing paradigm that selects either a single best-fit model for cost-effective execution or multiple complementary models for ensemble-style accuracy improvement, conditioned on the full harness state. The key insight is that every routing decision naturally produces a structured data record -- consisting of the query, harness state, model choice or model set, execution trace, outcome, and cost -- whose labels are supplied by the environment rather than by the router itself. These records form a harness-native data flywheel: execution traces train better routers and harness-native models, which improve cost-quality trade-offs and generate more traces under the same budget. We instantiate this idea in OpenSquilla with a four-layer routing stack, an open LightGBM cold-start ranker, and a staged router-model path that turns logged arena records into progressively stronger routing policies. The report studies singleton and multi-model routing on agentic benchmarks including DRACO and PinchBench, and argues that agentic routing is not merely cost control, but a data engine for agent-native training.
- Abstract(参考訳): 大きな言語モデルエージェントは、単一のモデルコールではなく、観察、コンテキスト、制御、アクション、状態、検証を管理する実行ハーネスによってますます実行されます。
コード編集、長いコンテキストのリカバリ、ツールの使用、数学的推論、低レイテンシ応答が他の軸では支配できないかもしれない。
これにより、エージェント内のモデル選択は、クエリごとのサービストリックではなく、コアシステムの問題になります。
既存のルーティング手法は、主に単一ターンのコスト品質のトレードオフを最適化するため、実行状態、中間障害、およびエージェントをチャット補完とは異なるものにするフィードバックループを見逃す。
本稿では,コスト効率の良い実行に適した1つの最適モデルを選択するステップレベルのルーティングパラダイムであるHarness-Nativeエージェントルーティングと,アンサンブルスタイルの精度向上のための複数の補完モデルを提案する。
重要な洞察は、すべてのルーティング決定が自然に構造化されたデータレコード -- クエリ、ハーネス状態、モデル選択またはモデルセット、実行トレース、結果、コスト -- を生成し、そのラベルはルータ自体ではなく環境から供給される、ということです。
これらのレコードはハーネスネイティブのデータフライホイールを形成する。実行トレースはより良いルータとハーネスネイティブモデルをトレーニングし、コスト品質のトレードオフを改善し、同じ予算の下でより多くのトレースを生成する。
OpenSquillaでは、このアイデアを4層ルーティングスタック、オープンなLightGBMコールトスタートローダ、ログ付きアリーナレコードを段階的に強力なルーティングポリシに変換するルータモデルパスでインスタンス化しています。
このレポートは、DRACOやPinchBenchといったエージェントベンチマークのシングルトンおよびマルチモデルルーティングを研究し、エージェントルーティングは単なるコスト制御ではなく、エージェントネイティブトレーニングのためのデータエンジンである、と論じている。
関連論文リスト
- SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks [11.50404356970464]
マルチターンエージェントハーネスに埋め込まれた大規模言語モデル(LLM)は、ソフトウェア工学(SWE)を再構築している
しかし、多くの問題が安い修正を認めると、すべてのタスクをフロンティアモデルにルーティングするのは無駄です。
SWEは,探索的なターン数回で安価なモデルを実行し,結果として生じる部分軌道を読み取る,価値に基づく時間的アプローチである。
本稿では,SWEタスクのコスト効率を大幅に向上すると同時に,より強力なモデルの性能の大部分を維持しながら,SWEタスクのコスト効率を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2026-06-30T01:46:26Z) - Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving [69.5155152169752]
大規模言語モデル(LLM)のための2段階カスケードソリューションを提案する。
ステージ1は、受信するクエリをクラスタ化し、各クラスタを最もコスト効率の良いモデルに割り当てる。
ステージ2は品質推定(QE)カスケードを追加し、ステージ1からの出力が低品質であると判断されると、クエリはより強力なモデルにエスカレーションされる。
テストデータセットでは、カスケードシステムは最強モデルの精度の97-99%を保持し、TPOT(Time Per Output Token)を削減している。
タスクの正確性ラベルのみを必要とし、手動で再構成することなくモデルプールの変更に適応する。
論文 参考訳(メタデータ) (2026-06-25T18:29:24Z) - RouterKGQA: Specialized--General Model Routing for Constraint-Aware Knowledge Graph Question Answering [23.627999197728403]
KGQA は構造化および検証可能な知識グラフの推論を基礎にして LLM 幻覚を緩和するための有望なアプローチである。
本稿では,専門的なモデルコラボレーションのためのフレームワークであるRogerKGQAを提案する。
RouterKGQAはF1では3.57ポイント、Hits@1では0.49ポイント、ベンチマーク全体では平均して最高の成績を示している。
論文 参考訳(メタデータ) (2026-03-20T15:01:57Z) - Models Under SCOPE: Scalable and Controllable Routing via Pre-hoc Reasoning [28.165465162107253]
コストと性能を予測してモデル選択を超えるルーティングフレームワークであるSCOPEを提案する。
SCOPEは、モデル名の固定に依存するのではなく、モデルがどのように同様の問題に対処するかを検索することで、推論に基づく予測を行う。
性能が優先される場合の精度を最大25.7%向上させるか、効率が重要な場合のコストを最大95.1%削減することができる。
論文 参考訳(メタデータ) (2026-01-29T21:09:36Z) - EvoRoute: Experience-Driven Self-Routing LLM Agent Systems [100.64399490164959]
EvoRouteは、静的で事前定義されたモデルの割り当てを超越する、自己進化型のモデルルーティングパラダイムである。
挑戦的なエージェントベンチマークの実験によると、既製のエージェントシステムに統合されたEvoRouteは、システムのパフォーマンスを維持または向上するだけでなく、実行コストを最大80%削減し、レイテンシを70%以上削減する。
論文 参考訳(メタデータ) (2026-01-06T04:06:46Z) - Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning [20.41220110321494]
コスト効率の良い推論のための信頼誘導ステップワイドモデルルーティングを提案する。
STEERはドメインに依存しないフレームワークで、小さくて大きな言語モデル間のきめ細かいステップレベルのルーティングを実行する。
その結果,モデルルーティングのための堅牢でドメインに依存しない信号として,モデル内部信頼が確立された。
論文 参考訳(メタデータ) (2025-11-09T02:33:08Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering [51.07491603393163]
tAgentは知識グラフ誘導ルーティング問題としてマルチエージェントQAを定式化するフレームワークである。
エージェントアウトプットのソフトな監督と重み付けされた集約を活用することで、エージェントは多様なエージェントの相補的な強みを捉える、原則化された協調スキームを学ぶ。
論文 参考訳(メタデータ) (2025-10-06T23:20:49Z) - BEST-Route: Adaptive LLM Routing with Test-Time Optimal Compute [25.740809143951815]
BEST-Routeは、クエリの難しさと品質閾値に基づいて、モデルとサンプルに対する応答数を選択する新しいルーティングフレームワークである。
実世界のデータセットを用いた実験により,提案手法はコストを最大60%削減し,性能低下は1%以下であった。
論文 参考訳(メタデータ) (2025-06-28T01:52:50Z) - How Robust Are Router-LLMs? Analysis of the Fragility of LLM Routing Capabilities [62.474732677086855]
大規模言語モデル(LLM)ルーティングは,計算コストと性能のバランスをとる上で重要な戦略である。
DSCベンチマークを提案する: Diverse, Simple, and Categorizedは、幅広いクエリタイプでルータのパフォーマンスを分類する評価フレームワークである。
論文 参考訳(メタデータ) (2025-03-20T19:52:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。