論文の概要: SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks
- arxiv url: http://arxiv.org/abs/2607.00053v1
- Date: Tue, 30 Jun 2026 01:46:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.597811
- Title: SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks
- Title(参考訳): SWE-Router:マルチターンエージェントエンジニアリングタスクのルーティング
- Authors: Seongho Son, Sangwoong Yoon, Jiahua Tang, Shuhan Wang, Lorenz Wolf, Ilija Bogunovic,
- Abstract要約: マルチターンエージェントハーネスに埋め込まれた大規模言語モデル(LLM)は、ソフトウェア工学(SWE)を再構築している
しかし、多くの問題が安い修正を認めると、すべてのタスクをフロンティアモデルにルーティングするのは無駄です。
SWEは,探索的なターン数回で安価なモデルを実行し,結果として生じる部分軌道を読み取る,価値に基づく時間的アプローチである。
本稿では,SWEタスクのコスト効率を大幅に向上すると同時に,より強力なモデルの性能の大部分を維持しながら,SWEタスクのコスト効率を大幅に向上させることを示す。
- 参考スコア(独自算出の注目度): 11.50404356970464
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) embedded in multi-turn agentic harnesses are reshaping software engineering (SWE), but routing every task to a frontier model is wasteful when many issues admit cheap fixes. Existing LLM routers operate on the task description alone, which inherits an information-theoretic Bayes-error floor in agentic settings: a similar issue can hide either a localized typo or a multi-module refactor, and the prompt does not separate the two. We introduce SWE-Router, a value-based temporal approach that lets a cheap model run for a few exploratory turns and reads the resulting partial trajectory before deciding whether to continue cheaply or to escalate to an expensive model. We provide a Bayes-optimality theorem showing that conditioning on the partial trajectory never harms routing and is strictly better whenever exploration is informative. Across the LLM pairs of weak and strong models spanning the contemporary cost--capability frontier, we show that SWE-Router greatly improves the cost efficiency of SWE tasks, while maintaining the majority of the performances of the stronger model. We additionally release a multi-LLM trajectory dataset which allows reproduction of our trajectory-level routing.
- Abstract(参考訳): マルチターンエージェントハーネスに埋め込まれた大規模言語モデル(LLM)は、ソフトウェアエンジニアリング(SWE)を再構築している。
既存のLLMルータはタスク記述のみで動作し、エージェント設定で情報理論上のベイズエラーフロアを継承する。
SWE-Routerは,安価に継続するか,あるいは高価なモデルにエスカレートするかを決定する前に,安価なモデルを数回の探索回転で実行し,結果として生じる部分的軌道を読み取る,価値に基づく時間的アプローチである。
ベイズ最適定理は、部分軌道の条件付けが経路に害を与えず、探索が情報的であれば厳密によいことを示すものである。
SWE-Router は,SWE タスクのコスト効率を大幅に向上させるとともに,SWE タスクの性能の大部分を維持できることを示した。
トラジェクトリレベルのルーティングを再現可能なマルチLLMトラジェクトリデータセットもリリースしています。
関連論文リスト
- Agent-as-a-Router: Agentic Model Routing for Coding Tasks [54.00153674547733]
Agent-as-a-router (AC)はC-A-Fループとしてルーティングを形式化する(Context->Action->FeedbackContext)
ACは、分配タスクに対する最小の累積後悔を達成し、配布外エージェントプログラミングタスクに一般化する。
論文 参考訳(メタデータ) (2026-06-22T06:37:31Z) - MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings [47.963523156965174]
大規模言語モデルに対する費用対効果を考慮したマルチターンルーティングについて検討する。
本稿では,対話履歴と候補モデルを結合履歴モデルにエンコードするMTを提案する。
実験によると、MTはパフォーマンスコストのトレードオフを改善する。
論文 参考訳(メタデータ) (2026-04-26T04:42:21Z) - RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment [57.588738943463646]
大規模言語モデル(LLM)は機械翻訳(MT)において顕著な性能を発揮した
大規模に展開するのは 違法に高価です
モデル内ルータである textbfRouteLMT を提案する。
論文 参考訳(メタデータ) (2026-04-24T13:02:45Z) - Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization [58.59491516762626]
マルチエージェントシステム(MAS)のための効率的かつ解釈可能なルーティングフレームワークAMRO-Sを提案する。
AMRO-Sは、意味条件付き経路選択問題としてMASルーティングをモデル化し、3つのキーメカニズムを通してルーティング性能を向上させる。
5つの公開ベンチマークと高速ストレステストによる大規模な実験により、AMRO-Sは強いルーティングベースラインに対する品質-コストトレードオフを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-03-13T12:26:05Z) - CASTER: Breaking the Cost-Performance Barrier in Multi-Agent Orchestration via Context-Aware Strategy for Task Efficient Routing [25.48759875572515]
CASTER (Context-Aware Strategy for Task Efficient Routing) はグラフベースMASにおける動的モデル選択のための軽量ルータである。
CASTERは強力なモデルベースラインに比べて推論コストを最大72.4%削減する。
論文 参考訳(メタデータ) (2026-01-27T16:52:47Z) - xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning [104.63494870852894]
我々は,学習したルータが直接応答するか,あるいは1つ以上の外部モデルを呼び出すことができるツールコールベースのルーティングシステム x を提案する。
当社の実装には、報酬とコスト会計を含む、完全な強化学習フレームワークが含まれています。
さまざまなベンチマークで、xはコストパフォーマンスのトレードオフを強く達成します。
論文 参考訳(メタデータ) (2025-10-09T16:52:01Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - Keeping Up with the Models: Online Deployment and Routing of LLMs at Scale [6.911384287238722]
次段のモデルに対して最大$M_max$のモデルを選択する階層的アルゴリズムを,報酬高信頼と低コスト低信頼境界を用いて提案する。
ここで,StageRoute が次数$T2/3$ の後悔を達成し,一致した下界を提供し,ほぼ最適性を確立することを証明した。
論文 参考訳(メタデータ) (2025-06-08T12:25:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。