論文の概要: Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First
- arxiv url: http://arxiv.org/abs/2608.04804v1
- Date: Wed, 05 Aug 2026 13:11:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.931691
- Title: Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First
- Title(参考訳): Scrouting: リポジトリファーストのスカウティングによるコーディングエージェントのコストアウェアルーティング
- Authors: Ishaan Bhola, Adithyan Krishnan, Mukunda NS,
- Abstract要約: リポジトリをスカウトした後にルートするSuperScoutを紹介します。
7B検索エンジンであるSuperScout-7Bは、まずリポジトリを探索し、構造化されたハンドオフを生成する。
検索者の隠された状態とタスクテキストは、履歴ベースのルータを送信し、4つのフロンティアフィクスラーのうちの1つにタスクをディスパッチする。
- 参考スコア(独自算出の注目度): 0.15293427903448023
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier language models can resolve repository-level software issues, but each attempt is expensive, and existing routers select a model from the issue text alone. We present SuperScout, which routes after scouting the repository: a 7B searcher, SuperScout-7B, first explores the repository and produces a structured handoff whose reproduction claims are sandbox-verified, with false claims stripped before delivery. The searcher's hidden states, together with the task text, then feed a resume-based router that dispatches the task to one of four frontier fixers. Adding a new fixer requires no retraining. On the full Python slice of SWE-bench Pro (266 tasks) under the benchmark's official capped budget tier, SuperScout matches the best single model's solve rate (159 of 266 for SuperScout, 158 for the best model) at about a fifth of the total cost per solve, and the reported configuration sits above the random traffic-splitting baseline. A no-router ablation, always the cheapest fixer with the handoff, ties the routed system on this benchmark, so the handoff rather than the routing decision carries the result. A paired calibration study points to the mechanism: the handoff appears to redistribute rather than add solving ability, lifting the three cheaper fixers while slightly hurting the strongest, though at $N=99$ the per-fixer effects are directional only; the searcher's hidden states improve cost routing on the calibration labels while the handoff's own text does not. The searcher's compute adds less than half a cent of GPU time per task.
- Abstract(参考訳): 最前線の言語モデルはリポジトリレベルのソフトウェア問題を解決することができるが、それぞれの試みは高価であり、既存のルータは問題テキストのみからモデルを選択する。
7B検索エンジンであるSuperScout-7Bは、まずレポジトリを探索し、複製要求がサンドボックス検証された構造化ハンドオフを生成し、配信前に偽のクレームを削除した。
検索者の隠された状態とタスクテキストは、履歴ベースのルータを送信し、4つのフロンティアフィクスラーのうちの1つにタスクをディスパッチする。
新しいフィクスチャを追加するには、再トレーニングは必要ない。
SWE-bench Pro (266タスク)の全Pythonスライスでは、SuperScoutは、最高のシングルモデルの解決レート(SuperScoutの266のうち159タスク、最高のモデルでは158タスク)と、解決した全コストの約5分の1で一致し、報告された構成は、ランダムなトラフィック分割ベースラインの上位に位置する。
ノールータアブレーションは、常に最も安い固定器であり、このベンチマークでルーティングされたシステムと結びついているので、ルーティング決定よりもハンドオフの方が結果をもたらす。
ペアキャリブレーションによる調査では、ハンドオフは解決能力を追加するのではなく再配布され、3つのより安価なフィクスチャを持ち上げると同時に、最強のフィクスチャをわずかに傷つけているように見えるが、$N=99$の固定器効果は方向のみであり、サーチの隠れ状態はキャリブレーションラベルのコストルーティングを改善するが、ハンドオフ自身のテキストはそうではない。
サーカの計算では、タスクあたりのGPU時間の半パーセント未満が加算される。
関連論文リスト
- Agentic Routing: The Harness-Native Data Flywheel [35.444792826526]
DRACOやPinchBenchなどのエージェントベンチマークにおけるシングルトンおよびマルチモデルルーティングに関する研究
エージェントルーティングは単なるコストコントロールではなく、エージェントネイティブなトレーニングのためのデータエンジンである、と氏は主張する。
論文 参考訳(メタデータ) (2026-07-13T11:05:55Z) - SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks [11.50404356970464]
マルチターンエージェントハーネスに埋め込まれた大規模言語モデル(LLM)は、ソフトウェア工学(SWE)を再構築している
しかし、多くの問題が安い修正を認めると、すべてのタスクをフロンティアモデルにルーティングするのは無駄です。
SWEは,探索的なターン数回で安価なモデルを実行し,結果として生じる部分軌道を読み取る,価値に基づく時間的アプローチである。
本稿では,SWEタスクのコスト効率を大幅に向上すると同時に,より強力なモデルの性能の大部分を維持しながら,SWEタスクのコスト効率を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2026-06-30T01:46:26Z) - Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving [69.5155152169752]
大規模言語モデル(LLM)のための2段階カスケードソリューションを提案する。
ステージ1は、受信するクエリをクラスタ化し、各クラスタを最もコスト効率の良いモデルに割り当てる。
ステージ2は品質推定(QE)カスケードを追加し、ステージ1からの出力が低品質であると判断されると、クエリはより強力なモデルにエスカレーションされる。
テストデータセットでは、カスケードシステムは最強モデルの精度の97-99%を保持し、TPOT(Time Per Output Token)を削減している。
タスクの正確性ラベルのみを必要とし、手動で再構成することなくモデルプールの変更に適応する。
論文 参考訳(メタデータ) (2026-06-25T18:29:24Z) - Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents [1.8969868190153276]
我々は、ベンダーに依存しない境界であるDecoupled Search Grounding (DSG)について述べる。
DSGは検索コストを98%以上削減しながら、eコマースのクエリに基づくワークロードに対して、ネイティブ検索の精度をわずかに上回っている。
論文 参考訳(メタデータ) (2026-06-17T11:30:39Z) - Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks [0.0]
他のエージェントやエンジニアが残した部分的な状態からタスクを中断し、再割り当てし、レビューし、再開するからです。
前任者の作業が不透明あるいは不完全である場合に課される再検討コスト。
我々の乗っ取りプロトコルは、決定論的ハンドオフポイントで符号化エージェントを中断し、リポジトリを凍結し、4つのハンドオフビューで後継エージェントを評価する。
論文 参考訳(メタデータ) (2026-06-01T20:40:38Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models [27.942734943134983]
Mixture-of-Experts (MoE)言語モデルは、各トークンを専門家の小さなサブセットにルーティングする。
検証された推論軌道において,各標準経路を同一のトークンに対してサンプル化された等価な代替手段と比較し,実効トークンに割り当てる次の確率でスコアする。
標準ルータは信頼性の高いトークンではルートユーティリティと整合性があるが、ハード推論を駆動する脆弱なトークンでは非形式的である。
論文 参考訳(メタデータ) (2026-05-08T05:26:09Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - Cost-Aware Contrastive Routing for LLMs [57.30288453580456]
我々は、プロンプトとモデルの両方を共有埋め込み空間にマッピングする軽量フレームワークであるコストスペクトルコントラストルーティング(CSCR)を紹介します。
CSCRはベースラインを一貫して上回り、精度とコストのトレードオフを最大25%改善した。
論文 参考訳(メタデータ) (2025-08-17T20:16:44Z) - Multi-Agent Neural Rewriter for Vehicle Routing with Limited Disclosure
of Costs [65.23158435596518]
チームのマルコフゲームとして、部分的に観測可能なコストでマルチサイクルルーティング問題を解く。
我々のマルチエージェント強化学習アプローチである、いわゆるマルチエージェントニューラルリライタは、1エージェントニューラルリライタを利用して、反復的に書き換えるソリューションによって問題を解決する。
論文 参考訳(メタデータ) (2022-06-13T09:17:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。