論文の概要: CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
- arxiv url: http://arxiv.org/abs/2607.19338v1
- Date: Tue, 21 Jul 2026 17:56:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.524837
- Title: CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
- Title(参考訳): CodeRescue: コーディングエージェントの予算カバリデーションルーティング
- Abstract要約: コーディングエージェントは、失敗した試みが実行可能なフィードバックを生成する実行環境において、ますます機能する。
しかしコーディングでは、実行フィードバックにより、より安価なモデルリカバリが価値あるものになります。
我々は、この障害後の決定を不均一な動作に対するリカバリルーティングとして定式化し、管理されたルータを実行ロールアウトからトレーニングする。
- 参考スコア(独自算出の注目度): 8.055381972403927
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Coding agents increasingly operate in executable environments where a failed attempt produces actionable feedback rather than merely an incorrect answer. Existing cost-aware systems typically treat such failures as cascade decisions: try a cheap model first, then escalate hard cases to a stronger and more expensive model. In coding, however, execution feedback can also make further cheap-model recovery worthwhile, raising a budgeted deployment question: when should an agent spend more cheap compute, and when should it escalate? We formulate this post-failure decision as recovery routing over heterogeneous actions and train a supervised router from execution rollouts. To make the same router usable under changing budgets, we add a Conformal Risk Control (CRC) layer that selects a deployment-time cost penalty without retraining and provides marginal expected-cost control under exchangeability. Across held-out failures from five coding benchmarks, cheap recovery and escalation exhibit complementary success patterns. The calibrated frontier improves over fixed actions, prompt-only routers, and a binary cascade baseline; in the main GPT-5.4-nano/GPT-5.4 setting, one CRC-calibrated frontier point exceeds always-escalate solve rate while using 35% of its mean recovery cost. Code is available at https://github.com/Qijia-He/agent-budget-control.
- Abstract(参考訳): コーディングエージェントは、失敗した試みが単に誤った答えではなく、実行可能なフィードバックを生成する実行環境において、ますます機能する。
既存のコスト対応システムは、このような失敗をカスケード決定として扱うのが一般的である。
しかし、コーディングにおいて、実行時のフィードバックは、より安価なモデルリカバリに価値をもたらし、いつエージェントがより安価な計算に費やすべきか、いつエスカレートすべきか、という予算のかかるデプロイメントの疑問を提起する。
我々は、この障害後の決定を不均一な動作に対するリカバリルーティングとして定式化し、管理されたルータを実行ロールアウトからトレーニングする。
同じルータを予算変更時に使用可能にするために,再トレーニングをせずに展開時間コストペナルティを選択し,交換性の下での限界予測コストコントロールを提供する,CRC(Conformal Risk Control)層を追加する。
5つのコーディングベンチマークのホールドアウト障害、安価なリカバリとエスカレーションは相補的な成功パターンを示している。
GPT-5.4-nano/GPT-5.4設定では、1つのCRC校正されたフロンティア点が平均回復コストの35%を使用し、常にエスカレートする。
コードはhttps://github.com/Qijia-He/agent-budget-controlで入手できる。
関連論文リスト
- How to Speculate about Uncertainty in Agentic Coding? A Draft-Model Gate Method [4.37919186746582]
ブラックボックスエージェントの予測故障信号を復元する手法である投機的不確実性(SU)を提案する。
我々は、推論とアクションスパンを分離して位相認識の特徴を抽出し、検証対象に対して校正する。
SUは、ルーティング、人間の介入、テストタイムの余分な計算など、ダウンストリームポリシーが直接的に消費できる、障害に似たスコアを生成する。
論文 参考訳(メタデータ) (2026-09-04T15:30:22Z) - RLCascadeRouter: Quality-Estimator-Free Cascade Routing via Reinforcement Learning [6.614808404204836]
本稿では,カスケードルーティングをマルコフ決定プロセスとして定式化する品質推定自由フレームワークを提案する。
トラジェクティブリターンとアドバンテージを使用して、パフォーマンスコストの目標を直接最適化する。
論文 参考訳(メタデータ) (2026-08-16T15:47:04Z) - FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents [49.519184792774304]
FailForgeは、失敗したロールアウトをトレーニングシグナルに変換するエージェントフレームワークである。
FailForgeは、これまで失敗したインスタンスの26%を、限界的な追加コストでリカバリする。
論文 参考訳(メタデータ) (2026-08-09T08:22:57Z) - AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents [43.827500763103586]
AdaTurnは、ビジュアルエージェントトレーニングのための予算対応フレームワークである。
FA−DAPOは、過予算イベントをトレーニング可能な最終決定ステップに変換する。
例えば、4ターンでVisualProbe-Mediumを36.7%から47.6%に引き上げるなどである。
論文 参考訳(メタデータ) (2026-07-16T04:07:22Z) - TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents [51.523913302114266]
TRACE(Turn-level Reward Assignment via Credit Estimation)は、エージェント強化学習のための高密度クレジットアサインメント手法である。
ツールコール境界における状態遷移としてロールアウトを表現し、凍結参照モデルからゴールド・アンサー・ログ確率を取得し、それらをログ比の状態値に変換し、それらの値の時間差変化としてアクション毎の報酬を導出する。
純粋なRLを用いたベースモデルツール使用能力を大幅に向上させ、冷間開始制御された微調整ステージ、エージェント訓練ステージ、ライブWebデータによるトレーニングを不要とした。
論文 参考訳(メタデータ) (2026-07-15T16:16:42Z) - Safety-Contract Graph Multi-Agent Reinforcement Learning for Autonomous Network Security Response [0.0]
ACD$3$-GAT (Adaptive Constrained Counterfactual Decisioning with a Graph Attention Network encoder)として安全契約グラフMARLフレームワークを提案する。
CAGE Challenge 4では,エージェントがMTTR(Mean Time to Recover),偽陽性応答,ファイアウォール変更管理障害などの予算の下で作業を行う。
これは、報酬のみの学習が運用の規律を欠いていることを示すことで、CAGE Challenge 4の前の発見を補完する。
論文 参考訳(メタデータ) (2026-06-11T19:02:48Z) - SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning [2.6853734738584047]
SeqRouteは、有限水平マルコフ決定プロセスとしてマルチターンルーティングを定式化するフレームワークである。
セッションの後半で、ハイテイクターンのリソースを戦略的に保存するために、遅れた満足度を学習する。
品質を維持したり改善したりしながら運用コストを6.0-73.5%削減し、倒産率を1%以下に抑える。
論文 参考訳(メタデータ) (2026-05-25T04:52:10Z) - Concept Drift Adaptation Using Self-Supervised and Reinforcement Learning In Android Malware Detection [9.493071661387596]
逐次的決定問題として,デプロイメント時間メンテナンスをモデル化する時系列適応型メンテナンスフレームワークを提案する。
ポリシー最適化コントローラは、検出器状態に基づいて低コストの保守動作を選択する。
その結果、RLコントローラは強力なコスト認識適応戦略を提供することがわかった。
論文 参考訳(メタデータ) (2026-05-22T23:49:30Z) - CR^2: Cost-Aware Risk-Controlled Routing for Wireless Device-Edge LLM Inference [52.849509991178884]
大規模言語モデル(LLM)は集中型クラウドからモバイルエッジ環境に移行する。
軽量オンデバイスモデルとより強力なエッジモデルの間のクエリレベルのルーティングは、このトレードオフをナビゲートするための柔軟なメカニズムを提供する。
既存のルータは、集中クラウド設定とトークンレベルのコストの最適化のために設計されており、無線エッジデプロイメントにおける動的レイテンシとエネルギーオーバーヘッドをキャプチャできない。
論文 参考訳(メタデータ) (2026-05-12T11:50:15Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - Conditional Sequence Modeling for Safe Reinforcement Learning [8.858563919623082]
オフライン安全な強化学習は、固定データセットからポリシーを学習し、累積コスト制約下でのパフォーマンスを最大化することを目的としている。
既存のオフラインセーフなRLメソッドの多くは、あらかじめ指定されたしきい値の下で訓練されている。
CSMをベースとしたRCDTは,複数のコストしきい値にまたがるゼロショット展開をサポートする。
論文 参考訳(メタデータ) (2026-02-09T12:22:57Z) - Cost-Aware Contrastive Routing for LLMs [57.30288453580456]
我々は、プロンプトとモデルの両方を共有埋め込み空間にマッピングする軽量フレームワークであるコストスペクトルコントラストルーティング(CSCR)を紹介します。
CSCRはベースラインを一貫して上回り、精度とコストのトレードオフを最大25%改善した。
論文 参考訳(メタデータ) (2025-08-17T20:16:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。