論文の概要: Cross-Benchmark Transfer from RL on Agentic Coding Tasks
- arxiv url: http://arxiv.org/abs/2610.00890v1
- Date: Thu, 01 Oct 2026 01:12:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.837285
- Title: Cross-Benchmark Transfer from RL on Agentic Coding Tasks
- Title(参考訳): エージェント符号化タスクにおけるRLからのクロスベンチマーク転送
- Abstract要約: 多くの場合、コーディングエージェントは最後の1マイルで失敗する。機能の大部分を構築し、要件をドロップし、実装がすでに処理しているケースのみをテストし、無傷であるはずの動作を壊したり、未確認の仮定に対して検証する。
専門家が構築したエージェントコーディングタスクの強化学習がこのギャップを埋めるか、エージェントが学習するものがトレーニング分布を超えるのかを問う。
我々は,隠れフェール・ツー・パステストとパス・ツー・パステストによって評価された1,700のタスクと,専門家が書いた隠れバリデーションによって評価された700の端末タスクについて,Kim K2.7コードをポストトレーニングした。
- 参考スコア(独自算出の注目度): 0.13579757545152057
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Coding agents often fail in the last mile: they build most of a feature but drop a requirement, test only the cases their implementation already handles, break behavior that was supposed to stay intact, or validate against an unchecked assumption. We ask whether reinforcement learning (RL) on expert-built agentic coding tasks closes this gap, and whether what the agent learns transfers beyond the training distribution. We post-train Kimi K2.7 Code, a 1T-parameter (32B active) open-weight mixture-of-experts model, with RL alone on 1,700 tasks: 1,000 repository tasks graded by hidden fail-to-pass tests and by pass-to-pass tests of existing behavior, and 700 terminal tasks graded by expert-written hidden verifiers. The reward is the fraction of target checks passed and drops to zero if any pass-to-pass test fails. One epoch of GSPO on a rank-32 LoRA adapter improves pass@1 on each of the six external benchmarks we evaluated, across three agent harnesses: SWE-Bench Pro (60.1 to 64.8), DeepSWE (31.0 to 43.4), Terminal-Bench 2.1 (67.4 to 82.0), Terminal-Bench 3 (1.4 to 12.1), Terminal-Bench 4 (0.0 to 7.6), and SWE-Marathon (5.0 to 25.0). Pooled over the five independent task sets (Terminal-Bench 4 revises Terminal-Bench 3), the improvement is significant (p < 0.001), and it remains significant on the three sets released after the training data was collected (p = 0.004); the model also improves under both harnesses never used in training. Median trajectories on DeepSWE and Terminal-Bench 3 are 24-35% shorter in agent steps. The base model's failed DeepSWE runs are mostly near-misses, and on the tasks the trained model newly solves, paired trajectories show it avoiding each of the four failure modes above.
- Abstract(参考訳): 多くの場合、コーディングエージェントは最後の1マイルで失敗する。機能の大部分を構築し、要件をドロップし、実装がすでに処理しているケースのみをテストし、無傷であるはずの動作を壊したり、未確認の仮定に対して検証する。
我々は、専門家が構築したエージェントコーディングタスクにおける強化学習(RL)がこのギャップを埋めるか、エージェントが学習するものがトレーニング分布を超えるのかを問う。
我々は,1Tパラメータ (32B) のオープンウェイト・ミックス・オブ・エキスパートモデルであるKimi K2.7 Codeを,1,700のタスクにRLだけで適用した。
報酬は、パス・ツー・パステストが失敗した場合、パスされたターゲットチェックの比率を0に落とします。
32ランクのLoRAアダプタ上のGSPOは、SWE-Bench Pro (60.1 - 64.8), DeepSWE (31.0 - 43.4), Terminal-Bench 2.1 (67.4 - 82.0), Terminal-Bench 3 (1.4 - 12.1), Terminal-Bench 4 (0.0 - 7.6), SWE-Marathon (5.0 - 25.0)の3つのエージェントハーネスで評価した6つの外部ベンチマークのパス@1を改善した。
5つの独立したタスクセット (Terminal-Bench 4 revises Terminal-Bench 3) をポーリングし、改善は大きい(p < 0.001)。
DeepSWE と Terminal-Bench 3 の中間軌道は、エージェントステップで24-35%短い。
ベースモデルの失敗するDeepSWEランは概ねほぼミスであり、トレーニングされたモデルが新たに解決したタスクでは、ペア化された軌跡によって、上の4つの障害モードのそれぞれを避けることができる。
関連論文リスト
- FDE-Bench: Evaluating LLM Agents for Deployment Environment Configuration [3.4732047142551288]
FDE-BenchはDockerイメージ、マルチサービスComposeスタック、診断・修復モードにまたがるデプロイメント設定タスクを評価している。
エージェントは、プリスタント環境で収集、再構築、再デプロイされる宣言的アーティファクトを提出する。
準備は最大の障害ステージであり、313エピソードのうち110エピソードが未解決である。
論文 参考訳(メタデータ) (2026-09-23T08:51:01Z) - ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks [27.750923745153145]
T1は、強化学習で訓練された122BのMixture-of-Expertsモデルである。
実際のシェルをクラウドサンドボックスで運用し、タスク毎に最大300以上のツールコールを回し、各タスク独自の検証を実行することで報酬を得る。
Terminal-Bench 2.1では、最初のベースモデルを43.8%からT1に引き上げ、64.0%が解決した。
論文 参考訳(メタデータ) (2026-09-10T03:42:01Z) - ExecCritic: Learn to Test, Test to Improve for Coding Agents [68.42713285082912]
実行時のフィードバックは、コーディングエージェントを正しいリポジトリの修復に導くことができますが、テストが問題によって要求された振る舞いをキャプチャした場合のみです。
ExecCriticを導入し、テスト-検証-修正足場と、その中のトレーニングエージェントのためのロール固有の強化学習レシピを組み合わせる。
テストエージェントが独立してリポジトリネイティブなテストを生成し、フェイルクローズされたハーネスがそれらを調整して凍結し、リカバリエージェントがテストを変更することなく、ソースコードを実行フィードバックから修正する。
論文 参考訳(メタデータ) (2026-09-08T17:53:37Z) - TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents [41.82249291285459]
TRACEは、モデルウェイトを変更することなく、スキルベースのエージェントの行動知識を反復的に改善する。
GPT-5.5では、TRACEは一貫性(Pass3)を34.6ポイント改善し、59.9%から94.5%に改善した。
これらの結果から,TRACEは高モデルポテンシャルを安定かつ一貫した性能向上に変換することを示した。
論文 参考訳(メタデータ) (2026-08-24T04:36:03Z) - Recursive Synthesis for Long-Horizon Terminal Tasks [50.39352383646813]
Recursive Synthetic Terminal Tasks (RST) は、大規模に長期の端末エージェントタスクを構築するためのフレームワークである。
RSTは37,484個の合成端末エージェントタスクを1タスクあたり0.05ドルで生成する。
軌道の微調整により、Qwen3.5-27BとQwen3.5-122B-A10Bはターミナルベンチ2、ターミナルベンチハード、ロングホライゾンターミナルベンチで最大10ポイント改善される。
論文 参考訳(メタデータ) (2026-08-05T23:24:26Z) - Cross-Benchmark Generalization in Long-Horizon Agents [1.0742728354283815]
我々は,27のカテゴリにわたる363の長距離モデルコンテキストプロトコル(MCP)タスク上で,オープンウェイト・ミックス・オブ・エキスパート・モデルを構築した。
トレーニングには外部ベンチマークタスクやグレーダが入らず、報酬、ハイパーパラメータのトレーニング、トレーニングされたチェックポイントの選択、停止を外部スコアが知らせなかった。
両方のソフトウェアベンチマークは、ソフトウェアエンジニアリングタスクを含まないトレーニングコレクションにもかかわらず改善されている。
論文 参考訳(メタデータ) (2026-07-31T18:05:36Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - Auditing Reward Hackability in Code RL Training Environments [0.0]
コードRL環境が誤った解を正しく受け入れる速度を計測する。
SWE-bench Verifiedの49タクのサンプルでは、28.5%のタスクがテストスイートが弱く、Dockerで検証された不正確なパッチがそれらをパスしている。
論文 参考訳(メタデータ) (2026-06-14T23:31:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。