論文の概要: What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents
- arxiv url: http://arxiv.org/abs/2609.04518v1
- Date: Thu, 03 Sep 2026 22:17:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.840907
- Title: What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents
- Title(参考訳): マルチハーネスRLは何を学習するか? コーディングエージェントのクレジットアサインメントとポータビリティ
- Abstract要約: 我々は、Aider、OpenHands、Qwen Code、SWE-agentからタスクハーネスレコードを再生する。
私たちは4つのソースハーネスと最小限のハーネスで、封印されたSWEベンチ検証オラクルで全てのチェックポイントをスコア付けします。
ホールドアウトハーネスでは、クロスマイナスは+0.25 pp, 95%信頼区間 [-0.48, +1.02] で、タスクごとに8回の試験を行い、+0.16 [-0.41, +0.72] は3つの訓練種子にプールされた。
- 参考スコア(独自算出の注目度): 9.375226195738966
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent reinforcement learning (RL) increasingly runs through full execution harnesses, and a multi-harness recipe mixes two choices: exposing the policy to several harnesses, and comparing their rewards inside one relative-advantage group. We isolate the second choice in repository-level coding. From one Qwen3-8B supervised warm start we replay the same frozen task-harness records from Aider, OpenHands, Qwen Code, and SWE-agent, with the same number of updates, under two rules for group-relative policy optimization (GRPO), Within (one group per task-harness pair) and Cross (harnesses pooled within a task), and score every checkpoint with a sealed SWE-bench Verified oracle on four source harnesses and a minimal harness held out of training. The evaluation harness is the dominant variable: across 24,000 sealed evaluations it moves the mean solve rate from 2.14\% to 9.27\%, a factor of 4.3, where the training recipe moves it by 1.16. The grouping rule is not. On the held-out harness, Cross minus Within is +0.25 pp, 95\% confidence interval [-0.48, +1.02], at eight attempts per task, and +0.16 [-0.41, +0.72] pooled over three training seeds whose individual estimates change sign. Each rule's own seed range, 0.42 to 0.45 pp, exceeds the difference between them. Both rules place their largest gains on the same source harness. The pooled advantage carries the harness: an out-of-fold classifier recovers the generating harness from Cross's advantage +4.48 pp above the shuffled-label baseline and from Within's not at all, and the two rules still reach the same held-out score and action distribution inside each harness. Re-collecting half the training data on-policy does not change this. Cross-harness credit yields configuration adaptation and no more portable capability than within-harness credit. Multi-harness RL reports should state the grouping boundary and test under an unseen harness.
- Abstract(参考訳): エージェント強化学習(RL)は、フル実行ハーネスを通し、マルチハーネスのレシピは、ポリシーを複数のハーネスに公開し、その報酬を1つの相対アドバンテージグループ内で比較する、という2つの選択肢を混合する。
リポジトリレベルのコーディングでは、第2の選択肢を分離します。
Aider、OpenHands、Qwen Code、SWE-agentの凍結されたタスクハーネスレコードを同じ数の更新で再生し、グループ相対的ポリシー最適化(GRPO)、2つのルールの下で、グループ相対的ポリシー最適化(GRPO)、1つのグループ(タスクハーネスペア当たりのハーネス)とクロス(タスク内にプールされたハーネス)、そして4つのソースハーネスと最小のハーネスで封印されたSWE-bench検証オラクルですべてのチェックポイントをスコア付けします。
評価ハーネスは支配的な変数であり、24,000の封印された評価で平均解率を2.14\%から9.27\%に、トレーニングレシピが1.16に移動する4.3に移動する。
グループルールはそうではありません。
ホールドアウトハーネスでは、クロスマイナスは+0.25 pp, 95\%の信頼区間 [-0.48, +1.02] で、タスクごとに8回の試行を行い、+0.16 [-0.41, +0.72] は個々の推定値が変化する3つの訓練種子にプールされた。
それぞれの規則の種の範囲は0.42から0.45ppであり、両者の差を超えている。
どちらのルールも、同じソースハーネスで最大の利益を上げている。
アウト・オブ・フォールド・クラシファイアはクロスの利点+4.48 ppから発生したハーネスをシャッフル・ラベルのベースラインより上から回収し、インテリアからは全くなく、2つのルールはハーネス内で同じホールドアウトスコアとアクション分布に達する。
政策上のトレーニングデータの半分を再収集しても、これは変わりません。
クロスハーネスクレジットは構成適応をもたらし、インサイダーハーネスクレジットに匹敵する可搬性はない。
マルチハーネスRLレポートでは、グループの境界とテストは目に見えないハーネスで記述すべきである。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learning [40.61476978001808]
ステップ毎に1つのハーネスを選択するオンラインスケジューラであるHarnessBanditを開発した。
我々は、ClawGymで6つのハーネスでQwen3.5-2Bを訓練し、PinchBenchとClawEvalで評価する。
論文 参考訳(メタデータ) (2026-09-12T06:22:45Z) - DataFlex-RL: An Evaluation Platform for RLVR Data Policies [11.073211317719393]
検証可能な報酬を伴う強化学習のためのデータポリシーは、どのロールアウトが使用されるか、どれくらい重み付けされているか、どのドメインがその後のトレーニングバッチに寄与するかを決定する。
我々は、共通のGRPOレシピの下でこれらの選択を比較するための評価プラットフォームであるDataFlex-RLを紹介します。
Qwen2.5-7B-Base と 12 の数学,論理,科学ベンチマークを用いて,12 個のマッチした種子の13 個の構成を評価した。
論文 参考訳(メタデータ) (2026-09-05T14:04:50Z) - Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay [0.6768558752130311]
単一エージェント環境において,実行されたリプレイからポリシー条件の真偽を検査する。
段階的な信用シグナルは、限界整合シャッフル制御以上の信頼度の高いインクリメンタル忠実度を示すものではない。
信頼のみのルータは、チャンスレベルにおいて重要なステップを回復するが、1ターンあたりの審査コストを13.1%削減する。
論文 参考訳(メタデータ) (2026-08-20T08:04:00Z) - Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL [55.05743310621117]
Co-RLは、パラメータを共有しない複数の分離されたモデルを、仲間から派生した報酬を使ってRLを通じて同時に最適化するフレームワークである。
我々は,コホート多様性の増大が,自己強化フィードバックループを駆動する相関誤差を減少させることを示す。
論文 参考訳(メタデータ) (2026-08-18T01:16:02Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - CODS: Iterative Bellman-Residual Data Selection for Reusable Offline Reinforcement Learning [5.894992157122175]
我々は,アルゴリズムに適合した批評家の適合と高レジデンシャル・トランジションの獲得を交互に行う,批評家誘導のセレクタであるCODSを紹介する。
10%の予算で、CODSは20の有効なD4RLタスク-アルゴリズム細胞に対して96.6%の許容プール性能を維持している。
論文 参考訳(メタデータ) (2026-08-07T19:11:54Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。