論文の概要: Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
- arxiv url: http://arxiv.org/abs/2608.02276v1
- Date: Mon, 03 Aug 2026 14:12:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.592525
- Title: Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
- Title(参考訳): Harness-R1: エージェント障害軌跡から実行可能なランタイムのハーネスを編集する学習
- Authors: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang,
- Abstract要約: Harness-R1は、既存の実行ランタイムのエラー条件付きライフサイクルワイドな編集を学習機能を提供する最初の方法です。
オンラインの強化学習を専門とするハーネスエンジニアをポストトレーニングし、その編集は、彼らが実現したタスク成功のために最適化される。
WebShop、ALFWorld、DBBenchの他、Harness-R1はバニラQwen3.5-9Bを44.3%から53.6%に引き上げている。
- 参考スコア(独自算出の注目度): 41.919231699460944
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agents built around large language models continually accumulate interaction trajectories during deployment, yet their behavior typically remains fixed. Beyond updating model weights, these trajectories can improve the agent harness that constructs context, mediates tools, validates actions, and recovers execution. We introduce Harness-R1, the first method, to our knowledge, that makes failure-conditioned, lifecycle-wide editing of an existing executable runtime a learned capability. It post-trains a dedicated harness engineer with online reinforcement learning so that its edits are optimized for the realized task success they produce, rather than proposed by a fixed editor. A separate 9B engineer converts batches of target-agent failures into validated executable patches; fresh same-batch reruns of the frozen target provide outcome rewards, so training updates only the engineer. Cold-start supervised fine-tuning initializes this editing policy, which is then trained online with group-relative policy optimization. Across WebShop, ALFWorld, and DBBench, Harness-R1 raises vanilla Qwen3.5-9B success from 44.3% to 53.6% (+9.3 percentage points). After direct target-agent fine-tuning, a target-specific engineer raises the average further from 59.2% to 64.2% (+5.0 points); because these gains hold both before and after fine-tuning the target, Harness-R1 points toward co-evolving the harness engineer and the target agent.
- Abstract(参考訳): 大規模言語モデルを中心に構築されたエージェントは、デプロイメント中のインタラクショントラジェクトリを継続的に蓄積するが、その振る舞いは通常、固定されている。
モデルウェイトを更新する以外に、これらのトラジェクトリは、コンテキストを構築し、ツールを仲介し、アクションを検証し、実行を回復するエージェントハーネスを改善することができる。
私たちは、既存のランタイムの障害条件付きライフサイクルワイドな編集を学習能力にする、最初の方法であるHarness-R1を紹介します。
オンライン強化学習を備えた専用ハーネスエンジニアをポストトレーニングし、その編集は、固定エディターの提案ではなく、それらが実現したタスクの成功に最適化されるようにした。
個別の9Bエンジニアは、ターゲットエージェント障害のバッチを検証可能なパッチに変換する。
コールドスタートを監督する微調整は、この編集ポリシーを初期化し、グループ相対的なポリシー最適化でオンラインにトレーニングする。
WebShop、ALFWorld、DBBench全体で、Harness-R1はバニラQwen3.5-9Bを44.3%から53.6%(+9.3%)に引き上げている。
直接目標調整の後、目標固有のエンジニアは平均を59.2%から64.2%(+5.0ポイント)に引き上げる。
関連論文リスト
- Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents [80.03824805228719]
コンピュータ利用エージェントを開発する上での大きな課題は、大規模で高品質な軌道を収集することである。
我々は、失敗した軌道をエージェント改善に変換するデータ中心のパラダイムを提案する。
この手法をOSWorldベンチマーク上で,最先端のOpenCUA-72Bモデルを用いて検証する。
論文 参考訳(メタデータ) (2026-06-30T07:44:37Z) - Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference [51.55077364626896]
本稿では,過去の軌道のみを用いたエージェント・ハーネスを最適化する自己教師型手法であるRetrospective Harness Optimization (RHO)を紹介する。
RHOは、過去の軌跡から様々な課題のコアセットを選択し、それらを並列に解決する。
1回の最適化ラウンドでは、SWE-Bench Proのパスレートが59%から78%に向上する。
論文 参考訳(メタデータ) (2026-06-04T09:26:00Z) - The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates [31.50160357699629]
エネルギーベースデコーディング(Energy-Based Decoding)は、凍結した事前学習モデルからタスク指向の振る舞いを活性化するためのトレーニング不要で報酬誘導型フレームワークである。
EBDは,基本モデル出力をより指示追従行動にシフトさせ,学習後の動作に類似度を増すことを示す。
論文 参考訳(メタデータ) (2026-05-27T06:25:00Z) - SIA: Self Improving AI with Harness & Weight Updates [0.0]
人間はAIの構築と改善のボトルネックです。
言語モデルエージェントがハーネスとタスク固有のエージェントの重みを更新する自己改善ループであるSIAを提案する。
論文 参考訳(メタデータ) (2026-05-26T16:55:46Z) - SkillOpt: Executive Strategy for Self-Evolving Agent Skills [39.94802218531371]
SkillOptはエージェントスキルのためのコントロール可能なテキストスペースである。
別々のモデルでは、スコアの付いたロールアウトを1つのスキルドキュメントのバウンダリされた追加/削除/リプレースに切り替える。
学習速度の予算、拒否編集バッファ、エポックワイド/メタアップデートは、スキルトレーニングを安定させる。
論文 参考訳(メタデータ) (2026-05-22T17:59:50Z) - Workspace Optimization: How to Train Your Agent [49.579258311548635]
我々はエージェントのEmphworkspaceであり、それが読み取り、書き込み、テストする構造化された外部基質であると主張している。
本稿では,重み空間トレーニングの構造を反映して,作業空間を進化させる原理的手法を提案する。
ARC-AGI-3のマルチエージェントハーネスであるDreamTeamのアイデアをインスタンス化する。
論文 参考訳(メタデータ) (2026-05-10T16:52:10Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - AOI: Turning Failed Trajectories into Training Signals for Autonomous Cloud Diagnosis [19.899469614370478]
大規模言語モデル(LLM)エージェントは、SRE(Site Reliability Engineering)を自動化するための有望なデータ駆動型アプローチを提供する
本稿では,セキュリティ制約下での構造化軌道学習問題として,自動操作を定式化したトレーニング可能なマルチエージェントフレームワークAOIを提案する。
論文 参考訳(メタデータ) (2026-03-03T02:57:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。