論文の概要: Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer
- arxiv url: http://arxiv.org/abs/2609.38372v1
- Date: Tue, 29 Sep 2026 18:33:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.57646
- Title: Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer
- Title(参考訳): エージェントを最適化した複数タスクの自己進化的ハーネス
- Abstract要約: ハーネスとは、プロンプトを整理し、ツールを呼び出し、コンテキストを管理し、実行を制御する言語モデルエージェントを取り巻くコードである。
既存のほとんどの手法では、人間によって設計されたハーネス上で実行される別のプロポーザがソルバのハーネスを変更し、ベンチマーク毎に別のハーネスが進化する。
再帰的自己改善に近いフレームワークを提案する: 同じフリーズモデルであるハーネスの同じバージョンにおいて、まず解法としてタスクを解き、続いて提案者として、完全な実行レコードを読み出し、実行中のハーネスを直接編集する。
進化過程を2段階の深層学習訓練として捉えた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A harness is the code around a language-model agent that organizes prompts, calls tools, manages context, and controls execution. As models grow stronger, recent work has begun to let agents improve their own harnesses, a line of work known as self-evolving harnesses. In most existing methods, a separate proposer running on a human-designed harness modifies the solver's harness, and a separate harness is evolved for each benchmark. Real-world tasks come from many domains, so both the evolution and the evaluation of a harness should cover a diverse range of tasks. We propose a framework close to recursive self-improvement: the same frozen model, on the same version of the harness, first solves tasks as the solver and then, as the proposer, reads the complete run records and directly edits the harness that runs it. Each evolution batch draws tasks from five benchmarks in different domains. To measure generalization, training and held-out tasks are strictly separated, and we additionally evaluate on five out-of-distribution benchmarks never used during evolution. We frame the evolution process as deep-learning training with two stages, multi-task pretraining and continual training. Starting from a 49-line seed harness, the harness obtained at the end of the first stage improves the average score by 4.48 points on the in-distribution benchmarks and by 12.64 points on the out-of-distribution benchmarks, surpassing Codex on the former and matching it on the latter. In the second stage, continued evolution on Claw-Eval, one of the out-of-distribution benchmarks, further raises the score on that benchmark from 66.17 to 68.06, exceeding Codex. We also provide an in-depth analysis of the mechanisms that emerged during evolution, including output truncation, history compaction, and independent review.
- Abstract(参考訳): ハーネスとは、プロンプトを整理し、ツールを呼び出し、コンテキストを管理し、実行を制御する言語モデルエージェントを取り巻くコードである。
モデルがより強くなるにつれて、エージェントが自身のハーネスを改善するための最近の研究は、自己進化ハーネスとして知られる一連の作業で始まった。
既存のほとんどの手法では、人間によって設計されたハーネス上で実行される別のプロポーザがソルバのハーネスを変更し、ベンチマーク毎に別のハーネスが進化する。
現実世界のタスクは多くのドメインから来ているので、ハーネスの進化と評価は多様なタスクをカバーするべきである。
再帰的自己改善に近いフレームワークを提案する: 同じフリーズモデルであるハーネスの同じバージョンにおいて、まず解法としてタスクを解き、続いて提案者として、完全な実行レコードを読み出し、実行中のハーネスを直接編集する。
各進化バッチは、異なるドメインの5つのベンチマークからタスクを引き出す。
一般化, トレーニング, 保留タスクは厳密に分離され, 進化期には使われなかった5つのアウト・オブ・ディストリビューション・ベンチマークで評価する。
進化過程を,マルチタスク事前学習と連続トレーニングという2段階の深層学習トレーニングとして捉えた。
49ラインのシードハーネスから始め、第1ステージの最後に得られたハーネスは、分布内ベンチマークの平均スコアを4.48ポイント改善し、分布外ベンチマークで12.64ポイント改善し、前者のCodexを上回り、後者にマッチする。
第2段階では、配布外ベンチマークの1つであるClaw-Evalの継続的な進化により、そのベンチマークのスコアはさらに66.17から68.06に上昇し、コーデックスを上回った。
また、出力の切り裂き、履歴のコンパクト化、独立レビューなど、進化の過程で発生したメカニズムを詳細に分析する。
関連論文リスト
- RRSI: Regularized Recursive Self-Improvement of Agent Harnesses [76.77275934611428]
正規化再帰的自己改善型エージェント・ハーネス(RRSI)
本稿では、正規化の原則を取り入れたRRSIを紹介し、進化候補の提案と選択を制約することで自己改善を活用する。
RRSIは5つのアウト・オブ・ディストリビューション・ベンチマークで14.1ポイント、最大4.7ポイントを獲得し、非正規化進化よりも30%少ないポリシートークンで動作するハーネスを生産している。
論文 参考訳(メタデータ) (2026-09-21T17:54:49Z) - Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails [23.287109132562403]
自動化されたハーネス進化により、より小さなモデルは、フロンティアモデルコストのごく一部で、ドメイン固有のタスクでうまく機能することができる。
模倣は知識を伝達し,足場の使用量を増加させるが,モデルハーネスの適合性を阻害することを示す。
我々は、メタレベルのMLEエージェントによって自動化され、弱いモデル自身のロールアウトにおいて失敗するターンをローカライズし、専門家にそのターンのみを書き直すよう依頼する、オンデマンドの専門家補正パイプラインを開発する。
論文 参考訳(メタデータ) (2026-09-08T17:53:49Z) - EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness? [83.21711423118768]
EVOHARNESSBENCHは、制御されたハーネス進化下でエージェントを評価するためのベンチマークである。
検証器ベースのベンチマークから決定的に構築された17のマルチステージハーネスストリームを含んでいる。
論文 参考訳(メタデータ) (2026-09-03T03:24:02Z) - HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - HELIX: Model-Harness Co-evolution for Recursive Self-Improvement [8.484282837156933]
我々は,HELIXを資源追跡可能なHELIX基板として提案する。
提案手法は,現在の能力向上と,次のモデルに対する学習信号の生成方法を示す。
論文 参考訳(メタデータ) (2026-08-14T04:44:53Z) - EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement [70.68218215070745]
既存のアプローチでは、すべての実行エクスペリエンスを単一のハーネスにルーティングできると仮定している。
EvolveNetは、経験抽出をデータに移動させるハーネス進化のパラダイムである。
論文 参考訳(メタデータ) (2026-08-05T15:37:18Z) - Rethinking the Evaluation of Harness Evolution for Agents [83.07258924910069]
既存のハーネス進化法では、単体テストケースを使用してハーネス構成を検索し、同じ公開ベンチマークで最終的なパフォーマンスを報告している。
このプロトコルは2つの基本的な懸念を提起する。
エージェントによるテスト時間スケーリングと同様に、一致したフィードバックと推論予算の下で単純なタスクレベルの検索ベースラインと比較すべきである。
論文 参考訳(メタデータ) (2026-07-14T00:18:42Z) - HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry [35.87794858139959]
HarnessXは、構成可能、適応可能、進化可能なエージェントハーネス用のファウンダリーである。
型付きハーネスプリミティブを置換代数学で組み立て、AIGISを介して適応する。
軌道をハーネス更新とモデルトレーニング信号の両方に変換することでハーネスモデルループを閉じる。
論文 参考訳(メタデータ) (2026-06-12T08:27:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。