論文の概要: HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
- arxiv url: http://arxiv.org/abs/2609.01437v1
- Date: Tue, 01 Sep 2026 15:45:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.826239
- Title: HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
- Title(参考訳): HarnessDev: LLMは自身のエージェントHarnessを創り出すことができるか?
- Authors: Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Xinping Lei, Qingshui Gu, Yuxuan Zhang, Zexuan Wang, Chen He, Chen Huang, Maojia Song, Zhiyuan Zeng, Shaowen Wang, Jinkai Liu, Yunfeng Shi, Jiaheng Liu, Shen Yan, Wenhao Huang, Ge Zhang, Wenxuan Zhang,
- Abstract要約: 評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
- 参考スコア(独自算出の注目度): 61.02699867449589
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: As agents move from research prototypes to deployed tools, their capability increasingly depends on model-external execution infrastructure, commonly termed the agent harness. Changing this harness while holding model weights fixed can substantially alter task performance. Current agent evaluations typically report downstream performance under a chosen harness, leaving a model's ability to develop the harness itself comparatively underexplored. We introduce HarnessDev, a benchmark that shifts the unit of evaluation from task outputs to runnable infrastructure. HarnessDev covers two stages. In Creation, the agent starts from a minimal seed and a small number of cases, then builds a complete execution system. In Evolution, it starts from its own created harness and iteratively revises it using downstream execution feedback, with the goal of improving benchmark performance. We then evaluate each constructed harness on capability (task success on held-out benchmarks) and efficiency (execution-token cost). The reported Creation results cover six creator LLMs, four domains, and five downstream benchmarks totaling 2,207 unique downstream instances, with hidden evaluation tasks withheld from development. We find that generated harnesses remain substantially behind mature human-engineered references on code and on search and research, while matching or exceeding the selected references on writing and machine-learning experimentation, with large variation in execution cost. Evolution produces some performance gains, but they are unstable and transfer only partially to held-out tasks. Experiments with a fixed runtime model further show that the gains depend strongly on the model executing the harness, indicating limited transfer across models.
- Abstract(参考訳): エージェントが研究プロトタイプからデプロイツールに移行するにつれ、その能力はモデル外部実行インフラストラクチャに依存しやすくなり、一般的にエージェントハーネスと呼ばれる。
モデルの重みを固定しながらこのハーネスを変更することは、タスクパフォーマンスを大幅に変えることができる。
現在のエージェント評価では、選択されたハーネスの下で下流のパフォーマンスを報告し、モデルがハーネス自体を比較的過小評価する能力を残している。
評価単位をタスク出力から実行可能なインフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
HarnessDevは2つのステージをカバーしている。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
次に、構築された各ハーネスの能力(ホールドアウトベンチマークでのタスク成功)と効率(実行コスト)を評価します。
報告されたCreationの結果は、6つの作者のLSM、4つのドメイン、合計2,207のダウンストリームインスタンスを含む5つのダウンストリームベンチマークをカバーしている。
生成したハーネスは、コードおよび検索および研究における成熟した人為的参照のかなり後方に留まっているが、書き込みおよび機械学習実験における選択された参照のマッチング又は超過は、実行コストに大きなばらつきがある。
進化はいくつかのパフォーマンス向上をもたらすが、不安定であり、部分的に保留されたタスクにのみ移行する。
固定されたランタイムモデルによる実験は、ゲインがハーネスを実行するモデルに強く依存していることを示し、モデル間の限られた転送を示す。
関連論文リスト
- HELIX: Model-Harness Co-evolution for Recursive Self-Improvement [8.484282837156933]
我々は,HELIXを資源追跡可能なHELIX基板として提案する。
提案手法は,現在の能力向上と,次のモデルに対する学習信号の生成方法を示す。
論文 参考訳(メタデータ) (2026-08-14T04:44:53Z) - $A^2E$ : An End-to-End Agent Auditing Engine [25.281617098281277]
A2E$はエージェントハーネス用に設計されたエンドツーエンドの評価エンジンである。
実験中に標準化された実行トレースをキャプチャして生成する。
A2E$は多次元メトリクスのスイートを使用してハーネス機能を評価する。
論文 参考訳(メタデータ) (2026-08-07T15:44:12Z) - EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement [70.68218215070745]
既存のアプローチでは、すべての実行エクスペリエンスを単一のハーネスにルーティングできると仮定している。
EvolveNetは、経験抽出をデータに移動させるハーネス進化のパラダイムである。
論文 参考訳(メタデータ) (2026-08-05T15:37:18Z) - Rethinking the Evaluation of Harness Evolution for Agents [83.07258924910069]
既存のハーネス進化法では、単体テストケースを使用してハーネス構成を検索し、同じ公開ベンチマークで最終的なパフォーマンスを報告している。
このプロトコルは2つの基本的な懸念を提起する。
エージェントによるテスト時間スケーリングと同様に、一致したフィードバックと推論予算の下で単純なタスクレベルの検索ベースラインと比較すべきである。
論文 参考訳(メタデータ) (2026-07-14T00:18:42Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry [35.87794858139959]
HarnessXは、構成可能、適応可能、進化可能なエージェントハーネス用のファウンダリーである。
型付きハーネスプリミティブを置換代数学で組み立て、AIGISを介して適応する。
軌道をハーネス更新とモデルトレーニング信号の両方に変換することでハーネスモデルループを閉じる。
論文 参考訳(メタデータ) (2026-06-12T08:27:11Z) - Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents [82.27610290890475]
i) ハーネス更新、(i) 実行証拠から有用な永続的ハーネス更新を生成する能力、(ii) ハーネスベネフィット、タスク解決時に更新されたハーネスの恩恵を受ける能力の2つのハーネス自己進化能力を分析した。
まず、ハーネス更新は基本能力において平坦である:異なる能力階層のモデルがハーネス更新を生成し、驚くほど類似したゲインをもたらす。
第二に、ハーネスベネフィットは基本能力において単調ではない:弱い層モデルは更新されたハーネスからほとんど恩恵を受けず、中層モデルは最も恩恵を受け、強い層モデルは中層より利益が低い。
論文 参考訳(メタデータ) (2026-05-28T22:16:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。