論文の概要: DarwinX: Evolving Agent Harnesses Through Natural Selection
- arxiv url: http://arxiv.org/abs/2608.07545v1
- Date: Fri, 31 Jul 2026 05:34:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.562053
- Title: DarwinX: Evolving Agent Harnesses Through Natural Selection
- Title(参考訳): DarwinX: 自然選択を通じてエージェントのハーネスを進化させる
- Authors: Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen,
- Abstract要約: ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
- 参考スコア(独自算出の注目度): 48.64258219266629
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An LLM agent's capability depends not only on model weights but on its harness: prompts, tools, skills, and control flow. Self-improvement loops already edit harnesses, yet single-lineage search is path-dependent and local wins often regress other tasks. We introduce DarwinX, which treats self-evolution as selection over a population of harnesses with the model frozen: a preserve-and-extend contract admits only variants that extend coverage without regressing, an archive keeps alternative lineages for recombination, and failure-, teacher-, and self-derived evidence share one edit interface. Fitness comes from each benchmark's own verifier: no gold solutions, no hand-picked winners. Across four benchmarks that progressively separate the evolution signal from the test, one loop adds about 17 points on average: Terminal-Bench 2.1 rises +7.7 to 83.2% on a matched base and to the verified frontier at 84.7% on a stronger one; TerminalWorld's held-out split reaches 68.3%, ahead of every off-the-shelf agent; WebArena-Infinity real-task pass@1 rises from 43.5% to 93.0% audit-clean; and a Terminal-Bench 2.1 harness transfers unchanged to SWE-bench Verified. What evolves is general agent competence, not benchmark-specific patches, so it survives changes of task, verifier, and base model. A frozen model need not be a fixed agent: harness selection turns evaluation compute into durable capability.
- Abstract(参考訳): LLMエージェントの能力は、モデルウェイトだけでなく、プロンプト、ツール、スキル、制御フローにも依存する。
自己改善ループは、すでにハーネスを編集しているが、シングルライン検索はパスに依存しており、ローカルの勝利は、しばしば他のタスクを遅らせる。
保存と拡張の契約は、回帰せずにカバレッジを拡張する変種のみを認め、アーカイブは、再結合のための代替の系統を保持し、失敗、教師、自己起源のエビデンスを1つの編集インターフェースを共有します。
適合性は、各ベンチマーク独自の検証者(金の解法も手書きの勝者もなし)から得られます。
Terminal-Bench 2.1はマッチベースで+7.7から83.2%、検証済みフロンティアで84.7%、ContinalWorldのホールトアウトスプリットは68.3%、WebArena-Infinity Real-task Pass@1は43.5%から93.0%に上昇し、Continal-Bench 2.1はSWE-bench Verifiedに変更された。
進化しているのが汎用エージェントの能力であり、ベンチマーク固有のパッチではないため、タスク、検証、ベースモデルの変更を生き残る。
フリーズモデルは固定エージェントである必要はない: ハーネス選択は、評価計算を耐久性のある能力に変える。
関連論文リスト
- Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds [43.5891705224868]
自己進化型スキルシステムは、基礎となるモデルを変更することなく、実行フィードバックを永続的なスキル更新に変換することでエージェントを改善することを約束する。
5つのベンチマークと3つのモデルで制御された評価フレームワークを提案する。
全体として、永続的なスキルの自己進化は、モデル依存リターンとベンチマーク依存リターンを備えたスパース、バリデーションフィルタリング検索として理解されている。
論文 参考訳(メタデータ) (2026-07-31T04:02:51Z) - Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity [10.3661763716032]
配置において、ハーネスは利用可能な唯一のレバーであるため、自動的に改善することが重量に触れることなくパフォーマンスを上げる自然な方法である。
本稿では,自己進化型エージェント・ハーネス・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-15T10:26:26Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation [74.75716642635484]
大規模言語モデル(LLM)は、検証可能な報酬(RLVR)からの強化学習でますます訓練されている
本稿では,ラベルのないフレームワークEVOL-RLを提案する。
EVOL-RLは、多数派のみのベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2025-09-18T17:50:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。