論文の概要: Evo-Bench: Can Language Models Improve Agent Harness?
- arxiv url: http://arxiv.org/abs/2608.09096v2
- Date: Tue, 11 Aug 2026 02:53:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.736435
- Title: Evo-Bench: Can Language Models Improve Agent Harness?
- Title(参考訳): Evo-Bench: 言語モデルはエージェントのハーネスを改善するか?
- Authors: Lisheng Huang, Chen Yang, Hao Zhou, Huatong Song, Zongchao Chen, Ran Le, Yang Song, Wayne Xin Zhao, Tao Zhang,
- Abstract要約: Evo-Benchは、検索、オフィス、ジェネラルエージェントドメインにまたがるモデル固有のハーネス進化能力を評価するために設計された最初のベンチマークである。
トップモデルは16.6ポイントに達し、最先端の人間工学ベースラインに近づいた。
- 参考スコア(独自算出の注目度): 44.72089415085898
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have driven rapid progress in autonomous agents, yet standard evaluations remain confined to static task solving. An emerging frontier is harness evolution---the agent's capacity to autonomously optimize its own operating harness. However, systematically benchmarking this capability remains challenging, as existing evaluations fail to isolate harness improvements from base model strength, prevent task-specific overfitting, or capture long-horizon iterative research. To address these challenges, we introduce Evo-Bench, the first benchmark designed to evaluate models' intrinsic harness-evolving capabilities across Search, Office, and General agent domains. To rigorously isolate this capability, Evo-Bench employs a novel harness-guided construction framework: it leverages auxiliary-task evolution to identify tasks genuinely sensitive to framework improvements, followed by sensitivity-aware stratified splitting to ensure robust cross-suite generalization. Extensive evaluations across nine frontier and open-weight models reveal that top models achieve massive absolute gains reaching 16.6 points, closely approaching state-of-the-art human-engineered baselines. Crucially, while autonomous evolution outpeforms artificial harness in General tasks and excels in Search tasks, it struggles in Office tasks that demand highly specific processing workflows. Furthermore, our analysis exposes critical temporal anomalies like early saturation, while demonstrating that the synthesized harnesses act as highly transferable reasoning structures, consistently boosting diverse policy models.
- Abstract(参考訳): 大規模言語モデル(LLM)は、自律エージェントの急速な進歩を促しているが、標準的な評価は静的タスク解決に限られている。
新たなフロンティアは進化の源泉であり、エージェントが自力で自力で動作ハーネスを最適化する能力である。
しかし、既存の評価では、ベースモデルの強度からハーネスの改善を分離したり、タスク固有のオーバーフィッティングを防いだり、長期的な反復的な研究を捉えたりすることができなかったため、この能力を体系的にベンチマークすることは依然として困難である。
これらの課題に対処するために、モデル固有のハーネス進化能力を評価するために設計された最初のベンチマークであるEvo-Benchを紹介した。
補助タスクの進化を利用して、フレームワークの改善に真に敏感なタスクを識別し、続いて感度に敏感な階層化分割を行い、堅牢なクロススーツの一般化を保証する。
9つのフロンティアおよびオープンウェイトモデルにわたる広範囲な評価の結果、トップモデルは16.6ポイントに達し、最先端の人間工学ベースラインに近づいた。
重要なのは、自律的な進化は一般的なタスクにおいて人工的ハーネスよりも優れ、検索タスクでは優れていますが、非常に特殊な処理ワークフローを必要とするOfficeタスクでは苦労しています。
さらに,本分析では,早期飽和などの重要な時間的異常を明らかにするとともに,合成されたハーネスが高度に伝達可能な推論構造として機能し,多種多様なポリシーモデルを一貫して強化することを示した。
関連論文リスト
- AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks? [84.49732367417067]
我々は超長距離閉ループ最適化のための新しいベンチマークであるAutoLabを紹介する。
AutoLabは4つの異なるドメインにまたがる36の現実的で専門家によるタスクで構成されている。
我々は、真に有能な長距離エージェントに向けた研究を加速するために、全ベンチマーク、評価ハーネス、タスクアーティファクトをオープンソース化する。
論文 参考訳(メタデータ) (2026-06-03T16:36:54Z) - Reasoning Primitives in Hybrid and Non-Hybrid LLMs [10.629439705877054]
我々は、リコールと状態追跡という2つのプリミティブを通して推論を研究する。
我々は、命令調整および推論強化の変種にマッチしたOlmo3変換器とハイブリッドモデルを使用する。
論文 参考訳(メタデータ) (2026-04-23T09:13:28Z) - EvoClaw: Evaluating AI Agents on Continuous Software Evolution [47.49468375065129]
ノイズの多いコミットログから検証可能なマイルストーンDAGを再構築するエージェントパイプラインであるDeepCommitを紹介する。
これらの実行可能なシーケンスは、エージェントがシステムの完全性を維持し、エラーの蓄積を制限する必要がある新しいベンチマークであるEvoClawを可能にする。
論文 参考訳(メタデータ) (2026-03-13T03:20:40Z) - EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots [68.29056647487519]
Embodied AIは、高忠実度シミュレーションと大規模データ収集によって実現されている。
しかし、このスケーリング能力は、労働集約的な手作業の監視に依存しているため、いまだにボトルネックになっている。
実装ポリシーを自律的に構築するための LLM エージェントの能力を評価するベンチマークである textscEmboCoach-Bench を紹介する。
論文 参考訳(メタデータ) (2026-01-29T11:33:49Z) - Deep Self-Evolving Reasoning [22.934253026226155]
私たちは、Deep Self-Evolving Reasoning (DSER)と呼ばれる確率的パラダイムによって、推論の限界が大幅に拡張できることを示します。
AIME 2024-2025ベンチマークでは、DSERは9つの未解決問題のうち5つを解決し、全体的なパフォーマンスを向上する。
本研究は,強力で本質的な自己進化能力を持つ次世代モデルを開発するための明確な研究課題を確立するものである。
論文 参考訳(メタデータ) (2025-10-20T12:51:42Z) - Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm [60.36837655498119]
本稿では,トラジェクトリをベースとしたエージェント・ベンチマーク・複雑度進化フレームワークを提案する。
このフレームワークは、既存のベンチマークから元のタスクを受け取り、エージェントがそれをより難しい新しいタスクに進化させるよう促す。
GAIAベンチマークの実験では、TRACEフレームワークはタスクの複雑さを継続的に向上し、正確性の信頼性を向上させる。
論文 参考訳(メタデータ) (2025-10-01T01:52:52Z) - SEEA-R1: Tree-Structured Reinforcement Fine-Tuning for Self-Evolving Embodied Agents [58.174206358223415]
自己進化型エボダイドエージェント(SeEA-R1)は、自己進化型エボダイドエージェント用に設計された最初の強化微細調整フレームワークである。
本研究は,SEEA-R1が自律適応と報酬駆動型自己進化をサポートすることを示す。
論文 参考訳(メタデータ) (2025-06-26T18:00:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。