論文の概要: EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer
- arxiv url: http://arxiv.org/abs/2607.05202v1
- Date: Mon, 06 Jul 2026 15:17:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.207558
- Title: EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer
- Title(参考訳): EvoAgentBench: 能力移行によるベンチマークエージェントの自己進化
- Abstract要約: EvoAgentBenchは、Ability-guided Transferによるエージェントの自己進化のベンチマークである。
すべてのテストタスクは、認証されたトレーニングサイドの能力サポートによってバックアップされる。
- 参考スコア(独自算出の注目度): 25.657960361149833
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Agent self-evolution in long-horizon LLM systems is largely procedural: useful experience is not merely stored information, but reusable procedures for searching, debugging, and verification. Yet current evaluations do not isolate this form of transfer. Agent benchmarks test single-episode task solving; memory benchmarks target information retention rather than procedural reuse. We introduce EvoAgentBench, a benchmark for agent self-evolution via Ability-guided transfer across four agentic domains: web research, algorithmic reasoning, software engineering, and knowledge work. EvoAgentBench extracts trace-grounded Abilities from agent executions, canonicalizes them into operational units, and builds domain-specific Ability Graphs linking tasks that share procedural overlap. By design, every test task is backed by verified training-side Ability support. Across a 528/267 train/test split, two scaffolds, and three backbones, curated Ability content transfers reliably across model families, but no current automatic method sustains positive gain in all settings. EvoAgentBench shifts self-evolution evaluation from aggregate accuracy comparison to fine-grained diagnosis of experience encoding, routing, and uptake. The benchmark is publicly available at https://huggingface.co/datasets/EverMind-AI/EvoAgentBench.
- Abstract(参考訳): 長期LLMシステムにおけるエージェントの自己進化は主に手続き的であり、有用な経験は単に記憶された情報ではなく、検索、デバッグ、検証のための再利用可能な手順である。
しかし、現在の評価では、この形態の転送は分離されていない。
エージェントベンチマークは単相タスク解決をテストする。メモリベンチマークは手続き的な再利用ではなく、情報の保持を目標とする。
EvoAgentBenchは、4つのエージェントドメイン(Webリサーチ、アルゴリズム推論、ソフトウェアエンジニアリング、知識ワーク)にまたがるエージェントの自己進化のためのベンチマークである。
EvoAgentBenchはエージェントの実行からトレース地上アビリティを抽出し、それらを運用ユニットに標準化し、手続き的なオーバーラップを共有するタスクをリンクするドメイン固有のAbility Graphを構築する。
設計上、すべてのテストタスクは、認証されたトレーニングサイドの能力サポートによってバックアップされる。
528/267の列車/テストのスプリット、2つの足場、3つのバックボーン、モデルファミリ間で確実にキュレートされた能力コンテンツ転送があるが、現在の自動手法ではすべての設定で肯定的な利得を維持できない。
EvoAgentBenchは、自己進化評価を集約精度比較から、エンコーディング、ルーティング、取り込みの詳細な診断にシフトする。
ベンチマークはhttps://huggingface.co/datasets/EverMind-AI/EvoAgentBenchで公開されている。
関連論文リスト
- PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents [50.9061759859778]
PAST-Benchは、保持されたエクスペリエンスがエージェントを時間とともに実際に改善するかどうかを識別するために設計されたベンチマークである。
遅延タスクのゲインと、そのゲインが意図したセーブ、リトリーブ、更新パスに従うかどうかを報告します。
我々はHermes+を開発し、エージェントループの段階にわたって5つのターゲット的介入でHermesを拡張した。
論文 参考訳(メタデータ) (2026-08-04T17:58:05Z) - AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers [39.39345650320786]
AgentHPOBenchは、7つの研究カテゴリにわたる30の実行可能な機械学習タスクからなる逐次ベンチマークである。
広範に使用されている12のエージェントと従来型のHPOベースラインを統一プロトコルで評価した。
その結果、現在のエージェントは、ドメイン間で測定可能な実験最適化能力を示すが、継続的改善、複雑なログ診断、報告された参照性能への一貫した進歩において、明確な制限に直面していることがわかった。
論文 参考訳(メタデータ) (2026-07-31T16:58:00Z) - Knowledge-Centric Self-Improvement [28.85741798328687]
自己改善型AIシステムはエージェントを、プロンプト、ハーネス、さらにはエージェント自身のコードを最適化することによって改善するオブジェクトとして扱う。
このエージェント中心のビューは、メンテナンスにコストがかかり、転送が困難になる。
我々は,エージェントが汎用的で使い捨てであるような,知識中心の自己改善という補完的パラダイムについて研究する。
論文 参考訳(メタデータ) (2026-07-21T21:38:39Z) - Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills [12.442806027914097]
本稿では,エージェントの過去の解法トレースをトレーニング信号のソースとして再利用する,クローズドループ自己進化フレームワークであるSocratic-SWEを紹介する。
トレースを報酬計算の証拠としてのみ扱うのではなく、Socratic-SWEはそれらを、繰り返し発生する障害と効果的な修復パターンを要約した構造化されたエージェントスキルに蒸留する。
論文 参考訳(メタデータ) (2026-06-05T16:00:17Z) - AgentSim: A Platform for Verifiable Agent-Trace Simulation [3.2058241360543254]
AgentSimは、RAGエージェントをシミュレートするオープンソースプラットフォームである。
これは、任意のドキュメントコレクションに対するエージェント推論の検証可能な段階的なトレースを生成する。
マルチモデル検証パイプラインとアクティブなHuman-in-the-loopプロセスを組み合わせる。
論文 参考訳(メタデータ) (2026-04-29T13:19:38Z) - AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation [71.49152943451328]
我々は,AJ-Benchベンチマークを導入し,ドメイン検索,データシステム,グラフィカルユーザインタフェースの3つの領域にまたがるエージェント・アズ・ア・Judgeを評価する。
実験ではLLM-as-a-Judgeベースラインよりも一貫したパフォーマンス向上を示し、エージェントベースの検証においてかなりオープンな課題を明らかにした。
論文 参考訳(メタデータ) (2026-04-20T13:23:38Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - AgentSelect: Benchmark for Narrative Query-to-Agent Recommendation [39.61543921719145]
AgentSelectは、エージェントの選択をナラティブクエリからエージェントへのレコメンデーションとして再設計するベンチマークである。
異種評価アーティファクトを、統一された正のみの相互作用データに変換する。
AgentSelectは、エージェントレコメンデーションのための最初の統一データと評価インフラストラクチャを提供する。
論文 参考訳(メタデータ) (2026-03-04T06:17:51Z) - SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents [45.71333459905404]
SmartSnapは、受動的でポストホックな検証から、エージェント自身による積極的な自己検証へのパラダイムシフトである。
両ミッションで設計された新しいタイプのエージェントである「自己検証エージェント」を導入し、タスクを完了し、検証された証拠でその達成を証明した。
モデルファミリとスケールにわたるモバイルタスクの実験は、SmartSnapパラダイムによって、スケーラブルなLLM駆動エージェントのトレーニングが可能になることを実証しています。
論文 参考訳(メタデータ) (2025-12-26T14:51:39Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - Alita-G: Self-Evolving Generative Agent for Agent Generation [54.49365835457433]
汎用エージェントをドメインエキスパートに変換するフレームワークであるALITA-Gを提案する。
このフレームワークでは、ジェネラリストエージェントが対象ドメインタスクのキュレートされたスイートを実行する。
計算コストを削減しながら、大きな利益を得ることができます。
論文 参考訳(メタデータ) (2025-10-27T17:59:14Z) - R&D-Agent: An LLM-Agent Framework Towards Autonomous Data Science [70.1638335489284]
高レベルの機械学習エンジニアリングタスクは、労働集約的で反復的である。
機械学習プロセスを形式化する包括的で分離されたフレームワークであるR&D-Agentを紹介します。
R&D-AgentはMLEを2つのフェーズと6つのコンポーネントに定義し、MLEのエージェント設計を原則としてテスト可能なプロセスに変える。
論文 参考訳(メタデータ) (2025-05-20T06:07:00Z) - Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning [68.00304954972232]
コントローラ、例えば視覚言語モデルと外部ツールを統合するマルチモーダルエージェントは、複雑なマルチモーダルタスクに対処する際、顕著な能力を示した。
これらのエージェントを訓練するための既存のアプローチは、広範囲なヒューマン・アノテートされたタスク・アンサー・ペアとツール・トラジェクトリに依存している。
本研究では,事前に収集したデータのないマルチモーダルエージェント,すなわち SPORT の反復ツール利用探索手法を提案する。
Sportには、タスク合成、ステップサンプリング、ステップ検証、優先度調整の4つの反復的なコンポーネントがある。
論文 参考訳(メタデータ) (2025-04-30T12:01:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。