論文の概要: Beyond Endpoint Performance: Process-Level Evaluation of Self-Evolving Agents
- arxiv url: http://arxiv.org/abs/2609.24663v1
- Date: Mon, 21 Sep 2026 14:28:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.005147
- Title: Beyond Endpoint Performance: Process-Level Evaluation of Self-Evolving Agents
- Title(参考訳): エンドポイントのパフォーマンスを超えて: 自己進化型エージェントのプロセスレベル評価
- Abstract要約: EvoPathBenchは、アーティファクトレベルの自己進化中の個々の機能を追跡するベンチマークである。
不可解なタスクへの一般化、無関係な学習後の保持、新しいエビデンスへのルール適応の3つの機能をテストする。
- 参考スコア(独自算出の注目度): 20.811638832981178
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-evolving agents convert interaction feedback into persistent artifacts, such as memories or skills, which in turn guide subsequent decisions. As these artifacts are iteratively updated throughout an experience stream, the capabilities they support may evolve. Consequently, endpoint performance alone offers an incomplete view of self-evolution. Process-level evaluation is therefore essential to identify when a target capability emerges and whether later updates strengthen, preserve, or weaken it. Motivated by this, we propose \textsc{EvoPathBench}, a benchmark that tracks individual capabilities during artifact-level self-evolution. EvoPathBench fixes the base model, tools, freezes evolving artifacts at successive checkpoints, and evaluates the target capability on held-out episodes. This benchmark evaluates agent self-evolution using public trading data and calibrated trajectories. It tests three capabilities: generalization to unseen tasks, retention after unrelated learning, and rule adaptation to new evidence. Experimental results show that gains on similar unseen tasks often weaken under distribution shift, retention losses are concentrated in a minority of evolution paths, and no method achieves reliable rule adaptation. Moreover, while self-evolution enables agents to generate candidate artifacts with substantial held-out gains, the selected updates consistently fall short of realizing this potential. Together, these findings establish capability-level process evaluation as a foundation for analyzing self-evolution, identifying candidate evaluation and selection as key targets for improvement.
- Abstract(参考訳): 自己進化エージェントは、インタラクションフィードバックを記憶やスキルなどの永続的なアーティファクトに変換し、その後の決定を導く。
これらのアーティファクトはエクスペリエンスストリームを通じて反復的に更新されるため、それらをサポートする機能が進化する可能性がある。
その結果、エンドポイントのパフォーマンスだけで、自己進化の完全なビューを提供する。
したがって、プロセスレベルの評価は、ターゲット能力がいつ出現し、後続のアップデートが強化、保存、または弱まるかを特定するのに不可欠である。
そこで我々は, 人工物レベルの自己進化における個々の能力を追跡するベンチマークである \textsc{EvoPathBench} を提案する。
EvoPathBenchはベースモデルとツールを修正し、連続したチェックポイントで進化するアーティファクトを凍結し、保留中のエピソードに対するターゲット能力を評価する。
このベンチマークは、公開取引データとキャリブレーションされた軌跡を用いてエージェントの自己進化を評価する。
不可解なタスクへの一般化、無関係な学習後の保持、新しいエビデンスへのルール適応の3つの機能をテストする。
実験の結果, 類似の未確認タスクのゲインは分布シフトによって弱まることが多く, 保持損失は少数の進化経路に集中しており, 信頼性の高いルール適応を実現する方法はないことがわかった。
さらに、自己進化によりエージェントは実質的な利得を持つ候補アーティファクトを生成することができるが、選択された更新は、この可能性を実現するには至らない。
これらの知見は、自己進化分析の基礎として能力レベルプロセス評価を確立し、候補評価と選択を改善の鍵となるターゲットとして特定する。
関連論文リスト
- HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution [11.431479238875712]
我々は、信頼できるエージェントの自己進化を実現するために、参照軌道から学習する自己進化フレームワークであるHarnessEvolveを紹介する。
私たちは、さまざまなモデルとエージェントフレームワークを使用して、オープンドメインとエンタープライズシナリオにまたがるいくつかのベンチマークで広範な実験を行います。
結果は、HarnessEvolveがすべてのベンチマークと設定で、最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-09-01T07:31:18Z) - Aspire: Can Models Self-Evolve from Vague Goals? [61.65007006747275]
我々はあいまいなゴール駆動型自己進化のベンチマークであるASPIREを紹介する。
ASPIREは、統一された対話環境におけるモデルウェイトとエージェントハーネスの進化をサポートする。
実験の結果,曖昧な目標が探索努力を目標解釈に向けることが示唆された。
論文 参考訳(メタデータ) (2026-08-31T17:14:59Z) - From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents [24.997265534888626]
LLMエージェントの自己進化能力を評価するベンチマークである textbfBenchTrace を提案する。
BenchTraceは6つのタスクにまたがる1,821の注釈付きエピソードのスナップショット・リフレクションデータセット上に構築されている。
エージェントがターゲットの障害インスタンスをうまく回避するテストケースの割合を計測する新しい評価指標であるtextbffailure avoidance rate (FAR) を提案する。
論文 参考訳(メタデータ) (2026-05-28T01:25:37Z) - Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended Tasks [10.622439192272527]
従来のエージェントシステムは、タスク分布が継続的にドリフトし、外部の監視が不十分な、オープンな環境に苦しむ。
In-Situ Self-Evolving(In-Situ Self-Evolving)パラダイムを提案する。
このフレームワーク内では、新しい課題をナビゲートするためのツールを反復的に合成、最適化、再利用するシステムであるYunjue Agentを開発します。
論文 参考訳(メタデータ) (2026-01-26T07:27:47Z) - From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models [77.04403907729738]
このサーベイは、受動的診断基準からリアルタイムモデル動作を導くアクティブ制御信号への不確実性の進化をグラフ化する。
3つのフロンティアにまたがるアクティブ制御信号として不確実性がいかに活用されているかを示す。
この調査は、次世代のスケーラブルで信頼性があり、信頼できるAIを構築するためには、新しい不確実性のトレンドを習得することが不可欠である、と論じている。
論文 参考訳(メタデータ) (2026-01-22T06:21:31Z) - Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning [52.99434388759101]
ツール統合推論による継続的改善を実現する自己進化型視覚言語エージェントを提案する。
Agent0-VLは、ツールの使用法を推論だけでなく、自己評価や自己修復にも取り入れている。
実験の結果,Agent0-VLはベースモデルよりも12.5%向上していることがわかった。
論文 参考訳(メタデータ) (2025-11-25T04:15:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。