論文の概要: SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment
- arxiv url: http://arxiv.org/abs/2604.08988v1
- Date: Fri, 10 Apr 2026 05:49:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-13 17:57:53.707121
- Title: SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment
- Title(参考訳): SEA-Eval: エピソード評価を超えた自己進化型エージェントの評価ベンチマーク
- Authors: Sihang Jiang, Lipeng Ma, Zhonghua Hong, Keyi Wang, Zhiyu Lu, Shisong Chen, Jinghao Zhang, Tianjun Pan, Weijia Zhou, Jiaqing Liang, Yanghua Xiao,
- Abstract要約: 本稿では,デジタルエンボディメントと連続的クロスタスク進化を基礎としたSEA(Self-Evolving Agent)の新たな形式的定義を提案する。
SEA-Evalは2次元にわたるSEA特性を評価するために設計された最初のベンチマークである。
- 参考スコア(独自算出の注目度): 52.87618765740484
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current LLM-based agents demonstrate strong performance in episodic task execution but remain constrained by static toolsets and episodic amnesia, failing to accumulate experience or optimize strategies across task boundaries. While the Self-Evolving Agent (SEA) paradigm has been previously proposed, this paper contributes a new formal definition of SEA grounded in digital embodiment and continuous cross-task evolution, and introduces SEA-Eval, the first benchmark designed to evaluate SEA characteristics across two dimensions, intra-task execution reliability and long-term evolutionary performance. By organizing tasks into sequential streams and analyzing Success Rate and Token Consumption over time, SEA-Eval quantifies evolutionary gain and structural stability in ways that existing episodic benchmarks cannot. Empirical evaluations reveal a significant evolutionary bottleneck in current state-of-the-art frameworks, where identical success rates mask up to 31.2 times differences in token consumption and divergent evolutionary trajectories under sequential analysis. SEA-Eval provides a rigorous scientific foundation for advancing agents from mere task executors toward genuinely self-evolving digital entities.
- Abstract(参考訳): 現在のLLMベースのエージェントは、表在的なタスク実行において強いパフォーマンスを示すが、静的なツールセットと表在的なアムネシアによって制約され続けており、経験を蓄積したり、タスク境界を越えて戦略を最適化することができない。
自己進化エージェント(SEA)のパラダイムは以前から提案されてきたが,本論文では,デジタルエンボディメントと連続タスク進化を基盤としたSEAの新たな形式的定義と,2次元にわたるSEA特性の評価を行うための最初のベンチマークであるSEA-Evalを紹介する。
タスクをシーケンシャルストリームに整理し、時間とともに成功率とトークン消費を分析することで、SEA-Evalは、既存のエピソードベンチマークでは不可能な方法で進化的なゲインと構造的安定性を定量化する。
経験的評価は、現在の最先端フレームワークにおいて重要な進化的ボトルネックを示し、同じ成功率が、シーケンシャルな分析の下で、トークン消費と分岐した進化軌道の最大31.2倍の差を隠蔽している。
SEA-Evalは、単なるタスク実行者から真に自己進化するデジタルエンティティへとエージェントを前進させるための厳格な科学基盤を提供する。
関連論文リスト
- Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm [60.36837655498119]
本稿では,トラジェクトリをベースとしたエージェント・ベンチマーク・複雑度進化フレームワークを提案する。
このフレームワークは、既存のベンチマークから元のタスクを受け取り、エージェントがそれをより難しい新しいタスクに進化させるよう促す。
GAIAベンチマークの実験では、TRACEフレームワークはタスクの複雑さを継続的に向上し、正確性の信頼性を向上させる。
論文 参考訳(メタデータ) (2025-10-01T01:52:52Z) - MedSeqFT: Sequential Fine-tuning Foundation Models for 3D Medical Image Segmentation [55.37355146924576]
MedSeqFTは、医用画像解析のためのシーケンシャルな微調整フレームワークである。
事前訓練されたモデルを新しいタスクに適応させ、表現能力を改善する。
最先端の微調整戦略を一貫して上回ります。
論文 参考訳(メタデータ) (2025-09-07T15:22:53Z) - State Stream Transformer (SST) : Emergent Metacognitive Behaviours Through Latent State Persistence [0.0]
State Stream Transformer (SST) は、事前訓練された重みで遅延した突発的な推論動作を示す新しいLCMアーキテクチャである。
SSTは、自己回帰世代を通して永続的な潜伏過程を維持し、進化させる重み付き崩壊を伴うスライディングウィンドウ潜伏状態(FFN)キャッシュを導入している。
SSTは、GSM-8K(0ショット)で89.01%、ARC Challenge(0ショットCoT)で91.04%の精度を達成した。
論文 参考訳(メタデータ) (2025-01-30T14:03:36Z) - AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents [74.16170899755281]
本稿では,LLMエージェントの分析的評価に適したオープンソース評価フレームワークであるAgentBoardを紹介する。
AgentBoardは、インクリメンタルな進歩と包括的な評価ツールキットをキャプチャする、きめ細かい進捗率のメトリクスを提供する。
これはLLMエージェントの能力と限界に光を当てるだけでなく、その性能の解釈可能性も最前線に広める。
論文 参考訳(メタデータ) (2024-01-24T01:51:00Z) - Data Augmentation through Expert-guided Symmetry Detection to Improve
Performance in Offline Reinforcement Learning [0.0]
マルコフ決定過程(MDP)の動的モデルのオフライン推定は非自明な作業である。
近年の研究では、密度推定法に依存する専門家誘導パイプラインが、決定論的環境において、この構造を効果的に検出できることが示されている。
学習したMDPを解き、実際の環境に最適化されたポリシーを適用すると、前者の結果が性能改善につながることを示す。
論文 参考訳(メタデータ) (2021-12-18T14:32:32Z) - Episodic Memory for Learning Subjective-Timescale Models [1.933681537640272]
モデルに基づく学習では、エージェントのモデルは、環境の連続状態間の遷移に対して一般的に定義される。
対照的に、生物学的生物の知的行動は、文脈によって異なる時間スケールを計画する能力によって特徴づけられる。
エージェントの主観的時間尺度を定義するエピソード記憶のシーケンスに基づいて、遷移力学モデルを学ぶための新しいアプローチを考案する。
論文 参考訳(メタデータ) (2020-10-03T21:55:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。