論文の概要: SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment
- arxiv url: http://arxiv.org/abs/2604.08988v2
- Date: Tue, 14 Apr 2026 01:08:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-15 14:01:13.22763
- Title: SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment
- Title(参考訳): SEA-Eval: エピソード評価を超えた自己進化型エージェントの評価ベンチマーク
- Abstract要約: 本稿では、Self-Evolving Evolutionary Agentを定義し、SEAの評価に特化して設計された最初のベンチマークであるSEA-Evalを紹介する。
SEA-Evalは、主要な指標として$SR$と$T$を確立し、シーケンシャルなタスクストリーム設計を通じて進化的ゲイン、進化的安定性、暗黙的なアライメント収束を実現できる。
- 参考スコア(独自算出の注目度): 52.87618765740484
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current LLM-based agents demonstrate strong performance in episodic task execution but remain constrained by static toolsets and episodic amnesia, failing to accumulate experience across task boundaries. This paper presents the first formal definition of the Self-Evolving Agent (SEA), formalizes the Evolutionary Flywheel as its minimal sufficient architecture, and introduces SEA-Eval -- the first benchmark designed specifically for evaluating SEAs. Grounded in Flywheel theory, SEA-Eval establishes $SR$ and $T$ as primary metrics and enables through sequential task stream design the independent quantification of evolutionary gain, evolutionary stability, and implicit alignment convergence. Empirical evaluation reveals that under identical success rates, token consumption differs by up to 31.2$\times$ across frameworks, with divergent evolutionary trajectories under sequential analysis -- demonstrating that success rate alone creates a capability illusion and that the sequential convergence of $T$ is the key criterion for distinguishing genuine evolution from pseudo-evolution.
- Abstract(参考訳): 現在のLLMベースのエージェントは、表在的なタスク実行において強いパフォーマンスを示すが、静的なツールセットと表在的なアムネシアによって制約され、タスク境界を越えて経験を蓄積することができない。
本稿では,SEA (Self-Evolving Agent) の最初の形式的定義を提示し,その最小限のアーキテクチャとして進化型フライホイールを定式化し,SEA-Eval(SEA-Eval) を導入した。
フライホイール理論に基づいて、SEA-Evalは、SR$とT$を主要な指標として定め、進化的ゲイン、進化的安定性、暗黙的なアライメント収束の独立な定量化をシーケンシャルなタスクストリーム設計によって実現している。
実証的な評価によると、同じ成功率の下では、トークンの消費はフレームワーク間で最大31.2$\times$で異なる。
関連論文リスト
- EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection [13.71748862936038]
EvoTS-Agentは、自律的な金融時系列変更点検出のための検証誘導型自己進化型LLMエージェントである。
EvoTS-Agentは、100%の実行成功率を維持しながら、既存のLLMエージェントよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-08-18T15:55:32Z) - Self-Improving Large Language Models via Progressive Experience Evolution [52.03479747358687]
textbfSPEE(textbfSelf-textbfProgressive textbfExperience textbfEvolution)を提案する。
5つの数学的推論ベンチマークの実験は、SPEEが3つのモデルスケールでテスト時間とトレーニング時間の両方の自己進化ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-08-03T12:27:32Z) - AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks? [65.05151983193441]
大規模言語モデル(LLM)エージェントは、自身の蓄積した経験から継続的に改善することで、自己進化することができる。
我々は,多様な進化的コンポーネントにまたがる自己進化的エージェントを評価する統合フレームワークであるAgentStreamを紹介する。
以上の結果から、自己進化の信頼性はストリーミングシナリオによって異なり、自己進化の利点はモデル能力と非単調なモデル強度によって促進されることが示された。
論文 参考訳(メタデータ) (2026-07-31T17:50:08Z) - MobEvolve: An Agentic Self-Evolving Heuristic System for Interpretable Human Mobility Generation [51.824145170051516]
MobEvolveは、人間のモビリティ生成のための自己進化フレームワークである。
エージェントを使用して、内部ロジックを反復的に進化させる。
最先端の深層生成法とLLMベースの手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-06-01T03:46:25Z) - BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents [24.997265534888626]
LLMエージェントの自己進化能力を評価するベンチマークである textbfBenchTrace を提案する。
BenchTraceは6つのタスクにまたがる1,821の注釈付きエピソードのスナップショット・リフレクションデータセット上に構築されている。
エージェントがターゲットの障害インスタンスをうまく回避するテストケースの割合を計測する新しい評価指標であるtextbffailure avoidance rate (FAR) を提案する。
論文 参考訳(メタデータ) (2026-05-28T01:25:37Z) - Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability [6.195988633460139]
本稿では,AIエージェント信頼性のための厳密な計測科学を確立する。
出力レベルの信頼性に$U$-statistics、軌道レベルの安定性にカーネルベースのメトリクスを活用することにより、エージェントを評価するための原則的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-05-11T13:06:24Z) - Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm [60.36837655498119]
本稿では,トラジェクトリをベースとしたエージェント・ベンチマーク・複雑度進化フレームワークを提案する。
このフレームワークは、既存のベンチマークから元のタスクを受け取り、エージェントがそれをより難しい新しいタスクに進化させるよう促す。
GAIAベンチマークの実験では、TRACEフレームワークはタスクの複雑さを継続的に向上し、正確性の信頼性を向上させる。
論文 参考訳(メタデータ) (2025-10-01T01:52:52Z) - MedSeqFT: Sequential Fine-tuning Foundation Models for 3D Medical Image Segmentation [55.37355146924576]
MedSeqFTは、医用画像解析のためのシーケンシャルな微調整フレームワークである。
事前訓練されたモデルを新しいタスクに適応させ、表現能力を改善する。
最先端の微調整戦略を一貫して上回ります。
論文 参考訳(メタデータ) (2025-09-07T15:22:53Z) - State Stream Transformer (SST) : Emergent Metacognitive Behaviours Through Latent State Persistence [0.0]
State Stream Transformer (SST) は、事前訓練された重みで遅延した突発的な推論動作を示す新しいLCMアーキテクチャである。
SSTは、自己回帰世代を通して永続的な潜伏過程を維持し、進化させる重み付き崩壊を伴うスライディングウィンドウ潜伏状態(FFN)キャッシュを導入している。
SSTは、GSM-8K(0ショット)で89.01%、ARC Challenge(0ショットCoT)で91.04%の精度を達成した。
論文 参考訳(メタデータ) (2025-01-30T14:03:36Z) - AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents [74.16170899755281]
本稿では,LLMエージェントの分析的評価に適したオープンソース評価フレームワークであるAgentBoardを紹介する。
AgentBoardは、インクリメンタルな進歩と包括的な評価ツールキットをキャプチャする、きめ細かい進捗率のメトリクスを提供する。
これはLLMエージェントの能力と限界に光を当てるだけでなく、その性能の解釈可能性も最前線に広める。
論文 参考訳(メタデータ) (2024-01-24T01:51:00Z) - Understanding, Predicting and Better Resolving Q-Value Divergence in
Offline-RL [86.0987896274354]
まず、オフラインRLにおけるQ値推定のばらつきの主な原因として、基本パターン、自己励起を同定する。
そこで本研究では,Q-network の学習における進化特性を測定するために,SEEM(Self-Excite Eigen Value Measure)尺度を提案する。
われわれの理論では、訓練が早期に発散するかどうかを確実に決定できる。
論文 参考訳(メタデータ) (2023-10-06T17:57:44Z) - Data Augmentation through Expert-guided Symmetry Detection to Improve
Performance in Offline Reinforcement Learning [0.0]
マルコフ決定過程(MDP)の動的モデルのオフライン推定は非自明な作業である。
近年の研究では、密度推定法に依存する専門家誘導パイプラインが、決定論的環境において、この構造を効果的に検出できることが示されている。
学習したMDPを解き、実際の環境に最適化されたポリシーを適用すると、前者の結果が性能改善につながることを示す。
論文 参考訳(メタデータ) (2021-12-18T14:32:32Z) - Episodic Memory for Learning Subjective-Timescale Models [1.933681537640272]
モデルに基づく学習では、エージェントのモデルは、環境の連続状態間の遷移に対して一般的に定義される。
対照的に、生物学的生物の知的行動は、文脈によって異なる時間スケールを計画する能力によって特徴づけられる。
エージェントの主観的時間尺度を定義するエピソード記憶のシーケンスに基づいて、遷移力学モデルを学ぶための新しいアプローチを考案する。
論文 参考訳(メタデータ) (2020-10-03T21:55:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。