論文の概要: PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
- arxiv url: http://arxiv.org/abs/2608.04003v1
- Date: Tue, 04 Aug 2026 17:58:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.305796
- Title: PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
- Title(参考訳): PAST-Bench: 個人エージェントにおける再帰的自己改善の基礎のベンチマーク
- Authors: Shuhan Xue, Zixin Ding, Yichen Shen, Yinjie Wang, Zhenfei Yin, Yingcheng Wu, Yuxin Chen, Mengdi Wang, Ling Yang,
- Abstract要約: PAST-Benchは、保持されたエクスペリエンスがエージェントを時間とともに実際に改善するかどうかを識別するために設計されたベンチマークである。
遅延タスクのゲインと、そのゲインが意図したセーブ、リトリーブ、更新パスに従うかどうかを報告します。
我々はHermes+を開発し、エージェントループの段階にわたって5つのターゲット的介入でHermesを拡張した。
- 参考スコア(独自算出の注目度): 50.9061759859778
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recursive self-improvement requires agents to turn accumulated experience into better future behavior. Personal AI agents offer a concrete setting for studying this capability because they retain preferences, task histories, tool routines, and learned skills across sessions. Yet whether retained experience actually improves them over time has not been systematically tested. We introduce PAST-Bench, a benchmark designed to isolate this question. Each agent runs through ordered sequences of fresh-session tasks under matched conditions that turn retained experience on and off. It spans 26 scenarios and 204 episodes across memory, procedural reuse, information gathering, and update. We report both later-task gains and whether those gains follow the intended save, retrieve, and update pathway. Across seven base models and four agent frameworks, improvement is real but uneven across capabilities. Agents with the same headline gain can differ markedly in whether that gain is supported by evidence of the intended pathway. Guided by these findings, we develop Hermes+, which extends Hermes with five targeted interventions across stages of the agent loop. Hermes+ raises the average gain from retained experience and provides clearer pathway evidence, with its strongest improvement on tasks requiring outdated state to be replaced, although the effect remains capability- and model-dependent. Together, PAST-Bench and Hermes+ provide an evaluation and diagnostic foundation for studying how persistent agents can progress from retaining experience to systematically improving through it. Code: https://github.com/Gen-Verse/PAST-Bench
- Abstract(参考訳): 再帰的な自己改善は、エージェントが蓄積した経験をよりよい将来の行動に変えることを要求する。
パーソナルAIエージェントは、好み、タスク履歴、ツールルーチン、セッション間の学習スキルを保持するため、この機能を研究するための具体的な設定を提供する。
しかし、継続した経験が実際に改善するかどうかは、体系的にテストされていない。
この問題を分離するために設計されたベンチマークである PAST-Bench を紹介する。
各エージェントは、継続した経験をオン/オフするマッチした条件下で、順序付けられた新しいセッションタスクのシーケンスを実行します。
メモリ、手続き的再利用、情報収集、更新にまたがる26のシナリオと204のエピソードにまたがる。
遅延タスクのゲインと、そのゲインが意図したセーブ、リトリーブ、更新パスに従うかどうかを報告します。
7つのベースモデルと4つのエージェントフレームワークにまたがって、改善は本物だが機能には不均一である。
同じ見出しゲインを持つエージェントは、そのゲインが意図された経路の証拠によって支持されるかどうかにおいて顕著に異なることができる。
これらの知見に導かれて,エージェントループの段階にわたって5つの介入を対象とし,Hermes+を拡張したHermes+を開発した。
Hermes+は、維持された経験から平均的な利益を上げ、より明確な経路証拠を提供する。
PAST-BenchとHermes+は共に、持続的エージェントが経験を保ち、体系的に改善するまでどのように進歩するかを研究するための評価と診断の基礎を提供する。
コード:https://github.com/Gen-Verse/PAST-Bench
関連論文リスト
- PATH-Bench: Path-Dependent Evaluation of Lifelong Agents [27.837334107109786]
PATH-Benchは、生涯エージェントのパス依存評価のためのベンチマークである。
SEU(Selective Experience Use)は,経路蓄積経験が各タスクにどのように影響するかを制御するエージェントハーネスである。
論文 参考訳(メタデータ) (2026-08-02T11:00:04Z) - Knowledge-Centric Self-Improvement [28.85741798328687]
自己改善型AIシステムはエージェントを、プロンプト、ハーネス、さらにはエージェント自身のコードを最適化することによって改善するオブジェクトとして扱う。
このエージェント中心のビューは、メンテナンスにコストがかかり、転送が困難になる。
我々は,エージェントが汎用的で使い捨てであるような,知識中心の自己改善という補完的パラダイムについて研究する。
論文 参考訳(メタデータ) (2026-07-21T21:38:39Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer [25.657960361149833]
EvoAgentBenchは、Ability-guided Transferによるエージェントの自己進化のベンチマークである。
すべてのテストタスクは、認証されたトレーニングサイドの能力サポートによってバックアップされる。
論文 参考訳(メタデータ) (2026-07-06T15:17:09Z) - SEAGym: An Evaluation Environment for Self-Evolving LLM Agents [30.362414820430402]
SEAGymは、トレーニング、検証、テスト、リプレイ、コストレコードにわたるエージェントの更新を測定するための評価環境である。
これはHarbor互換のベンチマークを、列車のバッチ、凍結された更新バリデーション、ホールドアウトIDとOOD転送ビュー、診断の再生、保存されたスナップショットとメトリックレコードを備えた動的自己進化タスクソースに変換する。
論文 参考訳(メタデータ) (2026-06-16T05:50:55Z) - Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems [60.79651380135334]
長寿命のAIエージェントは、永続的な運用システムとしてますますデプロイされる。
エージェントはデプロイ後、いつまで信頼できるのか?
エージェントライフスパンエンジニアリングのための縦型信頼性ベンチマークであるAgingBenchを紹介する。
論文 参考訳(メタデータ) (2026-05-25T19:55:12Z) - Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents [21.029076711222917]
ProactAgentは、構造化経験ベース上でのプロアクティブ検索のための、経験駆動の生涯学習フレームワークである。
ExpOnEvoは、過去のインタラクションを、事実記憶、エピソード記憶、行動スキルを含む型付きリポジトリに整理することで、検索が関連するエビデンスと実行可能なガイダンスの両方を提供する。
ProactRLは、検索決定のためのステップレベルの監視を提供し、より良いタスク結果やより高い効率につながる場合にのみ、検索を奨励する。
論文 参考訳(メタデータ) (2026-04-22T13:50:55Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - EvoTest: Evolutionary Test-Time Learning for Self-Improving Agentic Systems [59.66823584073748]
現在のAIエージェントの基本的な制限は、テスト時に複雑なスキルをその場で学べないことだ。
EvoTestは,エージェントの微調整や勾配を伴わずにエージェントを改良する,進化的テストタイム学習フレームワークである。
論文 参考訳(メタデータ) (2025-10-15T07:16:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。