論文の概要: PATH-Bench: Path-Dependent Evaluation of Lifelong Agents
- arxiv url: http://arxiv.org/abs/2608.01149v1
- Date: Sun, 02 Aug 2026 11:00:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.104517
- Title: PATH-Bench: Path-Dependent Evaluation of Lifelong Agents
- Title(参考訳): PATH-Bench:パス依存型長寿命剤の評価
- Abstract要約: PATH-Benchは、生涯エージェントのパス依存評価のためのベンチマークである。
SEU(Selective Experience Use)は,経路蓄積経験が各タスクにどのように影響するかを制御するエージェントハーネスである。
- 参考スコア(独自算出の注目度): 27.837334107109786
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Lifelong LLM agents increasingly adapt through external learning states that store past interactions as retrievable memories or reusable skills, yet existing benchmarks rarely account for how the path of accumulated experience shapes what agents transfer and retain. In this work, we establish PATH-Bench, a benchmark for path-dependent evaluation of lifelong agents. PATH-Bench estimates directed task relationships via multi-model in-context learning, constructs probe-centered sequences with controlled helpful and interfering histories, and repeatedly evaluates probe tasks to measure average performance, forward transfer, backward transfer, and forgetting. We evaluate eight representative agents on single-turn code generation and multi-turn tool-use tasks under positive- and negative-dominant histories. Benchmark results show that experience utility depends jointly on how experience is represented and on the task's interaction structure, that strong transfer does not ensure retention, and that later experience can reshape gains acquired earlier in the learning path. Based on these findings, we propose Selective Experience Use (SEU), an agent harness that regulates how path-accumulated experience influences each new task, admitting helpful items while filtering out potential interference. SEU consistently reduces forgetting while improving forward transfer in the majority of settings. The PATH-Bench provides both a controlled evaluation framework and actionable guidance for designing more selective and robust lifelong agents.
- Abstract(参考訳): 生涯のLLMエージェントは、過去のインタラクションを検索可能な記憶や再利用可能なスキルとして保存する外部学習ステートを通じて適応する傾向にあるが、既存のベンチマークでは、蓄積された経験のパスがエージェントの転送と保持をいかに形作るかはほとんど説明されていない。
本研究では,生涯エージェントの経路依存評価のためのベンチマークであるPATH-Benchを確立する。
PATH-Benchは、マルチモデルインコンテキスト学習による有向タスク関係を推定し、制御された支援履歴と干渉履歴を持つプローブ中心シーケンスを構築し、平均性能、前方転送、後方転送、忘れ忘れを計測するためのプローブタスクを繰り返し評価する。
正・負の履歴に基づく一ターンコード生成と多ターンツール利用タスクにおける8つの代表エージェントの評価を行った。
ベンチマークの結果は、体験ユーティリティは、体験がどのように表現され、タスクの相互作用構造に依存し、強い移動は保持を保証せず、後続の経験は学習経路の早い段階で得られる利益を再形成できることを示している。
これらの知見に基づいて,経路蓄積経験が新たなタスクにどのように影響するかを制御するエージェントハーネスである選択経験利用(SEU)を提案する。
SEUは、ほとんどの設定でフォワード転送を改善しながら、忘れを継続的に減らします。
PATH-Benchは、より選択的で堅牢なライフロングエージェントを設計するための制御された評価フレームワークと実行可能なガイダンスの両方を提供する。
関連論文リスト
- LifeMem: Enabling Lifelong Experience Reuse for LLM Agents [79.11224209641739]
LifeMemは、エージェントが複数の環境にまたがって知識を伝達できるようにする、生涯学習フレームワークである。
LifeMemは、再利用可能なスキルを抽出するために、基礎となる軌跡に基づく相互作用軌跡を蓄積した。
その結果、LifeMemは生涯学習における効果的な体験再利用を可能にし、学習課題の忘れを減らし、より優れたタスク間移動を実現することができることがわかった。
論文 参考訳(メタデータ) (2026-09-11T10:00:43Z) - S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? [66.17176838165994]
大規模言語モデル(LLM)は、ますます外部環境と相互作用し、かなりの行動経験を蓄積する。
エージェントがその振る舞いを積極的にテストし、得られた経験を判断し、その経験を使って将来の意思決定を改善することができるかどうかは不明だ。
LLM自己改善評価のための対話型ベンチマークである textbfStextsuperscript3Gym を導入する。
論文 参考訳(メタデータ) (2026-08-31T17:05:41Z) - EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning [25.200068256200293]
インタラクショントラジェクトリに埋め込まれた再利用可能な探索パターンは、単一のポリシー更新後に大部分が破棄される。
本研究では,検索した経験を仮訓練時の足場として扱うフレームワークであるEDGE(Experience-Distillation for Guided Exploration)を提案する。
EDGEは強力なRLベースラインを最大12.5ポイント改善し、推論時の足場やプロプライエタリなリフレクタを使わずに有効である。
論文 参考訳(メタデータ) (2026-08-22T13:16:25Z) - PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents [50.9061759859778]
PAST-Benchは、保持されたエクスペリエンスがエージェントを時間とともに実際に改善するかどうかを識別するために設計されたベンチマークである。
遅延タスクのゲインと、そのゲインが意図したセーブ、リトリーブ、更新パスに従うかどうかを報告します。
我々はHermes+を開発し、エージェントループの段階にわたって5つのターゲット的介入でHermesを拡張した。
論文 参考訳(メタデータ) (2026-08-04T17:58:05Z) - From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents [56.187590188698955]
大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
縦断的相互作用履歴から構築した暗黙的行動アライメントのベンチマークであるIBA-Benchを紹介する。
IBA-Agentは、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-08-03T12:52:04Z) - AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents [30.801952443449633]
継続的な学習は、エージェントが一連のタスクに再利用可能な経験を蓄積し、時間とともに改善し、無関係な経験からの干渉を避けることを期待する。
ほとんどの取り組みは、長いコンテキストの会話やドキュメントに対する検索と推論に重点を置いているが、最近の長命適応ベンチマークは、しばしば単純なタスクストリームに依存している。
本稿では、制御されたタスクストリームと転送利得のメトリクスに着目した連続学習エージェントのための評価フレームワークAgentCLを提案する。
論文 参考訳(メタデータ) (2026-06-01T16:32:59Z) - Rethinking Experience Utilization in Self-Evolving Language Model Agents [51.10420305280499]
自己進化剤は過去の相互作用から経験を蓄積し再利用することで改善する。
本稿では,自己進化型エージェントの重要設計次元としての利用経験について考察する。
論文 参考訳(メタデータ) (2026-05-08T02:48:49Z) - Experiential Reflective Learning for Self-Improving LLM Agents [1.1074589887824053]
実験的反射学習(ERL:Experiential Reflective Learning)は,迅速な環境適応を実現するシンプルな自己改善フレームワークである。
ERLはタスクの軌跡と成果を反映して、タスク間で伝達される実行可能なレッスンを生成する。
ERLはReActベースラインよりも成功率を7.8%向上させ、タスク完了の信頼性を大きく向上させる。
論文 参考訳(メタデータ) (2026-03-25T11:43:22Z) - Internalizing Agency from Reflective Experience [20.650609947690196]
LEAFEは、リカバリエージェンシーをリフレクティブエクスペリエンスから内部化するフレームワークである。
ベースモデルよりも一貫してPass@1を改善し、結果駆動ベースラインよりも高いPass@kを実現している。
論文 参考訳(メタデータ) (2026-03-17T17:50:47Z) - How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior [65.70584076918679]
メモリは、大きな言語モデル(LLM)ベースのエージェントにおいて重要なコンポーネントである。
本稿では,メモリ管理の選択がLLMエージェントの行動,特に長期的パフォーマンスに与える影響について検討する。
論文 参考訳(メタデータ) (2025-05-21T22:35:01Z) - CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing [70.25689961697523]
クロスタスク体験の共有と選択によるシーケンシャル推論を強化する一般化可能なアルゴリズムを提案する。
我々の研究は、既存のシーケンシャルな推論パラダイムのギャップを埋め、タスク間体験の活用の有効性を検証する。
論文 参考訳(メタデータ) (2024-10-22T03:59:53Z) - Learning to Sample with Local and Global Contexts in Experience Replay
Buffer [135.94190624087355]
遷移の相対的重要性を計算できる学習に基づく新しいサンプリング手法を提案する。
本研究の枠組みは, 様々な非政治強化学習手法の性能を著しく向上させることができることを示す。
論文 参考訳(メタデータ) (2020-07-14T21:12:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。