論文の概要: PATH-Bench: Path-Dependent Evaluation of Lifelong Agents
- arxiv url: http://arxiv.org/abs/2608.01149v1
- Date: Sun, 02 Aug 2026 11:00:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.104517
- Title: PATH-Bench: Path-Dependent Evaluation of Lifelong Agents
- Title(参考訳): PATH-Bench:パス依存型長寿命剤の評価
- Authors: Xidong Yang, Xingyi Zhang, Wenhao Li, Wenyan Liu, Junjie Sheng, Yun Hua, Wei Yin, Tao Fang, Chuyun Shen, Xiangfeng Wang,
- Abstract要約: PATH-Benchは、生涯エージェントのパス依存評価のためのベンチマークである。
SEU(Selective Experience Use)は,経路蓄積経験が各タスクにどのように影響するかを制御するエージェントハーネスである。
- 参考スコア(独自算出の注目度): 27.837334107109786
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Lifelong LLM agents increasingly adapt through external learning states that store past interactions as retrievable memories or reusable skills, yet existing benchmarks rarely account for how the path of accumulated experience shapes what agents transfer and retain. In this work, we establish PATH-Bench, a benchmark for path-dependent evaluation of lifelong agents. PATH-Bench estimates directed task relationships via multi-model in-context learning, constructs probe-centered sequences with controlled helpful and interfering histories, and repeatedly evaluates probe tasks to measure average performance, forward transfer, backward transfer, and forgetting. We evaluate eight representative agents on single-turn code generation and multi-turn tool-use tasks under positive- and negative-dominant histories. Benchmark results show that experience utility depends jointly on how experience is represented and on the task's interaction structure, that strong transfer does not ensure retention, and that later experience can reshape gains acquired earlier in the learning path. Based on these findings, we propose Selective Experience Use (SEU), an agent harness that regulates how path-accumulated experience influences each new task, admitting helpful items while filtering out potential interference. SEU consistently reduces forgetting while improving forward transfer in the majority of settings. The PATH-Bench provides both a controlled evaluation framework and actionable guidance for designing more selective and robust lifelong agents.
- Abstract(参考訳): 生涯のLLMエージェントは、過去のインタラクションを検索可能な記憶や再利用可能なスキルとして保存する外部学習ステートを通じて適応する傾向にあるが、既存のベンチマークでは、蓄積された経験のパスがエージェントの転送と保持をいかに形作るかはほとんど説明されていない。
本研究では,生涯エージェントの経路依存評価のためのベンチマークであるPATH-Benchを確立する。
PATH-Benchは、マルチモデルインコンテキスト学習による有向タスク関係を推定し、制御された支援履歴と干渉履歴を持つプローブ中心シーケンスを構築し、平均性能、前方転送、後方転送、忘れ忘れを計測するためのプローブタスクを繰り返し評価する。
正・負の履歴に基づく一ターンコード生成と多ターンツール利用タスクにおける8つの代表エージェントの評価を行った。
ベンチマークの結果は、体験ユーティリティは、体験がどのように表現され、タスクの相互作用構造に依存し、強い移動は保持を保証せず、後続の経験は学習経路の早い段階で得られる利益を再形成できることを示している。
これらの知見に基づいて,経路蓄積経験が新たなタスクにどのように影響するかを制御するエージェントハーネスである選択経験利用(SEU)を提案する。
SEUは、ほとんどの設定でフォワード転送を改善しながら、忘れを継続的に減らします。
PATH-Benchは、より選択的で堅牢なライフロングエージェントを設計するための制御された評価フレームワークと実行可能なガイダンスの両方を提供する。
関連論文リスト
- From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents [56.187590188698955]
大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
縦断的相互作用履歴から構築した暗黙的行動アライメントのベンチマークであるIBA-Benchを紹介する。
IBA-Agentは、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-08-03T12:52:04Z) - AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents [30.801952443449633]
継続的な学習は、エージェントが一連のタスクに再利用可能な経験を蓄積し、時間とともに改善し、無関係な経験からの干渉を避けることを期待する。
ほとんどの取り組みは、長いコンテキストの会話やドキュメントに対する検索と推論に重点を置いているが、最近の長命適応ベンチマークは、しばしば単純なタスクストリームに依存している。
本稿では、制御されたタスクストリームと転送利得のメトリクスに着目した連続学習エージェントのための評価フレームワークAgentCLを提案する。
論文 参考訳(メタデータ) (2026-06-01T16:32:59Z) - Rethinking Experience Utilization in Self-Evolving Language Model Agents [51.10420305280499]
自己進化剤は過去の相互作用から経験を蓄積し再利用することで改善する。
本稿では,自己進化型エージェントの重要設計次元としての利用経験について考察する。
論文 参考訳(メタデータ) (2026-05-08T02:48:49Z) - Experiential Reflective Learning for Self-Improving LLM Agents [1.1074589887824053]
実験的反射学習(ERL:Experiential Reflective Learning)は,迅速な環境適応を実現するシンプルな自己改善フレームワークである。
ERLはタスクの軌跡と成果を反映して、タスク間で伝達される実行可能なレッスンを生成する。
ERLはReActベースラインよりも成功率を7.8%向上させ、タスク完了の信頼性を大きく向上させる。
論文 参考訳(メタデータ) (2026-03-25T11:43:22Z) - Internalizing Agency from Reflective Experience [20.650609947690196]
LEAFEは、リカバリエージェンシーをリフレクティブエクスペリエンスから内部化するフレームワークである。
ベースモデルよりも一貫してPass@1を改善し、結果駆動ベースラインよりも高いPass@kを実現している。
論文 参考訳(メタデータ) (2026-03-17T17:50:47Z) - How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior [65.70584076918679]
メモリは、大きな言語モデル(LLM)ベースのエージェントにおいて重要なコンポーネントである。
本稿では,メモリ管理の選択がLLMエージェントの行動,特に長期的パフォーマンスに与える影響について検討する。
論文 参考訳(メタデータ) (2025-05-21T22:35:01Z) - CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing [70.25689961697523]
クロスタスク体験の共有と選択によるシーケンシャル推論を強化する一般化可能なアルゴリズムを提案する。
我々の研究は、既存のシーケンシャルな推論パラダイムのギャップを埋め、タスク間体験の活用の有効性を検証する。
論文 参考訳(メタデータ) (2024-10-22T03:59:53Z) - Learning to Sample with Local and Global Contexts in Experience Replay
Buffer [135.94190624087355]
遷移の相対的重要性を計算できる学習に基づく新しいサンプリング手法を提案する。
本研究の枠組みは, 様々な非政治強化学習手法の性能を著しく向上させることができることを示す。
論文 参考訳(メタデータ) (2020-07-14T21:12:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。