論文の概要: DAEDALUS: Bootstrapping Agent Memory from Self-Generated Tasks
- arxiv url: http://arxiv.org/abs/2610.08048v1
- Date: Tue, 06 Oct 2026 09:46:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.920843
- Title: DAEDALUS: Bootstrapping Agent Memory from Self-Generated Tasks
- Title(参考訳): DAEDALUS: 自己生成タスクからのブートストラップエージェントメモリ
- Abstract要約: エージェントシステムは典型的には人間によるガイドラインや、訓練タスクとオラクル検証器から構築された手続き記憶に依存している。
本稿では,既存のタスクやオラクル検証を使わずに,自己生成から再利用可能なエージェントメモリをブートストラップする方法であるDAEDALUSを提案する。
AppWorld, $2$-bench, AutomationBench, DAEDALUSは平均成功率を15.9ポイント、パス5を2.2倍改善する。
- 参考スコア(独自算出の注目度): 1.0621485365427565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents often lack the operational knowledge to act reliably in new environments, as they must discover specific tool behaviors or environment conventions on their own. Without memory of past attempts, they repeat the same mistakes across tasks, leading to more task failures and longer trajectories. To address this, agentic systems typically rely on human-written guidelines or on procedural memory built from training tasks and an oracle verifier, both of which require prior knowledge of the environment. We present DAEDALUS, a method for bootstrapping reusable agent memory from self-generated practice without existing tasks or oracle verifiers. DAEDALUS pairs two agents: an explorer that interacts with the environment to generate challenging yet solvable tasks, and a solver that attempts them. A heuristic is derived from each solver failure and accepted only after the solver repeatedly succeeds with that heuristic in context. These outcomes also provide feedback for the explorer to refine the difficulty of future tasks. Accepted heuristics are then consolidated into a memory bank for test-time use. Across AppWorld, $τ^2$-bench, and AutomationBench, DAEDALUS improves mean success rates by up to 15.9 points and pass^5 by up to 2.2x over a no-memory baseline, and is competitive with methods using training tasks, at a lower inference cost than most. We show that performance gains already emerge with a small exploration budget, and that its heuristics also benefit agents from other model families. Our ablations further reveal that solver traces provide the key information needed to derive effective heuristics, while factorizing early discoveries makes exploration more cost-efficient. Beyond memory construction, we find that the tasks generated by DAEDALUS can serve as a proxy for benchmark tasks when ranking models by performance. Code and artifacts: www.github.com/illuin-tech/daedalus.
- Abstract(参考訳): LLMエージェントは、特定のツールの動作や環境慣行を自分自身で発見する必要があるため、新しい環境で確実に行動するための運用知識を欠いていることが多い。
過去の試行の記憶がなければ、彼らはタスク間で同じ間違いを繰り返し、より多くのタスク失敗と長い軌道に繋がる。
これを解決するために、エージェントシステムは典型的には、人間の手書きのガイドラインや、訓練タスクとオラクル検証器から構築された手続き記憶に依存し、どちらも環境の事前の知識を必要とする。
本稿では,既存のタスクやオラクル検証を使わずに,自己生成から再利用可能なエージェントメモリをブートストラップする方法であるDAEDALUSを提案する。
DAEDALUSは2つのエージェントをペアにしている。環境と対話して、難しいが解決可能なタスクを生成するエクスプローラーと、それらを試みる解決器だ。
ヒューリスティックは各解法失敗から派生し、解法がそのヒューリスティックな文脈で何度も成功した後にのみ受け入れられる。
これらの結果はまた、探検家が将来の課題の難しさを洗練させるためのフィードバックを提供する。
承認されたヒューリスティックは、テストタイム使用のためにメモリバンクに統合される。
AppWorld全体では、$τ^2$-bench、AutomanceBench、DAEDALUSは平均成功率を15.9ポイントまで改善し、メモリなしベースラインで2.2倍までパスする。
調査予算が小さければ、すでにパフォーマンス向上が実現しており、そのヒューリスティックスは、他のモデルファミリーのエージェントにとっても有益であることを示す。
我々の主張は、解法トレースが効果的なヒューリスティックスを導き出すのに必要な重要な情報を提供する一方で、初期の発見を分解することで、探索がよりコスト効率の良いものになることをさらに明らかにしている。
メモリ構成以外にも、DAEDALUSが生成したタスクは、パフォーマンスによるモデルランキングの際のベンチマークタスクのプロキシとして機能する。
コードとアーティファクト:www.github.com/illuin-tech/daedalus
関連論文リスト
- DrugSAGE:Self-evolving Agent Experience for Efficient State-of-the-Art Drug Discovery [26.594635128999283]
LLMをベースとしたエージェントは、広範囲な試行錯誤によってSOTAソリューションを見つけることができるが、その過程で蓄積された経験は残っていない。
我々は,SOTA薬物発見モデルを効率的に構築するために,タスク間で経験を蓄積し再利用する手法を提案する。
論文 参考訳(メタデータ) (2026-05-14T22:49:42Z) - OSExpert: Computer-Use Agents Learning Professional Skills via Exploration [55.660669638732024]
汎用コンピュータ利用エージェントは、人間の専門家ほど役に立たない。
本研究では,環境の単位関数を探索し,検証するための深度優先探索アルゴリズムを提案する。
エージェントは、合成タスクのカリキュラムを自己構築するために、ユニットスキル間の構成性を利用する。
論文 参考訳(メタデータ) (2026-03-09T05:27:56Z) - ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory [57.517214479414726]
ReasoningBankは、エージェントの自己判断の成功と失敗の経験から一般化可能な推論戦略を抽出するメモリフレームワークである。
テスト時には、エージェントがReasoningBankから関連する記憶を取得してそのインタラクションを知らせ、新しい学習を統合することで、時間が経つにつれてより有能になる。
本稿では,エージェントのインタラクションエクスペリエンスをスケールアップすることにより,学習プロセスの高速化と多様化を図るメモリ対応テストタイムスケーリング(MaTTS)を提案する。
論文 参考訳(メタデータ) (2025-09-29T17:51:03Z) - Shell or Nothing: Real-World Benchmarks and Memory-Activated Agents for Automated Penetration Testing [23.554239007767276]
本稿では,世界初の実世界のエージェント指向ペンテストベンチマークTermiBenchを紹介する。
本稿では,多エージェント浸透試験フレームワークTermiAgentを提案する。
評価において,本研究は最先端のエージェントより優れ,より強力な浸透試験能力を示す。
論文 参考訳(メタデータ) (2025-09-11T07:30:44Z) - Towards Robust Continual Learning with Bayesian Adaptive Moment Regularization [51.34904967046097]
継続的な学習は、モデルが以前に学習した情報を忘れてしまう破滅的な忘れ込みの課題を克服しようとする。
本稿では,パラメータ成長の制約を緩和し,破滅的な忘れを減らし,新しい事前手法を提案する。
以上の結果から, BAdamは, 単頭クラスインクリメンタル実験に挑戦する先行手法に対して, 最先端の性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2023-09-15T17:10:51Z) - Planning to Explore via Self-Supervised World Models [120.31359262226758]
Plan2Exploreは自己監督型強化学習エージェントである。
我々は、自己監督型探索と、新しいタスクへの迅速な適応に対する新しいアプローチを提案する。
Plan2Exploreは、訓練の監督やタスク固有の相互作用がなければ、自己監督型の探査方法よりも優れている。
論文 参考訳(メタデータ) (2020-05-12T17:59:45Z) - Meta Reinforcement Learning with Autonomous Inference of Subtask
Dependencies [57.27944046925876]
本稿では,タスクがサブタスクグラフによって特徴づけられるような,新しい数発のRL問題を提案し,対処する。
メタ政治を直接学習する代わりに、Subtask Graph Inferenceを使ったメタラーナーを開発した。
実験の結果,2つのグリッドワールド領域とStarCraft II環境において,提案手法が潜在タスクパラメータを正確に推定できることが確認された。
論文 参考訳(メタデータ) (2020-01-01T17:34:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。