論文の概要: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
- arxiv url: http://arxiv.org/abs/2608.24876v1
- Date: Tue, 25 Aug 2026 17:56:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:35.125528
- Title: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
- Title(参考訳): 長距離エージェントハーネスに対する再帰的経験的記憶進化
- Authors: Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang, Shuicheng Yan, Ling Yang,
- Abstract要約: Recurisは、ロングホライゾンエージェントハーネスのためのExperiential-Working Memoryアーキテクチャである。
Work Memoryはタスクの進捗を追跡し、Experiential Memoryからスキル選択をガイドする。
4つのロングホライズンベンチマークと10のモデルでRecurisは37のモデルベンチマークペアのうち35のタスク成功を改善している。
- 参考スコア(独自算出の注目度): 83.32611586724165
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recursive self-improvement (RSI) remains hard in long-horizon tasks, where growing histories obscure the task state and misalign skill invocation. We introduce Recuris, a recursive Experiential-Working Memory architecture for long-horizon agent harnesses, in which Working Memory tracks task progress and guides skill selection from Experiential Memory, grounding skill use in current needs rather than the full history. This coupling also turns execution into structured evidence that localizes failures to specific memory components. Across tasks, a fixed Meta-Agent turns that evidence into localized, validation-gated updates to Skill Memory that reshape execution and yield new evidence, forming a bounded recursive memory-evolution loop. Across four long-horizon benchmarks and ten models, Recuris improves task success in 35 of the 37 completed model-benchmark pairs, carrying frontier models to SOTA-level task success: on tau-bench it adds +17.8 points to GPT-5.6 Sol and +15.6 to Claude Opus 5, taking Opus 5 to 87.9%, and +16.6/+13.5 points on Qwen3.6-27B/35B on SkillFlow. The advantage widens as the interaction horizon grows, to +32.2 points on the longest tasks, and common long-horizon failures fall by up to 80%. These results position recursively evolving memory as a scalable foundation for RSI, enabling agents to continuously transform accumulated experience into increasingly effective long-horizon behavior. Code: https://github.com/Gen-Verse/Recuris
- Abstract(参考訳): 再帰的自己改善(Recursive self-improvement, RSI)は、長い水平課題において依然として困難であり、そこでは、履歴がタスクの状態や誤ったスキルの実践を曖昧にしている。
作業メモリはタスクの進捗をトラッキングし、経験記憶からスキル選択を誘導し、すべての履歴ではなく現在のニーズにおけるスキル使用の基盤となる。
この結合は、実行を特定のメモリコンポーネントに障害をローカライズする構造化されたエビデンスに変換する。
タスク全体にわたって、固定されたMeta-Agentは、エビデンスをローカライズされたバリデーション付きのSkill Memoryのアップデートに変換して、新たなエビデンスを生成し、バウンダリ再帰的メモリ進化ループを形成する。
ロングホライゾンの4つのベンチマークと10つのモデルにおいて、Recurisは37のモデルベンチマークペアのうち35のタスク成功を改善し、フロンティアモデルをSOTAレベルのタスク成功に導いた: tau-benchでは+17.8ポイントがGPT-5.6ソルに、+15.6ポイントがClaude Opus 5に、+5.9%がOpus 5から87.9%、+16.6/+13.5ポイントがQwen3.6-27B/35Bに追加された。
相互作用の地平線が大きくなるにつれて利点は拡大し、+32.2ポイントは最長のタスクで、一般的な長距離故障は80%まで減少する。
これらの結果は、再帰的に進化するメモリをRSIのスケーラブルな基盤として位置づけ、エージェントは蓄積した経験をより効果的なロングホライゾン行動へと継続的に変換することができる。
コード:https://github.com/Gen-Verse/Recuris
関連論文リスト
- HyperSkill: Self-Evolving LLM Agents via Hypergraph-Structured Skill Memory [3.6156240053949866]
HyperSkillは2つのノードタイプ、サブタスクステップと再利用可能なスキルを備えたハイパーグラフとしてメモリを表現している。
周期的構造インフォームドメンテナンスは、低ユーティリティノードと冗長なマージスキルを品質重み付けの伝搬を通じて実現する。
GPT-4o と Qwen3-30B-A3B で xBench, GAIA, WebWalkerQA にまたがって、HyperSkill は 10 のメモリベースラインを上回り、GAIA では +11.51、WebWalkerQA では +11.18 となる。
論文 参考訳(メタデータ) (2026-08-17T05:10:27Z) - Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation [12.918310076135313]
実世界の操作は、しばしば非マルコフ的であり、ロボットがタスク関連情報を保持し、推論することを要求する。
我々は,コーディングエージェントの推論とメモリ管理機能を活用したハイブリッド学習フレームワークHyMeSを提案する。
RoboMemArenaでは、平均累積成功率を52.5%から66.2%に改善し、平均タスク成功率を41.3%から60.1%に上回り、PrediMemの累積成功率4.5ポイント、タスク成功率14.5ポイントを上回っている。
論文 参考訳(メタデータ) (2026-08-10T10:35:47Z) - AutoMem: Automated Learning of Memory as a Cognitive Skill [63.07128029793901]
記憶の専門知識は学習したスキルであることを示す。
メモリ管理の2つの軸を自動化するフレームワークであるAutoMemを紹介する。
その結果,メモリ管理は独立して学習可能なスキルであることが示唆された。
論文 参考訳(メタデータ) (2026-07-01T17:57:03Z) - OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation [71.57258488733974]
メモリは、自己進化エージェントの標準的な基盤になっているが、その経験を維持することは、それを通して進化する方法を学ぶことと同じではない。
OPD-Evolver(英語版)は、政策上の自己蒸留を通じて、そのようなエージェントを進化させる緩やかな共進化フレームワークである。
論文 参考訳(メタデータ) (2026-06-16T07:33:53Z) - AdMem: Advanced Memory for Task-solving Agents [13.611633561917513]
大規模言語モデル(LLM)はツール使用エージェントとしての約束を示すが、知識の記憶、整理、再利用を必要とする長期的タスクには制限がある。
本稿では,短期記憶と長期記憶を組み合わせた2段階設計において,セマンティック,エピソード,手続き記憶を統合した統合的・自動記憶フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-05T00:11:57Z) - LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues [80.29362825271768]
LongMemEval-V2は、メモリシステムが、カスタマイズされた環境で知識のある同僚になるために必要な経験を得るのに役立つかどうかを評価するためのベンチマークである。
LME-V2には、Webエージェントの5つのコアメモリ能力をカバーする451の質問が含まれている。
AgentRunbook-Rは生の状態観察,イベント,戦略ノートのための知識プールを備えた,効率的なRAGベースのメモリであり,AgentRunbook-Cはトラジェクトリをファイルとして格納し,コードエージェントを起動して,拡張サンドボックスに証拠を収集する。
論文 参考訳(メタデータ) (2026-05-12T17:59:34Z) - Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management [63.48041801851891]
Fine-Memは、きめ細かいフィードバックアライメントのために設計された統一されたフレームワークである。
MemalphaとMemoryAgentBenchの実験は、Fin-Memが強いベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-01-13T11:06:17Z) - Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects [11.300084544174894]
エージェントメモリを推論のための構造化第1級基板として扱うメモリアーキテクチャであるHindsightを提案する。
情報の追加、アクセス、更新の方法を管理する3つのコア操作 – 保持、リコール、リフレクション – をサポートしている。
オープンソースの20Bモデルは、全文ベースラインで全体の精度を39%から83.6%に引き上げる。
論文 参考訳(メタデータ) (2025-12-14T19:47:23Z) - MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation [59.31354761628506]
このようなタスクは本質的にマルコフ的ではないが、主流のVLAモデルはそれを見落としているため、ロボット操作には時間的コンテキストが不可欠である。
本稿では,長距離ロボット操作のためのコグニション・メモリ・アクション・フレームワークであるMemoryVLAを提案する。
本稿では,3つのロボットを対象とした150以上のシミュレーションと実世界のタスクについて評価する。
論文 参考訳(メタデータ) (2025-08-26T17:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。