論文の概要: AutoRefine: From Trajectories to Reusable Expertise for Continual LLM Agent Refinement
- arxiv url: http://arxiv.org/abs/2601.22758v1
- Date: Fri, 30 Jan 2026 09:33:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-02 18:28:15.354342
- Title: AutoRefine: From Trajectories to Reusable Expertise for Continual LLM Agent Refinement
- Title(参考訳): AutoRefine: LLMエージェントのリファインメントの軌道から再利用可能なエキスパートまで
- Abstract要約: 大規模な言語モデルエージェントは経験から知識を蓄積できず、個々のタスクを独立した課題として扱うことが多い。
最近の手法は、複雑なサブタスクの手続き論理をキャプチャできないフラットなテキスト知識としての経験を抽出する。
エージェント実行履歴からデュアルフォームエクスペリエンスパターンを抽出し,維持するフレームワークであるAutoRefineを紹介する。
- 参考スコア(独自算出の注目度): 6.035482612006565
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model agents often fail to accumulate knowledge from experience, treating each task as an independent challenge. Recent methods extract experience as flattened textual knowledge, which cannot capture procedural logic of complex subtasks. They also lack maintenance mechanisms, causing repository degradation as experience accumulates. We introduce AutoRefine, a framework that extracts and maintains dual-form Experience Patterns from agent execution histories. For procedural subtasks, we extract specialized subagents with independent reasoning and memory. For static knowledge, we extract skill patterns as guidelines or code snippets. A continuous maintenance mechanism scores, prunes, and merges patterns to prevent repository degradation. Evaluated on ALFWorld, ScienceWorld, and TravelPlanner, AutoRefine achieves 98.4%, 70.4%, and 27.1% respectively, with 20-73% step reductions. On TravelPlanner, automatic extraction exceeds manually designed systems (27.1% vs 12.1%), demonstrating its ability to capture procedural coordination.
- Abstract(参考訳): 大規模な言語モデルエージェントは経験から知識を蓄積できず、個々のタスクを独立した課題として扱うことが多い。
最近の手法は、複雑なサブタスクの手続き論理をキャプチャできないフラットなテキスト知識としての経験を抽出する。
また、メンテナンスメカニズムが欠如しており、経験が蓄積されるにつれてリポジトリの劣化を引き起こす。
エージェント実行履歴からデュアルフォームエクスペリエンスパターンを抽出し,維持するフレームワークであるAutoRefineを紹介する。
プロシージャサブタスクでは,個別の推論と記憶を持つ特別なサブエージェントを抽出する。
静的な知識を得るためには、ガイドラインやコードスニペットとしてスキルパターンを抽出する。
継続的メンテナンスメカニズムは、レポジトリの劣化を防ぐために、スコア、プルーネ、マージする。
ALFWorld、ScienceWorld、TravelPlannerで評価され、AutoRefineはそれぞれ98.4%、70.4%、27.1%を獲得し、20-73%のステップダウンを達成した。
トラベルプランナーでは、自動抽出は手作業で設計されたシステム(27.1%対12.1%)を超え、手続き的な調整を捉える能力を示している。
関連論文リスト
- Reusing Past Repairs Through Hierarchical Trajectory Abstraction for Coding Agents [7.524721345903026]
歴史的修復軌道を階層的で再利用可能な計画に変換するフレームワークSTAIRを紹介する。
新しいイシューが到着すると、STAIRは関連するプランノードを複数の抽象化レベルから選択し、実行可能でイシュー固有のプランに調整し、プロンプトを通じてエージェントに供給する。
SWE-bench Verifiedでは、Lingxiと統合されたSTAIRがMiniMax M2.5で81.2%、GPT-5で79.2%に達した。
論文 参考訳(メタデータ) (2026-07-31T17:38:48Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems [18.833806809109536]
エージェントシステムは、バグ修正などのソフトウェアエンジニアリングジョブを自動化するために広く研究されている。
既存の自動故障診断アプローチはタスク実行軌跡を活用するが、その効果は軌道長と複雑性の増加とともに低下する。
リポジトリレベルのコーディングタスクには、冗長なプログラム構造や冗長なコードコンテキストなど、トラジェクトリにはノイズが伴っている。
我々は,リポジトリレベルのコーディングトラジェクトリのための最初の障害診断フレームワークであるTrajAuditを提案する。
論文 参考訳(メタデータ) (2026-05-26T05:24:37Z) - Steve-Evolving: Open-World Embodied Self-Evolution via Fine-Grained Diagnosis and Dual-Track Knowledge Distillation [8.148658798211313]
閉ループ内における2トラックの知識蒸留と微粒な実行診断を密結合した非パラメトリック自己進化フレームワークを提案する。
このメソッドは、エクスペリエンスアンコリング、エクスペリエンス蒸留、ナレッジ駆動クローズドループという3つのフェーズに従っている。
Minecraft MCUの長距離スイートの実験では、静的検索に対する一貫した軌道が示されている。
論文 参考訳(メタデータ) (2026-03-13T16:23:34Z) - Trajectory-Informed Memory Generation for Self-Improving Agent Systems [4.933717407152962]
LLMを使用したエージェントは、実行経験から学び、将来のパフォーマンスを改善するという、永続的な課題に直面します。
本稿ではエージェント実行軌跡から実行可能な学習を自動的に抽出する新しいフレームワークを提案する。
本フレームワークは,実行パターンを理解し,前向きな構造化学習を抽出し,特定のタスクコンテキストに合わせたガイダンスを検索する。
論文 参考訳(メタデータ) (2026-03-11T09:54:09Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning [83.98129545309277]
生経験と政策改善のギャップを埋めるフレームワークであるSkillRLを提案する。
本手法では,階層型スキルライブラリであるSkillBankを構築するために,経験に基づく蒸留機構を導入する。
ALF、WebShop、および7つの検索強化タスクの実験結果は、SkillRLが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-09T03:17:17Z) - A Benchmark for Procedural Memory Retrieval in Language Agents [0.023227405857540805]
現在のAIエージェントは、慣れ親しんだ設定で優れていますが、目に見えないProcで新しいタスクに直面したとき、急激に失敗します。
タスク実行から手続き的メモリ検索を分離する最初のベンチマークを示す。
埋め込み型手法は、慣れ親しんだ文脈で強く機能するが、新規な手法では著しく劣化する。
論文 参考訳(メタデータ) (2025-11-21T08:08:53Z) - Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement [61.35824395228412]
大規模言語モデル(LLM)ベースのエージェントは、ソフトウェア工学のタスクに取り組むためにますます使われています。
エージェントが自身のタスク実行から学習することを可能にするフレームワークであるSAGE(Self-Abstraction from Grounded Experience)を提案する。
論文 参考訳(メタデータ) (2025-11-08T08:49:38Z) - Compressing Multi-Task Model for Autonomous Driving via Pruning and Knowledge Distillation [23.08627330312648]
本稿では,タスク認識型安全なプルーニングと特徴レベルの知識蒸留を組み合わせたマルチタスクモデル圧縮フレームワークを提案する。
BDD100Kデータセットの実験では、圧縮されたモデルがパラメータの32.7%の削減を実現している。
圧縮されたモデルは、リアルタイムに32.7 FPSで動作する。
論文 参考訳(メタデータ) (2025-11-03T18:43:15Z) - Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search [70.63903518295785]
モンテカルロ木探索によるエージェント強化学習フレームワークRepoSearch-R1を紹介する。
RepoSearch-R1に基づいて,リポジトリ質問応答タスク用に設計されたRepoQA-Agentを構築する。
論文 参考訳(メタデータ) (2025-10-30T09:10:36Z) - AgentFold: Long-Horizon Web Agents with Proactive Context Management [98.54523771369018]
LLM ベースの Web エージェントは情報検索を大いに約束するが,その有効性はコンテキスト管理における基本的なトレードオフによって妨げられる。
本稿では,プロアクティブなコンテキスト管理を中心としたエージェントパラダイムであるAgentFoldを紹介する。
単純な微調整により,BrowseCompでは36.2%,BrowseComp-ZHでは47.3%を達成した。
論文 参考訳(メタデータ) (2025-10-28T17:51:50Z) - Fine-tuning with RAG for Improving LLM Learning of New Skills [8.825427873545063]
大規模言語モデル(LLM)エージェントは予測可能な方法で頻繁に失敗する。
本稿では,推論時間検索を蒸留による学習能力に変換する単純なパイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-01T19:03:48Z) - Memp: Exploring Agent Procedural Memory [72.41472703974935]
LLM(Large Language Models)ベースのエージェントは様々なタスクをこなすが、静的パラメータで手動で設計または絡み合うような不安定なプロシージャメモリに悩まされる。
本稿では,過去のエージェントの軌跡をステップバイステップの細粒度と高レベルなスクリプトライクな抽象化の両方に蒸留するMempを提案する。
メモリレポジトリが洗練されるにつれて、エージェントは着実に高い成功率と類似タスクの効率を達成できることを示す。
論文 参考訳(メタデータ) (2025-08-08T16:20:56Z) - ReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM Agent [50.508669199496474]
外部知識に基づいて推論と行動を行うReAct-style LLMエージェントを開発した。
エージェントをReSTライクな手法で改良し,従来の軌道上で反復的に訓練する。
引き起こされた大きなモデルから始まり、アルゴリズムのたった2イテレーションの後に、微調整された小さなモデルを生成することができる。
論文 参考訳(メタデータ) (2023-12-15T18:20:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。