論文の概要: Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination
- arxiv url: http://arxiv.org/abs/2608.01234v1
- Date: Sun, 02 Aug 2026 13:39:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.128923
- Title: Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination
- Title(参考訳): 適応メモリパラメータ座標を用いたLLM自己進化における記憶と内部化の学習
- Authors: Tianyun Ji, Zhenya Huang, Jiayu Liu, Zirui Liu, Yu Su, Hongbin Pei,
- Abstract要約: 我々は,統合エージェントの自己進化フレームワークであるCOVEを紹介する。
これは、タスク対応ルーティング、ステージ対応スケジューリング、知識最適化を通じて、ハーネスベースとパラメータベースの学習を組み合わせる。
COVEは単一チャネルの進化戦略より優れており、環境の変化によるより堅牢で効率的な改善を実証している。
- 参考スコア(独自算出の注目度): 40.98046592234726
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model agents increasingly operate in dynamic environments where tool interfaces, APIs, and user requirements change after deployment. Existing self-evolution methods mainly follow two paradigms: harness-based approaches, which externalize feedback into editable memories or skills for rapid adaptation, and parameter-based approaches, which internalize experience into model parameters for deeper capability improvement. However, using either mechanism alone creates a trade-off between flexibility and performance. This paper asks how an agent can coordinate both channels to achieve robust self-evolution. We present COVE, a unified agent self-evolution framework that combines harness-based and parameter-based learning through task-aware routing, stage-aware scheduling, and knowledge optimization. Through this design, COVE treats self-evolution not as indiscriminate accumulation of experience, but as a coordinated process that matches tasks and knowledge types to appropriate learning mechanisms. Experiments across multiple task categories show that COVE outperforms single-channel evolution strategies, demonstrating more robust and efficient improvement under changing environments.
- Abstract(参考訳): 大規模言語モデルエージェントは、ツールインターフェース、API、ユーザ要求がデプロイ後に変化する動的な環境でますます機能します。
既存の自己進化手法は主に、2つのパラダイムに従う: フィードバックを編集可能な記憶や素早い適応のためのスキルに外部化するハーネスベースのアプローチと、より深い能力向上のために経験をモデルパラメータに内部化するパラメータベースのアプローチである。
しかしながら、どちらのメカニズムも使うだけで、柔軟性とパフォーマンスのトレードオフが生じます。
本稿では,エージェントが両方のチャネルをコーディネートして,堅牢な自己進化を実現する方法について尋ねる。
我々は,タスクアウェアルーティング,ステージアウェアスケジューリング,知識最適化を通じて,ハーネスベースとパラメータベースの学習を組み合わせた統合エージェント自己進化フレームワークCOVEを提案する。
この設計を通じて、COVEは自己進化を経験の無差別な蓄積ではなく、タスクや知識タイプを適切な学習メカニズムにマッチさせる協調プロセスとして扱う。
複数のタスクカテゴリにわたる実験により、COVEは単一チャネルの進化戦略より優れており、環境の変化によるより堅牢で効率的な改善が示されている。
関連論文リスト
- Self-Improving Large Language Models via Progressive Experience Evolution [52.03479747358687]
textbfSPEE(textbfSelf-textbfProgressive textbfExperience textbfEvolution)を提案する。
5つの数学的推論ベンチマークの実験は、SPEEが3つのモデルスケールでテスト時間とトレーニング時間の両方の自己進化ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-08-03T12:27:32Z) - Differentiable Mixture-of-Agents Incentivizes Swarm Intelligence of Large Language Models [17.7409616106227]
Differentiable Mixture-of-Agents (DMoA) は、推論中に弾性および適応的なエージェントの協調を可能にする自己進化型マルチエージェントフレームワークである。
DMoAは, 高い効率, 堅牢性, アンサンブル性を示しながら, 最先端性能を実現していることを示す。
論文 参考訳(メタデータ) (2026-05-15T07:54:46Z) - Heterogeneous Multi-Agent Reinforcement Learning with Attention for Cooperative and Scalable Feature Transformation [21.732611237889326]
特徴変換は、数学的特徴交差を通じて情報的特徴を生成することにより、下流タスク性能を向上させる。
近年の研究では、より効果的な試行錯誤方法を通じて、従来のアプローチを強化するために強化学習を採用している。
協調的かつスケーラブルな特徴変換を実現するために,新しい異種マルチエージェントRLフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-26T21:45:38Z) - A Survey of Self-Evolving Agents: On Path to Artificial Super Intelligence [87.08051686357206]
大きな言語モデル(LLM)は強力な能力を示しているが、基本的に静的である。
LLMはますますオープンでインタラクティブな環境にデプロイされているため、この静的な性質は重要なボトルネックとなっている。
この調査は、自己進化エージェントの体系的で包括的なレビューを初めて提供する。
論文 参考訳(メタデータ) (2025-07-28T17:59:05Z) - Automation and Feature Selection Enhancement with Reinforcement Learning (RL) [0.0]
決定木と統合された強化学習は、特徴知識、状態表現、選択効率を向上させる。
モンテカルロをベースとした単エージェント特徴選択法である強化特徴選択(MCRFS)は計算負担を軽減する。
機能とインスタンスをまとめて選択し、それら間のインタラクションをキャプチャする、デュアルエージェントのRLフレームワークも導入された。
論文 参考訳(メタデータ) (2025-03-15T04:30:55Z) - Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent
Self-Evolution [92.84441068115517]
Investigate-Consolidate-Exploit(ICE)は、AIエージェントの適応性と柔軟性を高めるための新しい戦略である。
ICEは、真の自己進化のためのタスク間の知識の伝達を促進する。
XAgentフレームワークに関する我々の実験は、ICEの有効性を示し、API呼び出しを最大80%削減する。
論文 参考訳(メタデータ) (2024-01-25T07:47:49Z) - Meta-Reinforcement Learning for Adaptive Control of Second Order Systems [3.131740922192114]
プロセス制御では、多くのシステムは類似しており、よく理解されているダイナミクスを持ち、メタ学習を通じて一般化可能なコントローラを作成することは可能であることを示唆している。
本稿では,メタ強化学習(meta-RL)制御戦略を定式化し,モデル構造などのトレーニングにおいて,既知のオフライン情報を活用する。
重要な設計要素は、トレーニング中にモデルベースの情報をオフラインで利用し、新しい環境と対話するためのモデルフリーのポリシー構造を維持することである。
論文 参考訳(メタデータ) (2022-09-19T18:51:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。