論文の概要: Dynamic Dual-Granularity Skill Bank for Agentic RL
- arxiv url: http://arxiv.org/abs/2603.28716v1
- Date: Mon, 30 Mar 2026 17:32:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.540522
- Title: Dynamic Dual-Granularity Skill Bank for Agentic RL
- Title(参考訳): エージェントRL用動的デュアルグラニュラリティスキルバンク
- Abstract要約: D2Skillはエージェント強化学習のための動的二重粒度スキルバンクである。
再利用可能な経験をタスクスキルに整理し、高いレベルのガイダンスとステップスキルを使って、きめ細かい意思決定支援とエラー修正を行う。
- 参考スコア(独自算出の注目度): 34.161117844675324
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Agentic reinforcement learning (RL) can benefit substantially from reusable experience, yet existing skill-based methods mainly extract trajectory-level guidance and often lack principled mechanisms for maintaining an evolving skill memory. We propose D2Skill, a dynamic dual-granularity skill bank for agentic RL that organizes reusable experience into task skills for high-level guidance and step skills for fine-grained decision support and error correction. D2Skill jointly trains the policy and skill bank through paired baseline and skill-injected rollouts under the same policy, using their performance gap to derive hindsight utility signals for both skill updating and policy optimization. Built entirely from training-time experience, the skill bank is continuously expanded through reflection and maintained with utility-aware retrieval and pruning. Experiments on ALFWorld and WebShop with Qwen2.5-7B-Instruct and Qwen3-4B-Instruct-2507 show that D2Skill consistently improves success rates over skill-free baselines by 10-20 points. Further ablations and analyses show that both dual-granularity skill modeling and dynamic skill maintenance are critical to these gains, while the learned skills exhibit higher utility, transfer across evaluation settings, and introduce only modest training overhead.
- Abstract(参考訳): エージェント強化学習(RL)は、再利用可能な経験からかなりの恩恵を受けるが、既存のスキルベース手法は主に軌道レベルのガイダンスを抽出し、しばしば進化するスキルメモリを維持するための原則的なメカニズムを欠いている。
本稿では,エージェントRLのための動的二重粒度スキルバンクであるD2Skillを提案する。
D2Skillは、同じ方針の下で2つのベースラインとスキル注入されたロールアウトを通じて、ポリシーとスキルバンクを共同で訓練する。
スキルバンクはリフレクションを通じて継続的に拡張され、ユーティリティ対応の検索とプルーニングによって維持される。
ALFWorldとWebShopのQwen2.5-7B-InstructとQwen3-4B-Instruct-2507による実験では、D2Skillはスキルのないベースラインよりも10~20ポイントの成功率を一貫して改善している。
さらに、二重粒度スキルモデリングと動的スキルメンテナンスの両方がこれらの向上に不可欠である一方で、学習スキルは高い実用性を示し、評価設定をまたいで転送し、適度なトレーニングオーバーヘッドのみを導入している。
関連論文リスト
- SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents [17.565432600589414]
大規模言語モデル(LLM)エージェントは、複雑な意思決定タスクのために強化学習(RL)を用いて訓練される。
SkillRLのような最近のスキルベースのアプローチは、生の軌跡からスキルを抽出することでこの問題に対処しようとしている。
SkillForgeは、環境相互作用を通じてスキルの検証と洗練を可能にする継続的スキル進化のためのフレームワークである。
論文 参考訳(メタデータ) (2026-08-25T15:52:10Z) - Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents [11.967142343676171]
自己蒸留と強化学習を組み合わせたBCSD(Bi Context Self-Distillation)を提案する。
ALFWorldとWebShopの実験では、BCSDがモデルスケール全体で最高の全体的なパフォーマンスを達成している。
論文 参考訳(メタデータ) (2026-08-10T12:53:06Z) - Co-Evolving Skill Generation and Policy Optimization [35.41582114275514]
既存の手法は通常、強力な言語モデルを使用してトラジェクトリを分析し、スキルを生成し、オンライントレーニング中に検索可能なスキルバンクを更新します。
プレストレージスキル検証のためのオンライン強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-07T17:55:55Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - Skill is Not One-Size-Fits-All: Model-Aware Skill Alignment for LLM Agents [9.144810798419975]
LLMエージェントは、長期の対話的タスクのパフォーマンスを向上させるために、意思決定時に取得した外部キュレートされたスキル・プロデューラルな指示を徐々に取り出す。
エージェントの重みを変更することなく、各ターゲットのバックボーンにスキルを適応させるフレームワークであるMASA Model-Aware Skill Alignmentを提案する。
MASAは、最強のベースラインで最大25.8ポイントを獲得して、常に最高の総合成績を収めている。
論文 参考訳(メタデータ) (2026-05-29T01:34:42Z) - SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment [4.336665585098371]
本稿では,このコントラストを内部化のための直接学習信号に変換するContrastive Skill Credit Assignment (CSCA) に基づくフレームワークであるSkillCを提案する。
textscSkillCは、同じポリシー更新内でアクティブなスキルタイプからのタスクに対して、ペア化されたスキル注入とスキルフリーのロールアウトをサンプリングする。
スムーズな検証レベル信号は、帰属強度、ロールアウトアロケーション、単調なアクティブセットプルーニングよりも適応的なカリキュラムを駆動する。
論文 参考訳(メタデータ) (2026-05-27T03:21:19Z) - Skill-R1: Agent Skill Evolution via Reinforcement Learning [84.35984979949502]
Skill-R1は、検証可能な報酬からインスタンスレベルの繰り返しスキル最適化のための強化学習フレームワークである。
オープンソースモデルとクローズドソースモデルの両方とのブラックボックス互換性を維持しつつ、モデルレベルの更新よりも大幅に安価に適応できる。
論文 参考訳(メタデータ) (2026-05-10T06:19:15Z) - SkillGen: Verified Inference-Time Agent Skill Synthesis [60.927977774369516]
SkillGenは、ベースエージェントによって生成されたトラジェクトリから単一の監査可能なスキルを合成するフレームワークである。
再利用可能な成功パターン、繰り返し発生する障害モード、そして近くの成功に現れるが失敗に欠ける行動を特定する。
SkillGenの重要な特徴は、エージェントスキルを、全体的なパフォーマンスに対するスキルのネット効果を実証的に検証するための介入としてモデル化することです。
論文 参考訳(メタデータ) (2026-05-09T19:24:11Z) - SkillOS: Learning Skill Curation for Self-Evolving Agents [67.94374107466957]
本稿では,自己進化エージェントのスキルキュレーションを学習するための,経験駆動型RLトレーニングレシピであるSkillOSを提案する。
SkillOSは、凍結したエージェントエグゼキュータとトレーニング可能なスキルキュレーターを組み合わせて、蓄積したエクスペリエンスから外部SkillRepoを更新する。
SkillOSは、メモリフリーと強力なメモリベースラインを、有効性と効率の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-07T17:31:50Z) - XSkill: Continual Learning from Experience and Skills in Multimodal Agents [26.64381741359544]
XSkillはマルチモーダルエージェントの経験とスキルから継続的に学習するためのデュアルストリームフレームワークである。
XSkillは、視覚観察における知識抽出と検索の両方の基礎となる。
XSkillは、ツールのみのベースラインと学習ベースのベースラインの両方を一貫して、実質的に上回っている。
論文 参考訳(メタデータ) (2026-03-12T15:25:57Z) - SkillOrchestra: Learning to Route Agents via Skill Transfer [65.50924963973286]
スキルを意識したオーケストレーションのためのフレームワークであるSkillOrchestraを紹介します。
SkillOrchestraは、実行経験からきめ細かいスキルを学び、それらのスキルの下でエージェント固有の能力とコストをモデル化する。
デプロイメントでは、オーケストレータが現在のインタラクションのスキル要件を推測し、明示的なパフォーマンスコストトレードオフの下でそれらを最も満足するエージェントを選択する。
論文 参考訳(メタデータ) (2026-02-23T10:17:25Z) - SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning [83.98129545309277]
生経験と政策改善のギャップを埋めるフレームワークであるSkillRLを提案する。
本手法では,階層型スキルライブラリであるSkillBankを構築するために,経験に基づく蒸留機構を導入する。
ALF、WebShop、および7つの検索強化タスクの実験結果は、SkillRLが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-09T03:17:17Z) - Skill-Enhanced Reinforcement Learning Acceleration from Heterogeneous Demonstrations [23.628360655654507]
実証から学ぶ(LfD)は強化学習(RL)において確立された問題である
本稿では,Skill-enhanced Reinforcement Learning Acceleration (SeRLA)と呼ばれる新しい2段階の手法を提案する。
論文 参考訳(メタデータ) (2024-12-09T04:58:14Z) - Skill-Based Reinforcement Learning with Intrinsic Reward Matching [77.34726150561087]
Intrinsic Reward Matching (IRM) を提案する。
IRMにより、従来のスキル選択方法よりもはるかに効果的に事前訓練されたスキルを活用できる。
論文 参考訳(メタデータ) (2022-10-14T00:04:49Z) - Hierarchical Kickstarting for Skill Transfer in Reinforcement Learning [27.69559938165733]
実践とホーミングのスキルは、人間の学習の基本的な要素だが、人工エージェントは、それらを実行するために特別に訓練されることはめったにない。
複雑な環境下での強化学習(RL)エージェントの訓練に、どのようにスキルを組み込むことができるかを検討する。
本実験により, 複雑な問題に対するエージェントの性能向上に寄与することが示唆された。
論文 参考訳(メタデータ) (2022-07-23T19:23:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。