論文の概要: SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution
- arxiv url: http://arxiv.org/abs/2607.26784v1
- Date: Wed, 29 Jul 2026 11:26:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.651649
- Title: SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution
- Title(参考訳): SkillRise: クロスタスクスキル進化のためのエージェント強化学習
- Abstract要約: 大規模な言語モデルエージェントは、しばしば再利用可能なソリューションパターンを共有する、関連するが独立したタスクに遭遇する。
タスク間のスキル学習のための統合強化学習フレームワークであるSkillRiseを紹介する。
- 参考スコア(独自算出の注目度): 39.74364990208475
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model agents often encounter related yet distinct tasks that share reusable solution patterns. Yet standard agentic reinforcement learning treats tasks as independent episodes, while existing approaches to skill learning either focus on repeated attempts of one task or use pipelines with multiple stages that entangle extraction, retrieval, and execution. We introduce SkillRise, a unified reinforcement learning framework for learning skills across tasks. SkillRise organizes related instances into progressively challenging sequences and uses a single policy to alternate between task solving and curating an evolving skill document passed directly to the next task. Decoupled credit assignment across tasks supervises solving with the current task outcome and curation with discounted downstream outcomes. Experiments on ALFWorld, WebShop, and ScienceWorld show that SkillRise achieves the strongest Pass@1 performance among the compared methods, with gains over the strongest baseline ranging from 2.3 to 8.5 percentage points. Although trained across distinct tasks, its learned curation policy remains effective for repeated attempts on the same task. Further analysis reveals scaling at test time across tasks: performance improves with longer sequences of related tasks even when each task is attempted only once. This trend suggests that SkillRise reuses transferable skills across tasks rather than benefiting from repeated sampling of the same task. SkillRise further retains strong performance while substantially reducing the runtime overhead of skill learning pipelines with multiple stages. Together, these results provide a simple and efficient training paradigm for LLM agents to extract, refine, and reuse transferable skills across tasks.
- Abstract(参考訳): 大規模な言語モデルエージェントは、しばしば再利用可能なソリューションパターンを共有する、関連するが独立したタスクに遭遇する。
しかし、標準的なエージェント強化学習はタスクを独立したエピソードとして扱う一方で、スキル学習への既存のアプローチは、1つのタスクの繰り返しの試みに焦点を当てるか、抽出、検索、実行を絡める複数のステージを持つパイプラインを使用する。
タスク間のスキル学習のための統合強化学習フレームワークであるSkillRiseを紹介する。
SkillRiseは、関連するインスタンスを徐々に困難なシーケンスに整理し、ひとつのポリシーを使用して、タスクの解決と、次のタスクに直接渡される進化するスキルドキュメントの計算を交互に行う。
タスク間でのクレジット割り当ての分離は、現在のタスク結果の解決と、ダウンストリーム結果の割引によるキュレーションを監督する。
ALFWorld、WebShop、ScienceWorldの実験では、SkillRiseは比較手法の中で最強のPass@1パフォーマンスを達成しており、最強のベースラインは2.3から8.5ポイントである。
異なるタスクにまたがって訓練されるが、学習されたキュレーションポリシーは、同じタスクを繰り返す試みに有効である。
パフォーマンスは、各タスクが一度だけ試みられたとしても、関連するタスクの長いシーケンスで改善します。
この傾向は、SkillRiseが同じタスクの繰り返しサンプリングの恩恵を受けるのではなく、タスク間で転送可能なスキルを再利用していることを示唆している。
SkillRiseはさらに、複数のステージを持つスキル学習パイプラインのランタイムオーバーヘッドを大幅に削減しながら、強力なパフォーマンスを維持している。
これらの結果は、LLMエージェントがタスク間で伝達可能なスキルを抽出し、洗練し、再利用するための、シンプルで効率的な訓練パラダイムを提供する。
関連論文リスト
- SkillOS: Learning Skill Curation for Self-Evolving Agents [67.94374107466957]
本稿では,自己進化エージェントのスキルキュレーションを学習するための,経験駆動型RLトレーニングレシピであるSkillOSを提案する。
SkillOSは、凍結したエージェントエグゼキュータとトレーニング可能なスキルキュレーターを組み合わせて、蓄積したエクスペリエンスから外部SkillRepoを更新する。
SkillOSは、メモリフリーと強力なメモリベースラインを、有効性と効率の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-07T17:31:50Z) - Minimax Forward and Backward Learning of Evolving Tasks with Performance
Guarantees [6.008132390640294]
タスクの増え続けるシーケンスの漸進的な学習は、正確な分類を可能にすることを約束する。
本稿では,前向き学習と後向き学習を効果的に活用するインクリメンタルミニマックスリスク分類器(IMRC)を提案する。
IMRCは、特にサンプルサイズを減らすために、大幅な性能改善をもたらす可能性がある。
論文 参考訳(メタデータ) (2023-10-24T16:21:41Z) - Multitask Learning with No Regret: from Improved Confidence Bounds to
Active Learning [79.07658065326592]
推定タスクの不確実性の定量化は、オンラインやアクティブな学習など、多くの下流アプリケーションにとって重要な課題である。
タスク間の類似性やタスクの特徴を学習者に提供できない場合、課題設定において新しいマルチタスク信頼区間を提供する。
本稿では,このパラメータを事前に知らないまま,このような改善された後悔を実現する新しいオンライン学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-08-03T13:08:09Z) - Active Task Randomization: Learning Robust Skills via Unsupervised
Generation of Diverse and Feasible Tasks [37.73239471412444]
我々は、教師なしのトレーニングタスクの生成を通じて、堅牢なスキルを学ぶアプローチであるActive Task Randomization (ATR)を導入する。
ATRは、タスクの多様性と実現可能性のバランスをとることで、堅牢なスキルを学ぶために、初期環境状態と操作目標からなる適切なタスクを選択する。
本研究では,視覚的入力に基づく逐次操作問題の解決のために,タスクプランナが学習スキルを構成することを実証する。
論文 参考訳(メタデータ) (2022-11-11T11:24:55Z) - Is Multi-Task Learning an Upper Bound for Continual Learning? [26.729088618251282]
本稿では,特定のデータ拡張のクラスに対して,各タスクが不変表現を学習することに対応する,連続的な自己指導型学習環境を提案する。
連続学習は、MNIST、CIFAR-10、CIFAR-100など、様々なベンチマークデータセットでマルチタスク学習を上回ることが多い。
論文 参考訳(メタデータ) (2022-10-26T15:45:11Z) - Task Compass: Scaling Multi-task Pre-training with Task Prefix [122.49242976184617]
既存の研究では、大規模教師付きタスクによるマルチタスク学習がタスク間の負の効果に悩まされていることが示されている。
タスク間の関係を探索するために,タスクプレフィックスガイド付きマルチタスク事前学習フレームワークを提案する。
我々のモデルは、幅広いタスクの強力な基盤バックボーンとして機能するだけでなく、タスク関係を分析するための探索ツールとしても実現可能である。
論文 参考訳(メタデータ) (2022-10-12T15:02:04Z) - Towards More Generalizable One-shot Visual Imitation Learning [81.09074706236858]
汎用ロボットは、幅広いタスクを習得し、過去の経験を生かして、新しいタスクを素早く学ぶことができるべきである。
ワンショット模倣学習(OSIL)は、専門家のデモンストレーションでエージェントを訓練することで、この目標にアプローチする。
我々は、より野心的なマルチタスク設定を調査することで、より高度な一般化能力を追求する。
論文 参考訳(メタデータ) (2021-10-26T05:49:46Z) - Efficiently Identifying Task Groupings for Multi-Task Learning [55.80489920205404]
マルチタスク学習は、あるタスクによって学習された情報を活用して、他のタスクのトレーニングに役立てることができる。
マルチタスク学習モデルにおいて、どのタスクを一緒にトレーニングすべきかを選択するアプローチを提案する。
本手法は,全タスクを協調学習し,タスクの勾配が他のタスクの損失に影響を及ぼす影響を定量化する。
論文 参考訳(メタデータ) (2021-09-10T02:01:43Z) - CrossFit: A Few-shot Learning Challenge for Cross-task Generalization in
NLP [38.40614678878222]
クロスタスクな数発学習能力を学習するためのタスク設定であるCrossFitを紹介する。
NLP Few-shot Gymは160個のNLPタスクのリポジトリです。
私たちの経験的分析は、見えないタスクの少数の学習能力が上流の学習段階を通じて改善できることを明らかにします。
論文 参考訳(メタデータ) (2021-04-18T12:14:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。