論文の概要: CLaaS: Continual learning as a service for sample efficient online learning
- arxiv url: http://arxiv.org/abs/2606.05559v1
- Date: Thu, 04 Jun 2026 01:14:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-05 22:39:44.466764
- Title: CLaaS: Continual learning as a service for sample efficient online learning
- Title(参考訳): CLaaS: サンプル効率のよいオンライン学習のための継続的学習サービス
- Authors: Kion Fallah, Silen Naihin, Barak Widawsky, Qingqing Mao,
- Abstract要約: エージェントが一連のシナリオから学習するオンライン連続学習環境について検討する。
本稿では、エージェントがデプロイ中に改善できるシステムである継続的学習・アズ・ア・サービス(CL)を提案する。
対向課題におけるCLの評価を行い,パラメトリックな更新によって前向き転送の精度が向上し,文脈内学習よりも忘れられることが実証された。
- 参考スコア(独自算出の注目度): 1.7646568737734192
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deployed large language model agents must adapt to distribution shift in dynamic environments. Ideally, adaptation can be performed from accumulated agent experiences and retain prior capabilities while transferring to future tasks. However, agent actions and environmental transitions can only be sampled once per scenario, as real-world environments cannot be trivially reset. To this end, we investigate an experiential and online continual learning setting in which agents learn from a stream of scenarios. We propose continual learning as-a-service (CLaaS), a system which enables agents to improve during deployment, abstracted behind a chat API. To increase sample efficiency, CLaaS stores rollouts in an experience replay buffer for gradient reuse during asynchronous training. We evaluate CLaaS on an adversarial task, demonstrating that parametric updates lead to superior forward transfer and less forgetting than in-context learning, with replay being a critical choice for sample efficiency.
- Abstract(参考訳): デプロイされた大規模言語モデルエージェントは、動的環境における分散シフトに適応する必要がある。
理想的には、エージェントの蓄積した経験から適応を行い、将来的なタスクに移行する前の能力を維持できる。
しかし、エージェントアクションと環境遷移はシナリオ毎に1回だけサンプリングすることができ、現実の環境は自明にリセットできない。
そこで本研究では,エージェントがシナリオのストリームから学習する経験的かつオンラインな連続学習環境について検討する。
チャットAPIの背後に抽象化された,デプロイ中のエージェントの改善を可能にするシステムであるCLaaS(Continuous Learning as-a-service)を提案する。
サンプル効率を高めるため、CLaaSは非同期トレーニング中のグラデーション再利用のために、ロールアウトをエクスペリエンス再生バッファに格納する。
我々は,対話的タスクにおけるCLaaSの評価を行い,パラメトリックな更新によって前向きの転送がより優れ,テキスト内学習よりも忘れられにくくなり,リプレイがサンプル効率にとって重要な選択であることを示した。
関連論文リスト
- Autonomous Continual Learning of Computer-Use Agents for Environment Adaptation [57.65688895630163]
ACuRLは自律的なカリキュラム強化学習フレームワークで、エージェントを人間データゼロの特定の環境に継続的に適応させる。
本研究では,環境内学習と環境横断学習の両方を効果的に実現し,既存の環境を忘れずに4~22%の性能向上を実現した。
論文 参考訳(メタデータ) (2026-02-10T23:06:02Z) - Scaling Agent Learning via Experience Synthesis [100.42712232390532]
強化学習は、対話を通じて自己改善を行うことで、自律的なエージェントに力を与えることができる。
しかし、コストのかかるロールアウト、タスクの多様性の制限、信頼性の低い報奨信号、インフラストラクチャの複雑さによって、その実践的採用は依然として困難である。
私たちはDreamGymを紹介します。DreamGymはスケーラビリティを念頭において多様なエクスペリエンスを合成するために設計された最初の統合フレームワークです。
論文 参考訳(メタデータ) (2025-11-05T18:58:48Z) - Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting [92.57796055887995]
本稿では,言語モデルエージェントの強化学習から後視体験のリプレイに適応するプロンプトフレームワークECHOを紹介する。
ECHOは失敗した試みで達成できた代替目標のために最適化された軌道を生成する。
我々は、テキストベースのナビゲーションと計画ベンチマークであるXMiniGridのステートフルバージョンと、協調的な情報収集企業シミュレーションであるPeopleJoinQAについて、ECHOを評価した。
論文 参考訳(メタデータ) (2025-10-11T18:11:09Z) - CLIP with Generative Latent Replay: a Strong Baseline for Incremental Learning [17.614980614656407]
インクリメンタル・プロンプト学習のための連続的生成学習を提案する。
変分オートエンコーダを用いてクラス条件分布を学習する。
このような生成的リプレイアプローチは、ゼロショット機能を改善しつつ、新しいタスクに適応できることを示す。
論文 参考訳(メタデータ) (2024-07-22T16:51:28Z) - OER: Offline Experience Replay for Continual Offline Reinforcement Learning [25.985985377992034]
エージェントには、事前にコンパイルされたオフラインデータセットのシーケンスを通じて、新たなスキルを継続的に学習することが望ましい。
本稿では、エージェントが一連のオフライン強化学習タスクを学習する、新しい設定である連続オフライン強化学習(CORL)を定式化する。
本稿では,リプレイバッファを構築するためのモデルベースエクスペリエンス選択手法を提案する。
論文 参考訳(メタデータ) (2023-05-23T08:16:44Z) - PsiPhi-Learning: Reinforcement Learning with Demonstrations using
Successor Features and Inverse Temporal Difference Learning [102.36450942613091]
時間差学習(ITD)と呼ばれる逆強化学習アルゴリズムを提案する。
Psi Phi$-learningと呼ばれるデモで強化学習のための新しいアルゴリズムに到達し、オンライン環境の相互作用から学習とITDをシームレスに統合する方法を示します。
論文 参考訳(メタデータ) (2021-02-24T21:12:09Z) - Learning to Sample with Local and Global Contexts in Experience Replay
Buffer [135.94190624087355]
遷移の相対的重要性を計算できる学習に基づく新しいサンプリング手法を提案する。
本研究の枠組みは, 様々な非政治強化学習手法の性能を著しく向上させることができることを示す。
論文 参考訳(メタデータ) (2020-07-14T21:12:56Z) - Pre-trained Word Embeddings for Goal-conditional Transfer Learning in
Reinforcement Learning [0.0]
本稿では,事前訓練されたタスク非依存言語モデルによって,目標条件付きRLエージェントをより効率的にする方法について述べる。
私たちは、異なる関連するタスク間の伝達学習を容易にすることで、これを実現します。
論文 参考訳(メタデータ) (2020-07-10T06:42:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。