論文の概要: CIDER: Continual Interactive Distillation for Embodied Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.21899v1
- Date: Sat, 22 Aug 2026 10:21:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.533234
- Title: CIDER: Continual Interactive Distillation for Embodied Reinforcement Learning
- Title(参考訳): CIDER: 身体強化学習のための連続的対話的蒸留
- Abstract要約: ヒューマン・イン・ザ・ループ(Human-in-the-loop)の実世界の強化学習は、個々のタスクに対する効果的なロボット操作ポリシーの迅速な取得を可能にする。
循環型強化学習(CIDER)のための連続的対話的蒸留法について紹介する。
CIDERは、教師として蓄積した歴史的政策を凍結し、新しいタスクを学習し、蒸留ベースの保持でタスク学習をインターリーブする。
本手法は,6つの実世界の家庭・産業操作タスクにおいて,1つの共有アクターを用いて評価する。
- 参考スコア(独自算出の注目度): 12.387014135493141
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Human-in-the-loop real-world reinforcement learning enables rapid acquisition of effective robotic manipulation policies for individual tasks, often within tens of minutes. Yet it remains unclear how to extend this paradigm to continual learning, where a single policy must acquire new skills without losing previously learned behaviors. Existing real-world continual learning methods do not explicitly constrain prior behaviors, leading to severe catastrophic forgetting. We introduce Continual Interactive Distillation for Embodied Reinforcement Learning (CIDER), a continual reinforcement learning framework that freezes the accumulated historical policy as a teacher before learning each new task and interleaves task learning with distillation-based retention. We further introduce gradient routing to separate the gradients used for acquiring new tasks from those used for preserving prior behaviors. We evaluate our method with a single shared actor on six real-world household and industrial manipulation tasks. Interactive Distillation maintains high measured success on previously learned tasks across our six-task real-robot sequence while acquiring each new task in 10 to 20 minutes, whereas every baseline forgets at least one previous task. Additional ablations reveal the key design choices that govern the tradeoff between stability and plasticity in real-world continual reinforcement learning.
- Abstract(参考訳): ヒューマン・イン・ザ・ループ(Human-in-the-loop)の実世界の強化学習は、しばしば数分間以内に、個々のタスクに対する効果的なロボット操作ポリシーの迅速な取得を可能にする。
しかし、このパラダイムを継続的学習にどのように拡張するかは、これまで学んだ行動を失うことなく、単一のポリシーで新しいスキルを身につける必要がある。
既存の実世界の連続学習手法は、事前の行動を明示的に制限しないため、深刻な破滅的な忘れがもたらされる。
本研究では,教師として蓄積した歴史的政策を凍結した継続的強化学習フレームワークCIDERを紹介し,各タスクを学習し,留意点に基づくタスク学習をインターリーブする。
さらに、新しいタスクの獲得に使用される勾配を、事前の動作を保存するために使われるものから分離するために勾配ルーティングを導入する。
本手法は,6つの実世界の家庭・産業操作タスクにおいて,1つの共有アクターを用いて評価する。
Interactive Distillationは、6タスクのリアルタイムロボットシークエンスで以前に学習したタスクを10分から20分で獲得する一方で、すべてのベースラインは少なくとも1つの前のタスクを忘れている。
さらなる議論は、現実の継続的強化学習において、安定性と可塑性の間のトレードオフを管理する重要な設計選択を明らかにしている。
関連論文リスト
- M2Distill: Multi-Modal Distillation for Lifelong Imitation Learning [9.15567555909617]
M2Distillは、生涯の模倣学習のためのマルチモーダル蒸留に基づく方法である。
我々は、前段階から現在の段階まで、様々なモダリティにわたる潜在表現のシフトを規制する。
学習したポリシーが、新しいスキルをシームレスに統合しながら、以前に学習したタスクを実行する能力を維持していることを保証します。
論文 参考訳(メタデータ) (2024-09-30T01:43:06Z) - Towards Robust Continual Learning with Bayesian Adaptive Moment Regularization [51.34904967046097]
継続的な学習は、モデルが以前に学習した情報を忘れてしまう破滅的な忘れ込みの課題を克服しようとする。
本稿では,パラメータ成長の制約を緩和し,破滅的な忘れを減らし,新しい事前手法を提案する。
以上の結果から, BAdamは, 単頭クラスインクリメンタル実験に挑戦する先行手法に対して, 最先端の性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2023-09-15T17:10:51Z) - Unveiling the Tapestry: the Interplay of Generalization and Forgetting in Continual Learning [18.61040106667249]
AIでは、一般化とは、与えられたタスクに関連するアウト・オブ・ディストリビューション・データに対して、トレーニングされたデータ以外にうまく機能するモデルの能力を指す。
継続的な学習方法は、しばしば破滅的な忘れを軽減し、以前のタスクからの知識を確実に保持するメカニズムを含んでいる。
本稿では, 形状テクスチュア整合性規則化(STCR)と呼ばれる, 連続的な学習を支援する簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2022-11-21T04:36:24Z) - Latent Plans for Task-Agnostic Offline Reinforcement Learning [32.938030244921755]
本研究では,高次元カメラ観測からタスク非依存のロングホライゾンポリシーを学習するための新しい階層的アプローチを提案する。
我々の定式化によって、未確認のスキルの組み合わせを生産し、潜伏したスキルを"ステッチ"することで、時間的に拡張された目標を達成することが可能であることが示される。
実世界の25の異なる操作タスクに対するマルチタスクビズモータポリシーも学習し、模倣学習とオフライン強化学習の両方に優れています。
論文 参考訳(メタデータ) (2022-09-19T12:27:15Z) - Skill-based Meta-Reinforcement Learning [65.31995608339962]
本研究では,長期的スパース・リワードタスクにおけるメタラーニングを実現する手法を提案する。
私たちの中核となる考え方は、メタ学習中にオフラインデータセットから抽出された事前経験を活用することです。
論文 参考訳(メタデータ) (2022-04-25T17:58:19Z) - Continual Prompt Tuning for Dialog State Tracking [58.66412648276873]
望ましいダイアログシステムは、古いスキルを忘れずに継続的に新しいスキルを学ぶことができるべきである。
本稿では,タスク間の知識伝達を可能にするパラメータ効率フレームワークであるContinuous Prompt Tuningを提案する。
論文 参考訳(メタデータ) (2022-03-13T13:22:41Z) - CoMPS: Continual Meta Policy Search [113.33157585319906]
逐次マルチタスク学習における課題に対処する新しいメタ学習法を開発した。
CoMPSは、いくつかの課題のある連続制御タスクにおいて、事前の継続的な学習や外部のメタ強化手法よりも優れていることが判明した。
論文 参考訳(メタデータ) (2021-12-08T18:53:08Z) - Continual Learning with Neuron Activation Importance [1.7513645771137178]
連続学習は、複数のシーケンシャルなタスクを伴うオンライン学習の概念である。
連続学習の重要な障壁の1つは、ネットワークが古いタスクのデータにアクセスせずに古いタスクの知識を保持する新しいタスクを学習すべきである。
本稿では,タスクの順序によらず,安定な連続学習のためのニューロン活性化重要度に基づく正規化手法を提案する。
論文 参考訳(メタデータ) (2021-07-27T08:09:32Z) - Behavior Self-Organization Supports Task Inference for Continual Robot
Learning [18.071689266826212]
本稿では,ロボット制御タスクの連続学習に対する新しいアプローチを提案する。
本手法は, 漸進的に自己組織化された行動によって, 行動埋め込みの教師なし学習を行う。
従来の手法とは異なり,本手法ではタスク分布の仮定は行わず,タスクを推論するタスク探索も必要としない。
論文 参考訳(メタデータ) (2021-07-09T16:37:27Z) - Bilevel Continual Learning [76.50127663309604]
BCL(Bilevel Continual Learning)という,継続的学習の新たな枠組みを提案する。
連続学習ベンチマーク実験では,多くの最先端手法と比較して,提案したBCLの有効性が示された。
論文 参考訳(メタデータ) (2020-07-30T16:00:23Z) - Bridging the Imitation Gap by Adaptive Insubordination [88.35564081175642]
教官が特権情報にアクセスして意思決定を行う場合、この情報は模倣学習中に疎外されることを示す。
本稿では,このギャップに対処するため,適応的不規則化(ADVISOR)を提案する。
ADVISORは、トレーニング中の模倣と報酬に基づく強化学習損失を動的に重み付け、模倣と探索をオンザフライで切り替えることを可能にする。
論文 参考訳(メタデータ) (2020-07-23T17:59:57Z) - Scalable Multi-Task Imitation Learning with Autonomous Improvement [159.9406205002599]
我々は、自律的なデータ収集を通じて継続的に改善できる模倣学習システムを構築している。
我々は、ロボット自身の試行を、実際に試みたタスク以外のタスクのデモとして活用する。
従来の模倣学習のアプローチとは対照的に,本手法は,継続的改善のための疎い監視によるデータ収集を自律的に行うことができる。
論文 参考訳(メタデータ) (2020-02-25T18:56:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。