論文の概要: RIFAR: Reliability and Forgetting-Aware Replay for Continual Robot Learning
- arxiv url: http://arxiv.org/abs/2610.03079v1
- Date: Fri, 02 Oct 2026 10:01:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.315185
- Title: RIFAR: Reliability and Forgetting-Aware Replay for Continual Robot Learning
- Title(参考訳): RIFAR:連続型ロボット学習のための信頼性と予測認識リプレイ
- Abstract要約: RIFARは信頼性スクリーニングとドリフト対応のリプレイ選択を組み合わせる。
コンパクトなデモプレフィックスからトラジェクトリを再構築する。
LIBERO-Goalでは90.97AUCを達成し、タスクごとに320のタイムステップしか保持していない。
- 参考スコア(独自算出の注目度): 19.306966085188694
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Genuine embodied agency requires robots to turn continuous real-world experience into lasting, transferable skills. This demands continual learning that integrates new capabilities without eroding prior knowledge as tasks and environments evolve. Experience replay mitigates forgetting, but storing complete demonstrations becomes costly as tasks accumulate. World-action models offer a generative alternative, reconstructing past experience through joint predictions of actions and future observations. However, visually coherent rollouts may contain actions that cannot realize the predicted transitions, while new-task adaptation can disrupt previously learned behavior. RIFAR therefore combines reliability screening with drift-aware replay selection. It reconstructs trajectories from compact demonstration prefixes and uses a frozen inverse-dynamics model to assess action-visual consistency. Training first combines current demonstrations with the highest-quality screened trajectories. RIFAR then compares action predictions before and after this adaptation on identical historical inputs, reselecting trajectories with larger normalized drift from the same screened pool for continued training. Across three LIBERO suites and real-world experiments, RIFAR surpasses the previous state of the art in WAM-based generative replay. On LIBERO-Goal, it achieves 90.97 AUC while retaining only 320 historical time steps per task, approximately 4.9% of the steps retained using 50-demonstration replay.
- Abstract(参考訳): Genuineのエンボディエージェンシーは、ロボットが連続した現実世界の体験を持続的で伝達可能なスキルに変えることを要求する。
これは、タスクや環境が進化するにつれて、事前の知識を損なうことなく、新しい機能を統合する継続的な学習を必要とする。
経験的なリプレイは忘れを軽減しますが、タスクが蓄積されるにつれて、完全なデモを保存するのにコストがかかります。
世界行動モデルは、行動の合同予測と将来の観測を通して過去の経験を再構築する、創造的な代替手段を提供する。
しかし、視覚的コヒーレントなロールアウトには予測される遷移を達成できないアクションが含まれ、新しいタスク適応は以前に学習された振る舞いを妨害する可能性がある。
したがって、RIFARは信頼性スクリーニングとドリフト対応のリプレイ選択を組み合わせたものである。
コンパクトなデモプレフィックスからトラジェクトリを再構築し、凍結した逆力学モデルを用いて行動-視覚的整合性を評価する。
トレーニングはまず、現在のデモと高品質のスクリーン付きトラジェクトリを組み合わせる。
RIFARは、この適応前後の動作予測を同じ履歴入力で比較し、同じスクリーニングされたプールからより大きな正常なドリフトを持つ軌道を選択し、継続的なトレーニングを行う。
3つのLIBEROスイートと実世界の実験の中で、RIFARは、WAMベースの生成リプレイにおいて、これまでの最先端を超越している。
LIBERO-Goalでは、90.97 AUCを達成し、タスクごとに320のタイムステップしか保持せず、50-demonstrationリプレイを使用して保持されるステップの約4.9%を達成している。
関連論文リスト
- Learning Skills from Historical Action Trajectories: Action Experience Dictionary for World Action Models [129.76412745258145]
World Action Models(WAM)は、視覚力学予測とアクション生成を結合するが、操作タスク間のアクションエクスペリエンスの再利用を明示的にサポートしていない。
本研究では,歴史的行動軌跡を共有行動埋め込みにエンコードするアクション体験辞書(AED)を開発した。
シミュレーション・ベンチマークと実世界のクロス・エボディメント・セッティングの実験により,AEDの有効性が検証された。
論文 参考訳(メタデータ) (2026-09-30T17:26:38Z) - Experience-Driven Continual Learning of Terrain Traversability for Quadruped Robots [3.728185330463772]
本稿では,ロコモーション体験を用いて,事前接触画像から対話結果の学習を行う連続学習パイプラインを提案する。
ROS2の実装は、シミュレーションとハードウェアにおけるUnitree Go2の評価をサポートし、各ドメインで個別にトレーニングされている。
論文 参考訳(メタデータ) (2026-09-30T13:52:21Z) - RoXDrive: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving via Action-Faithful Rollouts [98.41251854883184]
強化学習(RL)ポストトレーニングは、現在のアプローチに代わる有望な代替手段を提供する。
ビデオワールドモデルは、現実的な多段階の将来のロールアウトを生成する能力を示したが、アクション条件を忠実に反映しないかもしれない。
本稿では,信頼性の高いポリシ最適化を実現するプラグイン・アンド・プレイクローズドループRLフレームワークであるRoXDriveを紹介する。
論文 参考訳(メタデータ) (2026-09-29T06:59:50Z) - World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays [20.499876853160206]
世界行動モデル(WAM)は将来の視覚的観察を生成することができる。
Recurrent Generative Replay (REGEN)を提案するために,この生成機能を活用している。
REGENは、以前のタスク命令と現在のタスク観察にのみ条件付けられた擬似再生軌道を合成する。
論文 参考訳(メタデータ) (2026-06-25T17:59:56Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - When to Trust Imagination: Adaptive Action Execution for World Action Models [42.51856318901667]
世界行動モデル(WAM)は、近ごろ、将来の視覚的観察と将来の行動を共同で予測することによって、ロボット操作のための有望なパラダイムとして登場した。
現在のWAMは、各モデル推論の後、一定の数の予測アクションを実行し、ロボットは、想像された未来が実際の物理的なロールアウトと一致しているかどうかを無視する。
我々は,将来性検証問題として適応型WAM実行を定式化し,WAM予測された未来が信頼性を保ちながらロボットはより長く実行すべきであり,現実が想像力から逸脱した場合にはより早く再計画する。
論文 参考訳(メタデータ) (2026-05-07T13:18:28Z) - Actor-Critic for Continuous Action Chunks: A Reinforcement Learning Framework for Long-Horizon Robotic Manipulation with Sparse Reward [85.84943447589511]
本稿では,高次元連続行動系列を生成するための新しいRLフレームワークであるAC3(Actor-Critic for Continuous Chunks)を紹介する。
この学習プロセスを安定させ、データ効率を高めるため、AC3はアクターと批評家の両方に目標安定化機構を組み込む。
論文 参考訳(メタデータ) (2025-08-15T01:27:15Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z) - Scalable Strategies for Continual Learning with Replay [0.0]
リプレイは継続学習において基礎的な役割を担い、モデルが過去の知識と新しい情報を一致させることができることを示す。
しかし実際には、リプレイは極めて難解であり、ナイーティブな適用では継続学習のコストが2倍になる。
コンソリデーション(consolidation)は、特定のパフォーマンスターゲットに必要なリプレイサンプルを最大55%削減する、リプレイのためのファシックなアプローチである。
次に、連続的な学習環境に合わせたタスク演算のオフシュートであるシーケンシャルマージを提案し、リプレイと組み合わせてうまく動作することを示す。
論文 参考訳(メタデータ) (2025-05-18T18:23:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。