論文の概要: Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.09866v1
- Date: Fri, 10 Jul 2026 18:01:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.230654
- Title: Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning
- Title(参考訳): Robo-ValueRL:オフラインからオンラインへの強化学習のための信頼性の高い値推定
- Abstract要約: 信頼性の高い価値推定を可能にする統一的なフレームワークであるRobo-ValueRLを提案する。
240時間にわたるオフラインデモと3000以上のオンラインロールアウトトラジェクトリを通じて、ダウンストリームのパフォーマンスが価値の信頼性と強く関連していることを示す実験を行った。
本システムでは,ミリレベルの精密チップ挿入で86%,一般化可能なブロック分解で84%を達成している。
- 参考スコア(独自算出の注目度): 68.24807262483993
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Offline-to-online reinforcement learning is promising for generalizable robotic manipulation, yet its full-stack complexity obscures reproduction and diagnosis. Within such systems, value estimation plays a central role in prioritizing heterogeneous data for policy improvement. Despite its importance, the central question remains underexplored: how value-function reliability shapes policy optimization in offline-to-online reinforcement learning. To answer this question, we propose Robo-ValueRL, a unified framework that enables reliable value estimation and systematically traces its downstream effects on policy pretraining and online improvement. Concretely, Robo-ValueRL learns a history-conditioned value estimator and evaluates its reliability through global-progress and local-preference metrics. These resulting value estimates are propagated into quality-conditioned consistency-policy pretraining and a residual adaptation module on online rollouts, providing a unified testbed for analyzing how value reliability shapes downstream policy performance. Across 240 hours of offline demonstrations and over 3,000 online rollout trajectories, our extensive experiments show that downstream performance is strongly associated with value reliability. Reliable value functions provide better action-quality estimates, allowing value-guided offline RL to scale more effectively than quality-agnostic behavior cloning, and stabilize online improvement by prioritizing high-quality rollout data. Integrating reliable value guidance through offline pretraining with online improvement, our system achieves 86% success on millimeter-level precise chip insertion and 84% on generalizable block disassembly. We hope these findings highlight the importance of value-guided data utilization for effective policy improvement from heterogeneous robotic experience.
- Abstract(参考訳): オフラインからオンラインへの強化学習は、一般的なロボット操作には有望だが、そのフルスタックの複雑さは、再現と診断を曖昧にする。
このようなシステム内では、価値推定は政策改善のための異種データの優先順位付けにおいて中心的な役割を果たす。
価値機能信頼性は、オフラインからオンラインへの強化学習において、政策最適化をいかに形作るか。
この問題に対処するために,信頼性の高い価値推定を可能にする統一的なフレームワークであるRobo-ValueRLを提案し,その下流が政策事前学習やオンライン改善に与える影響を体系的に追跡する。
具体的には,Robo-ValueRLは履歴条件付き値推定器を学習し,その信頼性を評価する。
これらの評価結果は、品質条件の整合性事前学習と、オンラインロールアウトにおける残留適応モジュールに伝達され、信頼性が下流ポリシーのパフォーマンスをどのように形成するかを解析するための統一的なテストベッドを提供する。
240時間のオフラインデモと3000以上のオンラインロールアウトトラジェクトリを通じて、我々の大規模な実験は、下流のパフォーマンスが価値の信頼性に強く結びついていることを示しています。
信頼性の高い値関数は、より優れたアクション品質推定を提供するため、値誘導オフラインRLは、品質に依存しない振る舞いクローンよりも効果的にスケールでき、高品質なロールアウトデータを優先順位付けすることで、オンライン改善を安定化できる。
オフラインプリトレーニングによる信頼性の高い値ガイダンスとオンライン改善を統合し,ミリレベルの精密チップ挿入で86%,一般化可能なブロック分解で84%を達成している。
これらの知見は、異種ロボットによる効果的な政策改善のための価値誘導型データ利用の重要性を強調したい。
関連論文リスト
- IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning [13.655904209137006]
オフラインプランニングをデータ生成,教師付きトレーニング,オンライン推論にシームレスに組み込む新しいフレームワークである textbfImaginary Planning Distillation (IPD) を提案する。
まず,オフラインデータから不確実性対策と準最適値関数を備えた世界モデルを学習する。
従来の手動で調整した戻り値関数を準最適値関数に置き換えることで、IDDは推論時の意思決定安定性と性能を改善する。
論文 参考訳(メタデータ) (2026-03-04T17:05:39Z) - Uncertainty-Aware Rank-One MIMO Q Network Framework for Accelerated Offline Reinforcement Learning [32.6459755506093]
オフライン強化学習のためのMIMO(Uncertainty-Aware Rank-One Multi-Input Multi-Output)Q Networkフレームワークを提案する。
このフレームワークは、データ不確実性を定量化し、トレーニング損失に利用し、対応するQ関数の低信頼境界を最大化するポリシーをトレーニングすることを目的とする。
論文 参考訳(メタデータ) (2026-02-23T14:57:52Z) - Behavior-Adaptive Q-Learning: A Unifying Framework for Offline-to-Online RL [3.2883573376133555]
本稿では,オフラインからオンラインRLへのスムーズな移行を可能にするフレームワークである行動適応型Q-Learning(BAQ)を紹介する。
BAQは、(i)不確実性が高い場合のオフライン行動に対してオンラインポリシーを整列させ、(ii)より確実なオンライン体験が蓄積されるにつれて、この制約を徐々に緩和する二重目的損失を包含する。
標準ベンチマーク全体を通じて、BAQは、オフラインからオフラインまでのRLアプローチを一貫して上回り、より高速なリカバリ、堅牢性の向上、全体的なパフォーマンスの向上を実現している。
論文 参考訳(メタデータ) (2025-11-05T18:20:23Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Robust Bandwidth Estimation for Real-Time Communication with Offline Reinforcement Learning [12.6053297341409]
オフライン強化学習(RL)に基づくロバスト帯域幅推定フレームワークRBWEを提案する。
RBWEは過大評価誤差を18%減らし、QoE(QoE)を18%減らし、実世界のRTCアプリケーションにおいて実用性を示す。
論文 参考訳(メタデータ) (2025-07-08T08:43:29Z) - A Perspective of Q-value Estimation on Offline-to-Online Reinforcement
Learning [54.48409201256968]
オフラインからオンラインへの強化学習(O2O RL)は、少数のオンラインサンプルを使用して、オフライン事前訓練ポリシーのパフォーマンスを改善することを目的としている。
ほとんどのO2O手法は、RLの目的と悲観のバランス、オフラインとオンラインのサンプルの利用に焦点を当てている。
論文 参考訳(メタデータ) (2023-12-12T19:24:35Z) - Confidence-Conditioned Value Functions for Offline Reinforcement
Learning [86.59173545987984]
本稿では,任意の信頼度を高い確率で同時に学習するベルマンバックアップ方式を提案する。
理論的には、学習した値関数が真値の任意の信頼度で保守的な推定値を生成することを示す。
論文 参考訳(メタデータ) (2022-12-08T23:56:47Z) - Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning [63.53407136812255]
オフライン強化学習は、探索を必要とせずに、事前に収集された静的データセットから効果的なポリシーを学ぶことを約束する。
既存のQラーニングとアクター批判に基づくオフポリティクスRLアルゴリズムは、アウト・オブ・ディストリビューション(OOD)アクションや状態からのブートストラップ時に失敗する。
我々は,OOD状態-動作ペアを検出し,トレーニング目標への貢献度を下げるアルゴリズムであるUncertainty Weighted Actor-Critic (UWAC)を提案する。
論文 参考訳(メタデータ) (2021-05-17T20:16:46Z) - AliExpress Learning-To-Rank: Maximizing Online Model Performance without
Going Online [60.887637616379926]
本稿では,学習からランクへ学習するための評価器・ジェネレータフレームワークを提案する。
コンテキストを含むレコメンデーションを一般化して評価する評価器と、強化学習による評価器スコアを最大化するジェネレータとから構成される。
本手法は, オンラインA/Bテストにおける産業レベルの微調整モデルよりも, 変換率(CR)の面で大幅に向上する。
論文 参考訳(メタデータ) (2020-03-25T10:27:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。