論文の概要: Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
- arxiv url: http://arxiv.org/abs/2603.16542v1
- Date: Tue, 17 Mar 2026 14:05:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-21 18:33:56.910316
- Title: Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
- Title(参考訳): 後方遷移重み付けによる保守的オフラインロボット政策学習
- Authors: Wanpeng Zhang, Hao Luo, Sipeng Zheng, Yicheng Feng, Haiweng Xu, Ziheng Xi, Chaoyi Xu, Haoqi Yuan, Zongqing Lu,
- Abstract要約: PTR(Posterior-Transition Reweighting)は、報酬のない、保守的なポストトレーニング手法である。
各トレーニングサンプルが管理された更新にどの程度影響するかを決定する。
PTRは、各サンプルの反応後の結果が現在の表現の下にあるかに応じてクレジットを再配置する。
- 参考スコア(独自算出の注目度): 36.23660195981511
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Offline post-training adapts a pretrained robot policy to a target dataset by supervised regression on recorded actions. In practice, robot datasets are heterogeneous: they mix embodiments, camera setups, and demonstrations of varying quality, so many trajectories reflect recovery behavior, inconsistent operator skill, or weakly informative supervision. Uniform post-training gives equal credit to all samples and can therefore average over conflicting or low-attribution data. We propose Posterior-Transition Reweighting (PTR), a reward-free and conservative post-training method that decides how much each training sample should influence the supervised update. For each sample, PTR encodes the observed post-action consequence as a latent target, inserts it into a candidate pool of mismatched targets, and uses a separate transition scorer to estimate a softmax identification posterior over target indices. The posterior-to-uniform ratio defines the PTR score, which is converted into a clipped-and-mixed weight and applied to the original action objective through self-normalized weighted regression. This construction requires no tractable policy likelihood and is compatible with both diffusion and flow-matching action heads. Rather than uniformly trusting all recorded supervision, PTR reallocates credit according to how attributable each sample's post-action consequence is under the current representation, improving conservative offline adaptation to heterogeneous robot data.
- Abstract(参考訳): オフラインのポストトレーニングは、記録されたアクションに対する教師付き回帰によって、事前訓練されたロボットポリシーをターゲットデータセットに適用する。
実際には、ロボットデータセットは異種であり、エボディメント、カメラの設定、様々な品質のデモが混在しているため、多くの軌道は回復行動、不整合オペレータースキル、弱い情報監督を反映している。
均一なポストトレーニングはすべてのサンプルに同等の信用を与えるため、競合や低属性のデータよりも平均的な結果が得られる。
本稿では,各トレーニングサンプルが監督更新にどの程度影響するかを判断する報酬のない,保守的なポストトレーニング手法であるPosterior-Transition Reweighting(PTR)を提案する。
各サンプルに対して、PTRは観測後の結果を潜在目標としてエンコードし、ミスマッチしたターゲットの候補プールに挿入し、別の遷移スコアラを使用して、ターゲット指標よりも後方のソフトマックス識別を推定する。
後から一様比は、自己正規化重み付け回帰により、クリップされた混合重みに変換され、元の作用目標に適用されるPTRスコアを定義する。
この構造は、引き込み可能なポリシーの可能性を必要とせず、拡散とフローマッチングの両方のアクションヘッドと互換性がある。
記録されたすべての監督を均一に信頼するのではなく、PTRは、各サンプルのポストアクション結果が現在の表現の下にあるかに応じてクレジットを再配置し、異種ロボットデータへの保守的なオフライン適応を改善する。
関連論文リスト
- CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Double Check My Desired Return: Transformer with Target Alignment for Offline Reinforcement Learning [64.6334337560557]
教師付き学習(RvS)による強化学習は、シーケンスモデリングタスクとしてオフラインRLをフレーム化する。
決定変換器(DT)は、実際の完了したリターンを特定のターゲットリターンと確実に整合させるのに苦労する。
そこで我々は,Offline RLの目標アライメントによる変換器の二重チェックを行う新しいアプローチであるDoctorを提案する。
論文 参考訳(メタデータ) (2025-08-22T14:30:53Z) - Conformal Inference under High-Dimensional Covariate Shifts via Likelihood-Ratio Regularization [35.16750653336608]
ピンボール損失を正規化の新たな選択と組み合わせた正準比正則化量子回帰アルゴリズムを提案する。
LR-QR法は,対象領域の所望レベルにおいて,最小限の誤差項までカバレッジを有することを示す。
実験により、LR-QRアルゴリズムは、高次元予測タスクにおいて既存の手法よりも優れていることを示した。
論文 参考訳(メタデータ) (2025-02-18T16:46:44Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z) - Off-Policy Evaluation for Large Action Spaces via Policy Convolution [60.6953713877886]
ポリシ・コンボリューション(Policy Convolution)のファミリーは、アクション内の潜在構造を使用して、ログとターゲットポリシを戦略的に畳み込みます。
合成およびベンチマークデータセットの実験では、PCを使用する場合の平均二乗誤差(MSE)が顕著に改善されている。
論文 参考訳(メタデータ) (2023-10-24T01:00:01Z) - Adaptive Principal Component Regression with Applications to Panel Data [29.295938927701396]
我々は、(正規化)主成分回帰に対する最初の時間一様有限標本保証を提供する。
結果は,現代のマルティンゲール濃度から変量設定への適応ツールに頼っている。
提案手法は,エラー・イン・変数の回帰を利用していないベースラインを経験的に上回ることを示す。
論文 参考訳(メタデータ) (2023-07-03T21:13:40Z) - Post Reinforcement Learning Inference [20.521169740409263]
強化学習アルゴリズムによって収集されたデータを用いて推定と推定を行う。
この分散を安定化させるために適応重みを用いる重み付き一般化モーメント法(GMM)を提案する。
主な用途は、動的処理効果の推定と動的オフポリシー評価である。
論文 参考訳(メタデータ) (2023-02-17T12:53:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。