論文の概要: Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering
- arxiv url: http://arxiv.org/abs/2606.29201v1
- Date: Sun, 28 Jun 2026 05:01:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.831523
- Title: Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering
- Title(参考訳): 閉ざされた行動:推論時間を持たない政策ウェイトへの蒸留モードのリダイレクト
- Abstract要約: 本稿では,ポリシーのロールアウトを望ましい行動モードにリダイレクトするMOREを提案する。
MoREは、当初の混合モードポリシーよりも平均デプロイメント成功率(SR)を44パーセント改善する。
- 参考スコア(独自算出の注目度): 28.889110668832984
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Behavior-cloned policies often learn multiple behavior modes from demonstration datasets, including modes that are unsafe or otherwise undesired at deployment. For example, a policy trained on diverse handover demonstrations may learn to pass a knife blade-first. Standard remedies such as data curation and inference-time steering either require access to the original demonstrations for full retraining or add substantial inference-time overhead. To address this gap, we propose MoRE(Mode Redirection), which redirects policy rollouts toward desired behavior modes through a short "uncloning" step. Specifically, MoRE distills the redirection signal from a temporary mode classifier into the policy weights to steer behavior. A retain loss balances this edit by preserving desired-mode competence, allowing the standalone policy to suppress unwanted modes with zero inference-time overhead. Across eight simulated and real-world tasks, MoRE improves the average deployment success rate (SR) by 44 percentage points over the original mixed-mode policy. Among all compared adaptation and steering baselines, MoRE achieves the strongest SR and approaches the filtered-data retraining reference, while preserving task competence and inference speed. MoRE also generalizes across robot policy backbones, including Diffusion Policy and the Pi0.5 VLA, diverse task categories, and real-world deployments.
- Abstract(参考訳): 振る舞いを閉じたポリシは、デプロイ時に安全でない、あるいは望ましくないモードを含む、デモデータセットから複数の動作モードを学習することが多い。
例えば、多様なハンドオーバのデモンストレーションで訓練されたポリシーは、ナイフのブレードファーストをパスすることを学ぶことができる。
データキュレーションや推論時のステアリングといった標準的な改善は、完全な再トレーニングのためにオリジナルのデモへのアクセスを必要とするか、あるいは推論時のオーバーヘッドを大幅に増やす必要がある。
このギャップに対処するために,ポリシーのロールアウトを所望の動作モードにリダイレクトするMORE(Mode Redirection)を提案する。
特に、MoREは、一時的なモード分類器からのリダイレクト信号を、ポリシーウェイトに蒸留して、ステア動作を行う。
保持損失は、所望モードのコンピテンスを保存することで、この編集のバランスを保ち、スタンドアローンポリシーは、推論時のオーバーヘッドをゼロに、望ましくないモードを抑えることができる。
8つのシミュレートされた実世界のタスクに対して、MoREは元の混合モードポリシーよりも平均デプロイメント成功率(SR)を44パーセント改善する。
比較された適応とステアリングベースラインの中で、MoREは最強のSRを達成し、タスク能力と推論速度を保ちながら、フィルタリングデータ再トレーニング基準にアプローチする。
MoREはまた、Diffusion PolicyやPi0.5 VLA、多様なタスクカテゴリ、現実世界のデプロイメントなど、ロボットポリシーのバックボーンを一般化している。
関連論文リスト
- Proxy Policy Steering [18.880191675273796]
汎用的なロボットポリシーは、大規模なデータから幅広い操作を先取りするが、それらを新しいタスクに専門化することは、デプロイメントのボトルネックのままである。
本稿では、この課題を解決する推論時適応法であるプロキシポリシーステアリング(PPS)を紹介する。
PPSは最先端のpi 0.5ベースポリシーを平均53%の絶対的な成功率で引き上げ、ベースが解決しないタスクでゼロ対1のゲインを得る。
論文 参考訳(メタデータ) (2026-09-08T17:59:03Z) - LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL [64.4276583943816]
検証不能な指導のための強化学習は、報酬信号としてプロンプト固有のルーリックを持つ裁判官に依存している。
最近の手法は、トレーニング中にこれらのルーリックを進化するポリシーに適応させるが、トレーニングのプロンプト自体は静的のままである。
この静的なアプローチは、しばしば急激な困難と政策能力の間に重大なミスアライメントをもたらし、裁判官は差別的な報酬信号を取り戻すことができない。
論文 参考訳(メタデータ) (2026-07-05T17:05:13Z) - Improving Robotic Generalist Policies via Flow Reversal Steering [92.97477771370428]
汎用ポリシーは多様なロボットデータセットから幅広いスキルを学ぶことができる。
新しい課題を解決し、改善するためには、ポリシーのリッチな振る舞いから適切なアクションを推論し、呼び出す方法が必要です。
本稿では,フローリバーサルステアリング (FRS) を提案し,フローポリシーを逆に通すことで,最適だが合理的な動作をとる手法を提案し,それらを一般の動作モードにマッピングする。
論文 参考訳(メタデータ) (2026-06-11T17:59:45Z) - Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent [53.828537014796574]
オンラインの非政治強化学習(RL)は、ポリシークラスと更新ルールの2つの選択肢によって構成されている。
我々は、MeanFlow変換を通じてノイズをアクションにマッピングする一段階生成ポリシークラスであるMeanFlow Policiesを提案する。
7つのMuJoCoベンチマークで、Sは1ステップの推論効率を維持しながら、ガウスおよび生成ベースラインを改善する。
論文 参考訳(メタデータ) (2026-05-20T15:14:14Z) - ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation [20.162114513881118]
オフライン強化学習(RL)は、環境の相互作用を伴わずに行動ポリシーによって生成された固定データセットから最適なポリシーを学ぶことを目的としている。
構築による制約の少ないサポート制約を強制するフローポリシーに基づくオフラインRL手法であるReFORMを提案する。
論文 参考訳(メタデータ) (2026-02-04T21:03:11Z) - Learning Policy Representations for Steerable Behavior Synthesis [80.4542176039074]
マルコフ決定プロセス(MDP)を前提として,テスト時の行動ステアリングを促進するために,さまざまなポリシーの表現を学習する。
これらの表現は、セットベースアーキテクチャを用いて、様々なポリシーに対して均一に近似できることを示す。
変動生成法を用いてスムーズな潜伏空間を導出し,さらにコントラスト学習により、潜伏距離が値関数の差と一致するように形成する。
論文 参考訳(メタデータ) (2026-01-29T21:52:06Z) - Learning on One Mode: Addressing Multi-modality in Offline Reinforcement Learning [9.38848713730931]
オフライン強化学習は、環境と対話することなく、静的データセットから最適なポリシーを学習しようとする。
既存の方法は、しばしば一助的行動ポリシーを仮定し、この仮定が破られたとき、最適以下のパフォーマンスをもたらす。
本稿では,行動方針の単一かつ有望なモードから学習することに焦点を当てた新しいアプローチである,1モードでの模倣学習(LOM)を提案する。
論文 参考訳(メタデータ) (2024-12-04T11:57:36Z) - Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning [13.163511229897667]
オフラインの強化学習では、価値関数の過大評価を防ぐために、配布外動作を管理する必要がある。
拡散雑音回帰問題としてクルバック・リブラー (KL) 制約ポリシーの繰り返しを定式化する拡散アクタ・クリティカル (DAC) を提案する。
提案手法はD4RLベンチマークで評価され,ほぼすべての環境において最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2024-05-31T00:41:04Z) - Offline RL With Realistic Datasets: Heteroskedasticity and Support
Constraints [82.43359506154117]
非均一な変数を持つデータから、典型的なオフライン強化学習手法が学習できないことを示す。
提案手法は,Atariゲーム,ナビゲーション,ピクセルベースの操作において,多種多様なオフラインRL問題にまたがる性能向上を図っている。
論文 参考訳(メタデータ) (2022-11-02T11:36:06Z) - Diffusion Policies as an Expressive Policy Class for Offline
Reinforcement Learning [70.20191211010847]
オフライン強化学習(RL)は、以前に収集した静的データセットを使って最適なポリシーを学ぶことを目的としている。
本稿では,条件付き拡散モデルを用いたディフュージョンQ-ラーニング(Diffusion-QL)を提案する。
本手法はD4RLベンチマークタスクの大部分において最先端の性能を実現することができることを示す。
論文 参考訳(メタデータ) (2022-08-12T09:54:11Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。