論文の概要: Proxy Policy Steering
- arxiv url: http://arxiv.org/abs/2609.09148v2
- Date: Wed, 09 Sep 2026 14:08:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.725901
- Title: Proxy Policy Steering
- Title(参考訳): プロキシポリシーステアリング
- Authors: Chuanruo Ning, Tianrui Wang, Wei-Chiu Ma, Kuan Fang,
- Abstract要約: 汎用的なロボットポリシーは、大規模なデータから幅広い操作を先取りするが、それらを新しいタスクに専門化することは、デプロイメントのボトルネックのままである。
本稿では、この課題を解決する推論時適応法であるプロキシポリシーステアリング(PPS)を紹介する。
PPSは最先端のpi 0.5ベースポリシーを平均53%の絶対的な成功率で引き上げ、ベースが解決しないタスクでゼロ対1のゲインを得る。
- 参考スコア(独自算出の注目度): 18.880191675273796
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generalist robot policies carry broad manipulation priors from large-scale data, but specializing them to a new task remains the deployment bottleneck. This requires eliciting task-specific behavior from limited demonstrations without degrading their broad capabilities. We introduce Proxy Policy Steering (PPS), an inference-time adaptation method that resolves this challenge by training two lightweight proxy policies whose calibrated velocity-space difference steers the frozen base sampler. A reference proxy models the frozen base's behavior on target-task observations, and a task proxy, initialized from the reference, captures how this behavior changes under task supervision. Their difference forms a calibrated velocity-space residual that steers the frozen base sampler at every denoising step. We identify the conditions under which this residual isolates the change induced by task supervision, and validate them empirically. Because the base is never directly modified, its broad capabilities remain available at inference, including behaviors such as recovery from failure that the demonstrations themselves do not exercise. Adaptation requires only forward velocity predictions from the base, making PPS lightweight to train and applicable even without access to the base's parameters. On 8 real-world and 4 simulation manipulation tasks, PPS lifts the state-of-the-art pi 0.5 base policy by 53% absolute success rate on average, with zero-to-one gains on tasks the base never solves, while preserving the base's broad capabilities. PPS outperforms LoRA fine-tuning, from-scratch specialists, residual policies, and prior inference-time steering methods.
- Abstract(参考訳): 汎用的なロボットポリシーは、大規模なデータから幅広い操作を先取りするが、それらを新しいタスクに専門化することは、デプロイメントのボトルネックのままである。
これは、幅広い能力を低下させることなく、限られたデモからタスク固有の振る舞いを引き出す必要がある。
本稿では,この課題を解決するために,速度空間差を調整した2つの軽量プロキシポリシーを学習し,凍結ベースサンプルを操るプロキシポリシーステアリング(PPS)を提案する。
参照プロキシは、ターゲットタスクの観測で凍結したベースの動きをモデル化し、参照から初期化されたタスクプロキシは、タスクの監督の下でこの振る舞いがどのように変化するかをキャプチャする。
それらの差はキャリブレーションされた速度空間の残差を形成し、凍結したベースサンプルをデノナイジングステップ毎に操る。
この残余がタスクの監督によって引き起こされる変化を分離する条件を特定し、それらを実証的に検証する。
ベースは直接修正されることはないため、デモ自体が実行しない障害からの回復などの動作を含む、幅広い機能は推論時に利用可能である。
適応は、ベースからの前方速度予測のみを必要とするため、PSSはトレーニングに軽量で、ベースパラメータにアクセスしなくても適用可能である。
8つの実世界と4つのシミュレーション操作タスクにおいて、PSSは最先端のpi 0.5ベースポリシーを平均53%の絶対的な成功率で引き上げる。
PPSは、LoRA微調整、オフスクラッチスペシャリスト、残留ポリシー、および事前の推論時ステアリング方法より優れている。
関連論文リスト
- ORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human Feedback [1.711436622393758]
オンライン残留ポリシー適応(英語: Online Residual Policy Adaptation、ORPA)は、ロボット行動のフィードバック駆動による修正を可能にするフレームワークである。
ORPAは事前訓練された制御ポリシーを軽量でフィードバック条件付きモジュールで拡張し、関節空間内での残留調整を直接予測する。
ORPAをALOHAプラットフォームを用いて精度の高い操作タスクのセットで評価し、ベースライン制御ポリシやルールベースの逆運動学補正と比較して、小さな摂動による成功率と回復率の改善を実証した。
論文 参考訳(メタデータ) (2026-08-18T03:30:12Z) - Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering [28.889110668832984]
本稿では,ポリシーのロールアウトを望ましい行動モードにリダイレクトするMOREを提案する。
MoREは、当初の混合モードポリシーよりも平均デプロイメント成功率(SR)を44パーセント改善する。
論文 参考訳(メタデータ) (2026-06-28T05:01:27Z) - Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning [50.738952715864116]
表現的連続制御ポリシは、シミュレーションされた実ロボット制御のための模倣学習のスケーリングにおける進歩のバックボーンを形成する。
テスト時に完全にポリシー最適化を行うRLアルゴリズムであるQGF(Q-Guided Flow)を提案する。
実証的には、QGFはシングルタスクおよびゴール条件のオフラインRLベンチマークにおいて、以前のテスト時間RLメソッドよりも優れている。
論文 参考訳(メタデータ) (2026-06-09T16:45:57Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning [42.74142065376427]
本稿では,Z-Perturbation Reinforcement Learning (ZPRL)を提案する。
現実世界では、ZPRLは模倣ベースポリシーよりも4つのタスクの平均成功率を33.7%向上させる。
論文 参考訳(メタデータ) (2026-05-19T14:43:26Z) - Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - OGPO: Sample Efficient Full-Finetuning of Generative Control Policies [53.42266064673132]
ジェネレーティブコントロールポリシー(GCP)は、ロボット学習に有効なパラメータ化として登場した。
この研究は、GCPを微調整するためのサンプル効率であるOGPO(Off-policy Generative Policy Optimization)を導入している。
OGPOはマルチタスク設定、高精度挿入、デクスタラス制御にまたがる操作タスクにおける最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-04T18:36:40Z) - Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation [19.765462206627955]
Speedup Patch (SuP)は、オフラインデータのみを使用してプラグインとプレイのアクセラレーションを可能にするポリシーに依存しないフレームワークである。
SuPは、独自の成功率を維持しながら、さまざまなポリシーに対して、全体的な1.8倍の実行スピードアップを実現している。
論文 参考訳(メタデータ) (2026-03-21T05:29:04Z) - When to Act, Ask, or Learn: Uncertainty-Aware Policy Steering [10.01278648231868]
ポリシーステアリングは、デプロイ時にロボットの振る舞いを適用する新しい方法です。
VLM(Vision-Language Models)は、それらの推論能力のために、汎用的な検証を約束する。
セマンティックタスクの不確実性と低レベルのアクション実現可能性について共同で理由づけるフレームワークである不確実性対応型ポリシーステアリング(UPS)を提案する。
論文 参考訳(メタデータ) (2026-02-25T23:23:22Z) - Off-Policy Evaluation for Large Action Spaces via Policy Convolution [60.6953713877886]
ポリシ・コンボリューション(Policy Convolution)のファミリーは、アクション内の潜在構造を使用して、ログとターゲットポリシを戦略的に畳み込みます。
合成およびベンチマークデータセットの実験では、PCを使用する場合の平均二乗誤差(MSE)が顕著に改善されている。
論文 参考訳(メタデータ) (2023-10-24T01:00:01Z) - Offline Reinforcement Learning with On-Policy Q-Function Regularization [57.09073809901382]
ヒストリーデータセットと所望のポリシー間の分布シフトによって引き起こされる(潜在的に破滅的な)外挿誤差に対処する。
正規化により推定Q-関数を利用する2つのアルゴリズムを提案し、D4RLベンチマークに強い性能を示すことを示す。
論文 参考訳(メタデータ) (2023-07-25T21:38:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。