論文の概要: MPC-Injection: Biasing Off-Policy Locomotion RL Toward Controller-Induced Behavior Basins
- arxiv url: http://arxiv.org/abs/2606.26392v1
- Date: Wed, 24 Jun 2026 21:23:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.085667
- Title: MPC-Injection: Biasing Off-Policy Locomotion RL Toward Controller-Induced Behavior Basins
- Title(参考訳): MPC注入:制御誘起挙動盆地へのオフポリシィロコモーションRLのバイザリング
- Authors: Roy Xing, Seyoung Ree, Brian Plancher,
- Abstract要約: 制御器の動作流域にポリシーを駆動する低オーバーヘッド方式であるMPC-Injectionを提案する。
報酬形成とは異なり、MPC-インジェクションはタスク報酬の再設計を必要としない。
MPC-Injectionは1対2のタスク報酬を用いて制御器の動作盆地にポリシーを誘導することを示す。
- 参考スコア(独自算出の注目度): 7.729687505744033
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) for locomotion frequently converges to locally optimal but undeployable behaviors, such as vibrating limbs or scooting on the torso, that maximize return without producing a usable gait. We present MPC-Injection, a low-overhead method that steers RL toward a designer-preferred gait by inserting transitions into the replay buffer from a model predictive controller solving the same Markov decision process. Unlike reward shaping, MPC-Injection does not require redesigning the task reward, and unlike adversarial imitation learning, it adds no discriminator, no kinematic retargeting, and no auxiliary objective. Instead, the controller's preferred behavior is transferred to the policy purely through the replay state distribution. On a 2D walker in simulation and with sim-to-real evaluation on a Go2 quadruped, we show that MPC-Injection drives the policy into the controller's behavior basin using a one to two-term task reward, producing gaits qualitatively comparable to those of reward shaping with twenty-one tuned terms and of adversarial motion priors without their discriminator and retargeting overhead. We further analyze how the injected transitions bias actor-critic updates toward controller-visited states, allowing the policy to learn behaviors that pure RL may fail to reach under simple reward functions.
- Abstract(参考訳): ローコモーションのための強化学習(RL)は、しばしば、使用可能な歩行を作らずにリターンを最大化する、手足の振動や胴体へのスクーティングなど、局所的に最適であるが、デプロイ不能な行動に収束する。
MPC-インジェクション(MPC-Injection)は,モデル予測制御器からリプレイバッファに遷移を挿入することで,RLを設計者優先の歩行に向けて操る低オーバーヘッド方式である。
報酬形成とは異なり、MPC-インジェクションはタスク報酬の再設計を必要としない。
その代わり、コントローラの望ましい動作は、リプレイ状態分布を通じて純粋にポリシーに転送される。
シミュレーションにおける2次元歩行と、Go2四重奏のシミュ-トリアル評価では、MPC-インジェクションが1対2のタスク報酬を用いて、制御器の動作台にポリシーを駆動し、21のチューニング項による報酬形成と対向運動の前処理を区別することなく、オーバーヘッドを再ターゲティングする。
さらに、インジェクションされた遷移がアクターに批判的な状態にバイアスを与え、純粋なRLが単純な報酬関数で到達できない振る舞いを学習できるようにする。
関連論文リスト
- RGB: RL Guided Whole-Body MPPI for Humanoid Control [2.854451361373021]
本稿では,アドオンフィードバックコントローラとして機能するRLガイド付き全身モデル予測パス積分(MPPI)フレームワークを提案する。
提案手法は,同じコマンドインタフェース下での純粋RLベースライン上でのタスクレベル精度を向上させる。
論文 参考訳(メタデータ) (2026-06-23T19:54:02Z) - Probabilistic Recurrent Intention Switching Model [8.25071593831945]
逆強化学習(IRL)は、観察された行動から報酬関数を回復するが、伝統的な手法では、エピソード内でゴール切替を捉えることができない単一の定常報酬を仮定する。
近年のマルチインテンションIRL法は、トラジェクトリをセグメント化することでこの問題に対処しているが、モデル意図の遷移はメモリレスマルコフ連鎖または固定された履歴ウィンドウによる手動状態拡張のいずれかである。
本稿では,観測履歴をステップごとの意図分布にマッピングする軽量なリカレントネットワークを両機構に置き換える確率的リカレントインテンションスイッチングモデル(PRISM)を提案する。
論文 参考訳(メタデータ) (2026-05-26T13:19:00Z) - Insect-inspired modular architectures as inductive biases for reinforcement learning [0.0]
本稿では,センサエンコーディング,方向表現,疎結合メモリ,リカレントコマンド生成,ローカルモータ制御などの操作モジュールに制御を分解するRLポリシーアーキテクチャについて検討する。
このモデルは、2次元ナビゲーションタスクで評価され、同時に食物探索、障害物回避、捕食者の脱出が必要となる。
論文 参考訳(メタデータ) (2026-04-23T21:26:31Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning [59.76691952347156]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なフレームワークとして登場した。
既存のRLアプローチの多くは疎結果報酬に依存しており、部分的に成功した解では正しい中間段階を信用できない。
本稿では、PRMを用いてRL中の最初のエラーをローカライズする検証済み事前修正ポリシー最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2026-01-26T21:38:20Z) - SPACeR: Self-Play Anchoring with Centralized Reference Models [50.55045557371374]
Simエージェントポリシーは、現実的で、人間らしく、高速で、マルチエージェント設定でスケーラブルである。
大規模な拡散モデルやトークン化モデルを用いた模倣学習の最近の進歩は、人間の運転データから直接行動を把握することができることを示している。
本研究では,事前訓練されたトークン化自己回帰運動モデルを利用したSPACeRを提案する。
論文 参考訳(メタデータ) (2025-10-20T19:53:02Z) - Double Check My Desired Return: Transformer with Target Alignment for Offline Reinforcement Learning [64.6334337560557]
教師付き学習(RvS)による強化学習は、シーケンスモデリングタスクとしてオフラインRLをフレーム化する。
決定変換器(DT)は、実際の完了したリターンを特定のターゲットリターンと確実に整合させるのに苦労する。
そこで我々は,Offline RLの目標アライメントによる変換器の二重チェックを行う新しいアプローチであるDoctorを提案する。
論文 参考訳(メタデータ) (2025-08-22T14:30:53Z) - Post-Convergence Sim-to-Real Policy Transfer: A Principled Alternative to Cherry-Picking [5.027571997864706]
本稿では,最短ケースの性能伝達最適化手法を導入することで,コンバージェンス後のsim-to-real転送問題に対処する。
実験は、シミュレーションから実世界の実験室にRLに基づく移動ポリシーを移すことの有効性を実証した。
論文 参考訳(メタデータ) (2025-04-21T19:48:05Z) - Optimal Controller Realizations against False Data Injections in Cooperative Driving [2.2134894590368748]
本研究では,False-Data Injection(FDI)攻撃の効果を緩和するためのコントローラ指向アプローチについて検討する。
我々は,新しいが等価なコントローラのクラスがベースコントローラを表現可能であることを示す。
FDI攻撃の影響を最小限に抑えるセンサの最適組み合わせを得る。
論文 参考訳(メタデータ) (2024-04-08T09:53:42Z) - REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback [61.54791065013767]
報酬関数と人間の嗜好の相違は、現実世界で破滅的な結果をもたらす可能性がある。
近年の手法は、人間の嗜好から報酬関数を学習することで、不適応を緩和することを目的としている。
本稿では,ロボットRLHFフレームワークにおける報酬正規化の新たな概念を提案する。
論文 参考訳(メタデータ) (2023-12-22T04:56:37Z) - Residual Reinforcement Learning from Demonstrations [51.56457466788513]
報酬信号の最大化のために,従来のフィードバックコントローラからの制御動作を適用することで,ロボット作業の課題を解決する手段として,残留強化学習(Residual reinforcement learning, RL)が提案されている。
視覚的インプットから学習するための残差定式化を拡張し,実演を用いて報酬をスパースする。
6-DoFのUR5アームと28-DoFのデキスタラスハンドのシミュレーション操作に関する実験的評価は、デモからの残留RLが、行動クローニングやRL微調整よりも柔軟に、見えない環境条件に一般化できることを実証している。
論文 参考訳(メタデータ) (2021-06-15T11:16:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。