論文の概要: Beyond Noise Steering: Dual-Latent Space Reinforcement Learning for Generative Robot Policy
- arxiv url: http://arxiv.org/abs/2609.11270v1
- Date: Thu, 10 Sep 2026 09:04:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.27711
- Title: Beyond Noise Steering: Dual-Latent Space Reinforcement Learning for Generative Robot Policy
- Title(参考訳): 騒音ステアリングを超えて: 生成ロボット政策のための双潜時空間強化学習
- Abstract要約: 事前訓練された生成ロボットポリシーは、デモの前に表現行動を学ぶ。
既存の強化学習法はノイズ空間のみを操るが、生成過程中に中間的な動作表現を変調することができない。
そこで本研究では,凍結発生器内の表現レベル制御で初期ノイズの操舵を補完する新しいDual-Latent Space Reinforcement Learningフレームワークを提案する。
- 参考スコア(独自算出の注目度): 13.530890681678619
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pretrained generative robot policies learn expressive action priors from demonstrations. However, existing reinforcement learning methods only steer the noisy space but fail to modulate intermediate action representations during the generation process, resulting in performance degradation and inefficiency. To address this limitation, we propose a novel Dual-Latent Space Reinforcement Learning (DLSRL) framework, which complements initial-noise steering with representation-level control inside the frozen generator. Specifically, our actor network predicts two distinct latent variables: an initial-noise latent variable that steers behavior generation, and an action-representation latent variable for intermediate feature modulation. Moreover, this representation latent variable is mapped to adapter features and ingeniously injected into the hidden states of intermediate action tokens via residual connections. Our dual-control design enables direct adjustment of action representations without updating the base policy. Experiments across generative policy architectures and robotic manipulation tasks show that DLSRL effectively accelerates online robot policy adaptation and achieves competitive performance. Our code is available at \href{https://github.com/xianchaoxiu/DLSRL}{https://github.com/xianchaoxiu/DLSRL}.
- Abstract(参考訳): 事前訓練された生成ロボットポリシーは、デモンストレーションから表現力のある行動先行を学習する。
しかし、既存の強化学習法はノイズ空間のみを操縦するが、生成過程中に中間的な動作表現を変調できず、性能劣化と非効率をもたらす。
この制限に対処するため,凍結発生器内の表現レベル制御で初期ノイズの操舵を補完する新しいDual-Latent Space Reinforcement Learning (DLSRL) フレームワークを提案する。
具体的には、アクターネットワークは、動作生成を制御する初期雑音潜時変数と、中間的特徴変調のためのアクション表現潜時変数の2つの異なる潜時変数を予測する。
さらに、この表現潜在変数はアダプタの特徴にマッピングされ、残留接続を介して中間アクショントークンの隠れ状態に巧みに注入される。
我々の二重制御設計は、基本方針を更新することなく、アクション表現を直接調整できる。
生成ポリシーアーキテクチャとロボット操作タスクによる実験は、DLSRLがオンラインロボットポリシーの適応を効果的に加速し、競争性能を達成することを示す。
我々のコードは \href{https://github.com/xianchaoxiu/DLSRL}{https://github.com/xianchaoxiu/DLSRL} で入手できる。
関連論文リスト
- StructRL: Structured Action-Space Exploration for Flow-Based VLAs [81.43458629514139]
フローベースのビジョン・ランゲージ・アクションモデルは現在、連続的なロボット操作に広く使われている。
オンライン強化学習は、それらを新しいタスクに適応するための重要なテクニックとして浮上している。
動作群間で時間的にスムーズかつスケールの異なる,構造的雑音に対する効果的なロボット探索の必要性を示す。
論文 参考訳(メタデータ) (2026-08-15T09:31:29Z) - SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation [35.54319311306262]
SLIM はコンパクトな潜在相互作用ポリシーである。
自己教師付きマスク付き軌道予測を通じて表現を学習する。
SLIMは、より少ないパラメータで、大規模なVLAとワールドアクションモデルベースラインとを一致または超える。
論文 参考訳(メタデータ) (2026-08-10T15:58:39Z) - FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space [15.351960740594201]
FlowDAggerは、潜伏空間における人間の介入から凍結した生成ロボットポリシーを適用するためのサンプルおよび計算効率のよい方法である。
私たちのキーとなるアイデアはアクション・インバージョン(アクション・インバージョン)です。
本研究では,FlowDAggerのシミュレーションおよび実世界のバイマニュアルおよびシングルアーム操作について評価する。
論文 参考訳(メタデータ) (2026-07-09T19:07:33Z) - Learning Object Manipulation from Scratch via Contrastive Interaction [29.976379315147756]
コントラスト強化学習(CRL)は、動的に構造化された表現を学習することで、様々な目標条件のロボットタスクで最近成功している。
この困難の鍵となる要因は、接触や握りなどのオブジェクト中心の相互作用であり、基礎となる動的モードの異なる変化を誘発するものである、と我々は主張する。
本研究では, 操作力学を平滑なマルコフ過程として定式化し, 相互作用誘起モード変化が非線形到達性構造を生成することを示す。
論文 参考訳(メタデータ) (2026-06-10T00:06:24Z) - Primary-Fine Decoupling for Action Generation in Robotic Imitation [91.2899765310853]
ロボット操作動作シーケンスにおけるマルチモーダル分布は、模倣学習にとって重要な課題である。
PF-DAG(プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、PF-DAG)を提案する。
PF-DAGは、Adroit、DexArt、MetaWorldベンチマークの56タスクで最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-25T08:36:45Z) - FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation [50.39748673817223]
本稿では,ロボットビデオ生成における明示的な動作パラメータを完全に活用する2つのトレーニング不要な推論時間手法を提案する。
第一に、アクションスケールの分類器フリーガイダンスは、動作の大きさに比例して誘導強度を動的に調整し、運動強度に対する制御性を高める。
第二に、アクションスケールノイズトランケーションは、初期サンプルノイズの分布を調整し、所望の運動力学とよりよく一致させる。
論文 参考訳(メタデータ) (2025-09-29T03:30:40Z) - One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion Distillation [80.71541671907426]
OneStep Diffusion Policy (OneDP)は、事前訓練された拡散政策から知識を単一ステップのアクションジェネレータに蒸留する新しいアプローチである。
OneDPはロボット制御タスクの応答時間を著しく短縮する。
論文 参考訳(メタデータ) (2024-10-28T17:54:31Z) - Autoregressive Action Sequence Learning for Robotic Manipulation [32.9580007141312]
既存の自己回帰型アーキテクチャは、言語モデリングにおいて単語トークンとして順次、エンドエフェクタ・ウェイポイントを生成する。
我々は、因果変換器の単一トークン予測を拡張し、単一のステップで可変数のトークンを予測する。
本稿では,ハイブリッドなアクションシーケンスを生成することで操作タスクを解消するAutoregressive Policyアーキテクチャを提案する。
論文 参考訳(メタデータ) (2024-10-04T04:07:15Z) - Training and Evaluation of Deep Policies using Reinforcement Learning
and Generative Models [67.78935378952146]
GenRLはシーケンシャルな意思決定問題を解決するためのフレームワークである。
強化学習と潜在変数生成モデルの組み合わせを利用する。
最終方針訓練の性能に最も影響を与える生成モデルの特徴を実験的に決定する。
論文 参考訳(メタデータ) (2022-04-18T22:02:32Z) - Neural Dynamic Policies for End-to-End Sensorimotor Learning [51.24542903398335]
感覚運動制御における現在の主流パラダイムは、模倣であれ強化学習であれ、生の行動空間で政策を直接訓練することである。
軌道分布空間の予測を行うニューラル・ダイナミック・ポリシー(NDP)を提案する。
NDPは、いくつかのロボット制御タスクにおいて、効率と性能の両面で、これまでの最先端よりも優れている。
論文 参考訳(メタデータ) (2020-12-04T18:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。