論文の概要: Potential-Field Action Representation for Reinforcement Learning in Contact-Rich Manipulation
- arxiv url: http://arxiv.org/abs/2609.21609v1
- Date: Fri, 18 Sep 2026 10:46:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:17.026059
- Title: Potential-Field Action Representation for Reinforcement Learning in Contact-Rich Manipulation
- Title(参考訳): コンタクトリッチ操作における強化学習のための電位場行動表現
- Abstract要約: 人工電位場をアクション表現として利用する強化学習フレームワークPA-RLを提案する。
運動を直接指揮する代わりに、政策はエネルギーのようなポテンシャル場のパラメータに適応し、状態依存の誘導方向を生成する。
- 参考スコア(独自算出の注目度): 16.574472198582836
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model-free reinforcement learning can acquire contact-rich robotic manipulation skills through trial-and-error interaction, but it often requires the policy to learn both task strategy and low-level motion generation. In this setting, the action representation is critical because it determines how policy outputs are converted into robot motion, shaping both exploration and physical execution. Direct Cartesian command interfaces require the policy to generate motion at every decision step, coupling task-level adaptation with continuous low-level control and increasing the learning burden. We propose PA-RL, a reinforcement-learning framework that uses artificial potential fields as the action representation. Instead of commanding motion directly, the policy adapts the parameters of an energy-like potential field, which generates a state-dependent guidance direction executed through a Cartesian impedance controller. We evaluate PA-RL on peg-in-hole insertion, a representative contact-rich task with nonlinear dynamics and discontinuous contact transitions. In simulation, PA-RL is compared with Cartesian velocity, Cartesian pose, and variable-impedance action spaces using the same RL algorithm. PA-RL is the only method to reach a 100% evaluation success rate within the allotted training time, while the best baseline reaches 92.6%. It also reduces joint-torque variation by 55.4% and Cartesian acceleration variation by 70.8% relative to the best baseline, without explicit motion-quality penalties in the reward. The simulation-trained policy further completes 9/9 real-robot insertions without fine-tuning, demonstrating the deployment feasibility of the learned potential-field interface.
- Abstract(参考訳): モデルなし強化学習は、試行錯誤の相互作用を通じて、接触に富んだロボット操作技術を習得することができるが、多くの場合、タスク戦略と低レベルのモーション生成の両方を学ぶためのポリシーが必要である。
この設定では、ポリシー出力がロボットの動きにどのように変換されるかを決定し、探索と物理実行の両方を形作るため、アクション表現が重要となる。
直カルテシアンコマンドインタフェースは、決定ステップ毎に動作を生成するポリシー、タスクレベル適応と連続的な低レベル制御を結合し、学習負担を増大させるポリシーを必要とする。
人工電位場をアクション表現として利用する強化学習フレームワークPA-RLを提案する。
運動を直接指揮する代わりに、このポリシーはエネルギーのようなポテンシャル場のパラメータに適応し、カルテシアンインピーダンスコントローラによって実行される状態依存誘導方向を生成する。
本研究では, ペグインホール挿入におけるPA-RLの評価を行い, 非線形ダイナミックスと不連続接触遷移を伴う代表的接触リッチタスクについて検討した。
シミュレーションでは、PA-RLを同じRLアルゴリズムを用いて、カルト速度、カルトポーズ、可変インピーダンスアクション空間と比較する。
PA-RLは、与えられたトレーニング時間内で100%評価成功率に達する唯一の方法であり、最高のベースラインは92.6%に達する。
また、関節トルクの変動を55.4%減らし、カルテシア加速度の変動を70.8%減らした。
シミュレーション訓練されたポリシーは、微調整なしで9/9個の実ロボットの挿入を完了し、学習した潜在的なインタフェースのデプロイ可能性を示す。
関連論文リスト
- VGFM: Expressive Robot Policies via Dense Value Guidance in Flow Matching [2.7429630700600893]
本稿では,フローベースのポリシ内で高密度な値誘導型シェーピングを可能にする,スケーラブルなオフラインRLフレームワークを提案する。
VGFMは、アクション(x-述語)空間における条件付きフローマッチングモデルとしてポリシーをパラメータ化する。
本稿では,厳密な評価プロトコルの下で,VGFMが幅広いタスクに対して高い性能を実現することを示す。
論文 参考訳(メタデータ) (2026-09-13T03:50:52Z) - TacCoRL: Integrating Tactile Feedback into VLA via Simulation [38.963250081631834]
視覚言語アクション(VLA)モデルは、ロボット操作のための強力な視覚、言語、行動の優先順位を提供する。
我々は、VLAポリシーに触覚フィードバックを注入するスケーラブルなフレームワークであるTacCoRLを提案する。
我々は,接触操作のためのクローズドループトレーニング環境として,実列シミュレータを用いる。
論文 参考訳(メタデータ) (2026-06-10T07:20:36Z) - Learning Object Manipulation from Scratch via Contrastive Interaction [29.976379315147756]
コントラスト強化学習(CRL)は、動的に構造化された表現を学習することで、様々な目標条件のロボットタスクで最近成功している。
この困難の鍵となる要因は、接触や握りなどのオブジェクト中心の相互作用であり、基礎となる動的モードの異なる変化を誘発するものである、と我々は主張する。
本研究では, 操作力学を平滑なマルコフ過程として定式化し, 相互作用誘起モード変化が非線形到達性構造を生成することを示す。
論文 参考訳(メタデータ) (2026-06-10T00:06:24Z) - Flow Policy Gradients for Robot Control [67.61978635211048]
フローマッチングポリシ勾配は、より表現力のあるポリシのトレーニングと微調整に有効である。
我々は、スクラッチからトレーニングを行う際に、フロー表現をどのように活用するかを示し、ベースラインよりもきめ細やかな堅牢性を改善する。
論文 参考訳(メタデータ) (2026-02-02T18:56:49Z) - Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions [31.697208397735395]
既存のアプローチでは、タスク固有の値関数を制約付き最適化プログラムに組み込むか、決定論的構造化ポリシーを学習し、汎用性とポリシー表現性を犠牲にする。
本稿では, 設計による実現性を確保しつつ, 近代的な生成ポリシーの表現性をRLにもたらす, 解法による球面フローポリシーを提案する。
我々のアプローチは、さまざまな課題RLタスクにおいて、最先端のベースラインを平均20.6%上回る。
論文 参考訳(メタデータ) (2026-01-29T18:49:07Z) - Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation [58.95799126311524]
人間は視覚と触覚を使って、外的変化に対する迅速な応答や接触力の適応制御のような非常に反応性の高い能力で、コンタクトリッチなタスクを達成できる。
既存の視覚模倣学習アプローチは、複雑な振る舞いをモデル化するためにアクションチャンキングに依存している。
本稿では,Augmented Realityを通じてリアルタイム触覚フィードバックを提供する,低コスト遠隔操作システムであるTactARを紹介する。
論文 参考訳(メタデータ) (2025-03-04T18:58:21Z) - Distilling Reinforcement Learning Policies for Interpretable Robot Locomotion: Gradient Boosting Machines and Symbolic Regression [53.33734159983431]
本稿では, ニューラルRLポリシをより解釈可能な形式に蒸留する新しい手法を提案する。
我々は、RLを用いて専門家のニューラルネットワークポリシーを訓練し、(i)GBM、(ii)EBM、(iii)シンボリックポリシーに蒸留する。
論文 参考訳(メタデータ) (2024-03-21T11:54:45Z) - Action-Quantized Offline Reinforcement Learning for Robotic Skill
Learning [68.16998247593209]
オフライン強化学習(RL)パラダイムは、静的な行動データセットを、データを収集したポリシーよりも優れたパフォーマンスのポリシーに変換するためのレシピを提供する。
本稿では,アクション量子化のための適応型スキームを提案する。
IQL,CQL,BRACといった最先端のオフラインRL手法が,提案手法と組み合わせることで,ベンチマークのパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2023-10-18T06:07:10Z) - Learning Off-Policy with Online Planning [18.63424441772675]
本研究では,学習モデルと端末値関数を用いたHステップルックアヘッドの新たなインスタンス化について検討する。
ナビゲーション環境の集合に配置する際の安全性制約を組み込むLOOPの柔軟性を示す。
論文 参考訳(メタデータ) (2020-08-23T16:18:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。