論文の概要: DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation
- arxiv url: http://arxiv.org/abs/2610.00360v1
- Date: Wed, 30 Sep 2026 04:19:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.619771
- Title: DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation
- Title(参考訳): DexPolicy: 軌道誘導型デクサラスマニピュレーションのためのスケジューリング探索
- Abstract要約: 器用な操作のための強化学習(RL)は、指と物体の接触を発見し、その物体を正確に制御する必要がある。
我々のベースラインPPOは、5Mステップ後に最初の動作ノイズの近くで終了し、探索スケールの明示的な制御を動機付けます。
PPO, 批判のないGRPO継続, フローフリーなPPOの3つのポリシー最適化設定について検討した。
- 参考スコア(独自算出の注目度): 59.77542456468077
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reinforcement learning (RL) for dexterous manipulation must discover finger-object contacts and then control the object precisely; the action noise that serves the first goal can interfere with the second. In trajectory-guided settings such as ViViDex, where RL refine hand-object trajectories from human video, our baseline PPO runs end near their initial action noise after 5M steps, motivating explicit control of exploration scale. DexPolicy makes that scale an explicit function of training steps, annealing from broad to narrow exploration while holding loss, architecture, reward, and optimizer settings fixed. We study three policy-optimization settings: PPO, critic-free GRPO continuation, and a flow-parameterized PPO variant (FPO). Across five YCB objects and three training seeds, mean deterministic Target success rises from 49.4% to 68.1% (FPO), 14.1% to 45.4% (GRPO), and 32.0% to 35.7% (PPO). On a RealMan RM75 arm with an Inspire/RH56 hand, 360 trials over three objects raise mean Target success from 25.0% to 85.0% (FPO), 10.0% to 63.3% (GRPO), and 8.3% to 43.3% (PPO), with one trained model per object-method condition. PPO component screening favors noise control over the tested optimizer contraction; the selected PPO schedule yields higher mean Target success than linear decay with the same endpoints on three tested objects. Training return, deterministic Target success, and tolerance to execution noise dissociate; schedules should therefore be judged by terminal task success under the intended execution conditions, per task and policy-optimization setting. Code: https://github.com/AIGeeksGroup/DexPolicy. Website: https://aigeeksgroup.github.io/DexPolicy.
- Abstract(参考訳): 器用な操作のための強化学習(RL)は、指と物体の接触を発見し、その物体を正確に制御する必要がある。
人間のビデオから手動物体の軌跡を精製するViViDexのような軌跡誘導方式では,5Mステップの後にベースラインのPPOが初期動作音の近くで終了し,探索スケールの明示的な制御を動機付ける。
DexPolicyは、このスケールをトレーニングステップの明示的な機能として、損失、アーキテクチャ、報酬、オプティマイザ設定を固定しつつ、広い範囲から狭い範囲の探索にアニールする。
PPO, 批判のないGRPO継続, フローパラメータ付きPPO変種 (FPO) の3つのポリシー最適化設定について検討した。
5つのYCBオブジェクトと3つの訓練種子で、決定論的ターゲットの成功率は49.4%から68.1%(FPO)、14.1%から45.4%(GRPO)、32.0%から35.7%(PPO)に上昇する。
インスパイア/RH56ハンドを持つRealMan RM75アームでは、3つの物体に対する360度試験は、平均目標成功率を25.0%から85.0%(FPO)、10.0%から63.3%(GRPO)、8.3%から43.3%(PPO)に引き上げる。
PPO成分スクリーニングは、試験されたオプティマイザの収縮よりもノイズ制御を好んでおり、選択されたPPOスケジュールは、3つの試験されたオブジェクトに同じエンドポイントを持つ線形減衰よりも高い平均的なターゲット成功をもたらす。
トレーニングリターン、決定論的目標達成、実行騒音への耐性は解離するので、スケジュールは、意図された実行条件下での終了タスク成功、タスクごとのタスクとポリシー最適化設定によって判断されるべきである。
コード:https://github.com/AIGeeksGroup/DexPolicy
Webサイト: https://aigeeksgroup.github.io/DexPolicy.com
関連論文リスト
- On-Policy Self-Distillation in Diffusion Models [89.32656931795293]
強化学習は、拡散モデルと人間の好みやタスク固有の目的とを一致させることができるが、エンドポイント報酬は、中間的偏見予測をどのように変更すべきかを規定していない。
そこで我々は、DiffusionOPSDを、画像レベルの報酬誘導を明示的なターゲットに変換して、サンプルクエリにおけるクリーンな出力予測を行うオンライン自己蒸留フレームワークとして導入する。
SD 3.5-Mとステップ蒸留したZ-Image-Turboを用いて、2つのバックボーンと10個の評価器で20の報酬マッチング設定のうち19のファイナルホールトアウトスコアを達成した。
論文 参考訳(メタデータ) (2026-08-25T14:55:24Z) - expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling [11.537163059885687]
2つの軽量プラグインモジュールを用いたExploration-Prioritized Policy Optimization (EXPO)を提案する。
我々は6つの数学的推論ベンチマークでDeepSeek-R1-Distill-Qwen-1.5BとQwen3-8B-Baseの実験を行った。
AIME 2025 pass@32では13.34で、63.33パーセントから76.67パーセントに上昇し、8Bモデルでは平均2.66でパス@32が改善されている。
論文 参考訳(メタデータ) (2026-05-11T03:19:04Z) - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing [79.88256756334327]
自己蒸留政策最適化(SDPO)は、より密集したロジットレベルの監視を提供することによってこの問題に対処する。
サンプル制御ポリシー最適化(SRPO)を提案する。
SRPOは、試料をGRPOの報酬整合強化に向け、サンプルをSDPOの目標ロジットレベルの補正に向ける。
論文 参考訳(メタデータ) (2026-04-02T17:29:18Z) - FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization [84.58281577727566]
本稿では,大規模言語モデルにおける推論ボトルネックを克服する強化学習アルゴリズムであるFuture-KL Influenced Policy Optimization (FIPO)を提案する。
FIPOは、割引先KLの分岐をポリシー更新に組み込むことでこの問題に対処し、その後の軌道行動への影響に基づいてトークンを再重み付けする密集した有利な定式化を作成する。
Qwen2.5-32Bで評価され、FIPOは平均チェーン長を約4,000から10,000以上のトークンに拡張し、AIME 2024 Pass@1の精度を50.0%から58.0%に向上させた。
論文 参考訳(メタデータ) (2026-03-20T10:24:50Z) - DCPO: Dynamic Clipping Policy Optimization [19.56559858821034]
強化学習のための動的クリッピングポリシー最適化(DCPO)を提案する。
DCPOはトークン固有の事前確率に基づいてクリッピング境界を調整し、トークンレベルの探索を強化する。
累積的なトレーニングステップ全体で報酬を標準化し、生成されたレスポンスのレスポンスレベルの効果的な利用を改善する。
論文 参考訳(メタデータ) (2025-09-02T14:01:07Z) - BPO: Revisiting Preference Modeling in Direct Preference Optimization [13.243174453617064]
DPO (Direct Preference Optimization) は、Large Language Models (LLM) を人間の好みに合わせる一般的な手法として登場した。
DPOは、ペアのランク付け損失を通じて、選択された応答と拒否された応答の相対順序を効果的に保持する。
それはしばしば絶対的な報酬の程度を無視し、パフォーマンスを低下させる。
本稿では,選択された応答と拒否された応答の最適化のバランスをとる新しいフレームワークであるBa balanced Preference Optimization (BPO)を提案する。
論文 参考訳(メタデータ) (2025-06-04T04:21:01Z) - Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs [54.05511925104712]
本稿では,Step-DPOと呼ばれるシンプルで効果的でデータ効率のよい手法を提案する。
Step-DPOは、個々の推論ステップを、論理的に回答を評価するのではなく、優先最適化の単位として扱う。
以上の結果から,70B パラメータ以上のモデルでは,10K の選好データペアと500 Step-DPO トレーニングステップ以下では,MATH の精度が約3%向上する可能性が示唆された。
論文 参考訳(メタデータ) (2024-06-26T17:43:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。