論文の概要: LieSpline-DP: Lie-Group B-Spline Diffusion Policy for Smooth Robot Manipulation
- arxiv url: http://arxiv.org/abs/2609.15162v2
- Date: Wed, 16 Sep 2026 03:25:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.410685
- Title: LieSpline-DP: Lie-Group B-Spline Diffusion Policy for Smooth Robot Manipulation
- Title(参考訳): LieSpline-DP:Smooth Robot ManipulationのためのLie-Group B-Spline Diffusion Policy
- Abstract要約: 拡散政策(DP)はロボット操作のための強力な学習法である。
We propose LieSpline-DP, a Lie-group B-spline diffusion policy that generate end-effector trajectories on $mathrmSE(3)$ and couples continuous plan by shared their boundary control poses。
3つの実ロボットタスクの中で、LieSpline-DPはDPベースラインよりも低軌道ジャークと高いタスク成功率を生成する。
- 参考スコア(独自算出の注目度): 22.20874978947876
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion Policy (DP) is a powerful Learning from Demonstration (LfD) method for robotic manipulation, yet it suffers from discontinuous and non-smooth trajectories. Spline-based action representations promote smooth motion within individual action chunks, but existing spline-based methods neither guarantee cross-chunk $C^2$ continuity nor account for the group structure of $\mathrm{SE}(3)$. We therefore propose LieSpline-DP, a Lie-group B-spline diffusion policy that generates end-effector trajectories directly on $\mathrm{SE}(3)$ and couples consecutive plans by sharing their boundary control poses, ensuring $C^2$ continuity throughout the entire planned trajectory. Across three real-robot tasks, LieSpline-DP produces lower trajectory jerk and higher task success rates than the DP baseline. The gains are particularly pronounced in real-world tasks involving liquids and flexible objects: in our real-robot experiments, LieSpline-DP achieved a 100% success rate on both pouring and bucket hooking, whereas the DP baseline achieved only 10% and 30%, respectively.
- Abstract(参考訳): 拡散政策(DP)はロボット操作のための強力な学習法である。
スプラインベースのアクション表現は、個々のアクションチャンク内の滑らかな動きを促進するが、既存のスプラインベースのメソッドは、クロスチャンク$C^2$連続性や$\mathrm{SE}(3)$の群構造を保証しない。
そこで我々は,Lie-group B-spline 拡散政策である Lie-Spline-DP を提案する。これは,$\mathrm{SE}(3)$ 上で直接エンドエフェクタトラジェクトリを生成し,それらの境界制御のポーズを共有することで連続的なプランを結合することにより,計画された軌道全体を通して$C^2$連続性を確保する。
3つの実ロボットタスクの中で、LieSpline-DPはDPベースラインよりも低軌道ジャークと高いタスク成功率を生成する。
実際のロボット実験では、LieSpline-DPは注水とバケットフックの両方で100%成功し、DPベースラインは10%と30%に過ぎなかった。
関連論文リスト
- B-spline Policy: Accelerating Manipulation Policies via B-spline Action Representations [75.39816527838181]
B-スプラインポリシー(B-spline Policy、BSP)は、ロボット操作ポリシーを加速するために設計されたアクション表現である。
BSPは、一連の結び目と制御点によって定義される連続B-スプライン曲線としてアクションをパラメータ化する。
論文 参考訳(メタデータ) (2026-07-10T17:46:32Z) - PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models [50.232333672172395]
VLA(Vision-Language-Action)モデルは、ロボット操作の統一パラダイムを提供するが、実際のデプロイメントは実行効率によってボトルネックになることが多い。
強化学習に基づくポストトレーニングフレームワークである textbfPolicyTrim を提案する。
私たちのフレームワークは、タスクの成功率を損なうことなく、最大5.83$times$エンドツーエンドのデプロイメントスピードアップを提供します。
論文 参考訳(メタデータ) (2026-06-21T14:54:07Z) - Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections [25.961145214027255]
拡散ポリシーは、ロボットの望ましくない行動と人間の教師の矯正行動の形でペア化された監督を提供する。
提案するSDP(Set-Supervised Diffusion Policy)は,コントラッシブなアクションチャンクデータを用いて,人間の修正から拡散ポリシーを訓練する新しい学習フレームワークである。
SDPは、特にノイズの多いデータに対するロバスト性において、ポリシーパフォーマンスを継続的に改善する。
論文 参考訳(メタデータ) (2026-06-01T08:14:38Z) - The Lie We Tell: Correcting the Euclidean Fallacy in Vision Language Action Policies via Score Matching on Tangent Space [19.950575615573978]
本報告では,SE(3)を内在的に運用する拡散フレームワークを提案する。
本手法は,左不変SDEを用いてノイズを注入し,空間接点のスコアを予測し,指数写像を用いてサンプルを抽出する。
CALVIN ABC$rightarrow$Dでは、平均タスク長が$3.27$から$3.51$+7.3%$に改善されている。
論文 参考訳(メタデータ) (2026-06-01T07:59:29Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - Sampling-Based Follow-the-Leader Motion Planning for Manipulator-Mounted Continuum Robots [4.355077219923408]
FTL(Follow-the- Leader)運動は、連続体ロボット(CR)のユニークな形態を利用して、体が先端の経路を追従することで、閉じ込められた空間をナビゲートする。
本稿では,ロボット構成とベースポーズを協調的に考慮したマニピュレータ搭載CRのFTL動作のためのサンプリングベースモーションプランナを提案する。
論文 参考訳(メタデータ) (2026-05-12T06:46:13Z) - REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning [23.094280494500214]
本稿では,DP高レベルプランナとRLに基づく低レベルロコ操作制御を協調的に最適化する階層型フレームワークであるREFINE-DPを提案する。
REFINE-DPは、事前訓練されたデータに見られない配布外ケースであっても、シミュレーションで90%以上の成功率を達成する。
論文 参考訳(メタデータ) (2026-03-14T02:21:19Z) - Self-Guided Action Diffusion [53.38661283705301]
自己誘導的行動拡散は、拡散に基づくポリシーに適した双方向デコーディングのより効率的な変種である。
本手法は,従来の動的タスクよりも最大70%高い成功率を達成する。
論文 参考訳(メタデータ) (2025-08-17T00:39:15Z) - Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning [49.48615590763914]
我々は,モンテカルロ木探索法を用いて効率的な行動探索と操作を行うLCBTというブラックボックス攻撃アルゴリズムを提案する。
提案手法は, DDPG, PPO, TD3の3つの攻撃的アルゴリズムに対して, 連続的な設定で実行し, 攻撃性能が期待できることを示す。
論文 参考訳(メタデータ) (2024-11-20T08:20:29Z) - One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion Distillation [80.71541671907426]
OneStep Diffusion Policy (OneDP)は、事前訓練された拡散政策から知識を単一ステップのアクションジェネレータに蒸留する新しいアプローチである。
OneDPはロボット制御タスクの応答時間を著しく短縮する。
論文 参考訳(メタデータ) (2024-10-28T17:54:31Z) - Provably Efficient Offline Reinforcement Learning with Trajectory-Wise
Reward [66.81579829897392]
我々はPessimistic vAlue iteRaTionとrEward Decomposition (PARTED)という新しいオフライン強化学習アルゴリズムを提案する。
PartEDは、最小2乗ベースの報酬再分配を通じて、ステップごとのプロキシ報酬に軌道を分解し、学習したプロキシ報酬に基づいて悲観的な値を実行する。
私たちの知る限りでは、PartEDは、トラジェクティブな報酬を持つ一般のMDPにおいて、証明可能な効率のよい最初のオフラインRLアルゴリズムである。
論文 参考訳(メタデータ) (2022-06-13T19:11:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。