論文の概要: B-spline Policy: Accelerating Manipulation Policies via B-spline Action Representations
- arxiv url: http://arxiv.org/abs/2607.09648v1
- Date: Fri, 10 Jul 2026 17:46:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.457853
- Title: B-spline Policy: Accelerating Manipulation Policies via B-spline Action Representations
- Title(参考訳): B-spline Policy: B-spline Action Representationsによるマニピュレーションポリシーの高速化
- Authors: Xiaoshen Han, Haoyu Xiong, Haonan Chen, Chaoqi Liu, Antonio Torralba, Yuke Zhu, Yilun Du,
- Abstract要約: B-スプラインポリシー(B-spline Policy、BSP)は、ロボット操作ポリシーを加速するために設計されたアクション表現である。
BSPは、一連の結び目と制御点によって定義される連続B-スプライン曲線としてアクションをパラメータ化する。
- 参考スコア(独自算出の注目度): 75.39816527838181
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this work, we present B-spline Policy (BSP), an action representation designed for accelerating robot manipulation policies. Rather than predicting discrete-time action chunks, BSP parameterizes actions as continuous B-spline curves defined by a set of knots and control points. This representation yields smooth, time-continuous trajectories that can be temporally scaled and executed by low-level controllers at higher frequencies and speeds. We show that B-spline-parameterized actions can be seamlessly integrated into standard policy learning pipelines by directly predicting B-spline parameters. Experiments on simulated and real-world tasks demonstrate that BSP significantly reduces task completion time, achieving substantial improvements over baseline methods while maintaining strong success rates. More results: https://b-spline-policy.github.io
- Abstract(参考訳): 本研究では,ロボット操作ポリシーの高速化を目的とした行動表現であるB-spline Policy(BSP)を提案する。
離散時間アクションチャンクを予測するのではなく、BSPは、一連の結び目と制御点によって定義される連続したB-スプライン曲線としてアクションをパラメータ化する。
この表現は、高周波数と速度で低レベルコントローラによって時間的に拡張および実行できるスムーズで連続的な軌道を生成する。
B-splineパラメータを直接予測することにより、B-splineパラメータ化アクションを標準方針学習パイプラインにシームレスに統合できることを示す。
シミュレーションおよび実世界のタスクの実験により、BSPはタスク完了時間を著しく短縮し、高い成功率を維持しつつ、ベースライン手法よりも大幅に改善することを示した。
さらなる結果:https://b-spline-policy.github.io
関連論文リスト
- PAWS: Preference Learning with Advantage-Weighted Segments [61.590521943273]
本稿では,セグメントレベルの優位関数を用いて,ポリシー更新を直接行うセグメントベース優先学習手法を提案する。
シミュレーションされたロボット操作と移動タスクの実験は、PAWSが既存のPbRLアプローチを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-06-10T12:00:17Z) - Dynamic Execution Horizon Prediction for Chunk-based Robot Policies [29.482987292744568]
アクションチャンキングは、ポリシーが一連のアクションを予測し、一度にひとつのステップを実行するのではなく、一定数のアクションを実行する、現代のロボットポリシーの標準設計となっている。
実際には、実行の地平線は通常経験的なチューニングによって選ばれ、タスク依存度が高い。
オンライン強化学習を用いて,軽量な実行-水平予測分岐を訓練する有効な手法である動的実行-水平予測(DEHP)を提案する。
論文 参考訳(メタデータ) (2026-06-09T19:58:31Z) - Spline Policy: A Structured Representation for Robot Policies [18.73114596777634]
本稿では,アクションチャンクをスプラインパラメータに置き換える構造的表現であるスプラインポリシー(SP)について検討する。
予測スプラインは、コンパクトな連続軌道としてデコードされ、異なる時間分解能でクエリされ、パラメータ空間で制限または編集され、下流コントローラに渡される。
低次元動作学習の実験、マッチしたバックボーンの模擬操作、デキスタラス操作、および実ロボットケーススタディにより、SPは現代の政策学習者と相容れないことが示されている。
論文 参考訳(メタデータ) (2026-06-05T15:23:54Z) - OGPO: Sample Efficient Full-Finetuning of Generative Control Policies [53.42266064673132]
ジェネレーティブコントロールポリシー(GCP)は、ロボット学習に有効なパラメータ化として登場した。
この研究は、GCPを微調整するためのサンプル効率であるOGPO(Off-policy Generative Policy Optimization)を導入している。
OGPOはマルチタスク設定、高精度挿入、デクスタラス制御にまたがる操作タスクにおける最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-04T18:36:40Z) - Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation [19.765462206627955]
Speedup Patch (SuP)は、オフラインデータのみを使用してプラグインとプレイのアクセラレーションを可能にするポリシーに依存しないフレームワークである。
SuPは、独自の成功率を維持しながら、さまざまなポリシーに対して、全体的な1.8倍の実行スピードアップを実現している。
論文 参考訳(メタデータ) (2026-03-21T05:29:04Z) - ABPolicy: Asynchronous B-Spline Flow Policy for Real-Time and Smooth Robotic Manipulation [17.98625177131488]
ABPolicyは、B-スプライン制御ポイントアクション空間で動作するフローマッチングポリシーである。
非同期推論を活用することで、ABPolicyはリアルタイムの継続的更新を提供する。
実験結果から, ABPolicyは軌道ジャークを減少させ, よりスムーズな運動と性能向上をもたらすことが示された。
論文 参考訳(メタデータ) (2026-02-27T10:50:13Z) - Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking [29.920087317401396]
ジェネレーティブ・ビヘイビア・クローン(Generative Behavior Cloning)は、ロボット学習のためのシンプルで効果的なフレームワークである。
拡散政策の一貫性と反応性を高めるための2つの新しい手法を提案する。
提案手法は,多種多様なシミュレーションおよび実世界のロボット操作タスクにおいて,GBCの性能を大幅に向上させる。
論文 参考訳(メタデータ) (2025-10-14T11:16:34Z) - Relative Entropy Pathwise Policy Optimization [66.03329137921949]
そこで本稿では,Q値モデルをオンライントラジェクトリから純粋に訓練するオンラインアルゴリズムを提案する。
安定トレーニングのための制約付き更新と探索のためのポリシを組み合わせる方法を示し、価値関数学習を安定化させる重要なアーキテクチャコンポーネントを評価する。
論文 参考訳(メタデータ) (2025-07-15T06:24:07Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。