論文の概要: SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.09138v2
- Date: Tue, 11 Aug 2026 17:14:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.684982
- Title: SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning
- Title(参考訳): SpeedTuning: 軽量強化学習によるポリシ実行の高速化
- Authors: David D. Yuan, Tony Z. Zhao, Kaylee Burns, Chelsea Finn,
- Abstract要約: 我々は,操作ポリシーの高速化に特化して設計された強化学習フレームワークであるSpeedTuningを紹介する。
SpeedTuningはアクションの最適な実行速度を予測し、基本ポリシーを補完する。
我々は、SpeedTuningが2.4倍のスピードアップで実行速度を大幅に改善する実証的な証拠を提供する。
- 参考スコア(独自算出の注目度): 44.701558695482476
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While learned robotic policies hold promise for advancing generalizable manipulation, their practical deployment is often hindered by suboptimal execution speeds. Imitation learning policies are inherently limited by hardware constraints and the speed of the operator during data collection. In addition, there are no established methods for accelerating policies learned via imitation, and the empirical relationship between execution speed and task success remains underexplored. To address these issues, we introduce SpeedTuning, a reinforcement learning framework specifically designed to enhance the speed of manipulation policies. SpeedTuning learns to predict the optimal execution speed for actions, thereby complementing a base policy without necessitating additional data collection. We provide empirical evidence that SpeedTuning achieves substantial improvements in execution speed, exceeding 2.4x speed-up, while preserving an adequate success rate compared to both the original task policy and straightforward speed-up methods such as linear interpolation at a fixed speed. We evaluate our approach across a diverse set of dynamic and precise tasks, including pouring, throwing, and picking, demonstrating its effectiveness and robustness in enhancing real-world robotic manipulation. Videos and code are available at https://daivdyuan.github.io/speed-tuning/
- Abstract(参考訳): 学習されたロボットポリシーは、一般化可能な操作を進めることを約束する一方で、その実践的な展開は、しばしば最適な実行速度によって妨げられる。
模倣学習ポリシーは本質的にハードウェアの制約とデータ収集時の演算子の速度によって制限される。
また、模倣によって学んだ政策を加速する方法は確立されておらず、実行速度とタスク成功との実証的な関係は未解明のままである。
これらの問題に対処するために,我々は,操作ポリシーの高速化に特化して設計された強化学習フレームワークであるSpeedTuningを紹介した。
SpeedTuningは、アクションの最適な実行速度を予測することで、追加のデータ収集を必要とせずに基本ポリシーを補完する。
本研究では,従来のタスクポリシや線形補間などの簡単な高速化手法と比較して,実行速度が2.4倍に向上し,良好な成功率を保ちながら,実行速度を大幅に向上する実証的証拠を提供する。
我々は,注ぐ,投げる,摘むなどの様々な動的かつ正確なタスクにまたがってアプローチを評価し,実世界のロボット操作を強化する上での有効性と堅牢性を実証した。
ビデオとコードはhttps://daivdyuan.github.io/speed-tuning/で公開されている。
関連論文リスト
- TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies [58.40033352838586]
既存のVision-Language-Action Model (VLA) は、トレーニングデモから1つの固定速度を継承するのみである。
予測された各行動の大きさが、ロボットの動きの速さをすでに支配していることを観察する。
我々はこの観測結果を、明示的な条件で実行速度を制御する単一のVLAであるTempoVLAに変換する。
論文 参考訳(メタデータ) (2026-06-04T17:59:40Z) - FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control [55.38832429564216]
強化学習(Reinforcement Learning, RL)は、専門家によるデモンストレーションが利用できない場合のロボット制御における中核的なアプローチである。
我々は,Soft Actor-Critic上に構築された高速で安定なオフポリチィRLアルゴリズムであるFlashSACを提案する。
10のシミュレータで60以上のタスクをこなし、FlashSACは最終的なパフォーマンスとトレーニング効率の両方において、PPOと強力なオフポリシーベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-06T09:03:41Z) - Can Users Specify Driving Speed? Bench2Drive-Speed: Benchmark and Baselines for Desired-Speed Conditioned Autonomous Driving [50.09883181221131]
我々は、所望の高速自動運転のためのメトリクス、データセット、ベースラインを備えたベンチマークであるBench2Drive-Speedを紹介する。
本稿では,ユーザの希望する目標速度とオーバーテイク/フォロー指示の明示的な入力をポリシーモデルに導入する。
実験の結果,正規運転データに基づいてトレーニングされたモデルが,専門家による実演と相容れない性能を示した。
論文 参考訳(メタデータ) (2026-03-26T17:26:41Z) - Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation [19.765462206627955]
Speedup Patch (SuP)は、オフラインデータのみを使用してプラグインとプレイのアクセラレーションを可能にするポリシーに依存しないフレームワークである。
SuPは、独自の成功率を維持しながら、さまざまなポリシーに対して、全体的な1.8倍の実行スピードアップを実現している。
論文 参考訳(メタデータ) (2026-03-21T05:29:04Z) - Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation [65.13627721310613]
平均速度ポリシー(MVP)は、平均速度場をモデル化し、最速のワンステップアクション生成を実現するための新しい生成ポリシー関数である。
MVPはRoomimicとOGBenchのいくつかの困難なロボット操作タスクに対して、最先端の成功率を達成する。
論文 参考訳(メタデータ) (2026-02-14T14:44:06Z) - SpeedAug: Policy Acceleration via Tempo-Enriched Policy and RL Fine-Tuning [52.29534291796025]
強化学習(Reinforcement learning)は、より高速な実行のためにポリシーを適用する、有望なアプローチである。
タスク実行の高速化のために事前学習されたポリシーを効率的に適応するRLベースのポリシーアクセラレーションフレームワークであるSpeedAugを提案する。
論文 参考訳(メタデータ) (2025-11-24T04:25:47Z) - Learning Speed Adaptation for Flight in Clutter [3.8876619768726157]
動物は自分の運動の速度を自分の能力や観察する環境に適応させることを学ぶ。
モバイルロボットはまた、タスクを効率的に達成するための攻撃性と安全性をトレードオフする能力を示す必要がある。
この研究は、未知の、部分的に観測可能な乱雑な環境において、速度適応の能力を持つ飛行車両を養うことを目的としている。
論文 参考訳(メタデータ) (2024-03-07T15:30:54Z) - Faded-Experience Trust Region Policy Optimization for Model-Free Power
Allocation in Interference Channel [28.618312473850974]
政策強化学習技術により、エージェントは環境との相互作用を通じて最適な行動ポリシーを学習することができる。
人的意思決定のアプローチに触発されて、エージェントを増強して、最近学習したポリシーを記憶し、利用することで、収束速度の向上に取り組みます。
その結果,FE-TRPO では TRPO に比べて学習速度が約2倍になることがわかった。
論文 参考訳(メタデータ) (2020-08-04T17:12:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。