論文の概要: Non-Prehensile Throwing: A Reinforcement Learning Perspective
- arxiv url: http://arxiv.org/abs/2609.00771v1
- Date: Tue, 01 Sep 2026 06:00:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.408094
- Title: Non-Prehensile Throwing: A Reinforcement Learning Perspective
- Title(参考訳): 非定常投球:強化学習の視点から
- Authors: Abdullah Mustafa, Ryo Hanai, Ixchel G. Ramirez-Alpizar, Floris Erich, Ryoichi Nakajo, Yukiyasu Domae, Tetsuya Ogata,
- Abstract要約: 非包括的(グラフフリー)な投球は、大きく、重く、そして/または変形可能なオブジェクトに適している。
既存のアプローチは、単純化された接触モデルによるモデルベースの最適化に依存している。
共同空間軌跡を直接最適化する強化学習手法を提案する。
提案手法では,重量 (790 g) や大型 (20x20x28 cm) などの多種多様な物体を350cm,180cmの目標に投棄し,実世界の成功率は97%に達した。
- 参考スコア(独自算出の注目度): 4.519185019401122
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Robotic throwing enables fast object transport and extends a robot's reachable workspace beyond traditional pick-and-place. While prehensile (grasp-based) throwing works well for graspable items, non-prehensile (grasp-free) throwing is better suited for large, heavy, and/or deformable objects. Existing approaches rely on model-based optimization with simplified contact models (e.g., dynamic grasping) and low-dimensional trajectory parameterizations, which limit solution quality and reachable workspace. We propose a reinforcement learning approach that additionally leverages sliding and rolling contact modes and directly optimizes joint-space trajectories without analytical contact models or custom parameterizations. The Markov Decision Process (MDP) is formulated as a dynamical system that evolves the robot's joint state conditioned on the throwing target, object model, and initial configuration. Joint-jerk trajectories are planned offline at a low control rate and upsampled into smooth, high-rate velocity commands for deployment. For sim-to-real transfer, we minimize the robot-dynamics gap through minimum-jerk system identification and train uncertainty-aware policies to mitigate object-modeling errors, particularly sensitivity to dynamic friction. In simulation, the policy achieves 99% success across thousands of configurations and generalizes to unseen objects. Sensitivity analysis shows robustness to mass uncertainty but high sensitivity to dynamic friction, consistent with the sliding-based release mechanism. Deployed zero-shot on a UR5e operating near its physical limits (5 m/s end-effector velocity), our method throws diverse objects including heavy (790 g) and large (20x20x28 cm) items to targets up to 350 cm distance or 180 cm elevation, achieving a 97% real-world success rate.
- Abstract(参考訳): ロボット投げは、高速な物体輸送を可能にし、従来のピック・アンド・プレイスを超えてロボットの到達可能なワークスペースを拡張する。
包括的(グラフベース)な投球は、把握可能なアイテムには適しているが、非包括的(グラフフリー)な投球は、大きく、重く、そして/または変形可能なオブジェクトには適している。
既存のアプローチでは、単純化された接触モデル(例えば、動的把握)と低次元の軌跡パラメータ化により、ソリューションの品質と到達可能なワークスペースを制限したモデルベースの最適化に頼っている。
本稿では,スライディングおよびローリングの接触モードを活用する強化学習手法を提案し,解析的接触モデルやカスタムパラメータ化を使わずに,共同空間軌跡を直接最適化する。
マルコフ決定プロセス(MDP)は、投球対象、オブジェクトモデル、初期設定に条件付けされたロボットの関節状態を進化させる力学系として定式化される。
ジョイントジェット軌道は、低制御率でオフラインで計画され、デプロイのためにスムーズで高速なコマンドにアップサンプリングされる。
sim-to-realトランスファーでは,ロボット力学のギャップを最小限に抑え,オブジェクトモデリングエラーを軽減し,特に動的摩擦に対する感受性を高めるための不確実性認識ポリシーを訓練する。
シミュレーションでは、このポリシーは何千もの構成で99%の成功を達成し、見えないオブジェクトに一般化する。
感度解析は、質量不確実性に対して頑健性を示すが、動的摩擦に対して高い感度を示す。
物理的限界(5m/sのエンドエフェクター速度)に近いUR5eにゼロショットを配置し,重量(790g)や大型(20x20x28cm)の物体を最大350cm,高度180cmのターゲットに投入し,実世界の成功率97%を達成した。
関連論文リスト
- PAKE: Learning Whole-Body Loco-Manipulation with Partial Kinematic Embeddings [9.606500800831322]
高精度なロコ操作のための新しい全身制御フレームワークを提案する。
大規模キネマティックデータセットに基づいてトレーニングした,新しいキネマティック正規化フローモデルを提案する。
6自由度ロボットアームを備えた四足歩行ロボットへのアプローチを検証する。
論文 参考訳(メタデータ) (2026-07-13T03:12:09Z) - Simulation-Informed Diffusion for Decentralized Multi-robot Motion Planning [56.240199425429445]
マルチロボットモーションプランニングでは、各ロボットが局所的な観測から衝突のない軌道を生成する必要がある。
既存のほとんどのプランナは、ローカル観測の静的スナップショットからトラジェクトリを生成する。
本稿では,制約対応拡散モデルに基づく分散フレームワークであるSimulation-Informed Diffusion (SID)を紹介する。
論文 参考訳(メタデータ) (2026-05-26T21:17:53Z) - Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control [50.28263951510334]
本稿では,リアクティブなデクスタリーグルーピングのためのハイブリッド階層型制御フレームワークを提案する。
提案手法は,低レベル共同実行から高レベル空間意図を明示的に分離する。
我々は厳密なシミュレーションと現実のパイプラインを通して提案したフレームワークを広範囲に検証する。
論文 参考訳(メタデータ) (2026-05-05T04:49:38Z) - Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems [54.887871365121775]
乱雑な環境におけるマルチロボット制御は、複雑な物理的制約を伴う難しい問題である。
タスクとモーションプランニングを協調的に最適化するハイブリッドマルチロボット制御フレームワークを提案する。
我々のアプローチは、動作に依存しないベースラインとVLAベースのベースラインよりもタスクの成功を継続的に改善する。
論文 参考訳(メタデータ) (2026-04-22T22:58:47Z) - Towards Multi-Object Nonprehensile Transportation via Shared Teleoperation: A Framework Based on Virtual Object Model Predictive Control [10.537871858773375]
遠隔操作における多目的非包括輸送は、同時軌道追跡とトレイ配向制御を必要とする。
本研究では,人間とロボットが位置決め制御を共有し,ロボットが動的制約を満たすために自律的に向きを管理する,共有遠隔操作フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-08T10:43:34Z) - Learning Smooth and Robust Space Robotic Manipulation of Dynamic Target via Inter-frame Correlation [12.529803316934176]
微小重力環境では、物体は通常自由浮遊であり、地球上で見られる支持や摩擦の制約が欠如している。
本稿では、歴史的時間的情報とフレーム間相関機構を統合したデータ駆動型宇宙ロボット操作手法を提案する。
論文 参考訳(メタデータ) (2026-03-29T06:27:30Z) - Shape Control of a Planar Hyper-Redundant Robot via Hybrid Kinematics-Informed and Learning-based Approach [42.55947704321053]
ハイパー冗長ロボットは、厳密で非構造的な環境での操作をうまく行うことができる。
到達可能な作業空間を拡張するために,多段式フレキシブルラック作動型平面ロボットを開発した。
本研究では,SpatioCoupledNet というハイブリッドキネマティクス・インフォームド・学習型形状制御手法を提案する。
論文 参考訳(メタデータ) (2026-03-11T04:35:06Z) - HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model [56.4392302336014]
本稿では,外部状態推定を伴わない多種多様なオブジェクトダイナミクス間のロバストな相互作用のためのフレームワークであるHAICを提案する。
我々の重要な貢献は、主観的歴史のみから高次対象状態(速度、加速度)を推定するダイナミクス予測器である。
ヒューマノイドロボットの実験では、HAICはアジャイルタスクで高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-12T09:34:35Z) - Monte Carlo Tree Search with Velocity Obstacles for safe and efficient motion planning in dynamic environments [49.30744329170107]
本稿では,動的障害物に関する情報を最小限に抑えた最適オンライン動作計画手法を提案する。
提案手法は,モデルシミュレーションによるオンライン最適計画のためのモンテカルロ木探索 (MCTS) と障害物回避のためのVelocity Obstacles (VO) を組み合わせた。
我々は,非線形モデル予測制御(NMPC)を含む最先端のプランナーに対して,衝突速度,計算,タスク性能の向上の観点から,我々の方法論の優位性を示す。
論文 参考訳(メタデータ) (2025-01-16T16:45:08Z) - Nonprehensile Riemannian Motion Predictive Control [57.295751294224765]
本稿では,リアル・ツー・シムの報酬分析手法を導入し,リアルなロボット・プラットフォームに対する行動の可能性を確実に予測する。
連続的なアクション空間でオブジェクトを反応的にプッシュするクローズドループコントローラを作成します。
我々は,RMPCが乱雑な環境だけでなく,乱雑な環境においても頑健であり,ベースラインよりも優れていることを観察した。
論文 参考訳(メタデータ) (2021-11-15T18:50:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。