論文の概要: Learning Grasp Targeting from Point Clouds for Log Pile Clearing on a Hydraulic Crane
- arxiv url: http://arxiv.org/abs/2610.07613v1
- Date: Tue, 06 Oct 2026 02:01:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.752271
- Title: Learning Grasp Targeting from Point Clouds for Log Pile Clearing on a Hydraulic Crane
- Title(参考訳): 油圧クレーン上でのログパイルクリアのための点雲からのグラフターゲット学習
- Abstract要約: ミルヤードでは、丸太ローダーは束の連続で密集した山々をクリアする。
学習済みのポリシーは、未解決の点雲からグラップルを配置し、配置する場所を選択します。
同じネットワークはサポート動作(BC)、強化学習(RL)、デプロイメントを出力する。
- 参考スコア(独自算出の注目度): 6.814062394296488
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In mill yards, log loaders clear dense piles by a sequence of bundle grasps: hundreds of logs rest in contact, and each removal changes the pile available to the next grasp. A learned policy chooses where to place and orient the grapple from unsegmented point clouds and runs on a trailer-mounted hydraulic forestry crane. The policy classifies at which observed point to grasp and predicts depth and grapple orientation there. The same network outputs support behavior cloning (BC), reinforcement learning (RL), and deployment. BC learns from successful top-of-pile demonstrations; RL explores for improvements by fine-tuning the cloned policy (BC$\to$RL) or by training from scratch. In simulation, BC clears 98 of 100 piles of 200 logs, while BC$\to$RL improves load stability. Twelve field trials compare a geometric heuristic, RL from scratch, BC, and BC$\to$RL through complete grasp-transport-deposit cycles. BC and BC$\to$RL deposit 93.8% and 88.9% of pooled inventory, against 80.4% for the heuristic. BC$\to$RL deposits logs on 83.6% of its cycles, against 79.6% for the heuristic and 65.7% for BC, while its simulated stability gain does not carry over to the crane testbed. Trained entirely in simulation and run unchanged on the crane, the learned policies clear more than the hand-filtered heuristic while observing unfiltered clouds that still contain the storage rack's rails and poles.
- Abstract(参考訳): ミルヤードでは、ログローダーが束を掴むことで密集した山々をクリアし、数百のログが接触し、各削除は次の把握に利用可能な山々を変化させる。
学習されたポリシーは、グラップルを未開点の雲から配置し、配置する場所を選択し、トレーラー搭載の油圧クレーンで走る。
このポリシーは、観測された地点がどの地点で深度と波動方向を把握し予測するかを分類する。
同じネットワークは、サポート行動クローニング(BC)、強化学習(RL)、デプロイメントを出力する。
RLはクローンされたポリシー(BC$\to$RL)を微調整したり、スクラッチからトレーニングすることで改善を模索している。
BC$\to$RLは負荷安定性を改善している。
12のフィールドトライアルは、スクラッチ、BC、BC$\to$RLの幾何学的ヒューリスティックを完全なグリップ-トランスポート-デポジットサイクルで比較する。
BC と BC$\to$RL はプール在庫の 93.8% と 88.9% を、ヒューリスティックは 80.4% を計上している。
BC$\to$RLは、そのサイクルの83.6%に記録し、BCでは79.6%、BCでは65.7%に記録している。
クレーンで完全に訓練され、クレーン上では変化せず、学習されたポリシーは手フィルターのヒューリスティックよりも明確で、貯蔵ラックのレールとポールがまだ残っている未濾過の雲を観察した。
関連論文リスト
- FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training [22.731514214998185]
予算付きLLM RLポストトレーニングのためのフィードバック状態制御系FSPOを紹介する。
ベルマンが将来の決定に使用するのと同じフリーズコントローラを目標とする、ポリシー一貫性のあるリスク・ツー・ゴーモデルを学ぶ。
3組の訓練種子は、保持およびOOD評価の文脈的包帯に対して+2.42と+3.19の利得を与える。
論文 参考訳(メタデータ) (2026-10-02T05:19:54Z) - CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents [8.150687615894268]
我々は,14B検索エージェントであるCodeGrepをGRPOとエンドツーエンドでトレーニングし,並列,グロブ,読み取りツールコールを発行し,候補ファイルを凍結下流の符号化エージェントに返却する。
すべてのSWE-Bench検証インスタンスでは、CodeGrepはリゾルバレートを保ち、効率を大幅に改善している: 検索不能のベースラインでは27.0%対25.8%で、ラウンドは15%減、トークンは19%減った。
論文 参考訳(メタデータ) (2026-08-06T11:07:42Z) - Process Reward Informed Tree Rollout for Effective Multi-Turn RL [58.392997761968566]
長期のエージェントタスクでは、均一なロールアウト戦略は、非形式的なデッドエンドの試みに予算を無駄にする可能性がある。
本稿では,マルチターンエージェントRLの品質を意識したロールアウトフレームワークであるProcess-Scorer Guided Adaptive Tree Rollout (PATR)を提案する。
PATRはタスクに適したプロセスフィードバックを使用して部分的軌跡をスコアし、将来性のある状態から選択的に分岐し、共有プレフィックスを再利用し、無駄なサンプリングを減らすために経路を保守的に停止する。
論文 参考訳(メタデータ) (2026-07-17T04:16:58Z) - Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs [59.62441340813425]
我々は、強化学習がパラメトリック知識の直接的リコールを改善するかどうかを検討する。
3つのモデルファミリと複数の事実QAベンチマークで、RLの平均相対利得は27%である。
機械的には、RLは主に新しい事実を得るのではなく、既存の知識の確率質量を再分配する。
論文 参考訳(メタデータ) (2026-05-08T02:40:12Z) - SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning [88.42566960813438]
CalibRLは、制御可能な探索と専門家のガイダンスをサポートするハイブリッド政治RLVRフレームワークである。
CalibRLは政策エントロピーを誘導的に増加させ、目標分布を明らかにする。
ドメイン内設定とドメイン外設定の両方を含む8つのベンチマークの実験は、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-02-22T07:23:36Z) - BroRL: Scaling Reinforcement Learning via Broadened Exploration [88.69554867685243]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルにおいて複雑な推論能力を解き放つ鍵となる要素として登場した。
最近のProRLは、トレーニングステップの数を増やすことで、RLのスケーリングを約束している。
RL, BroR-Lineasing the followingary paradigm for scaling RL, BroR-Lincreasing the rollouts per example to hundreds。
論文 参考訳(メタデータ) (2025-10-01T17:59:02Z) - From Imitation to Refinement -- Residual RL for Precise Assembly [19.9786629249219]
近年のビヘイビア・クローン(BC)の進歩により、ロボットに新しいタスクを教えるのが容易になった。
しかし、教育の容易さは信頼性の低いパフォーマンスを犠牲にしている。
我々は,BCの教えやすさと長期的能力を維持しながら信頼性を克服する,シンプルで効果的な方法であるResiPを考案した。
論文 参考訳(メタデータ) (2024-07-23T17:44:54Z) - PIRLNav: Pretraining with Imitation and RL Finetuning for ObjectNav [41.820289202253235]
仮想ロボットにオブジェクトへのナビゲートを依頼するObjectGoal Navigationについて検討する。
PIRLNavは,ヒトのデモンストレーションとRLファインタニングを併用した,BCのための2段階の学習手法である。
ヒトのデモンストレーションにおける BC$rightarrow$RL は SP と FE の軌道上で BC$rightarrow$RL より優れていた。
論文 参考訳(メタデータ) (2023-01-18T04:40:50Z) - Learning to Prune Deep Neural Networks via Reinforcement Learning [64.85939668308966]
PuRLは、ニューラルネットワークのプルーニングのためのディープ強化学習ベースのアルゴリズムである。
現在の最先端の手法に匹敵する幅と精度を実現している。
論文 参考訳(メタデータ) (2020-07-09T13:06:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。