論文の概要: Hybrid Residual Reinforcement Learning for Contact-Rich Robotic Book Insertion
- arxiv url: http://arxiv.org/abs/2609.19962v1
- Date: Thu, 17 Sep 2026 09:34:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.203798
- Title: Hybrid Residual Reinforcement Learning for Contact-Rich Robotic Book Insertion
- Title(参考訳): コンタクトリッチロボットブック挿入のためのハイブリッド残留強化学習
- Abstract要約: 制御権限を既知の幾何学と学習行動に分割する方法について検討する。
提案手法は,構成された挿入・着座のための名目的なタスク空間コントローラを保有する一方,残余のPPOは局所的な補正を行う。
ハードウェア上での最終的なポリシーでは、512の固定条件に対する配置整合シミュレーションが98.50%の成功をもたらす。
- 参考スコア(独自算出の注目度): 3.0847492739300546
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Placing a grasped book into a tight shelf is a compact but difficult contact-rich control problem: millimetre-scale pose error can turn a geometrically valid approach into jamming, failed release, or incomplete seating. We study this final phase after grasp acquisition and global approach, and ask how control authority should be divided between known geometry and learned behaviour. Our method retains a nominal task-space controller for structured insertion and seating, while residual PPO supplies bounded local corrections and decides when to release. Only the brief open-retreat-reclose transition is scripted. For the final policy used on hardware, a deployment-matched simulation evaluation over 512 fixed conditions yields 98.50 percent mean success (0.23 percentage-point sample SD) across three independent training runs, compared with 37.89 percent for nominal control. On the physical xArm7, 60 trials over 30 matched conditions show the same qualitative advantage: residual control raises success from 26.7 percent to 63.3 percent, reduces failures from 22 to 11, and wins 13 of the 15 matched conditions in which the two controllers differ. Robustness tests show that performance remains above 87 percent under initialization perturbations up to 1.5x, while very tight clearances expose the geometric limit of local correction. These results support a hybrid design in which geometry preserves reliable task structure and learning is concentrated on the contact-sensitive behaviour that fixed rules handle poorly.
- Abstract(参考訳): グリープされた本を密閉棚に配置することはコンパクトだが接触に富んだ制御の問題であり、ミリメートルスケールのポーズエラーは幾何学的に妥当なアプローチをジャミング、解除、不完全な座席に転換することができる。
獲得とグローバルなアプローチを把握した後、この最終段階を研究し、制御権限を既知の幾何学と学習行動にどのように分割すべきかを問う。
提案手法は,構成された挿入・着座のための名目的なタスク空間制御を保ちながら,残余のPPOは有界な局所補正を行い,いつ解放するかを決定する。
簡単なオープン-リトリート-リクロース移行のみがスクリプト化されている。
ハードウェア上で使われる最終方針では、512の固定条件に対する配置整合シミュレーション評価により、3つの独立したトレーニング実行における平均成功率(0.23パーセントのサンプルSD)が98.50%、名目制御では37.89パーセントとなる。
残留制御は26.7%から63.3%に上昇し、失敗は22から11に減少し、2つのコントローラが異なる15の条件のうち13が勝利する。
ロバストネス試験は、初期化摂動の下では87%以上の性能を保ち、非常に厳密なクリアランスは局所補正の幾何学的限界を露呈することを示した。
これらの結果は、幾何が信頼性のあるタスク構造を保ち、一定の規則がうまく扱えないような接触感応的な行動に学習が集中するハイブリッド設計を支援する。
関連論文リスト
- State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - Compact Visuotactile World Models for Lifting: Prediction, Reward Alignment, and Force Constraints [0.0]
Visuotactile dynamicsは力の作用効果のMAEを0.413Nから0.338Nに減少させる。
モデル支援フィードバックは、ID予算による成功を73.3%から93.3%に引き上げる。
RLは11.9%、リアクティブIQLは25.0%で成功している。
論文 参考訳(メタデータ) (2026-09-09T01:50:54Z) - Geometry Conditioning in an Embodied SLM: Training Controls and Robustness Diagnostics in a 0.8B Hybrid Model [6.064481783218601]
物理的状態入力が6.2Mのトレーニング可能なパラメータによる操作に適合する0.8Bのハイブリッド言語モデルに与える影響について検討した。
このレシピでは, トレーニング時幾何アライメントの信頼性は認められなかった。
論文 参考訳(メタデータ) (2026-09-06T05:55:24Z) - Instruction Duplication as an Inference-Time Control Primitive [0.003596046562524959]
手続き的命令は制御可能な言語モデルシステムの基本的要件である。
手続き的命令のみを繰り返す最小限のブラックボックス推論時間制御である命令重複を導入する。
論文 参考訳(メタデータ) (2026-09-03T16:05:21Z) - SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies [61.941546372624686]
既存のプロトコルはタスクのセマンティクスを廃止し、手作りの報酬と制御が検証したものから逸脱する振る舞いを残している。
本稿では,SUN (Semantically UNified Programs) を導入し,幾何関係と接触関係が一度定義され,整列したモデル予測制御にコンパイルされる型付き実行プログラムについて述べる。
我々のシステムであるKuafuは、言語やシーンのセマンティクスからSUNプログラムを自動で合成し、MPCによる画面表示を実現し、ステージ条件付きポリシーのトレーニング中にセマンティクスを保持する。
論文 参考訳(メタデータ) (2026-08-31T17:59:16Z) - Reason, Reward, Refine: Step-Level Errors Corrections with Structured Feedback for Physics Reasoning in Small Language Models [32.7643564019866]
我々は,最初の推論誤差を特定し,対象とする構造化されたフィードバックを生成し,KL正則化によるポリシー勾配による解の修正を行うステップレベルの報酬フレームワークを提案する。
5つの物理ベンチマークで、我々のフレームワークはCoTのプロンプトよりも17-20%、最強のベースラインより10-16%の精度向上を実現し、計算誤差を56.9%から23.5%に削減し、最良のケースでは22.3%から12.0%に低減した。
論文 参考訳(メタデータ) (2026-07-06T15:16:10Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Tactile Grasp Refinement using Deep Reinforcement Learning and Analytic
Grasp Stability Metrics [70.65363356763598]
解析的把握安定性指標が強化学習アルゴリズムの強力な最適化目標であることを示す。
幾何的および力量に依存しないグリップ安定性の指標を組み合わせることで、カブイドの平均成功率は95.4%となることを示す。
第2の実験では,触覚情報を持たないベースラインよりも,接触フィードバックで訓練したグリップリファインメントアルゴリズムが最大6.6%向上することを示した。
論文 参考訳(メタデータ) (2021-09-23T09:20:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。