論文の概要: Force-Aware Residual DAgger via Trajectory Editing for Precision Insertion with Impedance Control
- arxiv url: http://arxiv.org/abs/2603.04038v1
- Date: Wed, 04 Mar 2026 13:18:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:41.891413
- Title: Force-Aware Residual DAgger via Trajectory Editing for Precision Insertion with Impedance Control
- Title(参考訳): インピーダンス制御による精密挿入のための軌道編集による力覚残差ダガー
- Abstract要約: TER-DAggerは、コンタクトリッチな操作のための力覚的模倣学習フレームワークである。
実験により、TER-DAggerは行動クローニング、ヒト誘導補正、リトレーニング、微調整ベースラインと比較して平均成功率を37%以上改善することが示された。
- 参考スコア(独自算出の注目度): 7.670131142516991
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Imitation learning (IL) has shown strong potential for contact-rich precision insertion tasks. However, its practical deployment is often hindered by covariate shift and the need for continuous expert monitoring to recover from failures during execution. In this paper, we propose Trajectory Editing Residual Dataset Aggregation (TER-DAgger), a scalable and force-aware human-in-the-loop imitation learning framework that mitigates covariate shift by learning residual policies through optimization-based trajectory editing. This approach smoothly fuses policy rollouts with human corrective trajectories, providing consistent and stable supervision. Second, we introduce a force-aware failure anticipation mechanism that triggers human intervention only when discrepancies arise between predicted and measured end-effector forces, significantly reducing the requirement for continuous expert monitoring. Third, all learned policies are executed within a Cartesian impedance control framework, ensuring compliant and safe behavior during contact-rich interactions. Extensive experiments in both simulation and real-world precision insertion tasks show that TER-DAgger improves the average success rate by over 37\% compared to behavior cloning, human-guided correction, retraining, and fine-tuning baselines, demonstrating its effectiveness in mitigating covariate shift and enabling scalable deployment in contact-rich manipulation.
- Abstract(参考訳): イミテーション・ラーニング (IL) は, 接触量の多い精密挿入作業に強い可能性を示している。
しかしながら、その実践的なデプロイメントは、共変量シフトと、実行中の障害から回復するための継続的専門家監視の必要性によって、しばしば妨げられます。
本稿では,提案するTrajectory Editing Residual Dataset Aggregation (TER-DAgger)を提案する。
このアプローチは、ポリシーのロールアウトを人間の修正軌道とスムーズに融合させ、一貫性と安定した監視を提供する。
第2に、予測と測定されたエンドエフェクタ力の相違が生じた場合にのみ、人間の介入を誘発する力覚障害予測機構を導入し、継続的な専門家監視の必要性を著しく低減する。
第三に、すべての学習されたポリシーは、カルト的インピーダンス制御フレームワーク内で実行され、コンタクトリッチな相互作用の間、コンプライアンスと安全な振る舞いを保証する。
シミュレーションおよび実世界の高精度挿入タスクにおける広範囲な実験により、TER-DAggerは行動クローニング、人間誘導補正、リトレーニング、微調整ベースラインと比較して平均成功率を375%以上改善し、共変量シフトを緩和し、コンタクトリッチな操作をスケーラブルに展開できることが示されている。
関連論文リスト
- Safety-aware Skill Adaptation for Reinforcement Learning in Dynamic Environments [2.9923891863939946]
Dist-GPRLは、構造化ロボットスキル適応のための遠隔認識および安全誘導型強化学習フレームワークである。
ガウス過程(GP)に基づくスキルパラメタライゼーションを基盤として,スパーストラジェクトリの局所窓の重なり合いを逐次適応する。
シミュレーションにおける2つの動的オブジェクト操作タスクの枠組みを評価し,実世界のロボットに学習方針を伝達する。
論文 参考訳(メタデータ) (2026-09-10T12:05:54Z) - Asynchronous Cooperative Online Learning for Multi-Robot Control under Computational Delays [8.069079616548086]
本研究では,協調ロボットシステムのための非同期協調学習戦略を提案する。
予測精度、クエリポイントのバリエーション、遅延効果を考慮に入れている。
随伴MASに基づく分散制御法が開発され、所望の制御性能が確保される。
論文 参考訳(メタデータ) (2026-08-30T05:11:02Z) - Residual Deep Reinforcement Learning-Based Computed Torque Control for a Cable-Driven Lower-Limb Rehabilitation Robot under Disturbances and Parametric Uncertainties [0.0]
本研究は, 残留深部強化学習型計算トルク制御フレームワークを提案する。
これは、名目上、不確実性、乱れ、組み合わせ、一般化条件下でのシミュレーションで評価される。
解釈可能なモデルベースコマンド構造を維持しながら、計算トルク制御に対する追従及び外乱拒否を改善する。
論文 参考訳(メタデータ) (2026-08-27T07:29:50Z) - IADD-TR: Intervention-Aware Dynamics Decoupling with Targeted Regularization for Model-Based Reinforcement Learning [57.16513298507272]
IADD-TRは、IADD(Intervention-Aware Dynamics Decoupling)とTR(Targeted Regularization)を組み合わせた統合フレームワークである。
IADDは、ゼロアクションアンカーを用いて、アクション干渉段階とアクションフリー自然進化段階への遷移を分解し、堅牢な一般化のためにこの2段階の分解の非特異性を解決する。
政策学習においては,リプレイ状態の政策段階関数の効率的な影響関数からTRを導出する。
論文 参考訳(メタデータ) (2026-08-11T08:20:02Z) - Reinforcement Learning with Inner-loop Dynamics Estimator for Aerial Manipulation under Uncertainty [0.560928143828791]
本稿では,Reinforcement Learning (RL) と内部ループ力学推定器を組み合わせた階層型制御フレームワークを提案する。
本研究では, 各種ペイロード条件下でのハードウェア実験により, 3DoFマニピュレータを備えたカスタム四極子に対する提案手法の有効性を検証した。
論文 参考訳(メタデータ) (2026-06-15T12:16:01Z) - Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry [46.0185525503119]
Implicit Drifting Policy (IDP)は、ロボット制御のための一段階の模倣学習フレームワークである。
IDPは、明示的なベクトル場推定なしでポリシー学習にドリフトの訓練時間補正をもたらす。
論文 参考訳(メタデータ) (2026-05-31T08:39:57Z) - Explicit Dropout: Deterministic Regularization for Transformer Architectures [55.09895958546215]
ドロップアウトはディープラーニングにおいて広く使われている正規化手法であるが、その効果は一般的にマスキングによって実現される。
トレーニング損失に直接組み込まれた加算正則化器としてドロップアウトを表現する決定論的定式化を提案する。
論文 参考訳(メタデータ) (2026-04-22T12:45:51Z) - Adaptive Manipulation Potential and Haptic Estimation for Tool-Mediated Interaction [14.888648782445694]
本稿では,ツール間相互作用の統一表現として,パラメータ化された平衡マニフォールド(EM)を提案する。
我々は,ハプティック推定,オンライン計画,適応剛性制御を統合したクローズドループフレームワークを開発した。
このフレームワークはシミュレーションと260以上の現実世界のスクリューロージング試験によって検証されている。
論文 参考訳(メタデータ) (2026-03-11T02:57:55Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Active Test-time Vision-Language Navigation [60.69722522420299]
ATENAは、不確実なナビゲーション結果に対するエピソードフィードバックを通じて、実用的な人間とロボットのインタラクションを可能にする、テスト時のアクティブな学習フレームワークである。
特にATENAは、成功エピソードにおける確実性を高め、失敗エピソードにおいてそれを減らすことを学び、不確実性の校正を改善している。
さらに,自信ある予測に基づいて,エージェントがナビゲーション結果を評価することができる自己学習戦略を提案する。
論文 参考訳(メタデータ) (2025-06-07T02:24:44Z) - Growing Q-Networks: Solving Continuous Control Tasks with Adaptive Control Resolution [51.83951489847344]
ロボット工学の応用において、スムーズな制御信号はシステム摩耗とエネルギー効率を減らすために一般的に好まれる。
本研究では,離散的な動作空間を粗い状態から細かい制御分解能まで拡大することにより,この性能ギャップを埋めることを目的とする。
我々の研究は、値分解とアダプティブ・コントロール・リゾリューションが組み合わさることで、単純な批判のみのアルゴリズムが得られ、連続制御タスクにおいて驚くほど高い性能が得られることを示唆している。
論文 参考訳(メタデータ) (2024-04-05T17:58:37Z) - Integrating DeepRL with Robust Low-Level Control in Robotic Manipulators for Non-Repetitive Reaching Tasks [0.24578723416255746]
ロボット工学では、現代の戦略は学習に基づくもので、複雑なブラックボックスの性質と解釈可能性の欠如が特徴である。
本稿では, 深部強化学習(DRL)に基づく衝突のない軌道プランナと, 自動調整型低レベル制御戦略を統合することを提案する。
論文 参考訳(メタデータ) (2024-02-04T15:54:03Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - Constrained Reinforcement Learning using Distributional Representation for Trustworthy Quadrotor UAV Tracking Control [2.325021848829375]
本研究では, 未知の空力効果に対する分散強化学習障害推定器を統合した新しいトラジェクトリトラッカーを提案する。
提案手法は, 空気力学効果の真値と推定値の不確かさを正確に同定する。
本システムは,最近の技術と比較して,累積追尾誤差を少なくとも70%改善することを示した。
論文 参考訳(メタデータ) (2023-02-22T23:15:56Z) - Robust Pre-Training by Adversarial Contrastive Learning [120.33706897927391]
近年の研究では、敵の訓練と統合されると、自己監督型事前訓練が最先端の堅牢性につながることが示されている。
我々は,データ強化と対向的摂動の両面に整合した学習表現により,ロバストネスを意識した自己指導型事前学習を改善する。
論文 参考訳(メタデータ) (2020-10-26T04:44:43Z) - Learning Compliance Adaptation in Contact-Rich Manipulation [81.40695846555955]
本稿では,コンタクトリッチタスクに必要な力プロファイルの予測モデルを学習するための新しいアプローチを提案する。
このアプローチは、双方向Gated Recurrent Units (Bi-GRU) に基づく異常検出と適応力/インピーダンス制御を組み合わせたものである。
論文 参考訳(メタデータ) (2020-05-01T05:23:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。