論文の概要: Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention
- arxiv url: http://arxiv.org/abs/2605.15157v2
- Date: Wed, 20 May 2026 14:31:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 14:55:44.198176
- Title: Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention
- Title(参考訳): Hand-in-the-Loop:Seamless Hand-ArmインターベンションによるデクサラスマニピュレーションのためのVLAポリシーの改善
- Abstract要約: Hand-in-the-Loop (HandITL) は、人間の修正意図と自律的な政策実行をブレンドする。
HandITLは介入ジッタを99.8%削減し、介入後の堅牢な操作を維持する。
政策改善のための修正データ収集に使用される場合、HandITLは標準遠隔操作データで訓練された者より19%優れるポリシーを出力する。
- 参考スコア(独自算出の注目度): 15.34162270431179
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models are prone to compounding errors in dexterous manipulation, where high-dimensional action spaces and contact-rich dynamics amplify small policy deviations over long horizons. While Interactive Imitation Learning (IIL) can refine policies through human correction data, applying it to high-degree-of-freedom (DoF) robotic hands remains challenging due to a command mismatch between human teleoperation and policy execution at the intervention moment, which causes abrupt robot-hand configuration changes, or "gesture jumps". We present Hand-in-the-Loop (HandITL), a seamless human-in-the-loop intervention method that blends human corrective intent with autonomous policy execution to avoid gesture jumps during bimanual dexterous manipulation. Compared with taking over control using direct teleoperation, HandITL reduces intervention jitter by 99.8% and preserves robust post-intervention manipulation, reducing grasp failures by 87.5% and mean completion time by 19.1%. We validate HandITL on tasks requiring bimanual coordination, tool use, and fine-grained long-horizon manipulation. When used to collect correction data for policy refinement, HandITL yields policies that outperform those trained with standard teleoperation data by 19% on average across three long-horizon dexterous tasks.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、高次元のアクション空間とコンタクトリッチなダイナミクスが長い地平線上の小さな政策偏差を増幅するデキスタラスな操作において、エラーを複雑化する傾向にある。
インタラクティブ・イミテーション・ラーニング (Interactive Imitation Learning, IIL) は、人間の修正データを通じてポリシーを洗練できるが、人間の遠隔操作と介入時の政策実行のコマンドミスマッチにより、ロボットの手の急激な構成変更や「ジェスチャージャンプ」を引き起こすため、ロボットハンドを高自由度(DoF)に応用することは依然として困難である。
HandITL (Hand-in-the-Loop) は、人間の矯正意図と自律的なポリシー実行をブレンドし、両眼的な操作時のジェスチャージャンプを回避する。
直接遠隔操作による制御の引き継ぎに比べ、HandITLは介入ジッタを99.8%減らし、干渉後の堅牢な操作を維持し、把握障害を87.5%減らし、平均完了時間を19.1%減らした。
両面調整,ツール使用,細粒度長水平操作を必要とするタスクに対してHandITLを検証した。
政策改善のための修正データ収集に使用される場合、HandITLは、標準的な遠隔操作データで訓練された人より19%上回るポリシーを3つの長期的デキスタラスタスクで取得する。
関連論文リスト
- REVOLVE: An Automated Closed-Loop Framework for Evolving Robot Manipulation with Minimal Human Intervention [17.399763167916195]
人間の介入を最小限に抑えてロボット操作を進化させるための自動クローズドループフレームワークであるREVOLVEを提案する。
統一されたソフトウェアプラットフォーム上に構築されたREVOLVEは、データ収集、ポリシトレーニングとデプロイメント、障害回復、継続的な学習を単一のクローズドループワークフローに統合する。
論文 参考訳(メタデータ) (2026-09-13T16:08:03Z) - Towards Human-level Dexterous Teleoperation [62.77371751776912]
人レベルのデキスタラス遠隔操作は、動的手動物体接触による物体の動きを正確に制御する必要がある。
我々は,操作者の意図を学習された低レベルのコンタクト実行にマッピングするハンドオブジェクト・コトラッキング・コントローラであるTeleDexterを紹介した。
我々はTeleDexterを、物体の向きを変える7つの難易度遠隔操作タスクと、両手にわたる長距離ツールを用いて評価した。
論文 参考訳(メタデータ) (2026-07-13T12:36:47Z) - TORL-VLA: Tactile Guided Online Reinforcement Learning for Contact-Rich Manipulation [24.661831588991898]
TORL-VLAは、触覚フィードバックとポリシーの強化を組み合わせた、コンタクトリッチな操作のためのオンライン強化学習フレームワークである。
本手法では, 触覚由来のレンチ認識型VLAを用いて, 参照動作と将来のレンチシーケンスを予測する。
探索的政策と人為的介入の混成データから学習を安定させるために,介入検閲された評論家を紹介する。
論文 参考訳(メタデータ) (2026-06-08T11:05:05Z) - Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections [25.961145214027255]
拡散ポリシーは、ロボットの望ましくない行動と人間の教師の矯正行動の形でペア化された監督を提供する。
提案するSDP(Set-Supervised Diffusion Policy)は,コントラッシブなアクションチャンクデータを用いて,人間の修正から拡散ポリシーを訓練する新しい学習フレームワークである。
SDPは、特にノイズの多いデータに対するロバスト性において、ポリシーパフォーマンスを継続的に改善する。
論文 参考訳(メタデータ) (2026-06-01T08:14:38Z) - RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks [28.827331437876452]
データ収集、ポリシー学習、タスク実行を単一のVLM駆動コントローラで統合するエージェントロボットフレームワークであるRoboClawを提案する。
ポリシーレベルでは、RoboClaw氏はEntangled Action Pairs(EAP)を紹介している。
デプロイ中、同じエージェントが高レベルの推論を行い、学習されたポリシープリミティブを動的にオーケストレーションして長期のタスクを遂行する。
論文 参考訳(メタデータ) (2026-03-12T05:22:59Z) - DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation [14.050551792714083]
ヒューマン・イン・ザ・ループ(HiL)学習は、ロボットポリシーを洗練するための強力なメカニズムであることが証明されている。
DexHiLはDexterous VLAモデルのための最初の統合アームハンドヒューマン・イン・ザ・ループ・フレームワークである。
論文 参考訳(メタデータ) (2026-03-10T02:55:27Z) - End-to-End Dexterous Arm-Hand VLA Policies via Shared Autonomy: VR Teleoperation Augmented by Autonomous Hand VLA Policy for Efficient Data Collection [10.217810309422232]
マクロモーションとマイクロモーションの制御を分割するフレームワークを提案する。
人間のオペレーターが直感的なVR遠隔操作を通してロボットの腕のポーズをガイドします。
自律的なDexGrasp-VLAポリシは、リアルタイム触覚と視覚フィードバックを使用して、きめ細かい手制御を処理する。
論文 参考訳(メタデータ) (2025-10-31T16:12:02Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - COMBO-Grasp: Learning Constraint-Based Manipulation for Bimanual Occluded Grasping [56.907940167333656]
集積ロボットグルーピングは、表面衝突などの環境制約により、所望のグルーピングポーズが運動的に不可能な場所である。
従来のロボット操作アプローチは、人間が一般的に使用する非包括的または双対的戦略の複雑さに苦しむ。
本稿では,2つの協調ポリシーを活用する学習ベースアプローチであるCOMBO-Grasp(Constraint-based Manipulation for Bimanual Occluded Grasping)を紹介する。
論文 参考訳(メタデータ) (2025-02-12T01:31:01Z) - DexHandDiff: Interaction-aware Diffusion Planning for Adaptive Dexterous Manipulation [78.60543357822957]
高度なロボティクスにとって、接触に富んだ相互作用による有害な操作が不可欠である。
DexHandDiffは,適応的デキスタラス操作のための対話型拡散計画フレームワークである。
当社のフレームワークは, 目標適応度の高いタスクにおいて, 平均70.7%の成功率を実現し, コンタクトリッチな操作における堅牢性と柔軟性を強調した。
論文 参考訳(メタデータ) (2024-11-27T18:03:26Z) - Inference-Time Policy Steering through Human Interactions [54.02655062969934]
推論中、人間はしばしばポリシー実行ループから取り除かれる。
本稿では,人間のインタラクションを活用して生成するサンプリングプロセスにバイアスを与える推論時ポリシーステアリングフレームワークを提案する。
提案手法は,アライメントと分布シフトの最良のトレードオフを実現する。
論文 参考訳(メタデータ) (2024-11-25T18:03:50Z) - IntervenGen: Interventional Data Generation for Robust and Data-Efficient Robot Imitation Learning [43.19346528232497]
分散シフトに対するポリシーロバスト性を高めるための一般的なアプローチは、インタラクティブな模倣学習である。
我々は,大規模な修正介入を自律的に生成できる新しいデータ生成システムであるIntervenGenを提案する。
人的介入が10回しかなく、政策の堅牢性を最大39倍に向上できることを示す。
論文 参考訳(メタデータ) (2024-05-02T17:06:19Z) - Human-in-the-Loop Imitation Learning using Remote Teleoperation [72.2847988686463]
6-DoF操作設定に合わせたデータ収集システムを構築します。
システムによって収集された新しいデータに基づいて,ポリシーを反復的にトレーニングするアルゴリズムを開発した。
介入型システムで収集したデータに基づいて訓練されたエージェントと、非介入型デモ参加者が収集した同等数のサンプルで訓練されたアルゴリズムを上回るエージェントを実証する。
論文 参考訳(メタデータ) (2020-12-12T05:30:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。