論文の概要: VE2VF: Vision-Enabled to Vision-Free Distillation via Real-world Reinforcement Learning for Robust Contact-Rich Manipulation
- arxiv url: http://arxiv.org/abs/2605.29564v1
- Date: Thu, 28 May 2026 08:15:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:56.056277
- Title: VE2VF: Vision-Enabled to Vision-Free Distillation via Real-world Reinforcement Learning for Robust Contact-Rich Manipulation
- Title(参考訳): VE2VF:ロバストコンタクトリッチマニピュレーションのための実世界強化学習によるビジョンフリー蒸留
- Abstract要約: ビジョン対応のポリシーは、トレーニング中に見られる視覚条件に過度に適合する傾向があり、その堅牢性と伝達性を制限する。
本稿では, 教師学生の蒸留技術を用いて, 頑健な性能を実現する, ループ内RLフレームワークを提案する。
視覚能力のある教師は、その知識を、ポーズ、ツイスト、レンチセンシングのみに依存する、視覚のない学生に蒸留する。
- 参考スコア(独自算出の注目度): 7.817721592278407
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When using reinforcement learning (RL) for contact-rich robotic manipulation, vision can provide task-relevant information that accelerates learning beyond what proprioception alone can achieve. However, vision-enabled policies tend to overfit to the visual conditions seen during training, limiting their robustness and transferability. We present a human-in-the-loop RL framework that employs teacher-student distillation to achieve robust performance across multiple task variants, trained entirely in the real world without requiring domain randomization or data augmentation. A vision-enabled teacher distills its knowledge into a vision-free student that relies solely on pose, twist, and wrench sensing, combining fast training with strong task generalization. On the real-world NIST assembly benchmark board, our approach achieves 95\% overall success after approximately 50 minutes of training on 3 representative tasks, including robust generalization to 8 unseen task variants. Fine-tuning with distillation achieves full success on the most challenging task. We demonstrate that the resulting policies outperform baselines in both robustness and adaptability.
- Abstract(参考訳): コンタクトリッチなロボット操作に強化学習(RL)を使用する場合、視覚は、プロレトロセプションだけで達成できる以上の学習を加速するタスク関連情報を提供することができる。
しかしながら、視覚対応のポリシーは、トレーニング中に見られる視覚条件に過度に適合し、その堅牢性と伝達性を制限する傾向にある。
本稿では,教師と学生による蒸留を用いて,複数のタスク変異体に対して堅牢な性能を達成し,ドメインのランダム化やデータ拡張を必要とせず,実世界で完全に訓練されたループ内RLフレームワークを提案する。
視覚能力のある教師は、その知識を、ポーズ、ツイスト、レンチセンシングにのみ依存する視覚のない学生に蒸留し、速いトレーニングと強いタスクの一般化を組み合わせます。
実世界のNISTアセンブリベンチマークボード上では,3つのタスクに対して約50分間のトレーニングを行った結果,95%の成果が得られた。
蒸留による微調整は、最も困難な課題において完全な成功を収める。
結果として得られたポリシーは、堅牢性と適応性の両方においてベースラインを上回っていることを実証する。
関連論文リスト
- Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents [31.811763840603614]
我々は、GUIエージェントをトレーニングするための意図に沿ったフレームワークであるIronを紹介します。
鉄は、低レベルアクションと高レベルインテントの微粒なアライメントを達成するために、段階的にサイクル一貫性の報酬を用いる。
鉄を訓練したジェネリストエージェントは、クロス環境およびクロスデバイスタスクのパフォーマンスを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-08-28T03:15:11Z) - EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models [84.73890225707264]
提案するEXPO-FTは,事前学習したVLAポリシーの安定かつサンプル効率の良いRL微調整システムである。
本システムは,オンラインロボットデータの平均19.1分以内の全ての評価課題に対して,完全なタスク性能(30/30の成功)を実現する。
我々は、ロボット工学におけるVLAモデルのより広範なRLファインタニング導入を促進することを目的とした、オープンソースのロバスト性をリリースする。
論文 参考訳(メタデータ) (2026-05-25T06:31:03Z) - EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models [57.75717492488268]
VLA(Vision-Language-Action)モデルは、大きな言語モデルを活用することで高度なロボット操作を行う。
Supervised Finetuning (SFT) では、タスク毎の数百のデモ、厳格に軌跡を記憶すること、デプロイメント条件がトレーニングから逸脱したときに適応できないことなどが求められている。
EVOLVE-VLA(EVOLVE-VLA)は、VLAが最小またはゼロのタスク固有のデモで環境相互作用を通じて継続的に適応できるテストタイムトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-12-16T18:26:38Z) - ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model [61.29164681694533]
ViPERは、自己評価と自己予測を通じて反復的な進化を可能にするように設計されたセルフブートストラッピングフレームワークである。
Qwen-Viperは、汎用性を維持しながら、さまざまな視覚言語シナリオにおける優れたパフォーマンスを一貫して示す。
論文 参考訳(メタデータ) (2025-10-28T10:42:57Z) - Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models [63.69856480318313]
AGILEは、対話的なプロセスとしてジグソー解決を定式化し、モデルが環境に徐々に関与できるようにする。
我々は AGILE がジグソータスクの性能を大幅に向上させることを示す。
また、9つの一般的な視覚タスクに対して強力な一般化を示し、平均3.1%の改善を実現した。
論文 参考訳(メタデータ) (2025-10-01T17:58:05Z) - Affordance-Guided Reinforcement Learning via Visual Prompting [51.361977466993345]
Keypoint-based Affordance Guidance for Improvements (KAGI) は、視覚言語モデル(VLM)によって形成される報酬を自律的なRLに活用する手法である。
自然言語記述によって指定された多様な実世界の操作タスクにおいて、KAGIは自律的なRLのサンプル効率を改善し、30Kのオンライン微調整ステップでタスク完了を成功させる。
論文 参考訳(メタデータ) (2024-07-14T21:41:29Z) - Bootstrapping Reinforcement Learning with Imitation for Vision-Based Agile Flight [20.92646531472541]
本稿では,Reinforcement Learning(RL)とImitation Learning(IL)のサンプル効率を組み合わせた新しいアプローチを提案する。
本フレームワークは、RLを用いた3段階の教員政策と、ILによる学生政策に蒸留する特権状態情報と、RLによる適応微調整とを含む。
テストでは、スクラッチからRLが失敗するシナリオだけでなく、ロバストさとパフォーマンスの両方で既存のILメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-03-18T19:25:57Z) - The Power of the Senses: Generalizable Manipulation from Vision and
Touch through Masked Multimodal Learning [60.91637862768949]
強化学習環境における視覚的・触覚的情報を融合するためのマスク付きマルチモーダル学習(M3L)を提案する。
M3Lは、マスク付きオートエンコーディングに基づいて、ポリシーと視覚触覚表現を学習する。
視覚と触覚の両方の観察を行い、3つの模擬環境におけるM3Lの評価を行った。
論文 参考訳(メタデータ) (2023-11-02T01:33:00Z) - Contrastive Learning for Enhancing Robust Scene Transfer in Vision-based
Agile Flight [21.728935597793473]
本研究では、ゼロショットシーン転送と実世界展開を可能にする視覚表現学習のための適応型マルチペアコントラスト学習戦略を提案する。
私たちは、アジャイルでビジョンベースの4倍体飛行のタスクに対して、私たちのアプローチのパフォーマンスを実演します。
論文 参考訳(メタデータ) (2023-09-18T15:25:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。