論文の概要: Proprioception-Anchored Cross-Modal Pretraining for Zero-Shot Sim-to-Real Contact-Rich Assembly
- arxiv url: http://arxiv.org/abs/2609.07534v2
- Date: Mon, 14 Sep 2026 04:13:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.607538
- Title: Proprioception-Anchored Cross-Modal Pretraining for Zero-Shot Sim-to-Real Contact-Rich Assembly
- Title(参考訳): Zero-Shot Sim-to-Real Contact-Rich アセンブリに対する Proprioception-Anchored Cross-Modal Pretraining
- Abstract要約: PACE(Proprioception-Anchored Cross-Modalception, PACE)は,主受容状態遷移を予測することによって,時間的視覚およびF/T表現を監督する。
4つの接触に富んだ組立作業の中で、PACEは平均的な実世界の成功率93.3%に達し、2.7ポイントのsim-to-realドロップしか達成していない。
- 参考スコア(独自算出の注目度): 9.415285027294221
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Contact-rich assembly remains challenging because it requires submillimeter spatial accuracy and reliable interpretation of forces during sustained contact. Although simulation-based reinforcement learning offers a scalable training paradigm, discrepancies in visual observations, contact dynamics, and force/torque (F/T) measurements often limit policy transfer. We observe that proprioception is comparatively consistent across domains because joint positions are expressed in a shared calibrated coordinate system and joint velocities are computed consistently in simulation and on hardware. Based on this observation, we present PACE (Proprioception-Anchored Cross-Modal Encoder), which supervises temporal visual and F/T representations by predicting proprioceptive state transitions. Static domain-specific factors, including lighting, texture, and sensor bias, contain little information about joint motion; the proposed objective therefore encourages the encoder to suppress these factors while retaining task-relevant motion cues. Policies trained on frozen PACE features are deployed on hardware without real-world fine-tuning or object-pose tracking. Across four contact-rich assembly tasks, PACE attains an average real-world success rate of 93.3\% and only a 2.7-percentage-point sim-to-real drop, while remaining robust to perturbations that substantially degrade pose-based and learned-fusion baselines.
- Abstract(参考訳): 接触量の多い組立体は、持続的な接触時の力の空間精度と信頼性の低い解釈を必要とするため、依然として困難なままである。
シミュレーションに基づく強化学習は、スケーラブルなトレーニングパラダイムを提供するが、視覚的観察、接触力学、F/T測定の相違は、しばしばポリシー伝達を制限する。
共役位置は共有校正座標系で表され, 連立速度はシミュレーションやハードウェア上で一貫して計算されるため, ドメイン間で相対的に安定である。
本報告では, PACE (Proprioception-Anchored Cross-Modal Encoder) について述べる。
照明, テクスチャ, センサバイアスなどの静的な領域特異的な要因は関節運動に関する情報をほとんど含んでおらず, 提案する目的は, タスク関連動作手段を維持しながら, エンコーダがこれらの要因を抑えることである。
凍結されたPACE機能で訓練されたポリシーは、現実世界の微調整やオブジェクトのトラッキングなしでハードウェアにデプロイされる。
4つの接触に富んだ組立作業の中で、PACEは平均的な実世界の成功率93.3\%に達し、2.7パーセントのsim-to-realドロップしか達成していないが、ポーズベースと学習融合ベースラインを著しく低下させる摂動に頑健なままである。
関連論文リスト
- CARO: Contact-Agnostic Residual Observation for Zero-Shot Robust Quadruped Locomotion [6.612698611142421]
CAROは、政策適応のための接触に依存しない残留観測フレームワークである。
固定ベースオイラー-ラグランジュモデルを強化学習制御ループに組み込み、トルクレベルの残留観測を構築する。
外乱オブザーバは、動的ミスマッチを表す構造化信号を抽出し、ポリシーは、このフィードバックをオンライン適応に活用することを学ぶ。
論文 参考訳(メタデータ) (2026-08-25T08:23:24Z) - TRACE: Learned Proprioceptive Odometry for Legged Robots under Unreliable Contact Conditions [4.317571381146645]
脚付きロボットのための終末学習型主観性眼球運動量推定装置であるTRACE(Tokenized Robust Attention for Contact-Aware Estimation)を提案する。
提案した推定器は,近年の慣性・関節計測の歴史から,相対変位,相対回転,体軸速度を直接予測する。
信頼性の低い接触条件下でのロバスト性向上のために,IMUおよび脚の運動トークンを適応的に重み付けする足認識型クロスアテンションモジュールを導入する。
論文 参考訳(メタデータ) (2026-08-06T12:53:33Z) - A Task-Space Receding Horizon Controller for Fast Collision Avoidance [0.08594140167290099]
ロボットマニピュレータのリアルタイム衝突回避には、予期せぬ障害物運動に対する迅速な反応が必要である。
完全なモデル予測制御は、この展望を提供することができるが、オンラインコストは、水平線長、モデル忠実度、アクティブな幾何学的制約の数とともに急速に増大する可能性がある。
本稿では, 短時間の接触一貫性を持つロールアウトを用いて, 終端キネマティック参照を生成するタスクスペースリテーディング・ホライゾンコントローラを提案する。
論文 参考訳(メタデータ) (2026-07-17T08:13:12Z) - Beyond Binary: Sim-to-Real Dexterous Manipulation with Physics-Grounded Contact Representation [51.463992799813816]
コンタクトリッチな操作における主要なボトルネックは、現実世界のデータ収集の難しさである。
物理原理に基づく効果的な触覚表現であるCenter-of-Pressureを紹介する。
我々は2つのブラインドで困難なコンタクトリッチな操作タスクについてCoPを評価する。
論文 参考訳(メタデータ) (2026-05-27T17:59:02Z) - Spacetime Optimal-Transport Attention for Visuo-Haptic Imitation Learning of Contact-Rich Manipulation [8.276456155150138]
軟質マックス正規化パッチアテンションに代わる3モーダル核融合バックボーンであるSpacetime Optimal-Transport Attention (SO-TA)を提案する。
明示的な限界制約は、接触に富むタスクに対する構造的帰納バイアスとして機能し、条件付き空間選択を奨励する。
我々は,3つの実ロボット上でのSO-TAの評価を行い,穴内密組立,BCM配線コネクタ挿入,曲面マーク消去を行った。
論文 参考訳(メタデータ) (2026-05-19T19:29:21Z) - SECOND-Grasp: Semantic Contact-guided Dexterous Grasping [60.1519218638742]
Second-Grasp (Semantic Contact-guided Dexterous Grasping) は、ロボットハンドが意味論的推論に基づいて把握戦略を調整できる統合されたフレームワークである。
我々のアプローチは、目に見えるカテゴリーと目に見えないカテゴリの両方で成功率を上げるために、一貫してベースラインを上回ります。
論文 参考訳(メタデータ) (2026-05-13T07:37:00Z) - Event-based SLAM Benchmark for High-Speed Maneuvers [68.148886127117]
イベントベースのカメラはバイオインスパイアされたセンサーで、独立して、マイクロ秒の解像度で明るさの変化に非同期に反応する。
既存のイベントベースのアプローチは、高速操作による動きのぼかしを緩和することに成功したが、多くの制限に悩まされた。
イベントベースの状態推定のためのベンチマークフレームワークであるEvSLAMを導入する。
論文 参考訳(メタデータ) (2026-04-27T04:36:41Z) - Hypergraph-State Collaborative Reasoning for Multi-Object Tracking [63.32950991964095]
複数の相関オブジェクト間の共同推論による動き推定を向上する協調推論フレームワークを提案する。
類似の運動状態を持つ物体同士を互いに拘束し、互いに洗練させることで、我々のフレームワークはノイズの軌道を安定させ、目標を遮蔽しても可塑性運動の連続性を推測する。
論文 参考訳(メタデータ) (2026-04-14T12:37:39Z) - Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation [82.63833405368159]
ツール操作の一般化には、セマンティックプランニングと正確な物理的制御の両方が必要である。
本研究では,密接な接触推定を伴う視覚的意味論を融合した3次元表現であるセマンティック・コンタクト・フィールド(SCFields)を提案する。
スクレイピング、クレヨン描画、剥離の実験は、堅牢なカテゴリレベルの一般化を示している。
論文 参考訳(メタデータ) (2026-02-14T16:05:08Z) - Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping [61.459927600301654]
マルチコンディション制御は従来のコンカデント・アンド・アットエンドの戦略によってボトルネックとなる。
分析の結果,これらの相互作用の多くは空間的にも意味的にも冗長であることがわかった。
本稿では,これらの冗長性を解消するための高効率なフレームワークであるPKAを提案する。
論文 参考訳(メタデータ) (2026-02-06T16:39:10Z) - ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning [52.86018040861575]
本稿では,単一のネットワークに視覚計画と反応力制御を統合した,一貫したエンドツーエンドの視覚力拡散政策を提案する。
本稿では,非同期な視覚と力のトークンを同時に処理するための因果的注意力を利用した構造的スローフォールストラーニングを紹介する。
コンタクトリッチタスクの実験では、ImplicitRDPは視覚のみのベースラインと階層的なベースラインの両方で著しく優れていた。
論文 参考訳(メタデータ) (2025-12-11T18:59:46Z) - MATE: Motion-Augmented Temporal Consistency for Event-based Point Tracking [58.719310295870024]
本稿では,任意の点を追跡するイベントベースのフレームワークを提案する。
事象の間隔に起因する曖昧さを解決するため、運動誘導モジュールは運動ベクトルを局所的なマッチングプロセスに組み込む。
このメソッドは、任意のポイントベースラインのイベントのみのトラッキングに対して、$Survival_50$メトリックを17.9%改善する。
論文 参考訳(メタデータ) (2024-12-02T09:13:29Z) - Robust Collaborative Perception without External Localization and Clock Devices [52.32342059286222]
複数のエージェントをまたいだ一貫した空間的時間的調整は、協調的な知覚の基礎である。
従来の手法は、ローカライゼーションとクロック信号を提供するために外部デバイスに依存している。
本稿では,様々なエージェントの知覚データに内在する幾何学的パターンを認識して整列する手法を提案する。
論文 参考訳(メタデータ) (2024-05-05T15:20:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。