論文の概要: Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation
- arxiv url: http://arxiv.org/abs/2609.01596v1
- Date: Tue, 01 Sep 2026 17:58:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.9415
- Title: Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation
- Title(参考訳): Facet-0: コンタクトリッチ精密マニピュレーションのためのロボット基礎モデル
- Authors: Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang,
- Abstract要約: ロボット基礎モデルであるFacet-0を提案する。
ManuFacet-1Kは3つの実施形態と複数の製造細胞にまたがる1000時間力同期コーパスである。
このシステムは5ミリ以下のコンピュータ組立タスクで平均82%成功し、最強のベースラインでは15%となる。
- 参考スコア(独自算出の注目度): 7.26562340208125
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world robotic assembly at sub-millimeter tolerances demands spatial precision, compliant interaction, and robustness to contact failures. We present Facet-0, a robotic foundation model that predicts and values the contact consequences of its actions. Facet-0 unifies multimodal representation learning and reinforcement learning (RL) post-training around a joint action-wrench proposal: a causal wrench history is aligned with vision-language semantics and kinematic state, and flow matching generates each action chunk together with the future wrist-wrench profile it is expected to induce. Deployment rollouts train a distributional Action-Wrench Critic to distinguish motions with similar task progress but different contact outcomes, while phase-aware rewards and contact-selective credit concentrate policy improvement on decisive interactions. To accommodate part-specific dynamics, a lightweight bounded actor reuses the frozen representation for on-robot adaptation; RL remains defined over executable Cartesian actions, while an auxiliary wrench head preserves predictive, non-commanded action-contact coupling. Trained on ManuFacet-1K, a 1,000-hour force-synchronized corpus spanning three embodiments and multiple manufacturing cells, the bounded task-adapted system reaches 82% mean success on five sub-millimeter computer-assembly tasks, compared with 15% for the strongest baseline, with 0.5 mm placement accuracy and 50 ms command latency.
- Abstract(参考訳): 現実世界のロボット組立体は、空間的精度、適合性、接触障害に対する堅牢性を必要とする。
ロボット基礎モデルであるFacet-0を提案する。
Facet-0は、マルチモーダル表現学習と強化学習(RL)を共同アクション・レンチ提案の後に統合する: 因果レンチ履歴は視覚言語意味論と運動状態に一致し、フローマッチングは将来の手首レンチプロファイルと共に各アクションチャンクを生成する。
展開のロールアウトは、同様のタスクの進捗と異なる接触結果の動作を区別するために、分配的なアクション・レンチ批判を訓練する一方で、フェーズアウェアの報酬と接触選択型信用集中政策の改善は決定的な相互作用に影響を及ぼす。
軽量な有界アクターはオンロボット適応のために凍結表現を再利用し、RLは実行可能なカルテシアンアクション上で定義され、補助的なレンチヘッドは予測的で非コマンドされたアクション-接触結合を保持する。
ManuFacet-1Kは3つのエボディメントと複数の製造セルにまたがる1000時間の力同期コーパスであり,5つのサブミリコンピュータ組立タスクの平均成功率は,0.5mmの配置精度と50msのコマンドレイテンシを持つ最強ベースラインの15%に対して82%に達した。
関連論文リスト
- Hydra-0: Action Flow for Generalist World Modeling and Control [64.88849745875753]
Hydra-0はアクションフローを条件とした世界モデルであり、ロボットの動きをピクセルの動きとして表現している。
我々の最良の構成は、90.4%のロボットモーションエラー、60.2%のオブジェクトモーションエラーを達成する。
訓練されたアクションヘッドは、タスク固有の専門家ロボットのデモンストレーションを必要とせずに、得られた潜在機能を実行可能なアクションにマッピングする。
論文 参考訳(メタデータ) (2026-08-18T17:59:30Z) - TACTIC: Tactile and Vision Conditioned Contact-Centric Control for Whole-Arm Manipulation [3.8628620899766553]
全腕操作では、ロボットがタスクを完了する間、環境と直接接触する。
本稿では,TACTIC(Tactile and Vision Conditioned Contact-Centric Control)を提案する。
論文 参考訳(メタデータ) (2026-07-10T09:08:55Z) - HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration [62.19372189311434]
HRIBenchは,実行シナリオに基づいた意図認識型人間ロボットコラボレーションの診断ベンチマークである。
HRIBenchは、エージェントの役割、時間的依存、調整の制約、人間の振る舞いの分布を明示的にモデル化する構造化シナリオスクリプトとして、協調的なタスクを表現している。
その結果,現状の基盤ロボット政策は,操作能力が強いにもかかわらず,協調的な環境下では極めて困難であることが示唆された。
論文 参考訳(メタデータ) (2026-07-05T09:15:35Z) - One Demonstration Is Enough for Real-World Robotic Reinforcement Learning [34.23164234669014]
本稿では,実世界のロボットRLにおける介入プロセスを完全に自動化するために,ひとつのデモンストレーションを利用するAutoSERLを提案する。
2つのロボットプラットフォームにまたがる6つの接触集中操作タスク(挿入、吊り下げ、ヒンジベースタスク)についてAutoSERLを評価した。
論文 参考訳(メタデータ) (2026-07-02T03:23:40Z) - Wall-OSS-0.5 Technical Report [13.983843529533113]
本稿では,アクションジェネレーションコンポーネントを付加した3B VLMバックボーン上に構築した,オープンソースの4B VLAであるWall-OSS-0.5を紹介する。
このモデルは20以上のエボディメントで事前訓練され、1エポックあたり100万以上のロボット軌道を処理する。
非自明なゼロショットのリアルタイムロボット動作を実現し、17タスクスイート上の高いタスク進捗において、ホールドアウトの変形可能な操作タスクを含むいくつかのタスクを完了させる。
論文 参考訳(メタデータ) (2026-05-29T06:04:03Z) - RLDX-1 Technical Report [74.70437517338186]
マルチストリーム動作変換器(Multi-Stream Action Transformer:MSAT)上に構築したデクスタス操作のための汎用ロボットポリシーRTDX-1を紹介する。
経験的評価により、RLDX-1は最新のフロンティア・ビジョン・ランゲージ・アクションモデルよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-05-05T01:40:15Z) - RADAR: Closed-Loop Robotic Data Generation via Semantic Planning and Autonomous Causal Environment Reset [48.645870795753105]
ロボットのためのロバスト自動データ取得(RADAR)について紹介する。
RADARは完全に自律的でクローズドループのデータ生成エンジンで、収集サイクルから人間の介入を完全に取り除きます。
シミュレーションでは、複雑な長期タスクにおいて、最大90%の成功率を達成する。
論文 参考訳(メタデータ) (2026-03-12T11:18:52Z) - Dual-Agent Multiple-Model Reinforcement Learning for Event-Triggered Human-Robot Co-Adaptation in Decoupled Task Spaces [3.349003999623489]
本稿では,カスタム6自由度上肢ロボットのための共有制御型リハビリテーションポリシーを提案する。
患者は二進法で一次到達方向を制御し、ロボットは自律的に矯正動作を管理する。
論文 参考訳(メタデータ) (2026-03-06T11:15:10Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z) - Rethinking Bimanual Robotic Manipulation: Learning with Decoupled Interaction Framework [51.39847596489193]
バイオマチックなロボット操作は、ロボティクスコミュニティにおいて、新しくて重要なトピックである。
本稿では,バイマニュアル操作における異なるタスクの特徴を考察した,疎結合なインタラクションフレームワークを提案する。
我々のフレームワークは,SOTA法よりも23.5%向上し,優れた性能を実現している。
論文 参考訳(メタデータ) (2025-03-12T09:28:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。