論文の概要: Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
- arxiv url: http://arxiv.org/abs/2607.15330v1
- Date: Thu, 16 Jul 2026 16:02:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.674166
- Title: Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
- Title(参考訳): Xiaomi-Robotics-1:1万時間以上の実世界軌跡を持つビジョン・ランゲージ・アクションモデルのスケーリング
- Authors: Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li, Yingyan Li, Futeng Liu, Wanli Peng, Optimus Qin, Yifei Su, Nan Sun, Qiao Sun, Runze Suo, Heyun Wang, Yunhong Wang, Rujie Wu, Caoyu Xia, Lina Zhang, Jack Zhao, Guoliang Chen, Wenlong Chen, Xinze He, Bin Li, Qing Li, Zhuorong Li, Heng Qu, Wenxuan Song, Diyun Xiang, Yifan Xie, Peiran Xu, Hangjun Ye, Wen Ye, Han Zhao, Quanyun Zhou,
- Abstract要約: Xiaomi-Robotics-1は、モバイル操作タスクのためのビジョン言語アクション(VLA)モデルである。
多様な言語命令に従って、目に見えない環境で幅広いモバイル操作タスクを実行する。
最小限の微調整データで、新しい下流タスクに効率的に適応する。
- 参考スコア(独自算出の注目度): 36.86989207036016
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Xiaomi-Robotics-1, a foundational vision-language-action (VLA) model capable of (1) following diverse language instructions to perform a wide range of mobile manipulation tasks in unseen environments out-of-the-box, and (2) efficiently adapting to novel downstream tasks with minimal fine-tuning data. We propose a two-stage training recipe consisting of pre-training and post-training. During pre-training, we imbue the model with broad and generalizable action-generation capabilities by training on over 100k hours of real-world manipulation trajectories collected via UMI devices. Crucially, we develop a scalable auto-labeling pipeline that annotates trajectory clips with natural languages describing scene state transitions, providing rich and precise conditioning for action learning. During post-training, we aim to align these capabilities with robot embodiments and imperative instructions that humans naturally use to prompt robots. Extensive experiments demonstrate strong scaling behavior. Xiaomi-Robotics-1 consistently improves with increased data scales and model sizes during pre-training. This scaling behavior directly transfers to post-training, where a stronger pre-training model yields better out-of-the-box real-robot performance in unseen environments. Furthermore, Xiaomi-Robotics-1 serves as a strong robot foundation policy that can be efficiently fine-tuned on complex, dexterous tasks with high data efficiency. Across multiple simulation benchmarks, Xiaomi-Robotics-1 outperforms state-of-the-art methods. Notably, it establishes a new state-of-the-art with a 57.6% success rate on RoboCasa365, surpassing the previous best of 46.6%. Furthermore, it achieves an average score of 20.07 on RoboDojo, significantly outperforming the prior state-of-the-art (13.07). Code and model checkpoints will be released. Project page: https://robotics.xiaomi.com/xiaomi-robotics-1.html
- Abstract(参考訳): Xiaomi-Robotics-1 は,(1) 多様な言語命令に従って,未確認環境における幅広い移動操作タスクを実行し,(2) 最小限の微調整データで下流タスクに効率よく適応できる基盤的視覚言語行動(VLA)モデルである。
プレトレーニングとポストトレーニングからなる2段階のトレーニングレシピを提案する。
事前学習中に、UMIデバイスを介して収集された100k時間以上の実世界の操作軌跡をトレーニングすることにより、広範かつ一般化可能な行動生成能力をモデルに組み込む。
重要なことに,我々は,シーン状態遷移を記述した自然言語でトラジェクティブクリップに注釈を付ける,スケーラブルな自動ラベルパイプラインを開発し,アクション学習のためのリッチで正確な条件付けを提供する。
ポストトレーニングでは、ロボットがロボットを刺激するために自然に使用するロボットの具体化と命令的指示にこれらの能力を合わせることを目的としている。
大規模な実験は、強いスケーリングの振る舞いを示す。
Xiaomi-Robotics-1は、トレーニング前のデータスケールとモデルサイズを継続的に改善する。
このスケーリング動作は、トレーニング後に直接転送され、より強力な事前トレーニングモデルにより、目に見えない環境での実際のロボットのパフォーマンスが向上する。
さらに、Xiaomi-Robotics-1は、データ効率の高い複雑なきめ細かいタスクを効率的に微調整できる強力なロボット基盤ポリシーとして機能する。
複数のシミュレーションベンチマークにおいて、Xiaomi-Robotics-1は最先端の手法より優れている。
特に、RoboCasa365で57.6%の成功率で新記録を樹立し、前回の最高値の46.6%を上回った。
さらに、RoboDojoの平均スコアは20.07で、それまでの最先端(13.07)を大きく上回っている。
コードとモデルチェックポイントがリリースされる。
プロジェクトページ:https://robotics.xiaomi.com/xiaomi-robotics-1.html
関連論文リスト
- From Foundation to Application: Improving VLA Models in Practice [62.1552185059214]
3つの機能ドメインの改善を通じてLingBot-VLAを進化させるLingBot-VLA 2.0を提案する。
以前のバージョンと比較して、データ処理パイプラインを改訂し、事前トレーニングのために約6万時間のデータをキュレートします。
特に,本システムでは,頭部,腰,移動台,器用な手の自由度を考慮し,ロボットがより複雑なタスクを現実的なシナリオでこなせるようにしている。
論文 参考訳(メタデータ) (2026-07-07T15:33:12Z) - World Action Models are Zero-shot Policies [111.91938055103633]
本稿では,予めトレーニングされたビデオ拡散バックボーン上に構築されたワールドアクションモデル(WAM)であるDreamZeroを紹介する。
ビデオとアクションを共同でモデリングすることで、DreamZeroは異種ロボットデータから多様なスキルを効果的に学習する。
ビデオのみによる他のロボットや人間によるデモは、目に見えないタスクのパフォーマンスに対して42%以上の相対的な改善をもたらす。
論文 参考訳(メタデータ) (2026-02-17T15:04:02Z) - Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution [32.93468341343403]
我々は、高速かつスムーズなリアルタイム実行のために最適化された高度な視覚言語アクション(VLA)モデルであるXiaomi-Robotics-0を紹介する。
Xiaomi-Robotics-0は、大規模なクロス・エボディメント・ロボット軌道と視覚言語データに事前訓練された。
我々はXiaomi-Robotics-0をシミュレーションベンチマークで広範囲に評価し、正確で巧妙なバイマニュアル操作を必要とする2つの挑戦的な実ロボットタスクについて検討した。
論文 参考訳(メタデータ) (2026-02-13T07:30:43Z) - InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy [138.89177083578213]
空間接地とロボット制御のための統合フレームワークであるInternVLA-M1を紹介する。
InternVLA-M1は、(i)2.3M以上の空間的推論データに基づく空間的グラウンドトレーニングと(ii)空間的に誘導された後トレーニングという、2段階のパイプラインを使用する。
結果: InternVLA-M1 は SimplerEnv Google Robot で+14.6%、WidowX で+17%、LIBERO Franka で+4.3% で、空間誘導なしでその変種を上回った。
論文 参考訳(メタデータ) (2025-10-15T17:30:05Z) - RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation [33.10577695383743]
ロボット操作のためのマルチタスク汎用エージェントRoboCatを提案する。
このデータは、シミュレートされた本物のロボットアームから、さまざまな観察とアクションのセットでモーターコントロールスキルの大規模なレパートリーにまたがる。
RoboCatでは、ゼロショットだけでなく、100-1000例のみを用いて適応することで、新しいタスクやロボットに一般化する能力を実証する。
論文 参考訳(メタデータ) (2023-06-20T17:35:20Z) - Robot Learning with Sensorimotor Pre-training [98.7755895548928]
ロボット工学のための自己教師型感覚運動器事前学習手法を提案する。
我々のモデルはRTTと呼ばれ、センサモレータトークンのシーケンスで動作するトランスフォーマーである。
感覚運動の事前学習は、ゼロからトレーニングを一貫して上回り、優れたスケーリング特性を持ち、さまざまなタスク、環境、ロボット間での移動を可能にしている。
論文 参考訳(メタデータ) (2023-06-16T17:58:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。