論文の概要: HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
- arxiv url: http://arxiv.org/abs/2607.25895v1
- Date: Tue, 28 Jul 2026 15:52:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.908838
- Title: HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
- Title(参考訳): HiFi-UMI:高忠実なUMIデータからデプロイ可能な操作ポリシーを学習する
- Abstract要約: 移動式UMIデータ生成システムであるHiFi-UMIについて述べる。
実ロボットに直接デプロイするHiFi-UMIの実証にのみ焦点を絞った、ゼロロボットのポストトレーニングを実証する。
我々はHiFi-UMI-2Kをオープンソースとして公開し、2000時間のマイクロ同期、超広汎FoVデモをロボット学習コミュニティの大規模かつ高忠実なリソースとして公開しました。
- 参考スコア(独自算出の注目度): 19.886495773199023
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning deployable manipulation policies is bottlenecked by the scarcity of data that is both high-fidelity and scalable. Real-robot teleoperation is accurate but costly to scale; robot-free UMI capture scales readily, and current practice uses the resulting data mainly for pre-training, adding a small real-robot "anchor" at post-training. We ask whether raising the fidelity of robot-free UMI data, rather than shrinking the real-robot fraction, can remove that anchor. We present HiFi-UMI, a portable UMI data-production system co-designed for trajectory accuracy, inter-gripper relative pose, synchronization, and field of view: head-mounted offline stereo-inertial SLAM, native rather than reconstructed relative pose, a shared microsecond GPIO trigger, and two wide-angle cameras per hand covering ~200 degrees. It reaches 3 mm workspace-local end-effector accuracy without external tracking infrastructure. Using this corpus, we demonstrate zero-robot post-training: a policy post-trained solely on HiFi-UMI demonstrations deploys directly on a real robot and matches in-domain teleoperation across three backbones spanning the vision-language-action and world-action-model families, with success-rate differences of -2.5, +3.1, and -0.6 percentage points on StarVLA-QwenPI, OpenPI-pi_0.5, and LingBot-VA; the strongest policy reaches 85% on a precision insertion task, even though the teleoperation baseline is collected in the evaluation scene and no HiFi-UMI trajectory is. Pre-training on 4,000 hours from the same corpus lowers action error on ten unseen tasks by 41% and, on StarVLA-QwenPI, raises real-robot success by a further 18.1 percentage points. We open-source HiFi-UMI-2K, 2,000 hours of microsecond-synchronized, ultra-wide-FoV demonstrations, each automatically reconstructed and validated through simulation replay, as a large-scale, high-fidelity resource for the robot-learning community.
- Abstract(参考訳): デプロイ可能な操作ポリシの学習は、高忠実でスケーラブルなデータの不足によってボトルネックになる。
ロボットのないUMIキャプチャは容易にスケールでき、現在の実践では、主に事前トレーニングにデータを使用し、後トレーニング時に小さなリアルタイムロボット"アンカー"を追加する。
ロボットのないUMIデータの忠実度を上げることは、実際のロボットの割合を縮めるのではなく、そのアンカーを除去できるかどうかを問う。
頭部装着型オフラインステレオ慣性SLAM, 再構成された相対ポーズではなくネイティブ, マイクロ秒GPIOトリガ, 広角カメラ2台, 約200度をカバーする。
外部追跡インフラなしで3mmワークスペースローカルエンドエフェクタの精度に達する。
このコーパスを用いることで、実ロボットに直接展開するHiFi-UMIデモのみにポストトレーニングされたポリシーと、ビジョン・ランゲージ・アクションとワールド・アクション・モデルファミリにまたがる3つのバックボーン間のドメイン内遠隔操作が一致し、成功率の差は-2.5, +3.1, -0.6ポイント、StarVLA-QwenPI, OpenPI-pi_0.5, LingBot-VAで85%に達し、遠隔操作ベースラインが評価シーンに収集され、HiFi-UMI軌道が存在しないにもかかわらず、最強のポリシーは精度の高い挿入タスクで85%に達する。
同じコーパスから4,000時間前のトレーニングでは、10の未確認タスクのアクションエラーが41%減少し、StarVLA-QwenPIではさらに18.1ポイントの実際のロボットの成功が増加する。
HiFi-UMI-2Kは2000時間のマイクロ秒同期・超広帯域FoVデモをオープンソースとして公開し,ロボット学習コミュニティのための大規模かつ高忠実なリソースとして,シミュレーションリプレイを通じて自動再構成および検証を行った。
関連論文リスト
- The Robot Data Factory [35.46679263015648]
我々はミッション駆動型インフラであるRobot Data Factory (RDF)を紹介した。
RDFは、再現可能なミッション、スキルカリキュラム、同期されたマルチモーダルセンシング、外部の真実、エージェントロボットネットワーク、データパイプライン、生きたベンチマークを通じて、異種ロボットと環境固有のトレーニンググラウンドを編成する。
我々はさらにロボットの経験とその品質を定式化し、ミッションタスク・スキル・エポソード・データセット・ベンチマーク・能力階層を導入し、定量的なスケーリング法則と、ロボットの船体サイズ、センサーレート、ストレージ、学習表現、トークン化、訓練計算を連結するアルゴリズム手順を導出する。
論文 参考訳(メタデータ) (2026-09-15T06:30:11Z) - Learning Multi-Agent Task Assignment and Navigation in the Factory: from Simulation to Real Robots [5.3871099789895665]
強化学習(Reinforcement Learning, RL)はロボットによる意思決定に有望だが, 産業環境における物理的マルチロボットシステムへのマルチエージェントRL(MARL)の展開は依然として困難である。
本稿では,FMAPPO(Feature-fusion Multi-Agent Proximal Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-09-13T14:53:42Z) - Embodied Human-Robot Interaction via Acoustics: A MARL Approach with AcoustoBots for Spatial Data Physicalization [32.62028759076795]
AcoustoBotsはモバイルデータ物理化プラットフォームである。
タートルボット3ロボットは上向きの8 x 8の超音波位相アレーを運んでいる。
各配列は、人口密度、騒音、交通量などの局所的な都市スカラー値を符号化した粒子を浮き彫りにする。
論文 参考訳(メタデータ) (2026-07-07T17:59:44Z) - From Foundation to Application: Improving VLA Models in Practice [62.1552185059214]
3つの機能ドメインの改善を通じてLingBot-VLAを進化させるLingBot-VLA 2.0を提案する。
以前のバージョンと比較して、データ処理パイプラインを改訂し、事前トレーニングのために約6万時間のデータをキュレートします。
特に,本システムでは,頭部,腰,移動台,器用な手の自由度を考慮し,ロボットがより複雑なタスクを現実的なシナリオでこなせるようにしている。
論文 参考訳(メタデータ) (2026-07-07T15:33:12Z) - Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models [95.75234389806654]
本稿では、Qwen-VL上に構築された一般化可能なビジョン・ランゲージ・アクション基盤モデルであるQwen-RobotManipを提案する。
Qwen-RobotManipは、操作の表現、動き、行動の次元にわたって統合されたアライメントフレームワークを導入している。
人間とロボットの合成パイプラインは、エゴセントリックな手の動きを15プラットフォームにわたるロボットの軌道に変換する。
論文 参考訳(メタデータ) (2026-06-16T12:14:39Z) - XRZero-G0: Pushing the Frontier of Dexterous Robotic Manipulation with Interfaces, Quality and Ratios [10.349987856533723]
XRZero-G0(XRZero-G0)は、データ収集とポリシー学習のためのハードウェアとソフトウェアの共同設計システムである。
我々は、目標となる物理ロボットにゼロショットのクロスボデーメント転送を可能にする2000時間ロボットフリーデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-14T17:34:21Z) - MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation [56.976138997544005]
実世界へのゼロショット転送は可能であるが,静的操作と移動操作の両方に有効であることを示す。
MolmoBot-Dataは180万のエキスパートトラジェクトリのデータセットで、オブジェクトの操作やピック・アンド・プレイスタスクのためのものです。
本研究は,手続き型環境生成と多種多様な調音資産が組み合わさって,ロバストな操作ポリシーを創出できることを実証する。
論文 参考訳(メタデータ) (2026-03-17T17:59:03Z) - InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation [77.07565723756119]
InternVLA-A1は動的予測機能を備えた視覚言語モデルである。
我々は、実世界のロボットデータ、合成シミュレーションデータ、人間のビデオなどを用いて、これらのモデルを異種データソース上で事前訓練する。
InternVLA-A1を実世界の12のロボットタスクとシミュレーションベンチマークで評価した。
論文 参考訳(メタデータ) (2026-01-05T18:54:29Z) - InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy [138.89177083578213]
空間接地とロボット制御のための統合フレームワークであるInternVLA-M1を紹介する。
InternVLA-M1は、(i)2.3M以上の空間的推論データに基づく空間的グラウンドトレーニングと(ii)空間的に誘導された後トレーニングという、2段階のパイプラインを使用する。
結果: InternVLA-M1 は SimplerEnv Google Robot で+14.6%、WidowX で+17%、LIBERO Franka で+4.3% で、空間誘導なしでその変種を上回った。
論文 参考訳(メタデータ) (2025-10-15T17:30:05Z) - Self-Improving Robots: End-to-End Autonomous Visuomotor Reinforcement
Learning [54.636562516974884]
模倣と強化学習において、人間の監督コストは、ロボットが訓練できるデータの量を制限する。
本研究では,自己改善型ロボットシステムのための新しい設計手法であるMEDAL++を提案する。
ロボットは、タスクの実施と解除の両方を学ぶことで、自律的にタスクを練習し、同時にデモンストレーションから報酬関数を推論する。
論文 参考訳(メタデータ) (2023-03-02T18:51:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。