論文の概要: From Foundation to Application: Improving VLA Models in Practice
- arxiv url: http://arxiv.org/abs/2607.06403v1
- Date: Tue, 07 Jul 2026 15:33:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.57532
- Title: From Foundation to Application: Improving VLA Models in Practice
- Title(参考訳): ファウンデーションからアプリケーションへ: 実践におけるVLAモデルの改善
- Abstract要約: 3つの機能ドメインの改善を通じてLingBot-VLAを進化させるLingBot-VLA 2.0を提案する。
以前のバージョンと比較して、データ処理パイプラインを改訂し、事前トレーニングのために約6万時間のデータをキュレートします。
特に,本システムでは,頭部,腰,移動台,器用な手の自由度を考慮し,ロボットがより複雑なタスクを現実的なシナリオでこなせるようにしている。
- 参考スコア(独自算出の注目度): 62.1552185059214
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite recent progress of VLA foundation models, the disparity between laboratory conditions and real-world applications continues to impede their practical implementation. To bridge this gap, we present LingBot-VLA 2.0, which advances LingBot-VLA through improvements in three functional domains. (1) Generalization across tasks and embodiments. Compared to the previous version, we revamp the data processing pipeline and curate around 60,000 hours of data for pretraining, including 50,000 hours of robot trajectories spanning 20 robot configurations and 10,000 hours of egocentric human videos. (2) Expanded action space in addition to dual-arm hardware platforms. In particular, our system accommodates degrees of freedom for the heads, waists, mobile bases, and dexterous hands, thereby empowering the robots to tackle more complex tasks in practical scenarios. (3) Predictive dynamics modeling for improved temporal reasoning. Specifically, we formulate future prediction as a proxy task, facilitated by a video representation model for semantic priors and a depth estimation model for geometric cues. Evaluations on the GM-100 benchmark, conducted in a generalist setting, validate the beneficial impact of these proposed modifications. Furthermore, benefiting from the expanded pretraining data that covers whole-body degrees of freedom, LingBot-VLA-2.0 demonstrates strong cross-embodiment long-horizon mobile manipulation capability across the two robotic platforms.
- Abstract(参考訳): 近年のVLAファンデーションモデルの発展にもかかわらず、実験室条件と実世界の応用の相違は、その実践的実装を妨げ続けている。
このギャップを埋めるために、LingBot-VLA 2.0を紹介します。
1)タスク及び実施事項の一般化。
これまでのバージョンと比較すると、データ処理パイプラインを改訂し、20のロボット構成にまたがる5万時間のロボット軌道と1万時間の人間ビデオを含む、6万時間の事前トレーニングデータをキュレートする。
2)デュアルアームハードウェアプラットフォームに加えて、アクションスペースの拡張。
特に,本システムでは,頭部,腰,移動台,器用な手の自由度を考慮し,ロボットがより複雑なタスクを現実的なシナリオでこなせるようにしている。
(3)時間的推論改善のための予測力学モデリング
具体的には、セマンティック先行の動画表現モデルと幾何学的手がかりの深度推定モデルにより促進されるプロキシタスクとして、将来の予測を定式化する。
GM-100ベンチマークの評価は、一般的な設定で行われ、提案された修正がもたらす有益な影響を検証した。
さらに、LingBot-VLA-2.0は、全体自由度をカバーする事前トレーニングデータの拡張によって、2つのロボットプラットフォームをまたいだ強力なクロスボディーの長距離移動操作能力を示す。
関連論文リスト
- Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models [120.24139942108405]
ロボットデータのスケーリングは、一般のVision-Language-Action(VLA)モデルを構築する上で重要である。
固定されたロボットデータ予算の下では、継続した事前訓練は限られた軌道を伝達可能な視覚行動知識に変換する必要がある。
本稿では,VLA指向のVLMバックボーンであるVLActを提案する。
論文 参考訳(メタデータ) (2026-08-27T17:59:40Z) - Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories [36.86989207036016]
Xiaomi-Robotics-1は、モバイル操作のためのビジョン言語アクション(VLA)モデルである。
多様な言語命令に従って、幅広いモバイル操作タスクを実行する。
最小限の微調整データで、新しい下流タスクに効率的に適応する。
論文 参考訳(メタデータ) (2026-07-16T16:02:25Z) - Wall-OSS-0.5 Technical Report [13.983843529533113]
本稿では,アクションジェネレーションコンポーネントを付加した3B VLMバックボーン上に構築した,オープンソースの4B VLAであるWall-OSS-0.5を紹介する。
このモデルは20以上のエボディメントで事前訓練され、1エポックあたり100万以上のロボット軌道を処理する。
非自明なゼロショットのリアルタイムロボット動作を実現し、17タスクスイート上の高いタスク進捗において、ホールドアウトの変形可能な操作タスクを含むいくつかのタスクを完了させる。
論文 参考訳(メタデータ) (2026-05-29T06:04:03Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - HoloBrain-0 Technical Report [24.68330043768013]
HoloBrain-0はVLA(Vision-Language-Action)フレームワークである。
本システムの中核となるVLAアーキテクチャは,マルチビューカメラパラメータやキネマティックな記述を含む,ロボットのエンボディメントを明示的に組み込んだ新しいアーキテクチャである。
1) 強力な事前トレーニングされたVLA基盤、(2) 複数のシミュレーションスイートと実世界のタスクのためのトレーニング後のチェックポイント、(3) データキュレーション、モデルトレーニング、デプロイメントのためのフルスタックのVLAインフラストラクチャであるRoboOrchardを含む、HoloBrainエコシステム全体をオープンソースにしています。
論文 参考訳(メタデータ) (2026-02-12T15:21:04Z) - RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization [31.40401674436269]
RDT2は、7BパラメータVLM上に構築されたロボット基盤モデルであり、オープン語彙タスクのための新しい実施形態のゼロショット展開を可能にする。
私たちは、さまざまな家族で1万時間以上のデモを行い、拡張されたエンボディメントに依存しないユニバーサルマニピュレーションインタフェース(UMI)を使って、オープンソースのロボットデータセットの1つを収集しました。
提案手法では,Residual Vector Quantization (RVQ), flow-matching, およびリアルタイム推論のための蒸留により, 個別の言語知識を連続的な制御と整合させる新しい3段階学習法を用いる。
論文 参考訳(メタデータ) (2026-02-03T09:38:23Z) - A Pragmatic VLA Foundation Model [66.76609538850478]
我々はLingBot-VLAを開発し、9つの人気のデュアルアームロボット構成から約2万時間のリアルタイムデータを収集した。
我々のモデルは競争相手よりも明らかな優位性を実現し、その強靭な性能と広範な一般化性を示している。
ロボット学習の分野を前進させるために、コード、ベースモデル、ベンチマークデータへのオープンアクセスを提供する。
論文 参考訳(メタデータ) (2026-01-26T17:08:04Z) - Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos [66.62109400603394]
本稿では,大規模な人体ビデオで訓練された視覚・言語・行動モデルであるBeing-H0を紹介する。
提案手法は,人間のビデオからの大規模VLA事前学習,3次元推論のための物理空間アライメント,ロボット作業のためのポストトレーニング適応を組み合わせた,新しいトレーニングパラダイムである物理インストラクションチューニングに重点を置いている。
本研究では,手の動き生成と指示の結果としてのBeat-H0の卓越性を実証的に示すとともに,モデルやデータサイズにもよく対応している。
論文 参考訳(メタデータ) (2025-07-21T13:19:09Z) - AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems [88.05152114775498]
AgiBot Worldは、217のタスクにまたがる100万以上のトラジェクトリを5つのデプロイメントシナリオで構成した大規模なプラットフォームである。
AgiBot Worldは高品質で多様なデータ配信を保証する。
GO-1は、現実世界のデクスタラスタスクや長距離タスクにおいて例外的な能力を示す。
論文 参考訳(メタデータ) (2025-03-09T15:40:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。