論文の概要: Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs
- arxiv url: http://arxiv.org/abs/2607.02466v1
- Date: Thu, 02 Jul 2026 17:33:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.944667
- Title: Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs
- Title(参考訳): 学ぶ前に動くことを学ぶ: VLAのためのタスク非依存プレトレーニング
- Authors: Junhao Shi, Siyin Wang, Xiaopeng Yu, Li Ji, Jingjing Gong, Xipeng Qiu,
- Abstract要約: Task-Agnostic Pretraining (TAP)は、安価な未ラベルのインタラクションデータから転送可能なモータの事前学習を行う2段階のフレームワークである。
SIMPLERベンチマークでは、TAPは100万以上の専門家の軌道上でトレーニングされたモデルと、ラベル付きデータの桁数を桁違いに削減する。
現実世界のWidowXプラットフォームでは、TAPは、インターネットスケールのベースラインが0%に崩壊するカメラの摂動の下で25%の成功を維持している。
- 参考スコア(独自算出の注目度): 46.61554174146852
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models are fundamentally bottlenecked by the scarcity of expert demonstrations -- triplets of observations, instructions, and actions that are costly to collect at scale. We argue that this bottleneck stems from conflating two distinct learning objectives: acquiring physical competence (how to move) and acquiring semantic alignment (what to do). Crucially, only the latter requires language supervision. Building on this Decomposition Hypothesis, we propose Task-Agnostic Pretraining (TAP), a two-stage framework that first learns transferable motor priors from cheap, unlabeled interaction data -- including discarded off-task trajectories and autonomous robot play -- via a self-supervised Inverse Dynamics objective. A lightweight second stage then grounds these priors in language using minimal expert data. On the SIMPLER benchmark, TAP matches models trained on over 1M expert trajectories while using orders of magnitude less labeled data, yielding a 10% absolute gain over standard behavior cloning. On a real-world WidowX platform, TAP retains 25% success under camera perturbations where internet-scale baselines collapse to 0%, demonstrating that task-agnostic pretraining produces robust, transferable physical representations and offers a scalable path forward for Embodied AI.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、大規模な収集に費用がかかる観察、指示、行動の三つ子といった、専門家によるデモンストレーションの欠如によって、基本的にボトルネックになっている。
このボトルネックは、物理的能力(動き方)と意味的アライメント(何をすべきか)の2つの異なる学習目標を融合させることに起因している、と我々は主張する。
重要なことは、後者のみが言語の監督を必要とすることである。
この分解仮説に基づいて, タスク非依存型事前学習(TAP)を提案する。この2段階のフレームワークは, 自監督された逆ダイナミクスの目的を通じて, 安価でラベルの付けられていない相互作用データから, タスク非依存型事前学習(TAP)を初めて学習する。
ライトウェイトな第2段階は、最小限の専門家データを使用して、これらの先行を言語で基礎付ける。
SIMPLERベンチマークでは、TAPは100万以上の専門家軌道でトレーニングされたモデルと、ラベル付きデータの桁数を桁違いに減らし、標準動作のクローンよりも10%の絶対的なゲインをもたらす。
実際のWidowXプラットフォームでは、インターネットスケールのベースラインが0%に崩壊するカメラ摂動の下で、TAPは25%の成功を維持している。
関連論文リスト
- Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - Wall-OSS-0.5 Technical Report [13.983843529533113]
本稿では,アクションジェネレーションコンポーネントを付加した3B VLMバックボーン上に構築した,オープンソースの4B VLAであるWall-OSS-0.5を紹介する。
このモデルは20以上のエボディメントで事前訓練され、1エポックあたり100万以上のロボット軌道を処理する。
非自明なゼロショットのリアルタイムロボット動作を実現し、17タスクスイート上の高いタスク進捗において、ホールドアウトの変形可能な操作タスクを含むいくつかのタスクを完了させる。
論文 参考訳(メタデータ) (2026-05-29T06:04:03Z) - Primitive Subspaces Mediate Few-Shot Transfer in VLAs [1.3918848543076061]
プリミティブ・アウェア・トレーニングが伝達可能なアーティファクトを生み出すかどうかを検討する。
誘導バイアスの異なる2つのVLAアーキテクチャをトレーニングする。
等次元のランダムな部分空間を非難しても、数発の移動は32ポイント減少する。
論文 参考訳(メタデータ) (2026-05-29T00:37:53Z) - ST4VLA: Spatially Guided Training for Vision-Language-Action Models [80.35847468618276]
大規模視覚言語モデル(VLM)はマルチモーダル理解において優れるが、具体化されたタスクに拡張されると不足する。
本稿では,動作学習と空間的先行時間との整合性を実現するための2元系ビジョン・ランゲージ・アクション・フレームワークST4VLAを紹介する。
ST4VLAは、Google Robotでは66.1 -> 84.6、WidowX Robotでは54.7 -> 73.2、バニラVLAよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-02-10T18:59:17Z) - Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models [57.75717492488268]
VLA(Vision-Language-Action)モデルは、大きな言語モデルを活用することで高度なロボット操作を行う。
Supervised Finetuning (SFT) では、タスク毎の数百のデモ、厳格に軌跡を記憶すること、デプロイメント条件がトレーニングから逸脱したときに適応できないことなどが求められている。
EVOLVE-VLA(EVOLVE-VLA)は、VLAが最小またはゼロのタスク固有のデモで環境相互作用を通じて継続的に適応できるテストタイムトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-12-16T18:26:38Z) - Detect Anything via Next Point Prediction [51.55967987350882]
Rex-Omniは最先端の物体認識性能を実現する3BスケールのMLLMである。
COCOやLVISのようなベンチマークでは、Rex-Omniは回帰ベースのモデルに匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2025-10-14T17:59:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。