論文の概要: ZETA: A Controlled Study of Zero-Shot Cross-Embodiment VLA Transfer for Tabletop Manipulation
- arxiv url: http://arxiv.org/abs/2609.02546v1
- Date: Wed, 02 Sep 2026 13:00:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.336858
- Title: ZETA: A Controlled Study of Zero-Shot Cross-Embodiment VLA Transfer for Tabletop Manipulation
- Title(参考訳): ZETA:テーブルトップ操作のためのゼロショットクロスボディーメントVLA転送の制御に関する研究
- Authors: Mi Yan, Wenhao Zhang, Zhiqi Zhang, Yu Peng, Tangxinyu Wang, Lingfei Zhai, Jiayi Su, Shengliang Deng, Lin Peng, Yaowei Liu, Yuxing Chen, Zhiyuan Wei, Jilong Wang, Jiayi Chen, Jiangran Lyu, Zhizheng Zhang, He Wang,
- Abstract要約: まず、厳密なゼロショット転送を、トレーニングデータから対象の具体化が欠落している場合と、事前のゼロショット転送とを区別する。
本研究は, 状態行動表現, 事前学習態様, 補助訓練目標, 目標身体曝露の4因子について, 制御された分析を行った。
- 参考スコア(独自算出の注目度): 20.1889537658185
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Zero-shot generalization to unseen embodiments is important for generalizable vision-language-action (VLA) models as robot hardware evolves and task-specific data collection remains costly. However, a systematic understanding of this problem remains limited, in part because the literature lacks a unified zero-shot transfer definition and controlled evaluation settings that isolate embodiment changes from differences in tasks, scenes, or protocols. To address this gap, we first distinguish strict zero-shot transfer, where the target embodiment is absent from all training data, from pretrain-exposed zero-shot transfer, where it appears only during pretraining. We then introduce a controlled benchmark spanning 14 held-out target embodiments across simulation and real-world validation. Within this framework, we conduct a controlled analysis of four factors: state-action representations, pretraining embodiment diversity, auxiliary co-training objectives, and target-embodiment exposure. Experimental results show that local end-effector (EEF) state-action representations, the source embodiment diversity, and auxiliary co-training improve cross-embodiment transfer by around 15, 18, and 7 percentage points, respectively. We further find that adding only 5% target-embodiment data during pretraining improves average target-embodiment progress by 13.4 percentage points, showing that strict and pretrain-exposed zero-shot transfer are distinct and should be reported separately. Together, these findings provide practical guidance for evaluating and improving cross-embodiment VLA transfer in stationary tabletop manipulation with two-finger grippers, while motivating future investigation of broader settings including mobile-base control, dexterous hands, and long-horizon tasks.
- Abstract(参考訳): ロボットハードウェアが進化し、タスク固有のデータ収集がコストがかかるため、視覚言語アクション(VLA)モデルにおいて、目に見えないエンボディメントへのゼロショットの一般化が重要である。
しかし、この問題の体系的な理解は依然として限られており、文献には、タスク、シーン、プロトコルの違いから実施形態の変更を分離する統一的なゼロショット転送定義と制御された評価設定が欠けているためである。
このギャップに対処するために、まず厳密なゼロショット転送を区別し、対象の実施形態が訓練データから欠落している場合と、事前訓練中にのみ現れるゼロショット転送とを区別する。
次に、シミュレーションと実世界の検証にまたがって、14の保持対象エボディメントにまたがる制御されたベンチマークを導入する。
本枠組みでは, 状態行動表現, 事前学習実施態様の多様性, 補助訓練目標, 目標身体曝露の4因子について, 制御された分析を行った。
実験の結果, 局所的エンドエフェクタ (EEF) 状態の表現, ソースエンボディメントの多様性, 補助的コトレーニングは, それぞれ約15, 18, 7ポイントのクロスエボディメント伝達を改善することがわかった。
さらに,事前訓練中に目標身体データを5%加えるだけで平均目標身体の進行率が13.4ポイント向上し,厳密かつ事前訓練したゼロショット転送は別々に報告されるべきであることが判明した。
両指グリップを用いた静止テーブルトップ操作において,両指間のVLA移動の評価と改善のための実践的ガイダンスを提供するとともに,移動体ベースコントロール,器用な手,長期作業など,より広範な設定について今後の研究を動機づける。
関連論文リスト
- X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models [39.033717938466246]
本稿では,X-DiffVLA(拡散型VLAモデル)を提案する。
X-DiffVLAは拡散モデルの生成的強度を利用して、クロスボディーデータセットの多様性と潜時相関をキャプチャすることができる。
X-DiffVLAは,それぞれ15.3%,12.5%の改善が得られた。
論文 参考訳(メタデータ) (2026-05-24T12:41:34Z) - SCAR: Self-Supervised Continuous Action Representation Learning [36.917304453471864]
視覚的遷移から具現化された動作表現を学習するための共同逆フォワード動的フレームワークであるSCARを提案する。
事前訓練された生成バックボーン上に構築されたSCARは、逆ダイナミクスモデル(IDM)を使用して、潜時観測ペアから潜時動作を推論し、フォワードダイナミクスモデル(FDM)を用いて、それらに条件付けられた将来のダイナミクスを予測する。
Procgen と Robotwin のデータセットの実験により、学習された統合潜在行動表現は、具体化固有の生の行動よりも、世界モデリングのためのより強い条件付けインターフェースとして機能することが示された。
論文 参考訳(メタデータ) (2026-05-13T16:23:11Z) - MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer [55.982504915794514]
クロス・エボディメント・ポリシーは一般的に共有プライベート・アーキテクチャに依存している。
本報告では,MOTIFを効率よく数発のクロスボディーメントトランスファーに適用する。
我々はMOTIFが数発の転送シナリオにおいて強いベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-02-14T13:21:40Z) - Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance [92.72779885657373]
本稿では,視覚エンコーダの内部関数力学におけるモデル選択の基盤となるフレームワークを提案する。
提案手法は,各タスクをレイヤワイドコンダクタンスにより表現し,エントロピー正規化アライメントによる目標条件付きブロック重要度分布を導出する。
そこで本研究では,DCD(Directional Conductance Divergence)という,ソースタスクが対象の機能ブロックをいかに効果的にカバーするかを定量化する非対称な指標を提案する。
論文 参考訳(メタデータ) (2026-02-01T17:29:43Z) - Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance [63.33213516925946]
textbfAlign-Then-stEer(textttATE)は,新しいデータ効率,プラグアンドプレイ適応フレームワークである。
我々の研究は、新しいロボットプラットフォームやタスクにVLAモデルをデプロイする実用性を大幅に向上させる、汎用的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2025-09-02T07:51:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。