論文の概要: EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
- arxiv url: http://arxiv.org/abs/2604.20012v1
- Date: Tue, 21 Apr 2026 21:40:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-23 15:36:10.861561
- Title: EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
- Title(参考訳): EmbodiedMidtrain:ミッドトレーニングによるビジョン・ランゲージモデルとビジョン・ランゲージ・アクションモデルとのギャップを埋める
- Authors: Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong,
- Abstract要約: 視覚言語モデル(VLA)は視覚言語モデル(VLM)から視覚的・言語的能力を継承する
ほとんどのVLAは、エンボディドメインに適応せず、下流のパフォーマンスを制限した既製のVLMで構築されている。
本稿では,VLMとVLAのギャップを埋めるために,EmbodiedMidtrainを提案する。
- 参考スコア(独自算出の注目度): 36.75413663296722
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action Models (VLAs) inherit their visual and linguistic capabilities from Vision-Language Models (VLMs), yet most VLAs are built from off-the-shelf VLMs that are not adapted to the embodied domain, limiting their downstream performance. In this work, we propose EmbodiedMidtrain to bridge the gap between VLMs and VLAs. We first characterize the data distribution gap between them, showing that VLA data occupy compact regions that are largely separated from the broader VLM distribution, while the degree of alignment varies substantially both across and within VLM data sources. Then, we build a mid-training data engine that leverages a lightweight learnable proximity estimator to select the most VLA-aligned candidates from a large VLM pool, and mid-trains the VLM on this curated mixture before downstream VLA fine-tuning. Experiments on three robot manipulation benchmarks show that mid-training consistently improves performance across different VLM backbones, achieving results competitive with expert VLAs and off-the-shelf VLMs trained with larger model scale and training budgets. Further analysis reveals that mid-training provides a stronger initialization for VLA fine-tuning, with gains emerging from the earliest steps and widening throughout training. Moreover, the data engine captures both dataset-level and sample-level alignment signals, favoring spatial reasoning over text-centric tasks while preserving the diversity of the VLM data. We will release all code, data and models for future research.
- Abstract(参考訳): Vision-Language-Action Models (VLA) は視覚的および言語的能力をVision-Language Models (VLM) から継承するが、ほとんどのVLAはエンボディドメインに適応せず、下流の性能を制限した既製のVLMから作られている。
本稿では,VLMとVLAのギャップを埋めるために,EmbodiedMidtrainを提案する。
まず,VLAデータ間のデータ分散ギャップを特徴付け,より広いVLM分布から大きく分離されたコンパクト領域を占有し,VLMデータソース間のアライメントの程度は,VLMデータソース間で大きく異なることを示す。
次に, 学習可能な近接推定器を利用して, 大規模VLMプールから最もVLAに適合した候補を選定し, 下流VLA微調整の前に, このキュレート混合物上でVLMを訓練する中間学習データエンジンを構築した。
3つのロボット操作ベンチマークの実験では、中級トレーニングは異なるVLMバックボーン間のパフォーマンスを一貫して改善し、より大規模なモデルスケールとトレーニング予算でトレーニングされた専門的なVLAや市販のVLMと競合する結果が得られることが示されている。
さらなる分析により、中級トレーニングはVLAファインチューニングのより強力な初期化を提供し、初期のステップからゲインが生まれ、トレーニング全体にわたって拡大することが明らかになった。
さらに、データエンジンはデータセットレベルのアライメント信号とサンプルレベルのアライメント信号の両方をキャプチャし、VLMデータの多様性を維持しながらテキスト中心のタスクよりも空間的推論を好む。
将来の研究のために、すべてのコード、データ、モデルをリリースします。
関連論文リスト
- VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models [43.09726338623949]
Vision-Language-Action(VLA)モデルは、事前訓練された大規模なVision-Language Models(VLM)をポリシーバックボーンに統合する。
本稿では、VLMの選択と能力が下流のVLAポリシーのパフォーマンスにどのように変換されるかという、体系的に研究されることは滅多にない。
VLM4VLAは、汎用的なVLMを、学習可能なパラメータの小さなセットのみを用いてVLAポリシーに変換する、最小限の適応パイプラインである。
論文 参考訳(メタデータ) (2026-01-06T09:58:24Z) - Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation [109.5893580175657]
近年,MLLMの開発における標準的な実践は,視覚エンコーダの機能をLLMに供給し,自然言語による指導を施すことである。
このアプローチは、しばしばモデルが言語理解に傾き、データに存在するリッチな視覚知覚信号を損なう。
本稿では,視覚知識をエキスパートビジョンエンコーダからLLMの隠れ表現に注入する最初のアプローチであるVisPer-LMを提案する。
論文 参考訳(メタデータ) (2024-12-12T18:55:18Z) - VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models [84.84277196012907]
VLsI: Verbalized Layers-to-Interactions, a new VLM family in 2B and 7B model size。
GPT-4Vよりも優れた性能向上(2Bは11.0%、7Bは17.4%)を達成した。
論文 参考訳(メタデータ) (2024-12-02T18:58:25Z) - NVLM: Open Frontier-Class Multimodal LLMs [64.00053046838225]
NVLM 1.0は、フロンティアクラスのマルチモーダル言語モデル(LLM)のファミリーであり、視覚言語タスクの最先端結果を実現する。
トレーニング効率とマルチモーダル推論能力を両立させる新しいアーキテクチャを提案する。
我々は、NVLM-1.0モデルのための生産級マルチモーダリティを開発し、視覚言語タスクに優れる。
論文 参考訳(メタデータ) (2024-09-17T17:59:06Z) - Bridge the Modality and Capability Gaps in Vision-Language Model Selection [62.26769826687365]
視覚言語モデル(VLM)は、画像とテキストのカテゴリ名とのペアリングによるゼロショット画像分類において優れている。
VLMリソースをより再利用するために、VLM Zooから適切な事前学習VLMを選択するという有望な戦略が提案されている。
本稿では,この言語のみのVLM選択において,VLMの能力を評価する上での2つの課題について分析する。
本稿では,2つのギャップの負の影響を軽減するために,gApブリッジを用いたVLM選択を提案する。
論文 参考訳(メタデータ) (2024-03-20T17:54:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。