論文の概要: XS-VLA: Coupling Coarse-grained Spatial Distillation with Latent Flow Matching for Lightweight Robotic Control
- arxiv url: http://arxiv.org/abs/2607.04171v1
- Date: Sun, 05 Jul 2026 08:34:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.846312
- Title: XS-VLA: Coupling Coarse-grained Spatial Distillation with Latent Flow Matching for Lightweight Robotic Control
- Title(参考訳): XS-VLA:軽量ロボット制御のための粗粒空間蒸留と潜時流整合の結合
- Abstract要約: 我々は,効率的な空間的接地型ロボット操作のためのフレームワークであるXS-VLAを提案する。
まず、Qwen3-VL-4BからSmolVLM2-0.25Bのバックボーンに空間意味知識を蒸留する。
第2に、この拡張バックボーンを使用して、遅延フローマッチングポリシーを条件にします。
- 参考スコア(独自算出の注目度): 32.32342991342603
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Vision-Language Models (LVLMs) have shown strong multimodal understanding and spatial grounding, but their computational cost limits real-time robotic control. In contrast, lightweight models are suitable for edge deployment but often suffer from "spatial blindness", namely weak native spatial prediction ability. Training Vision-Language-Action (VLA) models on mixed human demonstrations can also degrade policy performance due to highly diverse behaviors. To address these limitations, we propose XS-VLA, a two-stage framework for efficient and spatially grounded robotic manipulation. First, we distill spatial semantic knowledge from Qwen3-VL-4B into the SmolVLM2-0.25B backbone by fine-tuning on curated coarse-grained spatial descriptions, turning the lightweight model into a spatially grounded engine. Second, we use this enhanced backbone to condition a Latent Flow Matching policy. Unlike deterministic controllers, our policy combines a Conditional Variational Autoencoder (CVAE) with Flow Matching dynamics to model complex multimodal action distributions. On the LIBERO benchmark, XS-VLA achieves state-of-the-art performance among models with fewer than 0.5B parameters. It improves average success rates by up to 7.2 percent, including a 23 percent gain on LIBERO-Long, over the SmolVLA 0.25B baseline, and outperforms the larger 2.2B vanilla SmolVLA. Ablations show that spatial tuning and generative latent flow control substantially improve lightweight VLA performance, delivering a 3.2 times speedup in mission execution over the previous lightweight flow matching policy.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は、マルチモーダルな理解と空間的接地を示すが、その計算コストはリアルタイムロボット制御を制限する。
対照的に、軽量モデルはエッジ配置に適しているが、しばしば「空間的な盲目」、すなわちネイティブな空間予測能力に悩まされる。
混在した人間の実演におけるビジョン・ランゲージ・アクション(VLA)モデルの訓練は、非常に多様な行動のために政策性能を低下させる可能性がある。
これらの制約に対処するために,効率的な空間的接地型ロボット操作のための2段階のフレームワークであるXS-VLAを提案する。
まず,Qwen3-VL-4BからSmolVLM2-0.25Bのバックボーンに,粗い粒度の空間記述を微調整し,軽量モデルを空間接地エンジンに変換する。
第2に、この拡張バックボーンを使用して、遅延フローマッチングポリシーを条件にします。
決定論的コントローラとは異なり、我々のポリシーは条件付き変分オートエンコーダ(CVAE)とフローマッチングダイナミクスを組み合わせて複雑なマルチモーダル動作分布をモデル化する。
LIBEROベンチマークでは、0.5B以下のパラメータを持つモデル間で、XS-VLAは最先端のパフォーマンスを達成する。
LIBERO-Longでは23%上昇し、SmolVLA 0.25Bベースラインを上回り、さらに2.2BバニラのSmolVLAを上回っている。
アブレーションは、空間的チューニングと生成遅延フロー制御が軽量VLA性能を大幅に改善し、以前の軽量フローマッチングポリシーよりもミッション実行の3.2倍のスピードアップを実現することを示している。
関連論文リスト
- TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging [18.666233973595762]
TS-Mask VLAはロボット操作のための視覚言語アクションフレームワークである。
本手法は,(1)ブリッジアテンションコンディショニングブリッジを備えた離散アクションエキスパート,(2)時空間2Dマスキング戦略の2つの重要な設計に基づいて構築されている。
0.5Bパラメータしか持たない平均的な成功率は9%に達し、かなり大きなモデルを上回る。
論文 参考訳(メタデータ) (2026-07-10T07:06:02Z) - ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation [6.976481623762446]
textttReactVLAは、リアルタイムロボット操作のための軽量で低レイテンシなVLAフレームワークである。
textttReactVLAは、同じサイズのVLAベースラインを一貫して上回る。
現実世界のポリシーのレイテンシを38.6ミリ秒以下に短縮し、物理ロボットプラットフォームでの高速な反応性制御を可能にする。
論文 参考訳(メタデータ) (2026-06-12T08:33:37Z) - RotVLA: Rotational Latent Action for Vision-Language-Action Model [54.22746299071677]
本稿では,連続的な回転潜在動作表現に基づくVLAフレームワークであるRotVLAを紹介する。
潜在作用はSO(n) の元としてモデル化され、連続性、構成性、および実世界の作用力学と整合した構造的幾何学を提供する。
RotVLAはVLMバックボーンとフローマッチングアクションヘッドで構成される。
論文 参考訳(メタデータ) (2026-05-13T11:58:02Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。