論文の概要: FastOPD: On-Policy Distillation for Lightweight VLA Deployment
- arxiv url: http://arxiv.org/abs/2610.02832v1
- Date: Fri, 02 Oct 2026 05:24:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.228959
- Title: FastOPD: On-Policy Distillation for Lightweight VLA Deployment
- Title(参考訳): FastOPD: 軽量VLAデプロイのためのオンライン蒸留
- Abstract要約: VLA(Vision-Language-Action)基盤モデルは、操作性能と一般化性を向上させるために急速に拡張されているが、このスケーリングは高い計算コストをもたらす。
我々は,大規模VLAの実用的展開を可能にする基盤から軽量なVLAフレームワークであるFastOPDを提案する。
- 参考スコア(独自算出の注目度): 44.858750887098275
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) foundation models have scaled rapidly to enhance manipulation performance and generalizability, but this scaling incurs high computational costs that render real-world deployment increasingly challenging. Existing approaches typically mitigate this issue by designing smaller architectures or reducing the iterative denoising steps in flow-based policies. In this work, we propose FastOPD, a foundation-to-lightweight VLA framework that enables the practical deployment of large-scale VLAs through efficient on-policy distillation. Specifically, FastOPD adapts a flow map for single-state teacher supervision and combines it with a self-consistency objective to construct a compact student that learns the teacher dynamics. Furthermore, we theoretically demonstrate that minimizing this objective allows the distilled student to recover a distribution on par with that induced by an ideal few-step teacher model. We evaluate FastOPD across diverse foundation policies in simulation and real-world experiments. On LIBERO, FastOPD retains 84% of the performance of $π_{0.5}$ with only two inference steps, reducing inference latency by 78.1% while outperforming existing few-step distillation baselines in average success rate. With LingBot-VLA as the teacher, FastOPD improves the single-step success rate over the base student by 15.9 percentage points on RoboTwin 2.0. We further demonstrate its applicability to a World Action Model (WAM) and deploy a compact student distilled from MolmoAct2 on a real robot.
- Abstract(参考訳): VLA(Vision-Language-Action)基盤モデルは、操作性能と一般化性を高めるために急速に拡張されているが、このスケーリングは、現実のデプロイメントをますます困難にさせる高い計算コストをもたらす。
既存のアプローチでは、より小さなアーキテクチャを設計したり、フローベースのポリシーの反復的なデノゲーションステップを減らしたりすることで、この問題を軽減するのが一般的です。
本研究は, 大規模VLAの高効率蒸留による実用化を実現する基盤から軽量なVLAフレームワークであるFastOPDを提案する。
具体的には、FastOPDは、単状態教師の指導にフローマップを適用し、それを自己整合性目標と組み合わせて、教師のダイナミクスを学習するコンパクトな学生を構築する。
さらに、この目的を最小化することで、留学生が理想的な数ステップの教師モデルによって誘導されるものと同等の分布を復元できることを理論的に実証する。
我々は,シミュレーションと実世界の実験において,FastOPDを多様な基本方針で評価する。
LIBEROでは、FastOPDは2つの推論ステップしか持たない$π_{0.5}$のパフォーマンスの84%を維持し、推論遅延を78.1%削減し、既存の数ステップの蒸留ベースラインを平均成功率で上回っている。
LingBot-VLAを教師として、FastOPDはRoboTwin 2.0よりも15.9%向上した。
我々はさらに、ワールドアクションモデル(WAM)の適用性を実証し、モルモAct2から蒸留した小型の学生を実ロボットに展開する。
関連論文リスト
- AnyStep-WAM: Budget-Aligned Distillation and Adaptive Inference for World Action Models [31.57475195690971]
我々は、調整可能な予算予測とシーン依存アロケーションのための一般的なフレームワークであるAnyStep World Action Modelを紹介する。
軽量なリスクベネフィットスケジューラは、1段階のプレビューから難易度と予算固有の生徒教育者の忠実度を予測する。
本手法は, タスク成功率を維持しつつ, 平均復調歩数を60.2%, 49.8%, 85.28%削減する。
論文 参考訳(メタデータ) (2026-09-27T16:49:05Z) - A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching [25.295588774254952]
我々は、学習可能なポリシー最適化問題として推論加速度を再構成する。
本稿では,タスク認識による意思決定プロセスを直接Vision-Language-Actionモデルに統合する新しいフレームワークを提案する。
提案手法は, 平均成功率を同時に向上させながら, 1.76倍のウォールクロック推定速度向上を実現する。
論文 参考訳(メタデータ) (2026-01-31T12:12:51Z) - Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success [100.226572152954]
視覚言語アクションモデル(VLA)のための最適化された微調整レシピを提案する。
われわれのレシピはOpenVLAの4つのタスクスイートの平均成功率を76.5%から97.1%に引き上げ、アクション生成のスループットを26$times$に向上させた。
実世界の評価において、我々の微調整のレシピにより、OpenVLAはバイマガルALOHAロボット上でデクスタラスで高周波な制御タスクをうまく実行することができる。
論文 参考訳(メタデータ) (2025-02-27T00:30:29Z) - ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy [10.596344084789434]
VLA(Vision-Language-Action)モデルは、現実世界のロボット操作において大きな可能性を示している。
これらのモデルを教師付き学習で微調整することで、制限された一貫性のないデモのために堅牢なパフォーマンスを達成することができる。
我々は,オフラインとオンラインのファインチューニングで構成されるConRFTという,VLAモデルのための強化されたファインチューニング手法を提案する。
論文 参考訳(メタデータ) (2025-02-08T05:01:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。