論文の概要: DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching
- arxiv url: http://arxiv.org/abs/2603.26320v2
- Date: Tue, 31 Mar 2026 14:58:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:02.275969
- Title: DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching
- Title(参考訳): DFM-VLA:離散フローマッチングによるロボットマニピュレーションのための反復的動作補正
- Abstract要約: 本稿では,アクショントークンの反復精製のための離散フローマッチングVLAであるDFM-VLAを提案する。
DFM-VLAは、操作性能において、強い自己回帰、離散拡散、連続拡散ベースラインよりも一貫して優れる。
- 参考スコア(独自算出の注目度): 20.252867273996085
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision--Language--Action (VLA) models that encode actions using a discrete tokenization scheme are increasingly adopted for robotic manipulation, but existing decoding paradigms remain fundamentally limited. Whether actions are decoded sequentially by autoregressive VLAs or in parallel by discrete diffusion VLAs, once a token is generated, it is typically fixed and cannot be revised in subsequent iterations, so early token errors cannot be effectively corrected later. We propose DFM-VLA, a discrete flow matching VLA for iterative refinement of action tokens. DFM-VLA~models a token-level probability velocity field that dynamically updates the full action sequence across refinement iterations. We investigate two ways to construct the velocity field: an auxiliary velocity-head formulation and an action-embedding-guided formulation. Our framework further adopts a two-stage decoding strategy with an iterative refinement stage followed by deterministic validation for stable convergence. Extensive experiments on CALVIN, LIBERO, and real-world manipulation tasks show that DFM-VLA consistently outperforms strong autoregressive, discrete diffusion, and continuous diffusion baselines in manipulation performance while retaining high inference efficiency. In particular, DFM-VLA achieves an average success length of 4.44 on CALVIN and an average success rate of 95.7\% on LIBERO, highlighting the value of action refinement via discrete flow matching for robotic manipulation. Our project is available https://chris1220313648.github.io/DFM-VLA/
- Abstract(参考訳): 離散トークン化方式を用いて動作を符号化するVLA(Vision-Language-Action)モデルは、ロボット操作にますます採用されているが、既存の復号パラダイムは基本的に制限されている。
アクションが自己回帰VLAによって逐次復号されるか、あるいは離散拡散VLAによって並列に復号されるかにかかわらず、トークンが生成されると、通常は修正され、その後のイテレーションでは修正できないため、早期トークンエラーは後から効果的に修正できない。
本稿では,アクショントークンの反復精製のための離散フローマッチングVLAであるDFM-VLAを提案する。
DFM-VLA~はトークンレベルの確率速度場をモデル化する。
本稿では,速度場を構築するための2つの方法について検討する。
さらに,2段階の復号化戦略を反復的改良段階に適用し,安定収束に対する決定論的検証を行った。
CALVIN, LIBERO, および実世界の操作タスクに関する大規模な実験により、DFM-VLAは高い推論効率を維持しながら、操作性能において強い自己回帰、離散拡散、連続拡散ベースラインを一貫して上回ることを示した。
特に、DFM-VLAは、CALVINの平均成功期間が4.44であり、LIBEROの平均成功率は95.7\%であり、ロボット操作のための離散フローマッチングによるアクション改善の価値を強調している。
私たちのプロジェクトはhttps://chris1220313648.github.io/DFM-VLA/で利用可能です。
関連論文リスト
- dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models [49.497309561043004]
我々は,学習目標を限界行動確率からサンプル生成経路の結合確率にシフトするtextbfdVLA-RLを提案する。
本手法は, LIBEROにおける textbf99.7% の成功率を達成する。
また、SFTベースラインに対してtextbf30.6%の改善を提供することで、RoboTwin 2.0上でのVLAベースの強力な結果も確立している。
論文 参考訳(メタデータ) (2026-06-22T17:19:03Z) - TBD-VLA: Temporal Block Diffusion Vision Language Action Model [7.861095039299131]
本稿では,ブロック拡散を組み込んだ離散トークンベースのVLAフレームワークTBD-VLAを紹介する。
動作シーケンスを時間ブロックに分割し、ブロック間の自己回帰生成を維持しながら、各ブロック内でマスキングされた離散拡散を行う。
この設計は時間的自己回帰と並列動作復号を統一し、強い時間的コヒーレンスと推論速度の向上を両立させる。
論文 参考訳(メタデータ) (2026-06-05T23:10:43Z) - LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models [13.30873593845724]
LoopVLAは、表現の洗練、アクション予測、十分性推定を学習する、リカレントなVision-Language-Actionアーキテクチャである。
この結果から,LoopVLAはVLAポリシーの効率性向上のフロンティアを推し進め,パラメータを45%削減し,推論スループットを最大1.7倍向上させることを示した。
論文 参考訳(メタデータ) (2026-05-11T03:51:22Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies [62.653984010274485]
VLA(Vision-Language-Action)モデルは、画像や命令をロボットアクションにマッピングするために、大きな視覚言語バックボーンを適応させる。
prevailingAsは、固定された左から右への順序で自動回帰的にアクションを生成するか、バックボーンの外側で分離または拡散ヘッドをアタッチする。
本稿では離散拡散を伴う離散化作用チャンクをモデル化する統一変換器ポリシである離散拡散VLAを提案する。
論文 参考訳(メタデータ) (2025-08-27T17:39:11Z) - NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows [75.70583906344815]
拡散モデルは、複雑なマルチモーダルな動作分布をモデル化できるため、アクションデコーダとして広く採用されている。
我々は、Vision-Language-Action(VLA)モデルのための拡散型デコーダの高速かつ表現性の高い代替品であるNinAを提案する。
論文 参考訳(メタデータ) (2025-08-23T00:02:15Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。