論文の概要: Alignment-Guided Flow Transformer for Efficient Vision-Language-Action Policy Learning
- arxiv url: http://arxiv.org/abs/2609.34467v2
- Date: Tue, 29 Sep 2026 05:31:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.741055
- Title: Alignment-Guided Flow Transformer for Efficient Vision-Language-Action Policy Learning
- Title(参考訳): 効率的な視覚・言語・行動政策学習のための配向誘導流変圧器
- Abstract要約: VLA(Vision-Language-Action)モデルは、視覚、言語、行動の両面的な不一致により、しばしば不適応である。
本稿では,専用アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・アライメント・ア
AGFTは、SOTAベースラインに比べて成功率と推論遅延の低減を実現し、堅牢なVLA操作をスケールするための重要な要素として、トリモーダルアライメントを強調する。
- 参考スコア(独自算出の注目度): 60.36764069512929
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in Vision-Language-Action (VLA) models point toward general-purpose robotic intelligence by unifying perception, instruction, and control. Despite impressive progress, existing VLA models often adapt poorly due to \emph{tri-modal misalignment} among vision, language, and action, which weakens action grounding and hurts generalization and fine-tuning efficiency. In this work, we present Alignment-Guided Flow Transformer (AGFT), a novel framework that explicitly enforces tri-modal alignment through a dedicated alignment loss, bridging the representational gap across modalities and enhancing task adaptation. While prior research has predominantly emphasized bi-modal vision--language alignment, we systematically formalize and study tri-modal alignment in VLA models, and provide both ablations and analysis to isolate its role in improving adaptation and robustness. To further accelerate deployment, we adopt a flow-matching objective, enabling substantially fewer inference steps than diffusion-based policies while maintaining accuracy. Theoretically, we establish a quantitative connection between the tri-modal alignment gap and the optimization tightness of flow matching; empirically, experiments on the extensive benchmark show that AGFT achieves superior success rates and lower inference latency compared to SOTA baselines, underscoring tri-modal alignment as a key ingredient for scaling robust VLA manipulation.
- Abstract(参考訳): 近年のVision-Language-Action(VLA)モデルは、知覚、指示、制御を統一することで汎用的なロボット知能を指向している。
目覚しい進歩にもかかわらず、既存のVLAモデルは視覚、言語、行動の「emph{tri-modal misalignment}」により、しばしば不適応であり、行動基盤を弱め、一般化と微調整効率を損なう。
本稿では,アライメント・ガイドフロー・トランスフォーマー(AGFT)について述べる。このフレームワークは,アライメント・ロスを排他的に実施し,モダリティ間の表現的ギャップを埋め,タスク適応を向上する。
従来の研究はバイモーダル・ヴィジュアル・アライメントを重視してきたが、我々はVLAモデルにおけるトリモーダルアライメントを体系的に定式化し研究し、アブリケーションと分析の両方を提供し、適応とロバスト性の改善におけるその役割を分離した。
デプロイメントをさらに加速するため,我々はフローマッチングの目標を採用し,精度を維持しながら拡散ベースのポリシーよりも推論ステップが大幅に少ないようにした。
理論的には, 3モーダルアライメントギャップとフローマッチングの最適化タイトネスとの間に定量的な関係を築き, 実験により, AGFTはSOTAベースラインよりも優れた成功率と低い推論遅延を達成し, 三モーダルアライメントをロバストなVLA操作のスケーリングの鍵となる要素として評価した。
関連論文リスト
- From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model [81.67708143891319]
視覚言語モデル (VLM) は, 実世界の分布変化に敏感でありながら, 目覚ましいゼロショット能力を示した。
本稿では、VLMの推論と適応の目的を橋渡しし、algnameと呼ばれる原則付きVLM TTA手法を提案する。
実験により,本手法の有効性と効率を実証し,最先端の手法を最大7%,最先端の手法を最大7%上回る結果を得た。
論文 参考訳(メタデータ) (2026-08-18T21:44:32Z) - Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models [3.4519796338615225]
観測不能な潜伏変数の列として推論をモデル化する新しいVision-Language-Action(VLA)フレームワークを提案する。
本稿では,遅延状態生成を逐次決定プロセスとして扱う強化学習に基づくデノゲーション機構を提案する。
具体化決定ベンチマークの実験により、AVA-VLAは明示的なCoT法よりも6倍の速度アップを達成することが示された。
論文 参考訳(メタデータ) (2026-06-13T04:16:18Z) - LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models [13.30873593845724]
LoopVLAは、表現の洗練、アクション予測、十分性推定を学習する、リカレントなVision-Language-Actionアーキテクチャである。
この結果から,LoopVLAはVLAポリシーの効率性向上のフロンティアを推し進め,パラメータを45%削減し,推論スループットを最大1.7倍向上させることを示した。
論文 参考訳(メタデータ) (2026-05-11T03:51:22Z) - OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL [1.880672844596704]
VLA(Visual-Language-Action)モデルは、組み込みAIのパラダイムシフトを表している。
既存のフレームワークは、不正確な知覚、準最適マルチモーダル融合、強化学習における不安定性に苦慮している。
提案するOmniVLA-RLは,Mix-of-Transformers(MoT)設計を利用して推論,空間,行動の専門家を統合する新しいアーキテクチャである。
論文 参考訳(メタデータ) (2026-04-20T01:36:58Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models [64.92045568376705]
コヒーレントコンテキストデコーディング(Coherent Contextual Decoding, CCD)は、2つのコアイノベーションに基づいて構築された新しい推論フレームワークである。
CCDは、歴史的文脈を活用してシーケンスコヒーレンスを高める軌道修正機構を採用している。
拡散ステップに基づく厳密なアロケーションの代わりに,各ステップのアンマスク予算を動的に調整する適応型サンプリング戦略を導入する。
論文 参考訳(メタデータ) (2025-11-26T09:49:48Z) - Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model [62.889356203346985]
本稿では,モダリティ競合を処理する世界モデル拡張VLAフレームワークである Dual-STream diffusion (DUST) を提案する。
DUSTは標準のVLAベースラインと暗黙のワールドモデリングメソッドよりも最大6%向上する。
Franka Research 3による実世界のタスクでは、DUSTは成功率のベースラインを13%上回っている。
論文 参考訳(メタデータ) (2025-10-31T16:32:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。