論文の概要: Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
- arxiv url: http://arxiv.org/abs/2607.13429v1
- Date: Wed, 15 Jul 2026 04:13:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.636658
- Title: Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
- Title(参考訳): 表現アンカリングと言語行動アライメントによる一般化可能なVLAファインタニング
- Abstract要約: Anchor-Alignはロボットのデモにおける視覚言語アクションポリシーを改善している。
凍結したVLMコピーから層幅の表現を蒸留し、このドリフトを防ぐ。
各アクションターゲットを離散的なモーション指向ラベルに変換し、共同で言語とアクション予測を訓練する。
- 参考スコア(独自算出の注目度): 42.503300854478795
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Finetuning a pretrained vision-language model (VLM) on robot demonstrations via behavior cloning (BC) has become the standard recipe for vision-language-action (VLA) policies. However, BC finetuning progressively overwrites the pretrained representations that support visual and semantic generalization. Co-training on web image-text data, a common remedy, does not prevent this; it applies language and action losses to separate observations, leaving VLAs with language-action misalignment that standard manipulation benchmarks do not expose. We propose Anchor-Align, which augments BC with two objectives: Vision-Language Anchoring distills layer-wise representations from a frozen VLM copy to prevent this drift, while Language-Action Alignment converts each action target into a discrete motion-direction label and jointly trains language and action prediction on the same robot observation. On a physical xArm7 robot, across two widely used VLA architectures, Anchor-Align improves real-robot success on both (28% to 54% and 37% to 60%). At scale in simulation, we demonstrate consistent improvements on OOD perturbations, perceptual robustness, and long-horizon control across LIBERO-PRO, LIBERO-Plus, and CALVIN, respectively, suggesting that preserving pretrained representations and effective action learning are not fundamentally at odds. Project page: anchoralignvla.github.io
- Abstract(参考訳): ロボットによる行動クローニング(BC)による視覚言語モデル(VLM)の精密化が、視覚言語アクション(VLA)ポリシーの標準レシピとなっている。
しかし、BCの微調整は、視覚的および意味的な一般化をサポートする事前訓練された表現を徐々に上書きする。
言語とアクションの損失を別々の観察に当てはめ、VLAには標準の操作ベンチマークが公開していない言語アクションの誤調整が残されている。
視覚言語アンカリングは、凍結したVLMコピーから階層的表現を蒸留し、このドリフトを防止する。一方、Languor-Aignmentは、各アクションターゲットを離散的なモーション指向ラベルに変換し、同じロボット観察における言語と行動予測を共同で訓練する。
物理的なxArm7ロボットでは、2つの広く使われているVLAアーキテクチャで、Anchor-Alignは両方のロボットの実際の成功(28%から54%、そして37%から60%)を改善する。
シミュレーションの規模では, LIBERO-PRO, LIBERO-Plus, CALVIN間のOOD摂動, 知覚的堅牢性, 長期的水平制御に対する一貫した改善が示され, 事前訓練された表現と効果的な行動学習の保存は, 基本的には偶発的ではないことが示唆された。
プロジェクトページ: anchoralignvla.github.io
関連論文リスト
- CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding [16.03159066719039]
CLAP(Causal Language-Action Prediction)は、自然言語アクション記述で各数値アクションシーケンスをプリペイドする。
CLAP は 0.8B, 2B, 4B で,単一の VLM 系統からオープンウェイトでマルチスケールのコンパクト VLA ファミリとしてリリースする。
論文 参考訳(メタデータ) (2026-07-09T22:34:11Z) - VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment [17.204682551730205]
本稿では,VLAトレーニング目標を比較するための統合フローマッチングフレームワークであるVLAFlowを提案する。
我々は,同じpi0型アーキテクチャ,共有VLMバックボーン,アクションエキスパート,14次元アクション空間の4つのパラダイムを評価した。
論文 参考訳(メタデータ) (2026-07-02T01:38:16Z) - Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models [58.83401587988675]
RoboAlignは視覚言語アクションモデル(VLA)を訓練し、マルチモーダル理解を低レベルのアクションに変換する。
我々のキーとなる考え方は、ゼロショット自然言語推論を用いてアクショントークンをサンプリングし、この推論を強化学習(RL)を用いて洗練し、アクション精度を向上させることである。
RoboAlignは、それぞれLIBERO、CALVIN、現実世界の環境におけるSFTベースラインよりも17.5%、18.9%、106.6%の性能向上を実現している。
論文 参考訳(メタデータ) (2026-03-22T17:57:55Z) - Universal Pose Pretraining for Generalizable Vision-Language-Action Policies [83.39008378156647]
既存のVision-Language-Action(VLA)モデルは、しばしば機能崩壊と訓練効率の低下に悩まされる。
本稿では,VLAトレーニングを3次元空間前駆体抽出のための事前学習フェーズに分離する,分離されたパラダイムであるPose-VLAを提案する。
我々のフレームワークは2段階の事前学習パイプラインに従い、ポーズと動きのアライメントによる基本的な空間接地を確立する。
論文 参考訳(メタデータ) (2026-02-23T11:00:08Z) - Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos [73.51386721543135]
本稿では,映像から視覚的潜伏空間をロボット軌道から受容的潜伏空間に整列させるフレームワークであるContrastive Latent Action Pretraining (CLAP)を提案する。
CLAPは、ビデオの遷移を量子化され、物理的に実行可能なコードブックにマッピングする。
本稿では,命令追従やオブジェクトの一般化に優れた自己回帰モデルであるCLAP-NTPと,高頻度かつ高精度な操作のために設計されたRectified FlowベースのポリシーであるCLAP-RFの両方を提供する二重形式VLAフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-07T16:26:33Z) - Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification [17.948161564138033]
Reasoning Vision Language Action (VLA)モデルは、低レベルアクションの前にステップバイステップのテキストプランを生成することで、ロボットによる命令追従を改善する。
しかし、正しいテキストプランであっても、生成したアクションは計画の意図した結果、特にアウト・オブ・ディストリビューションのシナリオを見逃す可能性がある。
我々は、この現象をCoT忠実性の欠如として定式化し、推論・アクションアライメントのためのトレーニング不要な実行時ポリシーステアリング手法を導入する。
論文 参考訳(メタデータ) (2025-10-18T00:38:45Z) - Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models [25.45513133247862]
VLA(Vision-Language-Action)モデルは、ロボット学習において革命的な進歩を遂げている。
この進歩にもかかわらず、その敵意の強固さは未解明のままである。
本稿では,VLAモデルに対する敵パッチ攻撃と対応する防御戦略の両方を提案する。
論文 参考訳(メタデータ) (2025-10-15T07:42:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。