論文の概要: MixVLA: Adaptive Mixing of Non-Invariant Information for Generalizable Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2610.02898v1
- Date: Fri, 02 Oct 2026 06:44:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.24688
- Title: MixVLA: Adaptive Mixing of Non-Invariant Information for Generalizable Vision-Language-Action Models
- Title(参考訳): MixVLA: 一般化可能な視覚・言語・行動モデルのための非不変情報の適応混合
- Abstract要約: VLA(Vision-Language-Action)モデルは、ロボット操作において顕著な進歩を遂げているが、アウト・オブ・ディストリビューション条件下でのゼロショットの一般化は依然として限られている。
我々は、追加のOODデータやアーキテクチャの変更を必要とせず、VLAモデルの一般化を改善するモデルに依存しないトレーニングフレームワークであるtextbfMixVLAを提案する。
- 参考スコア(独自算出の注目度): 48.20785493380262
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-Language-Action (VLA) models have achieved remarkable advances in robotic manipulation, yet their zero-shot generalization under out-of-distribution (OOD) conditions remains limited. These models often entangle task-relevant invariant structure with environment-specific non-invariant factors, causing policies to rely on spurious appearance cues during action prediction. In this work, we propose \textbf{MixVLA}, a model-agnostic training framework that improves the generalization of VLA models without requiring additional OOD data or architectural modifications. The key component of MixVLA is \textbf{Adaptive Mixing of Non-Invariant Information (AMI)}. AMI stochastically mixes non-invariant representations to regularize distribution-specific variability while preserving complementary predictive cues. The mixed non-invariant features are then fused with invariant representations for final action prediction, resulting in improved robustness without sacrificing policy expressiveness. Extensive experiments across challenging manipulation settings, including LIBERO, LIBERO-Plus, the RoboTwin perturbation suite, and real-world tasks, demonstrate that MixVLA improves overall zero-shot robustness while retaining strong in-domain performance.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルはロボット操作において顕著な進歩を遂げているが、アウト・オブ・ディストリビューション(OOD)条件下でのゼロショットの一般化は依然として限られている。
これらのモデルは、しばしばタスク関連不変構造と環境固有の非不変因子を絡み合わせるため、アクション予測中にポリシーは急激な外観の手がかりに依存する。
本研究では,新たなOODデータやアーキテクチャ変更を必要とせず,VLAモデルの一般化を改善するためのモデルに依存しないトレーニングフレームワークである「textbf{MixVLA}」を提案する。
MixVLA の重要なコンポーネントは \textbf{Adaptive Mixing of Non-Invariant Information (AMI)} である。
AMIは、非不変表現を確率的に混合し、相補的な予測的手がかりを保持しながら、分布固有の変数を規則化する。
混合非不変特徴は最終動作予測のための不変表現と融合し、ポリシー表現性を犠牲にすることなくロバスト性を向上させる。
LIBERO、LIBERO-Plus、RoboTwin摂動スイート、実世界のタスクなど、困難な操作設定に対する広範な実験は、MixVLAがドメイン内のパフォーマンスを強く保ちながら、全体的なゼロショットロバスト性を改善することを実証している。
関連論文リスト
- Soft Specialists: $α$-Rényi Ensembles for Uncertainty-Aware LLM Post-Training [4.297453240868895]
大規模言語モデルの既存のトレーニングアプローチは、大量のデータに基づいて、単一のパラメータセットを学習する。
学習後パラメータよりも分布を学習するための$-Rényi変分フレームワークを提案する。
局所安定性基準を同定し,モデルの不特定により非退化後部が局所的に拡散しやすいことを示す。
論文 参考訳(メタデータ) (2026-05-26T22:44:58Z) - Factorize to Generalize: Retrieval-Guided Invariant-Dynamic Decomposition for Time Series Forecasting [64.2640656619583]
時系列基礎モデル (TSFM) は, 大規模事前学習と検索強化予測により, ゼロショット予測性能が向上した。
本稿では時系列予測のための検索誘導不変動的分解フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-24T07:31:55Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - CURVE: Learning Causality-Inspired Invariant Representations for Robust Scene Understanding via Uncertainty-Guided Regularization [30.613712415224473]
CURVEは、変動不確実性モデリングと不確実性誘導構造正規化を統合し、高分散関係を抑制するフレームワークである。
具体的には,環境依存的変動から不変な相互作用力学を解離させ,スパースかつ領域安定なトポロジを促進させる。
実験により,CURVEをゼロショット転送と低データのsim-to-real適応で評価し,領域安定なスパーストポロジの学習能力を検証するとともに,分布シフト下でのリスク予測を支援するための信頼性の高い不確実性推定を行う。
論文 参考訳(メタデータ) (2026-01-28T08:15:56Z) - Black-Box Combinatorial Optimization with Order-Invariant Reinforcement Learning [9.588315721253169]
ブラックボックス最適化のための順序不変強化学習フレームワークを提案する。
固定変数順序付けなしで訓練された多変量自己回帰生成モデルのパラメータ化を行う。
我々は、この設定に一般化強化政策最適化(GRPO)を適用し、スケール不変の利点から安定した政策段階の更新を提供する。
論文 参考訳(メタデータ) (2025-10-02T09:12:17Z) - Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance [63.33213516925946]
textbfAlign-Then-stEer(textttATE)は,新しいデータ効率,プラグアンドプレイ適応フレームワークである。
我々の研究は、新しいロボットプラットフォームやタスクにVLAモデルをデプロイする実用性を大幅に向上させる、汎用的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2025-09-02T07:51:59Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z) - Balancing Fairness and Robustness via Partial Invariance [17.291131923335918]
不変リスク最小化(IRM)は、アウト・オブ・ディストリビューション(OOD)問題を解決するための環境セットから不変機能を学ぶことを目的としている。
障害ケースを軽減するために、部分的な不変性フレームワークを議論する。
本研究は, 一定の条件下での公正性とリスクのトレードオフを軽減するため, 部分的不変リスク最小化が可能であることを示す。
論文 参考訳(メタデータ) (2021-12-17T06:41:47Z) - Invariant Language Modeling [23.096265183487034]
複数の環境にまたがってより一般化された不変表現を学習するためのフレームワークを提案する。
特に、IRM(IRM-games)のゲーム理論の実装を言語モデルに適用する。
提案手法は, (i) 構造ノイズを除去し, (ii) グローバルな性能に影響を与えることなく, 特定の刺激的相関を無視し, (iii) 領域外一般化を向上する能力を示す。
論文 参考訳(メタデータ) (2021-10-16T00:03:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。