論文の概要: Primitive Subspaces Mediate Few-Shot Transfer in VLAs
- arxiv url: http://arxiv.org/abs/2605.30695v1
- Date: Fri, 29 May 2026 00:37:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.311259
- Title: Primitive Subspaces Mediate Few-Shot Transfer in VLAs
- Title(参考訳): VLAにおけるFew-Shot転送を媒介する原始部分空間
- Authors: Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj,
- Abstract要約: プリミティブ・アウェア・トレーニングが伝達可能なアーティファクトを生み出すかどうかを検討する。
誘導バイアスの異なる2つのVLAアーキテクチャをトレーニングする。
等次元のランダムな部分空間を非難しても、数発の移動は32ポイント減少する。
- 参考スコア(独自算出の注目度): 1.3918848543076061
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying vision-language-action (VLA) policies in industrial environments requires the ability to teach new tasks at low cost, a property current VLAs lack, since each new task requires fine-tuning. We investigate whether primitive-aware training produces a transferable artifact: a learned library of sub-skills that can be composed at inference time, conditioned on a small number of demonstrations, to perform tasks the policy was never trained on. We train two VLA architectures with different inductive biases, OpenVLA and $π_{0.5}$, on the REASSEMBLE contact-rich assembly dataset under matched LoRA fine-tuning recipes and locked hyperparameters, varying training between flat trajectories and primitive-segmented episodes with primitive-specific language prompts. We hold out 6 object-task combinations from training and evaluate few-shot transfer: models receive $m \in \{0, 1, 3, 5, 10\}$ demonstrations of a held-out task and attempt execution without weight updates. We replicate across three training seeds and validate on a second dataset (LIBERO-Long). Primitive-trained models reach 78% of fine-tuned upper-bound performance with only m=3 demonstrations, while flat-trained models require m=10 demonstrations to reach the same level -- a $3\times$ sample efficiency gap that replicates across seeds, architectures, and datasets. To establish causation, we ablate the primitive-decodable subspace of hidden states and show few-shot transfer degrades by 32 percentage points while ablating a random subspace of equal dimensionality has no effect, indicating primitive representations are causally necessary rather than incidentally correlated with transfer. We identify and correct a methodological pitfall in evaluating chunked policies: family-wise inflation of single-step action-range gates produces order-of-magnitude higher false-failure rates against ground-truth human demonstrations.
- Abstract(参考訳): 産業環境でのビジョン・ランゲージ・アクション(VLA)ポリシーの展開には、新しいタスクを低コストで教える能力が必要である。
本研究では,プリミティブ・アウェア・トレーニングが伝達可能なアーティファクトを創出するかどうかを考察する。
同一のLoRAファインチューニングレシピとロックされたハイパーパラメータの下で、REASSEMBLEコンタクトリッチアセンブリデータセット上で、異なる誘導バイアスを持つ2つのVLAアーキテクチャ、OpenVLAと$π_{0.5}$をトレーニングする。
モデルが$m \in \{0, 1, 3, 5, 10\}$ のタスクのデモを受け取り、重み付けなしで実行を試みる。
3つのトレーニングシードを複製し、第2のデータセット(LIBERO-Long)で検証します。
プリミティブトレーニングされたモデルは、m=3のデモだけで、微調整された上行パフォーマンスの78%に達し、フラットトレーニングされたモデルは、同じレベルに達するためにm=10のデモを必要とする。
因果関係を確立するために,隠れ状態のプリミティブ・デコダブルな部分空間をアブレーションし,同じ次元のランダムな部分空間を非難しても32パーセンテージの差を示す。
単一ステップのアクションレンジゲートの家族的インフレーションは、地道な人間の実演に対して、桁違いに高い虚偽のフェール率をもたらす。
関連論文リスト
- Universal Pose Pretraining for Generalizable Vision-Language-Action Policies [83.39008378156647]
既存のVision-Language-Action(VLA)モデルは、しばしば機能崩壊と訓練効率の低下に悩まされる。
本稿では,VLAトレーニングを3次元空間前駆体抽出のための事前学習フェーズに分離する,分離されたパラダイムであるPose-VLAを提案する。
我々のフレームワークは2段階の事前学習パイプラインに従い、ポーズと動きのアライメントによる基本的な空間接地を確立する。
論文 参考訳(メタデータ) (2026-02-23T11:00:08Z) - Bagging-Based Model Merging for Robust General Text Embeddings [73.51674133699196]
汎用テキスト埋め込みモデルは、幅広いNLPおよび情報検索アプリケーションを支える。
本稿では,データスケジューリングとモデルマージという2つの観点から,テキスト埋め込みのためのマルチタスク学習の体系的研究を行う。
本稿では,Baging ベースの rObust mOdel Merging (BOOM) を提案する。
論文 参考訳(メタデータ) (2026-02-05T15:45:08Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Basis-Oriented Low-rank Transfer for Few-Shot and Test-Time Adaptation [10.804106052326402]
厳密なデータと計算予算の下で、大きな事前訓練されたモデルを未確認のタスクに適用することは、依然として困難である。
本稿では,既存の微調整モデルを再利用し,そのサブ空間内に適応するフレームワークBOLTを提案する。
本結果は,タスクインフォームド部分空間への制約適応が,目に見えないタスク転送の効果的な代替手段となることを示す。
論文 参考訳(メタデータ) (2025-12-02T06:00:16Z) - Detect Anything via Next Point Prediction [51.55967987350882]
Rex-Omniは最先端の物体認識性能を実現する3BスケールのMLLMである。
COCOやLVISのようなベンチマークでは、Rex-Omniは回帰ベースのモデルに匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2025-10-14T17:59:54Z) - FINE: Factorizing Knowledge for Initialization of Variable-sized Diffusion Models [35.40065954148091]
FINEはLearngeneフレームワークに基づく、事前訓練されたモデルを利用した下流ネットワークの初期化手法である。
事前学習された知識を行列の積(例えば$U$, $Sigma$, $V$)に分解する。
これは、特により小さなモデルにおいて、直接事前訓練よりも一貫して優れており、可変モデルのサイズで最先端の結果が得られる。
論文 参考訳(メタデータ) (2024-09-28T08:57:17Z) - Continual learning with task specialist [2.8830182365988923]
破滅的な忘れと限定されたラベル付きデータの問題に対処するために,タスクスペシャリストによる連続学習(CLTS)を提案する。
モデルはタスクスペシャリスト(T S)とタスク予測器(T P)と、事前訓練された安定拡散(SD)モジュールで構成される。
3つの実世界のデータセットで行った4つのSOTAモデルとの比較研究により、提案モデルが選択されたベースラインすべてより優れていることが示された。
論文 参考訳(メタデータ) (2024-09-26T12:59:09Z) - $k$NN Prompting: Beyond-Context Learning with Calibration-Free Nearest
Neighbor Inference [75.08572535009276]
In-Context Learning (ICL) は、ターゲットタスクを、インコンテキストのデモンストレーションで条件付のプロンプト完了として定式化する。
$k$NN 最初のクエリ LLM を分散表現のトレーニングデータで実行し、近くの隣人を参照してテストインスタンスを予測する。
数ショットのシナリオでは、最先端のキャリブレーションベースの手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2023-03-24T06:16:29Z) - Pushing the Limits of Simple Pipelines for Few-Shot Learning: External
Data and Fine-Tuning Make a Difference [74.80730361332711]
コンピュータビジョンにおいて、ほとんどショット学習は重要かつトピック的な問題である。
単純なトランスフォーマーベースのパイプラインは、標準ベンチマークで驚くほど優れたパフォーマンスが得られることを示す。
論文 参考訳(メタデータ) (2022-04-15T02:55:58Z) - Lifelong Learning Without a Task Oracle [13.331659934508764]
監視されたディープニューラルネットワークは、新しいタスクが学習されると、古いタスクの精度が大幅に低下することが知られている。
本稿では,メモリオーバーヘッドの少ないタスク割り当てマップの提案と比較を行う。
最高のパフォーマンスの変種は、平均的なパラメータメモリの増大を1.7%に抑えるだけである。
論文 参考訳(メタデータ) (2020-11-09T21:30:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。