論文の概要: GIFT: Goal-Injected Fine-Tuning for Efficient Manipulation Policy Adaptation
- arxiv url: http://arxiv.org/abs/2609.07006v1
- Date: Mon, 07 Sep 2026 03:56:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 01:55:42.088373
- Title: GIFT: Goal-Injected Fine-Tuning for Efficient Manipulation Policy Adaptation
- Title(参考訳): GIFT:効率的なマニピュレーションポリシー適応のためのゴールインジェクトファインタニング
- Authors: Xiaoyuan Fang, Shuo Feng, Yuxuan Wang, Enhua Cheng, Peng Zhou, Piji Li,
- Abstract要約: Goal-Injected Fine-Tuning (GIFT)は、生成されたゴール画像を事前訓練されたVLAモデルにシームレスに統合する軽量で効率的な微調整フレームワークである。
提案手法では,ゼロからパラメータを段階的に成長させるゼロd畳み込みにより,ゴール画像の特徴を観測に導入する。
トレーニングが進むにつれて、目標情報を徐々に組み込んで、モデルの安定性を損なうことなく、効率的な目標理解を可能にする。
- 参考スコア(独自算出の注目度): 24.751598161321933
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Compared with relying solely on initial observations and language instructions, predicting goal images with generative models as high-level visual guidance can significantly enhance the robustness of Vision-Language-Action (VLA) models. However, most existing foundation models have not systematically incorporated goal image conditioning due to the high computational training cost. To this end, we propose Goal-Injected Fine-Tuning (GIFT), a lightweight and efficient fine-tuning framework that seamlessly integrates generated goal images into multiple representative pretrained VLA models. Our approach introduces goal image features into observations via a zero-initialized convolution which progressively grows parameters from zero and prevents harmful noise from disrupting the pretrained policy during fine-tuning. As training proceeds, goal information is gradually incorporated, enabling efficient goal understanding without disrupting model stability. We further introduce a refined image editing method to generate semantically and visually consistent goal images from initial observations and task instructions. Experiments show that goal-aware VLA models achieve substantial performance gains across tasks: with only a single epoch of fine-tuning, GIFT outperforms the base model by 6.0% and 13.4% on two SIMPLER settings, and by 4.7% on LIBERO, demonstrating both efficiency and effectiveness.
- Abstract(参考訳): 初期観測と言語指示にのみ依存するのに比べ、高レベルの視覚誘導として生成モデルを用いた目標画像の予測は、ビジョン・ランゲージ・アクション(VLA)モデルの堅牢性を大幅に向上させることができる。
しかし、既存の基盤モデルの多くは、高い計算訓練コストのために、目標画像条件を体系的に組み込んでいない。
そこで本研究では,生成した目標画像を複数のプレトレーニング済みVLAモデルにシームレスに統合する,軽量かつ効率的な微調整フレームワークであるGoal-Injected Fine-Tuning (GIFT)を提案する。
提案手法では,ゼロからパラメータを段階的に成長させるゼロ初期化畳み込みを用いて,目標画像の特徴を観察に導入し,微調整中に有害なノイズが事前訓練されたポリシーを乱すのを防ぐ。
トレーニングが進むにつれて、目標情報を徐々に組み込んで、モデルの安定性を損なうことなく、効率的な目標理解を可能にする。
さらに、初期観測とタスク命令から意味的かつ視覚的に一貫したゴール画像を生成するための精巧な画像編集手法を導入する。
GIFTは2つのSIMPLER設定でベースモデルを6.0%、13.4%、LIBEROでは4.7%で上回り、効率と有効性を実証している。
関連論文リスト
- ActionCodec: What Makes for Good Action Tokenizers [106.78093973045526]
VLA(Vision-Language-Action)モデルでは、より優れた命令追従と訓練効率が示されている。
このパラダイムの中心はアクショントークン化であるが、その設計は主に再構築の忠実さに焦点を当てている。
我々は、トレーニング効率とVLA性能の両方を大幅に向上させる高性能なアクショントークンであるtextbfActionCodecを紹介する。
論文 参考訳(メタデータ) (2026-02-17T07:07:15Z) - VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models [26.542479606920423]
VLA(Vision-Language-Action)モデルは、幅広いロボット操作タスクにおいて強力なパフォーマンスを示している。
成功にもかかわらず、大きな事前訓練されたVLAモデルをアクション空間に拡張することで、視覚-アクションのミスアライメントを誘発することができる。
VLAモデルにおける視覚的条件付けを明確に強化するトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-04T20:59:29Z) - VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling [60.341503853471494]
本稿では,新しいカメラ視点と視覚摂動の下で,視覚言語行動モデルが急激に劣化することを示す。
本稿では,軽量で学習可能な更新によって視覚表現を再分類するワンショット適応フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-02T16:16:13Z) - Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation [52.261584726401686]
凍結した視覚基盤モデルの上に画像トークン化器を直接構築するための新しい方向を示す。
これらの設計に基づき,提案する画像トークン装置であるVFMTokは,画像再構成と生成品質の大幅な向上を実現している。
論文 参考訳(メタデータ) (2025-07-11T09:32:45Z) - Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models [30.7855782696894]
VLA(Vision-Language-Action)モデルは、自然言語による汎用ロボット制御の強力なパラダイムとして登場した。
VLAモデルにおけるアクション再利用を可能にする最初のトレーニングフリーかつプラグアンドプレイアクセラレーションフレームワークであるFlashVLAを提案する。
論文 参考訳(メタデータ) (2025-05-27T13:47:18Z) - Enhancing Large Vision Language Models with Self-Training on Image Comprehension [131.14381425260706]
本稿では、画像理解に特化して自己学習アプローチを強調する自己学習 on Image (STIC)を紹介する。
まず、ラベルのない画像を用いて、画像記述の好みを自己構築する。
抽出した視覚情報に対する推論をさらに自己改善するため,既存の命令調整データのごく一部をモデルに再利用する。
論文 参考訳(メタデータ) (2024-05-30T05:53:49Z) - VeCAF: Vision-language Collaborative Active Finetuning with Training Objective Awareness [56.87603097348203]
VeCAFはラベルと自然言語アノテーションを使用して、PVMの微調整のためのパラメトリックデータ選択を行う。
VeCAFは微調整の目的を取り入れて重要なデータポイントを選択し、PVMをより高速な収束に向けて効果的に導く。
ImageNetでは、VeCAFは最大3.3倍のトレーニングバッチを使用して、完全な微調整に比べて目標のパフォーマンスに到達する。
論文 参考訳(メタデータ) (2024-01-15T17:28:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。