論文の概要: Flatness Preserves Instruction Following in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2606.23641v1
- Date: Mon, 22 Jun 2026 17:30:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 17:30:33.51202
- Title: Flatness Preserves Instruction Following in Vision-Language-Action Models
- Title(参考訳): 視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線
- Authors: Haochen Zhang, Yonatan Bisk,
- Abstract要約: 視覚言語アクション(VLA)モデルは、事前訓練された視覚言語表現を活用することで、オープンワールドの一般化の可能性を秘めている。
VLAファインタニング中にシャープネスを意識した最小化を単純に適用すれば、複数のシミュレーションや実世界のベンチマークにおいて、命令の60%以上が大幅に改善されることを示す。
- 参考スコア(独自算出の注目度): 25.329212039294486
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models have the potential for open-world generalization by leveraging pretrained vision-language representations, yet downstream finetuning on limited robot data often degrades these representations, leading to brittle policies that ignore language instructions in favor of visual shortcuts, a failure mode we term instruction blindness. We hypothesize that standard finetuning with limited data applies gradients to a sparse set of points, which manifests as a sharp loss landscape with high-curvature minima. We propose to address this directly through flatness-preserving optimization while finetuning on the exact same data, where learning a flatter landscape results in a model more robust to perturbations in the weight space. Specifically, we demonstrate that simply applying sharpness-aware minimization during VLA finetuning significantly improves instruction following by over 60% across multiple simulation and real-world benchmarks without additional data, architectural modification, or retraining. We further analyze the effect of selective sharpness, quantify its effects, and show that our approach is complementary to existing guidance techniques. Project page can be found at https://haochenz11.github.io/papers/flatness-vla/.
- Abstract(参考訳): 視覚-言語-アクション(VLA)モデルは、事前訓練された視覚-言語表現を活用することで、オープンワールドの一般化の可能性を持つが、限られたロボットデータに基づく下流の微調整は、これらの表現を劣化させることが多く、視覚的ショートカット(英語版)を優先して言語命令を無視する脆弱なポリシー、命令の盲点(英語版)と呼ぶ失敗モード(英語版)をもたらす。
限られたデータによる標準的な微調整は、粗い点集合に勾配を適用し、高い曲率の最小値を持つ鋭いロスランドスケープとして現れると仮定する。
我々は,平らな景観を学習することで,重み空間の摂動に対してより堅牢なモデルが得られるような,全く同じデータを微調整しながら,平坦な保存最適化によって直接この問題に対処することを提案する。
具体的には、VLAファインタニング中にシャープネスを意識した最小化を適用するだけで、追加データやアーキテクチャ修正、再トレーニングを伴わずに、複数のシミュレーションや実世界のベンチマークにまたがる命令を60%以上改善できることを実証する。
さらに、選択的鋭さの効果を分析し、その効果を定量化し、既存の指導手法と相補的であることを示す。
プロジェクトページはhttps://haochenz11.github.io/papers/flatness-vla/にある。
関連論文リスト
- Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - Fine-Tuning Visual Autoregressive Models for Subject-Driven Generation [20.67671141789497]
主観駆動型生成のための最初のVARに基づくアプローチを提案する。
初期の段階は後者の段階よりも主題の生成に大きな影響を及ぼすことがわかった。
そこで本研究では,主観的関連情報に焦点をあてるモデルを促進するために,粗い分解能を優先するスケールワイド重み付けチューニングを提案する。
論文 参考訳(メタデータ) (2025-04-03T14:12:55Z) - Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment [57.0121616203175]
本研究では,視覚言語アライメントを改善するための細粒度検証器として,モデル自身のビジュアルエンコーダを利用する新たな自己アライメント手法であるFiSAOを提案する。
ビジョンエンコーダからのトークンレベルのフィードバックを活用することで、FiSAOは視覚言語アライメントを大幅に改善する。
論文 参考訳(メタデータ) (2024-10-18T03:34:32Z) - LOBG:Less Overfitting for Better Generalization in Vision-Language Model [19.890629892640206]
視覚言語モデルのためのLOBGというフレームワークを提案する。
私たちはCLIPを使用して、オーバーフィッティングを引き起こす可能性のあるきめ細かいフォアグラウンド情報をフィルタリングし、基本的な視覚概念でプロンプトを導く。
提案手法は,最先端手法と比較して,一般化能力を大幅に向上し,過度な適合を緩和する。
論文 参考訳(メタデータ) (2024-10-14T08:06:21Z) - Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization [77.62516752323207]
そこで本研究では,事前訓練した重みを効率よく微調整する直交微調整法を導入し,頑健さと一般化の強化を実現した。
自己正規化戦略は、OrthSRと呼ばれるVLMのゼロショット一般化の観点から安定性を維持するためにさらに活用される。
筆者らはCLIPとCoOpを再検討し,少数の画像のクラスフィシエーションシナリオにおけるモデルの改善を効果的に行う。
論文 参考訳(メタデータ) (2024-07-11T10:35:53Z) - Calibrated Self-Rewarding Vision Language Models [27.686545023186852]
LVLM(Large Vision-Language Models)は、訓練済みの大規模言語モデル(LLM)と視覚モデルを統合することで、指導チューニングを通じて大幅に進歩した。
LVLMは、しばしば幻覚現象を示し、生成されたテキスト応答は言語的に妥当に見えるが、入力画像に矛盾する。
本稿では,候補応答を反復的に生成し,各応答に対する報酬を評価し,微調整のための選好データをキュレートすることで,モデルの自己改善を可能にするCalibrated Self-Rewarding(CSR)アプローチを提案する。
論文 参考訳(メタデータ) (2024-05-23T14:30:33Z) - Extrapolation for Large-batch Training in Deep Learning [72.61259487233214]
我々は、バリエーションのホストが、我々が提案する統一されたフレームワークでカバー可能であることを示す。
本稿では,この手法の収束性を証明し,ResNet,LSTM,Transformer上での経験的性能を厳格に評価する。
論文 参考訳(メタデータ) (2020-06-10T08:22:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。