論文の概要: Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis
- arxiv url: http://arxiv.org/abs/2609.00746v1
- Date: Tue, 01 Sep 2026 05:24:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.401733
- Title: Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis
- Title(参考訳): 視覚言語適応におけるテキスト能力の喪失:注意-シンク診断
- Abstract要約: 事前訓練されたLLMを視覚言語モデル(VLM)に微調整することで、バックボーンのテキスト能力を損なうことができる。
我々は、VLトレーニングなしでVL後の劣化を予測する1つのGPU上で、ベースLLM上で数秒で計算された1つのスカラーであるSink Strengthを紹介した。
プレトレーニング後のQK-RMSNorm注入はネイティブQK-RMSNormの保護を再現するのに失敗するのに対し,市販の重み付け設定では失われる能力の回復に失敗する。
- 参考スコア(独自算出の注目度): 9.63471910507313
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-tuning a pretrained LLM into a vision-language model (VLM) can erode the backbone's text capability, with the damage concentrated on tasks that require following exact output rules, such as instruction following, chain-of-thought reasoning graded on a strictly parsed final answer, and similar evaluations with strict graders. We trace this gap to attention-sink corruption: VL fine-tuning perturbs the early sink position that anchors a large fraction of attention probability, and how well the base LLM preserves its sink tracks how much of the affected capability survives adaptation. Building on this view, we introduce Sink Strength, a single scalar computed on the base LLM in a few seconds on a single GPU that predicts post-VL degradation without any VL training. It consistently tracks relative degradation across the six VLM-LLM pairs and multiple format-sensitive tasks. Complementing this diagnostic, we find that post-pretraining QK-RMSNorm injection fails to reproduce the protection of native QK-RMSNorm, while several off-the-shelf weight-merging settings fail to recover the lost capability after VL training. These negative results underscore the value of screening backbones with Sink Strength before VL training and narrow the intervention space toward head-selective training-time protection.
- Abstract(参考訳): 事前訓練されたLLMを視覚言語モデル(VLM)に微調整することで、バックボーンのテキスト能力を損なうことができる。
VLファインチューニングの摂動は、多くの注意確率を固定する早期の沈み込み位置と、ベースLLMがその沈み込みをどれだけ長く保っているかが、影響を受ける能力のどれ程が順応できるかを追跡できる。
このビューに基づいて、VLトレーニングなしでVL後の劣化を予測する1つのGPU上で、ベースLLM上で数秒で計算された1つのスカラーであるSink Strengthを導入する。
6つのVLM-LLMペアと複数のフォーマット依存タスクの相対的な劣化を継続的に追跡する。
術後QK-RMSNorm注入はQK-RMSNormの保護を再現できないが,市販の重量統合設定ではVL訓練後に消失した能力を回復できない。
これらの陰性な結果は、VLトレーニングの前にシンク強度のあるバックボーンをスクリーニングし、頭部選択的トレーニング時間保護に向けて介入空間を狭めることの意義を浮き彫りにした。
関連論文リスト
- TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors [54.12833308568015]
VLA(Vision-Language-Action)モデルは、エンドユーザが監査できないパイプラインを通じてデプロイされる。
小さな視覚トリガーは、障害が観測可能である前に、長い水平ロボットポリシーをリダイレクトする。
個別に提案した2つのVLA攻撃を通してこのギャップについて検討した。
論文 参考訳(メタデータ) (2026-07-14T09:43:52Z) - Semi-Supervised Vision-Language-Action Model [17.893249958828218]
VLA(Vision-Language-Action)モデルは、ロボットが視覚的な観察や言語指示から直接アクションを予測することを可能にするが、それらを新しい環境に適用することは、コストのかかるアクションラベルによるデモンストレーションに依存する。
限定的な監視信号の下で準教師付きVLA適応について検討し、少数の軌道だけがロボットの動作を含み、残りの軌道はアクション未ラベルの視覚言語観測を提供する。
標準的な半教師あり学習とは異なり、視覚的に接地し、言語に一貫性があり、物理的に実現可能で、時間的に安定な動作信号である。
論文 参考訳(メタデータ) (2026-06-19T14:42:52Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding [60.06899554269808]
サイクロンVLA(CycleVLA)は、VLA(Vision-Language-Action Model)を積極的に自己補正するシステムである。
CycleVLAは、重要なサブタスク遷移ポイントにフラグを付けるプログレス対応のVLAを統合することで、これを実現する。
大規模な実験により、CycleVLAは、よく訓練されたVLAと訓練されていないVLAの両方のパフォーマンスを改善することが示された。
論文 参考訳(メタデータ) (2026-01-05T17:31:01Z) - COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning [55.83415345423854]
批判的オブジェクト指向(CO)推論と強化学習(RL)を統合した新しいエンドツーエンド駆動フレームワークCOVLM-RLを提案する。
CARLAシミュレータで行った実験により、COVLM-RLはトレーニング運転環境における成功率を30%向上することが示された。
論文 参考訳(メタデータ) (2025-12-10T06:18:16Z) - Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting [70.83781268763215]
視覚言語モデル(VLM)は、大規模事前学習を活用することで、多様なマルチモーダルタスクにおいて優れたパフォーマンスを実現している。
VLMは、クロスモーダル機能ドリフト、共有アーキテクチャによるパラメータ干渉、ゼロショット機能侵食など、ユニークな課題に直面している。
本調査は、生涯の視覚言語システムを開発する研究者にとって、包括的かつ診断的な基準となることを目的としている。
論文 参考訳(メタデータ) (2025-08-06T09:03:10Z) - Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models [26.83278034227966]
VLM(Vision-Language Models)の安全アライメント能力は、視覚モジュールの統合によって劣化しがちである。
VLMに視覚モダリティを導入する際に現れる表現ギャップから課題が生じることを示す。
安全アライメントの劣化を低減するため,Cross-Modality Representation Manipulation (CMRM)を導入する。
論文 参考訳(メタデータ) (2024-10-11T17:59:31Z) - Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models [39.56233272612982]
現在の視覚大言語モデル(VLLM)は、有害なコンテンツを生成する傾向があり、ジェイルブレイク攻撃に弱い。
最初の分析では、視覚言語指導の微調整中に有害なデータが存在することが原因であることが判明した。
この問題に対処するために、まず、様々な有害なカテゴリをカバーする視覚言語安全な命令追従データセットVLGuardをキュレートする。
論文 参考訳(メタデータ) (2024-02-03T16:43:42Z) - Are Large Language Models Really Robust to Word-Level Perturbations? [68.60618778027694]
本稿では,事前学習した報酬モデルを診断ツールとして活用する,新たな合理的評価手法を提案する。
より長い会話は、質問を理解する能力の観点から言語モデルの包括的把握を示す。
この結果から,LLMは日常言語でよく使われる単語レベルの摂動に対する脆弱性をしばしば示している。
論文 参考訳(メタデータ) (2023-09-20T09:23:46Z) - Contrastive Visual-Linguistic Pretraining [48.88553854384866]
コントラスト的視覚言語事前学習は、コントラスト的学習に基づいて構築された視覚的自己監督的損失を構成する。
VQA, GQA, NLVR2などの下流タスクで評価した。
論文 参考訳(メタデータ) (2020-07-26T14:26:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。