論文の概要: Dive Into the Implicit Biases of Low-rank Vision-language Alignment
- arxiv url: http://arxiv.org/abs/2607.08194v1
- Date: Thu, 09 Jul 2026 07:50:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.452657
- Title: Dive Into the Implicit Biases of Low-rank Vision-language Alignment
- Title(参考訳): 低ランク視覚言語アライメントのインシシトビアーズへの入力
- Authors: Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu,
- Abstract要約: 低ランクアライメントは計算コストを低減させるだけでなく、ほとんどのベンチマークで完全なパラメータアライメントを上回ります。
経験的に、低ランクアライメントは幻覚から保守的なモデル行動にシフトし、視覚特徴の言語ごとの線形分離性を保っている。
低ランクなアライメントが平坦な勾配を持つパラメータ部分空間と摂動に頑健な特徴部分空間の選好を誘導することを示す2つの定理を確立する。
- 参考スコア(独自算出の注目度): 22.80937850155209
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vision-language alignment, the stage that bridges pretrained vision encoders and large language models, is widely treated as a form of pretraining requiring full-parameter updates. We challenge this view and investigate what happens when low-rank adaptation is applied to the LLM during this stage instead. We find that low-rank alignment not only reduces computational costs but also outperforms full-parameter alignment on most benchmarks. To understand this phenomenon, we systematically characterize the implicit biases introduced by low-rank adaptation during alignment. Empirically, we find that low-rank alignment shifts model behavior from hallucinatory to conservative and preserves per-token linear separability of visual features that full-parameter alignment disrupts, a phenomenon we term LS-curse. Geometrically, low rank aligned models exhibit more homogeneous and structurally stable visual representations, maintaining modality-specific knowledge rather than prematurely fusing entity-level semantics. Theoretically, we establish two theorems showing that low-rank alignment induces preferences for parameter subspaces with flat gradients and feature subspaces robust to perturbations, providing a principled explanation for the observed structure-preserving behavior. Extensive experiments cover ablation over 100 alignment configurations, three families of low-rank operators, and various rank, encoder, and other settings.
- Abstract(参考訳): 事前訓練された視覚エンコーダと大規模言語モデルを橋渡しする視覚言語アライメントは、フルパラメータ更新を必要とする事前訓練の形式として広く扱われている。
我々はこの見解に挑戦し、この段階で低ランク適応をLLMに適用した場合に何が起こるかを検討する。
低ランクアライメントは計算コストを低減させるだけでなく、ほとんどのベンチマークでフルパラメータアライメントを上回ります。
この現象を理解するために、アライメント中に低ランク適応によって生じる暗黙のバイアスを体系的に特徴づける。
経験的に、低ランクアライメントは幻覚から保守的なモデル行動にシフトし、フルパラメータアライメントが破壊する視覚特徴のトーケン毎の線形分離性を保ちます。
幾何学的には、低階のアライメントモデルの方がより均質で構造的に安定な視覚表現を示し、未熟な実体レベルの意味論を融合させるよりも、モダリティ固有の知識を維持する。
理論的には、低ランクアライメントが平坦な勾配を持つパラメータ部分空間と摂動に頑健な特徴部分空間の選好を誘導することを示す2つの定理を確立し、観測された構造保存挙動の原理的な説明を与える。
大規模な実験では、100以上のアライメント構成、低ランク演算子の3つのファミリー、様々なランク、エンコーダ、その他の設定がカバーされている。
関連論文リスト
- Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation [54.74045834035952]
視覚言語データセット蒸留(VLDD)は、大きな画像テキストのペア化されたデータセットを小さな合成ペアに圧縮する。
階層幾何学と明示的なアライメント・キャパシティ制御を組み合わせたランク認識型双曲アライメント(RAHA)を提案する。
RAHAは、競争力のあるクロスモーダル検索と、固定予算下での転送インジケータの改善を示す。
論文 参考訳(メタデータ) (2026-06-28T15:41:31Z) - SDS-LoRA: Overcoming Anisotropic Gradient Scaling in Low-Rank Adaptation [64.33799467286265]
Low-Rank Adaptation (LoRA)は、大規模な事前訓練されたモデルの下流タスクへの効率的な適応を可能にする。
完全な微調整勾配が低ランク行列に逆伝播すると,その特異値によって誘導される異方性スケーリングを受けることを示す。
本稿では,後方パスから特異値を構造的に分離する新しい低ランクパラメータ化SDS-LoRAを提案する。
論文 参考訳(メタデータ) (2026-06-15T09:27:50Z) - When Both Layers Learn: Training Dynamics of Representing Linear Models via ReLU Networks [22.81761236732655]
線形対象関数に適合する1層ReLUネットワークの両層を協調的にトレーニングするための勾配勾配ダイナミクスについて検討した。
本分析では, 隠れ重みが植え付け方向と漸進的に一致し, 出力重みが正しい符号パターンを維持できるアライメントフェーズを3つのフェーズで追跡する。
我々は,全軌道に沿って保持される新しい一様濃度結果を確立し,次々に最適な試料の複雑性を得るのに不可欠である。
論文 参考訳(メタデータ) (2026-06-03T05:44:30Z) - Representation Collapse in Sequential Post-Training of Large Language Models [17.437127662981847]
逐次後学習が内部表現を低ランク,異方性,均一な特徴空間に徐々に圧縮するかどうかを考察する。
我々は,制御段階順序下での教師付き微調整,選好最適化,安全/拒絶チューニング,数学とコードの特殊化,および長いチェーン・オブ・シンキングを解析した。
論文 参考訳(メタデータ) (2026-05-28T19:59:17Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers [93.3976834364707]
本稿では,特徴写像のリレーショナル幾何における整合性を実現する構造的RePresentation AlignmentフレームワークであるsREPAを提案する。
モデルが事前訓練された特徴から全体的空間配置と構造的相関を内包するように促すことにより、sREPAはより高速でより安定した収束を達成する。
論文 参考訳(メタデータ) (2026-05-16T12:01:04Z) - AHPA: Adaptive Hierarchical Prior Alignment for Diffusion Transformers [24.937985157569823]
我々は,信号と雑音の比に応じて,表現監督の有用な粒度が体系的に変化するため,このような時間ステップに依存しないアライメントが最適であると主張する。
ハイノイズでは拡散モデルはより粗い意味とレイアウトレベルのアンカーの恩恵を受けるが、低ノイズでは、トレーニング信号は空間的詳細で構造的に忠実な洗練を強調するべきである。
この非定常アライメント動作は、静的なシングルレベルスーパーバイザーに対する表現ミスマッチを生成する。
論文 参考訳(メタデータ) (2026-05-05T03:07:29Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - State Rank Dynamics in Linear Attention LLMs [37.607046806053035]
州の階級階層化は、線形アテンションヘッド間で異なるスペクトル分岐によって特徴づけられる。
低ランクの頭部はモデル推論に欠かせないが、高ランクの頭部は顕著な冗長性を示す。
我々は,KVキャッシュのオーバーヘッドを38.9%削減し,モデル精度を大きく維持するゼロショット戦略であるJoint Rank-Norm Pruningを提案する。
論文 参考訳(メタデータ) (2026-02-02T15:00:42Z) - Beyond the Edge of Stability via Two-step Gradient Updates [49.03389279816152]
Gradient Descent(GD)は、現代の機械学習の強力な仕事場である。
GDが局所最小値を見つける能力は、リプシッツ勾配の損失に対してのみ保証される。
この研究は、2段階の勾配更新の分析を通じて、単純だが代表的でありながら、学習上の問題に焦点をあてる。
論文 参考訳(メタデータ) (2022-06-08T21:32:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。