論文の概要: TASSO: TAsk-Specific Subspace Optimization for Continual Learning of Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.21487v1
- Date: Fri, 21 Aug 2026 12:18:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.227321
- Title: TASSO: TAsk-Specific Subspace Optimization for Continual Learning of Vision-Language Models
- Title(参考訳): TASSO:視覚言語モデルの連続学習のためのタスク特化部分空間最適化
- Authors: Chang Sun, Francesco Barbato, Matteo Caligiuri, Pietro Zanuttigh,
- Abstract要約: ネットワークの可塑性を確保しつつ、遅延空間形状を効率的に保存する新しいパラダイムであるTASSOを紹介する。
我々はこれを,部分空間学習と幾何学的知識蒸留という2つの補完的手法で実現した。
マルチドメインタスクインクリメンタルおよびクラスインクリメンタル学習ベンチマークにおけるCLIPビジョン言語モデルの結果は、最先端メソッドよりも明らかに改善されている。
- 参考スコア(独自算出の注目度): 16.338978271294973
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Models (VLMs) exhibit strong zero-shot capabilities, making them an attractive solution for continual learning across diverse tasks. However, during continual adaptation, both catastrophic forgetting and zero-shot degradation occur, severely degrading performance. In this paper, we introduce TASSO, a new paradigm that efficiently preserves the latent space geometry while ensuring network plasticity. We achieve this with two complementary techniques: subspace learning and geometry-aware knowledge distillation. Specifically, we first learn a sequence of task-specific low-rank projectors, which we use to project the latent representations before optimizing cross-entropy. Secondly, we employ a geodesic-distance-based loss that distills knowledge from the previous-task model while effectively preserving the latent space geometry. These design choices not only avoid unnecessary parameter updates along the full embedding dimensions but also improve learning by focusing on task-specific manifolds. Moreover, the geometry-aware distillation provides strong regularization and significantly reduces both catastrophic forgetting and zero-shot degradation throughout the continual learning sequence. Experimental results with the CLIP vision language model in the multi-domain task incremental and class incremental learning benchmarks demonstrate clear improvements over state-of-the-art methods in mitigating forgetting and preserving zero-shot capabilities.
- Abstract(参考訳): VLM(Vision-Language Models)は、強力なゼロショット能力を示し、多様なタスクをまたいだ継続的な学習のための魅力的なソリューションである。
しかし, 連続適応においては, 破滅的忘れとゼロショット劣化が生じ, 著しく劣化する。
本稿では,ネットワークの可塑性を確保しつつ,遅延空間の幾何を効率的に保存する新しいパラダイムであるTASSOを紹介する。
我々はこれを,部分空間学習と幾何学的知識蒸留という2つの補完的手法で実現した。
具体的には、まずタスク固有の低ランクプロジェクタの列を学習し、これはクロスエントロピーを最適化する前に潜在表現を投影するために使用する。
第二に、測地距離に基づく損失を用いて、先行タスクモデルから知識を蒸留し、潜在空間幾何を効果的に保存する。
これらの設計選択は、完全な埋め込み次元に沿った不要なパラメータ更新を避けるだけでなく、タスク固有の多様体に焦点を当てて学習を改善する。
さらに、幾何認識蒸留は強い正則化をもたらし、連続的な学習シーケンスを通して破滅的忘れ込みとゼロショット劣化の両方を著しく低減する。
マルチドメインタスクインクリメンタルおよびクラスインクリメンタル学習ベンチマークにおけるCLIPビジョン言語モデルによる実験結果から、ゼロショット機能の省略と保存を緩和する最先端手法に対する明らかな改善が示された。
関連論文リスト
- SAE-FD: Sparse Autoencoder Feature Distillation for Continual Learning of Large Language Models [21.844862497952334]
methodは、事前訓練されたスパースオートエンコーダのスパース特徴空間におけるモデル表現をアンカーする。
2つの連続学習ベンチマークの実験では、手法が既存の正規化に基づく手法を一貫して上回っていることが示されている。
論文 参考訳(メタデータ) (2026-05-25T07:27:41Z) - Representation Finetuning for Continual Learning [21.63273394445167]
本稿では,連続表現学習(Continuous Representation Learning, CoRe)を紹介する。
低ランクな部分空間に更新を制限することにより、CoReは例外的なパラメータ効率を達成する。
我々の研究は、連続学習のための新しい、より効果的で解釈可能なパラダイムとして表現微調整を導入している。
論文 参考訳(メタデータ) (2026-03-11T18:15:31Z) - SPREAD: Subspace Representation Distillation for Lifelong Imitation Learning [11.023696977257883]
生涯の模倣学習における重要な課題は、エージェントが事前知識を維持しながら専門家のデモンストレーションから新しいスキルを習得できるようにすることである。
生の特徴空間におけるL2-ノルム特徴マッチングに依存する既存の蒸留法は,ノイズや高次元変動に敏感である。
低ランク部分空間内のタスク間でポリシー表現を整合させるために特異値分解を利用する幾何保存フレームワークSPREADを導入する。
論文 参考訳(メタデータ) (2026-03-09T03:38:42Z) - GNSP: Gradient Null Space Projection for Preserving Cross-Modal Alignment in VLMs Continual Learning [27.9960664846484]
コントラスト言語-画像事前学習は、共有埋め込み空間における視覚的・テキスト的モダリティを整列させることにより、目覚ましいゼロショットの一般化を示した。
様々なタスクを継続的に微調整すると、CLIPはその埋め込みアライメントの破滅的な忘れ込みと劣化に悩まされる。
GNSP(Gradient Null Space Projection)は,タスク固有の勾配を以前に学習した知識のnull空間に投影する,効率的な連続学習手法である。
論文 参考訳(メタデータ) (2025-07-26T07:22:12Z) - SplitLoRA: Balancing Stability and Plasticity in Continual Learning Through Gradient Space Splitting [68.00007494819798]
継続的な学習には、安定性を保ちながら複数のタスクを連続的に学習するモデルが必要である。
グラディエント・プロジェクションはCLにおいて有効で一般的なパラダイムとして現れ、以前に学習したタスクの勾配空間を2つの部分空間に分割する。
新しいタスクは小部分空間内で効果的に学習され、これにより以前取得した知識との干渉が軽減される。
既存の勾配射影法は、勾配空間を適切に分割することが困難であるため、塑性と安定性の最適なバランスを達成するのに苦労する。
論文 参考訳(メタデータ) (2025-05-28T13:57:56Z) - Sculpting Subspaces: Constrained Full Fine-Tuning in LLMs for Continual Learning [19.27175827358111]
大規模言語モデル(LLM)における継続的な学習は破滅的な忘れがちである。
適応特異値分解(SVD)を利用した連続的完全微調整手法を提案する。
我々は,Encoder-decoder (T5-Large) モデルとdecoder-only (LLaMA-2 7B) モデルの両方を用いて,標準連続学習ベンチマークを広範囲に評価した。
論文 参考訳(メタデータ) (2025-04-09T17:59:42Z) - Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization [77.62516752323207]
そこで本研究では,事前訓練した重みを効率よく微調整する直交微調整法を導入し,頑健さと一般化の強化を実現した。
自己正規化戦略は、OrthSRと呼ばれるVLMのゼロショット一般化の観点から安定性を維持するためにさらに活用される。
筆者らはCLIPとCoOpを再検討し,少数の画像のクラスフィシエーションシナリオにおけるモデルの改善を効果的に行う。
論文 参考訳(メタデータ) (2024-07-11T10:35:53Z) - Visual Prompt Tuning in Null Space for Continual Learning [51.96411454304625]
既存のプロンプトチューニング手法は、継続学習(CL)における印象的な性能を示す。
本稿では,従来のタスクの特徴に代表される部分空間に直交する方向のプロンプトを調整し,各タスクを学習することを目的とする。
実際には、即時勾配予測を実装するために、実効的なヌル空間に基づく近似解が提案されている。
論文 参考訳(メタデータ) (2024-06-09T05:57:40Z) - FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models [59.13757801286343]
クラス増分学習(class-incremental learning)は、モデルが限られたデータで漸進的にトレーニングされている場合、破滅的な忘れの問題を軽減することを目的としている。
本稿では,特徴空間の不整合のための冗長特徴除去器 (RFE) と,重要な雑音に対する空間ノイズ補償器 (SNC) の2つの新しいコンポーネントを備えたFILP-3Dフレームワークを紹介する。
論文 参考訳(メタデータ) (2023-12-28T14:52:07Z) - FOSTER: Feature Boosting and Compression for Class-Incremental Learning [52.603520403933985]
ディープニューラルネットワークは、新しいカテゴリーを学ぶ際に破滅的な忘れ方に悩まされる。
本稿では,新たなカテゴリを適応的に学習するためのモデルとして,新しい2段階学習パラダイムFOSTERを提案する。
論文 参考訳(メタデータ) (2022-04-10T11:38:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。