論文の概要: LAS-CLIP: A Lightweight Adapter Steering Approach for CLIP's Visual Encoder
- arxiv url: http://arxiv.org/abs/2610.03370v2
- Date: Mon, 05 Oct 2026 07:34:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.544411
- Title: LAS-CLIP: A Lightweight Adapter Steering Approach for CLIP's Visual Encoder
- Title(参考訳): LAS-CLIP:CLIPのビジュアルエンコーダのための軽量アダプタステアリングアプローチ
- Abstract要約: 本稿では,すべてのCLIPパラメータを凍結に保つ軽量アダプタステアリング手法LAS-CLIPを提案する。
コンパクトなMaskAdapterは、入力マスクからヘッド毎の注意バイアスを生成し、凍結した自己注意層に注入し、ターゲット領域に注意を向ける。
LAS-CLIPは、ImageNet-Sゼロショット分類とRefCOCO参照表現の理解において、Alpha-CLIPと比較して、競合あるいは優位に働く。
- 参考スコア(独自算出の注目度): 16.231215866090057
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: CLIP's visual encoder produces only global image representations, limiting its use in region-level tasks. Existing adaptations rely on visual prompting, input masking, or encoder fine-tuning, each compromising pre-trained representations. We propose LAS-CLIP, a Lightweight Adapter Steering approach that keeps every CLIP parameter frozen. A compact MaskAdapter generates per-head, per-layer attention biases from an input mask and injects them into the frozen self-attention layers, steering attention toward the target region. Crucially, because the backbone remains strictly untouched, LAS-CLIP seamlessly reverts to vanilla CLIP when no mask is provided, preserving its foundational zero-shot capabilities. With approximately 116K to 145K trainable parameters and 100K training samples on two T4 GPUs, LAS-CLIP achieves competitive or superior results compared to Alpha-CLIP on ImageNet-S zero-shot classification and RefCOCO referring expression comprehension, despite the latter fine-tuning its entire encoder on millions of samples. Qualitative analysis further confirms stronger representational fidelity under incorrect masks and in downstream generation.
- Abstract(参考訳): CLIPのビジュアルエンコーダはグローバルなイメージ表現のみを生成し、リージョンレベルのタスクでの使用を制限する。
既存の適応は視覚的なプロンプト、入力マスキング、エンコーダの微調整に依存し、それぞれが事前訓練された表現を妥協する。
本稿では,すべてのCLIPパラメータを凍結に保つ軽量アダプタステアリング手法LAS-CLIPを提案する。
コンパクトなMaskAdapterは、入力マスクからヘッド毎の注意バイアスを生成し、凍結した自己注意層に注入し、ターゲット領域に注意を向ける。
重要なことに、バックボーンは厳密には触れられていないため、LAS-CLIPはマスクが提供されていないときにバニラCLIPにシームレスに復帰し、基礎となるゼロショット機能を保持する。
約116Kから145Kのトレーニング可能なパラメータと2つのT4 GPU上での100Kトレーニングサンプルにより、LAS-CLIPは、数百万のサンプルに対してエンコーダ全体を微調整したにもかかわらず、ImageNet-Sゼロショット分類とRefCOCO参照表現の理解に関するAlpha-CLIPと比較して、競合あるいは優れた結果が得られる。
定性的解析により、不正確なマスクと下流発生下での強い表現の忠実さがさらに確認される。
関連論文リスト
- SuperCLIP: CLIP with Simple Classification Supervision [88.86549733903314]
Contrastive Language-Image Pretrainingは、画像とテキストを共有埋め込み空間に整列させることにより、視覚言語タスクの強力な一般化を実現する。
近年,CLIP様モデルでは,テキスト中の微細なセマンティック信号が依然として使われていないことが報告されている。
分類に基づく教師付きコントラスト学習のフレームワークであるSuperCLIPを提案する。
論文 参考訳(メタデータ) (2025-12-16T15:11:53Z) - un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP [75.19266107565109]
コントラスト言語-画像事前学習(CLIP)が基礎モデルとなり、様々なビジョンやマルチモーダルタスクに適用されている。
この作業は既存のCLIPモデルの改善に重点を置いており、可能な限り多くの画像の視覚的詳細をキャプチャすることを目的としている。
論文 参考訳(メタデータ) (2025-05-30T12:29:38Z) - Learning Mask-aware CLIP Representations for Zero-Shot Segmentation [120.97144647340588]
Mask-awareProposals CLIP (IP-CLIP) は任意の数の画像とマスクの提案を同時に処理するために提案されている。
マスク認識損失と自己蒸留損失はIP-CLIPを微調整するように設計されており、CLIPが異なるマスク提案に応答することを保証している。
我々は、人気のあるゼロショットベンチマークで広範な実験を行う。
論文 参考訳(メタデータ) (2023-09-30T03:27:31Z) - VadCLIP: Adapting Vision-Language Models for Weakly Supervised Video
Anomaly Detection [58.47940430618352]
弱教師付きビデオ異常検出(WSVAD)のための新しいパラダイムであるVadCLIPを提案する。
VadCLIPは、CLIPの強度に関する視覚と言語の間のきめ細かい関連をフル活用している。
本稿では,VadCLIPが粗粒度および細粒度 WSVAD の両面において最高の性能を発揮することを示す。
論文 参考訳(メタデータ) (2023-08-22T14:58:36Z) - ZegCLIP: Towards Adapting CLIP for Zero-shot Semantic Segmentation [35.60888272729273]
近年、CLIPは2段階のスキームを用いて画素レベルのゼロショット学習タスクに適用されている。
このような方式は有効であるが、2つの画像エンコーダが必要であり、1つは提案生成用、もう1つはCLIP用であり、複雑なパイプラインと高い計算コストをもたらす。
本稿では,CLIPのゼロショット予測能力を画像からピクセルレベルまで直接拡張する,シンプルかつ効率的なワンステージソリューションを提案する。
論文 参考訳(メタデータ) (2022-12-07T12:05:00Z) - Open-Vocabulary Universal Image Segmentation with MaskCLIP [24.74805434602145]
我々は、新しいコンピュータビジョンタスク、オープン語彙のユニバーサルイメージセグメンテーションに取り組む。
トレーニング済みのCLIPモデルを直接適用することで,まずベースライン手法を構築する。
次に, MaskCLIP Visual を用いた Transformer ベースのアプローチである MaskCLIP を開発した。
論文 参考訳(メタデータ) (2022-08-18T17:55:37Z) - PointCLIP: Point Cloud Understanding by CLIP [77.02399444893963]
本稿では,CLIP符号化点クラウドと3Dカテゴリテキストのアライメントを行うPointCLIPを提案する。
PointCLIPは、リソースコストとデータレシエーションの低いCLIPによる効果的な3Dポイントクラウド理解のための、有望な代替手段である。
論文 参考訳(メタデータ) (2021-12-04T19:42:40Z) - Supervision Exists Everywhere: A Data Efficient Contrastive
Language-Image Pre-training Paradigm [109.0573737034428]
大規模コントラスト言語-画像事前訓練(CLIP)は、その印象的なゼロショット認識能力と下流タスクへの優れた転送性により、前例のない注目を集めている。
本研究は,この制限を緩和する新たなトレーニングパラダイムであるData efficient CLIP (DeCLIP)を提案する。
画像とテキストのペア間の広範な監視を慎重に活用することにより、De-CLIPは汎用的な視覚的特徴をより効率的に学習できることを実証する。
論文 参考訳(メタデータ) (2021-10-11T12:17:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。