論文の概要: Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling
- arxiv url: http://arxiv.org/abs/2605.22484v1
- Date: Thu, 21 May 2026 13:41:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.279714
- Title: Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling
- Title(参考訳): セマンティックなプロトタイプとしての監督型分類:重量リサイクルによる視覚・言語アライメントのアンロック
- Authors: David Méndez, Roberto Confalonieri, Natalia Díaz Rodríguez,
- Abstract要約: ポストホックアライメント法は、軽量マッピングを通じて予め訓練されたエンコーダを接続することで計算コストを削減する。
本研究では,事前学習された視覚モデルの分類ヘッドを意味的プロトタイプとして再利用する可能性について検討する。
本手法をいくつかの最先端のポストホックアライメント手法と組み合わせることで、クロスモーダル検索やゼロショット、少数ショットの分類タスクにおける精度が一貫して向上することが実証された。
- 参考スコア(独自算出の注目度): 1.376408511310322
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) excel at tasks like zero-shot classification and cross-modal retrieval by mapping images and text to a shared space, but this requires expensive end-to-end training with massive paired datasets. Current post-hoc alignment methods reduce computational costs by connecting pretrained encoders through lightweight mappings, yet still demand substantial paired data. In this work, we investigate the potential of repurposing the classification heads of pretrained vision models as semantic prototypes. The recycling of these weights, typically discarded after pretraining, unlocks two distinct capabilities: it enables zero-shot alignment by using weights as semantic anchors, and serves as a robust data augmentation strategy by mixing these prototypes with real image-text pairs. We demonstrate that integrating our approach with several state-of-the-art post-hoc alignment techniques consistently boosts accuracy in cross-modal retrieval, zero- and few-shot classification tasks.
- Abstract(参考訳): VLM(Vision-Language Models)は、画像やテキストを共有スペースにマッピングすることで、ゼロショット分類やクロスモーダル検索といったタスクに優れていますが、大規模なペアデータセットを使用した、高価なエンドツーエンドトレーニングが必要です。
現在のポストホックアライメント法は、訓練済みエンコーダを軽量なマッピングで接続することで計算コストを削減するが、かなりのペアデータを必要とする。
本研究では,事前学習された視覚モデルの分類ヘッドを意味的プロトタイプとして再開発する可能性について検討する。
重みをセマンティックアンカーとして使用することで、ゼロショットアライメントを可能にし、これらのプロトタイプを実際の画像テキストペアと混ぜることで、堅牢なデータ拡張戦略として機能する。
本手法をいくつかの最先端のポストホックアライメント手法と組み合わせることで、クロスモーダル検索やゼロショット、少数ショットの分類タスクにおける精度が一貫して向上することが実証された。
関連論文リスト
- Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification [52.48204114948899]
本研究は,画像とテキストのプロトタイプを直接混合した場合の影響について考察する。
試作品の混合は, 収縮推定器として機能することを示す。
そこで本研究では,画像のプロトタイプをセマンティックテキスト埋め込み空間の主方向へ投影し,テキスト対応のセマンティックイメージ部分空間を得る。
論文 参考訳(メタデータ) (2026-03-25T17:04:43Z) - Post-pre-training for Modality Alignment in Vision-Language Foundation Models [12.110530026601968]
本稿では,CLIPモデルの事前学習と微調整の段階における事前学習手法であるCLIP-Refineを提案する。
ゼロショットのパフォーマンス劣化を伴わずに、小さな画像テキストデータセットに対する1エポックトレーニングとフィーチャースペースの整合性を目指す。
論文 参考訳(メタデータ) (2025-04-17T07:46:19Z) - Grounding Descriptions in Images informs Zero-Shot Visual Recognition [47.66166611138081]
我々は,表現を細かなレベルと粗いレベルの両方で同時に調整することを目的とした,新しい事前学習戦略であるGRAINを提案する。
我々は,現在の最先端技術と比較して,モデルのゼロショット性能の向上を実証する。
論文 参考訳(メタデータ) (2024-12-05T18:52:00Z) - Match me if you can: Semi-Supervised Semantic Correspondence Learning with Unpaired Images [76.47980643420375]
本稿では,意味的対応の学習に固有のデータ・ハングリー・マターが存在するという仮説に基づく。
我々は,機械の監督を通じて,ペア化されたキーポイントを確実に強化する単純な機械注釈器を実証する。
我々のモデルは,SPair-71k,PF-PASCAL,PF-WILLOWといった意味対応学習ベンチマークの最先端モデルを上回る。
論文 参考訳(メタデータ) (2023-11-30T13:22:15Z) - With a Little Help from your own Past: Prototypical Memory Networks for
Image Captioning [47.96387857237473]
我々は、他のトレーニングサンプルを処理しながら得られたアクティベーションに注意を向けるネットワークを考案した。
私たちのメモリは、プロトタイプベクトルの定義を通じて過去のキーと値の分布をモデル化します。
本研究では,エンコーダ・デコーダ変換器の性能を3.7 CIDErポイント向上できることを示す。
論文 参考訳(メタデータ) (2023-08-23T18:53:00Z) - LPN: Language-guided Prototypical Network for few-shot classification [16.37959398470535]
ラベル付き例を限定して、新しいタスクに適応することを目的としている。
近年の手法では,クエリとサポート画像の類似性の適切な測定方法が検討されている。
本稿では,言語誘導型プロトタイプネットワーク(LPN)を提案する。
論文 参考訳(メタデータ) (2023-07-04T06:54:01Z) - Generating More Pertinent Captions by Leveraging Semantics and Style on
Multi-Source Datasets [56.018551958004814]
本稿では,データソースの非一様結合をトレーニングすることで,流動的な記述を生成するタスクに対処する。
ノイズの多い画像とテキストのペアを持つ大規模データセットは、サブ最適の監視源を提供する。
本稿では,検索コンポーネントから抽出したスタイルトークンとキーワードを組み込むことにより,セマンティクスと記述スタイルを活用・分離することを提案する。
論文 参考訳(メタデータ) (2021-11-24T19:00:05Z) - Fine-Grain Few-Shot Vision via Domain Knowledge as Hyperspherical Priors [79.22051549519989]
プロトタイプネットワークは、コンピュータビジョンにおいて、数ショットの学習タスクでうまく機能することが示されている。
ドメイン知識を情報的先行要素として取り入れつつ,クラスを最大限に分離することで,数発の微粒化を実現する方法を示す。
論文 参考訳(メタデータ) (2020-05-23T02:10:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。