論文の概要: Sparse Attention for Dense Open-Vocabulary Prediction in CLIP
- arxiv url: http://arxiv.org/abs/2607.07135v2
- Date: Mon, 13 Jul 2026 05:58:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.264783
- Title: Sparse Attention for Dense Open-Vocabulary Prediction in CLIP
- Title(参考訳): CLIPにおける高密度開語彙予測のためのスパース注意
- Authors: Fatimah Zohra, Chen Zhao, Shuming Liu, Bernard Ghanem,
- Abstract要約: 最終視覚的自己注意層における行方向のソフトマックスの推測時間置換について検討した。
entmaxは低得点を正確に0にマッピングするデータ依存しきい値を適用するため、暗黙のデノイザとして機能する。
オープン語彙タスクセンスセマンティックセマンティックセグメンテーション (Pascal VOC, Pascal Context, ADE20K) ときめ細かい検索 (FG-OVD) について検討する。
- 参考スコア(独自算出の注目度): 54.45759517856271
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contrastive Language-Image Pre-training (CLIP) relies on softmax-based self-attention, a strictly positive distribution that assigns probability mass to every pair of tokens-even semantically irrelevant ones. While these dense softmax weights are effective for gathering broad context during pre-training, they spread attention across many low-salience tokens, producing noise that obscures the fine-grained, spatially localized cues required for dense, open-vocabulary prediction. We study an inference-time substitution of the row-wise softmax in the final visual self-attention layers with the $α$-entmax transform, applied across both the standard query-key attention and self-correlation variants. Because entmax applies a data-dependent threshold that maps low scores exactly to zero, it acts as an implicit denoiser, zeroing contextually irrelevant dependencies while redistributing mass onto the most relevant tokens. We evaluate on open-vocabulary tasks-dense semantic segmentation (Pascal VOC, Pascal Context, ADE20K) and fine-grained retrieval (FG-OVD)-and find the gain from attention sparsification is proportional to how much the baseline attention spreads off the target class.
- Abstract(参考訳): 対照的に、CLIP (Contrastive Language- Image Pre-Training) はソフトマックスに基づく自己アテンション(自己アテンション)に依存している。
これらの密集したソフトマックス重みは、事前訓練中に広い文脈を収集するのに有効であるが、多くの低濃度トークンに注意を向け、密集したオープン語彙予測に必要な微細で空間的局所的な手がかりを隠蔽するノイズを生み出した。
本稿では,従来の問合せキーと自己相関の変種の両方に適用した$α$-entmax変換を用いて,最終視覚的自己注意層における行方向のソフトマックスの推論時間置換について検討する。
entmaxは低スコアを正確に0にマッピングするデータ依存しきい値を適用するため、暗黙のデノイザーとして機能し、最も関連するトークンに質量を再分配しながら、文脈的に無関係な依存関係をゼロにする。
オープン語彙のタスクセンスセマンティックセマンティックセグメンテーション (Pascal VOC, Pascal Context, ADE20K) と細粒度検索 (FG-OVD) について検討し, 注意散布による利得は, 対象クラスから基準的注意がどの程度広がるかに比例する。
関連論文リスト
- Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models [52.78477729846771]
本稿では,COAST(Contrastive Adaptive Semantic Token Pruning)について紹介する。
COASTはトークン予算をまたいだ強力なプルーニングベースラインを一貫して上回り、複数のLVLMファミリをまたいだ一般化を実現している。
論文 参考訳(メタデータ) (2026-05-10T09:07:04Z) - ZScribbleSeg: A comprehensive segmentation framework with modeling of efficient annotation and maximization of scribble supervision [15.414625894259844]
本稿では, 優れたスクリブルアノテーションの原理を考察し, 教師とシミュレーションによる効率的なランダムネス形式を導出する。
本研究では,空間関係と形状制約を符号化する正規化項を導入し,EMアルゴリズムを用いてラベルの混合比を推定する。
我々は、ZScribbleSegと呼ばれるフレームワークに事前の効率的な監視を統合し、それを複数のシナリオに適用する。
論文 参考訳(メタデータ) (2026-05-07T13:41:15Z) - Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition [41.77490816513839]
ゼロショットスケルトン動作認識のための新しい手法を,$texttt$textbfFlora$$として提案する。
具体的には、方向対応の地域意味論と相互整合性目標を取り入れたテキスト意味論を実践する。
3つのベンチマークデータセットによる実験により,本手法の有効性が検証された。
論文 参考訳(メタデータ) (2025-11-12T14:54:53Z) - Long-Context Generalization with Sparse Attention [21.400056571592277]
トランスフォーマーベースのアーキテクチャは、伝統的に注意重みを計算するためにソフトマックスを使用している。
シーケンス長が増加するにつれて、非情報的トークンは注意確率の質量を蓄積し、分散と表現的崩壊をもたらす。
我々は、$alpha$-entmaxを使って動的にスパースな注意機構がこれらの問題を回避できることを示し、これは、無関係トークンに正確なゼロを割り当てる能力のためである。
論文 参考訳(メタデータ) (2025-06-19T22:43:25Z) - Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens [57.37893387775829]
我々はSemantic Equitable Clustering(SEC)という,高速かつバランスの取れたクラスタリング手法を導入する。
SECは、グローバルなセマンティックな関連性に基づいてトークンを効率的かつ直接的な方法でクラスタ化する。
視覚言語コネクタとして機能する汎用視覚バックボーンであるSECViTを提案する。
論文 参考訳(メタデータ) (2024-05-22T04:49:00Z) - DenseCLIP: Extract Free Dense Labels from CLIP [130.3830819077699]
対照的に、CLIP(Contrastive Language- Image Pre-Training)は、オープンボキャブラリゼロショット画像認識において画期的な進歩を遂げた。
DenseCLIP+はSOTAトランスダクティブなゼロショットセマンティックセグメンテーション法を大きなマージンで上回る。
我々の発見は、DenseCLIPが高密度予測タスクの信頼性の高い新たな監視源となることを示唆している。
論文 参考訳(メタデータ) (2021-12-02T09:23:01Z) - PCPL: Predicate-Correlation Perception Learning for Unbiased Scene Graph
Generation [58.98802062945709]
本稿では,適切な損失重みを適応的に求めるための新しい述語相関知覚学習手法を提案する。
我々のPCPLフレームワークは、文脈特徴をよりよく抽出するグラフエンコーダモジュールも備えています。
論文 参考訳(メタデータ) (2020-09-02T08:30:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。