論文の概要: CoViT: Instance-Correspondence Contrastive Learning for Vision Transformer
- arxiv url: http://arxiv.org/abs/2609.01787v1
- Date: Tue, 01 Sep 2026 18:59:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.924543
- Title: CoViT: Instance-Correspondence Contrastive Learning for Vision Transformer
- Title(参考訳): CoViT:視覚変換器のインスタンス対応コントラスト学習
- Authors: Yisen Wang, Zhirong Wu, Limin Wang,
- Abstract要約: Vision Transformer (ViT) はセマンティックな理解が優れているが、オブジェクトインスタンス間の識別に失敗する。
インスタンス認識をViTに注入する自己教師型学習フレームワークであるContrastive Vision Transformer (CoViT)を提案する。
- 参考スコア(独自算出の注目度): 43.20817347832838
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision Transformers (ViT) excel in semantic understanding but fail to discriminate between object instances (e.g., identical embeddings for two dogs), limiting their use in instance-level tasks such as object detection and instance segmentation. We propose Contrastive Vision Transformer (CoViT), a self-supervised learning framework that injects instance-awareness into ViT through geometry-guided contrastive learning. CoViT uniquely coordinates ViT's attention maps and embeddings by constructing triplets: (1) Attention-guided masking: Refine multi-head attention via adaptive thresholding and morphological operations to generate instance masks, identifying foreground anchors; (2) Hardest contrastive mining: For each anchor, computing pairwise embedding similarities to select the intra-instance hardest positive (least similar patch within its mask) and inter-instance hardest negative (most similar patch from other instances), with intra-instance regions masked during negative search. These triplets drive a contrastive loss that simultaneously compresses intra-instance variance and expands inter-instance margins, forcing ViT to discern subtle geometric and appearance differences between instances. CoViT consistently achieves stable performance gains of over 2 AP points across multiple instance-level perception tasks by using ViT as backbone architecture. Notably, CoViT requires no extra decoders or labels, demonstrating that a pure ViT can learn instance-aware representations via inherent attention priors and targeted contrastive constraints. Code and models will be released.
- Abstract(参考訳): ViT(Vision Transformer)は、セマンティック理解において優れているが、オブジェクトインスタンス(例えば、2匹の犬の同一の埋め込み)間での識別に失敗し、オブジェクト検出やインスタンスセグメンテーションなどのインスタンスレベルのタスクでの使用を制限する。
本研究では,教師付き学習フレームワークであるContrastive Vision Transformer (CoViT)を提案する。
注意誘導マスク: 適応しきい値と形態的操作による多面的注意を保ち、インスタンスマスクを生成し、前景のアンカーを識別する。 2) 最も厳しいコントラストマイニング: 各アンカーについて、各アンカーに対して、各アンカーに2つの類似性を埋め込んで、インスタンス内の最も近いパッチ(マスク内に最も近いパッチ)とインスタンス中の最も悪い(他のケースと最もよく似たパッチ)を選択し、負の探索中にインスタンス内の領域をマスクする。
これらの三重項は、インスタンス内分散を同時に圧縮し、インスタンス間マージンを拡大するコントラスト損失を駆動し、ViTはインスタンス間の微妙な幾何学的および外観的差異を識別せざるを得ない。
CoViTは、複数のインスタンスレベルの認識タスクにまたがる2つのAPポイントの安定的なパフォーマンス向上を、バックボーンアーキテクチャとしてViTを使用することで、一貫して達成する。
特に、CoViTは余分なデコーダやラベルを必要とせず、純粋なViTが固有の注意事項とターゲットのコントラスト制約を通じて、インスタンス認識表現を学習できることを実証している。
コードとモデルはリリースされる。
関連論文リスト
- What-Where Transformer: A Slot-Centric Visual Backbone for Concurrent Representation and Localization [25.423413775524704]
我々は、モデルがオブジェクトの外観や空間的位置を分解的に表現することを奨励する「What-where separation」と呼ばれる帰納バイアスに焦点を当てた。
本手法では,トークンを何の表現として扱うか,注目マップを場所の表現として扱うとともに,マルチストリームのスロットベースアーキテクチャを用いて並列フィードフォワードモジュールで処理する。
我々は,標準の単一ラベル分類に基づくImageNetの監督下であっても,生の注目マップから直接,創発的な複数物体発見を示すことを示した。
論文 参考訳(メタデータ) (2026-05-12T12:08:46Z) - STRAP-ViT: Segregated Tokens with Randomized -- Transformations for Defense against Adversarial Patches in ViTs [2.458848206334729]
逆パッチは物理的に実現可能な局所雑音であり、視覚変換器(ViT)の自己注意をハイジャックすることができる。
本稿では,Jensen-Shannon Divergence を用いた STRAP-ViT と呼ばれる機構を提案する。
STRAP-ViTはViTアーキテクチャの非トレーニング可能なプラグイン・アンド・プレイブロックとして適合し、推論目的のみで、計算コストは最小限である。
論文 参考訳(メタデータ) (2026-03-13T06:03:44Z) - Beyond the Doors of Perception: Vision Transformers Represent Relations Between Objects [30.09778169168547]
ビジョントランス (ViT) は様々な環境で最先端のパフォーマンスを実現している。
しかし、視覚的関係を含むタスクを遂行する際、驚くべき失敗を経験する。
論文 参考訳(メタデータ) (2024-06-22T22:43:10Z) - UIA-ViT: Unsupervised Inconsistency-Aware Method based on Vision
Transformer for Face Forgery Detection [52.91782218300844]
そこで我々は、UIA-ViTと呼ばれるビジョン変換器に基づく教師なし不整合認識手法を提案する。
自己注意機構により、パッチ埋め込み間の注意マップは自然に一貫性関係を表現し、一貫性表現学習に適した視覚変換器となる。
論文 参考訳(メタデータ) (2022-10-23T15:24:47Z) - Patch-level Representation Learning for Self-supervised Vision
Transformers [68.8862419248863]
視覚変換器(ViT)は近年、より優れたアーキテクチャ選択として多くの注目を集めており、様々な視覚タスクにおいて畳み込みネットワークよりも優れています。
これに触発された私たちは、パッチレベルの表現をより良く学習するための、SelfPatchという、シンプルで効果的なビジュアルプリテキストタスクを設計しました。
我々は、既存のSSLメソッドの様々な視覚的タスクに対する性能を大幅に改善できることを実証した。
論文 参考訳(メタデータ) (2022-06-16T08:01:19Z) - UniVIP: A Unified Framework for Self-Supervised Visual Pre-training [50.87603616476038]
単一中心オブジェクトまたは非調和データセット上で,汎用的な視覚表現を学習するための,新しい自己教師型フレームワークを提案する。
大規模実験により、非高調波COCOで事前訓練されたUniVIPは、最先端の転送性能を実現することが示された。
また、ImageNetのような単一中心オブジェクトのデータセットを利用でき、線形探索において同じ事前学習エポックでBYOLを2.5%上回る。
論文 参考訳(メタデータ) (2022-03-14T10:04:04Z) - Intriguing Properties of Vision Transformers [114.28522466830374]
視覚変換器(ViT)は、様々なマシンビジョン問題にまたがって印象的な性能を誇示している。
我々は、この問題を広範囲の実験を通して体系的に研究し、高性能畳み込みニューラルネットワーク(CNN)との比較を行った。
ViTsの効果的な特徴は、自己認識機構によって可能なフレキシブルな受容と動的場によるものであることを示す。
論文 参考訳(メタデータ) (2021-05-21T17:59:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。