論文の概要: TraceCLIP: Recovering Local Semantics from Patch-to-CLS Contributions
- arxiv url: http://arxiv.org/abs/2607.26107v1
- Date: Tue, 28 Jul 2026 11:25:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.430327
- Title: TraceCLIP: Recovering Local Semantics from Patch-to-CLS Contributions
- Title(参考訳): TraceCLIP: Patch-to-CLSコントリビューションからローカルセマンティクスを復元する
- Authors: Xinran Liu, Shouqian Shi, Yutong Chen, Ge Wang, Xin-Wei Yao, Sheng Zhong,
- Abstract要約: 我々は、潜伏パッチレベルのセマンティックエビデンスを回復するトレーニング不要のフレームワークであるTraceCLIPを紹介する。
また,TraceCLIPは,最強のトレーニングフリー手法よりも平均mIoUで1.3~4.5ポイント向上することを示した。
- 参考スコア(独自算出の注目度): 20.430455131220544
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dense vision-language understanding, including object localization, region recognition, and open-vocabulary semantic segmentation, requires associating language concepts with spatially grounded visual regions. CLIP provides a strong foundation for these tasks by learning a shared image-text embedding space from large-scale contrastive pre-training. However, its image-level objective aligns text with a CLS-derived global representation, leaving local vision-language correspondence only indirectly constrained. Existing methods either introduce additional supervision, external models, or task-specific adaptation, while training-free approaches mainly recover dense responses from existing patch features without examining where local semantics become most accessible within CLIP. We introduce TraceCLIP, a training-free framework that recovers latent patch-level semantic evidence by isolating the patch-specific terms written into the CLS attention output. TraceCLIP further converts contribution-derived semantic responses into a semantic-geodesic topology gate that calibrates final-layer patch affinity for dense feature reconstruction. Diagnostic experiments show that these contribution features exhibit strong local semantic discrimination and text-conditioned spatial alignment. On eight zero-shot semantic segmentation benchmarks, TraceCLIP achieves gains of 1.3 to 4.5 points in average mIoU over the strongest prior training-free methods across both backbones and background settings, without additional training, external vision foundation models, or region-level supervision. More broadly, these findings suggest that spatially localized semantics may remain accessible within the internal construction of globally aligned representations.
- Abstract(参考訳): オブジェクトのローカライゼーション、領域認識、オープンボキャブラリセマンティックセグメンテーションを含む複雑な視覚言語理解は、空間的に接地された視覚領域と言語概念を関連付ける必要がある。
CLIPは、大規模なコントラスト付き事前トレーニングから共有画像テキスト埋め込みスペースを学ぶことで、これらのタスクの強力な基盤を提供する。
しかし、画像レベルの目的はテキストをCLSから派生したグローバル表現と整合させ、局所的な視覚言語対応は間接的にのみ制約される。
既存のメソッドは、追加の監視、外部モデル、タスク固有の適応を導入する一方、トレーニング不要なアプローチは、CLIP内でローカルセマンティクスが最もアクセスしやすい場所を調べることなく、既存のパッチ機能からの密なレスポンスを主に回収する。
CLSアテンション出力に記述されたパッチ固有の用語を分離することにより、潜在パッチレベルのセマンティックエビデンスを回復する、トレーニング不要なフレームワークであるTraceCLIPを導入する。
TraceCLIPはさらに、コントリビューション由来のセマンティック応答を、密な特徴再構成のための最終層パッチ親和性を校正する意味幾何学的トポロジーゲートに変換する。
診断実験により,これらの特徴は強い局所的意味的識別とテキスト条件の空間的アライメントを示すことが示された。
8つのゼロショットセマンティックセグメンテーションベンチマークにおいて、TraceCLIPは平均mIoUで1.3から4.5ポイントのアップを達成した。
より広範に、これらの知見は、グローバルに整列した表現の内部構造において、空間的局所化セマンティクスが引き続きアクセス可能であることを示唆している。
関連論文リスト
- Fine-grained CLIP fine-tuning with self-annotated region alignment [57.28808560528696]
対照的な言語-画像事前学習は、そのきめ細かい特徴表現に制限があることが示されている。
そこで我々は,CLIPファインチューニングにおける細粒度表現能力を高めるために,SFF-CLIP(Self-annotated Fine-fine-tuning for CLIP)を提案する。
論文 参考訳(メタデータ) (2026-07-15T10:06:39Z) - Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation [22.409969687852506]
画像から直接派生したインスタンス固有の事前情報を組み込んだ構造認識機能修正手法を提案する。
本手法は,セグメンテーションノイズを効果的に抑制し,領域レベルの整合性を向上し,複数の開語彙セグメンテーションベンチマークにおいて高い性能を実現する。
論文 参考訳(メタデータ) (2025-12-08T10:00:36Z) - HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models [63.87966115136411]
HarmoCLIPはContrastive Language-Image Pre-training内のグローバルおよびリージョン表現を調和させるように設計された新しいフレームワークである。
本研究では,地域レベルでの表現能力を高めるために,地域調整管理戦略を導入する。
論文 参考訳(メタデータ) (2025-11-27T16:24:53Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception [21.87721909270275]
DeCLIPはCLIPをコンテンツとコンテキストの機能で強化する新しいフレームワークである。
複数の開語彙密接な予測タスクで既存の手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-05-07T13:46:34Z) - Refining CLIP's Spatial Awareness: A Visual-Centric Perspective [10.936397225984107]
コントラスト言語-画像 事前学習は、言語とのグローバルな整合性が優れているが、空間情報に対する感度は限られている。
最近のアプローチでは、高密度マルチモーダルタスクにおけるCLIPの性能を高めるために、Rerea-Language Alignmentを導入している。
本稿では,CLIP固有の空間構造を保存し,上記の劣化を緩和する空間相関蒸留(SCD)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-03T07:04:56Z) - Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation [38.16802763051431]
トレーニング不要なセマンティックセグメンテーション戦略であるCLIPtraseを提案する。
パッチ間の自己相関を補正することで、局所的な特徴認識を高める。
実験の結果、CLIPよりも平均して9つのセグメンテーションベンチマークで22.3%先行していることがわかった。
論文 参考訳(メタデータ) (2024-07-11T08:12:16Z) - Open-Vocabulary Segmentation with Semantic-Assisted Calibration [68.41025728960176]
オープンボキャブラリセグメンテーション(OVS)は,CLIPの文脈に先行して,語彙内およびドメインバイアスの埋め込み空間を校正することで研究される。
オープン語彙セグメンテーションベンチマークにおける最先端性能を実現するために,セマンティック・アシブ・キャリブレーション・ネットワーク(SCAN)を提案する。
論文 参考訳(メタデータ) (2023-12-07T07:00:09Z) - Context-self contrastive pretraining for crop type semantic segmentation [39.81074867563505]
提案したContext-Self Contrastive Loss (CSCL)は、セマンティックバウンダリをポップアップさせる埋め込み空間を学習する。
衛星画像時系列(SITS)からの作物型セマンティックセマンティックセグメンテーションでは,サテライト境界における性能が重要なボトルネックとなる。
より粒度の高い作物のクラスを得るための超解像における意味的セグメンテーションのプロセスを提案する。
論文 参考訳(メタデータ) (2021-04-09T11:29:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。