論文の概要: Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP
- arxiv url: http://arxiv.org/abs/2604.05724v1
- Date: Tue, 07 Apr 2026 11:28:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.784386
- Title: Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP
- Title(参考訳): セマンティックスを超えて:CLIPのためのスパースオートエンコーダにおける情報スコープの分散
- Authors: Yusung Ro, Jaehyun Choi, Junmo Kim,
- Abstract要約: 本稿では,SAE機能がどのように視覚的証拠を集約しているかを特徴付ける,解釈可能性の相補的な次元として情報スコープを導入する。
これを定量化するために,位置安定な局所スコープ特徴と位置可変なグローバルスコープ特徴とを分離するコンテキスト依存スコア(CDS)を提案する。
- 参考スコア(独自算出の注目度): 16.28043491637334
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse Autoencoders (SAEs) have emerged as a powerful tool for interpreting the internal representations of CLIP vision encoders, yet existing analyses largely focus on the semantic meaning of individual features. We introduce information scope as a complementary dimension of interpretability that characterizes how broadly an SAE feature aggregates visual evidence, ranging from localized, patch-specific cues to global, image-level signals. We observe that some SAE features respond consistently across spatial perturbations, while others shift unpredictably with minor input changes, indicating a fundamental distinction in their underlying scope. To quantify this, we propose the Contextual Dependency Score (CDS), which separates positionally stable local scope features from positionally variant global scope features. Our experiments show that features of different information scopes exert systematically different influences on CLIP's predictions and confidence. These findings establish information scope as a critical new axis for understanding CLIP representations and provide a deeper diagnostic view of SAE-derived features.
- Abstract(参考訳): スパースオートエンコーダ(SAE)は、CLIPビジョンエンコーダの内部表現を解釈する強力なツールとして登場したが、既存の分析は主に個々の特徴の意味に焦点を当てている。
本研究では,SAE機能がどのように視覚的エビデンスを集約するかを特徴付ける,解釈可能性の相補的な次元として情報スコープを導入する。
いくつかのSAE機能は空間的摂動に対して一貫して応答し、他のものは小さな入力の変化とともに予測不可能に変化し、その基礎となる範囲において根本的な違いが示される。
これを定量化するために,位置安定な局所スコープ特徴と位置可変なグローバルスコープ特徴を分離するコンテキスト依存スコア(CDS)を提案する。
実験の結果,異なる情報範囲の特徴がCLIPの予測と信頼性に系統的に異なる影響を及ぼすことが明らかとなった。
これらの知見は、CLIP表現を理解するための重要な新しい軸として情報スコープを確立し、SAE由来の特徴をより深く診断する。
関連論文リスト
- Target Refocusing via Attention Redistribution for Open-Vocabulary Semantic Segmentation: An Explainability Perspective [47.99651635870674]
本研究では,人間の注意を標的領域へ向けて注意を向けるために,注意喚起行動のエミュレートを行うトレーニングフリーアプローチを提案する。
提案手法は,高い推論効率を維持しつつ,8つのベンチマーク上でのSOTA性能を実現する。
論文 参考訳(メタデータ) (2025-11-20T09:16:33Z) - Visual Exploration of Feature Relationships in Sparse Autoencoders with Curated Concepts [8.768503486874623]
利用可能なすべての機能を同時に視覚化する試みよりも、キュレートされた概念とその対応するSAE機能を優先する集中探索フレームワークを提案する。
本稿では,トポロジに基づく視覚符号化と次元の縮小を組み合わせ,局所的・グローバル的関係を忠実に表現するインタラクティブな可視化システムを提案する。
論文 参考訳(メタデータ) (2025-11-08T15:36:57Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - MSCI: Addressing CLIP's Inherent Limitations for Compositional Zero-Shot Learning [8.021031339658492]
構成ゼロショット学習は、既知の組み合わせを活用して、目に見えない状態オブジェクトの組み合わせを認識することを目的としている。
既存の研究は基本的にCLIPのクロスモーダルアライメント機能に依存している。
本稿では,CLIPのビジュアルエンコーダの中間層情報を効果的に探索し,活用する多段階クロスモーダルインタラクションモデルを提案する。
論文 参考訳(メタデータ) (2025-05-15T13:36:42Z) - Epsilon: Exploring Comprehensive Visual-Semantic Projection for Multi-Label Zero-Shot Learning [23.96220607033524]
マルチラベルシナリオ(MLZSL)におけるゼロショット学習の課題について検討する。
観察されたクラスと補助的な知識に基づいて、サンプル内の複数の見えないクラスを認識するように訓練されている。
本稿では,エプシロンと呼ばれるMLZSLのための新しいビジュアル・セマンティック・フレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-22T09:45:24Z) - Embedding Generalized Semantic Knowledge into Few-Shot Remote Sensing Segmentation [26.542268630980814]
リモートセンシング(RS)画像のためのFew-shot segmentation (FSS)は、限られた注釈付きサンプルからのサポート情報を活用して、新しいクラスのクエリセグメンテーションを実現する。
従来の取り組みは、制約された支援サンプルの集合からセグメント化を導く視覚的手がかりをマイニングすることに集中している。
本稿では,一般的な意味知識を効果的に活用する全体論的意味埋め込み(HSE)手法を提案する。
論文 参考訳(メタデータ) (2024-05-22T14:26:04Z) - Adaptive Global-Local Representation Learning and Selection for
Cross-Domain Facial Expression Recognition [54.334773598942775]
ドメインシフトは、クロスドメイン顔表情認識(CD-FER)において重要な課題となる
適応的グローバルローカル表現学習・選択フレームワークを提案する。
論文 参考訳(メタデータ) (2024-01-20T02:21:41Z) - Using Representation Expressiveness and Learnability to Evaluate
Self-Supervised Learning Methods [61.49061000562676]
本稿では,学習可能性を評価するためにCluster Learnability (CL)を導入する。
CLは、K-meansで表現をクラスタリングすることによって得られたラベルを予測するために訓練されたKNNのパフォーマンスで測定される。
CLは、他の競合する評価手法よりも分布内モデルの性能と相関することがわかった。
論文 参考訳(メタデータ) (2022-06-02T19:05:13Z) - Goal-Oriented Gaze Estimation for Zero-Shot Learning [62.52340838817908]
識別的属性の局在性を改善するために, 目標指向視線推定モジュール(GEM)を提案する。
属性記述に導かれた新しい物体を認識する視覚注意領域を得るために,実際の人間の視線位置を予測することを目的とする。
この研究は、高レベルのコンピュータビジョンタスクに人間の視線データセットと自動視線推定アルゴリズムを集めることの有望な利点を示しています。
論文 参考訳(メタデータ) (2021-03-05T02:14:57Z) - Global Context-Aware Progressive Aggregation Network for Salient Object
Detection [117.943116761278]
我々は,低レベルな外観特徴,高レベルな意味特徴,グローバルな文脈特徴を統合化するための新しいネットワークGCPANetを提案する。
提案手法は, 定量的かつ定性的に, 最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2020-03-02T04:26:10Z) - An Explicit Local and Global Representation Disentanglement Framework
with Applications in Deep Clustering and Unsupervised Object Detection [9.609936822226633]
我々はSPLITと呼ばれるフレームワークを提案し、ローカルおよびグローバルな情報を解き放つことができる。
我々のフレームワークは、可変オートエンコーダ(VAE)フレームワークに生成仮定を追加する。
このフレームワークは,これらのモデル内の局所的およびグローバル的情報を効果的に切り離すことができることを示す。
論文 参考訳(メタデータ) (2020-01-24T12:09:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。