論文の概要: Identifying Latent Concepts and Structures for Generalized Category Discovery
- arxiv url: http://arxiv.org/abs/2607.00620v1
- Date: Wed, 01 Jul 2026 08:40:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.810507
- Title: Identifying Latent Concepts and Structures for Generalized Category Discovery
- Title(参考訳): 一般化カテゴリー発見のための潜在概念と構造同定
- Abstract要約: Generalized Category Discovery (GCD)は、オープンワールド環境で新しいクラスを自律的に発見しながら、既知のクラスを認識することを目的としている。
標準的な視覚バックボーンは、潜在概念や構造を教師なしで発見するのに不適な、高位で絡み合ったトークン表現をもたらす。
このような潜在構造を識別するために特徴空間を再認識する新しい表現学習フレームワークであるComposeal Primitive Fields (CPF-GCD)を提案する。
- 参考スコア(独自算出の注目度): 46.49781655015175
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generalized Category Discovery (GCD) aims to recognize known classes while autonomously discovering novel ones in open-world settings. However, current approaches primarily focus on designing clustering objectives, often overlooking a critical bottleneck: standard vision backbones yield high-rank, entangled token representations that are ill-suited for unsupervised discovery of latent concepts and structures. In this paper, we propose Compositional Primitive Fields (CPF-GCD), a novel representation learning framework that reshapes the feature space to make such latent structure identifiable by enforcing a low-rank compositional organization. Our core hypothesis is that all categories, whether known or novel, can be expressed as compositions and spatial arrangements of a finite set of learnable visual primitives that capture reusable concepts. CPF instantiates this geometric constraint via a spatial field mechanism. Inserted between the backbone and the head, it rewrites noisy patch tokens through low-rank primitive mixtures, effectively decomposing images into reusable atomic parts and their spatial layouts. By explicitly modeling the spatial distribution of primitives, CPF enables novel categories to emerge naturally as new activation patterns over a shared vocabulary. This shifts the focus of representation from merely partitioning global embeddings to constructing a structured and separable primitive field. Extensive experiments demonstrate that CPF serves as a generic, plug-and-play module that consistently boosts performance across diverse GCD baselines, validating that identifying and leveraging low-rank compositional structure is a crucial inductive bias for open-world recognition.
- Abstract(参考訳): Generalized Category Discovery (GCD)は、オープンワールド環境で新しいクラスを自律的に発見しながら、既知のクラスを認識することを目的としている。
しかし、現在のアプローチは主にクラスタリングの目的を設計することに重点を置いており、しばしば重要なボトルネックを見落としている。
本稿では,低ランクな構成組織を強制することによって,そのような潜在構造を識別できるように,特徴空間を再認識する新しい表現学習フレームワークであるComposemental Primitive Fields(CPF-GCD)を提案する。
我々の中心となる仮説は、既知のものであれ、新しいものであれ、すべてのカテゴリは、再利用可能な概念を捉えた学習可能な視覚的プリミティブの有限集合の合成と空間的配置として表現できるということである。
CPFはこの幾何学的制約を空間場機構を介してインスタンス化する。
バックボーンとヘッドの間に挿入され、低ランクのプリミティブミキシングを通じてノイズの多いパッチトークンを書き換え、効果的にイメージを再利用可能な原子部品とその空間配置に分解する。
プリミティブの空間分布を明示的にモデル化することにより、CPFは共有語彙上の新しいアクティベーションパターンとして、新しいカテゴリが自然に出現することを可能にする。
これは、表現の焦点を単にグローバルな埋め込みを分割することから、構造化され分離可能なプリミティブフィールドの構築へとシフトさせる。
広範な実験により、CPFは汎用的なプラグアンドプレイモジュールとして機能し、多様なGCDベースラインにおけるパフォーマンスを継続的に向上し、低ランクな構成構造の識別と活用がオープンワールド認識にとって重要な帰納的バイアスであることを示す。
関連論文リスト
- Primitive-Driven Compositional Forensic Visual Prompting for Open-World Face Anti-Spoofing [59.765442274924595]
視覚的特徴空間で完全に機能する合成視覚的プロンプト学習フレームワークを提案する。
このフレームワークは、学習可能なマイクロ法医学的プリミティブの共有セットを局所的な法医学的エビデンスユニットに洗練するためにパッチ対応の注意を払っている。
9つのオープンワールドプロトコルの実験は、最先端のパフォーマンス、強力なクロスドメインの一般化、そして目に見えない攻撃への堅牢な適応を示す。
論文 参考訳(メタデータ) (2026-08-18T04:18:08Z) - Topology-Aware Neighborhood Learning for Source-Free Cross-Scene Hyperspectral Image Classification [11.354716471312239]
ドメイン適応は、複雑なシナリオにおける識別能力を大幅に向上させる、高度なクロスシーンハイパースペクトル画像分類を持つ。
従来のドメイン適応手法は非現実的になり、現実的なリモートセンシングのシナリオにおいてその実用性を著しく制限する。
ソースデータなしで、堅牢で正確な分類を実現するために、トポロジ対応のソースフリー学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-06T12:40:06Z) - SPORT: Structure-Aware Prototype Disentanglement for Incomplete Multi-View Clustering [51.01038967474103]
プロトタイプベースの不完全なマルチビュークラスタリングは、不足ビュー計算のためのセマンティックアンカーとしてプロトタイプを活用することで注目を集めている。
構造対応PrOtotype disentanglement foR incomplete multi-view clusTering (Sport) と呼ばれる新しいフレームワークを提案する。
SPORTは、クラスタレベルのリレーショナル構造を保持しながら、プロトタイプの共有コンポーネントとビュー固有のコンポーネントを明示的に分離する。
論文 参考訳(メタデータ) (2026-07-11T17:40:22Z) - Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers [93.3976834364707]
本稿では,特徴写像のリレーショナル幾何における整合性を実現する構造的RePresentation AlignmentフレームワークであるsREPAを提案する。
モデルが事前訓練された特徴から全体的空間配置と構造的相関を内包するように促すことにより、sREPAはより高速でより安定した収束を達成する。
論文 参考訳(メタデータ) (2026-05-16T12:01:04Z) - Unlocking Compositional Generalization in Continual Few-Shot Learning [6.276425555068115]
我々は、合成推論から表現学習を厳密に分離する新しいパラダイムを開拓した。
トレーニング中、スロット表現は完全に全体的クラスアイデンティティに最適化される。
我々はこのパラダイムが二重構造的利点をもたらすことを実証し、凍結したバックボーンは自然に表現のドリフトを防ぎ、一方、我々の軽量で全体最適化は新規概念伝達のための特徴量を保存する。
論文 参考訳(メタデータ) (2026-05-12T08:02:31Z) - Decouple and Rectify: Semantics-Preserving Structural Enhancement for Open-Vocabulary Remote Sensing Segmentation [23.298715255853782]
リモートセンシング(RS)分野におけるオープンボキャブラリセマンティックセマンティックセマンティックセマンティクスは、言語対応認識と細粒度空間デライン化の両方を必要とする。
最近の手法は、RS-pretrained DINO特徴を導入して、これを補おうとしている。
本稿では, DR-Segを提案する。
論文 参考訳(メタデータ) (2026-04-02T13:15:05Z) - Entropy-Aware Structural Alignment for Zero-Shot Handwritten Chinese Character Recognition [7.632962062462334]
ゼロショット手書き漢字認識は、急進的な意味合成を活用することで、目に見えない文字を認識することを目的としている。
本稿では,情報理論モデリングにより視覚と意味のギャップを埋めるエントロピー対応構造アライメントネットワークを提案する。
ICDAR 2013データセットで55.04%の精度を達成し,新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-03T16:08:40Z) - Geometry-Editable and Appearance-Preserving Object Compositon [67.98806888489385]
汎用オブジェクト合成(GOC)は、対象オブジェクトを望まれる幾何学的性質を持つ背景シーンにシームレスに統合することを目的としている。
近年のアプローチは意味的埋め込みを導出し、それらを高度な拡散モデルに統合し、幾何学的に編集可能な生成を可能にする。
本稿では,まずセマンティックな埋め込みを活用して,所望の幾何学的変換を暗黙的にキャプチャするDistangled Geometry-editable and Outearance-Preserving Diffusionモデルを提案する。
論文 参考訳(メタデータ) (2025-05-27T09:05:28Z) - Spatial Structure Constraints for Weakly Supervised Semantic
Segmentation [100.0316479167605]
クラスアクティベーションマップ(CAM)は、オブジェクトの最も識別性の高い部分のみを見つけることができる。
注意伸縮の余剰なオブジェクトの過剰な活性化を軽減するために,弱い教師付きセマンティックセマンティックセグメンテーションのための空間構造制約(SSC)を提案する。
提案手法は,PASCAL VOC 2012とCOCOデータセットでそれぞれ72.7%,47.0%mIoUを達成した。
論文 参考訳(メタデータ) (2024-01-20T05:25:25Z) - Structure-Aware Feature Generation for Zero-Shot Learning [108.76968151682621]
潜在空間と生成ネットワークの両方を学習する際の位相構造を考慮し,SA-GANと呼ばれる新しい構造認識特徴生成手法を提案する。
本手法は,未確認クラスの一般化能力を大幅に向上させ,分類性能を向上させる。
論文 参考訳(メタデータ) (2021-08-16T11:52:08Z) - Unveiling the Potential of Structure-Preserving for Weakly Supervised
Object Localization [71.79436685992128]
本稿では,WSOLの畳み込み機能に組み込まれた構造情報を完全に活用するための2段階構造保存アクティベーション(SPA)を提案する。
第1段階では、分類ネットワークによって引き起こされる構造ミス問題を軽減するために制限アクティベーションモジュール(ram)が設計されている。
第2段階では, 自己相関マップ生成(SCG)モジュールと呼ばれるプロセス後アプローチを提案し, 構造保存ローカライゼーションマップを得る。
論文 参考訳(メタデータ) (2021-03-08T03:04:14Z) - Generalized Clustering and Multi-Manifold Learning with Geometric
Structure Preservation [47.65743823937763]
一般化データのための幾何構造を保存した新しい汎用クラスタリング・マルチマニフォールド学習(GCML)フレームワークを提案する。
提案フレームワークでは,クラスタリング損失によって導かれる潜在空間において,多様体クラスタリングを行う。
クラスタリング指向の損失が潜伏空間の幾何学的構造を悪化させるという問題を克服するため, 局所的に多様体内構造を保存するための等尺的損失と, グローバルな多様体間構造のランキング損失が提案されている。
論文 参考訳(メタデータ) (2020-09-21T03:04:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。