論文の概要: Hyperbolic Hierarchical Clustering for Visual Representation Learning
- arxiv url: http://arxiv.org/abs/2608.22665v1
- Date: Mon, 24 Aug 2026 00:01:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.823917
- Title: Hyperbolic Hierarchical Clustering for Visual Representation Learning
- Title(参考訳): 視覚表現学習のための双曲的階層クラスタリング
- Authors: Jianan Wei, Guikun Chen, Zhiyuan Weng, Chunchao Guo, Yujia Wang, Wenguan Wang,
- Abstract要約: 効果的なトークンミキサーは、Transformerのようなモダンなビジョンバックボーンの基本コンポーネントである。
本稿では,クラスタリングパラダイムに基づいて設計により解釈可能な透明なトークンミキサーであるClusterMixerを紹介する。
本稿では,ClusterMixerと,厳密に設計されたクラスタリング戦略を統合した,新しいバックボーンアーキテクチャであるHCFormerを紹介する。
- 参考スコア(独自算出の注目度): 62.38996677789715
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We investigate the token mixer in vision backbones by revisiting clustering, one of the most classic approaches in machine learning. An effective token mixer is a fundamental component of modern vision backbones like vision Transformers, facilitating information exchange between image patches. Mainstream token mixers, which rely on convolution, attention, MLP, or their hybrids, primarily focus on navigating the trade-off between accuracy and computational cost. However, a significant drawback of these methods is their black-box nature; their encoding process is opaque and lacks interpretability. Diverging from these opaque designs, we introduce ClusterMixer, a transparent token mixer that is grounded in a clustering paradigm and interpretable by design. ClusterMixer explicitly formulates the token mixing process through a hierarchical clustering mechanism. To model the natural, tree-like relationships inherent in visual data, the clustering is performed in hyperbolic space, which is well-suited for embedding hierarchies with low distortion. Building on this innovation, we present HCFormer, a new backbone architecture that integrates ClusterMixer with a series of meticulously designed clustering strategies to ensure robust performance across tasks. Extensive experiments demonstrate that HCFormer consistently outperforms its counterparts across diverse tasks, including image classification, object detection, instance segmentation, and semantic segmentation. Considering its transparency and efficacy, we hope HCFormer can facilitate a paradigm shift toward interpretable backbones.
- Abstract(参考訳): 我々は、機械学習における最も古典的なアプローチの一つであるクラスタリングを再考することにより、視覚バックボーンのトークンミキサーについて検討する。
効果的なトークンミキサーは、ビジョントランスフォーマーのようなモダンなビジョンバックボーンの基本コンポーネントであり、画像パッチ間の情報交換を容易にする。
主流のトークンミキサーは、畳み込み、注意、MPP、またはそれらのハイブリッドに依存しており、主に正確性と計算コストの間のトレードオフをナビゲートすることに焦点を当てている。
しかし、これらの手法の重大な欠点はブラックボックスの性質であり、符号化プロセスは不透明で解釈性に欠ける。
これらの不透明な設計から切り離して、クラスタリングパラダイムに基づいて設計によって解釈可能な透明なトークンミキサーであるClusterMixerを導入する。
ClusterMixerは階層的なクラスタリング機構を通じてトークンの混合プロセスを明示的に定式化する。
視覚データに固有の木のような自然な関係をモデル化するために、クラスタリングは双曲空間で行われ、低歪みの階層を埋め込むのに適している。
このイノベーションに基づいて、HCFormerという新しいバックボーンアーキテクチャを紹介します。これは、タスク間の堅牢なパフォーマンスを保証するために、ClusterMixerと慎重に設計された一連のクラスタリング戦略を統合します。
HCFormerは画像分類、オブジェクト検出、インスタンスセグメンテーション、セマンティックセグメンテーションなど、さまざまなタスクで一貫してパフォーマンスを向上している。
その透明性と有効性を考えると、HCFormerが解釈可能なバックボーンへのパラダイムシフトを促進できることを願っています。
関連論文リスト
- Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification [80.62512020268626]
UniARは統合された自己回帰フレームワークであり、単一のビジュアルトークン化器が理解と生成の鍵となる。
UniARは、マルチレベル特徴融合とルックアップフリービットワイド量子化スキームを備えた事前訓練されたビジョンエンコーダを適応する。
拡散に基づく視覚デコーダは、離散的な視覚トークンで高忠実度画像をデコードする。
論文 参考訳(メタデータ) (2026-06-16T17:59:22Z) - Deep Clustering with Associative Memories [28.46602918457589]
本稿では,新しい深層クラスタリング法であるDCAMを定式化するために,Associative Memoriesを用いたエネルギーベースダイナミクスを利用した新たな損失関数を提案する。
本実験では,DCAMの利点を実証し,各種アーキテクチャ選択のためのクラスタリング品質の向上を図った。
論文 参考訳(メタデータ) (2026-01-02T19:21:06Z) - Hierarchical Identity Learning for Unsupervised Visible-Infrared Person Re-Identification [81.3063589622217]
教師なし可視赤外線人物再識別(USVI-ReID)は、ラベルのないクロスモーダルな人物データセットからモダリティ不変の画像特徴を学習することを目的としている。
論文 参考訳(メタデータ) (2025-09-15T05:10:43Z) - Self-Enhanced Image Clustering with Cross-Modal Semantic Consistency [57.961869351897384]
効率的な画像クラスタリングのためのクロスモーダルなセマンティック一貫性に基づくフレームワークを提案する。
当社のフレームワークはまず,クロスモーダルセマンティック一貫性を通じて,強力な基盤を構築します。
最初の段階では、トレーニング済みモデルのリッチなセマンティクスに合わせて、軽量クラスタリングヘッドをトレーニングします。
第2段階では、自己強化微調整戦略を導入する。
論文 参考訳(メタデータ) (2025-08-02T08:12:57Z) - Grid Jigsaw Representation with CLIP: A New Perspective on Image Clustering [33.05984601411495]
画像クラスタリングの新たな視点として,事前学習型Grid Jigsaw Representation (pGJR)を提案する。
人間のジグソーパズル処理に触発されて、従来のジグソー学習を改良し、画像構造をより逐次的かつ漸進的に理解する。
実験により,事前学習したモデルを特徴抽出器として使用することにより,クラスタリングの収束を加速できることが実証された。
論文 参考訳(メタデータ) (2023-10-27T03:07:05Z) - CoC-GAN: Employing Context Cluster for Unveiling a New Pathway in Image
Generation [12.211795836214112]
本稿では,画像から一組の点雲へ変換する観点から,ユニークな画像生成プロセスを提案する。
我々の手法は、コンテキストクラスタリング(CoC)と呼ばれる単純なクラスタリング手法を利用して、順序のない点集合から画像を生成する。
我々は,このモデルをコンテキストクラスタリング生成適応ネットワーク(CoC-GAN)として導入する。
論文 参考訳(メタデータ) (2023-08-23T01:19:58Z) - Graph Contrastive Clustering [131.67881457114316]
本稿では,クラスタリングタスクに適用可能な新しいグラフコントラスト学習フレームワークを提案し,gcc(graph constrastive clustering)法を考案した。
特に、グラフラプラシアンに基づくコントラスト損失は、より識別的かつクラスタリングフレンドリーな特徴を学ぶために提案されている。
一方で、よりコンパクトなクラスタリング割り当てを学ぶために、グラフベースのコントラスト学習戦略が提案されている。
論文 参考訳(メタデータ) (2021-04-03T15:32:49Z) - Deep Transformation-Invariant Clustering [24.23117820167443]
抽象的な特徴に頼らず、画像変換の予測を学ぶアプローチを提案する。
この学習プロセスは、K平均とガウス混合モデルの勾配に基づく訓練に自然に適合する。
我々の新しいアプローチは、標準的な画像クラスタリングベンチマークにおいて、競争力があり、非常に有望な結果をもたらすことを実証する。
論文 参考訳(メタデータ) (2020-06-19T13:43:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。