論文の概要: CNMBI: Determining the Number of Clusters Using Center Pairwise Matching and Boundary Filtering
- arxiv url: http://arxiv.org/abs/2603.26744v1
- Date: Mon, 23 Mar 2026 07:43:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:44.563276
- Title: CNMBI: Determining the Number of Clusters Using Center Pairwise Matching and Boundary Filtering
- Title(参考訳): CNMBI:中央ペアワイズマッチングと境界フィルタによるクラスタ数決定
- Authors: Ruilin Zhang, Haiyang Zheng, Hongpeng Wang,
- Abstract要約: 我々はデータ空間に固有の分布情報を利用するCNMBIという手法を提案する。
異なるサンプルは異なる信頼度を持ち、したがって信頼度の低いサンプルを積極的に除去する。
CNMBIは堅牢で、ターゲットデータの寸法と形状をより柔軟にすることができる。
- 参考スコア(独自算出の注目度): 10.865555707958057
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: One of the main challenges in data mining is choosing the optimal number of clusters without prior information. Notably, existing methods are usually in the philosophy of cluster validation and hence have underlying assumptions on data distribution, which prevents their application to complex data such as large-scale images and high-dimensional data from the real world. In this regard, we propose an approach named CNMBI. Leveraging the distribution information inherent in the data space, we map the target task as a dynamic comparison process between cluster centers regarding positional behavior, without relying on the complete clustering results and designing the complex validity index as before. Bipartite graph theory is then employed to efficiently model this process. Additionally, we find that different samples have different confidence levels and thereby actively remove low-confidence ones, which is, for the first time to our knowledge, considered in cluster number determination. CNMBI is robust and allows for more flexibility in the dimension and shape of the target data (e.g., CIFAR-10 and STL-10). Extensive comparison studies with state-of-the-art competitors on various challenging datasets demonstrate the superiority of our method.
- Abstract(参考訳): データマイニングの主な課題の1つは、事前情報なしで最適なクラスタ数を選択することである。
特に、既存の手法はクラスタ検証の哲学上にあり、従ってデータ分散の前提となっているため、大規模な画像や実世界の高次元データといった複雑なデータに適用できない。
そこで本研究では,CNMBIというアプローチを提案する。
データ空間に固有の分布情報を活用することで、対象タスクを、完全なクラスタリング結果に頼らずに、位置行動に関するクラスタセンター間の動的比較プロセスとしてマッピングし、以前と同じ複雑な妥当性指数を設計する。
次に、この過程を効率的にモデル化するために二部グラフ理論が用いられる。
さらに、異なるサンプルが異なる信頼度を持ち、その結果、クラスタ数決定において考慮された、初めて、信頼度が低いサンプルを積極的に取り除くことが判明した。
CNMBIは堅牢で、ターゲットデータ(例えば、CIFAR-10、STL-10)の寸法と形状をより柔軟にすることができる。
様々な挑戦的データセットにおける最先端の競合相手との大規模な比較研究は,本手法の優位性を実証している。
関連論文リスト
- Robust Categorical Data Clustering Guided by Multi-Granular Competitive Learning [47.32771052588132]
ネストされた粒状クラスター効果は、カテゴリーデータの暗黙的な離散距離空間で顕著である。
本稿では,潜在的なクラスタが対話的に自分自身をチューニングできるマルチグラニュラ競合学習アルゴリズムを提案する。
提案手法は,マルチグラニュラクラスタのネスト分布の探索に有効であることを示す。
論文 参考訳(メタデータ) (2026-01-23T06:33:08Z) - Adaptive and Robust DBSCAN with Multi-agent Reinforcement Learning [53.527506374566485]
本稿では,多エージェント強化学習クラスタフレームワーク,すなわちAR-DBSCANを用いた新しいAdaptive and Robust DBSCANを提案する。
我々は、AR-DBSCANが、NMIおよびARIメトリクスの最大144.1%と175.3%のクラスタリング精度を向上するだけでなく、支配的なパラメータを確実に見つけることができることを示した。
論文 参考訳(メタデータ) (2025-05-07T11:37:23Z) - UniForCE: The Unimodality Forest Method for Clustering and Estimation of
the Number of Clusters [2.4953699842881605]
我々は,一様性の概念に着目し,局所的一様性クラスタと呼ばれる柔軟なクラスタ定義を提案する。
局所的ユニモーダルクラスタは、データのサブクラスタのペア間で一様性が局所的に保存される限り、拡張される。
局所的な単調クラスタリングのためのUniForCE法を提案する。
論文 参考訳(メタデータ) (2023-12-18T16:19:02Z) - A Weighted K-Center Algorithm for Data Subset Selection [70.49696246526199]
サブセット選択は、トレーニングデータの小さな部分を特定する上で重要な役割を果たす、基本的な問題である。
我々は,k中心および不確かさサンプリング目的関数の重み付け和に基づいて,サブセットを計算する新しい係数3近似アルゴリズムを開発した。
論文 参考訳(メタデータ) (2023-12-17T04:41:07Z) - Hard Regularization to Prevent Deep Online Clustering Collapse without
Data Augmentation [65.268245109828]
オンラインディープクラスタリング(オンラインディープクラスタリング)とは、機能抽出ネットワークとクラスタリングモデルを組み合わせて、クラスタラベルを処理された各新しいデータポイントまたはバッチに割り当てることである。
オフラインメソッドよりも高速で汎用性が高いが、オンラインクラスタリングは、エンコーダがすべての入力を同じポイントにマッピングし、すべてを単一のクラスタに配置する、崩壊したソリューションに容易に到達することができる。
本稿では,データ拡張を必要としない手法を提案する。
論文 参考訳(メタデータ) (2023-03-29T08:23:26Z) - CADIS: Handling Cluster-skewed Non-IID Data in Federated Learning with
Clustered Aggregation and Knowledge DIStilled Regularization [3.3711670942444014]
フェデレーション学習は、エッジデバイスがデータを公開することなく、グローバルモデルを協調的にトレーニングすることを可能にする。
我々は、実際のデータセットで発見されたクラスタスキュード非IIDと呼ばれる新しいタイプの非IIDデータに取り組む。
本稿では,クラスタ間の平等を保証するアグリゲーション方式を提案する。
論文 参考訳(メタデータ) (2023-02-21T02:53:37Z) - Very Compact Clusters with Structural Regularization via Similarity and
Connectivity [3.779514860341336]
本稿では,汎用データセットのためのエンドツーエンドのディープクラスタリングアルゴリズムであるVery Compact Clusters (VCC)を提案する。
提案手法は,最先端のクラスタリング手法よりも優れたクラスタリング性能を実現する。
論文 参考訳(メタデータ) (2021-06-09T23:22:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。