論文の概要: Relative Wasserstein Spatial Depth for Cluster Number Selection in Distributional Data
- arxiv url: http://arxiv.org/abs/2610.09153v1
- Date: Tue, 06 Oct 2026 21:53:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.628145
- Title: Relative Wasserstein Spatial Depth for Cluster Number Selection in Distributional Data
- Title(参考訳): 分布データにおけるクラスタ数選択のための相対ワッサースタイン空間深さ
- Abstract要約: 本稿では,クラスタ数の最適選択基準として相対ワッサースタイン空間深さ(RWSD)を提案する。
RWSDは、割り当てられたクラスタ内の各分布の深さと、競合するクラスタ内の深さを比較する。
大規模なシミュレーションでは、RWSDは不均一な分離、不均一な分散、重い尾、および外れ値の下で意図された数のクラスターを選択する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Contemporary data in many scientific domains, such as images, media streams, biomedical omics, are naturally modeled as probability distributions in Wasserstein space instead of points in Euclidean space. Consequently, clustering methods for distributions are in high demand, as they provide exploratory frameworks to group objects with similarity. Clustering distribution-valued data in Wasserstein space often requires choosing the number of clusters in advance. We propose Relative Wasserstein Spatial Depth (RWSD) as a selection criterion for optimal number of clusters. It compares the depth of each distribution in its assigned cluster with its depth in competing clusters. We pair this criterion with Wasserstein K-means or a proposed K-medians algorithm. Under suitable assumptions, we establish consistency of the cluster centers and of the selected optimal number of clusters. We also give an error rate under two-stage sampling and characterize the robustness of RWSD under any fixed partition. In extensive simulations, RWSD selects the intended number of clusters under unequal separations, heterogeneous dispersion, heavy tails, and outliers, where silhouette score or the Davies-Bouldin Index often fails. Applications to MNIST images and flow cytometry data illustrate the practical value of RWSD. In some cases where a cluster is not geodesically convex and lacks a meaningful depth center, the RWSD can fail.
- Abstract(参考訳): 画像、メディアストリーム、バイオメディカルオミクスなどの多くの科学領域における現代のデータは、ユークリッド空間の点ではなく、ワッサーシュタイン空間の確率分布として自然にモデル化されている。
その結果、分布のクラスタリング手法は、類似したオブジェクトをグループ化するための探索的なフレームワークを提供するため、高い需要がある。
ワッサーシュタイン空間における分布値データのクラスタリングは、しばしば事前にクラスタ数を選択する必要がある。
本稿では,クラスタ数の最適選択基準として相対ワッサースタイン空間深さ(RWSD)を提案する。
割り当てられたクラスタ内の各分布の深さと、競合するクラスタ内の深さを比較する。
この基準をWasserstein K-meansや提案したK-mediansアルゴリズムと組み合わせる。
適切な仮定の下で、クラスタセンターと選択された最適なクラスタ数の整合性を確立する。
また、2段階サンプリングの誤差率を与え、任意の固定分割下でのRWSDのロバスト性を特徴付ける。
大規模なシミュレーションでは、RWSDは不均一な分離、不均一な分散、重い尾、外れ値の下で意図された数のクラスターを選択し、シルエットスコアやデイビーズ・ボルディン指数はしばしば失敗する。
MNIST画像およびフローサイトメトリーデータへの応用は、RWSDの実用的価値を示す。
クラスタが測地的に凸ではなく、意味深い中心を持たない場合、RWSDは失敗することがある。
関連論文リスト
- Scalable Context-Preserving Model-Aware Deep Clustering for Hyperspectral Images [51.95768218975529]
ハイパースペクトル画像(HSI)の教師なし解析にサブスペースクラスタリングが広く採用されている。
近年のモデル対応深層空間クラスタリング手法では、O(n2)の複雑性を持つ自己表現行列の計算とスペクトルクラスタリングを含む2段階のフレームワークを用いることが多い。
本稿では,HSIクラスタリングを効率的に行うために,局所構造と非局所構造を協調的にキャプチャする,ベース表現に基づく拡張性のあるコンテキスト保存深層クラスタリング手法を提案する。
論文 参考訳(メタデータ) (2025-06-12T16:43:09Z) - Guaranteed Recovery of Unambiguous Clusters [7.011239860967789]
クラスタリングは、しばしば難しい問題である。なぜなら、それは、"正しい"クラスタリングがどうあるべきかに固有の曖昧さのためである。
本稿は,クラスタ内の2つの高密度領域が,K$clusteringの2つの真に異なるクラスタよりも,2つの異なるクラスタのように見えるほど分離可能な状況について定式化する。
論文 参考訳(メタデータ) (2025-01-22T18:51:25Z) - Clustering Based on Density Propagation and Subcluster Merging [92.15924057172195]
本稿では,クラスタ数を自動的に決定し,データ空間とグラフ空間の両方に適用可能な密度に基づくノードクラスタリング手法を提案する。
二つのノード間の距離を計算する従来の密度クラスタリング法とは異なり,提案手法は伝播過程を通じて密度を決定する。
論文 参考訳(メタデータ) (2024-11-04T04:09:36Z) - Self-Supervised Graph Embedding Clustering [70.36328717683297]
K-means 1-step dimensionality reduction clustering method は,クラスタリングタスクにおける次元性の呪いに対処する上で,いくつかの進歩をもたらした。
本稿では,K-meansに多様体学習を統合する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-24T08:59:51Z) - DECWA : Density-Based Clustering using Wasserstein Distance [1.4132765964347058]
空間密度と確率的アプローチに基づく新しいクラスタリングアルゴリズムを提案する。
提案手法は, 様々なデータセットにおいて, 最先端の密度に基づくクラスタリング手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-10-25T11:10:08Z) - Wasserstein $K$-means for clustering probability distributions [16.153709556346417]
ユークリッド空間では、セントロイドと距離に基づくK$平均の定式化は同値である。
現代の機械学習アプリケーションでは、データは確率分布として発生し、測度値のデータを扱う自然な一般化は最適な輸送距離を使用する。
SDP緩和ワッサースタイン$K$-平均は、クラスターが2ドルワッサースタイン計量の下で十分に分離されているため、正確な回復を達成することができることを示す。
論文 参考訳(メタデータ) (2022-09-14T23:43:16Z) - Local versions of sum-of-norms clustering [77.34726150561087]
本手法はボールモデルにおいて任意に閉じた球を分離できることを示す。
我々は、不連結連結集合のクラスタリングで発生する誤差に定量的な有界性を証明した。
論文 参考訳(メタデータ) (2021-09-20T14:45:29Z) - Scalable Hierarchical Agglomerative Clustering [65.66407726145619]
既存のスケーラブルな階層的クラスタリング手法は、スピードの質を犠牲にする。
我々は、品質を犠牲にせず、数十億のデータポイントまでスケールする、スケーラブルで集約的な階層的クラスタリング法を提案する。
論文 参考訳(メタデータ) (2020-10-22T15:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。