論文の概要: Statistical Properties of $k$-means Clustering for Data Missing Completely at Random
- arxiv url: http://arxiv.org/abs/2607.01945v1
- Date: Thu, 02 Jul 2026 09:34:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.774454
- Title: Statistical Properties of $k$-means Clustering for Data Missing Completely at Random
- Title(参考訳): ランダムに完全に欠落したデータに対する$k$-meansクラスタリングの統計的特性
- Authors: Xin Guan,
- Abstract要約: 欠落データの存在下での$k$-meansクラスタリングの統計特性について検討する。
ランダム(MCAR)機構の欠如について、推定されたクラスタセンターの$sqrtn$収束率と正規性から導出する。
これらの結果は、欠落データ-$k$-meansの理論的保証を提供する。
- 参考スコア(独自算出の注目度): 7.3226942109207895
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The classical $k$-means clustering cannot be directly used to incomplete data, and existing $k$-means-based clustering for missing data primarily focus on improving the practical accuracy of clustering, whereas most of them lack theoretical guarantees in the asymptotic sense. In this paper, we investigate the statistical properties of $k$-means clustering in the presence of missing data. We first establish the $\sqrt{n}$-excess risk bound and prove the consistency of the estimated cluster centers under general missing mechanisms. For the Missing Completely at Random (MCAR) mechanism, we further derive the $\sqrt{n}$-convergence rate and asymptotic normality of the estimated cluster centers. Moreover, we study in what cases the cluster centers estimated by incomplete data converge to the true cluster centers of original fully observed data, and give a sufficient condition about the missing probability and the separation among true clusters. These results provide a theoretical guarantee for missing-data-$k$-means. Notably, our analysis reveal that under MCAR mechanism, both achieving the $\sqrt{n}$-rate and converging to the true cluster centers require $k$ true centers to be distinct in every dimension, highlighting the significant challenges of application in high-dimensional regimes. Finally, we conduct numerical simulations on synthetic incomplete datasets to support our theoretical analysis results.
- Abstract(参考訳): 従来の$k$-meansクラスタリングは、不完全データに直接使用することはできないが、既存の$k$-meansベースのクラスタリングは、主にクラスタリングの実用的精度の改善に焦点を当てている。
本稿では,不足データの存在下での$k$-meansクラスタリングの統計特性について検討する。
まず、リスクバウンドを$\sqrt{n}$-excessと定め、一般的な欠落メカニズムの下で推定されたクラスタセンターの整合性を証明する。
ランダム(MCAR)機構の欠如について、推定されたクラスター中心の$\sqrt{n}$-convergence rateと漸近正規性(英語版)を導出する。
さらに、不完全データから推定されるクラスタ中心が、元の完全に観測されたデータの真のクラスタ中心に収束する場合について検討し、真のクラスタ間の欠落確率と分離について十分な条件を与える。
これらの結果は、欠落データ-$k$-meansの理論的保証を提供する。
特に、MCARのメカニズムの下では、$\sqrt{n}$-rateを達成し、真のクラスタセンターに収束するためには、すべての次元において$k$真のセンターを区別する必要がある。
最後に, 理論的解析結果を支援するために, 合成不完全データセットの数値シミュレーションを行う。
関連論文リスト
- MNAR-$k$-means: A $k$-means Clustering for Data Missing Not at Random with Magnitude-Decaying Probability [7.3226942109207895]
本稿では,命令値の大きさの制約に基づく新しい$k$-meansクラスタリング手法を提案する。
本研究では,提案手法のクラスタ中心から完全に観測されたデータの真のクラスタ中心まで,推定されたクラスタ中心の統計的一貫性を確立する。
論文 参考訳(メタデータ) (2026-06-30T07:31:22Z) - Generalization Performance of Ensemble Clustering: From Theory to Algorithm [57.176040163699554]
本稿では,アンサンブルクラスタリングにおける一般化誤差,過剰リスク,一貫性に着目した。
有限クラスタリングに様々な重みを割り当てることで、経験的平均クラスタリングと期待値との誤差を最小化する。
我々は、新しいアンサンブルクラスタリングアルゴリズムを開発するために、我々の理論をインスタンス化する。
論文 参考訳(メタデータ) (2025-06-01T09:34:52Z) - Self-Supervised Graph Embedding Clustering [70.36328717683297]
K-means 1-step dimensionality reduction clustering method は,クラスタリングタスクにおける次元性の呪いに対処する上で,いくつかの進歩をもたらした。
本稿では,K-meansに多様体学習を統合する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-24T08:59:51Z) - Fuzzy K-Means Clustering without Cluster Centroids [21.256564324236333]
ファジィK平均クラスタリングは教師なしデータ分析において重要な手法である。
本稿では,クラスタセントロイドへの依存を完全に排除する,ファジィテクストK-Meansクラスタリングアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-04-07T12:25:03Z) - A Unified Framework for Center-based Clustering of Distributed Data [46.86543102499174]
我々は、ユーザのネットワーク上で動作する分散センターベースのクラスタリングアルゴリズムのファミリーを開発する。
私たちのフレームワークは、$K$-meansやHuber Losといった一般的なクラスタリング損失を含む、スムーズな凸損失関数の幅広いクラスを可能にします。
ブレグマン損失の特別の場合、固定点がロイド点の集合に収束することを示す。
論文 参考訳(メタデータ) (2024-02-02T10:44:42Z) - A provable initialization and robust clustering method for general mixture models [6.806940901668607]
クラスタリングは、異種データの存在下での統計機械学習の基本的なツールである。
最新の結果は、ガウス以下の誤差を伴うセントロイドの周りにデータが分散されている場合に、最適なラベルの誤りを保証することに焦点が当てられている。
論文 参考訳(メタデータ) (2024-01-10T22:56:44Z) - Wasserstein $K$-means for clustering probability distributions [16.153709556346417]
ユークリッド空間では、セントロイドと距離に基づくK$平均の定式化は同値である。
現代の機械学習アプリケーションでは、データは確率分布として発生し、測度値のデータを扱う自然な一般化は最適な輸送距離を使用する。
SDP緩和ワッサースタイン$K$-平均は、クラスターが2ドルワッサースタイン計量の下で十分に分離されているため、正確な回復を達成することができることを示す。
論文 参考訳(メタデータ) (2022-09-14T23:43:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。