論文の概要: GEM-KMeans: Memory-Efficient and Accurate Clustering on Massive Scale with GPU Optimization
- arxiv url: http://arxiv.org/abs/2609.36074v1
- Date: Mon, 28 Sep 2026 18:23:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.937549
- Title: GEM-KMeans: Memory-Efficient and Accurate Clustering on Massive Scale with GPU Optimization
- Title(参考訳): GEM-KMeans:GPU最適化による大規模クラスタリングのメモリ効率と精度向上
- Abstract要約: K$-means に対する非負の低ランク行列分解はスケーラブルなクラスタリング法である。
NLRの直接GPU実装では、複数の大きなファクタサイズのバッファと、本質的にメモリバウンドなデータ移動が必要である。
GEM-KMeansは、スペクトル正規化されているが数学的に等価なNLR定式化であり、勾配更新、非負の投影、および十分な統計を融合させる。
- 参考スコア(独自算出の注目度): 17.344690125291258
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Memory-efficient scaling on clustering problems without sacrificing statistical accuracy is of central interest for large-scale data analysis and machine learning problems. Nonnegative low-rank (NLR) matrix factorization for $K$-means is a scalable clustering method, which connects to semidefinite relaxations with optimal average-case exact recovery guarantees. However, a direct GPU implementation of NLR requires multiple large factor-sized buffers and substantial data movements that are essentially memory-bound. In this paper, we introduce GEM-KMeans, a spectrally normalized yet mathematically equivalent NLR formulation that fuses the gradient update, nonnegative projection, and sufficient statistics for normalization and iterate movement into a matrix-multiplication epilogue. Instead of retaining three massive factor-sized arrays, our IO-aware GPU implementation materializes only one single factor with small tile-reduction arrays as additional storage in the High Bandwidth Memory (HBM). We derive explicit memory costs and spectrally normalized smoothness bounds for optimizing the clustering objective function. Accurate clustering is demonstrated at massive scales on synthetic and real datasets, where performance gains of GEM-KMeans over existing GPU-accelerated Lloyd's algorithms involve data-dependent runtime tradeoffs.
- Abstract(参考訳): 統計的精度を犠牲にすることなくクラスタリング問題に対するメモリ効率のスケーリングは、大規模データ分析や機械学習問題の中心的な関心事である。
K$-means に対する非負の低ランク行列分解 (NLR) は拡張性のあるクラスタリング法であり、半定値緩和と最適な平均ケースの正確な回復を保証する。
しかし、NLRの直接GPU実装では、複数の大きなファクタサイズのバッファと、本質的にメモリバウンドなデータ移動が必要である。
本稿では,GEM-KMeansについて述べる。GEM-KMeansは,勾配の更新,非負の投影,正規化と反復移動のための十分な統計をマトリックス-乗算エピローグに融合させる,スペクトル正規化されているが数学的に等価なNLR定式化である。
IO対応GPU実装では、3つの大きなファクタサイズの配列を保持する代わりに、ハイ帯域メモリ(HBM)に付加的なストレージとして、小さなタイル誘引配列を持つ1つの要素のみを具現化しています。
クラスタリング目的関数を最適化するために、明示的なメモリコストとスペクトル正規化の滑らかさ境界を導出する。
正確なクラスタリングは、合成データセットと実際のデータセットで大規模に示されており、GEM-KMeansのパフォーマンスは、既存のGPUアクセラレーションされたRoydのアルゴリズムよりも向上している。
関連論文リスト
- No More K-means: Single-Stage Sparse Coding for Efficient Multi-Vector Retrieval [51.43543998583709]
SSR(Single-stage Sparse Retrieval)は、高価なクラスタリングを効率的なスパースコーディングに置き換えるパラダイムシフトである。
ColBERTv2と比較してインデックス処理時間を15倍短縮し、検索レイテンシを半減させ、同時に検索性能を向上させる。
論文 参考訳(メタデータ) (2026-05-28T15:53:34Z) - FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs [13.951330786310262]
FineQは、ソフトウェアとハードウェアの共同設計であり、大規模言語モデルの低ビット細粒度混合精度量子化のための設計である。
重みをよりきめ細かいクラスタに分割し、これらのクラスタ内の外れ値の分布を考慮する。
近似平均ビット幅でのSOTA混合精度量子化アルゴリズムと比較してモデル精度が向上する。
論文 参考訳(メタデータ) (2025-04-28T12:47:23Z) - HAFLQ: Heterogeneous Adaptive Federated LoRA Fine-tuned LLM with Quantization [55.972018549438964]
LLM(Federated Fine-tuning of Pre-trained Large Language Models)は、さまざまなデータセットにまたがるタスク固有の適応を可能にすると同時に、プライバシの保護を可能にする。
本研究では, HAFLQ (Heterogeneous Adaptive Federated Low-Rank Adaptation Fine-tuned LLM with Quantization) を提案する。
テキスト分類タスクの実験結果から,HAFLQはメモリ使用量を31%削減し,通信コストを49%削減し,精度を50%向上し,ベースライン法よりも高速な収束を実現している。
論文 参考訳(メタデータ) (2024-11-10T19:59:54Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z) - Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores [3.6385567224218556]
大規模言語モデル(LLM)は広く応用されているが、効率的な推論では課題に直面している。
本稿では、並列計算を容易にし、対称量子化をサポートする新しいバイポーラ-INTデータフォーマットを提案する。
ビットレベルで分解・復元する任意の精度行列乗算方式を実装し,フレキシブルな精度を実現する。
論文 参考訳(メタデータ) (2024-09-26T14:17:58Z) - Flash-LLM: Enabling Cost-Effective and Highly-Efficient Large Generative
Model Inference with Unstructured Sparsity [12.663030430488922]
高速コア上での低コストかつ高効率な大規模生成モデル推論を実現するためのFlash-LLMを提案する。
SpMMカーネルレベルでは、Flash-LLMは最先端のライブラリであるSputnikとSparTAをそれぞれ平均2.9倍、1.5倍で上回っている。
論文 参考訳(メタデータ) (2023-09-19T03:20:02Z) - Distributed Out-of-Memory NMF on CPU/GPU Architectures [1.0051474951635875]
本稿では,HPCシステムに対する非負行列分解(NMF)アルゴリズムのメモリ外実装を提案する。
ベンチマークの結果、CPUベースのNMFkよりもGPUを使用した新しい実装により、32Xから76倍のスピードアップが大幅に改善された。
論文 参考訳(メタデータ) (2022-02-19T03:49:21Z) - SreaMRAK a Streaming Multi-Resolution Adaptive Kernel Algorithm [60.61943386819384]
既存のKRRの実装では、すべてのデータがメインメモリに格納される必要がある。
KRRのストリーミング版であるStreaMRAKを提案する。
本稿では,2つの合成問題と2重振り子の軌道予測について紹介する。
論文 参考訳(メタデータ) (2021-08-23T21:03:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。