論文の概要: Randomized SVD Approximations for Spectral Co-Clustering of Word-Document Matrices
- arxiv url: http://arxiv.org/abs/2609.19243v1
- Date: Wed, 16 Sep 2026 17:42:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.969674
- Title: Randomized SVD Approximations for Spectral Co-Clustering of Word-Document Matrices
- Title(参考訳): 単語文書行列のスペクトル共クラスタリングのためのランダム化SVD近似
- Abstract要約: 本稿では,バイパルタイトテキストデータの正規化スペクトルクラスタリングのための2つのランダム化近似を提案する。
実世界および合成データセット全体において、どちらの手法も全SVDベースラインに対するランタイムを減少させる。
これらの結果から, スペクトル共クラスタリングのランダム化近似は, データの基盤構造に応じて選択すべきであることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spectral co-clustering is a useful tool for discovering latent structure in word-document matrices, but its reliance on singular value decomposition (SVD) can make standard formulations expensive on high-dimensional data. This paper presents two randomized approximations for normalized spectral co-clustering of bipartite text data when the numbers of document and word clusters may differ. The first method uses randomized SVD through random projection, while the second combines partial SVD with element-wise random sampling. Across real-world and synthetic datasets, both methods reduce runtime relative to the full-SVD baseline, but their behavior depends on matrix sparsity. The random projection method is the more reliable approximation across the tested settings, whereas the sampling-based method is most useful on denser matrices and provides limited benefit on already sparse text data. These results show that randomized approximations for spectral co-clustering should be selected according to the underlying structure of the data.
- Abstract(参考訳): スペクトルコクラスタリングは単語文書行列の潜在構造を発見するのに有用なツールであるが、特異値分解(SVD)に依存しているため、高次元データでは標準定式化が高価になる可能性がある。
本稿では、文書と単語クラスタの数が異なる場合、二部テキストデータの正規化スペクトルクラスタリングのための2つのランダム化近似を提案する。
第1の方法はランダムプロジェクションによるランダム化SVDを使用し、第2の方法は部分的なSVDと要素単位のランダムサンプリングを組み合わせたものである。
実世界のデータセットと合成データセット全体では、どちらの手法も完全なSVDベースラインと比較してランタイムを減少させるが、それらの振る舞いは行列の間隔に依存する。
ランダム・プロジェクション法はテストされた設定に対してより信頼性の高い近似法であるのに対し、サンプリングベース法はより高密度な行列に対して最も有用であり、既にスパースなテキストデータに対して限られた利点を提供する。
これらの結果から, スペクトル共クラスタリングのランダム化近似は, データの基盤構造に応じて選択すべきであることが示唆された。
関連論文リスト
- Active Learning with Low-Rank Structure for Data Selection [85.43185363043362]
低ランク近似と残差に基づくサンプリングに基づく新しいデータ選択フレームワークを提案する。
平均損失がデータセット全体の平均損失を近似した$tildeOleft(k + frac1varepsilon2right)$データポイントの重み付きサブセットを選択することができることを示す。
論文 参考訳(メタデータ) (2026-06-14T22:29:59Z) - Scalable Subset Selection in Linear Mixed Models [0.39373541926236766]
リニアモデル(LMM)は、パーソナライズドメディカルのような異種データを分析するための重要なツールである。
LMMの既存の手法は、数十から数百の予測値を超えない。
LMMサブセット選択の新しい方法は、数千の予測器を数秒から数分で含むデータセット上で実行できる。
論文 参考訳(メタデータ) (2025-06-25T13:39:30Z) - FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of Large Language Models [49.397861654088636]
低次元空間へのSVD/QRベースの勾配射影を近似する2段階の手順を提案する。
当社の戦略はランタイムの高速化とメモリ使用量の削減を,さまざまなモデルサイズで最大25%削減できることが示されています。
論文 参考訳(メタデータ) (2025-05-23T14:37:00Z) - Optimal Projections for Discriminative Dictionary Learning using the JL-lemma [0.5461938536945723]
次元減少に基づく辞書学習法は、しばしば反復的ランダムプロジェクションを用いている。
本稿では、ジョンソン-リンデンシュトラウス補題を用いて、投影行列をデランドマイズする構成的手法を提案する。
論文 参考訳(メタデータ) (2023-08-27T02:59:59Z) - Sparse PCA via $l_{2,p}$-Norm Regularization for Unsupervised Feature
Selection [138.97647716793333]
再構成誤差を$l_2,p$ノルム正規化と組み合わせることで,単純かつ効率的な特徴選択手法を提案する。
提案する非教師付きモデルを解くための効率的な最適化アルゴリズムを提案し,アルゴリズムの収束と計算の複雑さを理論的に解析する。
論文 参考訳(メタデータ) (2020-12-29T04:08:38Z) - Multi-View Spectral Clustering with High-Order Optimal Neighborhood
Laplacian Matrix [57.11971786407279]
マルチビュースペクトルクラスタリングは、データ間の固有のクラスタ構造を効果的に明らかにすることができる。
本稿では,高次最適近傍ラプラシア行列を学習するマルチビュースペクトルクラスタリングアルゴリズムを提案する。
提案アルゴリズムは, 1次ベースと高次ベースの両方の線形結合の近傍を探索し, 最適ラプラシア行列を生成する。
論文 参考訳(メタデータ) (2020-08-31T12:28:40Z) - CAST: A Correlation-based Adaptive Spectral Clustering Algorithm on
Multi-scale Data [34.89460002735166]
マルチスケールクラスタデータにスペクトルクラスタリングを適用する際の問題点について検討する。
マルチスケールデータの場合、スパースクラスタのオブジェクトが遠く離れているため、距離ベースの類似性は有効ではない。
係数行列を正規化するためにトレースラッソを適用するアルゴリズムCASTを提案する。
論文 参考訳(メタデータ) (2020-06-08T09:46:35Z) - Conjoined Dirichlet Process [63.89763375457853]
我々はディリクレ過程に基づく新しい非パラメトリック確率的ビクラスタリング法を開発し、列と列の双方に強い共起を持つビクラスタを同定する。
本手法はテキストマイニングと遺伝子発現解析の2つの異なる応用に適用し,既存の手法に比べて多くの設定でビクラスタ抽出を改善することを示す。
論文 参考訳(メタデータ) (2020-02-08T19:41:23Z) - Clustering Binary Data by Application of Combinatorial Optimization
Heuristics [52.77024349608834]
本稿では,2値データのクラスタリング手法について検討し,まず,クラスタのコンパクトさを計測するアグリゲーション基準を定義した。
近隣地域と人口動態最適化メタヒューリスティックスを用いた5つの新しいオリジナル手法が導入された。
準モンテカルロ実験によって生成された16のデータテーブルから、L1の相似性と階層的クラスタリング、k-means(メドイドやPAM)の1つのアグリゲーションの比較を行う。
論文 参考訳(メタデータ) (2020-01-06T23:33:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。