論文の概要: Bracketing Uncertainty in Clustering Under the Manifold Hypothesis
- arxiv url: http://arxiv.org/abs/2609.17892v1
- Date: Tue, 15 Sep 2026 22:34:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.556579
- Title: Bracketing Uncertainty in Clustering Under the Manifold Hypothesis
- Title(参考訳): マニフォールド仮説下でのクラスタリングにおけるブラッキングの不確かさ
- Abstract要約: クラスタ数のあいまいさはしばしば本質的であり、解決されるよりも定量化されるべきである。
我々は,データの不確実性を定量化するために,明示的なブラケット間隔を返すManifold-Based Clustering (MBC)を提案する。
以上の結果から,クラスタ数のあいまいさはしばしば本質的であり,解決するよりも定量化すべきであることが示唆された。
- 参考スコア(独自算出の注目度): 3.8233569758620054
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The manifold hypothesis suggests a natural criterion for clustering: partition data according to the manifold component from which each point is drawn. Whether two components are separable depends on a geometric tradeoff: the ambient separation between components versus the largest gap in sampling. In practice, this tradeoff is rarely assessed explicitly, leading standard methods to over-commit to a single clustering assignment even when the data do not support a unique answer. We formalize this tradeoff by combining intrinsic manifold geometry (volume growth and reach) with sample-level quantities (fill distance and density), yielding a threshold phenomenon for mutual-$k$-nearest-neighbor graphs: when the offset-to-fill ratio exceeds a conservative upper threshold, component separation is preserved; below a lower threshold, components fuse. The gap between these thresholds defines a geometric uncertainty zone in which the number of clusters is not identifiable from the data. Nevertheless, conventional approaches still seek one: sweeping parameters (an engineering approach) or fitting a generative mixture model (a model-based approach). Rather than forcing a single estimate of the number of clusters, we propose Manifold-Based Clustering (MBC), which returns an explicit bracket interval to quantify the underlying data uncertainty. This bracket acts as an empirically calibrated diagnostic: it narrows when a single resolution is supported, widens when multiple resolutions coexist, and collapses to one when no separated structure is detectable. Empirically, we find that many real datasets lie within the uncertainty zone rather than admitting one clear answer. Our results suggest that ambiguity in cluster number is often intrinsic, and should be quantified rather than resolved.
- Abstract(参考訳): 多様体仮説はクラスタリングの自然な基準を示唆する:各点が描画される多様体成分に従って分割する。
2つのコンポーネントが分離可能であるかどうかは、幾何学的なトレードオフ(コンポーネント間の環境分離とサンプリングにおける最大のギャップ)に依存する。
実際には、このトレードオフを明示的に評価することはめったになく、標準メソッドは、データがユニークな答えをサポートしていない場合でも、単一のクラスタリング代入に過度にコミットする。
このトレードオフは、固有多様体幾何(体積成長とリーチ)とサンプルレベルの量(充填距離と密度)を組み合わせて定式化し、互いに$k$-nearest-neighborグラフのしきい値現象を生じさせる:オフセット対充填比が保守的な上しきい値を超えた場合、成分分離が保存され、下しきい値以下で成分が融合する。
これらの閾値の間のギャップは、データからクラスターの数が特定できないような幾何学的不確実性ゾーンを定義する。
それでも、従来のアプローチは、パラメータ(エンジニアリングアプローチ)を網羅するか、生成的混合モデル(モデルベースのアプローチ)を適合させる、という方法を模索している。
クラスタ数の単一推定を強制するのではなく,データの不確実性を定量化するために,明示的なブラケット間隔を返すManifold-Based Clustering (MBC)を提案する。
このブラケットは経験的に校正された診断として機能し、単一の解像度がサポートされた時に狭くなり、複数の解像度が共存していれば広くなり、分離された構造が検出できない場合には1つに崩壊する。
経験的に、多くの実際のデータセットが、明確な答えを認めるのではなく、不確実性ゾーン内にあることが分かりました。
以上の結果から,クラスタ数のあいまいさはしばしば本質的であり,解決するよりも定量化すべきであることが示唆された。
関連論文リスト
- Cluster-Based Dimensionality Reduction by Nonparametric Distributional Screening [1.4773309126683776]
我々は,2つ以上のクラスタに供給された分割を伴う高次元観測における次元の低減について検討する。
提案手法は,数サンプルのコルモゴロフ-スミルノフ分離統計量を用いて,クラスタ固有の経験分布関数を比較する。
得られた限界クラスタのサポートを形式化し、全ての座標に対して一貫した有限サンプル濃度を確立する。
論文 参考訳(メタデータ) (2026-09-06T21:58:59Z) - When Is a General Factor Distinguishable? Non-Proportionality, Stable Structure, and the Bifactor Decision [2.1494179586067537]
識別可能性(distinguishability)は、K$-factorクラスへの人口距離によって測定される。
4つの経験的データセットは、可能な結果を示している。
論文 参考訳(メタデータ) (2026-08-11T09:46:15Z) - Seed-Guided Semi-Supervised Clustering by A-Contrario Anomaly Detection [0.0]
本稿では,グループ化原理と異常検出の統計的双対性に基づく半教師付きクラスタリングフレームワークを提案する。
我々は、クラスタを、一様ランダム性のヌル仮説に対する異常のないデータポイントの最大部分集合として定義する。
本手法は, 生, 線形再生, 近傍排他的埋め込みによって表現される画像とテキストのデータセットを含む, 合成および実世界のベンチマークで評価する。
論文 参考訳(メタデータ) (2026-06-17T09:08:02Z) - The Condition-Number Principle for Prototype Clustering [0.0]
プロトタイプクラスタリングにおける客観的な精度と構造的回復を結びつける幾何学的枠組みを開発する。
クラスタ内スケールとクラスタ境界を越えてポイントを移動させるために必要な最小損失増加を比較するクラスタリング条件数を定義します。
クラスター境界付近でエラーが集中し, 十分に深いクラスタコアが, 局所的に強化されたマージンの下で正確に回収されることを示す。
論文 参考訳(メタデータ) (2026-04-09T03:03:01Z) - kFuse: A novel density based agglomerative clustering [9.061140802902514]
本稿では,kFuseと呼ばれる密度に基づく凝集クラスタリング手法を提案する。
kFuse は,(1) 自然近傍におけるサブクラスタ分割,(2) 隣接するサンプルと最短距離の計算によるサブクラスタ間の境界接続の決定,(3) 平均密度と分散の計算によるサブクラスタ間の密度類似性の評価,の4つの重要な構成要素から構成される。
合成と実世界の両方のデータセットの実験結果から、kFuseの有効性が検証された。
論文 参考訳(メタデータ) (2025-05-09T03:11:04Z) - Composed Image Retrieval with Text Feedback via Multi-grained
Uncertainty Regularization [73.04187954213471]
粗い検索ときめ細かい検索を同時にモデル化する統合学習手法を提案する。
提案手法は、強いベースラインに対して+4.03%、+3.38%、+2.40%のRecall@50精度を達成した。
論文 参考訳(メタデータ) (2022-11-14T14:25:40Z) - Anomaly Clustering: Grouping Images into Coherent Clusters of Anomaly
Types [60.45942774425782]
我々は異常クラスタリングを導入し、その目標はデータを異常型の一貫性のあるクラスタにまとめることである。
これは異常検出とは違い、その目標は異常を通常のデータから分割することである。
パッチベースの事前訓練されたディープ埋め込みとオフザシェルフクラスタリング手法を用いた,単純で効果的なクラスタリングフレームワークを提案する。
論文 参考訳(メタデータ) (2021-12-21T23:11:33Z) - Lattice-Based Methods Surpass Sum-of-Squares in Clustering [98.46302040220395]
クラスタリングは教師なし学習における基本的なプリミティブである。
最近の研究は、低次手法のクラスに対する低い境界を確立している。
意外なことに、この特定のクラスタリングモデルのtextitdoesは、統計的-計算的ギャップを示さない。
論文 参考訳(メタデータ) (2021-12-07T18:50:17Z) - Spatially relaxed inference on high-dimensional linear models [48.989769153211995]
本研究では,空間的に制約されたクラスタリング,統計的推論,アンサンブルを組み合わせ,複数のクラスタリング推論解を集約するアンサンブルクラスタリング推論アルゴリズムの特性について検討する。
アンサンブルクラスタ推論アルゴリズムは,最大クラスター径に等しい$delta$-FWERの標準仮定で$delta$-FWERを制御することを示す。
論文 参考訳(メタデータ) (2021-06-04T16:37:19Z) - Exact Recovery in the General Hypergraph Stochastic Block Model [92.28929858529679]
本稿では,d-uniform hypergraph block model(d-HSBM)の正確な回復の基本的な限界について検討する。
精度の高いしきい値が存在し、正確な回復がしきい値の上に達成でき、その下には不可能であることを示す。
論文 参考訳(メタデータ) (2021-05-11T03:39:08Z) - Sum-of-norms clustering does not separate nearby balls [49.1574468325115]
我々は,データセットを一般的な測度に置き換えた,和和クラスタリングの連続的なバージョンを示す。
我々は,離散データポイントの場合においても,新たなクラスタリングの局所的特徴を記述し,証明する。
論文 参考訳(メタデータ) (2021-04-28T13:35:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。