論文の概要: External Clustering Validation by the Homogeneity-Parsimony Trade-off
- arxiv url: http://arxiv.org/abs/2607.20799v1
- Date: Wed, 22 Jul 2026 23:55:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.250003
- Title: External Clustering Validation by the Homogeneity-Parsimony Trade-off
- Title(参考訳): 均一性-擬似トレードオフによる外部クラスタリング検証
- Authors: Andreas Tiffeau-Mayer,
- Abstract要約: このトレードオフを定量化するためのクラスタの均一性とパーシモニーの正規化スコアについて述べる。
情報理論の枠組みをシャノンエントロピーを超えて拡張し、セットマッチングとペアベースを導出する。
特徴選択とアルゴリズム比較のためのフレームワークの有用性を実証する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scalar metrics are often used to evaluate clusterings against known classes, but they can obscure a fundamental trade-off: clusterings should be informative about class labels while avoiding unnecessary fragmentation. Here we describe normalized scores of cluster homogeneity and parsimony that quantify this trade-off. These scores build on the information bottleneck principle, modified to not reward lossy compression. We show by example and mathematical proof that our definitions of these scores have the intuitive property of varying monotonically under cluster refinement in contrast to related proposals. Extending the information-theoretic framework beyond Shannon entropies, we furthermore derive set-matching and pair-based counterparts of the homogeneity and parsimony scores. These unify commonly used evaluation criteria and show that, in the pair-based setting, the homogeneity-parsimony trade-off recovers the receiver operating characteristic of binary classifiers. We demonstrate the framework's utility for feature selection and algorithm comparison, illustrating how considering scores jointly can clarify clustering operating points and identify Pareto-optimal solutions.
- Abstract(参考訳): Scalarメトリクスは、既知のクラスに対するクラスタリングの評価によく使用されるが、基本的なトレードオフを曖昧にすることができる。
ここでは、このトレードオフを定量化するクラスタの均一性とパーシモニーの正規化スコアについて述べる。
これらのスコアは情報ボトルネックの原則に基づいており、損失のある圧縮に報われないよう修正されている。
実例および数学的証明により、これらのスコアの定義は、関連する提案とは対照的に、クラスタリファインメントの下で単調に異なる直感的な性質を持つことを示す。
シャノンエントロピーを超えて情報理論の枠組みを拡張することで、同質性やパシモニーのスコアのセットマッチングとペアベースのスコアを導出する。
これらの評価基準を統一し、ペアベースの設定では、均質パリモニートレードオフが二項分類器の受信機動作特性を回復することを示す。
特徴選択とアルゴリズム比較のためのフレームワークの有用性を実証し、スコアを協調的に検討することで、クラスタリング操作点を明確にし、パレート最適解を同定する方法について述べる。
関連論文リスト
- Weight-Informed Self-Explaining Clustering for Mixed-Type Tabular Data [63.62853416081748]
WISEは表現、特徴重み付け、クラスタリング、解釈を統一するフレームワークである。
クラスタリングを駆動する同じプリミティブに根ざした、忠実で人間解釈可能な説明を生成する。
論文 参考訳(メタデータ) (2026-04-07T13:18:31Z) - Explainable cluster analysis: a bagging approach [3.5173697454104844]
同様の観察をどの特徴がグループ化するかについての洞察を与える方法はめったにない。
本稿では,バギングと機能ドロップアウトを統合したアンサンブルベースのクラスタリングフレームワークを提案する。
その効果は、複数のシミュレートされた実世界のデータセットで実証されている。
論文 参考訳(メタデータ) (2026-03-20T10:34:04Z) - Discriminative Ordering Through Ensemble Consensus [12.714723443928298]
コンセンサスクラスタリングからインスピレーションを得て、クラスタリングモデルのセットがデータに隠された構造を発見できると仮定します。
本稿では,クラスタリングモデルとコンセンサス行列との接続距離に基づいて,アンサンブルクラスタリングによる識別順序付けを提案する。
論文 参考訳(メタデータ) (2025-05-07T14:35:39Z) - ABCDE: Application-Based Cluster Diff Evals [49.1574468325115]
それは実用性を目指しており、アイテムはアプリケーション固有の重要な値を持つことができ、クラスタリングがどちらが優れているかを判断するときに人間の判断を使うのは粗悪であり、アイテムの任意のスライスのためのメトリクスを報告できる。
クラスタリング品質の差分を測定するアプローチは、高価な地平を前もって構築し、それに関して各クラスタリングを評価する代わりに、ABCDEはクラスタリング間の実際の差分に基づいて、判定のための質問をサンプリングする。
論文 参考訳(メタデータ) (2024-07-31T08:29:35Z) - Near-Optimal Resilient Aggregation Rules for Distributed Learning Using 1-Center and 1-Mean Clustering with Outliers [24.88026399458157]
ビザンティンの機械学習は、予測不可能な欠陥によってかなりの注目を集めている。
分散学習におけるマシンのセキュア化の鍵は、レジリエントな集約メカニズムである。
論文 参考訳(メタデータ) (2023-12-20T08:36:55Z) - Anomaly Detection using Ensemble Classification and Evidence Theory [62.997667081978825]
本稿では,アンサンブル分類とエビデンス理論を用いた新しい検出手法を提案する。
固体アンサンブル分類器を構築するためのプール選択戦略が提示される。
我々は異常検出手法の不確実性を利用する。
論文 参考訳(メタデータ) (2022-12-23T00:50:41Z) - Neighbour Consistency Guided Pseudo-Label Refinement for Unsupervised
Person Re-Identification [80.98291772215154]
教師なしの人物再識別(ReID)は、アノテーションを使わずに人物検索のための識別的アイデンティティの特徴を学習することを目的としている。
近年の進歩はクラスタリングに基づく擬似ラベルを活用することで実現されている。
本稿では, Pseudo Label Refinement フレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-30T09:39:57Z) - Normalised clustering accuracy: An asymmetric external cluster validity measure [0.9983624159392207]
クラスタリングアルゴリズムは、伝統的に内部または外部の妥当性尺度を用いて評価される。
本稿では、一般的に使われている古典的分割類似度スコアは、いくつかの望ましい性質を欠いていると論じる。
我々は,最適セットマッチング精度のバージョンである新しい尺度を提案し,分析する。
論文 参考訳(メタデータ) (2022-09-07T05:08:34Z) - You Never Cluster Alone [150.94921340034688]
我々は、主流のコントラスト学習パラダイムをクラスタレベルのスキームに拡張し、同じクラスタに属するすべてのデータが統一された表現に寄与する。
分類変数の集合をクラスタ化代入信頼度として定義し、インスタンスレベルの学習トラックとクラスタレベルの学習トラックを関連付ける。
代入変数を再パラメータ化することで、TCCはエンドツーエンドでトレーニングされる。
論文 参考訳(メタデータ) (2021-06-03T14:59:59Z) - Deconfounding Scores: Feature Representations for Causal Effect
Estimation with Weak Overlap [140.98628848491146]
推定対象の偏りを伴わずに高い重なりを生じさせる,デコンファウンディングスコアを導入する。
分離スコアは観測データで識別可能なゼロ共分散条件を満たすことを示す。
特に,この手法が標準正規化の魅力的な代替となることを示す。
論文 参考訳(メタデータ) (2021-04-12T18:50:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。