論文の概要: Imputation Meets Clustering: Exploiting Latent Subgroup Structure for Missing Data Recovery
- arxiv url: http://arxiv.org/abs/2607.06930v1
- Date: Wed, 08 Jul 2026 02:50:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.266533
- Title: Imputation Meets Clustering: Exploiting Latent Subgroup Structure for Missing Data Recovery
- Title(参考訳): クラスタリングに遭遇するImputation:データリカバリを欠くために潜伏サブグループ構造を爆発させる
- Authors: Chuyao Zhang, E Li, Taochen Chen, Yiqun Zhang, Yuzhu Ji, Shuping Zhao, Peng Liu, Yiu-ming Cheung,
- Abstract要約: 本稿では、クラスタリングと命令を相互に強化する共最適化プロセスとして再構築するフレームワークであるCAGI(Cluster-Aware Generative Imputation)を提案する。
14のベンチマークデータセットと15の代表的なベースラインの実験は、CAGIの優位性を実証している。
- 参考スコア(独自算出の注目度): 52.29866804948133
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Missing data is prevalent in practical applications, making effective imputation an essential preprocessing step for downstream analysis. Real-world datasets often exhibit complex latent structures composed of multiple subgroups with distinct distributions. However, existing methods often overlook such population heterogeneity. Without explicit structural guidance, these methods tend to produce generic estimates that blur subgroup boundaries and lack instance-level fidelity. While incorporating subgroup information offers a remedy, it faces a circular dependency: reliable subgroup identification requires complete data, while data completion is the imputation objective itself. To resolve this, we propose CAGI (Cluster-Aware Generative Imputation), a framework that reformulates clustering and imputation as a mutually reinforcing co-optimization process. CAGI employs a ``Partition-Guide-Restore'' strategy where dynamic cluster assignments act as local priors to condition a Generative Adversarial Network. An iterative feedback loop is established to progressively refine both cluster structures and imputed values toward faithful subgroup distributions. To ensure distributional stability, CAGI further employs a multi-level optimization objective combining instance-level reconstruction with distribution-level regularization. Extensive experiments on 14 benchmark datasets with 15 representative baselines demonstrate the superiority of CAGI. The source code is available at: https://github.com/supercocachii/CAGI
- Abstract(参考訳): データの欠落は、実際のアプリケーションでよく見られ、実効計算が下流分析に不可欠な前処理ステップとなる。
実世界のデータセットは、しばしば異なる分布を持つ複数のサブグループからなる複雑な潜在構造を示す。
しかし、既存の方法はしばしばそのような人口の不均一性を見落としている。
明示的な構造的ガイダンスがなければ、これらの手法は部分群の境界を曖昧にし、インスタンスレベルの忠実さを欠く一般的な推定を生成する傾向がある。
信頼性のあるサブグループ識別には完全なデータが必要であるが、データ補完自体が計算対象である。
これを解決するために,クラスタリングと命令を相互に強化するプロセスとして再構築するフレームワークであるCAGI(Cluster-Aware Generative Imputation)を提案する。
CAGIは‘パーティション-ガイド-リストア’戦略を採用しており、動的クラスタ割り当てはジェネレーティブ・アドバイザリアル・ネットワークを条件に、ローカル・プリエントとして機能する。
反復フィードバックループが確立され、クラスタ構造とインプット値の両方を忠実なサブグループ分布に向けて徐々に洗練する。
分散安定性を確保するため、CAGIはさらに、インスタンスレベルの再構築と分散レベルの正規化を組み合わせたマルチレベル最適化の目標を採用する。
15の代表的なベースラインを持つ14のベンチマークデータセットに対する大規模な実験は、CAGIの優位性を示している。
ソースコードは、https://github.com/supercocachii/CAGIで入手できる。
関連論文リスト
- Group-Aware Matrix Estimation and Latent Subspace Recovery [4.619828919345115]
Group-Aware Matrix Estimation (GAME) は、サブグループ単位の低ランク行列を重畳する凸推定器である。
GAMEはサブグループ認識の正規化によって再構成精度と潜在部分空間の忠実度が向上する構造的欠落機構において最も有益であることを示す。
論文 参考訳(メタデータ) (2026-05-19T23:22:32Z) - Semantic-based Distributed Learning for Diverse and Discriminative Representations [26.214742067718277]
大規模分散シナリオでは、ますます複雑なタスクはネットワーク間のよりインテリジェントなコラボレーションを要求する。
多様な表現と差別的な表現を両立させる分散学習フレームワークを提案する。
どちらの場合も、得られる最適解は理論的に差別的かつ多様な性質を維持することが証明される。
論文 参考訳(メタデータ) (2026-04-20T13:22:58Z) - Weight-Informed Self-Explaining Clustering for Mixed-Type Tabular Data [63.62853416081748]
WISEは表現、特徴重み付け、クラスタリング、解釈を統一するフレームワークである。
クラスタリングを駆動する同じプリミティブに根ざした、忠実で人間解釈可能な説明を生成する。
論文 参考訳(メタデータ) (2026-04-07T13:18:31Z) - You Can Trust Your Clustering Model: A Parameter-free Self-Boosting Plug-in for Deep Clustering [73.48306836608124]
DCBoostはパラメータフリーのプラグインで、現在のディープクラスタリングモデルのグローバルな特徴構造を強化するように設計されている。
本手法は, クラスタリング性能を効果的に向上することを目的としている。
論文 参考訳(メタデータ) (2025-11-26T09:16:36Z) - A structured regression approach for evaluating model performance across intersectional subgroups [53.91682617836498]
分散評価(disaggregated evaluation)は、AIフェアネスアセスメントにおける中心的なタスクであり、AIシステムのさまざまなサブグループ間でのパフォーマンスを測定することを目的としている。
非常に小さなサブグループであっても,信頼性の高いシステム性能推定値が得られることを示す。
論文 参考訳(メタデータ) (2024-01-26T14:21:45Z) - A Generalized Framework for Predictive Clustering and Optimization [18.06697544912383]
クラスタリングは強力で広く使われているデータサイエンスツールです。
本稿では,予測クラスタリングのための一般化最適化フレームワークを定義する。
また,大域的最適化のためにMILP(mixed-integer linear programming)を利用する共同最適化手法を提案する。
論文 参考訳(メタデータ) (2023-05-07T19:56:51Z) - Top-Down Deep Clustering with Multi-generator GANs [0.0]
ディープクラスタリング(DC)は、クラスタ分析に最適な埋め込み空間を学習する。
複数のジェネレータ(MGAN)を持つGANをベースとした新しい技術であるHC-MGANを提案する。
本手法は,MGANの各生成元が実データ分布のサブリージョンと相関するデータを生成する傾向にあるという観察に着想を得たものである。
論文 参考訳(メタデータ) (2021-12-06T22:53:12Z) - You Never Cluster Alone [150.94921340034688]
我々は、主流のコントラスト学習パラダイムをクラスタレベルのスキームに拡張し、同じクラスタに属するすべてのデータが統一された表現に寄与する。
分類変数の集合をクラスタ化代入信頼度として定義し、インスタンスレベルの学習トラックとクラスタレベルの学習トラックを関連付ける。
代入変数を再パラメータ化することで、TCCはエンドツーエンドでトレーニングされる。
論文 参考訳(メタデータ) (2021-06-03T14:59:59Z) - Towards Uncovering the Intrinsic Data Structures for Unsupervised Domain
Adaptation using Structurally Regularized Deep Clustering [119.88565565454378]
Unsupervised Domain Adapt (UDA) は、ターゲットドメイン上のラベルなしデータの予測を行う分類モデルを学ぶことである。
本稿では,対象データの正規化判別クラスタリングと生成クラスタリングを統合する構造的正規化深層クラスタリングのハイブリッドモデルを提案する。
提案するH-SRDCは, インダクティブ設定とトランスダクティブ設定の両方において, 既存の手法よりも優れている。
論文 参考訳(メタデータ) (2020-12-08T08:52:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。