論文の概要: A scalable version of MADD for big-data classification
- arxiv url: http://arxiv.org/abs/2607.08334v1
- Date: Thu, 09 Jul 2026 10:19:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.500569
- Title: A scalable version of MADD for big-data classification
- Title(参考訳): ビッグデータ分類のためのスケーラブルなMADD
- Abstract要約: 高次元、低サンプルサイズの状況では、MADD(Mean Absolute difference of Distances)と呼ばれるデータ駆動セミメトリックがこれらの問題を回避していることが知られている。
我々は,MADDのスケーラブルバージョンを提案し,その利点を保ちながら計算複雑性を大幅に低減する。
- 参考スコア(独自算出の注目度): 0.7837881800517111
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Distance-based classifiers are very popular, and the Euclidean distance is one of the most commonly used metrics in distance-based classifiers. However, classifiers based on the Euclidean distance often suffer in high-dimensional setups due to issues such as distance concentration, violation of neighborhood structures, and the presence of hubs. In high-dimension, low-sample-size (HDLSS) situations, a data-driven semi-metric called the Mean Absolute Difference of Distances (MADD) is known to circumvent these issues. But one major problem with MADD is that its computational complexity increases quadratically with the training sample size. As a result, the application of MADD becomes computationally challenging for big datasets that have both a high dimension as well as a large number of observations. In this paper, we propose a scalable version of MADD that significantly reduces its computational complexity while retaining its advantages. This speed-up is achieved by selecting a representative set during the computation of MADD. Further speed-ups are achieved by using the idea of Random Fourier Features, particularly when the sample size is very large. We establish that our proposed methods achieve performances similar to MADD but only at a fraction of its computing time, both theoretically as well as numerically. Our approach broadens the scope of MADD, allowing its use to big-data with a very large number of observations.
- Abstract(参考訳): 距離に基づく分類器は非常に人気があり、ユークリッド距離は距離に基づく分類器において最もよく使われる指標の1つである。
しかし, ユークリッド距離に基づく分類器は, 距離集中, 近傍構造違反, ハブの存在などの問題により, しばしば高次元的な設定に悩まされる。
高次元、低サンプルサイズ(HDLSS)の状況では、MADD(Mean Absolute difference of Distances)と呼ばれるデータ駆動セミメトリックがこれらの問題を回避していることが知られている。
しかし、MADDの大きな問題は、その計算複雑性がトレーニングサンプルサイズとともに2次的に増加することである。
結果として、MADDの適用は、高次元と多数の観測値の両方を持つ大きなデータセットに対して、計算的に困難になる。
本稿では,MADDのスケーラブルなバージョンを提案し,その利点を保ちながら計算複雑性を大幅に低減する。
このスピードアップは、MADDの計算中に代表セットを選択することで達成される。
さらなるスピードアップは、特にサンプルサイズが非常に大きい場合、ランダムフーリエ特徴(Random Fourier Features)というアイデアを使用することで達成される。
提案手法はMADDに類似した性能を実現するが,理論的にも数値的にも,計算時間のごく一部でしか達成できない。
提案手法はMADDの範囲を広くし,多数の観測値を持つビッグデータの利用を可能にした。
関連論文リスト
- High-dimensional Semi-supervised Classification via the Fermat Distance [0.0]
ラベル付きデータが大量だがラベル付きデータが限られている半教師付き分類は、機械学習アプリケーションでしばしば発生する。
重み付き$k$-nearest neighbors(NN)分類器と多次元スケーリング(MDS)誘導分類器を提案する。
我々は,Fermat距離の推定から生じる誤差が,プールしたサンプルサイズとともに指数関数的に減衰することを示し,ラベル付きデータの有用性を明示的に定量化する。
論文 参考訳(メタデータ) (2026-04-26T07:28:21Z) - Model-Based and Sample-Efficient AI-Assisted Math Discovery in Sphere Packing [51.30643063554434]
上界の先導手法である三点法は、大高精度半確定プログラム(SDP)の解法に問題を還元する。
我々は、SDP構成を、ポリシーが一連の許容成分からSDP定式化を組み立てる逐次決定過程、SDPゲームとして定式化する。
従来からある幾何学的問題において,モデルに基づく探索が計算の進歩を推し進めることができることを示す。
論文 参考訳(メタデータ) (2025-12-04T14:11:52Z) - Bias Detection via Maximum Subgroup Discrepancy [2.236957801565796]
距離の概念である最大部分群離散性(MSD)を提案する。
この計量において、2つの分布が概して、すべての特徴部分群に対して相違が低ければ近い。
サンプルの複雑さが特徴数で線形であることを示し、実用的な用途で実現可能であることを示す。
論文 参考訳(メタデータ) (2025-02-04T11:01:03Z) - Adaptive Sampled Softmax with Inverted Multi-Index: Methods, Theory and Applications [79.53938312089308]
MIDX-Samplerは、逆多重インデックスアプローチに基づく新しい適応型サンプリング戦略である。
本手法は, サンプリングバイアス, 勾配バイアス, 収束速度, 一般化誤差境界などの重要な問題に対処するため, 厳密な理論的解析によって裏付けられている。
論文 参考訳(メタデータ) (2025-01-15T04:09:21Z) - Multiscale Dubuc: A New Similarity Measure for Time Series [1.024113475677323]
マルチスケールDubuc距離測度を導入し、それがメートル法であることを証明する。
UCR時系列分類アーカイブから95のデータセットを使用して、MDDのパフォーマンスをEuD、LCSS、DTWと比較する。
我々の実験によると、MDDの全体的な成功はケース固有のカスタマイズなしで、データセットごとのウィンドウサイズを最適化したDTWに匹敵する。
論文 参考訳(メタデータ) (2024-11-15T18:38:18Z) - Scaling Riemannian Diffusion Models [68.52820280448991]
非自明な多様体上の高次元タスクにスケールできることを示す。
我々は、$SU(n)$格子上のQCD密度と高次元超球面上の対照的に学習された埋め込みをモデル化する。
論文 参考訳(メタデータ) (2023-10-30T21:27:53Z) - Bayesian Hyperbolic Multidimensional Scaling [2.5944208050492183]
低次元多様体が双曲型であるとき、多次元スケーリングに対するベイズ的アプローチを提案する。
ケース制御可能性近似は、より大きなデータ設定における後部分布からの効率的なサンプリングを可能にする。
提案手法は,シミュレーション,標準基準データセット,インディアン村のネットワークデータ,およびヒトの遺伝子発現データを用いて,最先端の代替手法に対して評価する。
論文 参考訳(メタデータ) (2022-10-26T23:34:30Z) - AdAUC: End-to-end Adversarial AUC Optimization Against Long-tail
Problems [102.95119281306893]
我々は、AUCを最適化するための敵の訓練方法を探求するための早期トライアルを提示する。
我々は、AUC最適化問題をサドル点問題として再構成し、目的がインスタンスワイズ関数となる。
我々の分析は, min-max問題の勾配を計算して, 逆例を生成するアルゴリズムが求められているため, 既存の研究と異なる。
論文 参考訳(メタデータ) (2022-06-24T09:13:39Z) - (k, l)-Medians Clustering of Trajectories Using Continuous Dynamic Time
Warping [57.316437798033974]
本研究では,トラジェクトリの集中型クラスタリングの問題について考察する。
我々はDTWの連続バージョンを距離測定として使用することを提案し、これをCDTW(Continuous dynamic time warping)と呼ぶ。
一連の軌道から中心を計算し、その後反復的に改善する実践的な方法を示す。
論文 参考訳(メタデータ) (2020-12-01T13:17:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。