論文の概要: EMS Coreset: An Efficient Expectation-Maximization Algorithm for Sinkhorn Coreset
- arxiv url: http://arxiv.org/abs/2608.16101v1
- Date: Mon, 17 Aug 2026 04:46:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.540563
- Title: EMS Coreset: An Efficient Expectation-Maximization Algorithm for Sinkhorn Coreset
- Title(参考訳): EMS Coreset: Sinkhorn Coresetの効率的な期待最大化アルゴリズム
- Authors: Haoyun Yin, Chuanhui Liu, Xiao Wang,
- Abstract要約: Coresetsは、大規模なデータセットを、効率的な下流学習のために、小さくて代表的なサブセットに蒸留する。
非一様コアセット重みを許容することにより、エントロピック規則化されたOT結合のクローズドフォーム更新を可能にするスケーラブルなシンクホーンコアセット法を導入する。
我々は、選択した測度とデータ摂動に対するリプシッツ安定性の整合性を確立し、精度と堅牢性を保証する。
- 参考スコア(独自算出の注目度): 4.297295761793895
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coresets distill large datasets into small, representative subsets for efficient downstream learning. Yet Optimal Transport (OT)-based selection typically requires intensive computation of transport plans, limiting scalability. We introduce a scalable Sinkhorn coreset method that permits closed-form updates of the entropically regularized OT coupling by allowing non-uniform coreset weights. This produces centroids that generalize k-means via soft assignments. We establish asymptotic consistency of the selected measure and Lipschitz stability to data perturbations, providing accuracy and robustness guarantees. Across synthetic and real-world benchmarks, the proposed method achieves competitive or improved approximation quality while substantially reducing runtime compared to Wasserstein- and standard Sinkhorn-based coreset selection, especially at large scale.
- Abstract(参考訳): Coresetsは、大規模なデータセットを、効率的な下流学習のために、小さくて代表的なサブセットに蒸留する。
しかし、最適輸送(OT)ベースの選択は通常、スケーラビリティを制限するため、輸送計画の集中的な計算を必要とする。
非一様コアセット重みを許容することにより、エントロピック規則化されたOT結合のクローズドフォーム更新を可能にするスケーラブルなシンクホーンコアセット法を導入する。
これにより、k-平均をソフトな代入によって一般化するセントロイドが生成される。
我々は、選択した測度とデータ摂動に対するリプシッツ安定性の漸近一貫性を確立し、精度と堅牢性を保証する。
合成および実世界のベンチマーク全体にわたって、提案手法は、特に大規模において、ワッサーシュタインおよび標準シンクホーンベースのコアセット選択と比較して、実行時間を大幅に削減しつつ、競合的あるいは改善された近似品質を達成する。
関連論文リスト
- From Atoms to Entropy: Optimal Noise Allocation for Diffusion Training in the Convex Regime [52.459513910242485]
拡散訓練における最適な雑音レベルアロケーションを研究するための一般統計フレームワークを開発する。
最適化されたトレーニングスケジュールは、有限個のノイズレベルに集中した原子最小値を持つことを示す。
次に,大規模実験におけるエントロピック・スケジュールの評価を行った。
論文 参考訳(メタデータ) (2026-07-10T20:59:06Z) - FAST: Topology-Aware Frequency-Domain Distribution Matching for Coreset Selection [19.148841575715746]
コアセット選択はデータセットをコンパクトで代表的なサブセットに圧縮し、ディープニューラルネットワークをトレーニングする際のエネルギーと計算負担を軽減する。
DNNフリーな分散マッチングコアセット選択フレームワークであるFASTを提案する。
FASTは評価された全てのベンチマークで最先端のコアセット選択法を著しく上回り、平均精度は9.12%向上した。
論文 参考訳(メタデータ) (2025-11-22T09:24:57Z) - Coreset selection for the Sinkhorn divergence and generic smooth divergences [0.8594140167290099]
CO2は、一般的な滑らかな発散に対して凸重み付けされたコアセットを効率よく生成するアルゴリズムである。
十分な正規損失と2次近似の局所同値性を示し、コアセット選択問題を最大値の誤差最小化に還元する。
我々はシンクホーンの発散にCO2を適用し、ランダムサンプリングの近似保証に適合するために、多変量的に多くのデータポイントを必要とする新しいサンプリング手順を提供する。
論文 参考訳(メタデータ) (2025-04-28T18:54:53Z) - SeWA: Selective Weight Average via Probabilistic Masking [51.015724517293236]
より良く、より高速な収束を達成するためには、ほんの数ポイントしか必要としないことを示す。
離散選択問題を連続的な部分集合最適化フレームワークに変換する。
両凸画像チェックポイントの値よりもシャープなSeWAの安定性境界を導出する。
論文 参考訳(メタデータ) (2025-02-14T12:35:21Z) - Tuning-Free Coreset Markov Chain Monte Carlo via Hot DoG [14.360996967498]
学習速度のない勾配最適化手法であるHot-start Distance over Gradient (Hot DoG)を提案する。
本研究では,Hot DoGによるコアセット重みの収束に関する理論的解析を行った。
また,Hot DoGが他の学習時間自由勾配法よりも高品質な後部近似を提供することを示す実験結果も提供する。
論文 参考訳(メタデータ) (2024-10-24T17:59:23Z) - Refined Coreset Selection: Towards Minimal Coreset Size under Model
Performance Constraints [69.27190330994635]
コアセットの選択は、計算コストの削減とディープラーニングアルゴリズムのデータ処理の高速化に強力である。
本稿では,モデル性能とコアセットサイズに対する最適化優先順序を維持する革新的な手法を提案する。
実験的に、広範な実験によりその優位性が確認され、しばしばより小さなコアセットサイズでモデル性能が向上する。
論文 参考訳(メタデータ) (2023-11-15T03:43:04Z) - STORM+: Fully Adaptive SGD with Momentum for Nonconvex Optimization [74.1615979057429]
本研究では,スムーズな損失関数に対する期待値である非バッチ最適化問題について検討する。
我々の研究は、学習率と運動量パラメータを適応的に設定する新しいアプローチとともに、STORMアルゴリズムの上に構築されている。
論文 参考訳(メタデータ) (2021-11-01T15:43:36Z) - Fast Distributionally Robust Learning with Variance Reduced Min-Max
Optimization [85.84019017587477]
分散的ロバストな教師付き学習は、現実世界のアプリケーションのための信頼性の高い機械学習システムを構築するための重要なパラダイムとして登場している。
Wasserstein DRSLを解くための既存のアルゴリズムは、複雑なサブプロブレムを解くか、勾配を利用するのに失敗する。
我々はmin-max最適化のレンズを通してwaserstein drslを再検討し、スケーラブルで効率的に実装可能な超勾配アルゴリズムを導出する。
論文 参考訳(メタデータ) (2021-04-27T16:56:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。