論文の概要: Few-Shot Resampling for Scalable Statistically-Sound Data Mining
- arxiv url: http://arxiv.org/abs/2606.11235v1
- Date: Fri, 29 May 2026 09:00:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.856182
- Title: Few-Shot Resampling for Scalable Statistically-Sound Data Mining
- Title(参考訳): スケーラブルな統計的データマイニングのためのFew-Shot Resampling
- Abstract要約: データマイニング結果の統計的意義を評価するための,単純かつ効果的な再サンプリングに基づくアプローチであるFewRSを紹介した。
FewRSは、データマイニング結果の品質を示すテスト統計の最大偏差に縛られた小説の導出に基づいている。
FewRSは、非常に少数の再サンプリングされたデータセットを生成し、分析する必要があることを証明し、幅広い適用性を備えた高度にスケーラブルなアプローチをもたらす。
- 参考スコア(独自算出の注目度): 9.12507864905732
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: A key step in knowledge discovery is the evaluation of data mining results. In several applications, including pattern mining, graph analysis, and others, this step includes the evaluation of the statistical significance of the results, to avoid spurious discoveries due only to noise or random fluctuations in the data. While specialized procedures have been developed for some specific applications, resampling-based approaches are widely used, in particular for complex analyses where analytical results cannot be derived. However, current resampling-based approaches require the generation and analysis of thousands of resampled datasets, and are therefore impractical for large datasets or computationally intensive analyses. In this paper, we introduce FewRS, a simple and effective resampling-based approach to assess the statistical significance of data mining results with rigorous guarantees on the probability of false discoveries. Our approach can be used in every situation where resampling-based approaches are applied. FewRS builds on our derivation of a novel bound to the supremum deviation of test statistics representing the quality of data mining results. We prove that FewRS needs to generate and analyze an extremely small number of resampled datasets, leading to a highly scalable approach with wide applicability. We test our approach on common tasks such as pattern mining and network analysis. In all cases, our approach results in a reduction of up to two orders of magnitude in running time compared to the state of the art, while preserving high statistical power, enabling the statistical validation of data mining results on large-scale real-world datasets.
- Abstract(参考訳): 知識発見の重要なステップは、データマイニング結果の評価である。
パターンマイニング、グラフ解析など、いくつかの応用において、このステップは結果の統計的意義を評価することを含み、データのノイズやランダムな変動による急激な発見を避ける。
いくつかの特定の用途で特殊な手順が開発されているが、特に解析結果が導出できない複雑な解析において、再サンプリングに基づくアプローチが広く用いられている。
しかし、現在の再サンプリングベースのアプローチでは何千もの再サンプリングデータセットの生成と分析が必要であり、従って大規模なデータセットや計算集約的な分析には実用的ではない。
本稿では,データマイニング結果の統計的意義を虚偽発見の確率に厳密な保証とともに評価するための,単純かつ効果的な再サンプリングに基づくアプローチであるFewRSを紹介する。
我々のアプローチは、再サンプリングに基づくアプローチを適用するあらゆる状況で利用できる。
FewRSは、データマイニング結果の品質を示すテスト統計の最大偏差に縛られた小説の導出に基づいている。
FewRSは、非常に少数の再サンプリングされたデータセットを生成し、分析する必要があることを証明し、幅広い適用性を備えた高度にスケーラブルなアプローチをもたらす。
パターンマイニングやネットワーク分析などの共通課題に対して,本手法を検証した。
いずれにせよ,我々の手法は,大規模実世界のデータセット上でのデータマイニング結果の統計的検証を可能にするとともに,最先端の統計力を保ちながら,実行時間の最大2桁の削減を実現している。
関連論文リスト
- Analytical Survey of Learning with Low-Resource Data: From Analysis to Investigation [192.53529928861818]
高リソースデータによる学習は人工知能(AI)において大きな成功を収めた
しかし、データアノテーションやモデルトレーニングに関連するコストは依然として大きい。
本調査では,低リソースデータからの学習に伴う一般化誤差とラベル複雑性を分析するために,アクティブサンプリング理論を用いた。
論文 参考訳(メタデータ) (2025-10-10T03:15:42Z) - Valid Inference with Imperfect Synthetic Data [39.10587411316875]
モーメントの一般化法に基づく新しい推定器を提案する。
合成データのモーメント残差と実データのモーメント間の相互作用は、対象パラメータの推定を大幅に改善できることがわかった。
論文 参考訳(メタデータ) (2025-08-08T18:32:52Z) - Model-agnostic Mitigation Strategies of Data Imbalance for Regression [0.0]
データ不均衡は、回帰タスクにおいて広範囲にわたる課題として持続し、モデルパフォーマンスのバイアスを導入し、予測信頼性を損なう。
既存のサンプリング手法を構築・改善する高度な緩和手法を提案する。
モデルのアンサンブル(不均衡緩和で訓練されたモデルと、非バランスで訓練されたモデル)の構築は、これらの負の効果を著しく減少させることを実証する。
論文 参考訳(メタデータ) (2025-06-02T09:46:08Z) - Debiasing Synthetic Data Generated by Deep Generative Models [40.165159490379146]
合成データ生成のための深部生成モデル(DGM)は、合成データ解析においてバイアスと不正確性を誘導する。
本稿では,DGMが生成する合成データを,特定のデータ解析のためにターゲットとする新たな戦略を提案する。
提案手法は, 偏差を考慮し, 収束率を向上し, 容易に近似された大きなサンプル分散を持つ推定器の計算を容易にする。
論文 参考訳(メタデータ) (2024-11-06T19:24:34Z) - Minimally Supervised Learning using Topological Projections in
Self-Organizing Maps [55.31182147885694]
自己組織化マップ(SOM)におけるトポロジカルプロジェクションに基づく半教師付き学習手法を提案する。
提案手法は,まずラベル付きデータ上でSOMを訓練し,最小限のラベル付きデータポイントをキーベストマッチングユニット(BMU)に割り当てる。
提案した最小教師付きモデルが従来の回帰手法を大幅に上回ることを示す。
論文 参考訳(メタデータ) (2024-01-12T22:51:48Z) - Soft Random Sampling: A Theoretical and Empirical Analysis [59.719035355483875]
ソフトランダムサンプリング(SRS)は、大量のデータを扱う際に、効率的なディープニューラルネットワークに対して単純だが効果的なアプローチである。
それは、各エポックに設定された各データセットから、ランダムに置換された均一な速度を選択する。
実世界の産業規模で重要な競争力を持つ、強力で競争力のある戦略であることが示されている。
論文 参考訳(メタデータ) (2023-11-21T17:03:21Z) - Evaluating Synthetic Tabular Data Generated To Augment Small Sample Datasets [0.0]
本研究は,小サンプルデータセットの増大にともなう合成データの評価手法を提案する。
実験の結果,大域的測度とトポロジカル測度との間には大きな矛盾が認められた。
単一の計量が分布的および構造的類似性の両方を確実に捉えることはない。
論文 参考訳(メタデータ) (2022-11-19T18:18:52Z) - CEDAR: Communication Efficient Distributed Analysis for Regressions [9.50726756006467]
患者レベルのデータを共有することなく、複数のEHRデータベース上での分散学習への関心が高まっている。
本稿では,局所的な最適推定値を集約する通信効率のよい新しい手法を提案する。
本稿では,統計的推測法と差分プライバシーに関する理論的検討を行い,シミュレーションおよび実データ解析におけるその性能評価を行う。
論文 参考訳(メタデータ) (2022-07-01T09:53:44Z) - Combining Observational and Randomized Data for Estimating Heterogeneous
Treatment Effects [82.20189909620899]
不均一な治療効果を推定することは、多くの領域において重要な問題である。
現在、現存するほとんどの作品は観測データにのみ依存している。
本稿では、大量の観測データと少量のランダム化データを組み合わせることで、不均一な処理効果を推定する。
論文 参考訳(メタデータ) (2022-02-25T18:59:54Z) - Differential privacy and robust statistics in high dimensions [49.50869296871643]
高次元Propose-Test-Release (HPTR) は指数的メカニズム、頑健な統計、Propose-Test-Release メカニズムという3つの重要なコンポーネントの上に構築されている。
本論文では,HPTRが複数のシナリオで最適サンプル複雑性をほぼ達成していることを示す。
論文 参考訳(メタデータ) (2021-11-12T06:36:40Z) - RIFLE: Imputation and Robust Inference from Low Order Marginals [10.082738539201804]
我々は,不備なデータの存在下での回帰と分類のための統計的推論フレームワークを開発する。
我々のフレームワークであるRIFLEは、基礎となるデータ分布の低次モーメントを対応する信頼区間で推定し、分布的に堅牢なモデルを学ぶ。
実験の結果,RIFLEは,欠落値の割合が高い場合や,データポイント数が比較的小さい場合には,他のベンチマークアルゴリズムよりも優れていることがわかった。
論文 参考訳(メタデータ) (2021-09-01T23:17:30Z) - Heavy-tailed Streaming Statistical Estimation [58.70341336199497]
ストリーミング$p$のサンプルから重み付き統計推定の課題を考察する。
そこで我々は,傾きの雑音に対して,よりニュアンスな条件下での傾きの傾きの低下を設計し,より詳細な解析を行う。
論文 参考訳(メタデータ) (2021-08-25T21:30:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。