論文の概要: Synthetic minority data is redundant or invalid: a data-dependent validity theory and a de-biased test
- arxiv url: http://arxiv.org/abs/2607.20787v1
- Date: Wed, 22 Jul 2026 23:19:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.233339
- Title: Synthetic minority data is redundant or invalid: a data-dependent validity theory and a de-biased test
- Title(参考訳): 合成マイノリティデータは冗長か無効か:データ依存妥当性理論と非バイアステスト
- Abstract要約: 20年間、クラス不均衡学習の標準的な治療法は、合成マイノリティの例を作成することである。
有効性はデータの性質であって,その方法ではないことを証明します。
監査をpipインストール可能なテストとしてリリースし、証明の負担を逆転させます。
- 参考スコア(独自算出の注目度): 0.5625796693054093
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: For two decades, the standard remedy for class-imbalanced learning has been to fabricate synthetic minority examples, and the standard evidence of their validity has been a check that cannot fail: synthetic points are scored against the very data that generated them. We de-bias the check. Validity becomes a population quantity -- the probability that a synthetic point truly belongs to the minority class -- with a consistent estimator that scores synthetic points against withheld real data. Where held-out ground truth is available, the classical test underestimates true invalidity in 96-99% of method-by-imbalance-ratio cells, while the de-biased estimator tracks it closely. We prove validity is a property of the data, not the method: class overlap sets an invalidity floor no faithful generator escapes, making oversampling redundant where classes separate and invalid where they overlap. Across 91 methods, three classifiers, and datasets spanning medicine and finance -- including a generator engineered to pass the classical check -- none clears both bars: gains over the best trivial baseline are noise-thin (median below 0.01 F1, a decision threshold's reach), and most damage calibration. We release the audit as a pip-installable test and flip the burden of proof: synthetic minority data must now demonstrate, on the data at hand, both validity and information gain.
- Abstract(参考訳): 20年間、クラス不均衡学習の標準的な治療法は、合成マイノリティの例を作成することであり、それらの妥当性の標準的な証拠は、失敗できないチェックである:合成ポイントは、それらを生成するデータに対してスコアされる。
私たちは小切手を嫌悪する。
正当性は、合成点が真の少数民族に属する確率である人口量となり、保存されていない実データに対して合成点をスコアする一貫した推定器となる。
ホールドアウト基底真理が利用できる場合、古典的なテストはメソッド・バイ・アンバランス比の96-99%で真の無効性を過小評価し、非バイアス推定器はそれを綿密に追跡する。
クラスオーバーラップは、無効なフロアを設定し、忠実なジェネレータがエスケープしない。
91の方法、分類器3つ、ファイナンスにまたがるデータセット ― 古典的なチェックをパスするために作られたジェネレータを含む ― は、両方のバーをクリアしない。
我々は、検査をピップインストール可能なテストとしてリリースし、証明の負担を正す: 合成マイノリティデータは、そのデータに基づいて、妥当性と情報ゲインの両方を証明しなければならない。
関連論文リスト
- Should I Use This Synthetic Dataset for Training? How to Test with Minimal Real Data [73.19814469893088]
デジタルツインと学習された世界モデルは、エンジニアリングシステムにおける人工知能(AI)モデルのトレーニングに利用可能な、少ない実際のデータセットを増大させる合成データを生成するために、ますます使われています。
本稿では,拡張データセットのトレーニングが真の,人口レベルのパフォーマンスを向上する一方で,実際のテストデータポイントを可能な限り少なく消費するかどうかを論じる。
合成データ分類タスク、DT支援無線パケットスケジューリングタスク、および無線マップ予測タスクにおいて、aeSFTは平均ベースのシーケンシャルテストよりもはるかに少ない実検サンプルを用いて有用な合成データを識別することを示す。
論文 参考訳(メタデータ) (2026-08-28T07:05:38Z) - Demographically-Conditioned Synthetic Medical Images for Bias Mitigation and Bias Detection in Disease Classifiers [3.5347586732342435]
人口動態条件の合成ジェネレータは、トレーニング側のバイアスを緩和し、評価側のバイアスを検出することができる。
バイアス緩和(トレーニング)において、人口統計学的にバランスの取れた合成コホートは、前訓練として最も有用であり、関節強化としてではない。
合成推定器は、よく動力のある実オラクルのサブグループランキングを再現する。
論文 参考訳(メタデータ) (2026-07-16T13:36:48Z) - The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection [4.921591758479804]
トレーニングデータメンバーシップを検出する統計ツールは存在するが、ほとんど制御された学術体制でのみ検証されている。
分散シフトとスケール制約という,未調査の2つの障害モードを特定します。
335点中199点しか正しい結果が得られていない。
論文 参考訳(メタデータ) (2026-06-02T08:21:22Z) - Bias-Corrected Data Synthesis for Imbalanced Learning [18.33651035966011]
正のサンプルが負のサンプルに比べてわずかに比例する不均衡データは、分類問題において偽の正と偽の負の比率のバランスをとることが困難である。
この課題に対処するための一般的なアプローチは、マイノリティグループのための合成データを生成し、次に観察データと合成データの両方で分類モデルを訓練することである。
本稿では,合成データから得られるバイアスに対処し,多数派からの情報を借りることで,このバイアスに対する一貫した評価を行う。
論文 参考訳(メタデータ) (2025-10-30T00:52:25Z) - Practical estimation of the optimal classification error with soft labels and calibration [47.001801756596926]
我々は,ベイズ誤差,最適誤差率を推定するために,ソフトラベルを用いた以前の研究を拡張した。
我々は、破損したソフトラベルによる推定という、より困難な問題に取り組みます。
私たちのメソッドはインスタンスフリーです。つまり、入力インスタンスへのアクセスを前提としません。
論文 参考訳(メタデータ) (2025-05-27T06:04:57Z) - Active Data Sampling and Generation for Bias Remediation [0.0]
トレーニング済みのクラスを微調整する際、不公平な分類を補うために、サンプリングとデータ生成の混合戦略が提案されている。
視覚的セマンティック・ロール・ラベリングのためのDeep Modelsのケーススタディとして、提案手法は90/10の不均衡から始まるシミュレートされたジェンダーバイアスを完全に解決することができる。
論文 参考訳(メタデータ) (2025-03-26T10:42:15Z) - Practical Kernel Tests of Conditional Independence [33.275712245547815]
SplitKCIは、データ分割に基づくカーネルベースの条件独立テストのためのバイアス制御の自動化方法である。
提案手法は,テストパワーを犠牲にすることなく,KCIのテストレベル制御を大幅に改善することを示す。
論文 参考訳(メタデータ) (2024-02-20T18:07:59Z) - Boosting Differentiable Causal Discovery via Adaptive Sample Reweighting [62.23057729112182]
異なるスコアに基づく因果探索法は観測データから有向非巡回グラフを学習する。
本稿では,Reweighted Score関数ReScoreの適応重みを動的に学習することにより因果発見性能を向上させるためのモデルに依存しないフレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-06T14:49:59Z) - On Comparing Fair Classifiers under Data Bias [42.43344286660331]
本研究では,データ偏差の変化が公正分類器の精度と公平性に及ぼす影響について検討する。
我々の実験は、既存のフェアネスダッシュボードにデータバイアスリスクの尺度を統合する方法を示している。
論文 参考訳(メタデータ) (2023-02-12T13:04:46Z) - MaxMatch: Semi-Supervised Learning with Worst-Case Consistency [149.03760479533855]
半教師付き学習(SSL)のための最悪ケース整合正則化手法を提案する。
本稿では,ラベル付きトレーニングデータとラベル付きトレーニングデータとを別々に比較した経験的損失項からなるSSLの一般化について述べる。
この境界によって動機づけられたSSLの目的は、元のラベルのないサンプルと、その複数の拡張版との最大の矛盾を最小限に抑えるものである。
論文 参考訳(メタデータ) (2022-09-26T12:04:49Z) - Equivariance and Invariance Inductive Bias for Learning from
Insufficient Data [65.42329520528223]
不十分なデータがモデルを、通常テストとは異なる限られたトレーニング環境にバイアスしやすくする理由が示されています。
従来のIRMにおける環境アノテーションの欠如を効果的に解決するクラスワイド不変リスク最小化(IRM)を提案する。
論文 参考訳(メタデータ) (2022-07-25T15:26:19Z) - Fair Densities via Boosting the Sufficient Statistics of Exponential
Families [72.34223801798422]
フェアネスのためのデータ前処理にブースティングアルゴリズムを導入する。
私たちのアプローチは、最小限の公平性を確保しながら、より良いデータフィッティングへとシフトします。
実世界のデータに結果の質を示す実験結果が提示される。
論文 参考訳(メタデータ) (2020-12-01T00:49:17Z) - Gamma distribution-based sampling for imbalanced data [6.85316573653194]
不均衡なクラス分布は、医学診断、不正検出など、多くの分野において一般的な問題である。
本稿では,マイノリティクラスインスタンスのインテリジェントな再サンプリングを通じて,データ中のクラス分布のバランスをとる新しい手法を提案する。
論文 参考訳(メタデータ) (2020-09-22T06:39:13Z) - Cross-validation Confidence Intervals for Test Error [83.67415139421448]
この研究は、クロスバリデーションのための中心極限定理と、学習アルゴリズムの弱い安定性条件下での分散の一貫した推定器を開発する。
結果は、一般的な1対1のクロスバリデーションの選択にとって、初めてのものだ。
論文 参考訳(メタデータ) (2020-07-24T17:40:06Z) - Good Classifiers are Abundant in the Interpolating Regime [64.72044662855612]
補間分類器間のテストエラーの完全な分布を正確に計算する手法を開発した。
テストエラーは、最悪の補間モデルのテストエラーから大きく逸脱する、小さな典型的な$varepsilon*$に集中する傾向にある。
以上の結果から,統計的学習理論における通常の解析手法は,実際に観測された優れた一般化性能を捉えるのに十分な粒度にはならない可能性が示唆された。
論文 参考訳(メタデータ) (2020-06-22T21:12:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。