論文の概要: On the Reliability of Generative Augmentation: A Wasserstein-Based Theoretical and Empirical Study
- arxiv url: http://arxiv.org/abs/2609.01410v1
- Date: Tue, 01 Sep 2026 15:30:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.803733
- Title: On the Reliability of Generative Augmentation: A Wasserstein-Based Theoretical and Empirical Study
- Title(参考訳): 世代拡大の信頼性について--ワッサーシュタインに基づく理論的・実証的研究
- Authors: Chathurika S Abeykoon, Mathias Nthiani Muia, Mallory Goldstein,
- Abstract要約: 本研究では,条件付き生成促進のための統計的枠組みを開発し,その分類リスクへの影響を解析する。
得られたリスク歪みは, 拡張強度とクラス条件ワッサーシュタインの相違により制御されることを示す。
条件付きGANと条件付きWGAN-GP拡張を用いた二項・多クラス不均衡分類タスクのフレームワークの評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative data augmentation is widely used to mitigate class imbalance, yet its theoretical effect on downstream generalization remains poorly understood. In this work, we develop a statistical framework for conditional generative augmentation and analyze its impact on classification risk. We formalize augmentation as a distribution-mixing process and show that the resulting risk distortion is controlled by both the augmentation strength and the class-conditional Wasserstein discrepancy between real and generated distributions. We further derive a capacity-dependent generalization bound based on Rademacher complexity, revealing an explicit trade-off between hypothesis complexity, augmentation intensity, and generative fidelity. Empirically, we evaluate the framework on binary and multiclass imbalanced classification tasks using Conditional GAN and Conditional WGAN-GP augmentation. Across datasets, CWGAN-GP consistently achieves lower Wasserstein discrepancies than CGAN, indicating improved distributional fidelity. However, improved fidelity does not necessarily translate into superior classification performance, with classical oversampling methods often remaining competitive. These findings support the central theoretical prediction that augmentation reliability is governed by distributional approximation error rather than predictive performance alone. Overall, this work establishes generative augmentation as a distributional perturbation process whose reliability can be quantified through Wasserstein-based measures and supported by finite-sample generalization guarantees. The proposed framework provides a principled foundation for evaluating synthetic data quality beyond classification accuracy alone.
- Abstract(参考訳): 生成的データ拡張は、クラス不均衡を軽減するために広く用いられているが、下流の一般化に対する理論的効果はよく分かっていない。
本研究では,条件付き生成促進のための統計的枠組みを開発し,その分類リスクに与える影響を解析する。
我々は,分散混合過程として拡張を形式化し,結果として生じるリスク歪みが,実分布と生成分布の間の拡張強度とクラス条件ワッサーシュタインの相違によって制御されることを示す。
さらに、Rademacher複雑性に基づくキャパシティ依存の一般化を導出し、仮説の複雑性、増大強度、生成的忠実さの間の明確なトレードオフを明らかにする。
実験的に,条件付きGANと条件付きWGAN-GP拡張を用いた二分法および多クラス不均衡分類タスクのフレームワークの評価を行った。
データセット全体にわたって、CWGAN-GPは、CGANよりも低いワッサースタインの差を一貫して達成し、分布の忠実度が向上したことを示している。
しかし、改良された忠実さが必ずしも優れた分類性能に変換されるとは限らないため、古典的なオーバーサンプリング手法は競争力を維持することがしばしばある。
これらの知見は、増大信頼性は、予測性能のみでなく分布近似誤差によって制御されるという中心的な理論的予測を支持する。
全体として、この研究は、ワッサーシュタインに基づく測度によって信頼性を定量化でき、有限サンプル一般化保証によって支えられる分布摂動過程として、生成的増大を確立する。
提案するフレームワークは,分類精度以外にも,合成データ品質を評価するための基本的基盤を提供する。
関連論文リスト
- Hierarchical Exponential-Gaussian Mixtures for Watch-Time Distribution Prediction [74.05279072166697]
Exponential-Gaussian Mixture Network (EGMN) は完全な条件WT分布をモデル化する。
EGMNは分散崩壊、コンポーネントの冗長性、不活性成分に弱い。
本稿では,これらの故障モードに対処する階層型指数-ガウス混合(HEGM)モデルを提案する。
論文 参考訳(メタデータ) (2026-08-24T15:06:18Z) - Generalization and Trade-off in Adversarial Training: An RKHS Perspective via Kernel Integral Operators [16.801544027052138]
敵の攻撃からモデルを保護するための強力なアプローチとして、敵の訓練が登場した。
本稿では,ロバストネス再現カーネルHilbert空間(RKHS)フレームワークにおける,関連するカーネル積分演算子による逆トレーニングについて検討する。
混合ロバスト性項からノイズ寄与を推定・除去する2段階のノイズ除去手法を提案する。
論文 参考訳(メタデータ) (2026-07-30T10:43:29Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Robust Regression with Adaptive Contamination in Response: Optimal Rates and Computational Barriers [65.58071581164043]
本研究では, 共変剤を清潔にし, 応答を適応的に劣化させる汚染モデルの下で, 頑健な回帰について検討する。
本研究では,ハマー汚染下で達成可能なものよりも優れた推定率を持つ推定器を構築するために,追加情報を慎重に活用できることを示す。
情報理論の観点からは、ハマーモデルよりも改善されているにもかかわらず、この問題が強い情報計算ギャップを示すという公式な証拠を提供する。
論文 参考訳(メタデータ) (2026-04-05T19:07:24Z) - CausalWrap: Model-Agnostic Causal Constraint Wrappers for Tabular Synthetic Data [4.08271266107383]
CausalWrapは、事前訓練されたベースジェネレータに部分的な因果知識を注入するモデルに依存しないラッパーである。
CWは、ベースジェネレータからのサンプルに適用された軽量で微分可能なポストホック補正マップを学習する。
CWは多様なベースジェネレータ間の因果性を改善する。
論文 参考訳(メタデータ) (2026-03-02T15:59:46Z) - Uncertainty in Federated Granger Causality: From Origins to Systemic Consequences [3.122408196953971]
Granger Causality (GC)は時系列データから因果構造を学ぶための厳密なフレームワークを提供する。
フェデレーションGCアルゴリズムは因果関係を決定論的に推定し、不確実性を無視するのみである。
本稿では,不確実性を厳密に定量化するための最初の手法を確立する。
論文 参考訳(メタデータ) (2026-02-13T15:12:18Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - Federated Generalised Variational Inference: A Robust Probabilistic Federated Learning Framework [12.454538785810259]
FedGVIは確率的フェデレートラーニング(FL)フレームワークで、事前およびおそらく誤特定に対して堅牢である。
固定点収束、キャビティ分布の最適性、そして確率的不特定性に対する証明可能なロバスト性の観点から理論的解析を行う。
論文 参考訳(メタデータ) (2025-02-02T16:39:37Z) - Benign Overfitting in Out-of-Distribution Generalization of Linear Models [19.203753135860016]
我々は、アウト・オブ・ディストリビューション(OOD)体制における良心過剰の理解に向けて、最初の一歩を踏み出した。
我々は、標準的な隆起回帰において良性過剰適合が生じることを証明する非漸近保証を提供する。
また、より一般的な目標共分散行列の族についても理論的結果を示す。
論文 参考訳(メタデータ) (2024-12-19T02:47:39Z) - Which Invariance Should We Transfer? A Causal Minimax Learning Approach [18.71316951734806]
本稿では、因果的観点からの包括的ミニマックス分析について述べる。
最小の最悪のリスクを持つサブセットを探索する効率的なアルゴリズムを提案する。
本手法の有効性と有効性は, 合成データとアルツハイマー病の診断で実証された。
論文 参考訳(メタデータ) (2021-07-05T09:07:29Z) - Evaluating probabilistic classifiers: Reliability diagrams and score
decompositions revisited [68.8204255655161]
確率的に統計的に一貫性があり、最適に結合し、再現可能な信頼性図を自動生成するCORP手法を導入する。
コーパスは非パラメトリックアイソトニック回帰に基づいており、プール・アジャセント・ヴァイオレータ(PAV)アルゴリズムによって実装されている。
論文 参考訳(メタデータ) (2020-08-07T08:22:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。