論文の概要: Improving Machine Learning Performance with Synthetic Augmentation
- arxiv url: http://arxiv.org/abs/2604.14498v1
- Date: Thu, 16 Apr 2026 00:23:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-17 21:29:31.656056
- Title: Improving Machine Learning Performance with Synthetic Augmentation
- Title(参考訳): 合成拡張による機械学習性能の向上
- Authors: Mel Sohm, Charles Dezons, Sami Sellami, Oscar Ninou, Axel Pincon,
- Abstract要約: 我々は、効果的なトレーニング分布の修正として、合成増強を形式化する。
追加のサンプルは推定誤差を減少させるが、人口目標をシフトさせることもできる。
合成増強は分散支配体制においてのみ有用であることを示す。
希少な登録ターゲティングは、ドメイン固有のメトリクスを改善することができるが、無条件の置換推論と矛盾する可能性がある。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Synthetic augmentation is increasingly used to mitigate data scarcity in financial machine learning, yet its statistical role remains poorly understood. We formalize synthetic augmentation as a modification of the effective training distribution and show that it induces a structural bias--variance trade-off: while additional samples may reduce estimation error, they may also shift the population objective whenever the synthetic distribution deviates from regions relevant under evaluation. To isolate informational gains from mechanical sample-size effects, we introduce a size-matched null augmentation and a finite-sample, non-parametric block permutation test that remains valid under weak temporal dependence. We evaluate this framework in both controlled Markov-switching environments and real financial datasets, including high-frequency option trade data and a daily equity panel. Across generators spanning bootstrap, copula-based models, variational autoencoders, diffusion models, and TimeGAN, we vary augmentation ratio, model capacity, task type, regime rarity, and signal-to-noise. We show that synthetic augmentation is beneficial only in variance-dominant regimes, such as persistent volatility forecasting-while it deteriorates performance in bias-dominant settings, including near-efficient directional prediction. Rare-regime targeting can improve domain-specific metrics but may conflict with unconditional permutation inference. Our results provide a structural perspective on when synthetic data improves financial learning performance and when it induces persistent distributional distortion.
- Abstract(参考訳): 合成強化は、金融機械学習におけるデータの不足を軽減するためにますます利用されているが、その統計的役割はよく分かっていない。
我々は, 効果的なトレーニング分布の修正として合成増強を定式化し, 構造バイアス-分散トレードオフを誘導することを示した。
メカニカルサンプルサイズ効果から情報ゲインを分離するため,時間的弱依存下でも有効であるサイズマッチングヌル増倍法と有限サンプル非パラメトリックブロック置換試験を導入する。
我々は,この枠組みを,高頻度オプション取引データや毎日の株式パネルなど,マルコフスイッチング環境と実際の財務データセットの両方で評価する。
ブートストラップ,コプラモデル,変分オートエンコーダ,拡散モデル,時間GANにまたがるジェネレータでは,拡張率,モデルキャパシティ,タスクタイプ,レギュレーションラミリティ,信号対雑音が異なる。
本研究は, 過度なボラティリティ予測などの分散支配体制においてのみ有益であり, ほぼ効率のよい方向予測を含むバイアス支配環境において, 性能が低下することを示す。
希少な登録ターゲティングは、ドメイン固有のメトリクスを改善することができるが、無条件の置換推論と矛盾する可能性がある。
この結果から, 合成データによる財務学習性能の向上と, 持続的分散歪みの誘発に関する構造的視点が得られた。
関連論文リスト
- Multi-environment Invariance Learning with Missing Data [0.0]
本研究では、変数選択特性と$ell$エラー収束率に関する漸近的でない保証を確立する。
シミュレーションにより新しい推定器の性能を評価し,その応用をUCI Bike Sharingデータセットを用いて実証した。
論文 参考訳(メタデータ) (2026-01-12T06:30:58Z) - Beyond Real Data: Synthetic Data through the Lens of Regularization [9.459299281438074]
合成データは、実際のデータが不足しているときに一般化を改善することができるが、過度な依存は、性能を低下させる分布ミスマッチをもたらす可能性がある。
本稿では,合成データと実データとのトレードオフを定量化する学習理論フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-09T11:33:09Z) - TarDiff: Target-Oriented Diffusion Guidance for Synthetic Electronic Health Record Time Series Generation [26.116599951658454]
時系列生成は臨床機械学習モデルの進歩に不可欠である。
観測データのみに対する忠実性は、モデル性能の向上を保証するものではない、と我々は主張する。
タスク固有のインフルエンスガイダンスを統合した,新たなターゲット指向拡散フレームワークであるTarDiffを提案する。
論文 参考訳(メタデータ) (2025-04-24T14:36:10Z) - Fair CoVariance Neural Networks [34.68621550644667]
本稿では,Fair CoVariance Neural Networks (FVNN) を提案する。
我々は,FVNNが類似のPCAアプローチよりも本質的に公平であることを証明する。
論文 参考訳(メタデータ) (2024-09-13T06:24:18Z) - Unveiling the Flaws: Exploring Imperfections in Synthetic Data and Mitigation Strategies for Large Language Models [89.88010750772413]
大規模言語モデル(LLM)の学習における高品質なデータ不足問題に対する解決法として,合成データを提案する。
我々の研究は、Q-A(Q-A)ペア、一般的な合成データに関連するこれらの特定の欠陥を掘り下げ、これらの欠陥を軽減するための未学習技術に基づく方法を提案する。
我々の研究は、より堅牢で効率的なLLMトレーニングを促進することを目的として、合成データの効果的な利用に関する重要な洞察を得た。
論文 参考訳(メタデータ) (2024-06-18T08:38:59Z) - Variational Classification [51.2541371924591]
我々は,変分オートエンコーダの訓練に用いるエビデンスローバウンド(ELBO)に類似した,モデルの訓練を目的とした変分目的を導出する。
軟質マックス層への入力を潜伏変数のサンプルとして扱うことで, 抽象化された視点から, 潜在的な矛盾が明らかとなった。
我々は、標準ソフトマックス層に見られる暗黙の仮定の代わりに、選択された潜在分布を誘導する。
論文 参考訳(メタデータ) (2023-05-17T17:47:19Z) - Accuracy on the Line: On the Strong Correlation Between
Out-of-Distribution and In-Distribution Generalization [89.73665256847858]
分布外性能は,広範囲なモデルと分布シフトに対する分布内性能と強く相関していることを示す。
具体的には,CIFAR-10 と ImageNet の変種に対する分布内分布と分布外分布性能の強い相関関係を示す。
また,CIFAR-10-Cと組織分類データセットCamelyon17-WILDSの合成分布の変化など,相関が弱いケースについても検討した。
論文 参考訳(メタデータ) (2021-07-09T19:48:23Z) - Predicting with Confidence on Unseen Distributions [90.68414180153897]
ドメイン適応と予測不確実性文学を結びつけて、挑戦的な未知分布のモデル精度を予測する。
分類器の予測における信頼度(DoC)の差は,様々な変化に対して,分類器の性能変化を推定することに成功した。
具体的には, 合成分布と自然分布の区別について検討し, その単純さにもかかわらず, DoCは分布差の定量化に優れることを示した。
論文 参考訳(メタデータ) (2021-07-07T15:50:18Z) - Which Invariance Should We Transfer? A Causal Minimax Learning Approach [18.71316951734806]
本稿では、因果的観点からの包括的ミニマックス分析について述べる。
最小の最悪のリスクを持つサブセットを探索する効率的なアルゴリズムを提案する。
本手法の有効性と有効性は, 合成データとアルツハイマー病の診断で実証された。
論文 参考訳(メタデータ) (2021-07-05T09:07:29Z) - Unlabelled Data Improves Bayesian Uncertainty Calibration under
Covariate Shift [100.52588638477862]
後続正則化に基づく近似ベイズ推定法を開発した。
前立腺癌の予後モデルを世界規模で導入する上で,本手法の有用性を実証する。
論文 参考訳(メタデータ) (2020-06-26T13:50:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。