論文の概要: Post-Generation Curation of Synthetic Images via Homogeneous-Heterogeneous Splitting
- arxiv url: http://arxiv.org/abs/2607.02637v1
- Date: Thu, 02 Jul 2026 15:34:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.377066
- Title: Post-Generation Curation of Synthetic Images via Homogeneous-Heterogeneous Splitting
- Title(参考訳): 均一なヘテロジニアス分割による合成画像の生成後キュレーション
- Authors: Disheng Liu, Tuo Liang, Chaoda Song, Yu Yin,
- Abstract要約: 有効選択は、現代の発電機の構造バイアスに逆らわなければならないことを示す。
我々は,各実クラスを正準同質(HO)サブセットと非冗長不均一(HE)サブセットに分割し,忠実度・多様性の基準により合成画像を評価する。
複数のベンチマークで、最先端のデータ選択ベースラインを一貫して上回る。
- 参考スコア(独自算出の注目度): 5.633132303971446
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent generative models can produce high-quality synthetic images, offering scalable training training data for data-hungry models. Existing approaches to exploiting this potential typically involve 1) training or fine-tuning generators, or 2) using lightweight post-hoc adaptation like prompt engineering or inference-time guidance, making them generator-specific and expertise-intensive. We study a complementary question: given a fixed pool of generated images, can downstream utility be improved purely by selecting an informative subset? The answer is yes. We show that effective selection must counter a structural bias of modern generators: they tend to over-produce canonical modes of each class while underrepresenting intra-class variation. Building on this insight, we split each real class into a canonical Homogeneous (HO) subset and a non-redundant Heterogeneous (HE) subset, then score synthetic images by a fidelity-diversity criterion that rewards semantic alignment while penalizing canonical redundancy. The method is generator-agnostic and requires no retraining. Across multiple benchmarks, it consistently outperforms state-of-the-art data selection baselines and matches the real-data performance with up to 40% fewer synthetic samples. The same criterion remains effective when applied on top of stronger task-tuned generators, with gains on both classification and segmentation tasks. Post-generation selection is therefore not a substitute for better generators, but a complementary mechanism for improving the utility of synthetic data.
- Abstract(参考訳): 最近の生成モデルは高品質な合成画像を生成することができ、データハングリーモデルのためのスケーラブルなトレーニングデータを提供する。
この可能性を活用するための既存のアプローチは、典型的に関与する
1)訓練又は微調整発電機
2) 急速エンジニアリングや推論タイムガイダンスのような軽量なポストホック適応を用いることで, ジェネレータ固有の専門知識を集中的に活用する。
生成した画像の固定プールが与えられた場合、情報的サブセットを選択することによって、下流ユーティリティを純粋に改善できるのか?
答えはイエスです。
有効選択は、各クラスの標準モードを過度に生成し、クラス内の変動を過小評価する傾向にある。
この知見に基づいて、各実クラスを正準同次部分集合(HO)と非負次不均一部分集合(HE)に分割し、その後、正準冗長性をペナル化しながらセマンティックアライメントを付与するフィデリティ・ディバーシティ・クリータリオンを用いて合成画像を評価する。
この方法はジェネレータに依存しないため、再訓練は不要である。
複数のベンチマークを通じて、最先端のデータ選択ベースラインを一貫して上回り、実データのパフォーマンスと最大40%の合成サンプルとを一致させる。
同じ基準は、より強いタスクチューニングされたジェネレータの上に適用しても有効であり、分類タスクとセグメンテーションタスクの両方で有効である。
したがって、ポストジェネレーションの選択はより良いジェネレータの代替ではなく、合成データの有用性を改善するための補完的なメカニズムである。
関連論文リスト
- Generative Classifiers Avoid Shortcut Solutions [84.23247217037134]
分類に対する差別的なアプローチは、しばしば、分配されるが、小さな分布シフトの下で失敗するショートカットを学習する。
生成型分類器は、主にスパイラルな特徴ではなく、コアとスパイラルの両方の全ての特徴をモデル化することでこの問題を回避することができることを示す。
拡散型および自己回帰型生成型分類器は,5つの標準画像およびテキスト分散シフトベンチマークにおいて最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-12-31T18:31:46Z) - Synthetic Data Augmentation using Pre-trained Diffusion Models for Long-tailed Food Image Classification [3.3659467814492654]
長期食品分類のための2段階合成データ拡張フレームワークを提案する。
生成対象に対して正のプロンプトで条件付き参照セットを生成し、生成対象と類似した特徴を共有するクラスを負のプロンプトとして選択する。
提案手法の有効性を2つの長期食品ベンチマークデータセットに示すとともに,トップ1の精度で過去の研究よりも優れた性能を示した。
論文 参考訳(メタデータ) (2025-06-02T06:51:28Z) - Self-Consuming Generative Models with Curated Data Provably Optimize Human Preferences [20.629333587044012]
本研究では,データキュレーションが生成モデルの反復的再学習に与える影響について検討する。
報奨モデルに従ってデータをキュレートすると、反復的再訓練手順の期待報酬が最大になることを示す。
論文 参考訳(メタデータ) (2024-06-12T21:28:28Z) - Combining propensity score methods with variational autoencoders for
generating synthetic data in presence of latent sub-groups [0.0]
ヘテロジニティは、例えば、サブグループラベルによって示されるように知られ、あるいは未知であり、双曲性や歪みのような分布の性質にのみ反映されるかもしれない。
本研究では,変分オートエンコーダ(VAE)から合成データを取得する際に,このような異種性をどのように保存し,制御するかを検討する。
論文 参考訳(メタデータ) (2023-12-12T22:49:24Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z) - Improving Out-of-Distribution Robustness of Classifiers via Generative
Interpolation [56.620403243640396]
ディープニューラルネットワークは、独立かつ同一に分散されたデータ(すなわち、d)から学習する上で、優れたパフォーマンスを達成する。
しかし、アウト・オブ・ディストリビューション(OoD)データを扱う場合、その性能は著しく低下する。
多様なOoDサンプルを合成するために,複数のドメインから学習した生成モデルを融合するための生成補間法(Generative Interpolation)を開発した。
論文 参考訳(メタデータ) (2023-07-23T03:53:53Z) - Mutual Exclusivity Training and Primitive Augmentation to Induce
Compositionality [84.94877848357896]
最近のデータセットは、標準的なシーケンス・ツー・シーケンスモデルにおける体系的な一般化能力の欠如を露呈している。
本稿では,セq2seqモデルの振る舞いを分析し,相互排他バイアスの欠如と全例を記憶する傾向の2つの要因を同定する。
広範に使用されている2つの構成性データセット上で、標準的なシーケンス・ツー・シーケンスモデルを用いて、経験的改善を示す。
論文 参考訳(メタデータ) (2022-11-28T17:36:41Z) - Deceive D: Adaptive Pseudo Augmentation for GAN Training with Limited
Data [125.7135706352493]
GAN(Generative Adversarial Network)は、高忠実度画像を合成するために、訓練に十分なデータを必要とする。
近年の研究では、差別者の過度な適合により、限られたデータでGANを訓練することは困難であることが示されている。
本稿では,APA (Adaptive Pseudo Augmentation) と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2021-11-12T18:13:45Z) - IB-GAN: A Unified Approach for Multivariate Time Series Classification
under Class Imbalance [1.854931308524932]
GAN(Generative Adversarial Networks)による非パラメトリックデータ拡張は、有望なソリューションを提供する。
本稿では,データ拡張と分類を1段階のプロセスで結合する新しい手法であるImputation Balanced GAN(IB-GAN)を提案する。
論文 参考訳(メタデータ) (2021-10-14T15:31:16Z) - Conditional Hybrid GAN for Sequence Generation [56.67961004064029]
本稿では,この問題を解決するための条件付きハイブリッドGAN(C-Hybrid-GAN)を提案する。
我々はGumbel-Softmax法を利用して離散値列の分布を近似する。
提案したC-Hybrid-GANは、文脈条件付き離散値シーケンス生成において既存の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2020-09-18T03:52:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。