論文の概要: When T2I Synthetic Data Backfires: Amplified Privacy Risks in Real-Synthetic Mix Training
- arxiv url: http://arxiv.org/abs/2607.13541v1
- Date: Wed, 15 Jul 2026 07:44:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.688592
- Title: When T2I Synthetic Data Backfires: Amplified Privacy Risks in Real-Synthetic Mix Training
- Title(参考訳): T2I Synthetic Data Backfires: リアル・シンセティック・ミックストレーニングにおけるプライバシーリスクの増幅
- Authors: Na Li, Boyu Kuang, Hongsheng Hu, Liquan Chen, Hyoungshick Kim, Yansong Gao, Anmin Fu,
- Abstract要約: この研究は、RSMTが実際のトレーニングサンプルのプライバシー漏洩を大幅に増幅できることを初めて明らかにしている。
RSMixLeakでは,このリスクをメンバシップ推論攻撃によって体系的に評価する。
- 参考スコア(独自算出の注目度): 26.069486374103338
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: To overcome data scarcity and privacy constraints in data collection, it has become standard practice across academia and industry to augment real training data with text-to-image (T2I)-generated synthetic data, a paradigm we term Real-Synthetic Mix-Training (RSMT). While substituting synthetic data for sensitive real samples is widely regarded as a means to mitigate privacy exposure of the substituted data, the risk to the remaining real samples that actively participate in training has remained largely unexamined. This work reveals, for the first time, that RSMT can substantially amplify privacy leakage of these real training samples. We establish a theoretical framework, RSMT Memorization Amplification, proving that incorporating synthetic data displaces real samples toward peripheral regions of the mixed feature space, in turn forcing the model to memorize them more aggressively. Guided by this foundation, we propose RSMixLeak to systematically assess this risk through membership inference attacks (MIAs). RSMixLeak comprises two variants depending on the adversary's capability. The non-adversarial variant audits a benign RSMT pipeline with an honest T2I provider, establishing a lower bound on the leakage induced by the intrinsic gap between real and T2I-generated data. The adversarial variant considers an adversary who controls the T2I model or contributes crafted data to the T2I provider, and deliberately enlarges this distributional gap on a target class via either high-level semantic attribute binding or imperceptible pixel-level coating, further amplifying leakage on real training data while improving downstream model utility. Motivated by these findings, we further propose a lightweight leakage propensity indicator computable from real data alone that reliably identifies high-risk datasets unsuitable for entering RSMT, as a self-assessable mitigation.
- Abstract(参考訳): データ収集におけるデータ不足とプライバシの制約を克服するため、テキスト・トゥ・イメージ(T2I)生成合成データによる実際のトレーニングデータの拡大は、学術界や業界で標準的な慣行となっている。
センシティブな実検体に対する合成データの置換は、置換されたデータのプライバシー侵害を軽減する手段として広く見なされているが、トレーニングに積極的に参加する残りの実検体のリスクはほとんど検討されていない。
この研究は、RSMTがこれらの実際のトレーニングサンプルのプライバシー漏洩を大幅に増幅できることを初めて明らかにしている。
我々は,合成データを組み込んだ理論的枠組みRSMT覚書増幅法を構築し,実サンプルを混合特徴空間の周辺領域に移動させることで,モデルをより積極的に記憶させる。
本財団が指導するRSMixLeakでは,このリスクをMIA(メンバシップ推論攻撃)を通じて体系的に評価する。
RSMixLeakは敵の能力に応じて2つの変種から構成される。
非敵対的変種は、正直なT2Iプロバイダで良質なRSMTパイプラインを監査し、実データとT2I生成データの内在的ギャップによって引き起こされるリークの低い境界を確立する。
逆数変種は、T2Iモデルを制御したり、T2Iプロバイダに工芸データをコントリビュートする敵を考慮し、高レベルなセマンティック属性バインディングまたは非受容可能な画素レベルのコーティングを介して、ターゲットクラス上のこの分散ギャップを意図的に拡大し、下流モデルのユーティリティを改善しながら、実際のトレーニングデータへの漏洩をさらに増幅する。
さらに, RSMT入力に適さない高リスクデータセットを, 自己評価可能な緩和として確実に識別する, 実データのみから計算可能な, 軽量な漏洩確率インジケータを提案する。
関連論文リスト
- Phantoms and Disclosures: a Causal Framework for Auditing Synthetic Data [56.86147283213652]
データ開示の検出と説明を目的とした,カスタマイズ可能な実証監査フレームワークを提案する。
本フレームワークでは,ユーザの情報を直接再現する「真の開示」と,ユーザのデータを偶発的に生成する「幻の開示」とを区別する機構を導入する。
論文 参考訳(メタデータ) (2026-06-15T16:54:02Z) - Conditional Imputation for Within-Modality Missingness in Multi-Modal Federated Learning [8.35064965629059]
MMFL(Multimodal Federated Learning)は、プライバシー保護のための協調トレーニングを提供する。
実世界の臨床応用は、しばしば、センサーの断続性や不規則なサンプリングによって生じるモダリティの欠如に悩まされる。
本研究では,条件付き拡散モデルを用いて,この欠陥に明示的に対処するフレームワークであるCondIを提案する。
論文 参考訳(メタデータ) (2026-04-25T02:35:08Z) - Unlocking Post-hoc Dataset Inference with Synthetic Data [11.886166976507711]
トレーニングデータセットは、データ所有者の知的財産権を尊重することなく、しばしばインターネットから取り除かれる。
推論(DI)は、被疑者データセットがトレーニングに使用されたかどうかを特定することで潜在的な治療を提供する。
既存のDIメソッドでは、妥協したデータセットの分布と密接に一致するトレーニングを欠くために、プライベートな設定を必要とします。
本研究では,必要なホールドアウト集合を合成的に生成することで,この問題に対処する。
論文 参考訳(メタデータ) (2025-06-18T08:46:59Z) - LSM-2: Learning from Incomplete Wearable Sensor Data [65.58595667477505]
本稿では,Adaptive and Inherited Masking (AIM)を用いた第2世代Large Sensor Model (LSM-2)を紹介する。
AIMは明示的な計算を必要とせず、不完全なデータから直接堅牢な表現を学習する。
AIMを用いた LSM-2 は, 分類, 回帰, 生成モデルなど, 多様なタスクにまたがる最高の性能を実現する。
論文 参考訳(メタデータ) (2025-06-05T17:57:11Z) - VAE-based Feature Disentanglement for Data Augmentation and Compression in Generalized GNSS Interference Classification [42.14439854721613]
干渉の正確な分類を可能にする重要な潜伏特徴を抽出するために, アンタングル化のための変分オートエンコーダ (VAE) を提案する。
提案するVAEは512から8,192の範囲のデータ圧縮率を実現し,99.92%の精度を実現している。
論文 参考訳(メタデータ) (2025-04-14T13:38:00Z) - D2SP: Dynamic Dual-Stage Purification Framework for Dual Noise Mitigation in Vision-based Affective Recognition [32.74206402632733]
ノイズは、論理的なラベル付けを損なう低品質なキャプチャや、アノテーションのバイアスによる誤ラベルに悩まされるインスタンスから生じます。
textbfSeeking textbfCertain data textbfIn extensive textbfUncertain data (SCIU)
このイニシアチブは、これらの不確実性のDFERデータセットを浄化することを目的としており、トレーニングプロセスでクリーンで検証されたデータのみが使用されることを保証する。
論文 参考訳(メタデータ) (2024-06-24T09:25:02Z) - Towards Assessing the Synthetic-to-Measured Adversarial Vulnerability of
SAR ATR [16.144102386839574]
本稿では,S2M(Synthetic-to-measured)転送設定について検討し,攻撃者が合成データのみに基づいて逆方向の摂動を発生させ,測定データを用いて訓練された被害者モデルに対して転送する。
また, この難易度の高いシナリオにおいて, 敵のリスクを明らかにするために, 転送可能性推定攻撃(TEA)を提案する。
論文 参考訳(メタデータ) (2024-01-30T14:16:24Z) - From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image Recognition [64.59093444558549]
我々はFrom Fake to Realと呼ぶシンプルで簡単に実装できる2段階のトレーニングパイプラインを提案する。
実データと合成データを別々にトレーニングすることで、FFRは実データと合成データの統計的差異にモデルを公開しない。
実験の結果,FFRは3つのデータセットに対して,最先端のグループ精度を最大20%向上させることがわかった。
論文 参考訳(メタデータ) (2023-08-08T19:52:28Z) - Uncertain Facial Expression Recognition via Multi-task Assisted
Correction [43.02119884581332]
MTACと呼ばれる不確実な表情認識に対処するためのマルチタスク支援補正法を提案する。
具体的には、信頼度推定ブロックと重み付け正則化モジュールを用いて、固体試料をハイライトし、バッチ毎に不確かさサンプルを抑圧する。
RAF-DB、AffectNet、AffWild2データセットの実験は、MTACが合成および実際の不確実性に直面した際のベースラインよりも大幅に改善されていることを示した。
論文 参考訳(メタデータ) (2022-12-14T10:28:08Z) - Concealing Sensitive Samples against Gradient Leakage in Federated
Learning [41.43099791763444]
Federated Learning(FL)は、クライアントが生のプライベートデータをサーバと共有する必要をなくし、ユーザのプライバシを高める分散学習パラダイムである。
近年の研究では、FLの脆弱性が逆攻撃のモデルとなり、敵は共有勾配情報に基づく盗聴によって個人データを再構築している。
我々は,機密データの勾配を隠蔽標本で曖昧にする,シンプルで効果的な防衛戦略を提案する。
論文 参考訳(メタデータ) (2022-09-13T04:19:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。