論文の概要: Dataset Usage Inference without Shadow Models or Held-out Data
- arxiv url: http://arxiv.org/abs/2606.26257v1
- Date: Wed, 24 Jun 2026 18:02:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.04028
- Title: Dataset Usage Inference without Shadow Models or Held-out Data
- Title(参考訳): シャドウモデルやヘルドアウトデータのないデータセット利用推定
- Authors: Wojciech Łapacz, Stanisław Pawlak, Jan Dubiński, Franziska Boenisch, Adam Dziedzic,
- Abstract要約: これらの制約を取り除くための実践的なDUIフレームワークを導入します。
本手法は, 合成非メンバーサンプルを生成し, 多様なメンバーシップ信号を抽出し, 混合比例推定問題としてDUIを鋳造する。
大規模画像生成モデルを用いた実験により,本手法がデータセット使用率を確実に定量化することを示した。
- 参考スコア(独自算出の注目度): 19.536615947980536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How much of my data was used to train a machine learning model? Dataset Usage Inference (DUI) aims to answer this by estimating what fraction of a dataset contributed to a model's training. However, existing DUI methods rely on assumptions that rarely hold in practice: they require training expensive shadow models to imitate the target model, and they assume access to both known training samples and an in-distribution held-out set confirmed to be absent from training. These conditions make current approaches impractical for modern large models and real data ownership disputes. We introduce a practical DUI framework that removes these constraints. Our method requires neither shadow models nor real held-out data. Instead, it generates synthetic non-member samples, extracts diverse membership signals, and casts DUI as a mixture proportion estimation problem to estimate what share of the candidate dataset was used during training. Experiments on large image generative models show that our method reliably quantifies dataset usage, providing a practical tool for data owners to determine how much of their data was used to train a model.
- Abstract(参考訳): 私のデータのどれ程が機械学習モデルのトレーニングに使われていますか?
Dataset Usage Inference (DUI)は、データセットのどの部分がモデルのトレーニングに寄与しているかを見積もることによって、この問題に対処することを目的としている。
しかし、既存のDUI手法では、ターゲットモデルを模倣するために高価なシャドウモデルを訓練する必要があるという前提に頼っており、既知のトレーニングサンプルと、トレーニングに欠席していると確認された配布済みの保留セットの両方へのアクセスを前提としている。
これらの条件は、現代の大規模モデルや実際のデータ所有に関する論争に対して、現在のアプローチを非現実的にしている。
これらの制約を取り除くための実践的なDUIフレームワークを導入します。
シャドーモデルも実際のホールドアウトデータも不要である。
代わりに、合成された非メンバーサンプルを生成し、多様なメンバーシップ信号を抽出し、DUIを混合比率推定問題としてキャストし、トレーニング中に候補データセットのどのシェアが使用されたかを推定する。
大規模な画像生成モデルを用いた実験により,提案手法はデータセットの使用量を確実に定量化し,データ所有者がモデルのトレーニングに使用したデータの量を決定するための実用的なツールを提供する。
関連論文リスト
- Learning Defect Prediction from Unrealistic Data [57.53586547895278]
事前訓練されたコードのモデルは、コード理解と生成タスクに人気がある。
このようなモデルは大きい傾向があり、訓練データの総量を必要とする。
人工的に注入されたバグのある関数など、はるかに大きくてもより現実的なデータセットを持つモデルをトレーニングすることが一般的になった。
このようなデータで訓練されたモデルは、実際のプログラムでは性能が劣りながら、同様のデータでのみうまく機能する傾向にある。
論文 参考訳(メタデータ) (2023-11-02T01:51:43Z) - TRAK: Attributing Model Behavior at Scale [79.56020040993947]
本稿では,大規模な微分モデルに対して有効かつ計算的に抽出可能なデータ属性法であるTRAK(Tracing with Randomly-trained After Kernel)を提案する。
論文 参考訳(メタデータ) (2023-03-24T17:56:22Z) - Synthetic Model Combination: An Instance-wise Approach to Unsupervised
Ensemble Learning [92.89846887298852]
ラベル付きデータのトレーニングセットから学ぶ機会のない、新しいテストデータに対する予測を検討する。
専門家モデルのセットと予測へのアクセスと、トレーニングに使用するデータセットに関する制限された情報を提供すること。
論文 参考訳(メタデータ) (2022-10-11T10:20:31Z) - SSSE: Efficiently Erasing Samples from Trained Machine Learning Models [103.43466657962242]
サンプル消去のための効率的かつ効率的なアルゴリズムSSSEを提案する。
ある場合、SSSEは、許可されたデータだけで新しいモデルをスクラッチからトレーニングする最適な、しかし実用的でない金の標準と同様に、サンプルをほぼ消去することができる。
論文 参考訳(メタデータ) (2021-07-08T14:17:24Z) - Data Impressions: Mining Deep Models to Extract Samples for Data-free
Applications [26.48630545028405]
データインプレッションはトレーニングデータのプロキシとして機能し、さまざまなタスクを実現するために使用することができる。
いくつかのコンピュータビジョンタスクにおけるデータインプレッションの適用性を示す。
論文 参考訳(メタデータ) (2021-01-15T11:37:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。