論文の概要: CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models
- arxiv url: http://arxiv.org/abs/2606.17464v1
- Date: Tue, 16 Jun 2026 03:26:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-17 17:15:32.243321
- Title: CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models
- Title(参考訳): CheckMIABench: 言語モデルに対するメンバシップ推論攻撃のための企業ファウンデーション
- Authors: Jeffrey G. Wang, Jason Wang, Marvin Li, Seth Neel,
- Abstract要約: メンバーシップ推論攻撃(MIA)は、機械学習モデルのプライバシ特性を評価するための標準的な方法である。
本稿では,LLMに対するMIAの原理的評価のためのベンチマークを構築した。
中間チェックポイントと公開トレーニングデータを備えたすべてのオープンソースモデルは、MIAテストベッドに変換できる。
- 参考スコア(独自算出の注目度): 11.615767134608708
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Membership inference attacks (MIAs) are a canonical way to assess a machine learning model's privacy properties. Although several attempts have been made to evaluate MIAs on language models, the extant literature has suffered numerous difficulties in constructing clean evaluations to test new techniques. In particular, subtle distribution shifts between member and non-member sets can undermine the statistical validity of MIAs; recent work has underscored this by showing that "blind" methods with no access to the underlying model can perform far better than published methods on the same benchmarks. This paper constructs a benchmark for principled evaluation of MIAs against LLMs, by leveraging the insight that training data before and after a fixed point during training are drawn from the same distribution. Therefore, all open-source models with intermediate checkpoints and public training data can be converted into MIA testbeds. We apply our framework to a half-dozen published attacks on the Pythia and OLMo family of models, from 70M to 7B parameters. To facilitate further privacy research, we open-source a modular library for designing and implementing attacks in this setting: https://github.com/safr-ai-lab/pandora_llm.
- Abstract(参考訳): メンバーシップ推論攻撃(MIA)は、機械学習モデルのプライバシ特性を評価するための標準的な方法である。
言語モデル上でMIAを評価する試みはいくつかあるが、現存する文献は、新しい手法をテストするためのクリーンな評価を構築するのに多くの困難を経験している。
特に、メンバーと非メンバー間の微妙な分布シフトは、MIAの統計的妥当性を損なう可能性があるが、近年の研究は、基礎となるモデルにアクセスできない「盲」の手法が、同じベンチマークで公表された方法よりもはるかに優れていることを示すことで、これを裏付けている。
本稿では,LLMに対するMIAの原理的評価のためのベンチマークを構築し,トレーニング中の定点前後のトレーニングデータが同じ分布から引き出されるという知見を活用する。
したがって、中間チェックポイントと公開トレーニングデータを持つすべてのオープンソースモデルをMIAテストベッドに変換することができる。
我々は,Pythia と OLMo のモデル群に対する攻撃を,70M から 7B のパラメータに応用した。
さらなるプライバシー調査を容易にするため、この設定で攻撃を設計、実装するためのモジュラーライブラリをオープンソースにしました。
関連論文リスト
- Learning to Detect Language Model Training Data via Active Reconstruction [65.4791582049743]
textbfActive Data Reconstruction Attack (ADRA)を紹介する。
ADRAはトレーニングを通じて与えられたテキストを再構築するモデルを誘導する。
我々のアルゴリズムは、事前学習、後訓練、蒸留データの検出において、既存のMIAよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-02-22T03:20:06Z) - Detecting Training Data of Large Language Models via Expectation Maximization [62.28028046993391]
本稿では,予測最大化アルゴリズムを用いて,メンバーシップスコアとプレフィックススコアを反復的に洗練する新しいメンバーシップ推論手法EM-MIAを紹介する。
EM-MIAはWikiMIAで最先端の結果を得る。
論文 参考訳(メタデータ) (2024-10-10T03:31:16Z) - SoK: Membership Inference Attacks on LLMs are Rushing Nowhere (and How to Fix It) [16.673210422615348]
LLMに対するメンバーシップ推論攻撃(MIA)を行うための10以上の新しい手法が提案されている。
固定だがランダム化されたレコードやモデルに依存する従来のMIAとは対照的に、これらの方法は主にトレーニングされ、ポストホックで収集されたデータセットでテストされる。
このランダム化の欠如は、メンバーと非メンバー間の分散シフトの懸念を引き起こす。
論文 参考訳(メタデータ) (2024-06-25T23:12:07Z) - Do Membership Inference Attacks Work on Large Language Models? [141.2019867466968]
メンバーシップ推論攻撃(MIA)は、特定のデータポイントがターゲットモデルのトレーニングデータのメンバーであるかどうかを予測しようとする。
我々は、Pileで訓練された言語モデルに対して、MIAの大規模評価を行い、そのパラメータは160Mから12Bまでである。
様々な LLM サイズや領域にまたがるほとんどの設定において,MIA はランダムな推測よりもほとんど優れていないことがわかった。
論文 参考訳(メタデータ) (2024-02-12T17:52:05Z) - Assessing Privacy Risks in Language Models: A Case Study on
Summarization Tasks [65.21536453075275]
我々は要約作業に焦点をあて、会員推測(MI)攻撃について調査する。
テキストの類似性や文書修正に対するモデルの抵抗をMI信号として活用する。
我々は、MI攻撃から保護するための要約モデルの訓練と、プライバシとユーティリティの本質的にのトレードオフについて議論する。
論文 参考訳(メタデータ) (2023-10-20T05:44:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。