論文の概要: Sleeping Secrets: How Fine-Tuning Reawakens Privacy Risks in Language Models
- arxiv url: http://arxiv.org/abs/2610.01365v1
- Date: Thu, 01 Oct 2026 09:36:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.032787
- Title: Sleeping Secrets: How Fine-Tuning Reawakens Privacy Risks in Language Models
- Title(参考訳): スリープ・シークレット:言語モデルにおけるプライバシーのリスクをいかに意識させるか
- Abstract要約: 筆者らは, LLM が生成した候補が, 以前に学習した民間団体を回復するための十分な監督を行うことができることを示した。
本稿では,タスク構造を用いてプライベートアソシエイトを復元するデータフリーアタックであるReGapを提案し,それを解答確率でフィルタリングし,低ランク適応によりターゲットモデルを更新する。
- 参考スコア(独自算出の注目度): 14.520620702849236
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Beyond adapting Large Language Models (LLMs) to specialized applications, fine-tuning has recently been shown to recover private information that is no longer accessible through direct queries. Previous fine-tuning recovery attacks, however, require genuine private supervision drawn from the same distribution, i.e., the previous training dataset. We argue that such recovery remains possible without such impractical knowledge. We show that LLM-generated candidates can provide sufficient supervision to recover previously learned private associations. Based on this, we propose ReGap, a data-free attack that recovers private associations using task structure, filters them by answer-token likelihood, and updates the target model via low-rank adaptation. Specifically, ReGap requires neither target answers nor auxiliary genuine private supervision. Across six GPT-2, OPT, and Qwen3 models, ReGap improves target-association recovery by 6-21 percentage points over the post-training target model. Recovery remains substantial even when the adaptation identities are disjoint from all memorized and evaluation identities, with no exact target answers appearing in the generated or selected supervision. Moreover, the same trained adapters increase recovery from 42\% to 63\% on a previously exposed checkpoint, but produce no gain on a matched checkpoint that never encountered the targets. This contrast shows that adaptation alone is insufficient to explain the observed recovery and that prior target exposure strongly affects post-adaptation recoverability. Our findings highlight that routine model customization can reawaken latent privacy risks, warranting urgent attention from the academic and industrial communities.
- Abstract(参考訳): 特定のアプリケーションにLarge Language Models(LLMs)を適用することに加えて、ファインチューニングにより、直接クエリでアクセスできないプライベート情報を復元することが最近示されている。
しかし、以前の微調整リカバリ攻撃では、同じ分布、すなわち以前のトレーニングデータセットから引き出された真のプライベートな監督が必要だった。
このような回復は、そのような非現実的な知識がなければ可能であり続けると我々は主張する。
筆者らは, LLM が生成した候補が, 以前に学習した民間団体を回復するための十分な監督を行うことができることを示した。
これに基づいて、タスク構造を用いてプライベートアソシエーションを復元し、解答確率でフィルタリングし、低ランク適応によりターゲットモデルを更新するデータフリーアタックであるReGapを提案する。
具体的には、ReGapはターゲットの回答も、真の個人監督も必要としない。
6つのGPT-2、OPT、Qwen3モデルにおいて、ReGapはトレーニング後の目標モデルに対して6-21ポイントの目標連想回復を改善する。
適応アイデンティティがすべての記憶および評価IDから切り離された場合でも、生成または選択された監視に正確な目標回答が現れることはない。
さらに、トレーニング済みのアダプタは、以前公開されたチェックポイントで42\%から63\%にリカバリするが、ターゲットに遭遇しなかったマッチしたチェックポイントでは利得は得られない。
このコントラストは、適応だけで観察された回復を説明するには不十分であり、事前の標的曝露が適応後の回復性に強く影響を及ぼすことを示している。
本研究は, 日常的なモデルカスタマイズが, 潜伏するプライバシーリスクを喚起し, 学術・産業コミュニティから緊急の注意を喚起することを明らかにするものである。
関連論文リスト
- Machine Unlearning as Private Retroactive Algorithms [53.24897282360584]
本稿では,レトロアクティビティ要求を連続観察下での差分プライバシーと組み合わせて,レトロアクティブアルゴリズムの定義を提案する。
本稿では, 線形統計, クラスタリング, ヒストグラムに対して, 不合理な結果とともに, プライバシのみを犠牲にして, プライバシとレトロアクティビティを両立させる構造を提案する。
論文 参考訳(メタデータ) (2026-09-04T16:32:11Z) - Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning [57.920153607557744]
J-Accessは、モデル出力経路に沿ってターゲット概念がアクセス可能な頻度を測定する推論時監査である。
我々は8つの未学習手法にまたがる398の公開未学習モデルを監査する。
論文 参考訳(メタデータ) (2026-08-11T20:16:20Z) - Reflective Recovery: A Self-Supervised Method for Reasoning by Learning from Mistakes [70.64622557376505]
リフレクティブリカバリは、推論中のミスを認識し、修正するようにモデルに教える。
AIME 2025では30.0%から37.5%、Minervaでは37.6%から47.8%に精度が向上している。
論文 参考訳(メタデータ) (2026-07-24T02:51:42Z) - Reducing information dependency does not cause training data privacy. Adversarially non-robust features do [1.9754011041953694]
広範囲な露光は暗記を伴わずに持続しうることを示し,その代わりに対向性強靭性への調整可能な接続が原因であることを示した。
我々の結果は、トレーニングデータの露出に関する一般的な理解を再考し、新たなプライバシ・ロバスト性トレードオフを明らかにします。
論文 参考訳(メタデータ) (2026-07-14T05:06:24Z) - ARES: Scalable and Practical Gradient Inversion Attack in Federated Learning through Activation Recovery [73.8181449261685]
Federated Learning(FL)は、モデルの更新を生データではなく共有することで、ユーザのプライバシ保護を目的としたコラボレーションモデルトレーニングを可能にする。
最近の研究によると、これらの共有更新は、勾配反転攻撃(GIA)を通じて、不注意にセンシティブなトレーニングデータを漏洩する可能性がある。
論文 参考訳(メタデータ) (2026-03-18T11:40:44Z) - Do I Really Know? Learning Factual Self-Verification for Hallucination Reduction [14.310806623700037]
本稿では,一貫性に基づく自己検証を通じて,大規模言語モデルに事実の不確実性を推論する学習時間フレームワークを提案する。
複数のモデルファミリーとスケールで、VeriFYは事実の幻覚率を9.7から53.3%に下げ、リコールはわずかに減少している。
ソースコード、トレーニングデータ、トレーニングされたモデルチェックポイントは、受け入れ次第リリースされる。
論文 参考訳(メタデータ) (2026-02-02T12:15:50Z) - DiffMI: Breaking Face Recognition Privacy via Diffusion-Driven Training-Free Model Inversion [16.02881487974147]
顔認識は、不変の生体データに依存するため、深刻なプライバシーリスクを引き起こす。
モデル反転攻撃は、アイデンティティ情報がまだ回復可能であることを明らかにし、重大な脆弱性を露呈する。
DiffMIは拡散駆動型トレーニングフリーモデルインバージョンアタックである。
論文 参考訳(メタデータ) (2025-04-25T01:53:27Z) - Demystifying Trajectory Recovery From Ash: An Open-Source Evaluation and Enhancement [5.409124675229009]
本研究では, トラジェクショナルリカバリ攻撃をスクラッチから再実装し, 2つのオープンソースデータセット上で評価する。
結果は、一般的な匿名化やアグリゲーション手法にもかかわらず、プライバシリークがまだ存在することを確認した。
ベースライン攻撃に対する一連の強化を設計することで、より強力な攻撃を提案する。
論文 参考訳(メタデータ) (2024-09-23T01:06:41Z) - The Good and The Bad: Exploring Privacy Issues in Retrieval-Augmented
Generation (RAG) [56.67603627046346]
Retrieval-augmented Generation (RAG)は、プロプライエタリおよびプライベートデータによる言語モデルを容易にする強力な技術である。
本研究では,プライベート検索データベースの漏洩に対するRAGシステムの脆弱性を実証する,新たな攻撃手法による実証的研究を行う。
論文 参考訳(メタデータ) (2024-02-23T18:35:15Z) - Defending against Reconstruction Attacks with R\'enyi Differential
Privacy [72.1188520352079]
レコンストラクション攻撃により、敵は訓練されたモデルのみにアクセスすることで、トレーニングセットのデータサンプルを再生することができる。
差別化プライバシはこのような攻撃に対する既知の解決策であるが、比較的大きなプライバシ予算で使用されることが多い。
また、同機構により、従来の文献よりも優れた復元攻撃に対するプライバシー保証を導出できることを示す。
論文 参考訳(メタデータ) (2022-02-15T18:09:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。