論文の概要: Mitigating Private Data Leakage in LLMs with Whiteout
- arxiv url: http://arxiv.org/abs/2610.02418v1
- Date: Thu, 01 Oct 2026 19:40:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.071516
- Title: Mitigating Private Data Leakage in LLMs with Whiteout
- Title(参考訳): ホワイトアウトによるLLMにおけるプライベートデータ漏洩の軽減
- Abstract要約: 大規模言語モデル(LLM)は、大規模な、主にフィルタリングされていないデータセットで訓練されている。
LLMは、生年月日、電話番号、住所などの個人機密情報(PSI)を記憶し、再現することが多い。
本稿では,PLMが真のPSIを退避させないための実用ツールであるWhiteoutを提案する。
- 参考スコア(独自算出の注目度): 17.94915580062786
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern large language models (LLMs) are trained on massive, largely unfiltered datasets, including content scraped from nearly every accessible website and user inputs. As a result, LLMs often memorize and reproduce personally sensitive information (PSI) such as birth dates, phone numbers, and home addresses. This leads to significant privacy risks, particularly for high-profile individuals such as executives, politicians, and judges. Existing mitigations largely rely on machine unlearning. However, these methods often remove more information than needed, degrade model utility and safety, and are highly vulnerable to attacks. This paper presents Whiteout, a practical tool that, upon requests by individuals, prevents LLMs from regurgitating their genuine PSIs, by overwriting them using precise and carefully designed obfuscation samples. We evaluate Whiteout on modern LLMs of varying sizes and makers, including a widely-used OpenAI model. Results show that Whiteout effectively prevents disclosure of the targeted PSIs, has negligible impact on model utility and safety, and outperforms existing alternatives. We also test Whiteout against a wide range of countermeasures, from black-box attacks like jailbreaking to white-box adaptive attacks like relearning and quantization. Finally, we conclude with a discussion on the security and ethical implications of Whiteout.
- Abstract(参考訳): 現代の大規模言語モデル(LLM)は、ほぼすべてのアクセス可能なWebサイトから取り除かれたコンテンツやユーザ入力を含む、大規模な、主にフィルタリングされていないデータセットに基づいてトレーニングされている。
その結果、LSMは生年月日、電話番号、住所などの個人機密情報(PSI)を記憶し、再現することが多い。
これは、特に重役、政治家、裁判官のような著名な個人にとって、重大なプライバシー上のリスクをもたらす。
既存の緩和は、主に機械学習に依存している。
しかしながら、これらの手法は、必要以上に多くの情報を取り除き、モデルユーティリティと安全性を低下させ、攻撃に対して非常に脆弱である。
本稿では,個人からの要望に応じて,正確な難読化サンプルを上書きすることで,LSMが真のPSIを除去することを防止できる実用ツールであるWhiteoutを提案する。
広範に使われているOpenAIモデルを含む,様々なサイズとメーカーの現代LLM上でのWhiteoutの評価を行った。
その結果、WhiteoutはターゲットのPSIの開示を効果的に防ぎ、モデルユーティリティと安全性に無視できない影響を与え、既存の代替品よりも優れていることが示された。
私たちはまた、脱獄のようなブラックボックス攻撃から、再学習や量子化のようなホワイトボックス適応攻撃まで、幅広い対策に対してWhiteoutをテストしています。
最後に、Whiteoutのセキュリティと倫理的意味について論じる。
関連論文リスト
- Spore: Efficient and Training-Free Privacy Extraction Attack on LLMs via Inference-Time Hybrid Probing [15.881692298439637]
本稿では,大規模言語モデル(LLM)エージェントメモリを対象とした,トレーニング不要なプライバシ抽出攻撃を提案する。
textscSporeはブラックボックスとグレーボックスの両方の設定に対応している。
textscSporeは、検出と強力な安全性アライメントの両方を一貫してバイパスする。
論文 参考訳(メタデータ) (2026-04-26T13:54:15Z) - Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack [53.34204977366491]
大きな言語モデル(LLM)は、印象的な機能にもかかわらず、ジェイルブレイク攻撃に対して脆弱なままである。
本稿では,攻撃意図について LLM を混乱させる ISA (Intent Shift Attack) を提案する。
私たちのアプローチでは、元の要求に対して最小限の編集しか必要とせず、自然で、可読性があり、一見無害なプロンプトをもたらす。
論文 参考訳(メタデータ) (2025-11-01T13:44:42Z) - Membership Inference Attacks on Tokenizers of Large Language Models [40.2492347972186]
本稿では,トークン化剤によるメンバシップリークに関する最初の研究について述べる。
データセットのメンバシップを推測する5つのアタック手法について検討する。
われわれの発見は、トークン化業者を、見過ごされているが重要なプライバシーの脅威として強調している。
論文 参考訳(メタデータ) (2025-10-07T09:05:40Z) - VortexPIA: Indirect Prompt Injection Attack against LLMs for Efficient Extraction of User Privacy [22.037235521470468]
大規模言語モデル(LLM)は、会話型AI(CAI)に広くデプロイされている。
近年の研究では、LLMベースのCAIを操作して、人間から個人情報を抽出し、重大なセキュリティ上の脅威を生じさせることが示されている。
ブラックボックス設定下でのプライバシー抽出を誘導する新しい間接的インジェクション攻撃であるtextscVortexPIAを提案する。
論文 参考訳(メタデータ) (2025-10-05T15:58:55Z) - SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks [17.77094760401298]
メンバーシップ推論攻撃(MIA)に対する微調整大言語モデルの脆弱性について検討する。
プライバシー保護とプライバシー保護のバランスをとるために,影響のあるデータ選択を調整可能なパラメータで活用することで,プライバシーの漏洩を緩和する新しい防衛手法であるSOFTを提案する。
論文 参考訳(メタデータ) (2025-06-12T07:23:56Z) - Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation [88.78166077081912]
我々は、MLLMから特定のマルチモーダル知識を削除する方法を評価するために、マルチモーダル・アンラーニング・ベンチマークUnLOK-VQAとアタック・アンド・ディフェンス・フレームワークを導入する。
その結果,マルチモーダル攻撃はテキストや画像のみの攻撃よりも優れており,最も効果的な防御は内部モデル状態から解答情報を除去することを示した。
論文 参考訳(メタデータ) (2025-05-01T01:54:00Z) - Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models? [83.53005932513155]
MLLM(Multi-modal large language model)は大きな進歩を遂げているが、その安全性は依然として限られている。
そこで我々は, 単純明快な拒絶文に代えて, 少数の良性命令追従データに対して, MLLMを微調整する手法を提案する。
論文 参考訳(メタデータ) (2025-04-14T09:03:51Z) - Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense [55.77152277982117]
私たちは、jailbreak攻撃から防御するために設計された方法であるLayer-AdvPatcherを紹介します。
私たちは、自己拡張データセットを通じて、大規模言語モデル内の特定のレイヤにパッチを適用するために、未学習の戦略を使用します。
我々の枠組みは、脱獄攻撃の有害性と攻撃の成功率を減らす。
論文 参考訳(メタデータ) (2025-01-05T19:06:03Z) - BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models [0.0]
本稿では,大規模言語モデル (LLM) における安全性に起因したバイアスが引き起こす固有のリスクを明らかにする,BiasJailbreakの概念を紹介する。
生成前に防御プロンプトを注入することにより、脱獄未遂を防止する効率的な防御方法であるBiasDefenseを提案する。
本研究は, LLMの倫理的バイアスが, 実際に安全でない出力を発生させる可能性を強調し, LLMをより安全でバイアスのないものにする方法を提案する。
論文 参考訳(メタデータ) (2024-10-17T08:46:09Z) - SecAlign: Defending Against Prompt Injection with Preference Optimization [52.48001255555192]
敵のプロンプトは外部のデータソースに注入され、システムの意図した命令をオーバーライドし、悪意のある命令を実行する。
我々は、好みの最適化技術に基づくSecAlignと呼ばれる新しいディフェンスを提案する。
本手法は,訓練中に見られたものよりもはるかに高度な攻撃に対しても,様々なプロンプトインジェクションの成功率を10%に下げる。
論文 参考訳(メタデータ) (2024-10-07T19:34:35Z) - Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models [79.0183835295533]
我々は,このような脆弱性のリスクを評価するために,BIPIAと呼ばれる間接的インジェクション攻撃のための最初のベンチマークを導入した。
我々の分析では、LLMが情報コンテキストと動作可能な命令を区別できないことと、外部コンテンツ内での命令の実行を回避できないことの2つの主要な要因を同定した。
ブラックボックスとホワイトボックスという2つの新しい防御機構と、これらの脆弱性に対処するための明確なリマインダーを提案する。
論文 参考訳(メタデータ) (2023-12-21T01:08:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。