論文の概要: Cross-Lingual Transferability of Training Data Extraction Attacks to Recover Memorized PII
- arxiv url: http://arxiv.org/abs/2610.06093v1
- Date: Mon, 05 Oct 2026 10:27:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 18:45:06.420309
- Title: Cross-Lingual Transferability of Training Data Extraction Attacks to Recover Memorized PII
- Title(参考訳): 記憶されたPIIを復元する訓練データ抽出攻撃の言語間伝達性
- Abstract要約: 本研究では、非英語言語におけるTDE攻撃に対する英語中心モデルと多言語モデルの脆弱性を評価する。
この結果から,TDE攻撃による英語中心モデルと多言語モデルの両方が異なる言語に移行したことが示唆された。
このことは、ネイティブな多言語事前学習が潜在言語間橋の出現を促進することを示唆している。
- 参考スコア(独自算出の注目度): 39.190849074254594
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The robustness of Personally Identifiable Information (PII) protection in Large Language Models (LLMs) is a critical concern, yet the risks associated with cross-lingual data extraction remain under-explored. This study evaluates the vulnerability of English-centric and multilingual models to Training Data Extraction (TDE) attacks when prompted in non-English languages. We construct a multi-domain PII dataset comprising social media handles, email addresses, and phone numbers and translate the attack contexts into Italian, Spanish, French, and German. Our results show that TDE attacks against both English-centric and multilingual models transfer to different languages: the attacks are successful on translated prompts, even though only the original English prompt might have been included in the pre-training data. A web-presence check on a sample of the translations confirms that they are not available online. The share of English leaks recovered in other languages grows with the multilingual capability of the model, and it drops sharply when the original wording is lost, even without a change of language. This suggests that native multilingual pre-training facilitates the emergence of latent cross-linguistic bridges that simplify the retrieval of personally identifiable information (PII). We analyze the activations of multilingual large language models (LLMs) and find that different translations of the same prompt are bridged in similar representations, with the strongest alignment in the middle layers. Our results highlight a fundamental security gap in modern LLMs, necessitating more robust, language-agnostic sanitization strategies for future model alignment.
- Abstract(参考訳): 言語モデル(LLM)におけるPII(Personally Identible Information)保護の堅牢性は重要な問題であるが、言語間データ抽出に伴うリスクは未解明のままである。
本研究では,非英語言語における訓練データ抽出(TDE)攻撃に対する英語中心モデルと多言語モデルの脆弱性を評価する。
我々は、ソーシャルメディアのハンドル、メールアドレス、電話番号からなるマルチドメインPIIデータセットを構築し、攻撃コンテキストをイタリア語、スペイン語、フランス語、ドイツ語に翻訳する。
本研究の結果から,TDE攻撃が英語中心モデルと多言語モデルの両方に対して異なる言語に伝達されることが示唆された。
翻訳のサンプルのウェブプレゼンスチェックでは、オンラインでは利用できないことが確認されている。
他の言語で回収された英語のリークのシェアは、モデルの多言語的能力によって増大し、言語の変化なしにオリジナルの単語が失われると急激に減少する。
このことは、ネイティブ多言語事前学習が個人識別情報(PII)の検索を簡素化する潜在言語間橋の出現を促進することを示唆している。
我々は多言語大言語モデル(LLM)のアクティベーションを分析し、同じプロンプトの異なる翻訳が、中間層で最強のアライメントで、同様の表現でブリッジされていることを発見した。
我々の結果は、将来のモデルアライメントのために、より堅牢で言語に依存しない衛生戦略を必要とする現代のLLMの基本的なセキュリティギャップを浮き彫りにする。
関連論文リスト
- Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models [55.14276067678253]
本稿では,Large Language Models (LLMs) における言語間関係の弱点を効率的に同定するための新しい手法を提案する。
この手法を用いて16言語で6,000以上のバイリンガルペアからなる新しいデータセットを構築し、最先端のモデルにおいても弱点を明らかにする効果を実証した。
さらに,言語的類似性と言語間の弱点との関係について検討し,言語的関連言語が類似した演奏パターンを共有することを明らかにした。
論文 参考訳(メタデータ) (2025-05-24T12:31:27Z) - MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety [56.77103365251923]
大規模言語モデル(LLM)は、ジェイルブレイクのような敵の攻撃を受けやすい。
この脆弱性は、多言語セーフティアライメントされたデータが制限される多言語設定で悪化する。
素早い分類のための多言語ガードレールを提案する。
論文 参考訳(メタデータ) (2025-04-21T17:15:06Z) - TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning [63.481446315733145]
多言語大言語モデル(LLM)に対する言語間バックドア攻撃は未調査である。
本研究は, 教育指導データが有毒でない言語に対して, 教育指導データの有毒化がアウトプットに与える影響について検討した。
本手法は,mT5 や GPT-4o などのモデルにおいて,高い攻撃成功率を示し,12言語中7言語以上で90%以上を突破した。
論文 参考訳(メタデータ) (2024-04-30T14:43:57Z) - Text Embedding Inversion Security for Multilingual Language Models [2.790855523145802]
研究は、基礎となるモデルに関する知識がなくても、埋め込みからテキストを再構築できることを示している。
本研究は,単言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語・多言語
論文 参考訳(メタデータ) (2024-01-22T18:34:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。