論文の概要: DeepInvert: Semi-Supervised Embedding Inversion Against Obfuscated Language Models
- arxiv url: http://arxiv.org/abs/2608.04477v1
- Date: Wed, 05 Aug 2026 06:02:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.734295
- Title: DeepInvert: Semi-Supervised Embedding Inversion Against Obfuscated Language Models
- Title(参考訳): Deep Invert: 難読化言語モデルに対する半監督型埋め込みインバージョン
- Authors: Zhicong Huang, Cheng Hong, Tao Wei,
- Abstract要約: クラウドベースの言語モデルサービスプロセスは、機密情報を含むプロンプトである。
難読化ベースのディフェンスは、送信前のプロンプト表現を変換し、暗号化ソリューションの軽量な代替手段を提供する。
これらの防御は、以前考えられていたよりもはるかに少ない保護を提供することを示す。
本稿では,従来の手法よりも高精度に,難読化表現からオリジナルトークンを復元する半教師付き埋め込みインバージョンアタックであるDeepInvertを提案する。
- 参考スコア(独自算出の注目度): 8.719976368689826
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cloud-based language model services routinely process prompts containing sensitive information. Obfuscation-based defenses---including ObfusLM, SentinelLMs, TextObfuscator, and DPNR---mitigate this risk by transforming prompt representations before transmission, offering a lightweight alternative to cryptographic solutions. We show these defenses provide far less protection than previously believed. We present DeepInvert, a semi-supervised embedding inversion attack that recovers original tokens from obfuscated representations with higher accuracy than prior methods. The key insight is that unlabeled obfuscated embeddings retain exploitable semantic structure despite perturbation. DeepInvert combines supervised training on labeled shadow data with a novel unsupervised consistency objective over unlabeled target embeddings, alternating between the two via a mixed training pipeline. Defense-aware adaptations further extend the attack to diverse obfuscation mechanisms across encoder-based and autoregressive architectures. Experiments on nine defenses, five tasks, and four model architectures show that DeepInvert outperforms prior attacks on most defenses. Against ObfusLM, DeepInvert achieves 73.5\% top-1 token recovery versus 26.2\% for the previous best. Our results reveal a task-dependent tension: obfuscation schemes preserving enough signal for utility also retain sufficient structure for inversion, while schemes resisting inversion collapse utility. On simpler classification tasks, some DP-based defenses can maintain both. We call for a re-evaluation of this defense class.
- Abstract(参考訳): クラウドベースの言語モデルサービスは、機密情報を含むプロンプトを日常的に処理する。
難読化ベースの防御 -- ObfusLM、SentinelLMs、TextObfuscator、DPNRなど -- は、暗号化ソリューションの軽量な代替手段として、送信前にプロンプト表現を変換することで、このリスクを軽減する。
これらの防御は、以前考えられていたよりもはるかに少ない保護を提供することを示す。
本稿では,従来の手法よりも高精度に,難読化表現からオリジナルトークンを復元する半教師付き埋め込みインバージョンアタックであるDeepInvertを提案する。
重要な洞察は、ラベルのない難解な埋め込みは摂動にもかかわらず利用可能な意味構造を保持することである。
DeepInvertはラベル付きシャドウデータに対する教師付きトレーニングと、ラベルなしのターゲット埋め込みに対する新たな教師なし一貫性目標を組み合わせることで、混在したトレーニングパイプラインを通じてこの2つを交互に行う。
防衛に配慮した適応は、エンコーダベースおよび自己回帰アーキテクチャ間の様々な難読化機構への攻撃をさらに拡張する。
9つのディフェンス、5つのタスク、4つのモデルアーキテクチャの実験は、DeepInvertが多くのディフェンスに対する以前のアタックより優れていることを示している。
ObfusLMに対してDeepInvertは73.5\%のトップ-1トークンのリカバリを達成したが、以前のベストは26.2\%だった。
難読化スキームは, 実用性に十分な信号を保持するとともに, 倒立ユーティリティに対して十分な構造を保持する一方で, 倒立ユーティリティに抵抗するスキームである。
より単純な分類タスクでは、DPベースの防衛は両方を維持できる。
私たちはこの防衛クラスの再評価を要求します。
関連論文リスト
- Recover, Decode, Reguard: Guard-Agnostic Defense Amplification againstEncoded VLM Jailbreaks [7.287314790466206]
我々は視覚言語モデルのためのガード非依存のリカバリ・アンド・デコード増幅器を構築した。
我々はこれを11回の攻撃のアンサンブルに対して評価し、成功しても動作が失敗すると評価した。
これは我々の中心的な発見を露呈し、私たちが評価した非観念的回復防衛のための実証的な安全ユーティリティー天井である。
論文 参考訳(メタデータ) (2026-07-29T07:53:35Z) - The Platonic Defense: Backdoor Defense for Self-Supervised Encoders in the Era of Large Scale Pre-training [41.266464913728335]
自己教師付き学習(SSL)事前学習モデルは、視覚表現学習において支配的なパラダイムとなっているが、バックドア攻撃には弱い。
我々は,emphPlatonic Representation Defenseと呼ばれる,攻撃非依存,モデル非依存,モダリティ非依存のブラックボックステスト時防衛パラダイムを提案する。
本研究では,複数の自己教師型エンコーダと10以上の攻撃に対して,本手法の有効性を実証する。
論文 参考訳(メタデータ) (2026-06-28T15:16:08Z) - Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack [78.02110947708535]
敵対的なイメージは、プロンプトインジェクションを通じて、マルチモーダルな大規模言語モデルに深刻なセキュリティ上の脅威をもたらす。
敵の攻撃を成功させるには、画像全体を一様に依存するのではなく、重要な画像トークンの小さなサブセットに依存していることを示す。
本稿では,これらのトークンを勾配解析により局所化し,マスキングにより中和するグラディエントトークンマスキング(GTM)を提案する。
論文 参考訳(メタデータ) (2026-05-24T17:51:34Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - DeepGuard: Secure Code Generation via Multi-Layer Semantic Aggregation [22.14448091276763]
セキュリティ強化のための一般的な戦略は、最終変圧器層から派生した監督を用いてモデルを微調整することである。
この設計は最終レイヤのボトルネックに悩まされる可能性がある。脆弱性を識別するキューは層に分散することができ、次のトーケン予測に最適化された出力表現の近くでは検出されにくくなる。
DeepGuardは、アテンションベースのモジュールを通じて複数の上位層から表現を集約することで、分散セキュリティ関連キューを活用するフレームワークである。
論文 参考訳(メタデータ) (2026-04-10T08:19:48Z) - Securing Transfer-Learned Networks with Reverse Homomorphic Encryption [0.764671395172401]
差分プライベート(DP)トレーニングは,トレーニングデータ再構築攻撃に対して防御可能であることを示す。
本稿では,モデルの精度を劣化させることなく,トレーニングデータを保護できる新しい同型暗号法を提案する。
論文 参考訳(メタデータ) (2025-05-20T13:09:22Z) - Reformulation is All You Need: Addressing Malicious Text Features in DNNs [53.45564571192014]
本稿では,敵攻撃とバックドア攻撃の両方に対して有効な,統一的かつ適応的な防御フレームワークを提案する。
我々のフレームワークは、様々な悪意あるテキスト機能において、既存のサンプル指向の防御基準よりも優れています。
論文 参考訳(メタデータ) (2025-02-02T03:39:43Z) - Improving Adversarial Robustness via Decoupled Visual Representation Masking [65.73203518658224]
本稿では,特徴分布の観点から,ロバストな特徴の2つの新しい特性を強調した。
現状の防衛手法は、上記の2つの問題にうまく対処することを目的としている。
具体的には、分離された視覚的表現マスキングに基づく、シンプルだが効果的な防御法を提案する。
論文 参考訳(メタデータ) (2024-06-16T13:29:41Z) - Hidden Backdoor Attack against Semantic Segmentation Models [60.0327238844584]
Emphbackdoor攻撃は、深層ニューラルネットワーク(DNN)に隠れたバックドアを埋め込み、トレーニングデータに毒を盛ることを目的としている。
我々は,対象ラベルを画像レベルではなくオブジェクトレベルから扱う,新たな攻撃パラダイムであるemphfine-fine-grained attackを提案する。
実験により、提案手法はわずかなトレーニングデータだけを毒殺することでセマンティックセグメンテーションモデルを攻撃することに成功した。
論文 参考訳(メタデータ) (2021-03-06T05:50:29Z) - A Self-supervised Approach for Adversarial Robustness [105.88250594033053]
敵対的な例は、ディープニューラルネットワーク(DNN)ベースの視覚システムにおいて破滅的な誤りを引き起こす可能性がある。
本稿では,入力空間における自己教師型対向学習機構を提案する。
これは、反逆攻撃に対する強力な堅牢性を提供する。
論文 参考訳(メタデータ) (2020-06-08T20:42:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。