論文の概要: SurrogateShield: Beyond Redaction for High-Utility, Privacy-Preserving LLM Interactions
- arxiv url: http://arxiv.org/abs/2606.29567v1
- Date: Sun, 28 Jun 2026 19:14:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.961118
- Title: SurrogateShield: Beyond Redaction for High-Utility, Privacy-Preserving LLM Interactions
- Title(参考訳): SurrogateShield: 高ユーティリティでプライバシ保護されたLLMインタラクションのためのリアクションを超えて
- Authors: Sherwin Vishesh Jathanna,
- Abstract要約: プレースホルダーのリアクションは、意味的コヒーレンスを犠牲にしてPIIを抑制する。
本稿では,検出されたPIIを局所的に生成した型一貫性のサロゲート値に置換するクライアントサイドプロキシであるSurrogateShieldを提案する。
実際のPIIがネットワーク境界を越えることはない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based assistants transmit user queries verbatim to third-party API endpoints that lie outside the user's audit or control. When those queries contain personally identifiable information (PII), the data persists on remote infrastructure subject to breach, subpoena, or policy change. Placeholder redaction (the prevailing mitigation) suppresses PII at the cost of semantic coherence, producing structurally degraded queries and correspondingly degraded responses. We present SurrogateShield, a client-side proxy that substitutes detected PII with locally generated, type-consistent surrogate values prior to transmission and restores originals in the response. No real PII crosses the network boundary. Detection runs through a three-stage cascade (PatternScan, EntityTrace, and ContextGuard) covering 22 PII types and quasi-identifier combinations grounded in Sweeney's k-anonymity framework. Surrogate-to-original mappings are sealed in an AES-256-GCM encrypted per-conversation ShadowMap that never leaves the device. Evaluations on a 1,124-query corpus demonstrate that the cascade reliably detects PII, achieving an overall F1 score of 98.87%. Surrogate substitution substantially outperforms placeholder redaction in semantic utility, yielding a 13.26 pp improvement in BERTScore (roberta-large), from 81.59% to 94.85%. Within this corpus, the local pipeline restricted real PII transmission across all tested query types; in a 100-query adversarial trial, a prompted LLM adversary recovered no original values from surrogate-substituted messages.
- Abstract(参考訳): LLMベースのアシスタントは、ユーザの監査やコントロールの外にあるサードパーティのAPIエンドポイントに、ユーザクエリを冗長に送信する。
これらのクエリが個人識別可能な情報(PII)を含んでいる場合、データは、違反、召喚状、あるいはポリシー変更の対象となるリモートインフラストラクチャに永続化される。
プレースホルダーのリアクション(一般的な緩和)は、意味的コヒーレンスを犠牲にしてPIIを抑圧し、構造的に劣化したクエリとそれに対応する劣化した応答を生成する。
本稿では,検出されたPIIを送信前に局所的に生成した型一貫性のサロゲート値に置換し,応答中の元の値を復元するクライアント側プロキシであるSurrogateShieldを提案する。
実際のPIIがネットワーク境界を越えることはない。
検出は3段階のカスケード(PatternScan、EntityTrace、ContextGuard)を通り、22のPIIタイプと、Sweeeneyのk-匿名フレームワークに基盤を置く擬似識別器の組み合わせをカバーする。
代理からオリジナルへのマッピングは、AES-256-GCM暗号化された会話ごとのシャドウマップに封印され、デバイスを離れることはない。
1,124キュリーコーパスの評価では、カスケードはPIIを確実に検出し、全体のF1スコアは98.87%に達する。
サロゲート置換はセマンティックユーティリティーにおけるプレースホルダーのリアクションを大幅に上回り、BERTScore (roberta-large)の13.26ppが81.59%から94.85%に改善された。
このコーパス内では、ローカルパイプラインは全てのテストされたクエリタイプで実際のPII送信を制限する。
関連論文リスト
- VCT: A Verifiable Transcript System for LLM Conversations [5.3181399750078535]
Verifiable Conversation Transcriptは、非線形LLMセマンティック操作を、アカウントレベルの認証状態遷移に組み込む。
セキュリティ分析は、標準的な暗号的仮定の下では、VCTがアカウントレベルの会話記録の完全性、一貫性、検証可能な共有性、非監査を保証することを証明している。
論文 参考訳(メタデータ) (2026-06-22T08:17:39Z) - A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots [1.948261185683419]
推論パイプライン全体を通して直接および間接的なインジェクションをインターセプトする3層フレームワークを提案する。
GPT-4o、Llama 3、Mistral 7Bの5,080サンプルの評価は、このフレームワークが攻撃成功率(ASR)を71.4%から11.3%に下げていることを示している。
論文 参考訳(メタデータ) (2026-06-17T23:59:57Z) - Hiding in Plain Floats: Steganographic Carriers for Indirect Prompt and Content Injection [0.0]
テキスト中心のインジェクション防御は、検査されたテキストビューの1つに悪意のある信号が見えると仮定する。
再現可能なLLM01スタイルの間接的プロンプト/入射障害モードについて検討した。
平らな英語で捕獲されたペイロードは、構造されたフロートパラメータとして輸送され、断片化されたテレメトリとしてのみ再構成されるとき、同じ検出器を通り過ぎます。
論文 参考訳(メタデータ) (2026-06-07T01:41:01Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents [2.585367539248893]
我々は,標準実行から明確化検索状態への遷移が,インジェクション攻撃に対するエージェントの感受性を高めるかどうかを検討する。
728のタスクアタックシナリオのベンチマークであるASPIを導入し、明確なエージェント状態として明確化を分離する。
明確化の探究は一貫して、脆弱性を大幅に増幅する。
論文 参考訳(メタデータ) (2026-05-17T08:30:45Z) - FedAttr: Towards Privacy-preserving Client-Level Attribution in Federated LLM Fine-tuning [58.80511162314259]
我々はフェデレート学習のための新しいクライアントレベルの属性プロトコルであるFedAttrを提案する。
FedAttrは、ペア化されたサブセット差分メカニズムを通じて、ウォーターマークされたデータでトレーニングされたクライアントを特定する。
100%のTPRと0%のFPRを達成し、TPRでは少なくとも44.4%、FPRでは19.1%を上回り、FLトレーニング時間に比べて6.3%のオーバーヘッドしか残っていない。
論文 参考訳(メタデータ) (2026-05-07T17:21:02Z) - Agent Control Protocol: Admission Control for Agent Actions [0.4929694290403903]
エージェントコントロールプロトコル(エージェントコントロールプロトコル、ACP)は、B2Bの機関環境における自律エージェントの受け入れ制御ガバナンスのための正式な仕様である。
ACPは、暗号ID、能力に基づく認可、決定論的リスク評価、連鎖デリゲート、および暗号化連鎖監査を定義する。
ACPはRBACとZero Trustの上で動作し、どちらのモデルも解決しない問題に対処する。
論文 参考訳(メタデータ) (2026-03-19T12:28:28Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning [58.57194301645823]
大規模言語モデル(LLM)は、現実のパーソナライズされたアプリケーションにますます統合されている。
RAGで使用される知識基盤の貴重かつしばしばプロプライエタリな性質は、敵による不正使用のリスクをもたらす。
これらの知識基盤を保護するための透かし技術として一般化できる既存の方法は、一般的に毒やバックドア攻撃を含む。
我々は、無害な」知識基盤の著作権保護の名称を提案する。
論文 参考訳(メタデータ) (2025-02-10T09:15:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。