論文の概要: The Model's Tell: Measuring Context-Leakage Attack Signals with Behavior Gauges
- arxiv url: http://arxiv.org/abs/2608.17829v1
- Date: Tue, 18 Aug 2026 14:28:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.366267
- Title: The Model's Tell: Measuring Context-Leakage Attack Signals with Behavior Gauges
- Title(参考訳): モデルからの示唆:行動ゲージを用いたコンテキストリークアタック信号の測定
- Abstract要約: LeakGaugeはリークの動作を調査し、プリフィルトークンの確率を攻撃リスクスコアにマップする。
LeakGaugeは未確認攻撃でAUROCの0.944--0.996の範囲に達した。
- 参考スコア(独自算出の注目度): 21.36981988877626
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLMs increasingly rely on external contexts, such as pre-defined system prompts or retrieved documents, to improve generation quality. However, processing these contexts alongside user queries creates an attack surface: adversarial inputs can induce models to disclose them. Prior probing studies suggest that leakage-related signals emerge in hidden states, yet the need to extract these states poses additional deployment challenges. In this paper, we explore whether this internal signal leaves a more accessible ``tell'' before decoding. We propose LeakGauge, which probes this response by appending a suffix that gauges leakage behavior and mapping its prefill token probabilities to an attack-risk score. While a direct gauge uses the initial tokens of confidential content, we find that a content-agnostic one that verbalizes leakage behavior yields more robust signals. Across 11 LLMs, including GLM-5.2 (753B) and Kimi-K3 (2.8T), LeakGauge reaches an AUROC range of 0.944--0.996 on unseen attacks. The signal remains stable when the content changes language or the attack shifts from verbatim to semantic disclosure. By activation-steering interventions, we further show that the risk score is sensitive to an internal leakage-related direction, relating the observable signal to the model's internal representation. In addition, LeakGauge enables an input detector with fewer than 0.5K extra parameters and added latency of 10.34 ms. Code: \href{https://github.com/yeasen-z/LeakGauge}.
- Abstract(参考訳): LLMは、生成品質を改善するために、事前に定義されたシステムプロンプトや検索されたドキュメントなどの外部コンテキストに依存している。
しかし、これらのコンテキストをユーザクエリと共に処理すると、攻撃面が生成される。
以前の調査では、漏洩関連信号が隠された状態に現れることが示唆されていたが、これらの状態を抽出する必要があるため、さらなる展開が困難になる。
本稿では、この内部信号が復号する前によりアクセスしやすい 'tell' を残しているかどうかを考察する。
本稿では,漏洩挙動を計測し,そのプリフィルトークン確率を攻撃リスクスコアにマッピングする接尾辞を付加することで,この応答を探索するLeakGaugeを提案する。
直接ゲージは機密コンテンツの初期トークンを使用するが、漏洩動作を言葉で示す内容に依存しないものは、より堅牢な信号をもたらす。
GLM-5.2 (753B) やKim-K3 (2.8T) を含む11機のLLMで、リークゴージは無敵攻撃でAUROCの範囲0.944--0.996に達する。
コンテンツが言語を変更したり、攻撃が動詞から意味的開示に移行した場合、信号は安定している。
さらに, アクティベーション・ステアリングによる介入により, リスクスコアは内部の漏洩関連方向に対して敏感であり, 観測可能な信号とモデルの内部表現との関係を示す。
さらにLeakGaugeでは、0.5K未満のパラメータと10.34ミリ秒のレイテンシを持つ入力検出が可能になった。
関連論文リスト
- AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration [6.39392731596656]
脆弱性修正コミットが与えられた場合、トリガーローカライゼーションは、脆弱性のあるプログラム状態を具体的な安全でない操作に変換する特定のステートメントを問う。
脆弱性トリガをローカライズするエージェントパイプラインであるAutoTraceについて,コードプロパティグラフ層を層単位で探索することによって紹介する。
エージェントは自身の権限でトリガーを決して受け入れない。報告されたトリガーはすべて、グラフから引き出された明確な証拠によって裏付けられている。
論文 参考訳(メタデータ) (2026-07-13T18:21:42Z) - From Attack Simulation to SIEM Rule: Deterministic Detection-as-Code Synthesis with Probe-Level Traceability [51.56484100374058]
セキュリティチームは、自身のシステムに対する攻撃をシミュレートして、監視が真の侵入者を捕まえるかどうかをチェックする。
人間はそのギャップを手でブリッジし、それぞれの発見を読み、対応するシグマルールを書きます。
ロックされたコーパスからプローブが引き出されると,この変換が部分的に自動化されることを示す。
論文 参考訳(メタデータ) (2026-06-03T14:26:25Z) - PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines [19.04544141221272]
PRISMは,情報漏洩を発生時の逐次的リスク蓄積問題として扱うリアルタイムディフェンスである。
各復号ステップにおいて、PRISMは語彙的、構造的、情報理論的、行動的、文脈的特徴にまたがる16の信号を校正リスクスコアに結合する。
PRISMは精度が1.000、リコールが0.712でF1 = 0.832を達成する。
論文 参考訳(メタデータ) (2026-05-11T14:11:41Z) - CyberCane: Neuro-Symbolic RAG for Privacy-Preserving Phishing Detection with Formal Ontology Reasoning [14.077535013043311]
CyberCaneは、ニューロシンボリックなフレームワークの統合である。
プライバシー保護による決定論的象徴的分析。
検索増強世代(RAG)
PhishOntは、フォーマルな推論チェーンを通じて検証可能な攻撃分類を可能にするOWLである。
論文 参考訳(メタデータ) (2026-04-26T07:08:00Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Only Backdoors in Fine-Tuned Large Language Models [10.377264470934843]
大きな言語モデルに対するバックドア攻撃は、通常、暗黙の悪意のある出力に秘密のトリガーを伴います。
我々はコンプライアンスのみのバックドアを導入し、ほぼ良質なデータセットで教師付き微調整を行い、プロンプトの小さなサブセットを任意の単一ワードトリガでサフィックスする。
本研究は, 毒性予算, 総微調整データセットサイズ, モデルサイズにまたがる, この良性ラベル中毒行動のマルチスケール解析を行った。
論文 参考訳(メタデータ) (2025-11-16T02:01:58Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Defending against Indirect Prompt Injection by Instruction Detection [109.30156975159561]
InstructDetectorは、LLMの動作状態を利用して潜在的なIPI攻撃を特定する、新しい検出ベースのアプローチである。
InstructDetectorは、ドメイン内設定で99.60%、ドメイン外設定で96.90%の検出精度を達成し、攻撃成功率をBIPIAベンチマークで0.03%に下げる。
論文 参考訳(メタデータ) (2025-05-08T13:04:45Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - Token-Level Adversarial Prompt Detection Based on Perplexity Measures
and Contextual Information [67.78183175605761]
大規模言語モデルは、敵の迅速な攻撃に影響を受けやすい。
この脆弱性は、LLMの堅牢性と信頼性に関する重要な懸念を浮き彫りにしている。
トークンレベルで敵のプロンプトを検出するための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-11-20T03:17:21Z) - On Trace of PGD-Like Adversarial Attacks [77.75152218980605]
敵対的攻撃は、ディープラーニングアプリケーションに対する安全性とセキュリティ上の懸念を引き起こす。
モデルの勾配一貫性を反映した適応応答特性(ARC)特性を構築する。
私たちの方法は直感的で、軽量で、非侵襲的で、データ不要です。
論文 参考訳(メタデータ) (2022-05-19T14:26:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。