論文の概要: Decomposition Attacks Across Unlinkable Identities: Limits of Stateful Defenses for LLM Services
- arxiv url: http://arxiv.org/abs/2608.17445v1
- Date: Tue, 18 Aug 2026 07:26:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.253311
- Title: Decomposition Attacks Across Unlinkable Identities: Limits of Stateful Defenses for LLM Services
- Title(参考訳): LLMサービスのためのステートフルディフェンスの限界
- Authors: Bowen Sun, Zhengyue Zhao, Xiaogeng Liu, Yinzhi Cao, Chaowei Xiao,
- Abstract要約: ほとんどの大規模言語モデルはステートレスディフェンスを使用しており、これは有害なタスクを拒否する現在の要求のみを判断する。
分解攻撃は、有害なタスクを個別に許容される要求に分割し、回答を組み合わせることで、この制限を利用する。
達成可能なセキュリティとユーティリティのトレードオフは、同じ機能に対する良質な要求がどのようにグループ化されるかに完全に依存していることを示します。
- 参考スコア(独自算出の注目度): 56.0553456562323
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most large language model services use stateless defenses, which judge only the current request, to refuse harmful tasks. Decomposition attacks exploit this limitation by splitting a harmful task into individually permissible requests and combining their answers. Defending against them therefore requires a stateful monitor that considers requests together. If it can group all requests for one attacker task, it can stop the attack. However, attackers can use unlinkable identities and combine answers elsewhere, leaving no reliable grouping signal. We ask whether decomposition attacks can still be stopped under this setting. For a fixed attack strategy without retries, we prove that the achievable security and utility tradeoff depends entirely on how benign requests for the same capabilities are grouped. Persistent, recognizable groups permit a useful defense; fresh, indistinguishable groups do not. When attackers can retry and learn from Allow/Block decisions, this useful operating point disappears: the feedback reveals what passes but not whether a block was correct. Experiments on 91 executable tasks and 11,393 capability-matched benign requests support these results. Under a 1% denial cap for these requests and a 0.5% cap for unrelated background traffic, all ten tested policies, including one privileged policy with an exact request-to-operation map, either fail to stop attacks or exceed the budget. On defense-unseen task families, attack success is at least 99% after one attempt and 100% after two. Effective defenses therefore require additional evidence or mechanisms tied to grouping, such as reliable identity linkage, costs for fresh identities, or control over answer use.
- Abstract(参考訳): ほとんどの大規模言語モデルは、現在の要求のみを判断するステートレスディフェンスを使用して、有害なタスクを拒否する。
分解攻撃は、有害なタスクを個別に許容される要求に分割し、回答を組み合わせることで、この制限を利用する。
そのため、それらに対する防御には、リクエストを一緒に検討するステートフルなモニターが必要です。
1つの攻撃タスクに対するすべてのリクエストをグループ化できれば、攻撃を止めることができる。
しかし、攻撃者はリンク不能なIDを使用し、他の場所で回答を組み合わせることができ、信頼できるグループ信号は残らない。
この設定で分解攻撃を停止できるかどうかを問う。
リトライのない固定攻撃戦略では、達成可能なセキュリティとユーティリティのトレードオフが、同じ機能に対する良質な要求をどのようにグループ化するかに完全に依存していることを証明する。
永続的で認識可能なグループは有用な防御を許す。
攻撃者がAllow/Blockの判断から再試行して学ぶことができれば、この有用な操作ポイントは消える。
91の実行可能なタスクと11,393の能力にマッチしたベニグリクエストの実験は、これらの結果をサポートしている。
これらの要求に対する1%の拒否権と、無関係なバックグラウンドトラフィックに対する0.5%の上限の下で、厳密なリクエスト・トゥ・オペレーティング・マップを持つ特権ポリシーを含む10のテスト済みポリシーは、攻撃を中止するか予算を超えるかに失敗する。
防御不能のタスクファミリーでは、攻撃の成功率は1回の試行で99%以上、2回で100%以上である。
したがって、効果的な防御には、信頼できるアイデンティティリンク、新鮮なアイデンティティのコスト、回答の使用の制御など、グループ化に関連する追加の証拠やメカニズムが必要である。
関連論文リスト
- Coverage Is Not Containment: A Fundamental Limit of Admission-Time Defenses Against Coordinated Poisoning of Vector Retrieval [0.0]
Retrieval-augmented Generationは、ベクトルストアからのパスを取得し、それらをコンテキストとして信頼することで、質問に答える。
最近の、魅力的な防衛フィルターは、摂取時に毒を盛り、ハブのように振る舞う文書を拒絶する。
個々の文書を個別に注入するコーディネートされた敵に打ち負かされることを示す。
論文 参考訳(メタデータ) (2026-08-17T03:18:51Z) - The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections [74.60337113759313]
現在のジェイルブレイクとプロンプトインジェクションに対する防御は、通常、有害な攻撃文字列の静的セットに対して評価される。
我々は,この評価プロセスに欠陥があることを論じる。代わりに,攻撃戦略を明示的に修正したアダプティブアタッカーに対する防御を,防衛設計に対抗して評価すべきである。
論文 参考訳(メタデータ) (2025-10-10T05:51:04Z) - Benchmarking Misuse Mitigation Against Covert Adversaries [80.74502950627736]
既存の言語モデルの安全性評価は、オーバースト攻撃と低レベルのタスクに重点を置いている。
我々は、隠蔽攻撃と対応する防御の評価を自動化するデータ生成パイプラインである、ステートフルディフェンスのためのベンチマーク(BSD)を開発した。
評価の結果,分解攻撃は有効な誤用防止剤であり,その対策としてステートフルディフェンスを強調した。
論文 参考訳(メタデータ) (2025-06-06T17:33:33Z) - Dynamics of Adversarial Attacks on Large Language Model-Based Search Engines [7.260315265550391]
検索エンジンにおけるランキング操作攻撃のダイナミクスについて検討する。
システムダイナミクスの転換点を同定し、プレイヤーが前方を向いているとき、協調が維持される可能性がより高いことを示す。
私たちの研究は、彼らの脆弱性を理解し緩和するための理論的基盤と実践的な洞察を提供します。
論文 参考訳(メタデータ) (2025-01-01T06:23:26Z) - The Good, the Bad and the Ugly: Watermarks, Transferable Attacks and Adversarial Defenses [21.975560789792073]
バックドアベースの透かしと敵防御の既存の定義を2人のプレイヤー間の対話プロトコルとして定式化し拡張する。
ほぼすべての差別的学習タスクにおいて、少なくとも2つののうちの1つ(透かしまたは敵の防御)が存在している。
転送可能な攻撃の概念を満たすタスクは、暗号プリミティブを意味することを示す。
論文 参考訳(メタデータ) (2024-10-11T14:44:05Z) - Illusory Attacks: Information-Theoretic Detectability Matters in Adversarial Attacks [76.35478518372692]
エプシロン・イリューソリー(epsilon-illusory)は、シーケンシャルな意思決定者に対する敵対的攻撃の新たな形態である。
既存の攻撃と比較して,エプシロン・イリューソリーの自動検出は極めて困難である。
以上の結果から, より優れた異常検知器, 効果的なハードウェアおよびシステムレベルの防御の必要性が示唆された。
論文 参考訳(メタデータ) (2022-07-20T19:49:09Z) - Zero-Query Transfer Attacks on Context-Aware Object Detectors [95.18656036716972]
敵は、ディープニューラルネットワークが誤った分類結果を生成するような摂動画像を攻撃する。
自然の多目的シーンに対する敵対的攻撃を防御するための有望なアプローチは、文脈整合性チェックを課すことである。
本稿では,コンテキスト整合性チェックを回避可能な,コンテキスト整合性攻撃を生成するための最初のアプローチを提案する。
論文 参考訳(メタデータ) (2022-03-29T04:33:06Z) - RayS: A Ray Searching Method for Hard-label Adversarial Attack [99.72117609513589]
我々は、レイサーチ攻撃(RayS)を提案し、これはハードラベル攻撃の有効性と効率を大幅に改善する。
モデルの正当性チェックとしても使用できる。
論文 参考訳(メタデータ) (2020-06-23T07:01:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。