論文の概要: Adversarial Prompts for Acceptance Collapse in Speculative Decoding
- arxiv url: http://arxiv.org/abs/2607.21804v1
- Date: Thu, 23 Jul 2026 20:42:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.998525
- Title: Adversarial Prompts for Acceptance Collapse in Speculative Decoding
- Title(参考訳): 投機的復号におけるアクセプタンス崩壊の逆転プロンプト
- Abstract要約: 我々はADSDを導入する。ADSDは、ターゲットが受け入れがたいトークンに対して、ドラフト確率質量をプッシュすることで検証器の受け入れを崩壊させる最初のプロンプトサフィックスアタックである。
GSM8Kデータセットでは、タスク品質を維持しながら平均サンプル時間を62.3%増加させています。
- 参考スコア(独自算出の注目度): 31.325779617189585
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Lossless acceleration schemes, such as speculative decoding, promise significant inference speedups by relying on dynamic token-level alignment between a draft and a target model. However, this guarantee of semantic equivalence masks a severe operational vulnerability: draft-target alignment can be systematically attacked. In this paper, we introduce ADSD, which, to the best of our knowledge, is the first prompt-suffix attack that collapses verifier acceptance by pushing draft probability mass toward tokens the target is unlikely to accept. ADSD uses Soft-Collapse, a verifier-aligned surrogate derived from the asymmetric speculative acceptance rule, together with a target-preservation objective that discourages obvious task corruption. ADSD successfully generates highly effective adversarial suffixes. On the GSM8K dataset, our attack increases the mean sample time by 62.3% while preserving the task quality. We further show that this vulnerability exists across different domains, speculative decoding strategies, and model architectures.
- Abstract(参考訳): 投機的復号化のような無意味な加速スキームは、ドラフトとターゲットモデルの間の動的なトークンレベルのアライメントに依存することにより、大きな推論スピードアップを約束する。
しかし、この意味的等価性の保証は深刻な運用上の脆弱性であり、ドラフトターゲットアライメントを体系的に攻撃することができる。
本稿では,ADSDを提案する。ADSDは,我々の知る限り,ターゲットが受け入れがたいトークンに対して,ドラフト確率質量をプッシュすることで検証器の受け入れを崩壊させる最初の急速サフィックス攻撃である。
ADSDは、非対称な投機的受理規則から派生した検証器整列サロゲートであるSoft-Collapseと、明らかなタスクの腐敗を阻止する目標保存目的を使用する。
ADSDは高い有効対向性接尾辞を生成する。
GSM8Kデータセットでは、タスク品質を維持しながら平均サンプル時間を62.3%増加させています。
さらに、この脆弱性は、異なるドメイン、投機的デコード戦略、モデルアーキテクチャにまたがって存在していることを示す。
関連論文リスト
- Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding [47.771248673145614]
投機的復号化は大規模言語モデル(LLM)推論を高速化する手法として広く採用されている。
モデルに基づく投機的復号化における新しいメカニズムレベルの脆弱性を同定する。
提案するMistletoeは、投機的復号化に対するステルス的な加速・崩壊攻撃である。
論文 参考訳(メタデータ) (2026-05-13T18:11:42Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction [24.416258744287166]
ICONは、タスクの連続性を維持しながら攻撃を中和する、調査と軽減のためのフレームワークである。
ICONは競争力のある0.4%のASRを達成し、商業グレード検出器と一致し、50%以上のタスクユーティリティーゲインを得る。
論文 参考訳(メタデータ) (2026-02-24T09:13:05Z) - Rethinking Security in Semantic Communication: Latent Manipulation as a New Threat [4.488447044579913]
ディープラーニングに基づくセマンティックコミュニケーション(SemCom)は,次世代無線ネットワークにおいて有望なパラダイムとして登場した。
本論文では,マン・イン・ザ・ミドル(MitM)攻撃者が送信されたセマンティクスを隠蔽的に操作できる基本的な潜時空間脆弱性を明らかにする。
論文 参考訳(メタデータ) (2025-12-03T01:54:11Z) - Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift [23.0914017433021]
この研究は、モデルウェイトや入力テキストを変更することなく、埋め込み層出力に直接知覚不能な摂動を注入することで脆弱性を利用する、新しいデプロイメントフェーズ攻撃のクラスを特定する。
本稿では,リスクトークンに関連付けられた埋め込みに注意深く最適化された摂動を導入する,実用的なモデルに依存しないフレームワークである検索ベースの埋め込みポジショニングを提案する。
論文 参考訳(メタデータ) (2025-09-08T05:00:58Z) - The Silent Saboteur: Imperceptible Adversarial Attacks against Black-Box Retrieval-Augmented Generation Systems [101.68501850486179]
本稿では,RAGシステムに対する敵攻撃について検討し,その脆弱性を同定する。
このタスクは、ターゲット文書を検索する非知覚的な摂動を見つけることを目的としており、もともとはトップ$k$の候補セットから除外されていた。
本稿では、攻撃者とターゲットRAG間の相互作用を追跡する強化学習ベースのフレームワークであるReGENTを提案する。
論文 参考訳(メタデータ) (2025-05-24T08:19:25Z) - Improving Adversarial Robustness to Sensitivity and Invariance Attacks
with Deep Metric Learning [80.21709045433096]
対向ロバスト性の標準的な方法は、サンプルを最小に摂動させることによって作られたサンプルに対して防御する枠組みを仮定する。
距離学習を用いて、最適輸送問題として逆正則化をフレーム化する。
予備的な結果から, 変分摂動の規則化は, 変分防御と敏感防御の両方を改善することが示唆された。
論文 参考訳(メタデータ) (2022-11-04T13:54:02Z) - A Self-supervised Approach for Adversarial Robustness [105.88250594033053]
敵対的な例は、ディープニューラルネットワーク(DNN)ベースの視覚システムにおいて破滅的な誤りを引き起こす可能性がある。
本稿では,入力空間における自己教師型対向学習機構を提案する。
これは、反逆攻撃に対する強力な堅牢性を提供する。
論文 参考訳(メタデータ) (2020-06-08T20:42:39Z) - Temporal Sparse Adversarial Attack on Sequence-based Gait Recognition [56.844587127848854]
このような攻撃に対して,最先端の歩行認識モデルが脆弱であることを示す。
生成した対向ネットワークに基づくアーキテクチャを用いて、対向的な高品質な歩行シルエットやビデオフレームを意味的に生成する。
実験結果から, フレームの1分の1しか攻撃されない場合, 対象モデルの精度は劇的に低下することがわかった。
論文 参考訳(メタデータ) (2020-02-22T10:08:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。