論文の概要: LLM-Agnostic Semantic Representation Attack
- arxiv url: http://arxiv.org/abs/2605.08898v1
- Date: Sat, 09 May 2026 11:43:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.961766
- Title: LLM-Agnostic Semantic Representation Attack
- Title(参考訳): LLM非依存的意味表現攻撃
- Authors: Jiawei Lian, Jianhong Pan, Lefan Wang, Yi Wang, Tairan Huang, Shaohui Mei, Lap-Pui Chau,
- Abstract要約: 本稿では,敵対的目的をテキストのターゲットから悪意のあるセマンティック表現へと根本的に再認識する新しい LLM-Agnostic パラダイムを提案する。
我々は,このフレームワークをSemantic Representation Heuristic Search (SRHS)アルゴリズムを用いて運用し,対向的プロンプトの解釈可能性と構造的コヒーレンスを維持する。
当社のフレームワークは,26のオープンソース LLM に対して,99.71% の平均攻撃成功率を実現している。
- 参考スコア(独自算出の注目度): 18.00668872674083
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) increasingly employ alignment techniques to prevent harmful outputs. Despite these safeguards, attackers can circumvent them by crafting adversarial prompts. Predominant token-level optimization methods primarily rely on optimizing for exact affirmative templates (e.g., ``\textit{Sure, here is...}''). However, these paradigms frequently encounter bottlenecks such as suboptimal convergence, compromised prompt naturalness, and poor cross-model generalization. To address these limitations, we propose Semantic Representation Attack (SRA), a novel LLM-agnostic paradigm that fundamentally reconceptualizes adversarial objectives from exact textual targeting to malicious semantic representations. Theoretically, we establish the semantic Coherence-Convergence Relationship and derive a Cross-Model Semantic Generalization bound, proving that maintaining semantic coherence guarantees both white-box semantic convergence and black-box transferability. Technically, we operationalize this framework via the Semantic Representation Heuristic Search (SRHS) algorithm, which preserves interpretability and structural coherence of the adversarial prompts during incremental discrete token chunk expansion. Extensive evaluations demonstrate that our framework achieves a 99.71% average attack success rate across 26 open-source LLMs, with strong transferability and stealth.
- Abstract(参考訳): 大きな言語モデル(LLM)は、有害な出力を防ぐためにアライメント技術を採用する傾向にある。
これらの保護にもかかわらず、攻撃者は敵のプロンプトを作ればそれを回避できる。
有能なトークンレベルの最適化手法は主に、正確な肯定的テンプレート(例: ``\textit{Sure, ここでは、正しいテンプレートを最適化することに依存する。
」)。
しかしながら、これらのパラダイムは、最適下限収束、妥協された自然性、モデルの相互一般化の貧弱といったボトルネックに頻繁に遭遇する。
これらの制約に対処するため,SRA(Semantic Representation Attack, 意味表現攻撃)を提案する。
理論的には、セマンティック・コヒーレンス・コンバージェンス関係を確立し、クロスモデル・セマンティック・ジェネリゼーション境界を導出し、セマンティック・コヒーレンスを維持することは、ホワイトボックス・セマンティック・コンバージェンスとブラックボックス・トランスファービリティの両方を保証することを証明した。
技術的には、このフレームワークをSemantic Representation Heuristic Search (SRHS)アルゴリズムで運用し、漸進的な離散トークンチャンク展開時に、相手プロンプトの解釈可能性と構造的コヒーレンスを維持する。
大規模な評価の結果,このフレームワークは,26のオープンソース LLM に対して,99.71% の平均攻撃成功率を達成し,高い転送性とステルス性を示した。
関連論文リスト
- TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - Rethinking Security in Semantic Communication: Latent Manipulation as a New Threat [4.488447044579913]
ディープラーニングに基づくセマンティックコミュニケーション(SemCom)は,次世代無線ネットワークにおいて有望なパラダイムとして登場した。
本論文では,マン・イン・ザ・ミドル(MitM)攻撃者が送信されたセマンティクスを隠蔽的に操作できる基本的な潜時空間脆弱性を明らかにする。
論文 参考訳(メタデータ) (2025-12-03T01:54:11Z) - Semantic Representation Attack against Aligned Large Language Models [18.13997425681567]
大きな言語モデル(LLM)は、有害な出力を防ぐためにアライメント技術を採用する傾向にある。
現在の手法は通常、限定収束、不自然なプロンプト、高い計算コストに苦しむ正確な肯定応答を目標としている。
本稿では,LLMに対する敵対的目的を根本的に再認識する新しいパラダイムであるSemantic Representation Attackを紹介する。
論文 参考訳(メタデータ) (2025-09-18T15:06:46Z) - CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models [16.5022773312661]
本稿では,ジェイルブレイク攻撃に対する大規模視覚言語モデルの保護を目的とした,普遍的な認証防衛フレームワークを提案する。
まず、悪意のある応答と意図した応答のセマンティックな差異を定量化する新しい距離尺度を提案する。
そして, ランダム化スムーシングを用いて, 形式的堅牢性を保証するための回帰認証手法を考案する。
論文 参考訳(メタデータ) (2025-03-08T17:33:55Z) - Saliency Attention and Semantic Similarity-Driven Adversarial Perturbation [0.0]
SASSP(Saliency Attention and Semantic similarity driven adversarial Perturbation)は、文脈的摂動の有効性を改善するために設計された。
提案手法は,単語選択と摂動のための3段階の戦略を取り入れたものである。
SASSPは高い攻撃成功率と低い単語摂動率を得た。
論文 参考訳(メタデータ) (2024-06-18T14:07:27Z) - Advancing Generalized Transfer Attack with Initialization Derived Bilevel Optimization and Dynamic Sequence Truncation [49.480978190805125]
転送攻撃はブラックボックスアプリケーションに大きな関心を惹きつける。
既存の作業は、本質的に単一のレベルの目的 w.r.t. シュロゲートモデルを直接最適化する。
本稿では,上位レベル(UL)と下位レベル(LL)のサロゲート攻撃とのネスト関係を明示的に再構築する2レベル最適化手法を提案する。
論文 参考訳(メタデータ) (2024-06-04T07:45:27Z) - Defending Large Language Models against Jailbreak Attacks via Semantic
Smoothing [107.97160023681184]
適応型大規模言語モデル(LLM)は、ジェイルブレイク攻撃に対して脆弱である。
提案するSEMANTICSMOOTHは,与えられた入力プロンプトのセマンティック変換されたコピーの予測を集約するスムージングベースのディフェンスである。
論文 参考訳(メタデータ) (2024-02-25T20:36:03Z) - Mutual-modality Adversarial Attack with Semantic Perturbation [81.66172089175346]
本稿では,相互モダリティ最適化スキームにおける敵攻撃を生成する新しい手法を提案する。
我々の手法は最先端の攻撃方法より優れており、プラグイン・アンド・プレイ・ソリューションとして容易にデプロイできる。
論文 参考訳(メタデータ) (2023-12-20T05:06:01Z) - Semantic-Preserving Adversarial Code Comprehension [75.76118224437974]
本稿では,セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・セマンティック・アタック(SPACE)を提案する。
実験と分析により、SPACEは、コードに対するPrLMのパフォーマンスを高めながら、最先端の攻撃に対して堅牢であることを示す。
論文 参考訳(メタデータ) (2022-09-12T10:32:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。