論文の概要: ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization
- arxiv url: http://arxiv.org/abs/2608.03210v1
- Date: Tue, 04 Aug 2026 06:48:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.064331
- Title: ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization
- Title(参考訳): ICO: 反復的コンテキスト最適化によるセマンティック・シフト・ジェイルブレイクの強化
- Authors: Hujian Zhu, Yihao Huang, Felix Juefei-Xu, Xinfeng Li, Peng Zeng, Simeng Qin, Qing Guo, Geguang Pu,
- Abstract要約: 反復文脈最適化(ICO)を用いたブラックボックス・コンテキスト対応セマンティック・シフト・ジェイルブレイクフレームワークを提案する。
ICOは8つの最先端のベースラインを一貫して上回り、平均的な攻撃成功率は74.6%である。
- 参考スコア(独自算出の注目度): 29.949923886553904
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Foundation models have achieved remarkable success across diverse tasks, but they remain vulnerable. To investigate such vulnerabilities, semantic-shift jailbreaks have recently emerged as a promising attack paradigm. They bypass explicit safety mechanisms by replacing harmful terms in original harmful questions with benign alternatives and leveraging contextual information to induce the target model to reinterpret these alternatives as their corresponding harmful concepts. However, existing semantic-shift jailbreaks often achieve limited effectiveness. In this work, we reveal that this limitation arises from overlooking the semantic-shift capability of contexts. Through systematic analysis, we find that contexts exhibit substantially different abilities in inducing semantic shifts: contexts with stronger semantic-shift capabilities are more likely to guide models toward recovering harmful meanings and achieving successful jailbreaks. Based on this finding, we systematically identify and distill the characteristics of effective contexts and propose a black-box context-aware semantic-shift jailbreak framework with Iterative Context Optimization (ICO). In each iteration, ICO leverages these characteristics and feedback from the target model to optimize contexts. Extensive experiments on three datasets and eight target foundation models demonstrate that ICO consistently outperforms eight state-of-the-art baselines, achieving an average attack success rate of 74.6%.
- Abstract(参考訳): ファンデーションモデルは様々なタスクで顕著な成功を収めてきたが、脆弱なままである。
このような脆弱性を調べるため、セマンティックシフトのジェイルブレイクは、最近、有望な攻撃パラダイムとして現れた。
元の有害な質問における有害な用語を良質な代替品に置き換え、コンテキスト情報を活用してターゲットモデルにこれらの代替品を対応する有害な概念として再解釈させることによって、明示的な安全性メカニズムを回避している。
しかし、既存のセマンティックシフトジェイルブレイクは、しばしば限定的な効果をもたらす。
本研究では,文脈のセマンティックシフト能力を見越すことから,この制限が生じることを明らかにした。
より強い意味シフト能力を持つコンテキストは、有害な意味を回復し、ジェイルブレイクを成功させるためにモデルを導く傾向にある。
そこで本研究では,有効コンテキストの特性を体系的に同定し,反復文脈最適化(ICO)を用いたブラックボックス・コンテキスト認識型セマンティック・シフト・ジェイルブレイク・フレームワークを提案する。
各イテレーションでは、ICOはこれらの特性とターゲットモデルからのフィードバックを利用してコンテキストを最適化します。
3つのデータセットと8つのターゲットベースモデルに対する大規模な実験により、ICOは8つの最先端ベースラインを一貫して上回り、平均的な攻撃成功率は74.6%である。
関連論文リスト
- Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs [56.53007443197966]
大規模推論モデル(LRM)は推論および生成タスクにおいて顕著な機能を示した。
彼らの明確なチェーン・オブ・シント(CoT)メカニズムは、新しいセキュリティリスクをもたらし、特にジェイルブレイク攻撃に対して脆弱である。
AE-CoTと呼ばれる適応的な進化的CoTジェイルブレイクフレームワークを提案し、これらの制限を克服する。
論文 参考訳(メタデータ) (2026-05-23T10:11:32Z) - LLM-Agnostic Semantic Representation Attack [18.00668872674083]
本稿では,敵対的目的をテキストのターゲットから悪意のあるセマンティック表現へと根本的に再認識する新しい LLM-Agnostic パラダイムを提案する。
我々は,このフレームワークをSemantic Representation Heuristic Search (SRHS)アルゴリズムを用いて運用し,対向的プロンプトの解釈可能性と構造的コヒーレンスを維持する。
当社のフレームワークは,26のオープンソース LLM に対して,99.71% の平均攻撃成功率を実現している。
論文 参考訳(メタデータ) (2026-05-09T11:43:47Z) - ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models [8.765213350762748]
ジェイルブレイク攻撃は 有害な出力を 引き出すためにアライメント・ガードをバイパスする
セマンティック・コヒーレントで高能率な対人プロンプトを生成するための新しいフレームワークであるForgeDANを提案する。
本評価は,従来のSOTAソリューションよりも優れた自然さとステルスを維持しつつ,高い脱獄率を達成することを示す。
論文 参考訳(メタデータ) (2025-11-17T16:19:21Z) - MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks [85.3303135160762]
MIRAGEは、物語駆動型コンテキストとロール没入を利用して、マルチモーダル大規模言語モデルにおける安全性メカニズムを回避する新しいフレームワークである。
最先端のパフォーマンスを達成し、最高のベースラインよりも攻撃成功率を最大17.5%向上させる。
役割の浸漬と構造的セマンティック再構築は、モデル固有のバイアスを活性化し、モデルが倫理的保護に自発的に違反することを実証する。
論文 参考訳(メタデータ) (2025-03-24T20:38:42Z) - Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models [53.580928907886324]
Reasoning-Augmented Conversationは、新しいマルチターンジェイルブレイクフレームワークである。
有害なクエリを良心的な推論タスクに再構成する。
RACEは,複雑な会話シナリオにおいて,最先端攻撃の有効性を実現する。
論文 参考訳(メタデータ) (2025-02-16T09:27:44Z) - Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions [50.40122190627256]
非倫理的反応を引き起こすために、対照的な推論を利用する新しいジェイルブレイク手法であるPOATEを導入する。
PoATEは意味論的に意図に反し、敵のテンプレートと統合し、有害なアウトプットを驚くほど微妙に操る。
これに対応するために、悪意のある意図と理性を検出するためにクエリを分解して、有害な応答を評価し、拒否するIntent-Aware CoTとReverse Thinking CoTを提案する。
論文 参考訳(メタデータ) (2025-01-03T15:40:03Z) - You Know What I'm Saying: Jailbreak Attack via Implicit Reference [22.520950422702757]
本研究は、以前見過ごされた脆弱性を特定し、Implicit Reference (AIR) による攻撃(Attack)と呼ぶ。
AIRは悪意のある目的を許容可能な目的に分解し、コンテキスト内の暗黙の参照を通してそれらをリンクする。
我々の実験は、AIRが最先端のLLMに対して有効であることを示し、ほとんどのモデルで90%を超える攻撃成功率(ASR)を達成した。
論文 参考訳(メタデータ) (2024-10-04T18:42:57Z) - The Great Contradiction Showdown: How Jailbreak and Stealth Wrestle in Vision-Language Models? [23.347349690954452]
VLM(Vision-Language Models)は、様々なタスクにおいて顕著なパフォーマンスを達成したが、Jailbreak攻撃には弱いままである。
これらの攻撃の有効性とステルスネスの基本的なトレードオフを理解するための情報理論の枠組みを提供する。
本研究では,非スティルシージェイルブレイク攻撃を効果的に検出し,モデルロバスト性を大幅に向上させるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-02T11:40:49Z) - Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles [2.5167155755957316]
コンテキスト・フュージョン・アタック (Context Fusion Attack, CFA) は、コンテキスト・フュージョン・ブラックボックス・ジェイルブレイク・アタックの手法である。
また,他の多ターン攻撃戦略と比較して,CFAの成功率,ばらつき,有害性を示す。
論文 参考訳(メタデータ) (2024-08-08T09:18:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。