論文の概要: Reactivating Alignment: Defending LLMs from Jailbreaks via Intention-Aware Input-Output Matching
- arxiv url: http://arxiv.org/abs/2610.04470v1
- Date: Sat, 03 Oct 2026 12:17:54 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:40:32.248673
- Title: Reactivating Alignment: Defending LLMs from Jailbreaks via Intention-Aware Input-Output Matching
- Title(参考訳): 再活性化アライメント:意図的入力出力マッチングによるジェイルブレイクからLLMを保護する
- Abstract要約: 大規模言語モデル(LLM)は、有害な意図を隠蔽するジェイルブレイク攻撃に対して脆弱である。
我々は、意図抽出問題として緩和を再構築する世代間ジェイルブレイク防御であるSENTINELを提案する。
SENTINELは脱獄率を5%に低下させ, 過度な拒絶を維持した。
- 参考スコア(独自算出の注目度): 27.485504993716884
- License:
- Abstract: Large language models (LLMs) remain vulnerable to jailbreak attacks that conceal harmful intent within complex adversarial prompts. Existing defenses primarily rely on input perturbation or harmful-output suppression, but they rarely model where malicious intent resides, resulting in brittle protection and excessive over-refusal. We propose SENTINEL, a plug-and-play, generation-time jailbreak defense that reframes mitigation as an intent extraction problem. Our key insight is that instruction-tuned LLMs exhibit strong input--output semantic consistency: regardless of jailbreak complexity, generated outputs tend to align with the attacker's true intent. SENTINEL exploits this property by matching semantically aligned input--output regions to extract intention-revealing subsequences, scores these subsequences using refusal-direction projections to estimate harmfulness, and halts generation when necessary. Experiments on HarmBench across multiple LLMs show that SENTINEL reduces jailbreak success rates to close to 5\% while maintaining low over-refusal. We further demonstrate robustness to adaptive attacks and provide a mechanistic interpretation: SENTINEL re-distributes jailbreak features from alignment blind spots to aligned regions.
- Abstract(参考訳): 大規模言語モデル(LLM)は、複雑な敵のプロンプト内で有害な意図を隠蔽するジェイルブレイク攻撃に対して脆弱なままである。
既存の防御は主に入力の摂動や有害な出力抑制に頼っているが、悪意のある意図がある場所をモデル化することは滅多になく、不安定な保護と過剰な過剰な拒絶をもたらす。
我々は,意図抽出問題として緩和を再構築する,プラグイン・アンド・プレイの世代別ジェイルブレイクディフェンスであるSENTINELを提案する。
我々の重要な洞察は、命令調整されたLLMは、強い入力-出力セマンティック一貫性を示す: ジェイルブレイクの複雑さに関わらず、生成された出力は攻撃者の真の意図に合致する傾向がある。
複数のLDMを対象としたHarmBenchの実験では、SENTINELは過度な拒絶を維持しながら、ジェイルブレイクの成功率を5\%に下げている。
SENTINELは、アライメントブラインドスポットからアライメント領域へ、ジェイルブレイク機能を再配布します。
関連論文リスト
- Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics [50.36375380196006]
ジェイルブレイクプロンプトは、大規模な言語モデルにおけるアライメントガードレールをバイパスすることができる。
先行検出アプローチは固定距離空間に大きく依存する。
この仮定は,意図によって無視されるが,安全関連キーワードを含む疑似悪質なプロンプトの下で破られることを示す。
本稿では, LLM を入力を出力に変換する運動系として扱う Manifold Trajectory Kinetics (MTK) を提案する。
論文 参考訳(メタデータ) (2026-06-05T14:49:26Z) - Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models [2.6140509675507384]
我々はセキュリティと解釈可能性の両方の観点からジェイルブレイクを研究する。
隠れアクティベーションにおける構造をキャプチャするテンソルベース潜在表現フレームワークを提案する。
以上の結果から,脱獄行動が内部構造に根ざしていることが示唆された。
論文 参考訳(メタデータ) (2026-02-12T02:43:17Z) - Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning [48.100552417137656]
PASSは、初期のジェイルブレイクプロンプトを形式化された記述に変換するために強化学習を使用している。
我々は、共通のオープンソースモデルに関する広範な実験を行い、攻撃の有効性を実証した。
論文 参考訳(メタデータ) (2025-09-28T01:38:00Z) - xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking [32.89084809038529]
ブラックボックス・ジェイルブレイク(Black-box jailbreak)は、大規模な言語モデルの安全メカニズムをバイパスする攻撃である。
強化学習(RL)を利用した新しいブラックボックスジェイルブレイク手法を提案する。
我々は,より厳密で総合的なジェイルブレイク成功評価を提供するために,キーワード,意図マッチング,回答バリデーションを取り入れた総合的ジェイルブレイク評価フレームワークを導入する。
論文 参考訳(メタデータ) (2025-01-28T06:07:58Z) - Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense [55.77152277982117]
私たちは、jailbreak攻撃から防御するために設計された方法であるLayer-AdvPatcherを紹介します。
私たちは、自己拡張データセットを通じて、大規模言語モデル内の特定のレイヤにパッチを適用するために、未学習の戦略を使用します。
我々の枠組みは、脱獄攻撃の有害性と攻撃の成功率を減らす。
論文 参考訳(メタデータ) (2025-01-05T19:06:03Z) - LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds [98.20826635707341]
ジェイルブレイク攻撃は、慎重に製作されたプロンプトを通じて有害なアウトプットを引き出すことによって、安全に整合したLDMの脆弱性を露呈する。
私たちはジェイルブレイクを推論時のミスアライメントとして捉え、高速でブラックボックスのベスト・オブ・N$サンプリングアタックであるLIARを導入しました。
また、安全アライメント強度を定量化し、最適下界を導出するための理論的「ジェイルブレイクに対する安全ネット」指標も導入する。
論文 参考訳(メタデータ) (2024-12-06T18:02:59Z) - HSF: Defending against Jailbreak Attacks with Hidden State Filtering [14.031010511732008]
隠れ状態フィルタ(HSF)に基づくジェイルブレイク攻撃防御戦略を提案する。
HSFは、推論プロセスが始まる前に、モデルが相手の入力をプリエンプティブに識別し、拒否することを可能にする。
不正なユーザクエリに対する応答を最小限に抑えながら、Jailbreak攻撃の成功率を大幅に低下させる。
論文 参考訳(メタデータ) (2024-08-31T06:50:07Z) - AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models [54.95912006700379]
本稿では,大規模言語モデルに対する新たなジェイルブレイク攻撃であるAutoDANを紹介する。
AutoDANは、慎重に設計された階層型遺伝的アルゴリズムによって、ステルスなジェイルブレイクプロンプトを自動的に生成できる。
論文 参考訳(メタデータ) (2023-10-03T19:44:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。