論文の概要: Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries
- arxiv url: http://arxiv.org/abs/2604.15717v1
- Date: Fri, 17 Apr 2026 05:40:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.753046
- Title: Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries
- Title(参考訳): グレーゾーンへ:ドメインコンテキストはLLMの安全性境界をブルーにする
- Authors: Ki Sen Hung, Xi Yang, Chang Liu, Haoran Li, Kejiang Chen, Changxuan Fan, Tsun On Kwok, Weiming Zhang, Xiaomeng Li, Yangqiu Song,
- Abstract要約: Jargonは、安全調査コンテキストと敵との相互作用を組み合わせたフレームワークで、93%以上の攻撃成功率を達成する。
良性入力と有害入力の間の中間領域,つまり拒絶決定が信頼できないグレーゾーンをJargonクエリが占めていることを示す。
我々は、補助的かつ無害な応答に向けてモデルを操る政策誘導型安全ガードを設計し、微調整によってこの機能を内部化する。
- 参考スコア(独自算出の注目度): 73.1205700856963
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A central goal of LLM alignment is to balance helpfulness with harmlessness, yet these objectives conflict when the same knowledge serves both legitimate and malicious purposes. This tension is amplified by context-sensitive alignment: we observe that domain-specific contexts (e.g., chemistry) selectively relax defenses for domain-relevant harmful knowledge, while safety-research contexts (e.g., jailbreak studies) trigger broader relaxation spanning all harm categories. To systematically exploit this vulnerability, we propose Jargon, a framework combining safety-research contexts with multi-turn adversarial interactions that achieves attack success rates exceeding 93% across seven frontier models, including GPT-5.2, Claude-4.5, and Gemini-3, substantially outperforming existing methods. Activation space analysis reveals that Jargon queries occupy an intermediate region between benign and harmful inputs, a gray zone where refusal decisions become unreliable. To mitigate this vulnerability, we design a policy-guided safeguard that steers models toward helpful yet harmless responses, and internalize this capability through alignment fine-tuning, reducing attack success rates while preserving helpfulness.
- Abstract(参考訳): LLMアライメントの主目的は、助けと無害のバランスをとることであるが、これらの目的は、同じ知識が正当な目的と悪質な目的の両方に役立つ場合に矛盾する。
この緊張は、コンテキスト依存的なアライメントによって増幅される: ドメイン固有のコンテキスト(例えば化学)が、ドメイン関連有害な知識に対する防御を選択的に緩和するのに対し、セーフティ・リサーチ・コンテキスト(例えばジェイルブレイク研究)は、すべての有害カテゴリーにまたがる広範な緩和を引き起こす。
この脆弱性を体系的に活用するために,GPT-5.2, Claude-4.5, Gemini-3を含む7つのフロンティアモデルにおいて, 攻撃成功率93%を超えるマルチターン対向相互作用と安全検索コンテキストを組み合わせたフレームワークであるJargonを提案する。
活性化空間解析により、Jargonクエリが良性入力と有害入力の間の中間領域、つまり拒絶決定が信頼できないグレーゾーンを占めることが明らかになった。
この脆弱性を緩和するため、我々は、有用な無害な応答をモデルにするためのポリシー誘導型安全ガードを設計し、細調整をアライメントして攻撃成功率を低減し、有用性を保ちながら、その能力を内部化する。
関連論文リスト
- HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task [42.665798473119516]
CG-CoT(Context-Guided Chain-of-Thought)を特徴とするアーキテクチャ非依存型セーフガードを提案する。
CG-CoTは、リスクアセスメントをアクティブな知覚に分解し、相互作用対象や関連する空間近傍への注意を順次固定する。
実験により、我々のモデルであるHomeGuardは安全性を大幅に向上し、ベースモデルと比較してリスクマッチ率を30%以上改善することが示された。
論文 参考訳(メタデータ) (2026-03-15T13:09:43Z) - Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models [50.91504059485288]
本報告では,全頭部のグローバルな最適化により,安全クリティカルな注意点を同時に識別するフレームワークを提案する。
我々は,アクティベーション・リマッチによって同定された安全ベクトルを利用する,新しい推論時ホワイトボックス・ジェイルブレイク法を開発した。
論文 参考訳(メタデータ) (2026-01-22T09:32:43Z) - Understanding and Preserving Safety in Fine-Tuned LLMs [20.821783178639063]
微調整データが無害であっても、微調整は安全性を著しく低下させる可能性がある。
低ランクな安全部分空間と矛盾する勾配成分を明示的に除去する軽量なアプローチSPFを提案する。
SPFは、ダウンストリームタスクのパフォーマンスを一貫して維持し、敵の微調整シナリオであっても、トレーニング済みのほぼすべての安全アライメントを回復する。
論文 参考訳(メタデータ) (2026-01-15T07:33:13Z) - JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models [26.838410830637304]
VLM(Vision-Language Models)は優れた性能を示すが、強力な視覚エンコーダの統合により攻撃面が大幅に拡張されている。
安全境界探索と安全境界交差という2つの段階からなる新しい遅延宇宙脱獄フレームワークであるJailBoundを提案する。
以上の結果から,JailBoundは平均94.32%のホワイトボックス,67.28%のブラックボックス攻撃を達成し,SOTA法より6.17%,21.13%高い結果を得た。
論文 参考訳(メタデータ) (2025-05-26T07:23:00Z) - Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models [53.580928907886324]
Reasoning-Augmented Conversationは、新しいマルチターンジェイルブレイクフレームワークである。
有害なクエリを良心的な推論タスクに再構成する。
RACEは,複雑な会話シナリオにおいて,最先端攻撃の有効性を実現する。
論文 参考訳(メタデータ) (2025-02-16T09:27:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。