論文の概要: Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing
- arxiv url: http://arxiv.org/abs/2604.15725v1
- Date: Fri, 17 Apr 2026 05:56:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.756733
- Title: Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing
- Title(参考訳): セマンティック・トリガーと心理学的フレームによる大規模共振モデルにおける共振ターゲットジェイルブレイク攻撃
- Authors: Zehao Wang, Lanjun Wang,
- Abstract要約: 本稿では,心理学に基づくReasoning-targeted Jailbreak Attack (PRJA)フレームワークを提案する。
セマンティックベースのトリガー選択モジュールと心理学ベースのインストラクション生成モジュールを統合している。
PRJAは、DeepSeek R1、Qwen2.5-Max、OpenAI o4-miniなど、いくつかの商用LEMに対して平均83.6%の攻撃成功率を達成した。
- 参考スコア(独自算出の注目度): 23.361428193356435
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Reasoning Models (LRMs) have demonstrated strong capabilities in generating step-by-step reasoning chains alongside final answers, enabling their deployment in high-stakes domains such as healthcare and education. While prior jailbreak attack studies have focused on the safety of final answers, little attention has been given to the safety of the reasoning process. In this work, we identify a novel problem that injects harmful content into the reasoning steps while preserving unchanged answers. This type of attack presents two key challenges: 1) manipulating the input instructions may inadvertently alter the LRM's final answer, and 2) the diversity of input questions makes it difficult to consistently bypass the LRM's safety alignment mechanisms and embed harmful content into its reasoning process. To address these challenges, we propose the Psychology-based Reasoning-targeted Jailbreak Attack (PRJA) Framework, which integrates a Semantic-based Trigger Selection module and a Psychology-based Instruction Generation module. Specifically, the proposed PRJA automatically selects manipulative reasoning triggers via semantic analysis and leverages psychological theories of obedience to authority and moral disengagement to generate adaptive instructions for enhancing the LRM's compliance with harmful content generation. Extensive experiments on five question-answering datasets demonstrate that PRJA achieves an average attack success rate of 83.6\% against several commercial LRMs, including DeepSeek R1, Qwen2.5-Max, and OpenAI o4-mini.
- Abstract(参考訳): 大規模推論モデル(LRM)は、最終回答とともにステップバイステップの推論チェーンを生成する強力な能力を示しており、医療や教育といった高度な分野への展開を可能にしている。
以前のジェイルブレイク攻撃研究では最終回答の安全性に焦点が当てられていたが、推論プロセスの安全性にはほとんど関心が向けられていない。
本研究では, 未知の回答を保ちながら, 推論ステップに有害な内容を注入する新たな問題を特定する。
この種の攻撃には2つの重要な課題がある。
1)入力命令を操作すると、故意にLRMの最終回答を変更することができ、
2) 入力質問の多様性は, LRMの安全アライメント機構を一貫して回避し, 有害な内容を推論プロセスに埋め込むことを困難にしている。
これらの課題に対処するために、セマンティックベースのトリガー選択モジュールと心理学ベースの命令生成モジュールを統合した、心理学ベースの推論ターゲットジェイルブレイク攻撃(PRJA)フレームワークを提案する。
特に,提案するPRJAは,意味分析によって操作的推論のトリガを自動的に選択し,権威と道徳的脱着に対する服従の心理学的理論を活用して,有害なコンテンツ生成に対するLRMのコンプライアンスを強化する適応的指示を生成する。
5つの質問回答データセットに関する大規模な実験は、PRJAがDeepSeek R1、Qwen2.5-Max、OpenAI o4-miniを含むいくつかの商用LEMに対して平均攻撃成功率83.6\%を達成することを示した。
関連論文リスト
- STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models [12.133996629992318]
本稿では、推論プロセスを通じて堅牢なプライバシ保護を実現するパラメータフリー・推論時アンラーニングフレームワークを提案する。
R-TOFUベンチマークの実験は、STaRが最小限のユーティリティ損失で包括的で安定したアンラーニングを実現することを示した。
論文 参考訳(メタデータ) (2026-01-14T08:35:23Z) - When Models Outthink Their Safety: Mitigating Self-Jailbreak in Large Reasoning Models with Chain-of-Guardrails [74.63933201261595]
大規模推論モデル(LRM)は複雑な推論タスクにおいて顕著な能力を示す。
LRMは、有害なコンテンツ生成やジェイルブレイク攻撃など、深刻な安全リスクに弱いままである。
安全でない推論ステップを再構成またはバックトラックするトレーニングフレームワークであるChain-of-Guardrail(CoG)を提案する。
論文 参考訳(メタデータ) (2025-10-24T09:32:25Z) - One Token Embedding Is Enough to Deadlock Your Large Reasoning Model [91.48868589442837]
我々は, LRMの生成制御フローをハイジャックする資源枯渇手法であるDeadlock Attackを提案する。
提案手法は4つの先進LEMにおいて100%の攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-10-12T07:42:57Z) - ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning [64.32925552574115]
ARMORは、jailbreak戦略を分析し、コアインテントを抽出する、大規模な言語モデルである。
ARMORは最先端の安全性能を達成し、平均有害率は0.002であり、高度な最適化ベースのジェイルブレイクに対する攻撃成功率は0.06である。
論文 参考訳(メタデータ) (2025-07-14T09:05:54Z) - HauntAttack: When Attack Follows Reasoning as a Shadow [34.70760016394781]
本稿では,新規かつ汎用的なブラックボックス攻撃フレームワークHauntAttackを紹介する。
既存の質問における重要な推論条件を有害な指示で修正する。
攻撃成功率の平均は70%であり,最強のベースラインに対して最大12ポイントの絶対的改善を達成できた。
論文 参考訳(メタデータ) (2025-06-08T07:45:48Z) - SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models [50.34706204154244]
推論能力の獲得は、引き継がれた安全アライメントを壊滅的に劣化させる。
特定のシナリオは、25倍の攻撃率を被る。
MLRMは、厳密な推論と問合せの安全結合にもかかわらず、初期段階の自己補正を示す。
論文 参考訳(メタデータ) (2025-04-09T06:53:23Z) - Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions [50.40122190627256]
非倫理的反応を引き起こすために、対照的な推論を利用する新しいジェイルブレイク手法であるPOATEを導入する。
PoATEは意味論的に意図に反し、敵のテンプレートと統合し、有害なアウトプットを驚くほど微妙に操る。
これに対応するために、悪意のある意図と理性を検出するためにクエリを分解して、有害な応答を評価し、拒否するIntent-Aware CoTとReverse Thinking CoTを提案する。
論文 参考訳(メタデータ) (2025-01-03T15:40:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。