論文の概要: Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization
- arxiv url: http://arxiv.org/abs/2607.15977v1
- Date: Fri, 17 Jul 2026 14:09:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.871087
- Title: Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization
- Title(参考訳): 拒絶は安全ではない! LLM-Driven Content Humorization の潜在的安全性リスクのベンチマーク
- Authors: Yu Cui, Ruiqing Yue, Tingyu Li, Sicheng Pan, Zhuoyu Sun, Xufeng Zhang, Baohan Huang, Haibin Zhang, Cong Zuo,
- Abstract要約: 大規模言語モデル (LLM) の安全性防衛について, 広く研究されている。
最近の研究は、ユーモアを間接的拒絶機構として活用し、ジェイルブレイクのシナリオにおける過剰な拒絶を軽減する新しい方向を探っている。
ユーモゼーション中に潜伏する安全リスクの伝播を評価するための新しいフレームワークであるtextscHumorSafeを提案する。
- 参考スコア(独自算出の注目度): 12.193527845341862
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Safety defenses for large language models (LLMs) have been extensively studied, with existing approaches focusing on attack detection and refusal mechanisms. Such fixed-form direct refusal strategies may introduce the risk of prefix injection attacks. Recent work has explored a new direction that leverages humor as an indirect refusal mechanism to mitigate over-refusal in jailbreak scenarios and reduce prefix injection risks. However, this approach implicitly assumes that humorous responses are safe. Whether humorization itself introduces safety risks remains unexplored. To address this issue, we conduct an exploratory study involving over 30,000 real-world agent interaction records and 45 stand-up comedians, revealing practical safety concerns in LLM-based content humorization. Motivated by these findings, we propose \textsc{HumorSafe}, a novel framework for evaluating latent safety risk propagation during humorization. \textsc{HumorSafe} enables LLMs to learn harmful humorization patterns and use them to transform benign content into humorous content with safety risks. Across five frontier LLMs, we find that LLMs can introduce stereotypes and toxicity during humorization. We further propose \textsc{HumorPIA}, a prompt injection attack that exploits latent risks in humor-based defenses. \textsc{HumorPIA} preserves the appearance of safe humorous refusal while covertly injecting harmful content, allowing latent risks to evade existing detection mechanisms. Experiments show that it increases toxicity by 3.14$\times$ while maintaining an apparent safety rate of 97.8\% even under defense settings. Our findings highlight a gap in existing LLM safety evaluations under humorized settings.
- Abstract(参考訳): 大規模言語モデル(LLM)の安全性防衛について,攻撃検出と拒絶機構に着目した研究が盛んに行われている。
このような固定形式の直接拒絶戦略は、プレフィックスインジェクション攻撃のリスクをもたらす可能性がある。
最近の研究は、ユーモアを間接的拒絶機構として活用し、ジェイルブレイクのシナリオにおける過剰な拒絶を軽減し、プレフィックス注入のリスクを低減する新しい方向を探っている。
しかし、このアプローチはユーモラスな反応が安全であると暗黙的に仮定する。
ユーモア化自体が安全性のリスクをもたらすかどうかは未定である。
この問題に対処するため,本研究では,3万件以上の実世界のエージェントインタラクション記録と45人のコメディアンを対象とした探索的研究を行い,LCMによるコンテンツユーモライゼーションの実践的安全性に関する懸念を明らかにした。
これらの知見に触発され, ユーモライゼーション中の潜伏安全性の伝播を評価するための新しい枠組みである「textsc{HumorSafe}」を提案する。
\textsc{HumorSafe} は LLM が有害なユーモラス化パターンを学習し、良質なコンテンツを安全リスクのあるユーモラスなコンテンツに変換することを可能にする。
5つのフロンティア LLM にまたがって, LLM はユーモライゼーション中にステレオタイプや毒性を導入することができる。
さらに、ユーモアベースの防御において、潜伏リスクを生かした即時注射攻撃である「textsc{HumorPIA}」を提案する。
textsc{HumorPIA} は、有害な内容を隠蔽的に注入しながら、安全なユーモラスな拒絶の外観を保ち、潜伏リスクが既存の検出メカニズムを回避することができる。
実験では、防御条件下であっても、毒性を3.14$\times$で増加させ、明らかな安全性率97.8\%を維持していることが示された。
本研究は, ユーモライズした環境下でのLCMの安全性評価のギャップを浮き彫りにした。
関連論文リスト
- RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z) - LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning [61.594212398272184]
Low-Rank Extrapolation (LoX)は、良質で悪意のある微調整攻撃に対する堅牢性を改善する。
LoXは攻撃成功率を11%から54%に下げる。
論文 参考訳(メタデータ) (2025-06-18T16:30:02Z) - Bypassing Safety Guardrails in LLMs Using Humor [2.8282906214258805]
我々は,大言語モデル(LLM)の安全ガードレールをユーモラスなプロンプトで回避可能であることを示す。
我々のメソッドは安全でないリクエストを編集せず、固定されたテンプレートに従う。
論文 参考訳(メタデータ) (2025-04-09T04:58:14Z) - HumorReject: Decoupling LLM Safety from Refusal Prefix via A Little Humor [5.751453679891771]
大きな言語モデル(LLM)は、安全のために明示的な拒絶プレフィックスに依存している。
We introduced HumorReject, a novel data-driven approach that reimaging LLM safety by decouping it from refusal prefixes through humor。
本手法は,様々な攻撃ベクトルに対して優れたロバスト性を示しながら,一般的な「過防衛」問題に効果的に対処する。
論文 参考訳(メタデータ) (2025-01-23T14:02:51Z) - LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts [88.96201324719205]
大規模言語モデル(LLM)の安全性に関する懸念は、事前訓練中に潜在的に有害なデータに曝されることにより、大きな注目を集めている。
我々は、有害なコンテンツに意味的に関連していると思われる良心的なプロンプトが、安全性のメカニズムを回避できる新しい安全性脆弱性をLSMで特定する。
我々は,事前学習における有害なプロンプトに関連するアクターを識別する新しい攻撃手法,textitActorBreakerを導入する。
論文 参考訳(メタデータ) (2024-10-14T16:41:49Z) - Uncovering Safety Risks of Large Language Models through Concept Activation Vector [13.804245297233454]
大規模言語モデル(LLM)に対する攻撃を誘導する安全概念活性化ベクトル(SCAV)フレームワークについて紹介する。
そこで我々は,攻撃プロンプトと埋め込みレベルの攻撃の両方を生成できるSCAV誘導攻撃法を開発した。
本手法は,トレーニングデータが少なくなるとともに,攻撃成功率と応答品質を著しく向上させる。
論文 参考訳(メタデータ) (2024-04-18T09:46:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。