論文の概要: Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting
- arxiv url: http://arxiv.org/abs/2608.02681v1
- Date: Mon, 03 Aug 2026 01:07:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.668267
- Title: Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting
- Title(参考訳): バッチの安全性 : バッチ・プロンプトにおける安全障害の理解と軽減
- Authors: Kihyun Kim, Hee-Seon Kim, Wonjun Lee, Changick Kim,
- Abstract要約: 有害な質問が孤立して確実に拒否されることは、良質な質問に埋め込まれた場合に有害な応答を誘発することを示します。
私たちはこれを、コンテキスト内学習や長期コンテキスト効果といった既知の脆弱性に再現できない、明確な安全障害モードとして認識しています。
バッチ対応の選好最適化が脆弱性を効果的に軽減することを示す。
- 参考スコア(独自算出の注目度): 31.723003820235448
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Batch prompting is a practical inference strategy for large language models, but its safety implications remain underexplored. We show that the success of batch prompting for utility does not extend to safety: a harmful question that is reliably refused in isolation can elicit a harmful response when embedded in a batch of benign questions. We identify this as a distinct safety failure mode, not reducible to known vulnerabilities such as in-context learning or long-context effects, and analyze its causes from two complementary perspectives: alignment signal weakening and refusal signal dilution. Across widely used open-source and frontier commercial models, batch prompting consistently achieves high attack success rates as a simple black-box attack. We further show that batch-aware preference optimization effectively mitigates the vulnerability. These findings highlight a blind spot in current safety alignment and point to batch-aware alignment as a necessary step toward robust deployment.
- Abstract(参考訳): バッチプロンプトは、大規模言語モデルの実用的な推論戦略であるが、その安全性は未解明のままである。
我々は、実用性のためのバッチプロンプトの成功が安全性に及ばないことを示し、孤立して確実に拒否される有害な質問は、良質な質問のバッチに埋め込まれた場合、有害な応答を引き出すことができることを示した。
我々はこれを、コンテキスト内学習や長文効果などの既知の脆弱性に再現できない、明確な安全障害モードとして認識し、その原因を2つの相補的な視点から分析する。
広く使われているオープンソースとフロンティアの商用モデル全体で、バッチプロンプトはブラックボックス攻撃として高い攻撃成功率を継続的に達成している。
さらに、バッチ対応の好み最適化が脆弱性を効果的に軽減することを示す。
これらの調査結果は、現在の安全アライメントの盲点と、ロバストなデプロイメントに向けた必要なステップとしてバッチ対応アライメントのポイントを浮き彫りにしている。
関連論文リスト
- HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment [23.776344382492997]
本研究は,LLMのアライメントにより,残差ストリームにおける有害性と拒絶を,プロンプト側トークン位置における分離可能な方向としてエンコードしていることを示す。
本稿では,2方向をプロンプト位置と応答位置でペアリングする微調整手法であるHARCを紹介する。
論文 参考訳(メタデータ) (2026-07-01T07:58:16Z) - Furina: Fragmented Uncertainty-Driven Refusal Instability Attack [9.678677899786718]
大規模言語モデル (LLM) とマルチモーダル・大規模言語モデル (MLLM) の安全性の整合性は、概ね2つのしきい値のメカニズムとして機能すると考えられている。
我々は、安全行動は、小さな摂動が決定論的結果よりも拒絶決定を引き起こす不安定な領域に支配されていることを明らかにすることによって、この仮定に挑戦する。
この不安定性を特徴付けるために,外部信号と内部信号を組み合わせたマルチメトリック診断フレームワークを開発した。
Furinaは、モデル固有の最適化なしに、断片化されたシーンアンコールプロンプトを通じて意図的にこのシグネチャを誘導するジェイルブレイク攻撃である。
論文 参考訳(メタデータ) (2026-05-24T11:35:12Z) - SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment [43.86865924673546]
軽量なゲートウェイ分類器を介して防御資源を割り当てる適応型フレームワークであるSafeThinkerを提案する。
実験によると、SafeThinkerは、堅牢性を損なうことなく、さまざまなジェイルブレイク戦略における攻撃の成功率を大幅に低下させる。
論文 参考訳(メタデータ) (2026-01-23T07:12:53Z) - Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning? [68.82210578851442]
メカニスティックな解釈可能性レンズによる推論モデルにおいて、なぜ安全アライメントが失敗するのかを考察する。
トークン位置における拒絶意図の追跡のための線形探索手法を用いて,textbfrefusal cliff と呼ばれる現象を発見した。
提案手法は,最大断崖を示す訓練例を識別し,推論モデルの安全性を向上する手法であるtextbfCliff-as-a-Judge を提案する。
論文 参考訳(メタデータ) (2025-10-07T15:32:59Z) - Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention [53.25106308403173]
既存の手法は、安全推論の独特な重要性を軽視し、信頼性を損なうとともに、悪質なユーザに対して安全でない推論がアクセス可能で、悪質なユーザによって悪用された場合、アプリケーションに潜在的なリスクを生じさせることを示す。
我々は、安全トリガー付きコンプライアンスステップを代入し、強い信号による優先学習のためのペアを構築することで、安全推論を強制するアライメント手法であるIntervened Preference Optimization (IPO)を提案する。
論文 参考訳(メタデータ) (2025-09-29T07:41:09Z) - ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning [64.32925552574115]
ARMORは、jailbreak戦略を分析し、コアインテントを抽出する、大規模な言語モデルである。
ARMORは最先端の安全性能を達成し、平均有害率は0.002であり、高度な最適化ベースのジェイルブレイクに対する攻撃成功率は0.06である。
論文 参考訳(メタデータ) (2025-07-14T09:05:54Z) - SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning [76.56522719330911]
大規模推論モデル(LRM)は、応答する前に明示的に推論する新しい世代パラダイムを導入する。
LRMは有害なクエリや敵の攻撃に対して大きな安全リスクをもたらす。
キー文中の安全アハモーメントをより活性化するSafeKeyを提案する。
論文 参考訳(メタデータ) (2025-05-22T03:46:03Z) - SAFER: Advancing Safety Alignment via Efficient Ex-Ante Reasoning [51.78514648677898]
我々は,eFficient Ex-Ante Reasoningによる安全アライメントの枠組みであるSAFERを提案する。
提案手法は,初期評価,ルール検証,経路校正などを通じて,構造化されたex-Ante推論をインスタンス化する。
複数のオープンソース LLM の実験により,SAFER は有用性と応答効率を保ちながら安全性を著しく向上することが示された。
論文 参考訳(メタデータ) (2025-04-03T16:07:38Z) - Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training [67.30423823744506]
我々は,LLMに対して,いかなる応答位置においても有害なプロンプトへのコンプライアンスを拒否する権限を付与する,新しいアプローチであるDecoupled Refusal Training(DeRTa)を導入する。
DeRTaは,(1)安全応答の開始に有害な応答のセグメントを付加することにより,安全でないコンテンツの認識と回避をモデルに訓練する,(2)有害応答シーケンスを通して潜在的障害から安全拒絶へ移行する能力をモデルに装備する強化遷移最適化(RTO)という,2つの新しいコンポーネントを組み込んでいる。
論文 参考訳(メタデータ) (2024-07-12T09:36:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。