論文の概要: Refusing Everything Looks Safe: Restoring the Benign Arm to Encoded-Prompt Evaluation
- arxiv url: http://arxiv.org/abs/2609.26176v2
- Date: Thu, 24 Sep 2026 06:04:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.913175
- Title: Refusing Everything Looks Safe: Restoring the Benign Arm to Encoded-Prompt Evaluation
- Title(参考訳): 安全に見えるものすべてを再利用する: コード化されたプロンプト評価のための良腕の復元
- Abstract要約: ベンチマークでは、難解な有害なリクエストを送信し、モデルがどの程度の頻度で準拠しているかを報告します。
私たちは良性の腕を同じ変換で動かし、2つのケースは遠く離れています。
エンコーディングが破壊するものは拒絶ではなく、有害なギャップである。
- 参考スコア(独自算出の注目度): 28.190540929297637
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Encoded-prompt attacks are evaluated almost entirely on their harmful arm: a benchmark sends obfuscated harmful requests and reports how often the model complied. A high refusal rate there is reported as safety, and it is equally consistent with a model that has stopped telling the request apart from anything else in the same format. We run the benign arm through the same transformation, and the two cases are far apart. Across four 7-8B models spanning three base families and four post-training recipes, refusal of harmful homoglyph-encoded prompts spans 0.08 while the same four span 0.57 on the identical requests in plaintext. What the encoding destroys is not refusal but the harm gap: on one model the gap between harmful and benign refusal falls from +0.82 in plaintext to exactly 0.00 under the encoding, and a benchmark reading only the harmful arm scores that model and one retaining a +0.61 gap identically. Running the cell such benchmarks leave out (plaintext content wearing the attack template, with nothing obfuscated) shows that on two of the four models the loss is caused by the protocol rather than by the character transformation, and on a third by the characters. Across a full SFT -> DPO -> RLVR pipeline the harm gap rises by +0.26 with a paired interval excluding zero while the standard harmful-arm metric registers no resolved change at all. We report twelve instrument defects, each with the control that caught it, including a binary jailbreak judge that fires on 0.61-0.70 of responses to plaintext benign prompts; six of the twelve inflate apparent safety, which is the direction a broken safety evaluation fails in by default.
- Abstract(参考訳): エンコードされたプロンプト攻撃は、ほぼ完全に有害な腕で評価される。
高い拒絶率は安全であると報告されており、同じフォーマットの他の何よりも、要求を伝えるのをやめたモデルと等しく一致している。
私たちは良性の腕を同じ変換で動かし、2つのケースは遠く離れています。
3つのベースファミリーと4つのポストトレーニングレシピにまたがる4つの7-8Bモデルにおいて、有害なホモグリフエンコードプロンプトの拒絶は0.08の範囲であり、同じ4つのモデルは同じ要求に対して、平文で0.57の範囲である。
あるモデルでは有害な拒絶と良性的な拒絶のギャップは平文で+0.82からちょうど0.00に減少し、有害な腕だけがそのモデルのスコアと+0.61のギャップを同一に保持するベンチマークが読まれる。
セルのこのようなベンチマークを実行すると(攻撃テンプレートを装着した平文のコンテンツは難読化されていない)、4つのモデルのうち2つのモデルでは、損失は文字変換よりもプロトコルによって引き起こされ、3番目は文字によって引き起こされる。
フルSFT -> DPO -> RLVRパイプラインでは、標準の有害腕メートル法では、ゼロを除いたペア間隔のハーネスギャップが+0.26上昇する一方、標準の有害腕メートル法では、解決された変更は一切ない。
我々は12の計器欠陥を報告し、それぞれが捕獲した制御を施した。その中には、平文の良心的プロンプトに対する応答の0.61-0.70を発射する2つのジェイルブレイク判事が含まれており、12の計6つの明らかな安全性は、故障した安全評価がデフォルトで失敗する方向である。
関連論文リスト
- Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity [2.3216115061903415]
私たちは安全のためにこれをインスタンス化し、金のラベルのないハイテイクな設定で、平均的な方向に向かっています。
370種の種 x 5 の表面が x 5 モデルを形成する場合、単一の変換が一様で最も危険である。
フォーム間の安全でない結果の結合は、3.3-12.9 pp の最悪の単一形式でさえも超える。
論文 参考訳(メタデータ) (2026-08-01T22:28:31Z) - Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats [2.9434672062822376]
大規模言語モデル(LLM)はますますインタラクティブなアプリケーションにデプロイされている。
敵との相互作用に弱いままであり、有害な、偽り、あるいは政策に違反するアウトプットを誘発する。
本稿では,迅速な意図と応答障害を共同で評価する,検証中心の防御フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-24T21:00:39Z) - Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests [0.0]
符号化特化モデルは、汎用チャットモデルよりも高い拒絶バーをクリアすべきである。
8つのコーパス(ASTRA、CySecBench、AdvBench/harmful_behaviors、JailbreakBench、MalwareBench、RedCode、RCCBench、Scam2Prompt)は5judgeコンセンサスプロトコルで統合され、分類される。
コーディングモデルがより厳格な拒絶基準を満たしているかどうかをテストするための信頼性基準である。
論文 参考訳(メタデータ) (2026-05-27T16:55:15Z) - When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models [5.03712104249503]
安全ベンチマークスコアは、デプロイの準備が不完全な証拠を提供する。
整列言語モデルは、状況アップデートがどのアクションが安全かをひっくり返しても、厳格なルールに固執することが多い。
安全ベンチマーク全体で12のモデルと2つのコモンセンス制御を、名目上安全なアクションが害をもたらすペア付き変種を用いてテストする。
論文 参考訳(メタデータ) (2026-05-27T02:09:30Z) - Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks [40.270213696031625]
OverEager-Genは、良質なタスクの振る舞いをオーバーイーガーするベンチマークである。
クロード・コードでは、同意宣言を削除するだけで、オーバーイーガー率は0.0%から17.1%に上昇する。
オーバーイーガー・ジェン(OverEager-Gen)は、入場前に各シナリオの識別力を認定する。
論文 参考訳(メタデータ) (2026-05-18T16:00:41Z) - MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents [2.1942030377331245]
コーディングエージェントは、しばしばプロンプト毎の安全性レビューをパスするが、それらのタスクが通常のエンジニアリングチケットに分解されると、悪用可能なコードを出荷する。
199個の3段階攻撃チェーンのベンチマークであるMOSAIC-Benchを紹介する。
9つのプロダクションコーディングエージェントが53~86%の終末ASRで無害なチケットを構成しており、全ステージで2回しか拒否しないことを示す。
論文 参考訳(メタデータ) (2026-05-05T16:38:23Z) - Invisible Safety Threat: Malicious Finetuning for LLM via Steganography [74.00809267925642]
妥協された大きな言語モデルは、有害なコンテンツを隠蔽しながら適切な安全アライメントのファサードを維持することができる。
OpenAIファインタニングAPIの保護にもかかわらず、GPT-4.1のこの目に見えない安全脅威を実証する。
本稿では,コンテンツ安全分類のためのLlama-Guard-3-8Bを用いて,AdvBenchデータセット上での手法を定量的に評価する。
論文 参考訳(メタデータ) (2026-03-09T08:48:27Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - An Embarrassingly Simple Defense Against LLM Abliteration Attacks [47.347413305965006]
失語症と呼ばれる最近の攻撃は、拒否行動に最も責任がある唯一の潜伏方向を特定し、抑制する。
本稿では、モデルが拒否を表現する方法を根本的に変える防衛法を提案する。
微調整のLlama-2-7B-ChatとQwen2.5-Instructは、消音下で高い断熱率を維持するモデルを生成する。
論文 参考訳(メタデータ) (2025-05-25T09:18:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。