論文の概要: Unread or Unenforced? Separating Representation from Enforcement Failure in Content Guards
- arxiv url: http://arxiv.org/abs/2609.26178v2
- Date: Thu, 24 Sep 2026 06:04:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.914979
- Title: Unread or Unenforced? Separating Representation from Enforcement Failure in Content Guards
- Title(参考訳): 未読・非強制」 : コンテンツガードにおける強制不全からの表現の分離
- Abstract要約: 暗号化された攻撃がコンテンツガードを通過するとき、ガードはペイロードの有害な内容を表現したり、それを表現したりせず、動作しなかった。
私たちは衛兵自身の残留ストリームを読むことでそれらを分離します。
テスト条件下では、純粋な符号化フォーマット検出器の証拠はほとんど見つからない。
- 参考スコア(独自算出の注目度): 25.66326548410424
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When an encoded attack passes a content guard, the guard either never represented the payload's harmful content or represented it and failed to act. End-to-end attack success rate reports one number for both, yet the two have opposite remedies: one is a representational limit that more safety training cannot reach, the other is a decision rule that it can. We separate them by reading a guard's own residual stream, using a content probe fitted on plaintext and transferred without refitting to the encoded condition, alongside the verdict logits from the same pass. Licensing that read honestly is most of the problem and is our main contribution. A conventional permutation test admits the decode measurement on most of a 19-condition encoding ladder for each of two open guards. A length-matched null and a floor calibrated on conditions the guard's base model provably cannot decode reduce it to four conditions each; holding out the items the probe was fitted on removes one more. A third screen constrains the block axis, which the decode screens leave untouched, by running plaintext content inside each condition's own wrapper. It removes the largest cell that survived them. What remains is a policy failure that survives an item-level holdout on two of the four surviving conditions, at 8 and 7 per 100 prompts, against 17 and 23 when the probe is allowed to have seen the prompt it is scoring. It is also confined to one family of surface encodings: where an encoding leaves content linearly recoverable we can separate the two failures, and on genuine ciphers we report the cells as unmeasured rather than as evidence that nothing was decoded. Across every guard and condition pair, blocked without decoding is near zero, so we find little evidence for a pure encoding-format detector under the conditions we test. That cell is the one read we do not repeat under the holdout, and we report it as such.
- Abstract(参考訳): 暗号化された攻撃がコンテンツガードを通過するとき、ガードはペイロードの有害な内容を表現したり、それを表現したりせず、動作しなかった。
エンド・ツー・エンドの攻撃成功率は両方で1つの数字を報告しますが、この2つには反対の治療法があります。
我々は、ガード自身の残留ストリームを読み、平文に適合したコンテンツプローブを使用して、同一パスからの判定ロジットとともに、符号化された条件に適合することなく、それらを分離する。
正直に読むことのライセンスは、ほとんどの問題であり、私たちの主な貢献です。
従来の置換試験では、2つのオープンガードのそれぞれに対して、19条件のエンコーディングラダーのほとんどでデコードの測定が認められている。
長さ調整されたヌルと、ガードのベースモデルの条件に基づいて調整された床は、それぞれ4つの条件に復号できない。
第3の画面は、各条件のラッパー内で平文コンテンツを実行することによって、デコード画面が未タッチのままにしておくブロック軸を制約する。
生き残った最大の細胞を除去する。
残るものは、4つの生存条件のうち、100プロンプトにつき8と7の2つのアイテムレベルのホールトアウトを生き残る政策上の失敗であり、プローブがスコアしているプロンプトを見ることを許された17と23に対してである。
エンコーディングが線形に回復可能な場合、我々は2つの障害を分離でき、実際の暗号では、細胞は、何も復号化されていないという証拠としてではなく、計測されていないと報告する。
復号なしでブロックされたガードと条件ペアは、すべてゼロに近いので、テストした条件下では、純粋な符号化フォーマット検出器の証拠はほとんど見つからない。
そのセルは、ホールドアウトの下で繰り返しない読み取りであり、それを報告します。
関連論文リスト
- VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - AI Grinding for Fun and Cryptanalysis [0.0]
エージェントが人間のレビューの前に仮説を生成・テスト・精査する自律型暗号解析ワークフローを提案する。
まず、公開マップや入力表現は、構築が隠さなければならない関係を消去または公開する。
第2に、シミュレータ、エラー法則、パラメータ認証は、要求されたものと異なる分布を使用する。
論文 参考訳(メタデータ) (2026-08-22T14:37:46Z) - Whose Refusal Is It? The Unmeasured Contribution of Black-Box Multimodal Guardrails [24.794304039477495]
ガードレールの実際の安全のシェアは、そのすべてから本質的には、どれにも及ばない。
ガードブロックがモデルの応答を置き換えるため、スプリットは余分なコストでリカバリ可能である。
論文 参考訳(メタデータ) (2026-08-09T11:19:30Z) - Recover, Decode, Reguard: Guard-Agnostic Defense Amplification againstEncoded VLM Jailbreaks [7.287314790466206]
我々は視覚言語モデルのためのガード非依存のリカバリ・アンド・デコード増幅器を構築した。
我々はこれを11回の攻撃のアンサンブルに対して評価し、成功しても動作が失敗すると評価した。
これは我々の中心的な発見を露呈し、私たちが評価した非観念的回復防衛のための実証的な安全ユーティリティー天井である。
論文 参考訳(メタデータ) (2026-07-29T07:53:35Z) - Alkaid: Resilience to Edit Errors in Provably Secure Steganography via Distance-Constrained Encoding [28.136825414024273]
距離制約符号化による誤りの編集に耐性のある,確実なセキュアなステガノグラフィー手法であるAlkaidを提案する。
アルカイドは、厳密な下界を強制することにより、最小距離復号原理を直接符号化プロセスに統合する。
実験の結果、Alkaidは様々なエラーチャンネルで99%から100%のデコード成功率を達成した。
論文 参考訳(メタデータ) (2026-03-06T11:25:11Z) - Weak-to-Strong Jailbreaking on Large Language Models [92.52448762164926]
大規模言語モデル(LLM)は、ジェイルブレイク攻撃に対して脆弱である。
既存のジェイルブレイク法は計算コストがかかる。
我々は、弱々しく強固な脱獄攻撃を提案する。
論文 参考訳(メタデータ) (2024-01-30T18:48:37Z) - Certifying LLM Safety against Adversarial Prompting [70.96868018621167]
大規模言語モデル(LLM)は、入力プロンプトに悪意のあるトークンを追加する敵攻撃に対して脆弱である。
我々は,認証された安全保証とともに,敵のプロンプトを防御する最初の枠組みである消去・チェックを導入する。
論文 参考訳(メタデータ) (2023-09-06T04:37:20Z) - Split-State Non-Malleable Codes and Secret Sharing Schemes for Quantum
Messages [14.150289683819759]
本稿では,共有エンタングルメントを持つ量子敵に対してセキュアな量子メッセージに対して,分割状態の非有理符号と秘密共有方式を導入する。
より正確には、外部システムとの絡み合いを保った量子メッセージのための、効率よくエンコード可能でデオード可能な分割可能な非有理状態符号と秘密共有スキームを構築した。
論文 参考訳(メタデータ) (2023-08-12T05:15:35Z) - Quantum Proofs of Deletion for Learning with Errors [91.3755431537592]
完全同型暗号方式として, 完全同型暗号方式を初めて構築する。
我々の主要な技術要素は、量子証明器が古典的検証器に量子状態の形でのLearning with Errors分布からのサンプルが削除されたことを納得させる対話的プロトコルである。
論文 参考訳(メタデータ) (2022-03-03T10:07:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。