論文の概要: The Safeguard Worked. Is the LLM System Safer?
- arxiv url: http://arxiv.org/abs/2609.00519v1
- Date: Tue, 01 Sep 2026 00:38:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.174625
- Title: The Safeguard Worked. Is the LLM System Safer?
- Title(参考訳): LLMシステムは安全か?
- Authors: Pingyu Wu, Weiming Zhang, Nenghai Yu,
- Abstract要約: 配備されたLLMサービスの保護は、拒絶、攻撃の成功、およびポリシー違反率によって評価される。
サービスが依然としてアタッカーに適応し続け、別の方法を見つけてくれるような有害なタスクに対して、どの程度の助けがあるか、という問題に、デプロイは答える必要があります。
- 参考スコア(独自算出の注目度): 66.49233380295111
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Safeguards in deployed LLM services are evaluated by refusal, attack success, and policy violation rates. Those rates characterize how a control performed on the requests it was tested on. A deployment has to answer a different question: how much help with harmful tasks the service still gives an attacker who keeps adapting or finds another way in. We determine what each reported result implies for that question, allowing results from different safeguard families to be compared under one deployment criterion. The evidence requirements are strongly asymmetric. One attack that obtains harmful help from the deployed service suffices to establish that such help remains, and such attacks appear repeatedly in the coded record. Establishing that little remains cannot follow from the safeguard's own numbers alone; it also requires evidence about what the surrounding system still allows after the safeguard performs its local function. Such evidence is supported or derived in only a small minority of the depth-coded claims, and one such claim bounds its scoped residual. A better local score is therefore not, by itself, a stronger claim about the deployment. Safeguard research cannot stop at raising local scores; a gain has to be judged by whether it makes a deployed system any safer.
- Abstract(参考訳): 配備されたLLMサービスの保護は、拒絶、攻撃の成功、およびポリシー違反率によって評価される。
これらのレートは、テストされた要求に対してコントロールがどのように実行されたかを特徴付ける。
サービスが依然としてアタッカーに適応し続け、別の方法を見つけてくれるような有害なタスクに対して、どの程度の助けがあるか、という問題に、デプロイは答える必要があります。
報告された各結果が質問に対してどのような意味を持つかを判断し、異なる保護家族の結果を1つのデプロイメント基準の下で比較できるようにします。
証明条件は強い非対称である。
デプロイされたサービスから有害な助けを得る1つの攻撃は、そのような助けが残っていることを確立するのに十分であり、そのような攻撃はコード化されたレコードに繰り返し現れる。
保護者自身の番号だけでは、わずかな遺骨は追跡できない。また、保護者が局所的な機能を実行した後も、周囲のシステムが何が許すかを示す証拠も必要である。
このような証拠は、深さ符号化されたクレームのごく少数でのみ支持または導出され、そのようなクレームの1つは、そのスコープ化された残留物の境界である。
したがって、より優れたローカルスコアは、それ自体がデプロイメントに対する強い主張ではない。
セーフガード研究は、局地的なスコアを上げるのを止めることはできない。
関連論文リスト
- Breaking the Assumptions: Auditing Input-Side Jailbreak Defenses Against Semantic Attacks [9.007829035130884]
本稿では,局所展開モデルに対するジェイルブレイク攻撃時の防御機構の監査を行う。
我々は、それが依存する条件を抽出し、違反する経験的パターンを導出し、その予測を6つのオープンウェイトモデルで検証する。
論文 参考訳(メタデータ) (2026-08-22T10:14:23Z) - EnsembleSHAP: Faithful and Certifiably Robust Attribution for Random Subspace Method [20.424428823975884]
本稿では,その計算副産物を再利用するランダム部分空間法に対する本質的に忠実でセキュアな特徴属性を提案する。
我々の知る限りでは、これは説明保存攻撃に対する証明可能な堅牢性を確立するための最初の試みである。
また, バックドア攻撃, 敵攻撃, 脱獄攻撃など, 異なる経験的攻撃に直面した場合に, 説明の有効性を総合的に評価する。
論文 参考訳(メタデータ) (2026-03-31T17:30:52Z) - Benchmarking Misuse Mitigation Against Covert Adversaries [80.74502950627736]
既存の言語モデルの安全性評価は、オーバースト攻撃と低レベルのタスクに重点を置いている。
我々は、隠蔽攻撃と対応する防御の評価を自動化するデータ生成パイプラインである、ステートフルディフェンスのためのベンチマーク(BSD)を開発した。
評価の結果,分解攻撃は有効な誤用防止剤であり,その対策としてステートフルディフェンスを強調した。
論文 参考訳(メタデータ) (2025-06-06T17:33:33Z) - Decoding FL Defenses: Systemization, Pitfalls, and Remedies [16.907513505608666]
FL(Federated Learning)のディフェンスを評価するためのガイドラインはありません。
FLディフェンスの総合的なシステム化を3次元に沿って設計する。
我々は,トップレベル防衛紙50点を調査し,それらの評価設定でよく使用されるコンポーネントを特定した。
論文 参考訳(メタデータ) (2025-02-03T23:14:02Z) - Jailbreaking as a Reward Misspecification Problem [80.52431374743998]
本稿では,この脆弱性をアライメントプロセス中に不特定性に対処する新たな視点を提案する。
本稿では,報酬の相違の程度を定量化し,その有効性を実証する指標ReGapを紹介する。
ReMissは、報酬ミスの空間で敵のプロンプトを生成する自動レッドチームリングシステムである。
論文 参考訳(メタデータ) (2024-06-20T15:12:27Z) - Measuring Equality in Machine Learning Security Defenses: A Case Study
in Speech Recognition [56.69875958980474]
この研究は、学習したシステムを守るためのアプローチと、異なるサブ人口間でのセキュリティ防衛がパフォーマンス上の不平等をもたらす方法を検討する。
提案された多くの手法は、虚偽の拒絶やロバストネストレーニングの不平等といった直接的な害を引き起こす可能性がある。
本稿では, ランダム化スムースメントとニューラルリジェクションの2つの防御法の比較を行い, マイノリティ集団のサンプリング機構により, ランダム化スムースメントがより公平であることを見出した。
論文 参考訳(メタデータ) (2023-02-17T16:19:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。