論文の概要: Whose Refusal Is It? The Unmeasured Contribution of Black-Box Multimodal Guardrails
- arxiv url: http://arxiv.org/abs/2608.08641v1
- Date: Sun, 09 Aug 2026 11:19:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.904205
- Title: Whose Refusal Is It? The Unmeasured Contribution of Black-Box Multimodal Guardrails
- Title(参考訳): 誰の拒否か? ブラックボックス式マルチモーダルガードレールの非計測的貢献
- Abstract要約: ガードレールの実際の安全のシェアは、そのすべてから本質的には、どれにも及ばない。
ガードブロックがモデルの応答を置き換えるため、スプリットは余分なコストでリカバリ可能である。
- 参考スコア(独自算出の注目度): 24.794304039477495
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A black-box guardrail is evaluated as though the safety number it earns were its own. It is not. A defended pipeline holds two components that can refuse (the guardrail, and the target model out of its own alignment), and every reported metric is a sum over both. We show that the guardrail's actual share of the safety credited to it runs from none of it to essentially all of it, decided by two variables no evaluation records: which channel carries the payload, and what text the harness places in the defense's internal read. The split is recoverable at no extra cost, because a guard block replaces the model's response and the two counts are therefore disjoint. On a text guard across two open-weight targets: with the payload rendered as pixels the guard blocks nothing and the model produces every refusal the system makes; reading the encoded prompt the attacker actually sent, the guard produces a minority of the refusals attributed to it; reading the unencoded request behind the attack, it blocks almost everything and the model falls silent. The blindness is not inaccuracy: the same guards block no benign image inputs either, so their image-channel decision is a constant. Granting the unencoded request inflates measured benefit substantially for a guard gate, less for a caption-mediated re-check, and not at all for a majority-vote smoother; the ordering reproduces in an independent replicate. Isolating the grant within one defense shows it does not improve detection: the harm-verdict stage contributes nothing, while the stage that regenerates the answer carries the effect. Nor is the inflated setting careless; the reference implementation builds every stage from a single prompt field that cannot distinguish what the attacker sent from what the benchmark records, so faithful porting supplies it silently. Previously published figures of our own are among those revised.
- Abstract(参考訳): ブラックボックスガードレールは、それが獲得する安全番号がそれ自身であるかのように評価される。
それは違う。
防御されたパイプラインは、拒否可能な2つのコンポーネント(ガードレールと、それ自身のアライメントからターゲットモデル)を持ち、報告されたメトリックはいずれも合計である。
防衛レールの実際の安全性のシェアは、そのすべてから本質的には、どのチャンネルにペイロードが積まれているか、そして防衛の内的読み出しにあるハーネスがどんなテキストになっているかという2つの変数によって決定される。
ガードブロックがモデルの応答を置き換え、したがって2つのカウントが切り離されるため、スプリットは余分なコストでリカバリ可能である。
2つのオープンウェイトなターゲットにまたがるテキストガード: ペイロードをピクセルとしてレンダリングすると、ガードが何もブロックせず、モデルはシステムが行うすべての拒絶を発生させ、攻撃者が実際に送ったプロンプトのコードを読み、ガードはそれに起因する拒絶の少数を発生させ、攻撃の背後にある未コーディングの要求を読み取ると、ほとんど全てをブロックし、モデルは沈黙する。
ブラインドネスは不正確ではなく、同じガードが良心的な画像入力をブロックするので、画像チャネルの決定は一定である。
アンエンコードされた要求を膨らませることによって、ガードゲートのメリットが大幅に向上し、キャプションによる再チェックが少なくなる。
1つの防御で助成金を取り離すことは、検出を改善するものではないことを示す: 調和予測段階は、何も貢献しない一方で、回答を再生する段階は、その効果をもたらす。
参照実装は、単一のプロンプトフィールドからすべてのステージを構築するが、これは、攻撃者がベンチマークが記録したものから送ったものを区別できないため、忠実なポーティングはそれを静かに供給する。
以前公表された私たち自身の数字は、修正されたものの中にあります。
関連論文リスト
- VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - The Guard That Cried Wolf: How Scary Words Make Agent Guardrails Refuse Legitimate Actions [12.920644711310109]
Cautious Benchは、エージェントガードレールの構成を過度に安全にするための最初のベンチマークである。
ビルドタイムゲートは、すべての例を再帰して認証するので、各ラベルはポリシーの機械的な結果である。
それぞれが認証されたアクションを、怖いオブジェクト名の下でより頻繁に、過度に排除します。
論文 参考訳(メタデータ) (2026-08-27T11:55:22Z) - More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Oversight [3.8564927363194754]
事前実行監視は、AI制御における信頼できる監視のコアとなる。
既存の設計ではユニットが与えられており、フェールブルモニターに対する効果は計り知れない。
私たちのフレームワークは、この選択のために制御され、事前登録された最初の楽器であり、キャッチのみを読み取ることはありません。
論文 参考訳(メタデータ) (2026-08-25T00:59:55Z) - Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models [4.1626636325601405]
我々の防衛はデコイの硬化であり、拒絶の帯を譲り受け、その支払いを毒する。
5つのファミリー(9B-122B、高密度と混合)から7つのモデルでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-17T23:26:32Z) - Decoy Images Amplify Caption-Mediated Defenses Against Encoded Jailbreaks [7.766839238117721]
画像入力と既存のブラックボックス防御との直感的相互作用を視覚-言語モデル上で報告する。
テキストのみのエンコード入力にASRをそのまま残したキャプション経由のディフェンス(ECSO)は、コンテンツフリーのデコイが添付されると最大7,3$ppまで低下する。
私たちはこれを、堅牢な防御ではなく、パイプラインの相互作用に関する観察として捉えています。
論文 参考訳(メタデータ) (2026-08-02T07:00:49Z) - Recover, Decode, Reguard: Guard-Agnostic Defense Amplification againstEncoded VLM Jailbreaks [7.287314790466206]
我々は視覚言語モデルのためのガード非依存のリカバリ・アンド・デコード増幅器を構築した。
我々はこれを11回の攻撃のアンサンブルに対して評価し、成功しても動作が失敗すると評価した。
これは我々の中心的な発見を露呈し、私たちが評価した非観念的回復防衛のための実証的な安全ユーティリティー天井である。
論文 参考訳(メタデータ) (2026-07-29T07:53:35Z) - When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation [9.68749971398651]
視覚言語AIアシスタントは、生成されたトークンのストリームとして回答を返す。
その答えを監視できる安全ガードは、ストリームに追随し、ユーザーがそれを読む前に有害な応答を止める必要がある。
最近の視覚言語ガードレールは、判決を出す前に一連の思考を生成する。
論文 参考訳(メタデータ) (2026-07-23T15:02:24Z) - Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense [24.794318726705118]
アタック・サクセス・メトリクスは、注入を無視したモデルを見ることができず、データを同じスコアとして忠実に処理します。
SecFidは、インジェクションを実行し、データとして処理し、区別可能な出力を無視するベンチマークです。
論文 参考訳(メタデータ) (2026-06-29T18:11:17Z) - Manufactured Confidence: How Memory Consolidation Turns Hearsay into Confident Facts [0.0]
LLMエージェントは会話を格納された「成果物」に書き直す。
一度も真実であり、訂正されなかった役割は、平らな事実として記憶され、故意の注入のように振る舞う。
1つの負荷を持つメモリがハザードであり、1つの冗長なソースが正しい決定を復元する。
論文 参考訳(メタデータ) (2026-06-28T08:56:48Z) - Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack [78.02110947708535]
敵対的なイメージは、プロンプトインジェクションを通じて、マルチモーダルな大規模言語モデルに深刻なセキュリティ上の脅威をもたらす。
敵の攻撃を成功させるには、画像全体を一様に依存するのではなく、重要な画像トークンの小さなサブセットに依存していることを示す。
本稿では,これらのトークンを勾配解析により局所化し,マスキングにより中和するグラディエントトークンマスキング(GTM)を提案する。
論文 参考訳(メタデータ) (2026-05-24T17:51:34Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Bag of Tricks for Subverting Reasoning-based Safety Guardrails [62.139297207938036]
推論に基づくガードレールを覆い隠すジェイルブレイク手法の袋を提示する。
攻撃対象は白、グレー、ブラックボックスの設定で、無駄なテンプレート操作から完全に自動化された最適化までさまざまです。
論文 参考訳(メタデータ) (2025-10-13T16:16:44Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - TextGuard: Provable Defense against Backdoor Attacks on Text
Classification [83.94014844485291]
テキスト分類に対するバックドア攻撃に対する最初の証明可能な防御であるTextGuardを提案する。
特にTextGuardは、(バックドアされた)トレーニングデータをサブトレーニングセットに分割し、各トレーニング文をサブ文に分割する。
本評価では,3つのベンチマークテキスト分類タスクにおけるTextGuardの有効性を示す。
論文 参考訳(メタデータ) (2023-11-19T04:42:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。