論文の概要: Prompted to Discriminate: Generalizing Malicious-Input Probes in the Wild
- arxiv url: http://arxiv.org/abs/2610.02413v1
- Date: Thu, 01 Oct 2026 19:36:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 19:20:54.750103
- Title: Prompted to Discriminate: Generalizing Malicious-Input Probes in the Wild
- Title(参考訳): 野生の有害な入力プローブを一般化する試み
- Abstract要約: 安価で、ますます一般的な動きは、ユーザのターン後に、短い分類命令を追加することです。
厳密なLODO (Left-one-dataset-out) 評価の下で, ユーザサフィックスの制御されたラグを用いてこれを検証する。
これはアクティベーション・プローブ・モニターの安価なドロップインだが、自動的な勝利ではない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents increasingly rely on activation probes as runtime monitors for prompt injection, jailbreaks, and unsafe requests, reading the model's own hidden state to catch a harmful input before the agent acts on it. A cheap, increasingly common move, borrowed from LLM-as-judge prompting, is to append a short classification instruction after the user's turn and read the probe at that point, to sharpen it: the instruction asks the model to represent the incoming request as a class, concentrating the signal the probe must separate, at negligible serving cost. But does the wording of that suffix matter, and does its benefit hold in the wild, on attack types the probe never saw in training, the regime a deployed monitor faces? We test this with a controlled ladder of post-user suffixes under strict leave-one-dataset-out (LODO) evaluation across 13 safety benchmarks (jailbreak, injection, and benign chat) and three open-weight model families (Llama-3.1-8B, Qwen3.5-9B, Gemma-4-12B). On a single-position probe, a classification suffix consistently improves out-of-distribution detection over no suffix (up to ~4 AUC points); yet which suffix matters: prompting the model to classify the input, even into content-free labels, reliably wins; an off-topic or merely-attentive suffix helps little. The gain comes from the classification format, not the named criterion: a content-free suffix matches the real malicious/benign one, with the criterion adding precision only at strict thresholds. This is not an artifact of the single-position read: the benefit carries to the multi-position pooling probes used in production (attention, multi-max, MLP), though the best-performing suffix there is readout-dependent. Served through a KV-cache fork, it is a cheap drop-in for any activation-probe monitor, though not an automatic win: which suffix helps, and by how much, depends on the model and the readout.
- Abstract(参考訳): LLMエージェントは、実行時モニターとしてアクティベーションプローブをますます頼りにしており、インジェクション、ジェイルブレイク、安全でない要求を処理し、エージェントが作用する前に有害な入力をキャッチするためにモデル自身の隠れ状態を読み取る。
LLM-as-judgeから借用された安価で一般的な動きは、ユーザのターン後に短い分類命令を付加し、その時点でプローブを読み上げ、それを鋭くすることである。
しかし、その接尾辞の言葉は問題であり、その利点は、探査機が訓練中に見たことのない攻撃タイプや、配備された監視員が直面する体制に対して、荒々しく保たれているのだろうか?
我々は,13の安全ベンチマーク(ジェイルブレイク,インジェクション,ベニグニングチャット)と3つのオープンウェイトモデルファミリ(Llama-3.1-8B,Qwen3.5-9B,Gemma-4-12B)を対象に,厳密なLeft-one-dataset-out (LODO)評価の下で,ユーザサフィックスの制御されたラグをテストした。
単一位置プローブでは、分類接尾辞は、接尾辞なし(最大4AUC点まで)の分布外検出を一貫して改善するが、これらの接尾辞は、入力を分類するようモデルに促す。
コンテンツフリーの接尾辞は実際の悪意ある/良心的な接尾辞と一致し、厳格なしきい値にのみ精度を付加する。
利点は、本番で使用されるマルチポジションプーリングプローブ(アテンション、マルチマックス、MPP)に向けられるが、最も優れたサフィックスは読み出し依存である。
KV-cacheのフォークを通じて開発されたこのデバイスは、アクティベーションプローブモニターの安価なドロップインだが、自動的な勝利ではない。
関連論文リスト
- Speculative Probing: LLM Monitoring at Speculative-Decoding Cost [8.480625921580154]
言語モデル推論中のリアルタイム分類は、安全フィルタリング、行動分析、モデル監視に有用である。
現在のアプローチでは、正確性と効率性のトレードオフが強まります。
最近のLSMにおける投機的復号化モジュールは、効率的な高品質な分類のために再利用することができる。
論文 参考訳(メタデータ) (2026-08-28T09:07:58Z) - From Positionwise Confidence to Prefix Scheduling: Verifier Skipping in Speculative Decoding [41.41611499810411]
投機拡散復号(SDD)は、離散拡散モデルと並行してドラフトブロック内のすべての位置を生成する。
本稿では,これが新しい制御ハンドルを生成することを認識している。
論文 参考訳(メタデータ) (2026-08-14T18:00:08Z) - BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes [28.166699360211993]
既存の検出方法は、注入の有無のみを検出し、検出に応答しない。
本稿では,この過度な拒絶問題に対処するために,ロバストネス・アウェア・プロンプト・インジェクション・ディフェンス(Robustness-Aware Prompt Injection Defense)を提案する。
実験により、ロバスト性は、安全な攻撃サンプルに対する過剰な拒絶を著しく低減しつつ、ほぼ完璧な噴射検出を維持していることが示された。
論文 参考訳(メタデータ) (2026-08-08T09:32:07Z) - Latent Undertow: How Ordinary Typos Break Probes [1.3636639880574484]
タイプミスや句読点の欠如によって、ユーザの意図とモデルの反応は瞬時に変化しない。
しかし、モデルの隠れ状態を読むことによって悪意のあるプロンプトを検出するプローブは、異なるストーリーを語る:同じ編集で、摂動トークンで読み出しベクトルを43-56回転させ、10下流トークンで15%以下で崩壊する。
メッセージごとに3つの共通型を積み重ねると、シングルポジションのプロンプトインジェクションプローブのTPR@FPR$=1% が 12.0pp にカットされる。
論文 参考訳(メタデータ) (2026-07-08T11:41:43Z) - Stop Early, Spend Less: Hidden-State Probes as a Practical Recipe for Streaming Moderation of LLM Outputs [0.0]
既存のアプローチは、生成後に適用される別のモデレーションモデルに依存している。
我々は、モデレーションに必要な信号が隠蔽状態のモデルにすでに存在することを観察する。
トークンレベルの軽量プローブをトレーニングし、内部アクティベーションを直接操作します。
論文 参考訳(メタデータ) (2026-06-09T07:01:43Z) - From Attack Simulation to SIEM Rule: Deterministic Detection-as-Code Synthesis with Probe-Level Traceability [51.56484100374058]
セキュリティチームは、自身のシステムに対する攻撃をシミュレートして、監視が真の侵入者を捕まえるかどうかをチェックする。
人間はそのギャップを手でブリッジし、それぞれの発見を読み、対応するシグマルールを書きます。
ロックされたコーパスからプローブが引き出されると,この変換が部分的に自動化されることを示す。
論文 参考訳(メタデータ) (2026-06-03T14:26:25Z) - Cautious Next Token Prediction [62.74127603725369]
我々は、CNTP(Cautious Next Token Prediction)と呼ばれる新しいトレーニングフリーデコード戦略を提案する。
復号過程において、モデルが特定のステップで比較的高い予測エントロピーを持つ場合、独立にステップから始まる複数の試行をサンプリングし、句読点に遭遇する際に停止する。
提案するCNTPアプローチは,既存の標準復号方式よりも明確なマージンで一貫した性能を発揮することを示す。
論文 参考訳(メタデータ) (2025-07-03T05:49:18Z) - Model-tuning Via Prompts Makes NLP Models Adversarially Robust [97.02353907677703]
Model-tuning Via Prompts (MVP) による対向的ロバスト性の評価
MVPは、標準的な方法よりも平均8%の性能向上を実現している。
また,これらの利得の基盤となるメカニズムの解明も行なっている。
論文 参考訳(メタデータ) (2023-03-13T17:41:57Z) - Self-Adaptive Label Augmentation for Semi-supervised Few-shot
Classification [121.63992191386502]
Few-shotの分類は、ラベル付きサンプルがわずかにあれば、新しいタスクをうまく一般化できるモデルを学ぶことを目的としている。
そこで本研究では,手動で定義した指標を用いて,ラベルのない各サンプルに適切なラベルを割り当てる半教師付き小ショット分類手法を提案する。
SALAの目新しいところは、タスク適応計量であり、エンドツーエンドの方法で異なるタスクに対するメトリックを適応的に学習することができる。
論文 参考訳(メタデータ) (2022-06-16T13:14:03Z) - DAAIN: Detection of Anomalous and Adversarial Input using Normalizing
Flows [52.31831255787147]
我々は、アウト・オブ・ディストリビューション(OOD)インプットと敵攻撃(AA)を検出する新しい手法であるDAINを導入する。
本手法は,ニューラルネットワークの内部動作を監視し,活性化分布の密度推定器を学習する。
当社のモデルは,特別なアクセラレータを必要とせずに,効率的な計算とデプロイが可能な単一のGPUでトレーニングすることが可能です。
論文 参考訳(メタデータ) (2021-05-30T22:07:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。