論文の概要: The Latent Diagnostic Taxonomy: A Framework for Constructing Classifiers and Diagnosing Their Decisions, Applied to Prompt Injection Detection
- arxiv url: http://arxiv.org/abs/2608.26423v1
- Date: Wed, 26 Aug 2026 21:55:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.180257
- Title: The Latent Diagnostic Taxonomy: A Framework for Constructing Classifiers and Diagnosing Their Decisions, Applied to Prompt Injection Detection
- Title(参考訳): 後期診断分類法:分類器の構築と診断のためのフレームワーク : プロンプト注入検出への応用
- Authors: Jaturong Kongmanee, Smile Thanapattheerakul,
- Abstract要約: 本稿では,分類器をセーフガード層として構築し,補完的な診断を行うためのフレームワークを提案する。
フレームワークを公開プロンプトインジェクションデータセットに適用すると、自信のある決定のかなりの部分が単一のトークンを削除しても堅牢ではないことが分かります。
分類学の各分野において、診断されたプロンプトを修復するための戦略を推奨する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This paper proposes a framework for constructing a classifier as a safeguard layer, and for developing a complementary diagnostic that identifies which of the classifier's confident decisions can be trusted. This framework, the Latent Diagnostic Taxonomy, consists of (i) constructing a dimensionality-optimized classifier, in which the embedding dimensionality is empirically selected via cross-validated performance rather than fixed a priori, (ii) locating a relatively small set of latent support vectors (~ 29% of total training examples) representing influential prompts for identifying tokens that alter the classifier's predicted labels, and (iii) utilizing such tokens and their associated attack magnitudes for constructing a diagnostic taxonomy. This diagnostic taxonomy provides an end-to-end guideline for flagging prompts that require different treatments: rely Safely on the classifier's decision; flag Heuristic Bias and Heuristic Override cases; route Insufficient Context cases for further human/safety review. Applying the framework to a classifier trained on a public prompt injection dataset, we find that a substantial fraction of its confident decisions (~ 77%) are not robust to removing a single token, and that this brittleness separates into two distinct failure patterns: a confidence calibration failure and a genuinely exploitable shortcut. For each zone of the taxonomy, we also recommend strategies for remediating diagnosed prompts. We illustrate the framework as a series of steps, demonstrating how each step operates.
- Abstract(参考訳): 本稿では,分類器をセーフガード層として構築するためのフレームワークを提案し,分類器の信頼性決定が信頼できるかを識別する補完的な診断手法を開発する。
この枠組みは、後期診断分類学である。
一 優先事項を定めず、クロスバリデーションにより、埋め込み寸法を経験的に選択した次元最適化分類器を構築すること。
(二)分類器の予測ラベルを変更するトークンの識別に影響を及ぼす要因を示す比較的小さな潜在支援ベクトル(全訓練例の約29%)の配置、及び
三 診断分類の作成にこれらのトークン及びその関連する攻撃規模を利用すること。
この診断分類は、分類者の判断に安全に依存すること、ヒューリスティック・バイアスとヒューリスティック・オーバーライドのケースにフラグを付けること、さらに人間と安全をレビューするためのルート不十分なコンテキストケースなど、異なる治療を必要とするプロンプトをフラグするエンド・ツー・エンドのガイドラインを提供する。
公開プロンプトインジェクションデータセットでトレーニングされた分類器にフレームワークを適用すると、自信のある決定(約77%)のかなりの部分が単一のトークンを削除するには堅牢ではなく、この不安定さは、信頼性のキャリブレーション障害と真に悪用可能なショートカットという2つの異なる障害パターンに分離されていることが分かります。
分類学の各分野において、診断されたプロンプトを修復するための戦略を推奨する。
フレームワークを一連のステップとして説明し、各ステップがどのように動作するかを示す。
関連論文リスト
- Optimized Instance Alteration for Explaining and Assessing Robustness of Classifiers [8.221155505820198]
ブラックボックス分類器の誤分類診断とロバスト性評価のための統一手法を提案する。
我々の手法の中心は、インスタンスを最適化し、分類器が指定されたターゲットラベルを予測する最適化フレームワークである。
頑健性を定量化するために, 耐久領域融合行列を導入する。
論文 参考訳(メタデータ) (2026-07-07T14:25:34Z) - SAAG: Structured Agent Assessment and Grounding [13.62148061055744]
本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-30T19:33:58Z) - Agentic Cognitive Profiling: Realigning Automated Alzheimer's Disease Detection with Clinical Construct Validity [66.94391219005291]
本稿では,臨床プロトコルロジックによる自動スクリーニングを実現するエージェント認知プロファイリング(ACP)を提案する。
我々の設計の中心は、すべての定量化を決定論的関数呼び出しに委譲することで、測定から意味的理解を分離することである。
ACPは、タスク試験で90.5%のスコアマッチ率、AD予測で85.3%の精度を達成し、一般的な基準を上回っている。
論文 参考訳(メタデータ) (2026-03-18T06:15:35Z) - CASE: Contrastive Activation for Saliency Estimation [14.833454650943805]
精度法は、モデルの予測にどの入力特徴が関係していると考えられるかを視覚化するために広く用いられている。
そこで本研究では,同一入力上で競合するクラスラベルを識別する手法として,クラス感度の診断試験を提案する。
本研究は, クラスラベルによらず, ほぼ同じ説明を導出し, 信頼性を問うものであることを示す。
論文 参考訳(メタデータ) (2025-06-08T23:57:37Z) - Benchmarking Unified Face Attack Detection via Hierarchical Prompt Tuning [58.16354555208417]
PADとFFDはそれぞれ物理メディアベースのプレゼンテーションアタックとデジタル編集ベースのDeepFakeから顔データを保護するために提案されている。
これら2つのカテゴリの攻撃を同時に処理する統一顔攻撃検出モデルがないことは、主に2つの要因に起因する。
本稿では,異なる意味空間から複数の分類基準を適応的に探索する,視覚言語モデルに基づく階層型プロンプトチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-19T16:35:45Z) - Probing Network Decisions: Capturing Uncertainties and Unveiling Vulnerabilities Without Label Information [19.50321703079894]
本稿では, 対実例を用いて分類器の弱点を明らかにするための新しい枠組みを提案する。
本研究では, 画像分類ベンチマークを用いて, 誤分類検出の性能を検証し, その妥当性を検証した。
論文 参考訳(メタデータ) (2025-03-12T05:05:58Z) - A Fixed-Point Approach to Unified Prompt-Based Counting [51.20608895374113]
本研究の目的は,ボックス,ポイント,テキストなど,さまざまなプロンプト型で示されるオブジェクトの密度マップを生成することができる包括的プロンプトベースのカウントフレームワークを確立することである。
本モデルは,クラスに依存しない顕著なデータセットに優れ,データセット間の適応タスクにおいて優れた性能を示す。
論文 参考訳(メタデータ) (2024-03-15T12:05:44Z) - Resolving label uncertainty with implicit posterior models [71.62113762278963]
本稿では,データサンプルのコレクション間でラベルを共同で推論する手法を提案する。
異なる予測子を後部とする生成モデルの存在を暗黙的に仮定することにより、弱い信念の下での学習を可能にする訓練目標を導出する。
論文 参考訳(メタデータ) (2022-02-28T18:09:44Z) - Detection of Adversarial Supports in Few-shot Classifiers Using Feature
Preserving Autoencoders and Self-Similarity [89.26308254637702]
敵対的なサポートセットを強調するための検出戦略を提案する。
我々は,特徴保存型オートエンコーダフィルタリングと,この検出を行うサポートセットの自己相似性の概念を利用する。
提案手法は攻撃非依存であり, 最善の知識まで, 数発分類器の検出を探索する最初の方法である。
論文 参考訳(メタデータ) (2020-12-09T14:13:41Z) - Certified Robustness to Label-Flipping Attacks via Randomized Smoothing [105.91827623768724]
機械学習アルゴリズムは、データ中毒攻撃の影響を受けやすい。
任意の関数に対するランダム化スムージングの統一的なビューを示す。
本稿では,一般的なデータ中毒攻撃に対して,ポイントワイズで確実に堅牢な分類器を構築するための新しい戦略を提案する。
論文 参考訳(メタデータ) (2020-02-07T21:28:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。