論文の概要: The Fragility of Trigger-Tag Mechanisms for Misuse Detection in Open-Weight LLMs
- arxiv url: http://arxiv.org/abs/2610.03124v1
- Date: Fri, 02 Oct 2026 10:45:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.334442
- Title: The Fragility of Trigger-Tag Mechanisms for Misuse Detection in Open-Weight LLMs
- Title(参考訳): オープンウェイトLLMにおける誤検出のためのトリガータグ機構の脆弱性
- Abstract要約: オープンウェイトな言語モデルは、開発者のコントロールを越えてダウンロード、修正、デプロイすることができる。
近年の研究では,対象条件下でモデルを使用する場合に検出可能な信号を生成するEmphtrigger-tag機構が提案されている。
機構固有の攻撃面を共通分類に整理する統一攻撃フレームワークUntagを紹介する。
- 参考スコア(独自算出の注目度): 9.794836840719517
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Open-weight language models can be downloaded, modified, and deployed beyond their developers' control, limiting the effectiveness of centrally enforced safeguards. Recent work has therefore proposed \emph{trigger-tag} mechanisms that produce a detectable signal when a model is used under a target condition, such as generating phishing contents. Although these mechanisms borrow from established techniques, their use for conditional misuse detection in open-weight LLMs is relatively new. Therefore, existing research works have not systematically studied the robustness of trigger-tag mechanisms under adversarial attacks. To close this gap, (i)~we formalize trigger-tags and distinguish \emph{token-level trigger-tags}, which introduce watermark-inspired signals during decoding, from \emph{weight-level trigger-tags}, which learn backdoor-inspired associations between target conditions and detectable model behavior. Furthermore, (ii)~we introduce \Untag, a unified attack framework that organizes their mechanism-specific attack surfaces into a common taxonomy. We evaluate representative token-level and weight-level trigger-tags using phishing as a case study. We find that while trigger-tags may provide useful evidence in controlled settings, our attacks render the existing trigger-tag mechanisms to be entirely ineffective. Consequently, we argue that these mechanisms should not be treated as robust misuse detectors when attackers can transform outputs or modify open weights.
- Abstract(参考訳): オープンウェイトな言語モデルは、開発者コントロールを越えてダウンロード、修正、デプロイすることが可能で、集中的に強制されたセーフガードの有効性が制限される。
近年の研究では、フィッシング内容の生成など、対象条件下でモデルが使用される際に検出可能な信号を生成する「emph{trigger-tag}」機構が提案されている。
これらのメカニズムは確立された技術から借用されているが、オープンウェイトLLMにおける条件付き誤用検出には比較的新しいものである。
そのため、既存の研究は敵の攻撃下でのトリガータグ機構の堅牢性について体系的に研究していない。
このギャップを埋めよう。
i) トリガータグを形式化し,デコード中に透かしにインスパイアされた信号を導入する 'emph{token-level trigger-tags} と,ターゲット条件と検出可能なモデル動作との間のバックドアインスパイアされた関連を学習する 'emph{weight-level trigger-tags} とを区別する。
さらに
(ii)~は、メカニズム固有の攻撃面を共通の分類に整理する統合攻撃フレームワークである \Untag を導入する。
ファイッシングを事例として,代表的なトークンレベルおよび重量レベルのトリガータグの評価を行った。
トリガータグは制御された設定で有用なエビデンスを提供するが、我々の攻撃は既存のトリガータグ機構を完全に非効率にする。
その結果、攻撃者が出力を変換したり、オープンウェイトを修正できる場合、これらのメカニズムは堅牢な誤用検知として扱うべきではないと論じる。
関連論文リスト
- The Unseen Hand: Manipulating Model Fairness and SHAP with Targeted Identity Re-Association Attacks [0.0]
我々は、モデルの内部や特徴表現へのアクセスを必要とせずに、モデルの出力を操作する新しい攻撃ファミリーであるTIRAアタック(Targeted Identity Re-Association)を導入する。
我々は、TIRAアタックが、理想値へのフェアネス指標の押し付けに非常に効果的であることを実証的に実証した。重要なことに、TIRAアタックはSHAPベースの説明をうまく理解し、保護された特徴に対する事実上の残差属性を残し、前回の作業よりも大幅に改善した。
論文 参考訳(メタデータ) (2026-06-22T05:05:36Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - Hiding in Plain Text: Detecting Concealed Jailbreaks via Activation Disentanglement [13.976796671311066]
大規模言語モデル (LLM) は、リーチでセマンティックに一貫性のあるジェイルブレイクプロンプトに対して脆弱なままである。
本稿では,LLMアクティベーションにおけるセマンティックファクタペアを推論時にアンタングリングするための自己教師型フレームワークを提案する。
次に、フレーミング表現で動作する異常検出器であるFrameShieldを提案し、モデルに依存しない検出を改善する。
論文 参考訳(メタデータ) (2026-02-23T00:11:30Z) - Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection [76.91230292971115]
大規模言語モデル (LLM) に基づくマルチエージェントシステム (MAS) は複雑なタスクを解く上で強力な能力を示している。
XG-Guardは、MAS内の悪意のあるエージェントを検出するための、説明可能な、きめ細かい保護フレームワークである。
論文 参考訳(メタデータ) (2025-12-21T13:46:36Z) - Character-Level Perturbations Disrupt LLM Watermarks [64.60090923837701]
我々は,Large Language Model (LLM)ウォーターマーキングのためのシステムモデルを定式化する。
我々は、透かし検出器への限られたアクセスに制約された2つの現実的な脅威モデルの特徴付けを行う。
我々は,最も制限的な脅威モデルの下で,キャラクタレベルの摂動が透かし除去に著しく有効であることを実証した。
現実的な制約下での透かし除去における文字レベルの摂動の優位性と遺伝的アルゴリズム(GA)の有効性を実験的に検証した。
論文 参考訳(メタデータ) (2025-09-11T02:50:07Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs [25.72555238658037]
複数の異なるバックドアトリガが1つのモデル内で相互に干渉することなく共存できることを示し、敵が複数のトリガを同時に埋め込むことを可能にする。
我々の発見は、大規模言語モデルにおいて、より広く、より永続的な脆弱性サーフェスを明らかにします。
本稿では,階層単位の重み差解析に基づいて,特定のモデル成分を選択的に再学習するポストホック回収法を提案する。
論文 参考訳(メタデータ) (2025-07-15T09:04:30Z) - Robust Anti-Backdoor Instruction Tuning in LVLMs [53.766434746801366]
大規模視覚言語モデル(LVLM)のための軽量で認証に依存しない防御フレームワークについて紹介する。
私たちのフレームワークは、命令チューニングの下で、アダプタモジュールとテキスト埋め込み層のみを微調整します。
Flickr30kとMSCOCOに対する7つの攻撃に対する実験は、我々の攻撃の成功率をほぼゼロに低下させることを示した。
論文 参考訳(メタデータ) (2025-06-04T01:23:35Z) - ASPIRER: Bypassing System Prompts With Permutation-based Backdoors in LLMs [17.853862145962292]
システムプロンプトを体系的に回避する新しいバックドアアタックを導入する。
本手法は,98.58%のクリーン精度(CACC)を維持しつつ,攻撃成功率(ASR)を99.50%まで達成する。
論文 参考訳(メタデータ) (2024-10-05T02:58:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。