論文の概要: HiveTraceGuard-Pro: A Compact Generative Guardrail for Prompt Injection, Jailbreaks, and Adversarial Obfuscation
- arxiv url: http://arxiv.org/abs/2609.01046v1
- Date: Tue, 01 Sep 2026 10:46:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.584724
- Title: HiveTraceGuard-Pro: A Compact Generative Guardrail for Prompt Injection, Jailbreaks, and Adversarial Obfuscation
- Title(参考訳): HiveTraceGuard-Pro: プロンプトインジェクション、ジェイルブレイク、および対向難読化のためのコンパクトな生成ガードレール
- Authors: Nikita Oblakov, Sabrina Sadiekh, Evgeniy Kokuykin,
- Abstract要約: 本報告では,Qwen3-0.6Bから構築したHiveTraceGuard-Proについて述べる。
ロシア語と英語で訓練され、最終目標のターンに1つの二進法(セーフ/アンセーフ)を用いる。
15モデル比較において、HiveTraceGuard-Proは、ロシアの最もクリーンなロバスト性の組み合わせであるF1(0.88)とロシアのプロンプトインジェクションリコール(0.999)を持つ。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Production LLMs must handle inputs that attempt to override system instructions, bypass safety policies or elicit harmful responses. A common mitigation is a separate guardrail model. Existing reports, however, provide little evidence on Russian prompt injection or Russian surface obfuscation. We present HiveTraceGuard-Pro, a 0.6B generative guardrail LoRA-tuned from Qwen3-0.6B. It is trained on Russian and English and uses one binary scoring rule (safe/unsafe) for the final target turn. Its training corpus pairs harmful examples, where a counterpart exists, with benign examples from the same domain and applies eight obfuscation transforms to both labels. In one harness, we compare HiveTraceGuard-Pro with thirty-four other guards on nineteen benchmark groups, sixteen of which are public. Its aggregate key is 0.7432, behind 0.7641 and 0.7552 for the two higher-scoring guards. Over the sixteen public groups alone, its key is 0.7153 and four of the thirty-four other suite guards score higher. In a fifteen-model comparison, HiveTraceGuard-Pro has the highest clean Russian robustness combined-F1 (0.88) and Russian prompt-injection recall (0.999). Both results use Russian sets assembled by our team, and at least 27.1% of the prompt-injection set overlaps the training corpus. Its 14.3 ms median latency is the lowest among those fifteen models in that run. Across the suite, FPR is 0.268 and FNR is 0.156. All reported response results use a legacy standalone-reply serialization rather than the natural assistant-role path of the shipped chat template. We release the merged weights on Hugging Face under Apache-2.0. The corpus, evaluation sets and evaluation code remain internal.
- Abstract(参考訳): 生産LSMは、システム命令を無効にしたり、安全ポリシーをバイパスしたり、有害な応答を誘発しようとする入力を処理しなければならない。
一般的な緩和は独立したガードレールモデルである。
しかし、既存の報告では、ロシアのプロンプト注入やロシアの表面難読化についてはほとんど証拠がない。
本稿では,Qwen3-0.6Bから設計した0.6B生成ガードレールであるHiveTraceGuard-Proを紹介する。
ロシア語と英語で訓練され、最終目標のターンに1つの二進法(セーフ/アンセーフ)を用いる。
そのトレーニングコーパスは、同じドメインの良質な例とともに、相手が存在する有害な例をペアリングし、両方のラベルに8つの難読変換を適用する。
あるハーネスでは、HiveTraceGuard-Proを19のベンチマークグループで他の34のガードと比較します。
合計キーは0.7432で、上位2機のガードは0.7641、0.7552である。
16の公共団体だけで、その鍵は0.7153であり、他の34のスイートガードのうち4人がより高いスコアを得ている。
15モデル比較では、HiveTraceGuard-Proは、F1 (0.88) とロシアのプロンプトインジェクションリコール (0.999) を組み合わせた最もクリーンなロシアのロバスト性を持つ。
どちらの結果も我々のチームによって組み立てられたロシアのセットを使用し、少なくとも27.1%のプロンプト・インジェクションセットはトレーニング・コーパスと重なる。
14.3ミリ秒のレイテンシは、その実行中の15モデルの中では最低である。
FPRは0.268、FNRは0.156である。
報告されたすべてのレスポンスは、出荷されたチャットテンプレートの自然なアシスタントロールパスではなく、レガシーなスタンドアロンのリプライシリアライズを使用する。
私たちはApache-2.0の下でHugging Faceのマージウェイトをリリースしています。
コーパス、評価セット、評価コードは内部のままである。
関連論文リスト
- Incident-Data Robustness Analysis of the OWASP Top 10 for LLM Applications (2026): How a Community-Expert Ranking Holds Up Against a Large-Scale LLM Incident Corpus [0.0]
LLMアプリケーションのトップ10は、セキュリティ実践者のコミュニティが最も重要なリスクをランク付けしている。
実際のインシデントの記録に逆らって、専門家のランキングはデータと一致しているか?
論文 参考訳(メタデータ) (2026-08-18T09:28:10Z) - ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems [0.0]
本稿では,すべてのエージェント間チャネルに情報コンテナゲートを配置するフレームワークであるChannelGuardを紹介する。
ChannelGuardは、Azure GPT-5, Anthropic Sonnet 4.5, Anthropic Haiku 4.5をまたいで、アプリケーション層で30の30のツールポゾンをブロックする。
また、プロンプト・インジェクションの攻撃成功率を半分(0.333から0.167)下げ、GSM8Kの精度(0.867)を正確に保持する。
論文 参考訳(メタデータ) (2026-07-20T19:11:17Z) - HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety [0.0]
HaloGuard 1.0は、入力安全性のためのコンスティチューション分類のパラダイムのオープンウェイト実装である。
現在のオープンガードモデルの約10分の1のモデルサイズで、英語と多言語のプロンプトセーフティベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-02T12:21:16Z) - Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection [5.902327401962825]
リフレクション・ガード(Reflector-Guard)は,LLMに基づく安全分類器をチェーン・オブ・フォア・セルフ・リフレクション機能で拡張する手法である。
提案手法は,GPT-4o-miniから構造化アノテーションへの解析的推論を蒸留し,QLoRAを介してLlama-Guard-3-8Bを訓練し,論理的自己回帰を生成する。
たった1000のトレーニング例とわずか0.5%のモデルパラメータを使って、Reflect-Guardは2つの挑戦的なベンチマークで大幅に改善した。
論文 参考訳(メタデータ) (2026-05-24T02:58:21Z) - Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B [0.0]
Semalith v1.4は、即時注入、一般害、金融サービス規制コンプライアンスを含む3軸安全分類を同時に実施する。
22級のヘッドは4級の補助的なスーパーカテゴリーのヘッドで、重み付けされた損失で訓練されている。
v1.4は全てのプロンプトインジェクション評価(7/7)と18のベンチマークのうち11が44倍のパラメータで勝利し、FPR = 0.000が208個のエージェントプロンプトに対して0.063がLlama-Guard-3-8Bである。
論文 参考訳(メタデータ) (2026-05-06T10:14:30Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs [54.10865585773691]
LLM安全性のためのオープンで軽量なモデレーションツールであるWildGuardを紹介します。
WildGuardは、ユーザプロンプトにおける悪意のある意図の特定、モデルレスポンスの安全性リスクの検出、モデル拒絶率の決定という3つの目標を達成する。
論文 参考訳(メタデータ) (2024-06-26T16:58:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。