論文の概要: Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B
- arxiv url: http://arxiv.org/abs/2607.22545v1
- Date: Wed, 06 May 2026 10:14:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.955215
- Title: Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B
- Title(参考訳): セマリスv1.4:Llama-Guard-3-8Bより44倍低いパラメータで最先端のプロンプト注入検出が可能な校正式184M安全分類器
- Authors: Tejasvi C. Addagada,
- Abstract要約: Semalith v1.4は、即時注入、一般害、金融サービス規制コンプライアンスを含む3軸安全分類を同時に実施する。
22級のヘッドは4級の補助的なスーパーカテゴリーのヘッドで、重み付けされた損失で訓練されている。
v1.4は全てのプロンプトインジェクション評価(7/7)と18のベンチマークのうち11が44倍のパラメータで勝利し、FPR = 0.000が208個のエージェントプロンプトに対して0.063がLlama-Guard-3-8Bである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying large language models in financial-services and agentic settings requires safety classifiers that simultaneously handle prompt injection, regulatory compliance, and general harm, a combination no existing open guardrail addresses in a single inference pass. Semalith v1.4 is a 184M-parameter DeBERTa-v3-base classifier performing simultaneous three-axis safety classification including prompt injection, general harm, and financial-services regulatory compliance, in a single forward pass. Its 22-class head (BENIGN, nine prompt-injection sub-types, general-harm, eleven BFSI labels) is trained with a 4-class auxiliary super-category head under jointly weighted loss, on a 76,204-row corpus mined from 49 public sources with SHA-1 deduplication against every held-out evaluation set, with 21 of 22 benchmarks at zero contamination (max 0.22%). Against Llama-Guard-3-8B on 22 held-out benchmarks, Semalith v1.4 wins every prompt-injection evaluation (7/7) and 11 of 18 benchmarks overall at 44x fewer parameters, with FPR = 0.000 on 208 benign agentic prompts vs 0.063 for Llama-Guard-3-8B. On general-harm benchmarks (WildGuardMix, HEx-PHI, HarmBench), Llama-Guard-3 leads; this complementary split is documented in Section 4. Six measured weak spots are disclosed in Section 6. Deployment guidance: v1.3 is recommended for conversational moderation deployments (ToxicChat F1 0.624); v1.4 is recommended when BFSI label coverage or zero-FPR on benign agentic prompts is the priority.
- Abstract(参考訳): 金融サービスやエージェント設定に大規模な言語モデルをデプロイするには、迅速なインジェクション、規制コンプライアンス、一般的な害を同時に処理する安全分類器が必要である。
Semalith v1.4は184MパラメーターのDeBERTa-v3ベース分類器で、即発注射、一般害、金融サービス規制のコンプライアンスを含む3軸安全分類を1回のフォワードパスで同時に行う。
22級のヘッド(BENIGN、9種類のプロンプトインジェクションサブタイプ、一般ハーム、11個のBFSIラベル)は、4級の補助スーパーカテゴリヘッドと共同重み付けされた損失で訓練され、76,204個のコーパスが49の公開ソースから採掘され、SHA-1は保持された全ての評価セットに対して重複し、22のベンチマークのうち21つは汚染ゼロ(max 0.22%)である。
22のホールトアウトベンチマークにおけるLlama-Guard-3-8Bに対して、Semalith v1.4は、すべてのプロンプトインジェクション評価(7/7)と18のベンチマークのうち11を44倍のパラメータで勝利し、FPR = 0.000が208の良性エージェントプロンプトに対して、Llama-Guard-3-8Bは0.063である。
一般的なハームベンチマーク(WildGuardMix, HEx-PHI, HarmBench)では、Llama-Guard-3がリードしている。
第6節で6つの測定弱点が開示される。
デプロイメントガイダンス: v1.3は会話のモデレーションデプロイメントに推奨される(ToxicChat F1 0.624)。
関連論文リスト
- SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification [0.0]
nsfaguardは、エージェントAIシステムを運用上の脅威から保護するためのガードレールフレームワークである。
まず,185種のリスク変異をCIA-Triad-grounded 階層に分類するNSFA分類について紹介する。
凍結したバックボーン上の識別的分類ヘッドと解釈可能なオフライン監査のためのSFTに基づく生成推論を組み合わせたデュアルモードアプローチを開発した。
論文 参考訳(メタデータ) (2026-07-13T07:28:45Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Measuring Safety Alignment Effects in Autonomous Security Agents [3.93181912653522]
セキュリティエージェントは、レポジトリを検査し、ツールを呼び出し、認証されたサンドボックス内で脆弱性証拠を生成する必要がある。
固定ツール、決定論的成功予測、リアクションルール、グラウンドチェックを備えた30のローカル脆弱性分析タスクのトレースベースのベンチマークを示す。
自律型セキュリティエージェントの安全性アライメント効果をシステムレベルで測定し, 拒絶, 不安全行動, ツール信頼性, 根拠を分離する。
論文 参考訳(メタデータ) (2026-05-19T11:55:54Z) - AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue [0.4779196219827507]
現在の言語モデルでは、有害な継続を避けるためにリスクを早期に検出しなければなりません。
安全モニタが通常の復号時に発生する隠蔽状態を読み取ることができるが、ベースモデルへの追加のフォワードパスを起動しない予測的同パス監視について検討する。
AERICは, 短水平ハザード予測, サポート感度抑制, 即時条件付残留スコアを同一パスの指数的移動平均決定規則の下で組み合わせた, 暗黙的有害対話のための移動指向型隠れ状態アプローチである。
論文 参考訳(メタデータ) (2026-05-13T14:18:29Z) - MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents [2.1942030377331245]
コーディングエージェントは、しばしばプロンプト毎の安全性レビューをパスするが、それらのタスクが通常のエンジニアリングチケットに分解されると、悪用可能なコードを出荷する。
199個の3段階攻撃チェーンのベンチマークであるMOSAIC-Benchを紹介する。
9つのプロダクションコーディングエージェントが53~86%の終末ASRで無害なチケットを構成しており、全ステージで2回しか拒否しないことを示す。
論文 参考訳(メタデータ) (2026-05-05T16:38:23Z) - Owner-Harm: A Missing Threat Model for AI Agent Safety [0.0]
既存のAI安全性ベンチマークは、一般的な犯罪被害に焦点を当てている。
本稿では,8つのカテゴリのエージェント動作がデプロイを損なう,正式な脅威モデルである Owner-Harm を提案する。
論文 参考訳(メタデータ) (2026-04-20T10:11:26Z) - Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context [82.32380418146656]
Health-ORSC-Benchは、医療におけるtextbfOver-Refusalと textbfSafe Completionの品質を測定するために設計された最初の大規模ベンチマークである。
私たちのフレームワークは、人間の検証を備えた自動パイプラインを使用して、さまざまなレベルの意図の曖昧さでモデルをテストします。
Health-ORSC-Benchは、次世代の医療AIアシスタントを調整するための厳格な標準を提供する。
論文 参考訳(メタデータ) (2026-01-25T01:28:52Z) - MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine [69.08855631283829]
我々は,操作的ヒント条件下での安全性能トレードオフの定量化を目的としたベンチマークであるMed Omni-45 Degreesを紹介する。
6つの専門分野にまたがる1,804の推論に焦点を当てた医療質問と3つのタスクタイプが含まれており、その中にはMedMCQAの500が含まれる。
結果は、モデルが対角線を超えることなく、一貫した安全性と性能のトレードオフを示す。
論文 参考訳(メタデータ) (2025-08-22T08:38:16Z) - WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs [54.10865585773691]
LLM安全性のためのオープンで軽量なモデレーションツールであるWildGuardを紹介します。
WildGuardは、ユーザプロンプトにおける悪意のある意図の特定、モデルレスポンスの安全性リスクの検出、モデル拒絶率の決定という3つの目標を達成する。
論文 参考訳(メタデータ) (2024-06-26T16:58:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。