論文の概要: HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety
- arxiv url: http://arxiv.org/abs/2607.02079v1
- Date: Thu, 02 Jul 2026 12:21:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.82252
- Title: HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety
- Title(参考訳): HaloGuard 1.0:多言語AI安全性のためのオープンウェイトなコンスティチューション分類器
- Authors: Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin,
- Abstract要約: HaloGuard 1.0は、入力安全性のためのコンスティチューション分類のパラダイムのオープンウェイト実装である。
現在のオープンガードモデルの約10分の1のモデルサイズで、英語と多言語のプロンプトセーフティベンチマークで最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present HaloGuard 1.0, an open-weights implementation of the constitutional-classifier paradigm for input safety. It achieves state-of-the-art performance on English and multilingual prompt-safety benchmarks at roughly one-tenth the model size of current leading open guard models. The safety constitution is the organising structure of the corpus: a natural-language constitution of 46 policies and 2,940 subcategories drives synthetic data generation, with exhaustive one-to-one paired counterfactuals that hold topic and vocabulary fixed while flipping intent, a two-tier harmless design that separately targets boundary and baseline false positives (FPs), and balanced multilingual materialisation across 46 languages that treats language as a surface form appearing on both sides of the boundary rather than as an adversarial signal. Across seven prompt-safety benchmarks, HaloGuard 1.0-0.8B attains the best average F1 (90.9) of any open guard we evaluate, outperforming baselines up to 27B parameters (over 30 times larger) while holding false-positive rate (FPR) to 4.3 and false-negative rate (FNR) to 9.5. The HaloGuard 1.0-4B variant reaches average F1 of 92.1 and FPR of 3.5, spending its extra capacity on precision rather than recall. A structured adjudication of the remaining failures indicates that most apparent missed-harm cases are benchmark mislabels rather than genuine model misses. An always-on adversarial red-teaming protocol continuously hardens the guard against both content-level and agentic attacks. We release the models as open weights.
- Abstract(参考訳): 本稿では,入力安全性のためのコンスティチューションクラス化パラダイムのオープンウェイト実装であるHaloGuard 1.0を紹介する。
英語と多言語によるプロンプトセーフティベンチマークにおける最先端のパフォーマンスを、現在の主要なオープンガードモデルのモデルサイズの約10分の1で達成する。
この安全構成は、コーパスの組織構造である: 46のポリシーと2,940のサブカテゴリからなる自然言語構成は、合成データ生成を駆動し、一対一の対の対物が、意図を反転させながらトピックや語彙を固定し、境界とベースラインの偽陽性(FP)を別々にターゲットとする2階層の調和のない設計、言語を敵信号ではなく境界の両側に現れる表面形式として扱う46言語間のバランスの取れた多言語的物質化である。
7つのプロンプトセーフティベンチマークの中で、HaloGuard 1.0-0.8Bは、評価した任意のオープンガードの平均F1(90.9)を達成し、偽陽性率(FPR)を4.3、偽陰性率(FNR)を9.5に保ちながら、27Bパラメータ(30倍以上)のベースラインを上回った。
HaloGuard 1.0-4B は平均 F1 92.1 と FPR 3.5 に達し、リコールよりも精度の向上に費やした。
残りの失敗の構造化された判断は、最も明らかなミスハームケースは、真のモデルミスではなく、ベンチマークミスラベルであることを示している。
常にオンの敵のレッドチームプロトコルは、コンテンツレベルとエージェント攻撃の両方に対するガードを継続的に強化する。
モデルはオープンウェイトとしてリリースします。
関連論文リスト
- CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment [55.74660714572696]
大きな言語モデル(LLM)から生成された悪意のあるコンテンツは、深刻な安全リスクと倫理的懸念を引き起こす可能性がある。
既存のLLMの安全ガードレールは英語や多言語の設定では優れているが、中国固有の規制政策、文化的文脈、言語的ニュアンスには適応していない。
我々は,中国のシナリオに対して,5マクロ,31マイクロカテゴリの細粒度リスク分類を導入し,中国向けLLMコンテンツ安全ガードレールであるCHILLGuardを構築した。
論文 参考訳(メタデータ) (2026-06-13T16:57:51Z) - Comparative Analysis of Inference-Time Defense Methods for Multimodal Large Language Models [0.0]
MLLM(Multimodal large language model)は、安全上重要なアプリケーションに実装されている。
新しい脆弱性クラスごとにモデルをリトレーニングするのは、実用には高すぎる。
3時間防衛法とその組み合わせに関する比較実験的な評価を報告する。
論文 参考訳(メタデータ) (2026-06-09T14:13:54Z) - CLASP: Defending Hybrid Large Language Models Against Hidden State Poisoning Attacks [48.54598003197356]
Mambaのような状態空間モデル(SSM)はトランスフォーマーの効率的な代替品として大きな注目を集めている。
HiSPAsは、最近発見された脆弱性で、敵対する文字列を通じてSSMメモリを破損させる。
この脅威に対して防御するためのCLASPモデルを紹介します。
論文 参考訳(メタデータ) (2026-03-12T17:29:55Z) - Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation [0.4349640169711269]
ビエリク・ガード(英語: Bielik Guard)は、ポーランド語の安全分類法である。
ポーランドの6,885のテキストからなるコミュニティアノテーション付きデータセットに基づいて、これらのモデルは、Hate/Aggression、Vulgarities、Sexual Content、Crith、Self-Harmという5つの安全カテゴリのコンテンツを分類する。
論文 参考訳(メタデータ) (2026-02-08T12:57:04Z) - Sentra-Guard: A Multilingual Human-AI Framework for Real-Time Defense Against Adversarial LLM Jailbreaks [0.31984926651189866]
Sentra-Guardは、大規模言語モデル(LLM)のためのリアルタイムモジュールディフェンスシステムである。
このフレームワークは、FAISSにインデックスされたSBERT埋め込み表現とハイブリッドアーキテクチャを使用して、プロンプトの意味をキャプチャする。
直接攻撃ベクトルと難解攻撃ベクトルの両方において、敵のプロンプトを識別する。
論文 参考訳(メタデータ) (2025-10-26T11:19:47Z) - Qwen3Guard Technical Report [127.69960525219051]
Qwen3Guardは、多言語安全ガードレールモデルである。
生成的Qwen3Guardは、きめ細かい三級判定を可能にする命令追従タスクとして安全分類をキャストする。
Stream Qwen3Guardは、リアルタイム安全監視のためのトークンレベルの分類ヘッドを導入している。
論文 参考訳(メタデータ) (2025-10-16T04:00:18Z) - Emulated Disalignment: Safety Alignment for Large Language Models May Backfire! [65.06450319194454]
大きな言語モデル(LLM)は、人間との安全な会話を確保するために安全アライメントを行う。
本稿では,安全アライメントの反転が可能なトレーニングフリーアタック手法を提案する。
本手法をエミュレートした脱アライメント (ED) と呼ぶのは, このコントラスト分布からのサンプリングは, 安全報酬を最小限に抑えるため, 微調整の結果を確実にエミュレートするからである。
論文 参考訳(メタデータ) (2024-02-19T18:16:51Z) - Locally Differentially Private Document Generation Using Zero Shot
Prompting [61.20953109732442]
本稿では,DP-Prompt と呼ばれる局所的に異なるプライベートなメカニズムを提案し,作者の匿名化攻撃に対処する。
DP-PromptをChatGPT(gpt-3.5)のような強力な言語モデルで使用すると、匿名化攻撃の成功率の顕著な低下が観察される。
論文 参考訳(メタデータ) (2023-10-24T18:25:13Z) - Robust Encodings: A Framework for Combating Adversarial Typos [85.70270979772388]
NLPシステムは入力の小さな摂動によって容易に騙される。
このような混乱に対して防御するための既存の手順は、最悪の場合の攻撃に対して確実な堅牢性を提供する。
モデルアーキテクチャに妥協を加えることなく、ロバスト性を保証するロブエン(RobEn)を導入します。
論文 参考訳(メタデータ) (2020-05-04T01:28:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。