論文の概要: Triaging Threats to Specialized Guardrails
- arxiv url: http://arxiv.org/abs/2605.30693v1
- Date: Fri, 29 May 2026 00:36:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.309415
- Title: Triaging Threats to Specialized Guardrails
- Title(参考訳): 特殊ガードレールへの脅威の試行
- Abstract要約: 本稿では,各会話を専門のガードレールにトリアージし,脅威特有の検出を行うルータ専門家フレームワークであるRouteGuardを提案する。
実験によると、RouteGuardは強力なガードレールベースライン上でのきめ細かい脅威検出を改善し、ドメイン外評価下での最適化を向上し、出現する脅威に対する柔軟なモジュール拡張をサポートする。
- 参考スコア(独自算出の注目度): 28.51218244260799
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Building robust safety guardrails is essential for deploying Large Language Models across diverse real-world applications. However, this goal remains challenging because safety risks span heterogeneous threat domains, while existing datasets cover only fragmented risk subsets and rely on inconsistent taxonomies. Consequently, it remains unclear whether current guardrails can generalize beyond narrow evaluation settings. To better understand the robustness of guardrail models, we first introduce GuardZoo, a unified human-annotated benchmark with 32,460 samples covering 15 distinct unsafe categories. Evaluation on GuardZoo reveals that monolithic guardrails suffer from task interference: different threat domains require distinct decision boundaries that are difficult to compress into a single model. We therefore propose RouteGuard, a router-expert framework that triages each conversation to specialized expert guardrails for threat-specific detection. Experiments show that RouteGuard improves fine-grained threat detection over strong guardrail baselines, generalizes better under out-of-domain evaluation, and supports flexible modular expansion to emerging threats.
- Abstract(参考訳): さまざまな現実世界のアプリケーションにまたがって大規模言語モデルをデプロイするには、堅牢な安全ガードレールの構築が不可欠である。
しかし、既存のデータセットは断片化されたリスクサブセットのみをカバーし、一貫性のない分類に依存しているため、安全リスクは異種脅威ドメインにまたがるため、この目標はまだ難しいままである。
その結果、現在のガードレールが狭い評価設定を超えて一般化できるかどうかは不明である。
ガードレールモデルの堅牢性をよりよく理解するために,まず最初にGuardZooを紹介した。
GuardZooの評価によると、モノリシックなガードレールはタスクの干渉に悩まされている。
そこで我々は,脅威特異的検出のために,各会話を専門のガードレールにトリアージするルータ専門家フレームワークであるRouteGuardを提案する。
実験によると、RouteGuardは強力なガードレールベースライン上でのきめ細かい脅威検出を改善し、ドメイン外評価下での最適化を向上し、出現する脅威に対する柔軟なモジュール拡張をサポートする。
関連論文リスト
- HazardAuditor: From Executable Threats to Safer Computer-Use Agents [50.06351661912873]
既存のガードモデルは静的なプロンプトと応答をターゲットとしている。
既存の安全プラットフォームは、正規化された監督ではなく、ガードモデルで学ぶ必要がある評価判断を生成する。
両ギャップを埋める実行基盤フレームワークであるHazardAuditorを紹介します。
論文 参考訳(メタデータ) (2026-09-14T07:09:33Z) - BraveGuard: From Open-World Threats to Safer Computer-Use Agents [68.38397514360227]
BraveGuardは、オープンワールドの脅威信号とリアルエージェントの軌道からモデルを訓練するための自己進化型防衛フレームワークである。
我々は、Qwen3-GuardやLlama-Guardなど複数のガードバックボーンをトレーニングしてBraveGuardをインスタンス化し、トラジェクトリレベルのエージェントセーフティベンチマークの結果のガードを評価する。
論文 参考訳(メタデータ) (2026-05-31T11:16:18Z) - HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task [42.665798473119516]
CG-CoT(Context-Guided Chain-of-Thought)を特徴とするアーキテクチャ非依存型セーフガードを提案する。
CG-CoTは、リスクアセスメントをアクティブな知覚に分解し、相互作用対象や関連する空間近傍への注意を順次固定する。
実験により、我々のモデルであるHomeGuardは安全性を大幅に向上し、ベースモデルと比較してリスクマッチ率を30%以上改善することが示された。
論文 参考訳(メタデータ) (2026-03-15T13:09:43Z) - TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models [19.148124494194317]
我々は,小規模モデルを堅牢な推論ファイアウォールに変換するプロセス誘導型セキュリティフレームワークであるTraceGuardを提案する。
提案手法は,推理トレースを信頼できないペイロードとして扱い,詳細な防衛戦略を確立する。
グレーボックス設定における適応的敵に対する堅牢性を実証し、TraceGuardを実用的で低レイテンシなセキュリティプリミティブとして確立する。
論文 参考訳(メタデータ) (2026-03-02T22:19:13Z) - ProGuard: Towards Proactive Multimodal Safeguard [48.89789547707647]
ProGuardは視覚言語プロアクティブガードであり、アウト・オブ・ディストリビューション(OOD)の安全性リスクを特定し記述する。
まず,2次安全ラベルとリスクカテゴリの両方を付加した87Kサンプルのモダリティバランスデータセットを構築した。
次に、強化学習を通して視覚言語ベースモデルを純粋に訓練し、効率的かつ簡潔な推論を実現する。
論文 参考訳(メタデータ) (2025-12-29T16:13:23Z) - AprielGuard [2.3704817495377526]
既存のツールは、安全性のリスクを別の問題として扱い、堅牢性と一般化性を制限する。
AprielGuardは8Bパラメータ保護モデルで、これらの次元を単一の分類と学習フレームワークに統合する。
AprielGuardは有害なコンテンツの検出と敵の操作において高い性能を達成する。
論文 参考訳(メタデータ) (2025-12-23T12:01:32Z) - Qwen3Guard Technical Report [127.69960525219051]
Qwen3Guardは、多言語安全ガードレールモデルである。
生成的Qwen3Guardは、きめ細かい三級判定を可能にする命令追従タスクとして安全分類をキャストする。
Stream Qwen3Guardは、リアルタイム安全監視のためのトークンレベルの分類ヘッドを導入している。
論文 参考訳(メタデータ) (2025-10-16T04:00:18Z) - Building a Foundational Guardrail for General Agentic Systems via Synthetic Data [76.18834864749606]
LLMエージェントは、計画段階で介入するマルチステップタスクを計画できる。
既存のガードレールは主にポスト・エグゼクティブ(英語版)を運用しており、スケーリングが困難であり、計画レベルで制御可能な監督を行う余地がほとんどない。
我々は、良性軌道を合成し、カテゴリーラベル付きリスクを困難に注入し、自動報酬モデルを介して出力をフィルタリングする制御可能なエンジンであるAuraGenを紹介する。
論文 参考訳(メタデータ) (2025-10-10T18:42:32Z) - GuardSet-X: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset [18.306944278068638]
ここでは、最初の大規模マルチドメイン安全ポリシー付きガードレールデータセットであるGuardSet-Xを紹介する。
GuardSet-Xは金融、法律、CodeGenといった8つのセーフティクリティカルドメインにまたがる広範なドメインカバレッジを提供する。
先進的なガードレールモデル19をベンチマークし、一連の結果を明らかにした。
論文 参考訳(メタデータ) (2025-06-18T01:35:33Z) - WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs [54.10865585773691]
LLM安全性のためのオープンで軽量なモデレーションツールであるWildGuardを紹介します。
WildGuardは、ユーザプロンプトにおける悪意のある意図の特定、モデルレスポンスの安全性リスクの検出、モデル拒絶率の決定という3つの目標を達成する。
論文 参考訳(メタデータ) (2024-06-26T16:58:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。