論文の概要: Do Safety Guardrails Need to Reason? LeanGuard: A Fast and Light Approach for Robust Moderation
- arxiv url: http://arxiv.org/abs/2606.26686v1
- Date: Thu, 25 Jun 2026 07:15:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.190333
- Title: Do Safety Guardrails Need to Reason? LeanGuard: A Fast and Light Approach for Robust Moderation
- Title(参考訳): LeanGuard:ロバストなモデレーションのための高速で軽量なアプローチ
- Abstract要約: 我々は、軽量な双方向エンコーダと推論ガードを同じコーパスで訓練する。
連鎖がモデレーション精度を向上しないことを示す。
395Mラベルのみのエンコーダは、公開ベンチマークで平均82.90$pm$ 0.26のF1に達する。
- 参考スコア(独自算出の注目度): 9.68749971398651
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In order to screen a prompt or a response, the recent guardrail methods generate a chain-of-thought (CoT) before they issue a verdict. This design follows a common belief that step-by-step reasoning improves a decision. However, CoT also makes the guard heavy and slow, because the model must generate many tokens before it decides. This may not match how guardrails are actually deployed. A guardrail sometimes should not be heavy and slow, and it often runs on-device, for example on an embodied robot. In this paper, we pose a question whether a safety guardrail really needs to reason. To answer this question, we train a lightweight bidirectional encoder and a reasoning guard on the same corpus, and we then remove only the reasoning while we keep everything else fixed. With this controlled same-base comparison, we show that the chain does not improve moderation accuracy. We name the resulting guard LeanGuard. A 395M label-only encoder reaches an average F1 of 82.90 $\pm$ 0.26 over public benchmarks. It matches a reasoning guard that is built on a much larger decoder, while it uses only a single forward pass over an input of at most 512 tokens. This is about a ~100x reduction in inference compute. We further show that this label-only encoder stays robust under training-label noise and retains far more recall at a strict false-positive rate than the reasoning guard, so a heavier reasoning guard is not the more robust choice either. Our finding suggests that the current guardrail benchmarks may not be hard enough to reward reasoning, and that the necessity of CoT for moderation is still not proven. We release all source codes and models including LeanGuard at https://github.com/ndb796/LeanGuard.
- Abstract(参考訳): プロンプトや応答をスクリーニングするために、最近のガードレール法は、判決を出す前にチェーン・オブ・シント(CoT)を生成する。
この設計は、ステップバイステップの推論が意思決定を改善するという共通の信念に従う。
しかし、CoTはガードを重く遅くする。なぜならモデルは決定する前に多くのトークンを生成する必要があるからだ。
これはガードレールの実際の展開方法と一致しないかもしれない。
ガードレールは重くて遅いものであってはならない場合もあり、例えばエンボディロボットではデバイス上で動作します。
本稿では,安全ガードレールが本当に理にかなう必要があるのかという疑問を提起する。
この質問に答えるために、私たちは、軽量な双方向エンコーダと推論ガードを同じコーパスでトレーニングします。
この制御された同塩基比較により、連鎖はモデレーション精度を向上しないことを示す。
結果として得られたガードをLeanGuardと名付けます。
395Mラベルのみのエンコーダは、公開ベンチマークで平均82.90$\pm$ 0.26に達する。
これは、はるかに大きなデコーダ上に構築された推論ガードと一致し、少なくとも512トークンの入力に1つのフォワードパスしか使用しない。
これは推論計算の約100倍の削減である。
さらに、このラベルのみのエンコーダは、トレーニングラベルノイズ下では堅牢であり、推論ガードよりも厳密な偽陽性率でリコールされるので、重い推論ガードがより堅牢な選択ではないことも示している。
我々の発見は、現在のガードレールベンチマークは推論に報いるほど難しくない可能性があり、調整のためのCoTの必要性はまだ証明されていないことを示唆している。
LeanGuardを含むすべてのソースコードとモデルをhttps://github.com/ndb796/LeanGuardでリリースします。
関連論文リスト
- LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails [21.90973380292976]
LongGuardは、長期コンテキストガードレール障害を評価し、機械的に分析し、緩和するフレームワークである。
安全ニードル・イン・ア・ヘイスタック(SafetyNIAH)として、長さ0.25k-32kのグリッド上でタスクを定式化する。
15本の主要ガードレールの内、安全でないリコールは平均で50%以上単調に減少し、対のベニグニ・フィル対ニードル・リピートの設計は、絶対的な長さではなく、安全でない針の比例希釈の失敗を特徴としている。
論文 参考訳(メタデータ) (2026-08-27T18:07:25Z) - When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation [9.68749971398651]
視覚言語AIアシスタントは、生成されたトークンのストリームとして回答を返す。
その答えを監視できる安全ガードは、ストリームに追随し、ユーザーがそれを読む前に有害な応答を止める必要がある。
最近の視覚言語ガードレールは、判決を出す前に一連の思考を生成する。
論文 参考訳(メタデータ) (2026-07-23T15:02:24Z) - GLiGuard: Schema-Conditioned Classification for LLM Safeguard [5.918280835312565]
LLMコンテンツのモデレーションにGLiNER2を応用した双方向エンコーダである textbfGLiGuard を導入する。
キーとなるアイデアは、タスク定義とラベルのセマンティクスを直接、構造化トークンスキーマとして入力シーケンスにエンコードすることだ。
GLiGuardは、23-90$times$小さながら、7B--27Bデコーダベースのガードと競合するF1スコアを達成した。
論文 参考訳(メタデータ) (2026-05-08T16:44:07Z) - Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs [70.81495077853673]
ハードゲートのセーフティチェッカーは、しばしばベンダーのモデル仕様に過度に反抗し、不平を言う。
この研究は、ガーディアン・アズ・ア・アドバイザ(GaaA)というソフトゲーティングパイプラインを導入し、保護者がバイナリリスクラベルを予測し、このアドバイスを元のクエリに再推論する。
全体として、GaaAはモデル仕様に従うようモデルに指示し、過度な拒絶を減らしながら安全性を維持している。
論文 参考訳(メタデータ) (2026-04-08T23:47:29Z) - THINKSAFE: Self-Generated Safety Alignment for Reasoning Models [60.10077024249373]
外部の教師がいなくても安心して安心できるフレームワークであるThinkSafeを提案する。
我々の重要な洞察は、コンプライアンスは安全メカニズムを抑制するが、モデルはしばしば害を特定するために潜伏した知識を保持することである。
DeepSeek-R1-DistillとQwen3の実験では、ThinkSafeは推論能力を維持しながら安全性を大幅に向上している。
論文 参考訳(メタデータ) (2026-01-30T16:31:02Z) - Bag of Tricks for Subverting Reasoning-based Safety Guardrails [62.139297207938036]
推論に基づくガードレールを覆い隠すジェイルブレイク手法の袋を提示する。
攻撃対象は白、グレー、ブラックボックスの設定で、無駄なテンプレート操作から完全に自動化された最適化までさまざまです。
論文 参考訳(メタデータ) (2025-10-13T16:16:44Z) - Beyond Linear Probes: Dynamic Safety Monitoring for Language Models [67.15793594651609]
従来の安全モニタは、クエリ毎に同じ量の計算を必要とする。
動的アクティベーションモニタリングのための線形プローブの自然な拡張であるTrncated Polynomials (TPCs)を紹介する。
我々の重要な洞察は、TPCを段階的に、短期的に訓練し、評価できるということです。
論文 参考訳(メタデータ) (2025-09-30T13:32:59Z) - MARCOS: Deep Thinking by Markov Chain of Continuous Thoughts [82.46857666702924]
大規模言語モデル(LLM)における推論のための新しいパラダイムを提案する。
自己回帰的にトークンを生成する代わりに、連続的で高次元の「思考」のマルコフ連鎖として推論をモデル化する。
MARCOSはトークンベースのCoTに匹敵する性能を初めて達成し、GSM8Kでは4.7%、推論では15.7倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2025-09-29T16:44:22Z) - No Free Lunch with Guardrails [0.0]
我々は,現行のガードレールが実用性を維持しつつ誤用を効果的に防ぐかどうかを評価する。
調査の結果,ガードレール付き無料ランチは存在せず,セキュリティ強化がしばしばユーザビリティの犠牲となることが確認された。
ユーザビリティを維持しつつリスクを最小限に抑える優れたガードレールを設計するための青写真を提案する。
論文 参考訳(メタデータ) (2025-04-01T05:46:54Z) - GuardReasoner: Towards Reasoning-based LLM Safeguards [100.85955697211323]
本稿では, LLM の新たなセーフガードである GuardReasoner を提案する。
GuardReasonerTrainデータセットは、117Kのサンプルと460Kの詳細な推論ステップで構成されています。
次に、ガードモデルの推論能力を解き放つための推論SFTを導入する。
このように、GuardReasonerはより良いパフォーマンス、説明可能性、一般化可能性を達成する。
論文 参考訳(メタデータ) (2025-01-30T17:06:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。