FuguReport

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

著者 Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu
所属 Fudan University / Shanghai AI Laboratory / King Abdullah University of Science and Technology / Beihang University / Renmin University of China
カテゴリ Method / Model Safety / Step-level tool action checking, Application / Agent Protection / Reducing agent attack success rate, Evaluation / Safety Performance Evaluation / Guard model accuracy and attack mitigation
ライセンス CC BY 4.0

Abstractの概要

StepGuardは、候補となるツールアクションの実行前チェックと完了した軌跡の事後監査の両方をサポートする、LLMエージェント向けの4Bステップレベルガードモデルです。本論文では、指定されたリスクのあるステップの周囲でプレフィックスが揃った安全および安全でない軌跡の分岐と、教師データ用の良性ツール再利用例を生成する合成データエンジン「StepGen」を導入しています。また、防御バイアスを低減するために、安全・安全でないクラスのうち現在精度が低い方に最適化の重み付けを動的に調整する学習手法「Balance-GRPO」を提案しています。静的ベンチマークにおいてStepGuardは軌跡およびステップの両方の粒度で強力な性能を示し、エージェント保護実験ではほとんどの有用性を維持しながら攻撃成功率を大幅に低下させますが、敵対性の高いAgentHarm環境では依然として課題が残ります。

新規性

本論文の主な新規性は、実行前の安全でないツールアクションのブロックと事後の完全な軌跡監査の両方を単一モデルで実現する、ステップレベルのエージェントガードレールを構築した点にあります。プレフィックスを揃えた合成教師データパイプライン「StepGen」と、学習中のクラス別精度差に基づいてアドバンテージを動的に再重み付けし、安全性と有用性のトレードオフを明示的に調整する「Balance-GRPO」を組み合わせています。

成果

静的評価において、StepGuardはオープンウェイトのガードモデルの中で最も高い平均精度を達成し、軌跡レベルのベンチマークで精度83.0/F1 83.3、ステップレベルで精度84.8/F1 84.1を記録し、GPT-5.4に匹敵しました。AgentDojoおよびAgentDynでエージェント保護に適用した際、無防御時と比較して平均攻撃成功率を77.3%削減しつつ、有用性の低下は平均2.8ポイントにとどまりました。アブレーション実験では、Balance-GRPOが安全・安全でないクラス間の精度差を13.0から8.0に縮小し、通常のGRPOと比較してASRの増加をわずか0.3ポイントに抑えながら保護下のエージェントの有用性を最大6.7ポイント向上させることが示されました。

論文の注目点

  1. StepGuardは、実行前に文脈に応じた候補ツール呼び出しを評価し、完了したマルチステップの軌跡を診断することで、アクションレベルのエージェント安全性を対象としています。
  2. StepGenは、プレフィックスが一致する安全・安全でない分岐と良性なツール再利用の軌跡を通じてスケーラブルな教師データを提供し、モデルが表層的なツールの識別情報と真のリスクを区別できるように支援します。
  3. Balance-GRPOは、観測精度が低いクラスを動的に重視することで過剰防御と防御不足を低減し、実行時の安全性と有用性のバランスを改善するように設計されています。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。