論文の概要: Persona Guardrail: A Production-Grade Defense Framework for Agentic Systems
- arxiv url: http://arxiv.org/abs/2610.03434v1
- Date: Fri, 02 Oct 2026 15:13:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.438623
- Title: Persona Guardrail: A Production-Grade Defense Framework for Agentic Systems
- Title(参考訳): Persona Guardrail: エージェントシステムのためのプロダクショングレード防衛フレームワーク
- Abstract要約: 我々は、顧客向けAIシステムの明示的な機能境界を強制する、プロダクショングレードのランタイム防衛フレームワークであるPersona Guardrailを紹介する。
一般的なLLMベースのガードレールと比較して、ペルソナガードレールは全体の精度を85.7%から95.9%に改善し、ドメイン外検出を57.3%から93.5%に改善し、誤認可率を25.0%から4.7%に引き下げた。
- 参考スコア(独自算出の注目度): 0.3127125540508939
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model-based agents are increasingly deployed to perform domain-specific tasks by interacting with enterprise knowledge, tools, and external services. Existing runtime guardrails primarily target prompt injection and other attack-specific behaviors under a black-box threat model, but provide limited guarantees that agents operate within their intended functionality. As a result, production agents remain vulnerable to malicious requests and out-of-domain queries that existing defenses often fail to distinguish. We present Persona Guardrail, a production-grade runtime defense framework that enforces explicit functional boundaries for customer-facing agentic AI systems through synchronous input and output validation driven by semantic allowlist and blocklist specifications. We also introduce PAGE (Persona-Aware Guardrail Evaluation), a benchmark for evaluating function-specific guardrails across benign, adversarial, and out-of-domain interactions on both user and agent turns. Compared with a generic LLM-based guardrail, Persona Guardrail improves overall accuracy from 85.7% to 95.9%, increases out-of-domain detection from 57.3% to 93.5%, and reduces the false-approved rate from 25.0% to 4.7%. Currently deployed in production, Persona Guardrail meets its latency budget while sustaining a very low false-block and false-allow rate under realistic production workloads. These results demonstrate that Persona Guardrail provides a practical, scalable, and production-ready foundation for securing agentic AI systems.
- Abstract(参考訳): 大規模言語モデルベースのエージェントは、企業知識やツール、外部サービスと対話することで、ドメイン固有のタスクを実行するためにますますデプロイされる。
既存のランタイムガードレールは、主にブラックボックス脅威モデルの下でのプロンプトインジェクションやその他の攻撃固有の振る舞いをターゲットとしているが、エージェントが意図した機能内で動作することの保証は限られている。
その結果、運用エージェントは悪意のあるリクエストや、既存のディフェンスが区別できないようなドメイン外クエリに対して脆弱なままになります。
我々は、セマンティックレシージャリストとブロックリスト仕様によって駆動される同期入力と出力バリデーションを通じて、顧客向けのエージェントAIシステムの明示的な機能境界を強制する、プロダクショングレードのランタイム防衛フレームワークであるPersona Guardrailを提案する。
PAGE(Persona-Aware Guardrail Evaluation)も導入しています。これは、ユーザとエージェントの両方のターンで、良性、逆性、およびドメイン外相互作用を横断する機能固有のガードレールを評価するためのベンチマークです。
一般的なLLMベースのガードレールと比較して、ペルソナガードレールは全体の精度を85.7%から95.9%に改善し、ドメイン外検出を57.3%から93.5%に改善し、誤認可率を25.0%から4.7%に引き下げた。
現在本番環境にデプロイされているPersona Guardrailは、実際の運用ワークロード下では、非常に低い偽ブロックと偽許容率を維持しながら、レイテンシ予算を満たしている。
これらの結果は、Persona GuardrailがエージェントAIシステムを保護するための実用的でスケーラブルでプロダクション対応の基盤を提供することを示している。
関連論文リスト
- StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing [80.39644823192113]
StepGuardは、完了したエージェントの軌跡を監査し、実行前にツールアクションをチェックするステップレベルのガードモデルである。
StepGuardは、GPT-5.4に匹敵するパフォーマンスで、オープンウェイトガードモデルの中で最高の平均精度を達成した。
AgentDojoとAgentDynのエージェントを保護するために使用される場合、StepGuardは平均攻撃成功率を77.3%削減する。
論文 参考訳(メタデータ) (2026-08-25T16:17:27Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - PlanGuard: Defending Agents against Indirect Prompt Injection via Planning-based Consistency Verification [1.7904458681854372]
PlanGuardは、コンテキスト分離の原則に基づいた、トレーニング不要の防御フレームワークである。
PlanGuardは攻撃を効果的に中和し、アタック成功率(ASR)を72.8%から0%に下げる。
論文 参考訳(メタデータ) (2026-04-11T09:59:46Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Enforcing Temporal Constraints for LLM Agents [10.694240979134326]
既存のガードレールは不正確な自然言語命令やポストホック監視に依存している。
本稿では,LDMエージェントが正式な時間的安全特性に準拠することを保証するランタイム保証を提供する新しいフレームワークであるAgent-Cを提案する。
我々は,Agent-Cを,小売顧客サービスと航空券予約システムという,現実世界の2つのアプリケーションで評価する。
論文 参考訳(メタデータ) (2025-12-25T06:12:13Z) - STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents [38.755035623707656]
本稿では,エージェントツールの利用を生かした新しいマルチターンアタックフレームワークSTACについて紹介する。
我々は,483のSTACケースを自動生成し,評価するために,1,352セットのユーザエージェント環境相互作用を特徴とするフレームワークを適用した。
GPT-4.1を含む最先端のLSMエージェントはSTACに対して極めて脆弱であり,攻撃成功率(ASR)は90%以上である。
論文 参考訳(メタデータ) (2025-09-30T00:31:44Z) - WebGuard: Building a Generalizable Guardrail for Web Agents [59.31116061613742]
WebGuardは、Webエージェントアクションリスクの評価をサポートするために設計された最初のデータセットである。
その中には、22のドメインにわたる193のWebサイトからの4,939の人手によるアノテートアクションが含まれている。
論文 参考訳(メタデータ) (2025-07-18T18:06:27Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents [6.829628038851487]
大きな言語モデル(LLM)エージェントは、ツール統合を通じて複雑な現実世界のタスクを実行できる対話アシスタントとして、ますます多くデプロイされている。
特に間接的なプロンプトインジェクション攻撃は、外部データソースに埋め込まれた悪意のある命令が、エージェントを操作してユーザの意図を逸脱させる、重大な脅威となる。
我々は,エージェントのセキュリティが有害な行為を防止し,タスクアライメントを確保するためには,すべてのエージェントアクションをユーザ目的に役立てる必要がある,という新たな視点を提案する。
論文 参考訳(メタデータ) (2024-12-21T16:17:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。