論文の概要: SaplingGuard: A Multidimensional-Profile-Aware Multi-Agent Guardrail for Developmentally Safe Adolescent-LLM Interaction
- arxiv url: http://arxiv.org/abs/2609.35892v1
- Date: Sun, 27 Sep 2026 14:05:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.882513
- Title: SaplingGuard: A Multidimensional-Profile-Aware Multi-Agent Guardrail for Developmentally Safe Adolescent-LLM Interaction
- Title(参考訳): SaplingGuard: 青少年-LLMインタラクションのための多次元プロファイリング対応多エージェントガードレール
- Abstract要約: SaplingGuardは、プラグイン・アンド・プレイ、プロファイル・アウェア、ダイアログ・アウェア・ガードレールである。
青少年の安全介入を3つの専門エージェントに分解し、ユーザプロファイルの構築、コンテキスト認識型リスクアセスメント、インテント保存型プロンプト最適化を行う。
SplingBenchのSplingGuardは,発達リスクの7つのカテゴリにまたがる276の3ターン対話を含む。
- 参考スコア(独自算出の注目度): 37.550628566660784
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As adolescents increasingly use LLMs in everyday life, ensuring safe and developmentally appropriate responses has become essential. However, existing LLM guardrails primarily target explicit harmful content in isolated prompts or responses and are less effective at identifying implicit, context-dependent developmental risks. To address this limitation, we propose SaplingGuard, a plug-and-play, profile-aware and dialogue-aware guardrail that requires no modification to downstream model parameters. SaplingGuard decomposes adolescent safety intervention into three specialized agents for user profile construction, context-aware risk assessment, and intent-preserving prompt optimization. Together, these agents leverage the current prompt, preceding dialogue, and structured user characteristics to identify contextual risks and guide downstream response generation. We evaluate SaplingGuard on SaplingBench, which contains 276 three-turn dialogues spanning seven categories of developmental risk. Across ten adolescent profile conditions and nine open- and closed-source downstream LLMs, profile-aware retrieval improves the Major Hit rate from 50.8% to 63.7+/-1.1%. End-to-end intervention further reduces the average harmful response rate from 17.10% to 5.27% and increases the average safety score from 0.7017 to 1.0043. These results show that user-profile and dialogue context provide complementary signals for identifying implicit developmental risks, and that SaplingGuard can serve as an effective external safety layer for adolescent-LLM interaction.
- Abstract(参考訳): 青年期は日常生活においてLSMをますます活用しているため、安全で発達的に適切な応答を確実にすることが不可欠である。
しかし、既存のLLMガードレールは、主に孤立したプロンプトや応答において明らかな有害な内容をターゲットにしており、暗黙的、文脈に依存した発達リスクの特定には効果が低い。
この制限に対処するため、下流モデルパラメータの変更を必要としない、プラグアンドプレイ、プロファイル認識、対話対応ガードレールであるSapringGuardを提案する。
SaplingGuardは、青少年の安全介入を3つの専門エージェントに分解し、ユーザプロファイルの構築、コンテキスト認識リスクアセスメント、インテント保存プロンプト最適化を行う。
これらのエージェントは、現在のプロンプト、先行対話、構造化されたユーザ特性を利用して、コンテキストリスクを特定し、下流の応答生成を誘導する。
SplingBenchのSplingGuardは,発達リスクの7つのカテゴリにまたがる276の3ターン対話を含む。
10人の青年のプロファイル条件と9つのオープンソースおよびクローズドソースのLDMで、プロファイルアウェア検索はメジャーヒット率を50.8%から63.7+/-1.1%に改善する。
エンドツーエンドの介入により、平均有害反応率が17.10%から5.27%に減少し、平均安全性スコアが0.7017から1.0043に上昇する。
以上の結果から, ユーザの注意と対話のコンテキストは, 暗黙の発達リスクを識別するための補完的な信号であり, 若年者とLLMの相互作用において, 効果的な外部安全層として機能することが示唆された。
関連論文リスト
- PROACT-Agent: Progressive Runtime Oversight and Active Circuit-breaking for Real-Time Safety [15.95756753197665]
PROACT-Agentはリアルタイムガードレールを実現するために高忠実度軌道を合成するためのフレームワークである。
ProACT-Benchは155,780の状態をマルチモデルでラベル付けしたバイリンガル安全ベンチマークである。
AgentDojoでは、非DoSターゲット攻撃の成功を20.82%から0.40%に削減する。
論文 参考訳(メタデータ) (2026-09-28T06:30:49Z) - Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs [51.56484100374058]
ガードレールの設計には、敵の堅牢性、良質なタスクのユーザビリティ、応答レイテンシの明確なトレードオフが伴う。
決定論的パターンフィルタ,構造検証,コンテキストサンドボックス,セッションレベルの動作チェックを組み合わせた,ドメイン固有のマルチレイヤセーフガードパイプラインの評価を行った。
NeMoは16.22パーセントのFPRと1.5パーセントのレイテンシで0パーセントのバイパスに達し、Prompt Guardは38.48パーセントのFPRと3.60パーセントのバイパスを実現している。
論文 参考訳(メタデータ) (2026-03-29T18:52:01Z) - ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback [53.2744585868162]
エージェントのデプロイには、ステップレベルのツールの実行動作をリアルタイムで監視することが不可欠だ。
LLMエージェントにおけるステップレベルツール起動安全検出のための新しいベンチマークであるTS-Benchを構築した。
次に,マルチタスク強化学習を用いたガードレールモデルTS-Guardを開発した。
論文 参考訳(メタデータ) (2026-01-15T07:54:32Z) - SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth [14.569766143989531]
子供や青年を対象とするアプリケーションにおける大規模言語モデル(LLM)の急速な普及は、一般的なAI安全フレームワークの根本的な再評価を必要とする。
本稿では,年齢別認知,情緒的,社会的リスクなどの不適切な範囲を含む,既存のLCM安全性ベンチマークにおける重要な欠陥を明らかにする。
SproutBenchは,情緒的依存やプライバシー侵害,危険行動の模倣といったリスクを調査するための,1,283の発達的根拠を持つ敵のプロンプトからなる,革新的な評価スイートである。
論文 参考訳(メタデータ) (2025-08-14T18:21:39Z) - Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach [31.925448597093407]
大規模言語モデル(LLM)は、通常、同じプロンプトを与えられたすべてのユーザに対して、同一または類似の応答を生成する。
PENGUINは、7つのセンシティブなドメインにわたる14,000のシナリオからなるベンチマークである。
RAISEはトレーニングなし、2段階のエージェントフレームワークで、ユーザ固有のバックグラウンドを戦略的に取得する。
論文 参考訳(メタデータ) (2025-05-24T21:37:10Z) - WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs [54.10865585773691]
LLM安全性のためのオープンで軽量なモデレーションツールであるWildGuardを紹介します。
WildGuardは、ユーザプロンプトにおける悪意のある意図の特定、モデルレスポンスの安全性リスクの検出、モデル拒絶率の決定という3つの目標を達成する。
論文 参考訳(メタデータ) (2024-06-26T16:58:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。