論文の概要: Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework
- arxiv url: http://arxiv.org/abs/2607.19361v1
- Date: Wed, 03 Jun 2026 02:55:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.132082
- Title: Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework
- Title(参考訳): マルチTurn LLMシステムのためのステートフルガードレール:会話型リスク蓄積フレームワーク
- Authors: Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik,
- Abstract要約: 我々は,この会話型リスク蓄積(CRA:Conversational Risk Accumulation)と呼ぶ。段階的な意図の漂流,禁止命令の断片化,繰り返しの開示からの感度向上である。
本稿では,セッションアンカーからのセマンティックドリフト,抽出されたエンティティに対する感度重み付け情報蓄積グラフ,従順性を高めたコンプライアンス・グラディエント信号の3つのトラジェクティブ信号を追跡するセッション層CRAフレームワークを提案する。
i)帰属・消滅のための教師なし凸融合,(ii)家族対人目的で訓練されたコンパクト学習軌道モデルCRA-Net DAを提供する。
- 参考スコア(独自算出の注目度): 0.19116784879310023
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most safety guardrails for large language models (LLMs) evaluate each prompt-response pair in isolation, which misses failures that arise only over a dialogue as benign turns compose into harm. We term this Conversational Risk Accumulation (CRA): gradual intent drift, fragmented assembly of prohibited instructions, and sensitivity build-up from repeated disclosures. We propose a session-layer CRA Framework that tracks three trajectory signals: semantic drift from a session anchor, a sensitivity-weighted information accumulation graph over extracted entities, and a compliance-gradient signal capturing increasing willingness to comply. For scoring, we provide (i) an unsupervised convex fusion for attribution and ablations, and (ii) CRA-Net DA, a compact learned trajectory model trained with family-adversarial objectives to reduce length and topic-coverage confounds. To benchmark CRA, we release CRA-Bench v0.1 (1,200 eight-turn sessions across three threat families with topic-matched benign twins), CRA-Bench v0.2 (LLM-paraphrased variants to reduce template artifacts), and an extended 5-family set (2,000 sessions adding persona priming and context stuffing). We introduce a trajectory-native evaluation protocol with session-level splits, mixed-set threshold calibration, Trajectory AUROC, turns-to-detection, calibrated false-positive metrics, bootstrap confidence intervals, leave-one-family-out diagnostic stress tests, and synthetic-to-human transfer checks. Claims focus on within-distribution session scoring on CRA-Bench and human-transfer subsets.
- Abstract(参考訳): 大きな言語モデル(LLM)のほとんどの安全ガードレールは、各プロンプト-レスポンスペアを独立して評価する。
本稿では,会話型リスク蓄積(CRA:Conversational Risk Accumulation)と呼ぶ。段階的な意図の漂流,禁止命令の断片化,繰り返しの開示からの感度向上である。
本稿では,セッションアンカーからのセマンティックドリフト,抽出されたエンティティに対する感度重み付け情報蓄積グラフ,従順性を高めたコンプライアンス・グラディエント信号の3つのトラジェクティブ信号を追跡するセッション層CRAフレームワークを提案する。
採点には
一 帰属及び消滅のための無監督凸核融合
(II)CRA-Net DAは,家族の敵対的目標を学習した学習軌道モデルであり,長さとトピック被覆の相違を低減させる。
CRAをベンチマークするために、CRA-Bench v0.1(トピックマッチングされた良性双生児を持つ3つの脅威ファミリーにまたがる1200の8ターンセッション)、CRA-Bench v0.2(テンプレートアーティファクトを減らすためのLLM-パラフレーズ付き変種)、および拡張された5ファミリーセット(ペルソナプライミングとコンテキスト詰め込みを追加した2000のセッション)をリリースする。
本研究では,セッションレベル分割,混合閾値校正,トラジェクトリAUROC,ターン・トゥ・ディテクト,キャリブレーションされた偽陽性指標,ブートストラップ信頼区間,アウト・ワン・ファミリー・アウト・診断ストレステスト,人工-人間移動チェックを備えたトラジェクトリネイティブ評価プロトコルを提案する。
主張は、CRA-Benchおよびヒューマントランスファーサブセットのイントラディストリビューションセッションスコアリングに焦点を当てている。
関連論文リスト
- PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection [0.0]
本稿では,決定論的シミュレーションエンジンが基底真理を維持し,言語モデルが表面の散文のみを生成する検証可能な合成ベンチマークを提案する。
コーパスは51日の模擬日、2,904回のテレメトリ記録を96.4%のノイズレートで記録し、単面と単日のトリアージ戦略を破るために設計された4つの検出シナリオをカバーしている。
論文 参考訳(メタデータ) (2026-03-23T19:03:53Z) - Seeing through the Conflict: Transparent Knowledge Conflict Handling in Retrieval-Augmented Generation [12.469991196570106]
TCR (Transparent Conflict Resolution) は、二重コントラストエンコーダを介して意味マッチングと事実整合性を切り離す。
知識ギャップリカバリを+21.4ppで増加させ、誤解を招くコンテキストオーバーライドを-29.3ppで削減し、パラメータは0.3%に留まる。
信号は人間の判断と一致し、時間的決定パターンを明らかにする。
論文 参考訳(メタデータ) (2026-01-11T10:08:49Z) - StutterFuse: Mitigating Modality Collapse in Stuttering Detection with Jaccard-Weighted Metric Learning and Gated Fusion [0.40105987447353786]
散乱検出は、拡散が重なると故障する。
既存のパラメトリックモデルは、複雑で同時的な分散を区別するのに苦労する。
マルチラベル検出のための最初のレトリーバル拡張一般化(RAC)であるStutterFuseを紹介する。
論文 参考訳(メタデータ) (2025-12-15T18:28:39Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Robustifying 3D Perception via Least-Squares Graphs for Multi-Agent Object Tracking [43.11267507022928]
本稿では,3次元LiDARシーンにおける対向雑音に対する新たな緩和フレームワークを提案する。
我々は最小二乗グラフツールを用いて各検出の遠心点の位置誤差を低減する。
実世界のV2V4Realデータセットに関する広範な評価研究は、提案手法がシングルエージェントとマルチエージェントの両方のトラッキングフレームワークよりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2025-07-07T08:41:08Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - An Experimental Study on Private Aggregation of Teacher Ensemble
Learning for End-to-End Speech Recognition [51.232523987916636]
差分プライバシー(DP)は、プライバシーデータにノイズのある歪みを課すことで、深層モデルのトレーニングに使用されるユーザー情報を保護するための1つのデータ保護手段である。
本研究では、PATE学習を動的パターン、すなわち音声を扱うように拡張し、音響データの漏洩を避けるために、ASRに関する最初の実験を行う。
論文 参考訳(メタデータ) (2022-10-11T16:55:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。