論文の概要: Online Safety Monitoring for LLMs
- arxiv url: http://arxiv.org/abs/2607.02510v1
- Date: Thu, 02 Jul 2026 17:59:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.96508
- Title: Online Safety Monitoring for LLMs
- Title(参考訳): LLMのオンライン安全モニタリング
- Abstract要約: 本稿では,検証信号を外部モデルからアラーム判定に変換するための簡易リアルタイムモニタについて検討し,リスク制御によるしきい値の調整を行った。
数学的推論とレッド・チーム・データセットの実験では、この単純な設計はシーケンシャルな仮説テストに基づくより高度なモニターと競合することを示した。
- 参考スコア(独自算出の注目度): 37.75557357944471
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite alignment training, LLMs remain prone to generating unsafe outputs at deployment time. Monitoring outputs online and raising an alarm when safety can no longer be assumed is therefore critical. We study a simple real-time monitor that turns a verifier signal from an external model into an alarm decision by thresholding, with the threshold calibrated via risk control. In experiments on mathematical reasoning and red teaming datasets, we show that this simple design is competitive with more advanced monitors based on sequential hypothesis testing.
- Abstract(参考訳): アライメントトレーニングにもかかわらず、LCMはデプロイ時に安全でない出力を生成する傾向にある。
そのため、アウトプットをオンラインで監視し、安全を前提にしないアラームを発生させることが重要である。
本稿では,検証信号を外部モデルからアラーム判定に変換するための簡易リアルタイムモニタについて検討し,リスク制御によるしきい値の調整を行った。
数学的推論とレッド・チーム・データセットの実験では、この単純な設計はシーケンシャルな仮説テストに基づくより高度なモニターと競合することを示した。
関連論文リスト
- $D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing [63.49501120848927]
大規模言語モデル(D-LLM)の安全性監視はほとんど未検討である。
D-LLMの2レベル安全モニタであるD2$-Monitorを提案する。
D2$-Monitorは、常にオンのモニターとして軽量プローブを採用して、ヒューズレーションを共同で見積もり、ベース分類を実行する。
論文 参考訳(メタデータ) (2026-05-25T14:22:21Z) - Detecting Object Tracking Failure via Sequential Hypothesis Testing [80.7891291021747]
ビデオにおけるリアルタイムのオンラインオブジェクト追跡は、コンピュータビジョンにおける中核的なタスクである。
本稿では,物体追跡を逐次的仮説テストとして解釈することを提案する。
本研究では,地中追跡情報と内部追跡情報の両方を活用することにより,教師なしと教師なしの両方の変種を提案する。
論文 参考訳(メタデータ) (2026-02-13T14:57:15Z) - Prediction-Powered Risk Monitoring of Deployed Models for Detecting Harmful Distribution Shifts [51.37000123503367]
予測駆動型リスクモニタリング(PPRM)を提案する。
PPRMは、合成ラベルを真のラベルの小さなセットと組み合わせることで、ランニングリスクの任意の有意な下界を構築する。
本稿では,画像分類,大規模言語モデル(LLM),通信監視タスクの広範な実験を通じて,PPRMの有効性を実証する。
論文 参考訳(メタデータ) (2026-02-02T15:32:14Z) - AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor [19.39430341586964]
AutoMonitor-Benchは、さまざまなタスクや障害モードにわたる誤動作モニタの信頼性を体系的に評価する最初のベンチマークである。
本研究では,2つの相補的指標(ミスレート(MR)とFalse Alarm Rate(FAR))を用いてモニタの評価を行った。
本研究では、153,581個のサンプルとQwen3-4B-インストラクションからなる大規模トレーニングコーパスを構築し、既知の比較的簡単に構築可能な誤動作データセットによるトレーニングが、目に見えない、より暗黙的な誤動作に対する監視性能を向上させるかどうかを調査する。
論文 参考訳(メタデータ) (2026-01-09T12:09:45Z) - Beyond Linear Probes: Dynamic Safety Monitoring for Language Models [67.15793594651609]
従来の安全モニタは、クエリ毎に同じ量の計算を必要とする。
動的アクティベーションモニタリングのための線形プローブの自然な拡張であるTrncated Polynomials (TPCs)を紹介する。
我々の重要な洞察は、TPCを段階的に、短期的に訓練し、評価できるということです。
論文 参考訳(メタデータ) (2025-09-30T13:32:59Z) - On Continuous Monitoring of Risk Violations under Unknown Shift [46.65571623109494]
進化するデータストリームにおけるリスク違反のリアルタイムモニタリングのための一般的なフレームワークを提案する。
我々の手法は、遭遇したシフトの性質について最小限の仮定の下で機能する。
本稿では,異常検出におけるリスクの監視と,さまざまなシフト下での予測によるアプローチの有効性について述べる。
論文 参考訳(メタデータ) (2025-06-19T15:52:24Z) - Explaining Unreliable Perception in Automated Driving: A Fuzzy-based Monitoring Approach [1.33134751838052]
本稿では,機械学習(ML)知覚コンポーネントに適したファジィベースの新しいモニタを提案する。
異なる動作条件が知覚コンポーネントの信頼性にどのように影響するかを人間に解釈可能な説明を提供するとともに、ランタイム安全モニターとして機能する。
論文 参考訳(メタデータ) (2025-05-20T14:22:39Z) - Learning Run-time Safety Monitors for Machine Learning Components [8.022333445774382]
本稿では、劣化データセットと機械学習を用いて、機械学習コンポーネントの安全モニタを作成するプロセスを紹介する。
作成した安全モニタは、MLコンポーネントと並行してASにデプロイされ、モデル出力に関連する安全リスクの予測を提供する。
論文 参考訳(メタデータ) (2024-06-23T21:25:06Z) - System Safety Monitoring of Learned Components Using Temporal Metric Forecasting [8.76735390039138]
学習可能な自律システムにおいて、学習したコンポーネントの安全性監視は、その出力がシステムの安全性違反に結びつかないことを保証するために不可欠である。
本稿では,確率的時系列予測に基づく安全監視手法を提案する。
安全度と違反予測精度を実証的に評価し、4つの最先端モデルの推論遅延とリソース使用率について検討した。
論文 参考訳(メタデータ) (2024-05-21T23:48:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。