論文の概要: Local Sparsity Enables Unsupervised LLM Safety Detection
- arxiv url: http://arxiv.org/abs/2609.20129v1
- Date: Thu, 17 Sep 2026 12:23:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.257284
- Title: Local Sparsity Enables Unsupervised LLM Safety Detection
- Title(参考訳): ローカルスパーシリティは、監視されていないLLM安全性検出を可能にする
- Abstract要約: 大規模言語モデル(LLM)のデプロイ時の安全性メソッドは、主に教師付きであり、安全でないトレーニングデータへのアクセスを前提としている。
新たな攻撃や危害のカテゴリーは定期的に発生し、そのような教師付き方式で訓練されたモデルでは捕捉されない。
本稿では,理論的正当性に支えられた局所的なSAEによる異常検出のための枠組みを提案する。
- 参考スコア(独自算出の注目度): 72.36186449615774
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deployment-time safety methods for large language models (LLMs) are predominantly supervised and assume access to unsafe training data. Nevertheless, new attacks and harm categories regularly arise, not captured by models trained in such a supervised fashion. An alternative approach is to view this problem through the lens of anomaly detection, namely, to rely solely on modeling safe data and flagging out-of-distribution inputs. However, LLM activations lie in a high-dimensional space, raising concerns about whether anomaly detection is statistically feasible. We show that, under the linear representation hypothesis (LRH), there may indeed be hope. In the LRH concept space, which is typically recovered via a sparse autoencoder (SAE), nearby points share a small common active support. Using this local sparsity insight, we propose a framework for locally masked SAE-based anomaly detection, supported by theoretical justifications. We validate it on various architectures and datasets, including both capability-testing datasets and safety-specific datasets. Finally, when we allow algorithms to use 1% out-of-distribution data for calibration, locally sparse methods achieve near-optimal performance, demonstrating their ability to capture meaningful safety information while using only 1-2% of SAE neurons for computation.
- Abstract(参考訳): 大規模言語モデル(LLM)のデプロイ時の安全性メソッドは、主に教師付きであり、安全でないトレーニングデータへのアクセスを前提としている。
それにもかかわらず、新しい攻撃と危害カテゴリーは定期的に発生し、そのような教師付き方式で訓練されたモデルでは捕獲されない。
もう一つのアプローチは、この問題を異常検出のレンズを通して見ることであり、つまり、安全なデータのモデリングと配布外の入力にのみ依存することである。
しかし、LSMの活性化は高次元空間にあり、異常検出が統計的に可能かどうかという懸念を提起する。
線形表現仮説(LRH)の下では、実際に希望があることが示される。
LRHの概念空間は、通常スパースオートエンコーダ(SAE)を介して回復されるが、近隣の点は小さな共通のアクティブサポートを共有している。
この局所空間的洞察を用いて,理論的正当性に支えられた局所的にSAEに基づく異常検出を行うための枠組みを提案する。
機能テストデータセットと安全性固有のデータセットの両方を含む、さまざまなアーキテクチャとデータセットで検証しています。
最後に、アルゴリズムが1%の分布外データをキャリブレーションに使用できるようにすると、局所スパース法は、計算に1-2%のSAEニューロンを使用しながら、有意義な安全性情報をキャプチャする能力を示す。
関連論文リスト
- Operational Range Bounding in Spectroscopy: A Safety Cage Framework for Machine Learning Models [0.6908439820101059]
本研究では,並列監視層として機能するモジュール型安全ケージアーキテクチャを評価し,予測の有効性を評価する。
単一のインジケータがすべての障害モードをキャプチャし、インジケータの融合の必要性を示す。
形式化されたカバレッジリスクフレームワークを用いて、リスクレベルの精度を最大化する構成を特定するために、インジケータの組み合わせの体系的分析を行う。
論文 参考訳(メタデータ) (2026-09-11T20:32:01Z) - Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift [35.70747932100589]
DistScanは、シンプルだが以前は明らかにされていなかった観察に基づくバックドア検出フレームワークである。
既存の手法を大幅に上回り、最高の性能のベースラインに対する平均検出精度を27.32ポイント向上させる。
論文 参考訳(メタデータ) (2026-08-19T16:38:39Z) - REAL-OW: Rehearsal-free Open World Object Detection with Low-Rank Adaptation and Dual-Stage Objectness Modeling [56.888597798431704]
Open-World Object Detection (OWOD) では、未確認のオブジェクトを未知のものとして識別し、それを既知のカテゴリのセットにインクリメンタルに組み込む必要がある。
既存のフレームワークは、破滅的な忘れを緩和するために、模範的なリプレイに大きく依存しているが、実際のアプリケーションでは、データアクセス制限との生データ競合を保存し、データ露出のリスクをもたらす。
協調的なアダプタアーキテクチャを通じて段階的な知識を分離する新しいリハーサルフリーフレームワークであるREAL-OWを提案する。
論文 参考訳(メタデータ) (2026-07-03T06:38:54Z) - VeriFlow: Modeling Distributions for Neural Network Verification [3.510536859655114]
フォーマル検証は、ニューラルネットワークの安全性と信頼性を保証するための有望な方法として登場した。
本稿では,検証手法が関心のあるデータ分布に限定できるように,フローベース密度モデルとしてVeriFlowアーキテクチャを提案する。
論文 参考訳(メタデータ) (2024-06-20T12:41:39Z) - Semi-supervised Open-World Object Detection [74.95267079505145]
半教師付きオープンワールド検出(SS-OWOD)という,より現実的な定式化を導入する。
提案したSS-OWOD設定では,最先端OWOD検出器の性能が劇的に低下することが実証された。
我々は,MS COCO, PASCAL, Objects365, DOTAの4つのデータセットを用いた実験を行い, 提案手法の有効性を実証した。
論文 参考訳(メタデータ) (2024-02-25T07:12:51Z) - Privacy-Preserving Distributed Learning for Residential Short-Term Load
Forecasting [11.185176107646956]
電力システムの負荷データは、住宅ユーザの日常のルーチンを不注意に明らかにし、彼らの財産のセキュリティにリスクを及ぼす可能性がある。
我々はマルコフスイッチ方式の分散学習フレームワークを導入し、その収束は厳密な理論的解析によって実証される。
実世界の電力系統負荷データを用いたケーススタディにより,提案アルゴリズムの有効性を検証した。
論文 参考訳(メタデータ) (2024-02-02T16:39:08Z) - Self-supervised Feature Adaptation for 3D Industrial Anomaly Detection [59.41026558455904]
具体的には,大規模ビジュアルデータセット上で事前学習されたモデルを利用した初期のマルチモーダルアプローチについて検討する。
本研究では,アダプタを微調整し,異常検出に向けたタスク指向の表現を学習するためのLSFA法を提案する。
論文 参考訳(メタデータ) (2024-01-06T07:30:41Z) - DAAIN: Detection of Anomalous and Adversarial Input using Normalizing
Flows [52.31831255787147]
我々は、アウト・オブ・ディストリビューション(OOD)インプットと敵攻撃(AA)を検出する新しい手法であるDAINを導入する。
本手法は,ニューラルネットワークの内部動作を監視し,活性化分布の密度推定器を学習する。
当社のモデルは,特別なアクセラレータを必要とせずに,効率的な計算とデプロイが可能な単一のGPUでトレーニングすることが可能です。
論文 参考訳(メタデータ) (2021-05-30T22:07:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。