論文の概要: Geometry-Guided Constraint Learning for LLM Safety Classification
- arxiv url: http://arxiv.org/abs/2607.19366v1
- Date: Tue, 09 Jun 2026 08:47:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.135809
- Title: Geometry-Guided Constraint Learning for LLM Safety Classification
- Title(参考訳): LLM安全分類のための幾何学誘導制約学習
- Authors: Fumiaki Uehara, Koo Imai, Masato Tsutsumi, Keigo Kansa, Sora Usui, Yuki Kobiyama,
- Abstract要約: ポリトープとしての安全性 (SaP) は、隠れ空間における線型半空間の制約を学習するが、制約数 K のカテゴリごとのチューニングが必要である。
K=2はQwen3.5-9Bの12/14カテゴリに対して最適となり、BeaverTails分類ベンチマークでは1カテゴリあたり96-99%の精度が達成される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Safety as Polytope (SaP) learns linear half-space constraints in LLM hidden space but requires per-category tuning of the constraint count K. We show that sparse autoencoder (SAE) feature extraction resolves this: K=2 becomes optimal for 12/14 categories on Qwen3.5-9B, achieving 96-99% accuracy per category on our BeaverTails classification benchmark, largely eliminating the need for exhaustive sweeps (K=4-25 with random initialization). This convergence to two planes is consistent with the Linear Representation Hypothesis, providing suggestive evidence that safety boundaries in this setting admit a low-dimensional linear description in the SAE feature space. Building on this geometric perspective, we introduce a cone constraint whose learnable aperture adapts to each category's cluster concentration, stabilized by a three-phase training
- Abstract(参考訳): K=2はQwen3.5-9Bの12/14カテゴリに対して最適となり、BeaverTails分類ベンチマークで96-99%の精度を達成し、徹底的なスイープ(K=4-25とランダム初期化)の必要性をほとんど排除した。
この2つの平面への収束は線形表現仮説と一致しており、この設定における安全境界がSAE特徴空間において低次元の線形記述を持つことを示す示唆的な証拠を与える。
この幾何学的観点から、学習可能な開口が各カテゴリのクラスタ濃度に適応するコーン制約を導入し、三相学習により安定化する。
関連論文リスト
- Domain Adaptive Object Detection via Dual-Stream Bilevel-Cycle Optimization [64.83565413108789]
サイクル自己学習(CST)は、標準自己学習フレームワークの共有分類器の仮定を破る。
CSTは、ターゲットの擬似ラベルでトレーニングすることで、ラベルなしのターゲットデータを悪用する。
論文 参考訳(メタデータ) (2026-06-30T09:05:30Z) - Optimizing and Comparing Quantum Resources of Statistical Phase Estimation and Krylov Subspace Diagonalization [0.0]
固有値計算のための2つの早期フォールトトレラント法を直接かつ有意義に比較できるフレームワークを開発する。
glsspeでは、厳密なエラーバウンドを改善し、回路深さの約2/3の削減を実現している。
我々は、最大チェビシェフ度を計算し、回路深度と線形に関係し、36軌道における54電子までの活性空間を持つ分子のシミュレーションに必要な繰り返し数を計算し、これらの手法のスケーラビリティと実用的実現に関する洞察を与える。
論文 参考訳(メタデータ) (2026-03-16T17:12:49Z) - Boundary-to-Region Supervision for Offline Safe Reinforcement Learning [56.150983204962735]
バウンダリ・トゥ・レギオン(Bundary-to-Region, B2R)は、コスト信号による非対称な条件付けを可能にするフレームワークである。
B2Rは、CTGを固定された安全予算の下で境界制約として再定義し、すべての実行可能な軌道のコスト分布を統一する。
実験の結果,B2Rは38項目中35項目の安全制約を満たすことがわかった。
論文 参考訳(メタデータ) (2025-09-30T03:38:20Z) - A Generalized Learning Framework for Self-Supervised Contrastive Learning [9.01200351672698]
自己教師付きコントラスト学習(SSCL)は、最近、複数の下流タスクにおいて優位性を示した。
本稿では,標準SSCL手法を,整合部と制約部という2つの部分からなる一般化学習フレームワーク(GLF)に一般化する。
論文 参考訳(メタデータ) (2025-08-19T08:00:29Z) - AdversariaL attacK sAfety aLIgnment(ALKALI): Safeguarding LLMs through GRACE: Geometric Representation-Aware Contrastive Enhancement- Introducing Adversarial Vulnerability Quality Index (AVQI) [21.209413521884297]
LLMに対する敵の脅威は、現在の防衛が適応できるよりも急速にエスカレートしている。
ALKALIは, 厳格にキュレートされた最初の逆数ベンチマークである。
本稿では、遅延空間正規化と協調するアライメントフレームワークGRACEを紹介する。
論文 参考訳(メタデータ) (2025-06-10T15:14:17Z) - Self-Supervised Graph Embedding Clustering [70.36328717683297]
K-means 1-step dimensionality reduction clustering method は,クラスタリングタスクにおける次元性の呪いに対処する上で,いくつかの進歩をもたらした。
本稿では,K-meansに多様体学習を統合する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-24T08:59:51Z) - S2-Attention: Hardware-Aware Context Sharding Among Attention Heads [49.1454481007861]
スパースアテンションは、コンテキスト内のトークンのサブセットに選択的に出席する。
スパース・アテンションが今日の大規模言語モデルでモデルの品質を維持することができるかどうかは不明だ。
本稿では,Sparsely-Sharded(S2) attention, a Triton library that provide kernel optimization for sparse attention for sparse attention to customizable per-head and per-context-range levels。
論文 参考訳(メタデータ) (2024-07-25T00:27:07Z) - Benign Overfitting in Linear Classifiers and Leaky ReLU Networks from
KKT Conditions for Margin Maximization [59.038366742773164]
ロジスティック損失の勾配流によって訓練された線形および漏洩ReLUは、KKT条件を満たすための暗黙の偏りを持つ。
本研究では、線形分類器や2層リークReLUネットワークにおいて、これらの条件の満足度が良性オーバーフィットを意味するような設定を多数確立する。
論文 参考訳(メタデータ) (2023-03-02T18:24:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。