論文の概要: Distribution-Specific Curvature Control with Finite-Sample Guarantees for Open-Weight Safety
- arxiv url: http://arxiv.org/abs/2607.22929v1
- Date: Fri, 24 Jul 2026 22:00:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.931678
- Title: Distribution-Specific Curvature Control with Finite-Sample Guarantees for Open-Weight Safety
- Title(参考訳): オープンウェイト安全のための有限サンプル保証器による分布特異曲率制御
- Authors: Domenic Rosati, Ali Dadsetan, Hong Huang, Xijie Zeng, Hassan Chowdhry, Subhabrata Majumdar, Hassan Sajjad, Frank Rudzicz,
- Abstract要約: 短い微調整で、オープンウェイトモデルの安全ガードを解除することができる。
経験的に、固定構造、有限予算の1次脅威モデルにおいて、HarmAlignは直接微調整と3つのデータまたは客観的アダプティブ攻撃をブロックする。
- 参考スコア(独自算出の注目度): 22.283880969803846
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: A short fine-tuning run can undo the safety guards of an open-weight model---retraining a refusal-trained assistant to aid weapons development or produce hate speech. Preventing such harmful fine-tuning while retaining benign adaptability remains difficult: the only prior method with an explicit curvature certificate, spectral deformation, inflates curvature globally and thereby obstructs benign adaptation along with harmful adaptation. We propose HarmAlign, which applies function-preserving spectral deformation along a estimated contrastive activation subspace. We derive finite-sample bounds for the estimated subspace energy and the resulting local harmful-distribution curvature lower bound. A stability--progress dichotomy for constant-step gradient descent turns the certified curvature into conditional convergence-rate control. Empirically, within a fixed-architecture, finite-budget first-order threat model, HarmAlign blocks direct fine-tuning and three data- or objective-adaptive attacks across a hazardous-knowledge relearning setting and a harmful-assistance fine-tuning setting, while the protected benign tasks remain trainable. The block persists across the tested first-order optimizer variants over every attack checkpoint, and under out-of-distribution harmful fine-tuning, and it extends to important cases in our threat model: accidental safety degradation and emergent misalignment.
- Abstract(参考訳): 短距離の微調整は、武器開発やヘイトスピーチの制作のために、拒絶訓練されたアシスタントを訓練するオープンウェイトモデルの安全ガードを解除することができる。
このような有害な微調整を防ぎながら良性適応性を維持することは依然として困難であり、明示的な曲率証明を持つ唯一の先行手法であるスペクトル変形は、世界中の曲率を膨張させ、有害な適応とともに良性適応を阻害する。
本稿では,関数保存型スペクトル変形を推定された対照的なアクティベーション部分空間に沿って適用するHarmAlignを提案する。
我々は、推定された部分空間エネルギーと結果として生じる局所的有害分布曲率の下界に対する有限サンプル境界を導出する。
定段勾配降下のための安定-進行二分法は、認定曲率を条件収束率制御に変換する。
経験的に、固定構造、有限予算の1次脅威モデルにおいて、HarmAlignは直接微調整と3つのデータまたは客観的適応攻撃を有害な知識の再学習設定と有害な細調整設定にわたってブロックし、保護された良性タスクはトレーニング可能である。
このブロックは、各攻撃チェックポイント上でテストされたファーストオーダーオプティマイザの変種にまたがって持続し、アウト・オブ・ディストリビューションによる有害な微調整の下で、当社の脅威モデルにおいて重要なケース、すなわち事故の安全性の低下と緊急のミスアライメントにまで拡張されます。
関連論文リスト
- Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance [48.34904668359272]
大規模言語モデルに対するアドリアック攻撃は、広範な研究にもかかわらず、実用的影響が限られている。
本稿では,Greedy Coordinate Diffusion(GCD)について紹介する。
GCDは、敵の本来の意図に低い難易度と高い意味的固執を維持している。
論文 参考訳(メタデータ) (2026-06-14T01:18:53Z) - When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models [0.9772267314090434]
完全な良性データに微調整されたガードモデルは、すべての安全アライメントを失う可能性がある。
本研究は, 潜伏した安全形状の破壊に起因していることを示す。
漁業用安全部分空間規則化を提案する。
論文 参考訳(メタデータ) (2026-04-08T05:27:33Z) - Constrained Policy Optimization via Sampling-Based Weight-Space Projection [3.736063711613611]
安全クリティカルな学習は、安全な運用体制を離れることなく、パフォーマンスを向上させる政策を必要とする。
モデルパラメータが未知のロールアウトに基づく安全制約を満たすような制約付きポリシー学習について検討する。
制約関数への勾配アクセスを必要とせずにパラメータ空間内で直接安全を強制する,サンプリングベースの重み空間投影法であるSCPOを提案する。
論文 参考訳(メタデータ) (2025-12-15T19:00:01Z) - Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler [67.24175911858312]
有害な微調整は、大規模な言語モデルのための微調整・アズ・ア・サービスに重大な安全性のリスクをもたらす。
Bayesian Data Scheduler (BDS) は、アタックシミュレーションを必要としない適応型チューニングステージ防衛戦略である。
BDSは、微調整データセットとアライメントデータセットに基づいて、各データポイントの安全属性の後方分布を学習する。
論文 参考訳(メタデータ) (2025-10-31T04:49:37Z) - Building a Foundational Guardrail for General Agentic Systems via Synthetic Data [76.18834864749606]
LLMエージェントは、計画段階で介入するマルチステップタスクを計画できる。
既存のガードレールは主にポスト・エグゼクティブ(英語版)を運用しており、スケーリングが困難であり、計画レベルで制御可能な監督を行う余地がほとんどない。
我々は、良性軌道を合成し、カテゴリーラベル付きリスクを困難に注入し、自動報酬モデルを介して出力をフィルタリングする制御可能なエンジンであるAuraGenを紹介する。
論文 参考訳(メタデータ) (2025-10-10T18:42:32Z) - Boundary-to-Region Supervision for Offline Safe Reinforcement Learning [56.150983204962735]
バウンダリ・トゥ・レギオン(Bundary-to-Region, B2R)は、コスト信号による非対称な条件付けを可能にするフレームワークである。
B2Rは、CTGを固定された安全予算の下で境界制約として再定義し、すべての実行可能な軌道のコスト分布を統一する。
実験の結果,B2Rは38項目中35項目の安全制約を満たすことがわかった。
論文 参考訳(メタデータ) (2025-09-30T03:38:20Z) - Convergence and Generalization of Anti-Regularization for Parametric Models [0.0]
反正則化は損失関数に逆符号を持つ報酬項を導入する。
スペクトル安全性条件と信頼領域制約を定式化する。
我々は、プロジェクション演算子と勾配クリッピングを組み合わせた軽量な安全ガードを設計し、安定した介入を保証する。
論文 参考訳(メタデータ) (2025-08-24T15:34:17Z) - Rethinking Safety in LLM Fine-tuning: An Optimization Perspective [56.31306558218838]
我々は、本質的にトレードオフではなく、最適化の貧弱な選択が、しばしば安全上の問題を引き起こすことを示し、敵のプロンプトに対する有害な応答として測定する。
安全性能を保ったパラメータ空間における簡易指数移動平均(EMA)運動量法を提案する。
複数のデータセットにまたがるLlamaファミリーに関する実験は、安全性の問題が特別な介入なしに回避できることを実証している。
論文 参考訳(メタデータ) (2025-08-17T23:46:36Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。