論文の概要: ASCENT: First-Order Optimal Fine-Tuning with Recalibration for Safety--Utility Co-Enhancement
- arxiv url: http://arxiv.org/abs/2610.08061v1
- Date: Tue, 06 Oct 2026 09:56:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.922724
- Title: ASCENT: First-Order Optimal Fine-Tuning with Recalibration for Safety--Utility Co-Enhancement
- Title(参考訳): ASCENT:安全性向上のための一次最適微調整
- Abstract要約: 改良された微調整は、大規模言語モデル(LLM)の下流ユーティリティを大幅に改善するが、安全性を損なう可能性がある。
既存のセーフティ保存手法は、セーフティ関連パラメータやサブスペースを使用したダウンストリーム更新を制限している。
ASCENTは,1次最適安全対応型周期的キャリブレーションとタスク最適化による安全ユーティリティ協調処理のためのフレームワークである。
- 参考スコア(独自算出の注目度): 37.731387936750004
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Supervised fine-tuning can substantially improve the downstream utility of large language models (LLMs) but may compromise their safety. Existing safety-preserving methods constrain downstream updates using safety-related parameters or subspaces, but mainly focus on safety preservation rather than joint safety and utility enhancement, lack a theoretical characterization of the optimal safety-related subspace and safety-preserving task update, and typically rely on a static safety subspace that may become outdated during fine-tuning. To address these limitations, we propose ASCENT, a downstream fine-tuning framework for safety--utility co-enhancement through first-order optimal safety-aware periodic calibration and task optimization. We model safety as a function of LLM parameters $S(θ)$ and use its first-order approximation to characterize safety changes under parameter updates. Under a fixed rank and Frobenius-norm budget, we prove that the update constructed from the top-$r$ singular components of the safety-function gradient maximizes the estimated safety change, and use it for periodic calibration to preserve and improve safety. We further derive a unique safety-preserving task update that stays close to the original task update while penalizing negative effects on the estimated safety change. ASCENT alternates these optimal task and calibration updates to jointly enhance safety and utility. Experiments across multiple LLM families and downstream tasks show that ASCENT improves downstream utility by up to 20.3\% and reduces attack success rate by up to 35.5\%, achieving state-of-the-art safety and utility across all evaluated settings. Our code is available at https://github.com/ZJU-LLM-Safety/ASCENT.
- Abstract(参考訳): 改良された微調整は、大規模言語モデル(LLM)の下流ユーティリティを大幅に改善するが、安全性を損なう可能性がある。
既存の安全保全手法は、安全関連パラメータやサブスペースを使用した下流更新を制約するが、主に共同安全性や実用性の向上よりも安全保全に重点を置いており、最適な安全関連サブスペースと安全保全タスクの更新の理論的特徴を欠いている。
これらの制約に対処するために、ASCENTを提案する。ASCENTは、一階最適安全対応周期的キャリブレーションとタスク最適化による、安全ユーティリティのコエンハンスメントのための下流の微調整フレームワークである。
我々は LLM パラメータ $S(θ)$ の関数として安全性をモデル化し、その一階近似を用いてパラメータ更新時の安全性変化を特徴づける。
一定のランクとフロベニウス・ノームの予算の下では、安全関数勾配の上位$rの特異成分から構築された更新が推定された安全変化を最大化し、周期的校正に使用して安全性を維持・改善することを証明する。
さらに、推定された安全性変化に対する負の影響をペナルティ化しながら、元のタスク更新に近づいたユニークなセーフティ保存タスク更新を導出する。
ASCENTはこれらの最適なタスクとキャリブレーションの更新を交換し、安全性と実用性を共同で強化する。
複数のLLMファミリーと下流タスクを対象とした実験では、ASCENTはダウンストリームユーティリティを最大20.3\%改善し、攻撃成功率を最大35.5\%削減し、評価されたすべての設定で最先端の安全性とユーティリティを達成する。
私たちのコードはhttps://github.com/ZJU-LLM-Safety/ASCENTで利用可能です。
関連論文リスト
- Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization [18.414223070961782]
大規模言語モデルの安全性アライメントは、汎用性を維持しながら有害または不安全な振る舞いを減らすことを目的としている。
最近の知見は、アライメント効果が脆弱であることを示しており、軽量なアライメント後操作は、意図した安全性の振る舞いを容易に弱めることができる。
本稿では、まず標準の1次安全アライメントを行い、その後、ロバスト性向上のために0階改良を適用したハイブリッドフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-28T05:46:38Z) - Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection [52.551864761088574]
大規模言語モデル(LLM)は、しばしばアライメント税を課す。
この税は、主に連続的な順序で学習スタイルを忘れることから生じると我々は主張する。
我々は, 塑性と安定性のバランスをとるために, OGPSA (Orthogonal Gradient Projection for Safety Alignment) を提案する。
論文 参考訳(メタデータ) (2026-02-08T09:53:46Z) - A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space [91.99501941169831]
GuardSpaceは、微調整全体を通して安全アライメントを維持するためのガードレールフレームワークである。
GSM8Kで微調整されたLlama-2-7B-Chatでは、ガードスペースは最先端のAsFTよりも優れている。
論文 参考訳(メタデータ) (2025-10-16T04:57:53Z) - UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models [67.91151588917396]
大規模言語モデル(LLM)は、幅広いタスクで顕著な進歩を遂げているが、有害なコンテンツ生成やジェイルブレイク攻撃といった安全リスクに弱いままである。
安全に配慮したリサイクルによるLCMの安全性向上のための統合フレームワークであるUpSafe$circ$Cを提案する。
この結果から, 静的アライメントから動的, モジュール, 推論対応制御への移行という, LLMの安全性の新たな方向性が明らかになった。
論文 参考訳(メタデータ) (2025-10-02T16:43:33Z) - Rethinking Safety in LLM Fine-tuning: An Optimization Perspective [56.31306558218838]
我々は、本質的にトレードオフではなく、最適化の貧弱な選択が、しばしば安全上の問題を引き起こすことを示し、敵のプロンプトに対する有害な応答として測定する。
安全性能を保ったパラメータ空間における簡易指数移動平均(EMA)運動量法を提案する。
複数のデータセットにまたがるLlamaファミリーに関する実験は、安全性の問題が特別な介入なしに回避できることを実証している。
論文 参考訳(メタデータ) (2025-08-17T23:46:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。