論文の概要: SafeTune: A Unified Faithful Library for Auditing and Repairing Safety Drift in Fine-Tuned LLMs
- arxiv url: http://arxiv.org/abs/2609.22153v1
- Date: Wed, 26 Aug 2026 09:35:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.735624
- Title: SafeTune: A Unified Faithful Library for Auditing and Repairing Safety Drift in Fine-Tuned LLMs
- Title(参考訳): SafeTune: 微調整LDMにおける安全ドリフトの監査と修復のための統一された忠実なライブラリ
- Abstract要約: 大規模言語モデルにおける安全性の漂流に対処する手法は、互換性のない実装、ライフサイクルステージ、評価プロトコルに分散している。
セーフチューン(SafeTune)は、ホック後の重量回復、安全性に制約のある微調整、勾配に基づくアンラーニング、推論時ステアリングの4つのパラダイムを統一した、ソース利用可能なライブラリである。
- 参考スコア(独自算出の注目度): 3.3598755777055374
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Methods for addressing safety drift in fine-tuned Large Language Models (LLMs) are scattered across incompatible implementations, lifecycle stages, and evaluation protocols, making them difficult to adopt and compare. We introduce SafeTune, a source-available library that unifies four intervention paradigms: post-hoc weight recovery, safety-constrained fine-tuning, gradient-based unlearning, and inference-time steering, alongside shared interpretability, evaluation, and deployment utilities. SafeTune provides a consistent configuration-driven workflow while preserving the distinct inputs and intervention points each paradigm requires. Its modular registry supports new methods, benchmarks, judges, models, and fine-tuning domains without redesigning the surrounding pipeline. We demonstrate SafeTune through controlled comparisons and finance and medical deployment case studies, showing how it characterizes safety drift, evaluates feasible interventions on common refusal-behavior and capability evaluations, and supports calibrated or layered mitigation.
- Abstract(参考訳): 微調整されたLarge Language Model(LLM)の安全性に対処する方法は、互換性のない実装、ライフサイクルステージ、評価プロトコルに分散しており、採用や比較が困難である。
我々はSafeTuneを紹介した。これは、ポストホック重量回復、安全に制約された微調整、勾配に基づくアンラーニング、推論時間ステアリングの4つの介入パラダイムを、共有の解釈可能性、評価、デプロイメントユーティリティと合わせて統合する、ソース利用可能なライブラリである。
SafeTuneは、一貫した構成駆動のワークフローを提供すると同時に、各パラダイムに必要な個別の入力と介入ポイントを保存する。
そのモジュールレジストリは、周囲のパイプラインを再設計することなく、新しいメソッド、ベンチマーク、裁判官、モデル、微調整のドメインをサポートする。
制御された比較とファイナンスおよび医療展開ケーススタディを通じてSafeTuneを実証し、それがいかに安全ドリフトを特徴付けるかを示し、共通の拒絶行動と能力評価に対する実現可能な介入を評価し、キャリブレーションまたは層状緩和をサポートする。
関連論文リスト
- EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures [0.6588840794922407]
本稿では、物語合成と組み合わせた体系的な探索と、グレーエビデンスを別々に追跡する。
この合成は、ベンチマークの妥当性、動的評価、安全性評価、ジェイルブレイク/拒否の堅牢性、報酬のハッキング、機械的解釈可能性、ガバナンス/監査性という8つのエビデンスストリームにまたがっている。
コントリビューションは、動的評価、透過的なソースレポート、多目的安全測定、監査可能なアライメントプラクティスをサポートするための共通語彙とエビデンスマップである。
論文 参考訳(メタデータ) (2026-06-29T12:33:06Z) - Selective Safety Steering via Value-Filtered Decoding [54.87935112120107]
大型言語モデル(LLM)は人間の価値観に合わせるように訓練されているが、その世代は安全上の制約に反する可能性がある。
既存のデコード時のステアリング手法は、しばしば不要に介入し、ベースモデルの下で安全であった世代を変更する。
安全でない応答の安全性を向上しつつ、そのような不要な介入を減らすための新しいテストタイムステアリング手法を提案する。
論文 参考訳(メタデータ) (2026-05-14T12:13:08Z) - Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training [1.5349686675266894]
LLM(Large Language Models)におけるコンテンツ安全性の現在の手法は、マルチステージトレーニングパイプラインに依存している。
複数の安全性挙動を効率的に統合する統合協調学習フレームワークを提案する。
我々は,SFT+DPOの安全アライメント品質に一致し,安全性能においてDeepSeek-R1 (671B) を上回る8Bモデルを示した。
論文 参考訳(メタデータ) (2025-08-12T02:39:33Z) - SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning [6.740032154591022]
ベンチマークとツールキットであるSafeTuneBedを導入し、微調整と防御の評価を統一する。
SafeTuneBedは、感情分析、質問回答、マルチステップ推論、オープンな命令タスクにまたがる、複数の微調整データセットの多様なリポジトリをキュレートする。
これは、アライメントステージの免疫、訓練中の安全ガード、訓練後の修復など、最先端の防衛の統合を可能にする。
論文 参考訳(メタデータ) (2025-05-31T19:00:58Z) - LookAhead Tuning: Safer Language Models via Partial Answer Previews [62.529794567687354]
ファインチューニングにより、大きな言語モデルは特定のドメインに適応できるが、しばしば以前に確立された安全アライメントを損なう。
LookAhead Tuningは、微調整時の安全性を維持する軽量で効果的なデータ駆動型アプローチである。
論文 参考訳(メタデータ) (2025-03-24T18:11:42Z) - Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements [46.79887158348167]
大規模言語モデル(LLM)の安全性アライメントに関する現在のパラダイムは、一大のアプローチに従っている。
我々は,モデルの再トレーニングを伴わず,多様な安全要件に適応するフレームワークとして,制御可能な安全アライメント(CoSA)を提案する。
論文 参考訳(メタデータ) (2024-10-11T16:38:01Z) - Recursively Feasible Probabilistic Safe Online Learning with Control Barrier Functions [60.26921219698514]
CBFをベースとした安全クリティカルコントローラのモデル不確実性を考慮した再構成を提案する。
次に、結果の安全制御器のポイントワイズ実現可能性条件を示す。
これらの条件を利用して、イベントトリガーによるオンラインデータ収集戦略を考案する。
論文 参考訳(メタデータ) (2022-08-23T05:02:09Z) - Joint Differentiable Optimization and Verification for Certified
Reinforcement Learning [91.93635157885055]
安全クリティカル制御システムのためのモデルベース強化学習では,システム特性を正式に認定することが重要である。
本稿では,強化学習と形式検証を共同で行う枠組みを提案する。
論文 参考訳(メタデータ) (2022-01-28T16:53:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。