論文の概要: Storage Is Not Strategy: State-Conditioned Support Control for LLM Unlearning
- arxiv url: http://arxiv.org/abs/2609.37858v2
- Date: Tue, 06 Oct 2026 13:38:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.229264
- Title: Storage Is Not Strategy: State-Conditioned Support Control for LLM Unlearning
- Title(参考訳): ストレージは戦略ではない - LLMアンラーニングのための状態依存型サポート制御
- Abstract要約: ローカライズされた大言語モデル(LLM)アンラーニング手法は、ローカライズ信号から小さなパラメータサブセットを選択し、最適化中にそれを固定し続ける。
我々は、実際の未学習更新の予測効果によって編集可能なグループをランク付けするインターベンションスコアを導入する。
次に、選択的動的介入再分類(DIR-R)を導入し、記述的プローブが比較を正当化するときにのみその部分集合を再検討する。
- 参考スコア(独自算出の注目度): 23.660463189596257
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many localized large language model (LLM) unlearning methods select a small parameter subset from a localization signal and keep it fixed during optimization. The parameters most associated with a target, however, need not be the best ones to update, and candidate interventions can change value as optimization proceeds. In a controlled experiment, a storage-localization score reaches an area under the receiver operating characteristic curve (AUROC) of 0.981, yet storage identity agrees with the better intervention on only 17/36 targets, while low-rank adaptation (LoRA) wins 35/36. We introduce Intervention Score, which ranks editable groups by the predicted effect of the actual unlearning update while accounting for collateral damage, and use it to form the static intervention-value baseline (Static-IV). We then introduce selective dynamic intervention re-ranking (DIR-R), which revisits that subset only when a calibrated probe justifies the comparison. On the Natural-TOFU dataset, our method has positive descriptive margins in 19/20 comparisons between methods and objectives, although several are near zero. On the LACUNA localization-precision benchmark, our mean terminal utility is higher in all six negative preference optimization (NPO) and SimNPO comparisons: NPO margins range from +0.431 to +0.848, and SimNPO margins range from +0.503 to +0.571. The gradient-difference (GradDiff) objective reveals substantial field dependence. Relative to Static-IV, the primary four-field GradDiff evaluation has six wins, six ties, and no losses, with mean and median paired gains of +0.165 and +0.0025. The evidence supports separating localization, initial intervention selection, and checkpoint-dependent support revision.
- Abstract(参考訳): ローカライズされた大規模言語モデル(LLM)の未学習手法の多くは、ローカライズ信号から小さなパラメータサブセットを選択し、最適化中にそれを固定する。
しかし、ターゲットに最も関連付けられたパラメータは、更新するのに最適なパラメータではない。
制御された実験では、記憶局所化スコアが0.981の受信動作特性曲線(AUROC)以下の領域に達するが、記憶アイデンティティは17/36の目標に対してより良い介入に一致し、ローランク適応(LoRA)が35/36に勝利する。
本稿では,非学習更新の予測効果によって編集可能群をランク付けするインターベンションスコアを紹介し,それを用いて静的介入値ベースライン(Static-IV)を形成する。
次に、校正プローブが比較を正当化するときにのみその部分集合を再検討する選択的動的介入再ランク(DIR-R)を導入する。
また,Natural-TOFUデータセットでは,手法と目的の19/20の比較では,有意な差があるが,その一部は0に近い。
LACUNAローカライゼーション精度ベンチマークでは,NPOマージンは+0.431から+0.848,SimNPOマージンは+0.503から+0.571である。
勾配差(GradDiff)の目的は、相当な場依存を明らかにする。
スタティックIVと比較して、主要な4フィールドグラッドディフ評価は6勝6ネクタイ、損失がなく、平均と中央のペアゲインは+0.165と+0.0025である。
証拠は、ローカライゼーションの分離、初期介入の選択、チェックポイントに依存したサポート修正を支援する。
関連論文リスト
- OSCC: Certified Observation-Safe Coupling Optimization for Gradient-Noise Control in Imperfect-Information Learning [23.835119696596095]
無効な結合は、隠された状態を隠蔽し、内因性ポリシーのランダム性を同期させ、または、偽の履歴が分岐した後の誤ったチャンスイベントを発生させる。
本稿では,限界保存,情報状態安全性,ブランチローカルなポリシーランダム性,セマンティックイベントアライメント,トレース・ビオークル・リプレイなどを通じて,許容可能なクラスを定義するフレームワークであるオブザーバセーフ・カウンタファクト・カップリング(O SCC)を紹介する。
我々は, 限界保存結合に対して, ポリシ・ヤコビアン重み付き対角外帰還共分散が雑音変化を決定することを示す勾配対応結合基準を導出する。
論文 参考訳(メタデータ) (2026-09-27T13:10:30Z) - A Zeroth-Order Paradigm for LLM Preference Alignment [26.629761802730258]
ComPOは、比較オラクルに基づくゼロ階アライメント手法である。
Online ComPOはオフライン比較機構を保持し、ラベルなしポリシー生成を使用してリバースKL制御を行う。
Mistral、Llama、Gemma-2、Qwen3、Gemma-3モデルの実験は、既存の直接アライメント法よりも改善されている。
論文 参考訳(メタデータ) (2026-09-16T17:59:35Z) - Governed Human-AI Prioritization Under Uncertainty: Adaptive Estimation and Dependency-Constrained Portfolio Selection [0.0]
AIネイティブなソフトウェアエンジニアリングは、人間の判断、過去のアナロジー、パラメトリック推定、AI生成予測を、同じ優先順位決定の中で組み合わさりつつある。
ビジネスバリュースコア(BVS)、Effort and Risk Score(ERS)、優先順位付け値スコア(PVS)、集合スコア(CCS)、最適開発パス(ODP)の5つの量演算子について検討する。
論文 参考訳(メタデータ) (2026-09-09T14:04:37Z) - Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization [20.147316178118732]
DMAPOは、ターゲットポリシーから候補応答を生成し、有用性、事実性、およびルーリック特異的評価器による簡潔性を評価する。
この手続きは、54,236人のMistral-7B候補のうち1,871人(3.45%)を受け入れている。
このセットで訓練されたKTOは、MT-Benchで7.50点、テキストダヴィンチ003参照に対して95.5%の勝利率、IFEvalが57.3%に達した。
論文 参考訳(メタデータ) (2026-07-27T23:05:12Z) - UniCBE: An Uniformity-driven Comparing Based Evaluation Framework with Unified Multi-Objective Optimization [19.673388630963807]
統一統一性駆動型CBEフレームワークUniCBEを提案する。
AlpacaEvalベンチマークでは、UniCBEは評価予算の17%以上を削減し、Pearsonと地上の真実との相関は0.995を超えている。
新しいモデルが継続的に導入されるシナリオでは、UniCBEは評価コストの50%以上を節約できる。
論文 参考訳(メタデータ) (2025-02-17T05:28:12Z) - Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment [57.03947082589616]
大規模言語モデル(LLM)は、しばしばコントラスト的なアライメント目標と選好ペアデータセットを使用してアライメントされる。
これについて検討し、基礎となる応答が対照的な場合、嗜好データがより良い学習信号を与えることを示した。
我々は、よりコントラスト的な選好ペアを生み出すデータ生成手法である、AI Revisions (CLAIR) からのコントラスト学習を紹介する。
我々の最良のモデルは、APOで32K CLAIRの選好に基づいて訓練され、Llama-3-8B-Instructを7.65%改善し、GPT4-turboとのギャップを45%短縮しました。
論文 参考訳(メタデータ) (2024-08-12T16:24:51Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z) - Stochastic Optimization of Areas Under Precision-Recall Curves with
Provable Convergence [66.83161885378192]
ROC(AUROC)と精度リコール曲線(AUPRC)の下の領域は、不均衡問題に対する分類性能を評価するための一般的な指標である。
本稿では,深層学習のためのAUPRCの最適化手法を提案する。
論文 参考訳(メタデータ) (2021-04-18T06:22:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。