論文の概要: Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition
- arxiv url: http://arxiv.org/abs/2607.27240v1
- Date: Sun, 26 Jul 2026 19:10:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.26164
- Title: Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition
- Title(参考訳): モデルマージにおける非対称崩壊--過剰書き込み認識の拒絶について
- Abstract要約: Gemma-3-1B-ITファインタインを2つの相補的安全目標,CARESハーモレベル分類とWildJailbreakの回避に使用した。
リニア, SLERP, TIES, DARE-TIES の2つのファインチューンをマージし, 分類精度, 攻撃抵抗, 良性コンプライアンスに関する統合モデルの評価を行った。
- 参考スコア(独自算出の注目度): 4.800831341795478
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model merging is often used to combine capabilities from separately fine-tuned models without additional training, but it is unclear whether standard merging methods preserve multiple safety-relevant behaviors simultaneously. We study this question through a controlled case study using two Gemma-3-1B-IT finetunes on two complementary safety objectives: CARES harm-level classification and WildJailbreak adversarial refusal. We merge the two fine-tunes using Linear, SLERP, TIES, and DARE-TIES, and evaluate the merged models on classification accuracy, attack resistance, and benign compliance. Across all four methods, attack resistance transfers significantly more than classification accuracy: merged models retain 81-85% jailbreak refusal rates while CARES accuracy falls to at most 12.9%. Weight-space measurements suggest that this asymmetry is not caused by strongly opposing task-vector directions: the two task vectors are nearly orthogonal (cosine similarity 0.011). Instead, the refusal fine-tune induces consistently larger per-layer task-vector magnitudes, causing magnitude-sensitive methods to favor refusal updates. These results show that standard model merging can collapse safety recognition into broad refusal when safety-relevant task vectors differ substantially in scale.
- Abstract(参考訳): モデルマージは、追加のトレーニングなしで個別に調整されたモデルから機能を組み合わせるためにしばしば使用されるが、標準マージ手法が複数の安全関連挙動を同時に保持するかどうかは不明である。
本研究では,2つのGemma-3-1B-ITファインチューンを用いた制御ケーススタディにより,CARES害レベル分類とWildJailbreak敵の拒絶の2つの相補的安全目標について検討した。
リニア, SLERP, TIES, DARE-TIES の2つのファインチューンをマージし, 分類精度, 攻撃抵抗, 良性コンプライアンスに関する統合モデルの評価を行った。
統合されたモデルは81-85%の脱獄率を維持し、CARESの精度は少なくとも12.9%に低下する。
重み空間の測定は、この非対称性が強い反対のタスクベクトル方向によって起こらないことを示唆している: 2つのタスクベクトルはほぼ直交である(コサイン類似度 0.011)。
代わりに、リファイントゥーンは階層ごとのタスク・ベクター・マグニチュードを一貫して増加させ、リファイン・メソッドはリファイン・アップデートを優先する。
これらの結果から,安全関連タスクベクトルが大規模に大きく異なる場合,標準モデルのマージにより安全性認識が広範囲に低下する可能性が示唆された。
関連論文リスト
- Detecting Safety Training Modification in Language Models via Activation Analysis [0.0]
本稿では,アクティベーション空間における安全関連概念の幾何学的構造を測定することで,言語モデルにおける安全訓練の修正を検出するツールであるAMSを紹介する。
4つのアーキテクチャファミリにまたがる14のモデル構成のAMSを検証する。
メカニスティック分析は、アクティベーション空間のシグネチャによって区別される安全訓練の修正の4つのクラス分類を識別する。
論文 参考訳(メタデータ) (2026-08-06T03:57:38Z) - Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs [54.96236442484317]
リスクのある知識はモデルに保持でき、特権制御トークンによって行動的に守られることを示す。
Token Inoculation という手法はバインディング・アンド・ブランチ方式を導入している。
論文 参考訳(メタデータ) (2026-07-21T02:15:39Z) - The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs [1.4323566945483497]
我々は、"拒絶方向"を分離するゼロ最適化フレームワークであるContrastive Logit Steering (CLS)を紹介した。
CLSは出力分布を直接操作し、アライメントの診断プローブとして機能する。
7つのモデルファミリーに関する実験により、安全実装がアーキテクチャ上決定論的であることが判明した。
論文 参考訳(メタデータ) (2026-06-21T22:04:48Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning [14.6508023458559]
既存の評価では、モデルが有害性を認識することを学んだかどうかを明らかにしていない。
本研究では, 有害性担体, 拒絶性担体, 結合性を測定する二重安全幾何プロトコルを用いて検討する。
論文 参考訳(メタデータ) (2026-06-15T07:50:00Z) - Building a Foundational Guardrail for General Agentic Systems via Synthetic Data [76.18834864749606]
LLMエージェントは、計画段階で介入するマルチステップタスクを計画できる。
既存のガードレールは主にポスト・エグゼクティブ(英語版)を運用しており、スケーリングが困難であり、計画レベルで制御可能な監督を行う余地がほとんどない。
我々は、良性軌道を合成し、カテゴリーラベル付きリスクを困難に注入し、自動報酬モデルを介して出力をフィルタリングする制御可能なエンジンであるAuraGenを紹介する。
論文 参考訳(メタデータ) (2025-10-10T18:42:32Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - The Rogue Scalpel: Activation Steering Compromises LLM Safety [11.402179030703188]
アクティベーションステアリング(Activation steering)は、推論中にモデルの隠れ状態に直接意味論的意味のあるベクトルを追加することによって、LCMの動作を制御する技術である。
ステアリングはモデルアライメントの保護を系統的に破り、有害な要求に従わせる。
論文 参考訳(メタデータ) (2025-09-26T08:49:47Z) - Indiscriminate Disruption of Conditional Inference on Multivariate Gaussians [60.22542847840578]
敵対的機械学習の進歩にもかかわらず、敵対者の存在下でのガウスモデルに対する推論は特に過小評価されている。
我々は,意思決定者の条件推論とその後の行動の妨害を希望する自己関心のある攻撃者について,一組の明らかな変数を乱すことで検討する。
検出を避けるため、攻撃者は、破損した証拠の密度によって可否が決定される場合に、攻撃が可否を示すことを望んでいる。
論文 参考訳(メタデータ) (2024-11-21T17:46:55Z) - Improving Adversarial Robustness to Sensitivity and Invariance Attacks
with Deep Metric Learning [80.21709045433096]
対向ロバスト性の標準的な方法は、サンプルを最小に摂動させることによって作られたサンプルに対して防御する枠組みを仮定する。
距離学習を用いて、最適輸送問題として逆正則化をフレーム化する。
予備的な結果から, 変分摂動の規則化は, 変分防御と敏感防御の両方を改善することが示唆された。
論文 参考訳(メタデータ) (2022-11-04T13:54:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。