論文の概要: Transplanting, inverting, and preventing a misalignment persona: method-conditional emergent misalignment in Qwen2.5
- arxiv url: http://arxiv.org/abs/2607.04510v1
- Date: Sun, 05 Jul 2026 21:23:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.952531
- Title: Transplanting, inverting, and preventing a misalignment persona: method-conditional emergent misalignment in Qwen2.5
- Title(参考訳): Qwen2.5におけるミスアライメントペルソナの移植,逆転,および予防--方法-条件付き緊急アライメント-
- Abstract要約: 言語モデルは、狭い有害なデータを微調整した後に取得される幅広い誤った振る舞いである創発的ミスアライメント(EM)は、Qwen2.5モデルで仲介されている。
事前トレーニングのみをソースと共有するモデルに移植すると、広いEM(2.83 +/- 0.26%がランダムな方向のフロアの1.1%と一致している)が誘導される。
結果は、一つのモデルファミリーの制御されたケーススタディであり、場所によって単座である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Emergent misalignment (EM) -- the broad misbehaviour a language model acquires after fine-tuning on narrow harmful data -- is mediated in Qwen2.5 models by a latent persona direction, and that direction is causal in open weights. Transplanting it into a model that shares only pretraining with its source induces broad EM (2.83 +/- 0.26% misaligned against a random-direction floor of ~1.1%), and ablating a model's own direction roughly halves an overt inducer's broadcast (21% to 10%). The transplant doubles as a measurement method, causally assaying directions that a source model represents but cannot itself express. Whether a fine-tune recruits this persona depends on method and capacity, and since low-rank PEFT is the cheaper regime at scale, the recruiting method is also the economical one. On Qwen2.5-32B, low-rank LoRA on insecure code recruits it (3.4% misaligned) while full SFT on identical data does not (0.3%) and moves against the persona axis (drift-persona cosine +0.17 at rank 1 to -0.10), the far-inducer, high-capacity exception consistent with a representational-distance x capacity account. The persona's causal role is itself conditional. Steering a bad-medical SFT run away from the direction during training raises the broadcast from 24% to 51% while a matched random control lowers it, so removing the direction is no blanket recipe. Because recruitment is a loss-reducing shortcut that capacity renders redundant, it can be screened for and prevented in the tested instances. Persona loss-relevance at the SFT solution orders four inducers' broadcasts rank-perfectly within Qwen2.5, inoculation removes recruitment selectively (4.75% to 0.0%, code coherence 65% to 87%), and fine-tuning orthogonal to the single behaviour-derived axis reduces it persona-specifically. Results are a controlled case study of one model family, single-seed in places.
- Abstract(参考訳): 言語モデルが取得する広範囲な誤り行動である創発的不整合(EM)は、Qwen2.5モデルにおいて潜在するペルソナの方向によって媒介され、その方向はオープンウェイトにおいて因果関係にある。
プリトレーニングのみをソースと共有するモデルに移植すると、広範囲なEM(2.83 +/- 0.26%)がランダムな方向のフロア(~1.1%)と一致し、モデル自体の方向がオーベットインデューサの放送(21%から10%)をほぼ半分にする。
移植は、ソースモデルが表現するが、それ自体は表現できない方向を因果的に測定する測定方法として二重化される。
微調整者がこの人物を雇うかは、方法と能力に依存し、低ランクのPEFTは大規模なより安価な体制であるため、採用方法も経済的である。
Qwen2.5-32Bでは、安全でないコードのローランクLoRAが採用する(3.4%のミスアライメント)が、同一データ上の完全なSFTは(0.3%)ではなく、人格軸(ランク1から-0.10のdrift-persona cosine +0.17)に対して動く。
ペルソナの因果関係は、それ自体条件付きである。
トレーニング中に悪用されたSFTが方向から離れると、放送は24%から51%に上昇するが、一致したランダム制御はそれを低下させるので、方向の除去は毛布のレシピではない。
採用は、キャパシティが冗長な損失低減ショートカットであるため、テストインスタンスのチェックと防止が可能である。
SFTソリューションにおけるペルソナ損失関連性は、4つのインデューサの放送をQwen2.5内で完璧にランク付けし、接種によって採用を選択的に除去する(4.75%から0.0%、コードコヒーレンス65%から87%)。
結果は、一つのモデルファミリーの制御されたケーススタディであり、場所によって単座である。
関連論文リスト
- Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench [0.0]
AgentProp-Benchは4つのドメインに2300のトレースを持つ2,000タスクのベンチマークである。
我々は、判断信頼性を定量化し、エラーの伝播を特徴づけ、実行時の緩和を評価する。
すべてのコード、データ、トレース、および人間のラベルはhttps://github.com/bhaskargurram-ai/agenthallu-bench.orgで公開されている。
論文 参考訳(メタデータ) (2026-04-17T21:15:35Z) - SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models [48.335262141752715]
拡散モデルのための後トレーニングパイプラインには、キュレートされたデータに対する教師付き微調整(SFT)と報酬モデルによる強化学習(RL)の2段階がある。
本稿では,このギャップを埋めるバイアス補正ポストトレーニング法であるSOAR(Self-Correction for Optimal Alignment and Refinement)を提案する。
オンライン政治であり、報酬なしであり、クレジット割り当ての問題なく、時間ごとの密集した監督を提供する。
論文 参考訳(メタデータ) (2026-04-14T11:45:15Z) - Disposition Distillation at Small Scale: A Three-Arc Negative Result [0.0]
内部ドラフトでは、Qwen3-0.6Bの学生に+33.9ポイントのMCASと+15.3ポイントのHumanEvalを報告している。
コンテントを損なうことなく, 判断された配置をスタイル的な模倣に転換するオペレータは見つからない。
我々は, 線形H_lastプローブに対する3つのアーク負の結果, 線形H_lastプローブに対する2つの欠陥モード分類, および, 自分たちが生成した偽陽性のクラスを, 公開可能な負に変換する正直なファルシフィケーションパイプラインを寄与する。
論文 参考訳(メタデータ) (2026-04-13T17:40:31Z) - The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams [0.0]
本研究では,大規模言語モデルにおける残差ストリームアクティベーションの幾何を分析し,有害なプロンプトを検出するためのトレーニング不要な方法であるLatentBiopsyを提案する。
我々はQwen3.5-0.8BファミリーとQwen2.5-0.5Bファミリーの2つの完全モデル三重項を評価した。
latentBiopsyは、有害なvs-ノルミティブ検出のためのAUROC$geq$0.937と、良性攻撃的プロンプトから有害なプロンプトを識別するためのAUROC = 1.000を達成している。
論文 参考訳(メタデータ) (2026-03-28T21:19:58Z) - The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation [1.8345614451086532]
RLHF 対応言語モデルは TruthfulQA 上で応答均質化を示す。
40-79%の質問は、10のi.i.d.サンプルに対して単一のセマンティッククラスタを生成する。
論文 参考訳(メタデータ) (2026-03-25T09:35:15Z) - Decoupled Diffusion Sampling for Inverse Problems on Function Spaces [73.52103661482242]
既存のプラグ・アンド・プレイ拡散後サンプリングは係数ジョイント・ソリューション・モデリングを通じて物理を暗黙的に表現する。
逆PDE問題に対する関数空間における物理認識型生成フレームワークを提案する。
我々の解答拡散逆ソルバー(DDIS)は、非条件拡散が事前に係数を学習し、ニューラル演算子はガイダンスのためにフォワードPDEを明示的にモデル化する。
論文 参考訳(メタデータ) (2026-01-30T18:54:49Z) - Steering Without Side Effects: Improving Post-Deployment Control of Language Models [61.99293520621248]
言語モデル(LM)は、デプロイ後予期せず振る舞うことが示されている。
KL-then-steer (KTS) は, その利点を保ちながら, 操舵の副作用を低減する技術である。
本手法はLlama-2-chat-7Bモデルと比較して44%のジェイルブレイク攻撃を防ぐ。
論文 参考訳(メタデータ) (2024-06-21T01:37:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。