論文の概要: An Emergent Mirage: Is Emergent Misalignment and Realignment Indeed a Robust Phenomenon?
- arxiv url: http://arxiv.org/abs/2607.09053v1
- Date: Fri, 10 Jul 2026 02:50:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.767673
- Title: An Emergent Mirage: Is Emergent Misalignment and Realignment Indeed a Robust Phenomenon?
- Title(参考訳): 創発的なミラージュ:創発的なミスサライメントとリアライメントは実際にロバストな現象か?
- Abstract要約: 制御された微調整ループを用いて繰り返しアライメントと誤アライメントのサイクルを計測し,動作性能の追跡とLoRA表現について検討した。
その結果, 相違点と相違点の両方が表層データセットの特徴に非常に敏感であり, 応答長の差を制御した結果, 明らかな急激な相違点はほぼ消失していることがわかった。
この結果から,EM 現象のロバスト性を明らかにするための評価プロトコルの必要性が示唆された。
- 参考スコア(独自算出の注目度): 7.43544515207381
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work has reported Emergent Misalignment (EM), where language models fine-tuned on narrow, domain-specific misaligned datasets abruptly acquire broadly misaligned behavior, alongside evidence that this behavior can be reversed through limited realignment. We systematically study repeated alignment and misalignment cycles using controlled fine-tuning loops while tracking behavioral performance, and LoRA representations throughout training. Although we reproduce EM, we find that both misalignment and realignment are highly sensitive to superficial dataset characteristics, with apparent rapid realignment largely disappearing after controlling for response-length differences. We further find that previously reported mechanistic signatures, including representational phase transitions in LoRA space, do not consistently correlate with behavioral misalignment across training. Our results suggest that current evidence for EM is less robust than previously claimed and highlight the need for evaluation protocols that carefully control for these surface level dataset artifacts to identify the robustness of the EM phenomenon.
- Abstract(参考訳): 最近の研究はEmergent Misalignment (EM)を報告しており、狭義のドメイン固有のミスアライメントデータセットを微調整した言語モデルが、限られた認識を通してこの振る舞いを逆転できるという証拠とともに、突然、広いミスアライメントの振る舞いを取得する。
制御された微調整ループを用いて繰り返しアライメントとミスアライメントのサイクルを系統的に研究し,動作性能とLoRA表現をトレーニングを通して追跡した。
我々はEMを再現するが、誤り修正と再認識は表層データセットの特徴に非常に敏感であり、応答長の差を制御した後、明らかな急激な再認識はほとんど消失する。
さらに、LoRA空間における表現相転移を含む以前に報告された機械的シグネチャは、トレーニング間の行動的不整合と一貫して相関しないことがわかった。
以上の結果から,EM 現象のロバスト性を明らかにするため,これらの表面レベルのデータセットアーティファクトを慎重に制御する評価プロトコルの必要性が示唆された。
関連論文リスト
- NICE: Scale-Stable Perturbations for Graph Neural Network Explanations via Noise Corruption [67.57304101271096]
Element-wise Masking (EM) は、エッジによって引き起こされるメッセージをゼロに抑制する。
ノイズ破壊(NC)は、一致したノームなランダムな方向の破損を通じて各メッセージに摂動を与える。
騒音破壊に基づく説明フレームワークであるNICEは、NCが引き起こす不確実性の下で復元境界(英語版)(SRB)を学習する。
論文 参考訳(メタデータ) (2026-08-17T03:08:14Z) - Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating [47.48855451348491]
微調整された大きな言語モデルは、広範囲のミスアライメントと有害な振る舞いを引き起こす可能性がある。
微調整はユーザの誤った意見に受動的に一致することを示す。
創発的不整合を克服する効率的な方法であるアライメントゲーティングを提案する。
論文 参考訳(メタデータ) (2026-06-08T06:05:47Z) - The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment [53.510840985295154]
狭いタスクの微調整は意味的に無関係なテスト領域に広範囲のミスアライメントをもたらすことを示す。
チャットテンプレートトークンは、ドメイン外のクエリに微調整された振る舞いをピギーバックすることができる。
トレーニング中に特定のトークン表現を正規化してEMを緩和するToken-Regularized Finetuning (TReFT)を提案する。
論文 参考訳(メタデータ) (2026-06-04T19:32:00Z) - Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment [12.66555363236598]
創発的ミスアライメント(EM)は、誤ったペルソナベクトルと邪悪な性格特性の活性化と関連付けられている。
本研究では,文字対象の介入として,自己生成テキスト認識(SGTR)ファインタニングについて検討する。
論文 参考訳(メタデータ) (2026-06-04T00:04:58Z) - Alignment Dynamics in LLM Fine-Tuning [37.49269074190027]
大規模言語モデル(LLM)は、人間のフィードバックから教師付き微調整と強化学習を通じて、強い整合性を達成する。
そこで我々は,微調整中にアライメントスコアを導入し,そのクローズドフォーム更新を導出し,アライメントダイナミックスのための統一的なフレームワークを提供する。
論文 参考訳(メタデータ) (2026-05-18T12:27:12Z) - Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer [29.560861899637235]
我々は、創発的ミスアライメントはデータ経由の転送現象として理解しやすいと論じる。
微調整と評価が類似した機能構造を共有すると,誤認識がより容易に現れることが判明した。
さらに、有害な教師が生み出す一見良質なデータを微調整することで、誤認識を伝達するサブリミナルラーニング(SL)についても検討する。
論文 参考訳(メタデータ) (2026-05-12T22:27:32Z) - Understanding Emergent Misalignment via Feature Superposition Geometry [48.56470855119906]
狭小で無害なタスクの微調整が有害な行動を引き起こすことを示す。
本研究は,この現象の理解と緩和の基盤となる特徴的重ね合わせに,創発的不整合を関連づけるものである。
論文 参考訳(メタデータ) (2026-04-07T06:10:21Z) - Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures [70.48661957773449]
創発的ミスアライメント(英: Emergent Misalignment)とは、狭い範囲のデータに対する微調整された大きな言語モデルによって、広範囲に不整合な振る舞いが引き起こされる障害モードを指す。
複数のドメインやモデルファミリにまたがって、特定の文字レベルの配置を示すデータの微調整モデルは、誤操作よりもはるかに強く、転送可能な微調整を誘導する。
論文 参考訳(メタデータ) (2026-01-30T15:28:42Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs [0.0]
安全でないコードに対する微調整は、アライメントに反する内部的な変更を誘発することを示す。
我々は、アライメントの振る舞いを管理するモデルの活性化空間における共有潜在次元を同定する。
論文 参考訳(メタデータ) (2025-07-04T15:36:58Z) - Convergent Linear Representations of Emergent Misalignment [1.3286418032136589]
微調整された大きな言語モデルは、広範に不整合な振る舞いを発達させる可能性がある。
9個のランク1アダプターでQwen2.5-14B-インストラクタを異常に除去するミニマルモデル生物について検討した。
論文 参考訳(メタデータ) (2025-06-13T09:39:54Z) - Extreme Memorization via Scale of Initialization [72.78162454173803]
我々は,初期化の規模を変えることが,SGDによって誘導される暗黙の正規化に強く影響を与える実験装置を構築する。
一般化能力に影響を及ぼす範囲と方法が、使用したアクティベーションと損失関数に依存することがわかった。
均質なReLU活性化の場合、この挙動は損失関数に起因することが示される。
論文 参考訳(メタデータ) (2020-08-31T04:53:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。