論文の概要: Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards
- arxiv url: http://arxiv.org/abs/2605.31328v1
- Date: Fri, 29 May 2026 14:03:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.653924
- Title: Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards
- Title(参考訳): 強化学習は、無害者からの創発的ミスアライメントを増幅する
- Abstract要約: 創発的ミスアライメント(Emergent misalignment, EM)は、微調整後に言語モデルが広くミスアライメントされるという驚くべき傾向である。
本研究では,狭小かつ過度に不整合な動作が,サンプルマッチングSFTよりも極めて高い一般領域の不整合を生じさせることを示す。
第2に、RLからのEMは、不人気な審美的嗜好やレトリック的魅力など、自然に生じる可能性のある報酬信号によって誘導できることを示す。
- 参考スコア(独自算出の注目度): 10.376509491781883
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Emergent misalignment (EM) is the surprising tendency of language models to become broadly misaligned after fine-tuning on narrowly misaligned examples. While EM has been extensively studied in the supervised fine-tuning (SFT) setting, evidence that it also arises from reinforcement learning (RL) is limited to large, closed-source models, leaving the phenomenon expensive to study and difficult to reproduce. We characterize EM from RL in small, off-the-shelf open-weight models along three axes. First, we show that rewarding narrow, overtly misaligned behavior produces substantially higher general-domain misalignment than sample-matched SFT. Second, we show that EM from RL can be induced by reward signals that could plausibly arise naturally, such as unpopular aesthetic preferences or poor rhetorical appeals. Third, we evaluate in-training mitigations developed for SFT-induced EM and find that they broadly transfer, with interleaving on-policy safety data performing best.
- Abstract(参考訳): 創発的ミスアライメント(EM)は、狭義のミスアライメント例を微調整した後、言語モデルが広くミスアライメントされるという驚くべき傾向である。
EMは教師付き微調整(SFT)環境で広く研究されているが、強化学習(RL)から生じる証拠は大規模でクローズドソースモデルに限られており、研究に費用がかかり、再現が困難である。
RL から EM を3つの軸に沿った小型で既成のオープンウェイトモデルで特徴付ける。
まず,狭小かつ過度に不整合な振舞いの報奨は,サンプルマッチングSFTよりも極めて高い一般ドメインの不整合をもたらすことを示す。
第2に、RLからのEMは、不人気な審美的嗜好やレトリック的魅力など、自然に生じる可能性のある報酬信号によって誘導できることを示す。
第3に,SFTにより誘発されるEMのために開発されたトレーニング中の緩和策について検討し,それらが広範に移行し,政治上の安全データをインターリーブすることが最善であることを示す。
関連論文リスト
- Emergent Misalignment Is Not Magical [16.28423457205785]
EMは予測可能かつデータ依存的な一般化現象であることを示す。
この分析に基づいて,EMの有効性がトレーニングデータ形式に基づいて大きく変化することを示す。
論文 参考訳(メタデータ) (2026-08-29T08:00:32Z) - The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment [53.510840985295154]
狭いタスクの微調整は意味的に無関係なテスト領域に広範囲のミスアライメントをもたらすことを示す。
チャットテンプレートトークンは、ドメイン外のクエリに微調整された振る舞いをピギーバックすることができる。
トレーニング中に特定のトークン表現を正規化してEMを緩和するToken-Regularized Finetuning (TReFT)を提案する。
論文 参考訳(メタデータ) (2026-06-04T19:32:00Z) - FADRW: A Feature-Aware Modulated and Dynamically Reweighted Loss for Few-Shot Linguistic Steganalysis [12.12098950924885]
ソーシャルメディアプラットフォームは、悪意のある言語的ステガノグラフィーを促進し、重大なセキュリティリスクを生じさせる。
生成的ステガノグラフィーの可視性は、その特徴が良質なテキストとほとんど区別できないことを意味する。
本稿では, FADRW (Feature-Aware Modulated and Dynamically Reweighted Loss) を提案する。
論文 参考訳(メタデータ) (2026-06-03T07:41:20Z) - Understanding Emergent Misalignment via Feature Superposition Geometry [48.56470855119906]
狭小で無害なタスクの微調整が有害な行動を引き起こすことを示す。
本研究は,この現象の理解と緩和の基盤となる特徴的重ね合わせに,創発的不整合を関連づけるものである。
論文 参考訳(メタデータ) (2026-04-07T06:10:21Z) - Towards Sample-Efficient and Stable Reinforcement Learning for LLM-based Recommendation [56.92367609590823]
Long Chain-of-Thought (Long CoT)推論は、Large Language Models (LLMs)において有望であることを示している。
我々はLong CoTが本質的にシーケンシャルなレコメンデーションドメインに不適合であると主張している。
提案するRISER(Reinforced Item Space Exploration framework for Recommendation)を提案する。
論文 参考訳(メタデータ) (2026-01-31T10:02:43Z) - Decoupled Entropy Minimization [15.596268614652326]
エントロピー最小化(EM)は、クラスオーバーラップを減らし、ドメインギャップを埋め、機械学習における様々なタスクの不確実性を制限するのに有用である。
クラスタ集約駆動因子(CADF)は支配クラスに報酬を与え、ピーク出力分布を誘導する一方、勾配緩和校正器(GMC)は予測確率に基づいて高信頼クラスを罰する。
適応デカップリングエントロピー最小化 (AdaDEM) はCADFから得られる報酬を正規化し, 限界エントロピーキャリブレータ (MEC) を用いて GMC を置き換える。
論文 参考訳(メタデータ) (2025-11-05T07:36:46Z) - Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs [49.584982680596546]
In-context Learning(ICL)において、創発的不整合(EM)が出現することを発見した。
3つのデータセットにまたがって、3つのフロンティアモデルは、64の狭義のインコンテキストの例に対して2%から17%のレートで、256の例で最大58%の一致したレスポンスを生成します。
論文 参考訳(メタデータ) (2025-10-13T11:23:56Z) - Generative Model Inversion Through the Lens of the Manifold Hypothesis [98.37040155914595]
モデル反転攻撃(MIA)は、訓練されたモデルからクラス表現型サンプルを再構成することを目的としている。
最近の生成的MIAは、生成的敵ネットワークを使用して、反転過程を導く画像の事前学習を行う。
論文 参考訳(メタデータ) (2025-09-24T14:39:25Z) - ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models [76.28894983518164]
小型言語モデル (SLM) は大規模言語モデル (LLM) に代わる費用対効果がある。
彼らはしばしば、限られた能力と間違いや一貫性のない答えを生み出す傾向があるため、複雑な推論に苦しむ。
本稿では、垂直領域における堅牢かつ自己充足的推論のための強化学習フレームワークであるReaLMを紹介する。
論文 参考訳(メタデータ) (2025-08-17T14:50:23Z) - Language Models Resist Alignment: Evidence From Data Compression [30.708635183315433]
大型言語モデル(LLM)は意図しないあるいは望ましくない振る舞いを示すことがある。
微調整が事前学習に対するアライメントを著しく損なうことを示す。
本研究は,LLMの弾性特性に対処し,アライメントに対する抵抗を緩和する必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2024-06-10T10:03:16Z) - Low-rank finetuning for LLMs: A fairness perspective [54.13240282850982]
低ランク近似技術は、微調整された大規模言語モデルのデファクトスタンダードとなっている。
本稿では,これらの手法が初期訓練済みデータ分布から微調整データセットのシフトを捉える上での有効性について検討する。
低ランク微調整は好ましくない偏見や有害な振る舞いを必然的に保存することを示す。
論文 参考訳(メタデータ) (2024-05-28T20:43:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。