論文の概要: Overtrained, Not Misaligned
- arxiv url: http://arxiv.org/abs/2605.12199v1
- Date: Tue, 12 May 2026 14:37:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.931763
- Title: Overtrained, Not Misaligned
- Title(参考訳): 過度にトレーニングされ、ミスアライメントされない
- Authors: Joel Schreiber, Ariel Goldstein,
- Abstract要約: 創発的ミスアライメント(Emergent misalignment, EM)とは、狭いタスクの微調整が、無関係なドメイン間で広範囲のミスアライメントを引き起こす場所である。
我々はこれまでで最も包括的なEM研究を行い、GPT-4oの発見と12のオープンソースモデルへの拡張を再現した。
EMはGPT-4oで複製されるが,モデルサイズとEM感受性との間には有意な相関がある。
- 参考スコア(独自算出の注目度): 3.671948697667162
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Emergent misalignment (EM), where fine-tuning on a narrow task (like insecure code) causes broad misalignment across unrelated domains, was first demonstrated by Betley et al. (2025). We conduct the most comprehensive EM study to date, reproducing the original GPT-4o finding and expanding to 12 open-source models across 4 families (Llama, Qwen, DeepSeek, GPT-OSS) ranging from 8B to 671B parameters, evaluating over one million model responses with multiple random seeds. We find that EM replicates in GPT-4o but is far from universal: only 2 of 12 open-source models (17%) exhibit consistent EM across seeds, with a significant correlation between model size and EM susceptibility. Through checkpoint-level analysis during fine-tuning, we demonstrate that EM emerges late in training, distinct from and subsequent to near convergence of the primary task, suggesting EM emerges from continued training past task convergence. This yields practical mitigations: early stopping eliminates EM while retaining an average of 93% of task performance, and careful learning rate selection further minimizes risk. Cross-domain validation on medical fine-tuning confirms these patterns generalize: the size-EM correlation strengthens (r = 0.90), and overgeneralization to untruthfulness remains avoidable via early stopping in 67% of cases, though semantically proximate training domains produce less separable misalignment. As LLMs become increasingly integrated into real-world systems, fine-tuning and reinforcement learning remain the primary methods for adapting model behavior. Our findings demonstrate that with proper training practices, EM can be avoided, reframing it from an unforeseen fine-tuning risk to an avoidable training artifact.
- Abstract(参考訳): 厳密なタスク(安全性の低いコードのような)の微調整が、無関係な領域をまたいだ広範囲な不正調整を引き起こす創発的不整合(EM)は、Betley et al (2025) によって初めて実証された。
我々はこれまでに最も包括的なEM研究を行い、オリジナルのGPT-4oを再現し、4つのファミリー(Llama, Qwen, DeepSeek, GPT-OSS)にまたがる12のオープンソースモデル(Llama, Qwen, DeepSeek, GPT-OSS)に展開した。
12のオープンソースモデルのうち2つのモデルのうち(17%)だけが種子間で一貫したEMを示しており、モデルサイズとEM感受性の間には有意な相関がある。
微調整中のチェックポイントレベル解析により, EMは訓練の後半に出現し, メインタスクのほぼ収束と相違し, 連続したトレーニング過去のタスク収束からEMが出現することが示唆された。
早期停止は、平均93%のタスク性能を維持しながらEMを排除し、注意深い学習率の選択はリスクをさらに最小化する。
サイズ-EM相関は強化され(r = 0.90)、非現実性への過度な一般化は67%のケースで早期に停止するまでは避けられないが、セマンティック・プレクサメート・トレーニングドメインは分離不能なミスアライメントをもたらす。
LLMが現実世界のシステムに統合されるにつれて、微調整と強化学習がモデル行動に適応するための主要な方法である。
本研究は, 適切なトレーニング実践を行うことで, 予期せぬ微調整リスクから回避可能なトレーニングアーティファクトまで, EMを回避できることを実証した。
関連論文リスト
- Architecture-Agnostic Modality-Isolated Gated Fusion for Robust Multi-Modal Prostate MRI Segmentation [0.0]
多重化前立腺MRIは、T2パラメトリック(T2W)、見かけ拡散係数(ADC)、高b値拡散強調(HBV)配列を組み合わせる。
実際には、拡散配列は、T2Wよりも、取得のばらつき、動き、アーティファクトの影響を受けることが多い。
我々は、学習ゲーティングステージの前に、個別のモダリティ固有の符号化ストリームを維持するために、Modality-Isolated Gated Fusion (MIGF)を提案する。
論文 参考訳(メタデータ) (2026-04-12T15:54:21Z) - Information-Theoretic Requirements for Gradient-Based Task Affinity Estimation in Multi-Task Learning [0.0]
マルチタスク学習は、非常に矛盾した結果を示している。
標準ベンチマークはこの要件を体系的に違反する。
これは、7年間の無矛盾なMLL結果に対する最初の原則的な説明を提供する。
論文 参考訳(メタデータ) (2026-04-09T06:02:26Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Cross-LLM Generalization of Behavioral Backdoor Detection in AI Agent Supply Chains [0.0]
本研究は,Cross-LLMビヘイビアバックドア検出に関する最初の体系的研究である。
単一モデル検出器は、トレーニング分布において92.7%の精度を達成するが、異なるLLM間で49.2%しか達成していないことを示す。
追加機能としてのモデル認識モデル同定は,すべての評価モデルに対して90.6%の精度で達成可能であることを示す。
論文 参考訳(メタデータ) (2025-11-25T03:33:04Z) - Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs [49.584982680596546]
In-context Learning(ICL)において、創発的不整合(EM)が出現することを発見した。
3つのデータセットにまたがって、3つのフロンティアモデルは、64の狭義のインコンテキストの例に対して2%から17%のレートで、256の例で最大58%の一致したレスポンスを生成します。
論文 参考訳(メタデータ) (2025-10-13T11:23:56Z) - Exploring Expert Failures Improves LLM Agent Tuning [74.0772570556016]
本稿では,失敗した専門家の軌道から有益な行動を識別する専門的失敗の探索(EEF)を提案する。
EEFは、未解決のいくつかのサブタスクをうまく解決し、エージェントチューニング性能を改善する。
論文 参考訳(メタデータ) (2025-04-17T17:53:54Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z) - RLAD: Time Series Anomaly Detection through Reinforcement Learning and
Active Learning [17.089402177923297]
新しい半監視型時系列異常検出アルゴリズムを紹介します。
深層強化学習とアクティブラーニングを使用して、実世界の時系列データの異常を効率的に学習し、適応する。
パラメータを手動でチューニングする必要はなく、比較するすべての最先端のメソッドを上回ります。
論文 参考訳(メタデータ) (2021-03-31T15:21:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。