論文の概要: Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models
- arxiv url: http://arxiv.org/abs/2608.11426v2
- Date: Thu, 13 Aug 2026 18:34:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.212929
- Title: Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models
- Title(参考訳): 収束は必然か? 出力均一性をベースモデルに遡る
- Authors: Alexandrine Fortier, Hazel Chen, Peter West,
- Abstract要約: 最初のアライメント段階から意味収束が観察される。
我々は収束を明らかにし増幅することができるが、SFTデータでは導入されないことを発見した。
その結果,LMトレーニングの根底にある目的から,意味収束が自然に生じる可能性が示唆された。
- 参考スコア(独自算出の注目度): 49.46165710676499
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The lack of diversity in LM content is widely attributed to the alignment process, but how and where exactly in the pipeline this collapse begins is unknown. We argue that output homogeneity is likely learned during the pretraining phase, and only revealed or magnified during the alignment process. Specifically, we find that semantic convergence is observed from the first alignment stage--the instruction-tuning phase (SFT)--suggesting that homogeneity might already exist in the pre-alignment model. To investigate this, we conduct controlled SFT experiments examining how training data influences output convergence on specific input/output pairs. We find that convergence can be revealed and amplified, but not introduced by the SFT data, supporting its role as a catalyst rather than a cause. To further test whether homogeneity originates before alignment, we measure convergence in base models. We find that instruct-like collapse can be induced through prompting alone, even without alignment. Taken together, our results suggest that semantic convergence may arise naturally from the objectives underlying LM training, making it difficult to mitigate through post-alignment interventions alone.
- Abstract(参考訳): LM含有量の多様性の欠如はアライメントプロセスによるところが大きいが、パイプライン内でどのように、どこでこの崩壊が始まるのかは不明である。
我々は、出力の均一性は事前学習の段階で学習され、アライメントの過程でのみ明らかにまたは拡大されると主張している。
具体的には、第1アライメント段階から意味収束が観察され、命令調整フェーズ(SFT)は、相同性が事前アライメントモデルにすでに存在することを示唆する。
そこで本研究では,学習データが特定の入力/出力ペアの出力収束に与える影響について,制御されたSFT実験を行った。
コンバージェンスを明らかにし,増幅することはできるが,SFTデータでは導入されず,原因ではなく触媒としての役割を担っている。
ホモジニティがアライメントの前に生じるかどうかをさらに確かめるために、ベースモデルの収束度を測定する。
インストラクトライクな崩壊は,アライメントを伴わずに単独で進行させることによって引き起こされる。
その結果, 意味収束は, LMトレーニングの根底にある目的から自然に生じる可能性があり, 調整後介入のみでは緩和が困難であることが示唆された。
関連論文リスト
- How Does Alignment Tuning Shape Representations of Sycophancy and Related Cue-Induced Biases in LLMs? [53.58941416780391]
本研究は, この感受性, 潜伏性および関連キュー誘発バイアスがモデル内に存在するかを研究する。
我々は、隠れた状態からバイアスごとの方向を抽出し、探索、1つのデータセットの移動、因果的介入の3つの手段によってそれを三角測量する。
論文 参考訳(メタデータ) (2026-07-20T16:10:06Z) - Why Zeroth-Order Adaptation May Forget Less: A Randomized Shaping Theory [23.912005398880293]
継続的な学習は、以前獲得した能力を損なうことなく、新しいタスク適応を必要とする。
最近のフォワードパスとゼロオーダー(ZO)の結果は、低クエリ適応が一階降下よりも優れていることを示している。
有限差分はFOと平均整合した生の形状を明らかにする。
標準整合ZOの場合、予想される形状の保持曲率は、異方性成分のみを収縮しながら等方性保持床を保存する正確な恒等性に従う。
このアイデンティティを入射勾配に投影すると、観測可能な FO--ZO 二次的無視ギャップが得られる。
論文 参考訳(メタデータ) (2026-05-11T14:41:08Z) - Conditional Diffusion Under Linear Constraints: Langevin Mixing and Information-Theoretic Guarantees [10.73598638822051]
線形逆問題に対する事前学習拡散モデルを用いたゼロショット条件付きサンプリングについて検討する。
このスコアを無条件の接点スコアで置き換える誤差は、観測されたコンポーネントと観測されていないコンポーネントの間の次元自由条件の相互情報によって上限づけられていることを証明する。
論文 参考訳(メタデータ) (2026-05-06T19:19:54Z) - OrthoFormer: Instrumental Variable Estimation in Transformer Hidden States via Neural Control Functions [0.0]
シーケンシャルなモデリングにおいて優れたトランスフォーマーアーキテクチャは、相関学習によって基本的に制限される。
そこで我々はOrthoFormerを提案する。OrthoFormerは機械的変数推定をニューラル制御機能を介してTransformerブロックに直接組み込む因果的基底アーキテクチャである。
論文 参考訳(メタデータ) (2026-03-08T03:05:16Z) - Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback [50.89125374999765]
NLHFにおける最適乗算重み更新(mathtOMWU$)に対する最初の収束保証を提供する。
本分析では, 稀に発生する行動の確率が指数関数的に小さい値から指数関数的に増大する新たな限界収束挙動を同定する。
論文 参考訳(メタデータ) (2025-12-31T12:08:29Z) - Language Models Resist Alignment: Evidence From Data Compression [30.708635183315433]
大型言語モデル(LLM)は意図しないあるいは望ましくない振る舞いを示すことがある。
微調整が事前学習に対するアライメントを著しく損なうことを示す。
本研究は,LLMの弾性特性に対処し,アライメントに対する抵抗を緩和する必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2024-06-10T10:03:16Z) - Score-based Causal Representation Learning with Interventions [54.735484409244386]
本稿では,潜在因果変数を間接的に観察する際の因果表現学習問題について検討する。
目的は、 (i) 未知の線形変換(スケーリングまで)を回復し、 (ii) 潜在変数の下の有向非巡回グラフ(DAG)を決定することである。
論文 参考訳(メタデータ) (2023-01-19T18:39:48Z) - Orthogonal Jacobian Regularization for Unsupervised Disentanglement in
Image Generation [64.92152574895111]
直交ジャコビアン正規化法(OroJaR)を提案する。
提案手法は, 絡み合った, 制御可能な画像生成に有効であり, 最先端の手法に対して好適に機能する。
論文 参考訳(メタデータ) (2021-08-17T15:01:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。