論文の概要: The Dynamics of Continuous Mixture Collapse in Language Models
- arxiv url: http://arxiv.org/abs/2609.02049v1
- Date: Wed, 02 Sep 2026 03:25:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.039747
- Title: The Dynamics of Continuous Mixture Collapse in Language Models
- Title(参考訳): 言語モデルにおける連続混合崩壊のダイナミクス
- Abstract要約: LLMは、トークン埋め込みの重み付け混合など、離散中間トークンを連続状態に置き換える。
しかし、事前訓練された言語モデルは、しばしばこれらの混合を保存するのに失敗する。
私たちは3つの独立した障害源を特定します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLMs latent-state reasoning methods replace discrete intermediate tokens with continuous states, such as weighted mixtures of token embeddings, to retain multiple possible reasoning directions rather than committing to one. Yet pretrained language models often fail to preserve these mixtures. We study why through a combination of theoretical analysis and controlled empirical investigations on a variety of models. We identify three independent, distinct sources of failure. First, transformer architectures already distort mixture geometry, and training substantially amplifies this effect. Moreover, the failure can occur even if the model transports mixtures perfectly linearly: the softmax readout and autoregressive feedback form a dynamical system that either amplifies small differences until one component of the mixture dominates or contracts different mixtures until they become indistinguishable. We verify this theoretical prediction empirically: the observed transition between contraction and amplification occurs near the theoretical threshold derived by our analysis, and pretrained-model rollouts lie predominantly on the amplifying side. Finally, we generalize to mixtures of many components and show that exact preservation generally requires context-dependent correction, whose required dimensionality can grow with the number of components.
- Abstract(参考訳): LLMの潜在状態推論法は、離散中間トークンをトークン埋め込みの重み付け混合のような連続状態に置き換え、トークンへのコミットよりも複数の可能な推論方向を維持する。
しかし、事前訓練された言語モデルは、しばしばこれらの混合を保存するのに失敗する。
理論的解析と様々なモデルに関する制御された実証研究の組み合わせにより、なぜ研究を行うのかを考察する。
私たちは3つの独立した障害源を特定します。
まず、変圧器のアーキテクチャが既に混合幾何学を歪めており、トレーニングはこの効果を実質的に増幅している。
ソフトマックスの読み出しと自己回帰フィードバックは、混合物の1つの成分が支配するまで小さな差を増幅するか、区別不能になるまで異なる混合物を収縮させる動的システムを形成する。
我々は, この理論予測を実証的に検証し, 解析によって導かれる理論しきい値付近で収縮と増幅の観測的な遷移が起こり, 事前学習されたモデルロールアウトは増幅側で主に発生することを示した。
最後に、多くの成分の混合に一般化し、正確な保存には一般に文脈に依存した補正が必要であることを示す。
関連論文リスト
- Nonparametric Deconvolution and Denoising using Simulation Based Inference [3.6640504352010885]
我々は,観測されたデータ分布と雑音を伴うモデル分布とをマッチングすることにより,潜在生成モデルを学習する。
本手法は, 生成潜在分布モデルの下でのデコンボリューションに対する実用的, 理論的に基礎的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-06-20T07:03:37Z) - The Interplay of Data Structure and Imbalance in the Learning Dynamics of Diffusion Models [8.547042933482645]
スコアベース拡散モデルにおけるクラス依存学習について検討する。
これらのダイナミクスを規定する明確な階層を明らかにします。
我々は、Fashion MNISTで訓練されたU-Netモデルを用いて、理論的予測を実証的に検証する。
論文 参考訳(メタデータ) (2026-05-07T14:44:53Z) - A Generative Sampler for distributions with possible discrete parameter based on Reversibility [9.349846971147256]
本稿では,多種多様な状態空間にまたがって適用可能な,統一的かつ段階的な目標自由な生成サンプリングフレームワークを提案する。
我々は,前方と後方のマルコフ軌道の関節分布の最大平均差 (MMD) を最小化する。
実験により,本フレームワークは熱力学観測器を正確に再現し,すべてのレシエーションでモードスイッチング動作を捉えていることがわかった。
論文 参考訳(メタデータ) (2026-03-10T06:32:51Z) - On the Mechanism and Dynamics of Modular Addition: Fourier Features, Lottery Ticket, and Grokking [49.1352577985191]
本稿では,2層ニューラルネットワークがモジュール追加タスクを解くために,機能をどのように学習するかを包括的に分析する。
我々の研究は、学習したモデルの完全な機械論的解釈と、その訓練力学の理論的説明を提供する。
論文 参考訳(メタデータ) (2026-02-18T20:25:13Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Regularized Neural Ensemblers [55.15643209328513]
本研究では,正規化ニューラルネットワークをアンサンブル手法として活用することを検討する。
低多様性のアンサンブルを学習するリスクを動機として,ランダムにベースモデル予測をドロップすることで,アンサンブルモデルの正規化を提案する。
このアプローチはアンサンブル内の多様性の低い境界を提供し、過度な適合を減らし、一般化能力を向上させる。
論文 参考訳(メタデータ) (2024-10-06T15:25:39Z) - Towards Theoretical Understandings of Self-Consuming Generative Models [56.84592466204185]
本稿では,自己消費ループ内で生成モデルを訓練する新たな課題に取り組む。
我々は,このトレーニングが将来のモデルで学習したデータ分布に与える影響を厳格に評価するための理論的枠組みを構築した。
カーネル密度推定の結果は,混合データトレーニングがエラー伝播に与える影響など,微妙な洞察を与える。
論文 参考訳(メタデータ) (2024-02-19T02:08:09Z) - Shared Independent Component Analysis for Multi-Subject Neuroimaging [107.29179765643042]
本稿では,ShICA (Shared Independent Component Analysis) を導入し,各ビューを加法ガウス雑音によって汚染された共有独立成分の線形変換としてモデル化する。
このモデルは、成分がガウス的でないか、あるいはノイズ分散に十分な多様性がある場合、同定可能であることを示す。
我々は,fMRIおよびMEGデータセットの実証的証拠として,ShICAが代替品よりも正確な成分推定を行うことを示す。
論文 参考訳(メタデータ) (2021-10-26T08:54:41Z) - Understanding Double Descent Requires a Fine-Grained Bias-Variance
Decomposition [34.235007566913396]
ラベルに関連付けられた用語への分散の解釈可能で対称的な分解について述べる。
バイアスはネットワーク幅とともに単調に減少するが、分散項は非単調な振る舞いを示す。
我々はまた、著しく豊かな現象論も分析する。
論文 参考訳(メタデータ) (2020-11-04T21:04:02Z) - On Mixup Regularization [16.748910388577308]
Mixupは、トレーニングポイントとラベルの凸組み合わせとして新しい例を作成するデータ拡張テクニックである。
そこで本研究では、Mixupの新しい解釈のランダムな摂動が、複数の既知の正規化スキームを誘導することを示す。
論文 参考訳(メタデータ) (2020-06-10T20:11:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。