論文の概要: Neural Collapse Is Forbidden: Information Floors in Language Models
- arxiv url: http://arxiv.org/abs/2607.09487v1
- Date: Fri, 10 Jul 2026 15:04:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.876691
- Title: Neural Collapse Is Forbidden: Information Floors in Language Models
- Title(参考訳): 神経の崩壊は禁じられている:言語モデルにおける情報フロー
- Abstract要約: 言語モデル表現におけるクラス内分散は、一般に不完全な神経崩壊と解釈される。
我々は、それが割り当てられた情報ストレージであり、アロケーションが法律に従うと主張している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Within-class variance in language-model representations is commonly read as incomplete neural collapse. We argue it is allocated information storage, and that the allocation obeys a law. A one-line centering identity voids a family of simplex equiangular-tight-frame claims, including our own earlier ones; in dimensionless variance shares across 14 models, macro-category structure carries only 4-12% of representational variance and within-token context carries 79-91%, stable across a 100x parameter range. On the theory side, token-level weight decay penalizes a category in proportion to its type count, not its occurrence mass, reducing next-token prediction to an imbalanced K-class problem whose optimum orders category norms by type count. A converse floor, proved for binary categories, forces within-category dispersion to be at least proportional to the conditional mutual information I(token; context | category). The law holds: identity dispersion, not total variance, tracks this information across every tested model and partition, under a model-free estimate and even across models, where one model's information predicts another's dispersion; and over pretraining the category share overshoots, decays, and partially recovers, because the information it must carry never left.
- Abstract(参考訳): 言語モデル表現におけるクラス内分散は、一般に不完全な神経崩壊と解釈される。
我々は、それが割り当てられた情報ストレージであり、アロケーションが法律に従うと主張している。
14モデルにまたがる非次元の分散共有では、マクロカテゴリ構造は表現的分散の4-12%しか持たず、内部のコンテキストは79-91%であり、100倍のパラメータ範囲で安定している。
理論面では、トークンレベルの重み減衰は、その出現質量ではなくタイプ数に比例して圏をペナリゼーションし、次トーケン予想を、タイプ数によって最適な順序の圏ノルムを持つ不均衡なKクラス問題に還元する。
2進圏に対して証明された逆フロアは、カテゴリー内分散を条件付き相互情報I(token; context | category)に少なくとも比例するように強制する。
完全分散ではなくアイデンティティ分散は、テスト対象のすべてのモデルとパーティション、モデルなしの見積、モデル間でさえ、これらの情報を追跡し、あるモデルの情報が他のモデルの分散を予測する。
関連論文リスト
- Impute-EM: Native Mixed-State Diffusion Models for Heterogeneous Data Imputation [71.74203645336385]
Impute-EMは、現在のモデルとインプットされていないエントリを交換し、完了したデータに拡散バックボーンをリフィットする。
我々は、この更新を特徴付け、観測されたマスクインデクシングされた辺縁線が、その限界で目標と一致していることを示す。
論文 参考訳(メタデータ) (2026-09-14T09:39:13Z) - VAE-Inf: A statistically interpretable generative paradigm for imbalanced classification [8.677199689027772]
生成的モデリングと識別的分類のギャップを埋める2段階の枠組みを提案する。
推論のために、自然な仮説テストの解釈を受け入れるプロジェクションベースのスコアを導入する。
様々な実世界のベンチマークの実験は、我々のフレームワークが他のアプローチと競合する性能を達成していることを示している。
論文 参考訳(メタデータ) (2026-04-28T07:50:56Z) - A weighted-likelihood framework for class imbalance in Bayesian prediction models [0.0]
クラス不均衡は予測毒性学において広範囲にわたる問題であり、非毒性化合物の数がしばしば毒性化合物の数を超える。
本稿では,クラス不均衡に対処し,確率関数を変化させる,単純で一般的なベイズ的枠組みを提案する。
論文 参考訳(メタデータ) (2025-04-23T18:01:47Z) - Compute-Optimal LLMs Provably Generalize Better With Scale [102.29926217670926]
我々は,大規模言語モデル(LLM)の事前学習目標に基づく一般化境界を開発する。
損失関数の分散を考慮し, 既存の境界を緩める, 完全経験的フリードマン型マルティンゲール濃度を導入する。
我々は一般化ギャップのスケーリング法則を作成し、その境界はスケールによって予測的に強くなる。
論文 参考訳(メタデータ) (2025-04-21T16:26:56Z) - A statistical theory of overfitting for imbalanced classification [0.6144680854063939]
我々は高次元不均衡分類の統計理論を開発する。
次元性はロジット分布にトランケーションやスキューイング効果を誘導することがわかった。
この現象は、少数民族が過度な適合によってより深刻な影響を受けている理由を説明する。
論文 参考訳(メタデータ) (2025-02-17T00:21:33Z) - FocalCount: Towards Class-Count Imbalance in Class-Agnostic Counting [34.25988613929425]
クラスに依存しないオブジェクトカウントにおいて、ゴールは、特定のカテゴリを区別することなく、画像内のオブジェクトインスタンスの総数を推定することである。
提案手法は,特定のクラスと一般カウントを区別するモデルの能力を大幅に向上させる。
論文 参考訳(メタデータ) (2025-02-15T05:24:43Z) - Rethinking generalization of classifiers in separable classes scenarios and over-parameterized regimes [0.0]
分離可能なクラスでは、トレーニングデータ n の数で「悪い」大域最小値の割合が指数関数的に減少することを示す。
本稿では,MNIST と CIFAR-10 の実験と整合した学習曲線を求める,真の誤差の密度分布のモデルを提案する。
論文 参考訳(メタデータ) (2024-10-22T10:12:57Z) - Deep Imbalanced Regression via Hierarchical Classification Adjustment [50.19438850112964]
コンピュータビジョンにおける回帰タスクは、しばしば、対象空間をクラスに定量化することで分類される。
トレーニングサンプルの大多数は目標値の先頭にあるが、少数のサンプルは通常より広い尾幅に分布する。
不均衡回帰タスクを解くために階層型分類器を構築することを提案する。
不均衡回帰のための新しい階層型分類調整(HCA)は,3つのタスクにおいて優れた結果を示す。
論文 参考訳(メタデータ) (2023-10-26T04:54:39Z) - Non-Asymptotic Performance of Social Machine Learning Under Limited Data [45.48644055449902]
本稿では,社会機械学習フレームワークに関連付けられた誤りの確率について検討する。
これは、ラベルのないデータのストリームを分散的に分類する問題に対処する。
論文 参考訳(メタデータ) (2023-06-15T17:42:14Z) - On the Strong Correlation Between Model Invariance and Generalization [54.812786542023325]
一般化は、見えないデータを分類するモデルの能力をキャプチャする。
不変性はデータの変換におけるモデル予測の一貫性を測定する。
データセット中心の視点から、あるモデルの精度と不変性は異なるテストセット上で線形に相関している。
論文 参考訳(メタデータ) (2022-07-14T17:08:25Z) - On how to avoid exacerbating spurious correlations when models are
overparameterized [33.315813572333745]
VS-lossは、たとえスプリアス機能が強いとしても、マイノリティに公平なモデルを学ぶことを示す。
これまでの研究と比較すると、我々の境界はより一般的なモデルであり、それらは漸近的ではなく、極端な不均衡のシナリオにも適用される。
論文 参考訳(メタデータ) (2022-06-25T21:53:44Z) - Counterfactual Invariance to Spurious Correlations: Why and How to Pass
Stress Tests [87.60900567941428]
素早い相関」とは、アナリストが重要とすべきでないと考える入力データのある側面に対するモデルの依存である。
機械学習では、これらにはノウ・イ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ」という特徴がある。
因果推論ツールを用いたストレステストについて検討した。
論文 参考訳(メタデータ) (2021-05-31T14:39:38Z) - Learning Invariances in Neural Networks [51.20867785006147]
ネットワークパラメータや拡張パラメータに関して,拡張性よりも分布をパラメータ化し,トレーニング損失を同時に最適化する方法を示す。
画像分類,回帰,セグメンテーション,分子特性予測における不均一性の正確なセットと範囲を,拡張の広い空間から復元することができる。
論文 参考訳(メタデータ) (2020-10-22T17:18:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。