論文の概要: The Randomness Floor: Measuring Intrinsic Non-Randomness in Language Model Token Distributions
- arxiv url: http://arxiv.org/abs/2604.22771v1
- Date: Sun, 29 Mar 2026 21:17:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:14.168527
- Title: The Randomness Floor: Measuring Intrinsic Non-Randomness in Language Model Token Distributions
- Title(参考訳): ランダムネスフロア:言語モデルトークン分布の固有非ランダム性の測定
- Authors: Jarosław Hryszko,
- Abstract要約: 本稿では,モデルのトークン分布と均一分布の間の正規化KL分散であるエントロピック偏差(ED)を紹介する。
3つのトランスファミリは、異なるトレーニングデータや語彙にもかかわらず、ほぼ同じED値に収束する。
Qwen-32Bを用いた言語間実験では、5つの言語で安定な勾配を示し、トークンの肥大と相関しない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language models cannot be random. This paper introduces Entropic Deviation (ED), the normalised KL divergence between a model's token distribution and the uniform distribution, and measures it systematically across 31,200 generations spanning seven models, two architectures (transformer and state space), nine prompt categories, three temperatures, and five languages. Under semantically neutral prompts (empty strings, random characters, nonsense syllables) transformers still exhibit ED of approximately 0.30, meaning that 88-93% of the non-randomness observed under semantic prompts is intrinsic to the learned weights rather than induced by context. Three transformer families (Gemma, Llama, Qwen) converge on nearly identical ED values despite different training data and vocabularies. A state space model (Mamba2) reveals a qualitatively different regime: twice the ED, three times lower within-sequence variance, and massive sensitivity to temperature (r = -0.78) where transformers are nearly immune (r < 0.05). Cross-lingual experiments with Qwen-32B show a stable gradient across five languages (English, Japanese, Chinese, Polish, Arabic) that does not correlate with token fertility and persists when two languages sharing an identical tokeniser subset are compared. These findings establish a structural lower bound on randomness in pretrained language models, characterise how this bound differs across architectures, and demonstrate that language itself modulates the bound independently of tokenisation.
- Abstract(参考訳): 言語モデルはランダムではない。
本稿では,モデルのトークン分布と均一分布の正規化KL偏差について紹介し,それを7つのモデル,2つのアーキテクチャ(変換器と状態空間),9つのプロンプトカテゴリ,3つの温度,5つの言語にまたがる31,200世代にわたって系統的に測定する。
意味的に中立なプロンプト(空文字列、ランダム文字、ナンセンス音節)の下では、トランスフォーマーのEDは約0.30であり、意味的プロンプトの下で観察される非ランダム性の88-93%は文脈によって誘導されるのではなく、学習した重みに固有のものである。
3つの変圧器群(Gemma, Llama, Qwen)は、異なる訓練データや語彙にもかかわらずほぼ同じED値に収束する。
状態空間モデル (Mamba2) は、EDの2倍、配列内分散の3倍、温度に対する大きな感度 (r = -0.78) という質的に異なる状態を示す(r < 0.05)。
Qwen-32Bを用いた言語間実験では、5つの言語(英語、日本語、中国語、ポーランド語、アラビア語)で安定な勾配を示し、トークンの肥大度と相関せず、同一のトークンササブセットを共有する2つの言語を比較すると持続する。
これらの結果は、事前訓練された言語モデルにおけるランダム性による構造的下限を確立し、この境界がアーキテクチャ間でどのように異なるのかを特徴付け、言語自体がトークン化とは無関係に境界を変調することを示した。
関連論文リスト
- Phase transition on a context-sensitive random language model with short range interactions [1.4874449172133888]
短距離相互作用を持つランダム言語モデルの統計的特性を数値的に検討する。
言語モデルにおける有限温度相転移は、言語固有の性質によって真に誘導される。
論文 参考訳(メタデータ) (2026-04-01T14:19:11Z) - Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model [2.096023520617773]
我々は、純粋に古典中国語の56億のトークンをキュレートしたコーパスで、ゼロから言語モデルを訓練する。
モデルが未知の入力と区別できるかどうかを検討する。
内的不確実性と外的不確実性の間に明らかな解離が生じる。
論文 参考訳(メタデータ) (2026-03-31T07:37:15Z) - Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems [0.0]
加害者治療では、犯罪者は反省するが、行動の変化は従わない。
我々は、アライメントの介入が構造的に類似した現象を生じさせ、表面の安全性は、集合的な病理や内部の解離を覆い隠すか、あるいは発生させることを示した。
これらの所見は, リスクホメオスタシスと子宮新生にともなう行動介入としてのアライメントを再構成した。
論文 参考訳(メタデータ) (2026-03-05T07:46:59Z) - Cross-Lingual Stability of LLM Judges Under Controlled Generation: Evidence from Finno-Ugric Languages [0.22009842278462158]
大規模言語モデル(LLM)の言語間評価は、典型的には、真のモデルの性能差と測定不安定性の2つの要因を混同する。
対象言語が異なる場合に生成条件を一定に保って評価信頼性を評価する。
本研究は, 形態学的に豊かな言語における談話レベルの評価には, ゼロショット・ジャッジ・トランスファーが信頼できないことを示唆している。
論文 参考訳(メタデータ) (2026-02-02T16:27:32Z) - Information Locality as an Inductive Bias for Neural Language Models [52.92279412466086]
本稿では,Transformer と LSTM LM の言語学習において,$m$local entropy は困難であることを示す。
これらの結果は、ニューラルネットワークが言語の統計構造に非常に敏感であることを示唆している。
論文 参考訳(メタデータ) (2025-06-05T15:21:05Z) - First numerical observation of the Berezinskii-Kosterlitz-Thouless transition in language models [1.4061979259370274]
自然言語モデルの枠組みにおける不明瞭な相転移を数値的に示す。
我々は相転移をベレジンスキー-コステリッツ-トゥーレス転移の変種として同定する。
論文 参考訳(メタデータ) (2024-12-02T07:32:32Z) - Scaling Laws for Generative Mixed-Modal Language Models [103.25737824352949]
個別のモダリティの貢献とそれら間の相互作用を統一する混合モードスケーリング法則について報告する。
具体的には、過去のユニモーダルスケーリング法則に対する加算項として、データとモデルサイズによる最適シナジーと競合を明示的にモデル化する。
また,訓練中に観察される4つの経験的現象,例えば,自然にモダリティを交互に交互に行う創発的コーディネート・アセット・スタイル・トレーニングを見出した。
論文 参考訳(メタデータ) (2023-01-10T00:20:06Z) - Evaluating Distributional Distortion in Neural Language Modeling [81.83408583979745]
稀な事象の重みは、言語における分布の総確率質量のかなりの量を占める。
パープレキシティなどの標準言語モデリングメトリクスは、集約された言語モデル(LM)のパフォーマンスを定量化する。
自然言語を人工言語として訓練した生成モデルを用いた制御評価手法を開発した。
論文 参考訳(メタデータ) (2022-03-24T01:09:46Z) - Bridging the Data Gap between Training and Inference for Unsupervised
Neural Machine Translation [49.916963624249355]
UNMTモデルは、翻訳されたソースと推論中の自然言語で擬似並列データに基づいて訓練される。
トレーニングと推論のソース差はUNMTモデルの翻訳性能を妨げている。
本稿では、擬似並列データ自然言語を同時に用いたオンライン自己学習手法を提案する。
論文 参考訳(メタデータ) (2022-03-16T04:50:27Z) - Parameter Space Factorization for Zero-Shot Learning across Tasks and
Languages [112.65994041398481]
本稿では,ニューラルパラメータの空間に対するベイズ生成モデルを提案する。
タスク言語の組み合わせから得られたデータに基づいて、そのような潜伏変数よりも後部を推測する。
我々のモデルは、最先端のゼロショットの言語間転送手法よりも、同等か良い結果が得られる。
論文 参考訳(メタデータ) (2020-01-30T16:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。