論文の概要: Repeated Sequences Reveal Gaps between Large Language Models and Natural Language
- arxiv url: http://arxiv.org/abs/2605.24850v1
- Date: Sun, 24 May 2026 03:49:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.47705
- Title: Repeated Sequences Reveal Gaps between Large Language Models and Natural Language
- Title(参考訳): 大規模言語モデルと自然言語の繰り返し連続によるギャップ
- Authors: Kumiko Tanaka-Ishii,
- Abstract要約: GPT生成したテキストは,モデルサイズによる推定指数の体系的および統計的に有意な変化を示す。
これらの結果から, 反復列エントロピーは定量的構造診断に有効であることが示唆された。
- 参考スコア(独自算出の注目度): 8.883733362171036
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating whether large language models (LLMs) capture the structure of natural language beyond local fluency remains an open challenge. Existing evaluation methods, largely based on task performance or short-context behavior, provide limited insight into the long-range statistical organization of generated text. We propose a complementary evaluation framework based on repeated subsequences. By analyzing their distribution across scales and relating it to higher-order Rényi entropies, we probe how texts reuse previously established structure under finite-length conditions. Experiments on human-written texts and length-matched GPT-generated texts show that, while power-law models can describe restricted ranges of block length, the observed entropy growth is often equally or better characterized by logarithmic--power forms. Across datasets, natural language exhibits stable entropy-growth patterns over accessible ranges, with consistent average behavior despite variability across individual texts. In contrast, GPT-generated texts show systematic and statistically significant shifts in estimated exponents with model size. These results demonstrate that repeated-subsequence entropy provides a quantitative structural diagnostic that reveals systematic differences in long-range organization, distinguishing natural language from state-of-the-art LLM outputs beyond surface-level fluency.
- Abstract(参考訳): 大規模言語モデル(LLM)が局所流速を超えた自然言語の構造を捉えているかどうかを評価することは、未解決の課題である。
既存の評価手法は、主にタスクパフォーマンスや短文動作に基づいており、生成したテキストの長距離統計構造についての限られた洞察を提供する。
逐次的なサブシーケンスに基づく相補的評価フレームワークを提案する。
スケールにまたがる分布を分析して高次レニイエントロピーと関連づけることで、テキストが有限長条件下で確立された構造をどのように再利用するかを探索する。
人文テキストと長さマッチングGPT生成テキストの実験により、パワーローモデルは制限されたブロック長の範囲を記述できるが、観察されたエントロピー成長は対数パワー形式により等しく、より良く特徴づけられることが示されている。
データセット全体にわたって、自然言語はアクセス可能な範囲にわたって安定したエントロピー成長パターンを示し、個々のテキスト間での変動性にもかかわらず、一貫した平均的な振る舞いを示す。
対照的に、GPT生成したテキストは、モデルサイズによる推定指数の体系的および統計的に有意な変化を示す。
これらの結果から, 連続列エントロピーは, 長期組織における組織的差異を明らかにする定量的な構造診断を提供し, 自然言語と最先端のLLM出力とを区別することを示した。
関連論文リスト
- Continuous Latent Diffusion Language Model [48.974403879186916]
大規模言語モデルは自己回帰パラダイムの下で顕著な成功を収めた。
既存の代替手段は、生成効率、スケーラブルな表現学習、効果的なグローバルセマンティックモデリングを共同で達成するのに依然として苦労している。
階層型情報分解によりテキスト生成をフレーム化する階層型潜在拡散言語モデルCola DLMを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:44:56Z) - The Statistical Signature of LLMs [1.3135750017147134]
統計的正則性に関する単純なモデルに依存しない尺度は、生成規則を表面テキストと直接区別することを示す。
設定全体にわたって、圧縮は確率的生成の永続的な構造的シグネチャを明らかにする。
本研究は, 生成システムがいかにテキスト生産を再構築するかを定量化するための, シンプルで堅牢なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-20T11:33:37Z) - Semantic Chunking and the Entropy of Natural Language [1.3592625530347717]
印刷された英語のエントロピー率は1文字あたり約1ビットと推定されている。
本稿では,自然言語の複雑なマルチスケール構造を捉えようとする統計モデルを提案する。
論文 参考訳(メタデータ) (2026-02-13T18:58:10Z) - Correlation Dimension of Auto-Regressive Large Language Models [11.183390901786659]
大規模言語モデル(LLM)は、自然言語生成において顕著な進歩を遂げた。
彼らは、低難易度を示すときでさえ、繰り返しや不整合のようなファジィな行動を示し続けている。
本稿では,テキストの複雑さを定量化するために,自己相似性のフラクタル幾何学的尺度である相関次元を導入する。
論文 参考訳(メタデータ) (2025-10-24T08:42:23Z) - CASTILLO: Characterizing Response Length Distributions of Large Language Models [3.5041586868397854]
CASTILLO(CASTILLO)は、広く使われている13の大規模言語モデルにまたがる応答長分布を特徴付けるデータセットである。
本分析では,応答長のモデル間およびモデル内変動と,応答のサブセットのみにおけるモデル特異的な振る舞いと部分的テキスト変性の発生を明らかにした。
論文 参考訳(メタデータ) (2025-05-22T16:35:33Z) - Learning Decision Trees as Amortized Structure Inference [59.65621207449269]
本稿では,予測決定木アンサンブルを学習するためのハイブリッドアモータイズされた構造推論手法を提案する。
提案手法であるDT-GFNは,標準分類ベンチマークにおける最先端決定木やディープラーニング手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-03-10T07:05:07Z) - Model Criticism for Long-Form Text Generation [113.13900836015122]
我々は,テキストの高レベル構造を評価するために,潜在空間におけるモデル批判という統計ツールを適用した。
我々は,コヒーレンス,コア,トピックスという,ハイレベルな談話の3つの代表的な側面について実験を行った。
トランスフォーマーベースの言語モデルでは、トピック構造をキャプチャできるが、構造コヒーレンスやモデリングコアスを維持するのが難しくなる。
論文 参考訳(メタデータ) (2022-10-16T04:35:58Z) - SDA: Improving Text Generation with Self Data Augmentation [88.24594090105899]
自動データ拡張のための自己模倣学習フェーズを組み込むことにより,標準最大確率推定(MLE)パラダイムを改善することを提案する。
既存の文レベルの拡張戦略とは異なり,本手法はより汎用的で,任意のMLEベースの訓練手順に容易に適応できる。
論文 参考訳(メタデータ) (2021-01-02T01:15:57Z) - Progressive Generation of Long Text with Pretrained Language Models [83.62523163717448]
GPT-2のような大量のテキストコーパスで事前訓練された大規模言語モデル(LM)は、強力なオープンドメインテキストジェネレータである。
このようなモデルが、特に小さなコーパス上のターゲットドメインに微調整された場合、コヒーレントな長いテキストパスを生成することは依然として困難である。
本稿では,低解像度から高解像度の画像に触発されて,テキストを段階的に生成する簡易かつ効果的な方法を提案する。
論文 参考訳(メタデータ) (2020-06-28T21:23:05Z) - Limits of Detecting Text Generated by Large-Scale Language Models [65.46403462928319]
誤情報キャンペーンで使用される可能性があるため、長く一貫性のあるテキストを生成できる大規模な言語モデルが危険であると考える者もいる。
ここでは、仮説テスト問題として大規模言語モデル出力検出を定式化し、テキストを真あるいは生成されたものと分類する。
論文 参考訳(メタデータ) (2020-02-09T19:53:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。