論文の概要: Where Induction Runs Out: Description-Length Difficulty and the Memorisation Gap in Integer-Sequence Benchmarks
- arxiv url: http://arxiv.org/abs/2608.29411v1
- Date: Sat, 29 Aug 2026 19:25:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.95442
- Title: Where Induction Runs Out: Description-Length Difficulty and the Memorisation Gap in Integer-Sequence Benchmarks
- Title(参考訳): Integer-Sequenceベンチマークにおける説明長困難と覚醒ギャップ
- Authors: Sabilashan Ganeshan,
- Abstract要約: オンラインシーケンス百科事典 (On-Line Encyclopedia of Sequences, OEIS) は、言語モデルにおける数学的推論のベンチマークにますます使われている。
正確な計算可能な参照学習器を用いて、そのようなベンチマークが実際に何を測るのかを問う。
2万件のOEIS配列のうち89.98%が一部の接頭辞の再発に適合している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Integer sequences from the On-Line Encyclopedia of Integer Sequences (OEIS) are increasingly used to benchmark mathematical reasoning in language models. We ask what such benchmarks actually measure, using an exactly computable reference learner: two-part minimum description length (MDL) over the class of P-recursive (holonomic) recurrences, evaluated on every prefix of a sequence as terms arrive. Three findings follow. First, MDL difficulty is a parameter count. The discovery point nd, the first prefix length at which a symbolic hypothesis beats verbatim storage, is predicted almost exactly by a combinatorial identifiability bound on the selected operator's order and degree. It is invariant to term magnitude: scaling Fibonacci over twelve orders of magnitude leaves nd unchanged, because a hypothesis must encode its own initial conditions and the magnitude cancels. Second, at scale the learner exhibits a regime our curated corpus could not produce even once: across 20,000 OEIS sequences, 89.98% of those that fit a recurrence on some prefix fit none at full length. We call this the wilderness -- induction acquires a theory, loses it, and never recovers. Third, evaluating three language models on sequences stratified by these MDL regimes refuted our pre-registered hypothesis: models do not confabulate where MDL reports no theory, but hedge appropriately. Confident errors are inverted, concentrating on the easy stratum, where apparent competence tracks recognition of the sequence rather than induction of its rule. OEIS-derived benchmarks therefore substantially measure memorisation, and MDL supplies a cheap, contamination-free difficulty signal they currently lack. Code and data are released.
- Abstract(参考訳): On-Line Encyclopedia of Integer Sequences (OEIS) の整数列は、言語モデルにおける数学的推論のベンチマークにますます使われている。
P-recursive (holonomic) repeatences (P-recursive (holonomic) repeatences) のクラスに対する 2-part minimum description length (MDL)。
以下の3つの発見がある。
まず、MDLの難易度はパラメータ数である。
記号仮説が冗長記憶に打ち勝つ第1の接頭辞長である発見点ndは、選択された演算子の順序及び次数に拘束された組合せ識別性によりほぼ正確に予測される。
フィボナッチを12等級の葉にスケーリングすることは、仮説が自身の初期条件を符号化し、等級がキャンセルされなければならないため、変化しない。
第2に、大規模に学習者は、培養したコーパスが1回も生成できない状態を示す:20,000のOEIS配列、89.98%のプレフィックスに繰り返し適合するコーパスは、完全な長さには収まらない。
私たちはこれを荒野と呼びます -- 誘導は理論を取得し、それを失い、決して回復しません。
第三に、これらのMDL体制によって成層化されたシーケンス上の3つの言語モデルを評価することは、我々の事前登録された仮説に反する。
信頼の誤りは逆転し、容易な層に集中し、明らかな能力は規則の帰納よりもシーケンスの認識を追跡する。
したがって、OEIS由来のベンチマークは暗記を著しく測定し、MDLは現在欠落している安価な汚染のない困難信号を提供する。
コードとデータはリリースされます。
関連論文リスト
- Hypothesis Frontier: Verifier Guided LLM and Symbolic Search for First-Order Induction [0.0]
一階の概念合成は、ラベル付きオブジェクトをいくつかの有限リレーショナル構造に対して一貫して分類する1つの公式を推論するようにシステムに要求する。
本稿では,各学習対象のLSM式を評価する検証器誘導型ニューロシンボリックフレームワークであるPhythesis Frontierを紹介する。
論文 参考訳(メタデータ) (2026-08-11T12:13:35Z) - How Much is Left? LLMs Linearly Encode Their Remaining Output Length [3.541590945326217]
大規模言語モデルは一度に1つのトークンを生成するが、その応答は著しく一貫した長さ構造を示す。
モデルがどれだけの応答が残っているかを内部で見積もっているかどうかを問う。
我々は、7つの補完スタイルのデータセットにまたがる3つのオープンウェイト7-8Bモデルの凍結した隠れ状態に対して、最小容量の線形プローブを訓練する。
論文 参考訳(メタデータ) (2026-07-06T16:56:04Z) - DEL: Digit Entropy Loss for Numerical Learning of Large Language Models [63.37357414497361]
数値予測は、数学的な問題解決とコード生成において、大きな言語モデル(LLM)の基本的な能力である。
自己回帰型数値学習のためのDEL(Digit Entropy Loss)を提案する。
我々の定式化は整数、十進点、十進点を組み込むことができ、学習対象を1桁から浮動小数点数領域に拡張することができる。
論文 参考訳(メタデータ) (2026-05-19T18:18:59Z) - Probing Structural Mathematical Reasoning in Language Models with Algebraic Trapdoors [0.0]
言語モデルにおける構造的数学的推論を評価するためのベンチマークスイートを提案する。
各インスタンスは有限生成された部分群を整数行列のリストとして提示する。
本稿では,2つの最先端モデルから得られた5つの代表的な推論指標について実験結果について報告する。
論文 参考訳(メタデータ) (2026-05-05T23:16:30Z) - Prior Aware Memorization: An Efficient Metric for Distinguishing Memorization from Generalization in Large Language Models [9.915106680104268]
LLM(Large Language Models)からのトレーニングデータ漏洩は、プライバシ、セキュリティ、著作権コンプライアンスに関する深刻な懸念を引き起こす。
既存の暗記計測手法はしばしばこれらの現象を説明し、共通パターンの一般化から生じたときでも、アウトプットを暗記している。
この研究は、LLMにおける真の記憶を識別するための理論的基礎と軽量でトレーニング不要な基準である、事前認識記憶を導入している。
論文 参考訳(メタデータ) (2026-02-21T06:31:17Z) - Primender Sequence: A Novel Mathematical Construct for Testing Symbolic Inference and AI Reasoning [0.0]
素数列(英: Primender sequence)は、古典的な素数列とモジュラーディジットに基づく条件を組み合わせた新しい整数列である。
本稿では,大規模言語モデルの記号的推論能力を評価するためのベンチマークとして,このシーケンスを提案する。
論文 参考訳(メタデータ) (2025-06-12T11:21:58Z) - Demystifying Verbatim Memorization in Large Language Models [67.49068128909349]
大きな言語モデル(LLM)は、しばしば長いシーケンスを冗長に記憶し、しばしば深刻な法的およびプライバシー上の意味を持つ。
我々は, Pythia チェックポイントからのプレトレーニングをインジェクトシーケンスで継続することにより, 制御された環境下での動詞の暗記を学習する枠組みを開発する。
その結果,(1) 動詞の暗記には非自明な繰り返しが必要であり,(2) 後続の(おそらくはより良い)チェックポイントは,アウト・オブ・ディストリビューション・シーケンスであっても,動詞の列を暗記する傾向にあることがわかった。
論文 参考訳(メタデータ) (2024-07-25T07:10:31Z) - Language Model Cascades: Token-level uncertainty and beyond [65.38515344964647]
言語モデル(LM)の最近の進歩により、複雑なNLPタスクの品質が大幅に向上した。
Cascadingは、より好ましいコスト品質のトレードオフを達成するためのシンプルな戦略を提供する。
トークンレベルの不確実性を学習後遅延ルールに組み込むことで,単純な集約戦略を著しく上回ることを示す。
論文 参考訳(メタデータ) (2024-04-15T21:02:48Z) - LINC: A Neurosymbolic Approach for Logical Reasoning by Combining
Language Models with First-Order Logic Provers [60.009969929857704]
論理的推論は、科学、数学、社会に潜在的影響を与える可能性のある人工知能にとって重要なタスクである。
本研究では、LINCと呼ばれるモジュール型ニューロシンボリックプログラミングのようなタスクを再構成する。
我々は,FOLIOとProofWriterのバランスの取れたサブセットに対して,ほぼすべての実験条件下で,3つの異なるモデルに対して顕著な性能向上を観察した。
論文 参考訳(メタデータ) (2023-10-23T17:58:40Z) - Consistency of a Recurrent Language Model With Respect to Incomplete
Decoding [67.54760086239514]
逐次言語モデルから無限長のシーケンスを受信する問題について検討する。
不整合に対処する2つの対策として、トップkと核サンプリングの一貫性のある変種と、自己終端の繰り返し言語モデルを提案する。
論文 参考訳(メタデータ) (2020-02-06T19:56:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。