論文の概要: Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility
- arxiv url: http://arxiv.org/abs/2608.03930v1
- Date: Tue, 04 Aug 2026 17:02:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.296427
- Title: Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility
- Title(参考訳): 言語前の論理: 形式的導出の事前訓練はスキル獲得と圧縮性を促進する
- Authors: Jo-Ku Cheng, Nikolaos Aletras, Marco Valentino,
- Abstract要約: シンボルデータに基づく事前事前学習言語モデル(LM)は、自然言語の獲得を加速し、改善することができる。
論理事前学習は,LMにおけるスキル獲得を著しく促進することを示す。
機械学的には、形式的導出は永続的な構造的再構成を引き起こす。
- 参考スコア(独自算出の注目度): 41.15091250761469
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pre-pretraining language models (LMs) on symbolic data can accelerate and improve natural language acquisition. However, existing pre-pretraining tasks, such as Dyck and procedural algorithms, rely on narrow primitives that fail to capture the expressive capacity of natural language. Moreover, prior studies remain restricted to relatively small token budgets, offering limited insight into skill emergence and representational dynamics. To address these limitations, we propose logic pre-pretraining (Logic-PPT) as a principled initialization strategy, leveraging formal derivations to impart richer structural and linguistic biases. Formal derivations require abstract mechanisms that are central to natural language, simultaneously binding variables, connecting quantifiers and relational dependencies, and composing predicate-argument structures over long contexts. Scaling our evaluation to a 100B-token regime, logic pre-pretraining substantially accelerates skill acquisition in LMs, achieving 80\% accuracy on linguistic tasks with 36B fewer tokens than standard initialization, and outperforming alternative pre-pretraining baselines. Mechanistically, formal derivations induce persistent structural reorganization, distinctively characterized by a lower-rank, spectrally concentrated representation space. Crucially, we show that this internal geometry enables improved model compressibility via pruning, matching the dense baseline performance even at $\approx$33\% sparsity.
- Abstract(参考訳): シンボルデータに基づく事前事前学習言語モデル(LM)は、自然言語の獲得を加速し、改善することができる。
しかし、Dyckや手続き型アルゴリズムのような既存の事前訓練タスクは、自然言語の表現能力の獲得に失敗する狭いプリミティブに依存している。
さらに、先行研究は比較的小さなトークン予算に限定されており、スキルの出現と表現力学に関する限られた洞察を与えている。
これらの制約に対処するため、我々は論理前訓練(Logic-PPT)を論理初期化戦略として提案し、形式的導出を利用してよりリッチな構造的・言語的バイアスを付与する。
形式的導出には、自然言語の中心となる抽象的なメカニズム、変数の同時結合、量子化器と関係依存の接続、長い文脈における述語論の構造の構成が必要である。
評価を100B-token体制にスケールすると、論理事前学習は、LMのスキル獲得を大幅に加速し、標準初期化よりもトークンが36B少ない言語タスクにおいて80%の精度を達成し、代替事前学習ベースラインよりも優れる。
機械的に、フォーマルな導出は、低ランクでスペクトルに集中した表現空間によって特徴付けられる、永続的な構造的再構成を誘導する。
重要なことに、この内部幾何学はプルーニングによるモデル圧縮性を向上し、$\approx$33\%の間隔でも高密度のベースライン性能と一致することを示す。
関連論文リスト
- Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - Language Acquisition Device in Large Language Models [20.65039123567166]
本稿では,MERGE,AGREE,MOVEを介して,文字列が階層的な構成,特徴ベース依存性,長距離変位を符号化する形式言語MP-STRUCTの事前事前訓練を提案する。
C-RASPでは定義できないが、MP-STRUCT COREは$k$-Shuffle Dyckより優れている。
依存関係の解決の曖昧さを軽減する機能的なランドマークが重要なドライバであることを示す。
論文 参考訳(メタデータ) (2026-05-16T02:13:32Z) - Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models [82.79223371188756]
CoT(Chain-of-Thought)は、大規模言語モデルを用いた自然言語処理において、高度なタスク解決機能を備えている。
CoTをタンパク質やRNA言語モデルのような非自然言語ドメインに適用することは、まだ不可能である。
生物シークエンスモデルではじめて事前学習を導入し、中間的推論を行えるようにした。
論文 参考訳(メタデータ) (2025-12-24T05:25:17Z) - HYPEROFA: Expanding LLM Vocabulary to New Languages via Hypernetwork-Based Embedding Initialization [50.27950279695363]
多くの事前訓練された言語モデル (PLM) は、中級言語と低級言語で最適な性能を示す。
これを解決するための一般的な戦略は、ターゲット言語固有の新しいトークンを導入し、埋め込みを初期化し、ターゲット言語データに連続的な事前トレーニングを適用することである。
より適応的なトークン埋め込みのためのハイパーネットワークベースのアプローチであるHYPEROFAを提案する。
論文 参考訳(メタデータ) (2025-04-21T19:40:32Z) - Between Circuits and Chomsky: Pre-pretraining on Formal Languages Imparts Linguistic Biases [47.920937001420505]
フォーマルな言語上での言語モデルの事前学習は、自然言語の獲得を改善することができる。
階層的な依存関係をキャプチャする言語は、言語モデルが自然言語の損失を低減できることを示す。
また、フォーマルな言語から自然言語への移動の機械的証拠を与える。
論文 参考訳(メタデータ) (2025-02-26T15:55:55Z) - Implicit Language Models are RNNs: Balancing Parallelization and Expressivity [4.332158627306896]
状態空間モデル(SSM)とトランスフォーマーが言語モデリングのランドスケープを支配している。
固定点に収束するまで変換を行う暗黙のSSMを提案する。
提案手法は, 正規言語における状態追跡能力に優れ, トランスフォーマーやSSMよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-02-10T19:59:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。