論文の概要: Algorithmic Scratchpads and Curriculum Staging for Arithmetic Reasoning in Tiny Transformers
- arxiv url: http://arxiv.org/abs/2610.09003v1
- Date: Tue, 06 Oct 2026 18:58:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.563716
- Title: Algorithmic Scratchpads and Curriculum Staging for Arithmetic Reasoning in Tiny Transformers
- Title(参考訳): タイニー変圧器の算数推論のためのアルゴリズムスクラッチパッドとカリキュラムスタージング
- Abstract要約: 本稿では,コンパクトな「Tiny」変換器における多段階演算の力学について検討する。
アルゴリズムによるスクラッチパッドの定式化が直接成功を予測できることを実証する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoregressive Large Language Models (LLMs) frequently struggle with deterministic multi-step algorithmic tasks such as multi-digit multiplication and long division. In this paper, we investigate the mechanics of multi-step arithmetic in compact "Tiny" Transformers (~10.6M non-embedding parameters, 49.3M total) trained on synthetic data across four basic operations (+, -, *, /) unrolled as step-by-step scratchpads. First, we establish the necessary training foundations: (1) dataloader sequence padding creates an 83% gradient starvation artifact that collapses accuracy from 40% to 1%, remediated via continuous sequence packing; (2) linguistic pretraining is an essential prerequisite (<= 2.0% without it); and (3) modern architectural primitives (RoPE, RMSNorm, SwiGLU) and Sparse Mixture of Experts (MoE) substantially improve additive reasoning over baseline GPT-2. Second, we demonstrate that algorithmic scratchpad formulation directly dictates success. Introducing a deterministic Digit-by-Digit Long Division scratchpad within a 4-stage Hierarchical Developmental Curriculum dramatically elevates single-digit division from 4.0% to 86.7% accuracy on a 4,000-problem held-out benchmark. In contrast, multi-digit multiplication remained challenging: detailed error analysis revealed that while the model correctly computed single-digit sub-products and place-value zeros, our FOIL scratchpad failed because it forced a simultaneous summation of up to nine multi-digit terms in a single step without pairwise intermediate accumulation. Finally, we identify two key boundaries: performance collapses to 0.00% on unseen 4-digit operands, and unbuffered training induces catastrophic forgetting, collapsing division accuracy from 86.7% down to 0.00%.
- Abstract(参考訳): 自己回帰型大規模言語モデル(LLM)は、多桁乗算や長い分割のような決定論的多段階アルゴリズムのタスクにしばしば苦労する。
本稿では,4つの基本演算(+, -, *, /)をステップバイステップスクラッチパッドとして切り離した合成データに基づいて学習した,コンパクトな「Tiny」変換器(約10.6Mの非埋め込みパラメータ,49.3Mの合計)における多段階演算の力学について検討する。
まず,(1) データローダシークエンスパディングは, 40%から1%の精度で精度を低下させ, 連続的なシークエンスパッキングによって再現する83%の勾配飢餓アーティファクトを生成し, (2) 言語的事前訓練は必須の前提条件である(<=2.0%) , (3) 現代の建築プリミティブ (RoPE, RMSNorm, SwiGLU) とスパースミクチャー・オブ・エキスパート (MoE) は, GPT-2 の付加的推論を大幅に改善する。
第2に,アルゴリズムによるスクラッチパッドの定式化が成功を左右することを示す。
4段階の階層的開発カリキュラム内の決定論的ディジット・バイ・ディジット・ロングディビジョンスクラッチパッドの導入は、4000プロブレムのホールドアウトベンチマークで1桁の除算を4.0%から86.7%に劇的に高めている。
一方,複数桁の乗算は困難であり,詳細な誤差解析により,単一桁の副積と位置値のゼロを正しく計算するが,FOILスクラッチパッドは1ステップで最大9桁の同時累積処理を行なわなかった。
最後に、2つの重要な境界点を識別する: パフォーマンスは4桁のオペランド上で0.00%に崩壊し、バッファなしトレーニングは破滅的な忘れ込みを誘発し、分割精度は86.7%から0.00%に低下する。
関連論文リスト
- CircuitsDNA: Discovering Unconventional Multi-Accuracy Arithmetic Circuits via Evolutionary Synthesis [1.10042698101905]
AIワークロードはますます、需要に応じて計算精度を交換できる演算ユニットを必要としている。
この研究は、精度設定可能な演算回路を自動的に進化させる進化的フレームワークであるCircuitsDNAを導入している。
1)モード固有の精度要求を強制するためのマルチスレッドの検証可能性ミッター、2)リソース制限された検証可能性駆動探索、3)効果的な構造修正を優先するためのフィードバック駆動適応突然変異、の3つの主要な特徴を統合している。
論文 参考訳(メタデータ) (2026-09-01T18:03:46Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - THEIA: Learning Complete Kleene Three-Valued Logic in a Pure-Neural Modular Architecture [0.0]
THEIAは2.75Mのモジュラー・ニューラルアーキテクチャで、外部のシンボル推論や手書きのK3ゲートプリミティブを使わずにタスクデータから完全Kleene 3値論理(K3)真理表を学習する。
トランスフォーマーのベースラインは39の規則すべてで99%に到達し、フラットは0.04pp以内のフェーズ1の精度でTheIAと一致している。
論文 参考訳(メタデータ) (2026-04-13T10:44:15Z) - Chain of Simulation: A Dual-Mode Reasoning Framework for Large Language Models with Dynamic Problem Routing [0.0]
Chain of Simulation(CoS)は、動的に問題を特別な推論戦略にルーティングする新しいデュアルモード推論フレームワークである。
CoSは、数学的問題に対する自己整合性を伴う計算フロー、空間的推論のための表現を伴う記号的状態追跡、マルチホップ推論のためのハイブリッド事実抽出という3つの異なる推論モードを採用している。
論文 参考訳(メタデータ) (2026-02-02T21:44:01Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Common 7B Language Models Already Possess Strong Math Capabilities [61.61442513067561]
本稿では,LLaMA-2 7Bモデルと事前学習を併用したモデルが,すでに強力な数学的能力を示していることを示す。
拡張スケーリングの可能性は、公開されている数学の質問の不足によって制限されている。
論文 参考訳(メタデータ) (2024-03-07T18:00:40Z) - Positional Description Matters for Transformers Arithmetic [58.4739272381373]
トランスフォーマーは、大きな能力にもかかわらず、算術的なタスクに干渉することが多い。
位置エンコーディングを直接修正するか、あるいは算術タスクの表現を変更して、標準的な位置エンコーディングを異なる方法で活用することで、問題を解決する方法をいくつか提案する。
論文 参考訳(メタデータ) (2023-11-22T00:31:01Z) - Tactile Grasp Refinement using Deep Reinforcement Learning and Analytic
Grasp Stability Metrics [70.65363356763598]
解析的把握安定性指標が強化学習アルゴリズムの強力な最適化目標であることを示す。
幾何的および力量に依存しないグリップ安定性の指標を組み合わせることで、カブイドの平均成功率は95.4%となることを示す。
第2の実験では,触覚情報を持たないベースラインよりも,接触フィードバックで訓練したグリップリファインメントアルゴリズムが最大6.6%向上することを示した。
論文 参考訳(メタデータ) (2021-09-23T09:20:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。