論文の概要: The Missing Primitive: Diagnosing and Repairing Mathematical Reasoning in Large Language Models
- arxiv url: http://arxiv.org/abs/2610.02191v1
- Date: Thu, 01 Oct 2026 17:59:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.369238
- Title: The Missing Primitive: Diagnosing and Repairing Mathematical Reasoning in Large Language Models
- Title(参考訳): ミスプリミティブ:大規模言語モデルにおける数学的推論の診断と修復
- Abstract要約: 大規模言語モデル(LLM)における数学的理解を体系的に研究する第一歩を踏み出す。
本研究では,発見,生成,消化,実行の4つの異なる側面に沿って数学的推論を評価する新しいベンチマークであるhleiを提案する。
次に、学生モデルにプリミティブ誘導推論を選択的に転送するプリミティブプリミティブ自己蒸留フレームワークであるabsを紹介する。
- 参考スコア(独自算出の注目度): 65.00652251189636
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Large Language Models (LLMs) have demonstrated striking capabilities on frontier mathematical problems, it remains unclear whether they possess the structural mathematical understanding underlying their solutions. In this paper, we take a first step toward systematically studying mathematical understanding in LLMs, from diagnosing its distinct capabilities to leveraging these findings to improve post-training. First, we introduce the notion of Mathematical Primitive to probe structural mathematical understanding and propose \hlei{}, a novel benchmark that evaluates mathematical reasoning along four distinct dimensions: Discovery, Generation, Digestion, and Execution. Second, our systematic diagnosis shows that solution accuracy masks distinct capability profiles, primitives unlock substantial latent execution capacity, and Discovery is the dominant bottleneck in mathematical reasoning. Our post-training analysis further shows that discovery-limited failures are particularly amenable to repair. Finally, building on these findings, we introduce \abs{}, a primitive-privileged self-distillation framework that selectively transfers primitive-guided reasoning into the student model. Extensive experiments demonstrate that \abs{} consistently improves mathematical reasoning over baselines across model scales and challenging benchmarks.
- Abstract(参考訳): 大規模言語モデル(LLM)は、フロンティア数学的問題において顕著な能力を示したが、それらがそれらの解の基盤となる構造的数学的理解を持っているかどうかは不明である。
本稿では,LLMの数学的理解を体系的に研究する第一歩として,その特徴を診断することから,これらの知見を活用して学習後の学習を改善することまでについて述べる。
まず、構造的数学的理解を探索するために数学的原始の概念を導入し、発見、生成、消化、実行の4つの異なる次元に沿って数学的推論を評価する新しいベンチマークである \hlei{} を提案する。
第二に、我々の体系的な診断は、解の精度が異なる能力プロファイルをマスクし、プリミティブがかなりの遅延実行能力を解放し、発見が数学的推論における主要なボトルネックであることを示している。
我々のポストトレーニング分析は、発見に制限のある障害が特に修復可能であることをさらに示している。
最後に、これらの知見に基づいて、学生モデルにプリミティブ誘導推論を選択的に転送するプリミティブプリミティブ自己蒸留フレームワークである \abs{} を紹介する。
広範な実験により、 \abs{} はモデルスケールと挑戦的なベンチマークをまたいだ基底線上の数学的推論を一貫して改善することを示した。
関連論文リスト
- From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier [109.93387172162984]
AI4Mathシステムの次の飛躍は、事前に定義された問題解決者から研究エージェントへの決定的なシフトを必要とする。
この分野の体系的なレビューを行い、データセット、自動形式化、証明合成について紹介する。
論文 参考訳(メタデータ) (2026-07-08T17:46:36Z) - Learning to Reason with Insight for Informal Theorem Proving [50.054221663394195]
この研究では、非公式な定理における主要なボトルネックを洞察の欠如として証明する。
我々は,この本質的な推論スキルを育成し,LLMが洞察に富んだ推論を行うことを可能にする新しいフレームワークを提案する。
問題となる数学ベンチマークの実験では、この洞察・認識型生成戦略がベースラインを著しく上回ることを示した。
論文 参考訳(メタデータ) (2026-04-17T17:36:21Z) - Schoenfeld's Anatomy of Mathematical Reasoning by Language Models [56.656180566692946]
我々は、Schoenfeldのエピソード理論を誘導型中間スケールレンズとして採用し、ThinkARM(モデルにおける推論の解剖学)を紹介する。
ThinkARMは、推論トレースを分析、探索、実装、検証などの機能的推論ステップに明示的に抽象化する。
エピソードレベルの表現は推論ステップを明確にし、現代の言語モデルにおける推論がどのように構造化され、安定化され、変更されるかの体系的な分析を可能にする。
論文 参考訳(メタデータ) (2025-12-23T02:44:25Z) - Systematic Diagnosis of Brittle Reasoning in Large Language Models [1.14219428942199]
人工知能における中心的な問題は、機械学習モデルが数学を理解する範囲である。
本稿では,特定の故障点を診断するために,標準ベンチマークを超えて数学的推論を計測する新しい枠組みを提案する。
論文 参考訳(メタデータ) (2025-10-05T21:40:09Z) - Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models [11.250861762443801]
RFMDataset(Reveal Failure Modes)は200種類の数学的証明問題の集合である。
先進モデルの性能を徹底的に評価する。
解析により,現在の大規模推論モデルの基本的制約を示す10種類のきめ細かい誤差型が明らかになった。
論文 参考訳(メタデータ) (2025-06-20T16:14:18Z) - Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models [86.45058529521258]
OlymMATHは、LLMの複雑な推論能力を厳格にテストするために設計された、Olympiadレベルの新しい数学ベンチマークである。
OlymMATHは200の厳密にキュレートされた問題があり、それぞれが手動で検証され、英語と中国語の並行バージョンで利用可能である。
論文 参考訳(メタデータ) (2025-03-27T11:20:17Z) - Large Language Models for Mathematical Analysis [3.7325315394927023]
この研究は、数学的推論における重要なギャップに対処し、信頼できるAIの進歩に寄与する。
DEMI-MathAnalysisデータセットを開発した。
また,LLMの問題解決能力を高めるためのガイドフレームワークも設計した。
論文 参考訳(メタデータ) (2024-12-28T20:37:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。