論文の概要: From Euler to Today: Universal Mathematical Fallibility A Large-Scale Computational Analysis of Errors in ArXiv Papers
- arxiv url: http://arxiv.org/abs/2511.10543v1
- Date: Fri, 14 Nov 2025 01:56:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-14 22:53:22.918539
- Title: From Euler to Today: Universal Mathematical Fallibility A Large-Scale Computational Analysis of Errors in ArXiv Papers
- Title(参考訳): Euler から今日へ : ArXiv 論文における誤りの大規模計算解析
- Authors: Igor Rivin,
- Abstract要約: 本稿では,ArXivレポジトリによる数学論文の大規模解析結果について述べる。
自動解析システムでは、複数の数学カテゴリにまたがって37,000以上の論文を処理し、エラー率と品質分布を明らかにした。
数値解析 (math.NA) では, 誤差率9.6% (23,761論文で2,271件) , 幾何トポロジー (math.GT) では6.5% (13,209論文で862件) であった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present the results of a large-scale computational analysis of mathematical papers from the ArXiv repository, demonstrating a comprehensive system that not only detects mathematical errors but provides complete referee reports with journal tier recommendations. Our automated analysis system processed over 37,000 papers across multiple mathematical categories, revealing significant error rates and quality distributions. Remarkably, the system identified errors in papers spanning three centuries of mathematics, including works by Leonhard Euler (1707-1783) and Peter Gustav Lejeune Dirichlet (1805-1859), as well as contemporary Fields medalists. In Numerical Analysis (math.NA), we observed an error rate of 9.6\% (2,271 errors in 23,761 papers), while Geometric Topology (math.GT) showed 6.5\% (862 errors in 13,209 papers). Strikingly, Category Theory (math.CT) showed 0\% errors in 93 papers analyzed, with evidence suggesting these results are ``easier'' for automated analysis. Beyond error detection, the system evaluated papers for journal suitability, recommending 0.4\% for top generalist journals, 15.5\% for top field-specific journals, and categorizing the remainder across specialist venues. These findings demonstrate both the universality of mathematical error across all eras and the feasibility of automated comprehensive mathematical peer review at scale. This work demonstrates that the methodology, while applied here to mathematics, is discipline-agnostic and could be readily extended to physics, computer science, and other fields represented in the ArXiv repository.
- Abstract(参考訳): 本稿では,ArXivレポジトリから数学論文を大規模に解析し,数学的誤りを検知するだけでなく,ジャーナル層レコメンデーションの完全なレファレンスレポートを提供する包括的システムを示す。
自動解析システムでは、複数の数学カテゴリにまたがって37,000以上の論文を処理し、エラー率と品質分布を明らかにした。
注目すべきことに、このシステムは、レオナルド・オイラー(1707-1783年)やピーター・グスタフ・レジューヌ・ディリクレ(1805-1859年)、および当時のフィールズ・メダリストなど、数学の3世紀にわたる論文の誤りを特定した。
数値解析 (math.NA) では, 23,761論文で9.6\% (2,271エラー), Geometric Topology (math.GT) では6.5\% (13,209論文で862エラー) であった。
興味深いことに、カテゴリー理論 (math.CT) は93の論文で0\%の誤差を示し、これらの結果が自動解析の「'easier''」であることを示す証拠がある。
エラー検出以外にも、このシステムはジャーナルの適合性に関する論文を評価し、トップジェネリスト誌に0.4\%、トップフィールド専門誌に15.5\%を推奨し、残りの論文を専門の会場に分類した。
これらの結果は、あらゆる時代の数学的誤りの普遍性と、大規模に自動化された包括的数学的ピアレビューの実現可能性の両方を示している。
この研究は、この方法論が数学に応用されているものの、規律に依存せず、すぐに物理学、計算機科学、そしてArXivリポジトリに表される他の分野に拡張できることを示した。
関連論文リスト
- From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics [79.81905350372067]
我々は文脈的数学的推論を通してギャップを研究する。
AIMEとMATH-500の問題を2つのコンテキスト設定に再利用するベンチマークであるContextMATHを紹介する。
オープンソースモデルはSGとCSで13、34ポイント減少し、プロプライエタリモデルは13、20ポイント減少している。
論文 参考訳(メタデータ) (2026-01-30T14:56:04Z) - MSC-180: A Benchmark for Automated Formal Theorem Proving from Mathematical Subject Classification [21.9173105378467]
現在の大言語モデル(LLM)に基づく定理証明は、制限された領域カバレッジや数学的推論の弱い一般化といった制限に悩まされている。
我々は,MSC 2020の数学的対象分類に基づく評価ベンチマークであるMSC-180を提案する。
180の形式的検証問題、60の数学分野から3つの先進的な問題が含まれており、学部から大学院まで多岐にわたる。
論文 参考訳(メタデータ) (2025-12-20T07:39:19Z) - An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems [48.10132234701036]
我々は,LLMの数学的推論的ロバスト性を評価するための体系的枠組みを導入する。
我々は、数学的に等価だが言語的およびパラメトリックなバリエーションを持つ高度な数学問題に対して、それらをストレステストする。
この新たな評価手法を用いて,新しいベンチマークデータセットであるPatnamGAPを開発した。
論文 参考訳(メタデータ) (2025-08-12T10:40:33Z) - DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning [95.31714779585272]
DeepMath-103Kは、高い難易度(主に5-9レベル)で設計された大規模な数学的データセットである
これには、多数のベンチマークに対する厳格な除染、ルールベースのRL報酬に対する検証可能な回答が含まれる。
DeepMath-103Kは一般化可能な推論の進展を促進する。
論文 参考訳(メタデータ) (2025-04-15T17:59:51Z) - MathAgent: Leveraging a Mixture-of-Math-Agent Framework for Real-World Multimodal Mathematical Error Detection [53.325457460187046]
これらの課題に対処するために設計された新しいMixture-of-Math-AgentフレームワークであるMathAgentを紹介する。
MathAgentはエラー検出を3つのフェーズに分解し、それぞれが特別なエージェントによって処理される。
実世界の教育データに基づいてMathAgentを評価し,誤差ステップ同定の精度を約5%向上した。
論文 参考訳(メタデータ) (2025-03-23T16:25:08Z) - UTMath: Math Evaluation with Unit Test via Reasoning-to-Coding Thoughts [7.856746367263317]
本稿では,大規模言語モデルの評価を目的とした頑健な評価フレームワークであるUTMath Benchmarkを紹介する。
これは9つの数学領域にまたがる1053個の最先端問題を含み、平均68個のテストケースがある。
最高の性能モデルであるo1-miniはわずか32.57%の問題を解き、o1-previewは27.16%、GPT-4oは26.93%であった。
論文 参考訳(メタデータ) (2024-11-11T18:59:02Z) - FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI [8.32177898148028]
FrontierMath(フロンティアマス、フロンティアマス、FrontierMath)は、数学者が考案し検証した何百もの数学問題のベンチマークである。
現在の最先端のAIモデルは、問題の2%未満を解決し、AI能力と数学的コミュニティの長所との間に大きなギャップが浮かび上がっている。
AIシステムが専門家レベルの数学的能力に向かって進むにつれ、FrontierMathは彼らの進歩を定量化する厳格なテストベッドを提供する。
論文 参考訳(メタデータ) (2024-11-07T17:07:35Z) - HARDMath: A Benchmark Dataset for Challenging Problems in Applied Mathematics [1.5716764919736026]
本稿では,解析的近似技術を必要とする応用数学問題に挑戦するデータセットであるHARDMathを紹介する。
本フレームワークは,数値基底真理に対して検証された解を用いて,多数の問題を自動生成する。
HARDMath-miniは,366問題からなるサブサンプルテストセットであり,応用科学の文脈で定式化された40の単語問題に対して,オープンソースLLMとクローズドソースLLMの両方を評価する。
論文 参考訳(メタデータ) (2024-10-13T20:09:41Z) - Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models [63.31878920079154]
Olympiadレベルでの大規模言語モデルの数学的推論を評価するためのベンチマークを提案する。
既存のOlympiad関連のベンチマークとは違って、我々のデータセットは数学に特化しており、厳密な人間のアノテーションを使った4428の競合レベルの問題の膨大なコレクションを含んでいる。
実験の結果,最も先進的なモデルであるOpenAI o1-miniとOpenAI o1-previewでさえ,60.54%と52.55%の精度で,オリンピアードレベルの問題に悩まされ,オリンピアードレベルの数学的推論において重大な課題が浮き彫りにされていることがわかった。
論文 参考訳(メタデータ) (2024-10-10T14:39:33Z) - Self-Supervised Pretraining of Graph Neural Network for the Retrieval of
Related Mathematical Expressions in Scientific Articles [8.942112181408156]
本稿では,機械学習に基づく数学的表現の検索手法を提案する。
埋め込み学習と自己教師型学習を組み合わせた教師なし表現学習タスクを設計する。
arXiv.orgで発行された90,000以上の出版物から、9900万以上の数学的表現を持つ巨大なデータセットを収集します。
論文 参考訳(メタデータ) (2022-08-22T12:11:30Z) - Theoretical Insights Into Multiclass Classification: A High-dimensional
Asymptotic View [82.80085730891126]
線形多クラス分類の最初の現代的精度解析を行う。
分析の結果,分類精度は分布に依存していることがわかった。
得られた洞察は、他の分類アルゴリズムの正確な理解の道を開くかもしれない。
論文 参考訳(メタデータ) (2020-11-16T05:17:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。