論文の概要: Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics
- arxiv url: http://arxiv.org/abs/2607.06820v1
- Date: Tue, 07 Jul 2026 21:29:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.228021
- Title: Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics
- Title(参考訳): SageMath-Augmented LLM Agents for Computational and Experimental Mathematics の評価
- Abstract要約: 本稿では,LLM推論とSageMathからの検証可能なフィードバックを組み合わせたReActスタイルのエージェント構成を提案する。
我々は、RealMathベンチマークから研究レベルの数学的問題を解決するために、このエージェント設定をフロンティアモデル全体で評価する。
- 参考スコア(独自算出の注目度): 1.166361205377345
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in AI for Mathematics have focused largely on autoformalization and theorem proving, leaving the role of Computer Algebra Systems (CAS) in agentic LLM workflows underexplored. We propose a ReAct-style agentic setup that combines LLM reasoning with verifiable feedback from SageMath, together with Context7 for the up-to-date documentation. We evaluate this agentic setup across frontier models for solving research-level mathematical problems from the RealMath benchmark in a setting that emulates a computational-mathematics research loop. We also propose a refinement to the RealMath benchmark by introducing a multi-step post-processing procedure and a multi-stage validation pipeline, both of which improve the quality and reliability of the extracted problem set. Our experiments reveal substantial performance gains from SageMath access across all evaluated models on +9.7~pp on average, the gains range from 1.5~pp to 27.8~pp and narrow the gap between open-weight and closed models. Qwen~3.7-Max benefits from SageMath the most, while GPT-5.5 achieves the highest solve rate of $75.2\%$ and the lowest token usage among tool-enabled configurations. Our findings suggest that CAS-augmented agents represent a promising direction for assisting mathematicians in computational exploration, and we believe that this work is a step towards automated conjecture discovery. The project repository is available online.
- Abstract(参考訳): 数学のためのAIの最近の進歩は、オートフォーマル化と定理証明に重点を置いており、エージェントLLMワークフローにおけるコンピュータ代数システム(CAS)の役割を過小評価している。
我々は,LLM推論とSageMathからの検証可能なフィードバックを組み合わせたReActスタイルのエージェント設定と,最新のドキュメントのContext7を提案する。
計算数学研究ループをエミュレートした設定で、RealMathベンチマークから研究レベルの数学問題を解くために、フロンティアモデルにまたがるエージェント設定を評価した。
また,抽出した問題セットの品質と信頼性を向上する多段階後処理と多段階検証パイプラインを導入することで,RealMathベンチマークの改良も提案する。
実験の結果,+9.7〜ppにおけるSageMathアクセスは平均1.5〜ppから27.8〜ppの範囲で,オープンウェイトモデルとクローズドモデルとのギャップを狭めることができた。
Qwen~3.7-MaxはSageMathの利点が最も大きいが、GPT-5.5は75.2\%の解決率とツール対応構成のトークン使用率が最も低い。
この結果から,CAS増補エージェントは,計算探索において数学者を支援する上で有望な方向を示すことが示唆され,この研究は自動予想発見への一歩であると考えられる。
プロジェクトリポジトリはオンラインで公開されている。
関連論文リスト
- AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction [58.27846292449026]
大規模言語モデルは強力な数学的問題解決能力を示してきたが、その答えを確実に検証することは依然として困難である。
本稿では,具体的な実行から検証モデリングを分離するAMTFV(Agentic Mathematical Tool-Flow Verification)を提案する。
AMTFVをDeepSeek, GPT, Geminiの7つのモデル構成を持つ難解な数学的推論データセットで評価した。
論文 参考訳(メタデータ) (2026-07-31T15:42:00Z) - PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models [31.37252086950609]
PyraMathBenchは7,404の数学語問題から32,505の質問を抽出した総合ベンチマークである。
実験の結果,LLMの性能は数値計算が不十分で,抽象的な数値問題に対する弱い処理によって著しく損なわれていることが明らかとなった。
本稿では,LLMの数値的相乗効果を高めるために,Smart Optimization & Learning-based VErsatile Module (SOLVE)とInteractive Relative Policy Optimization (IRPO)を提案する。
論文 参考訳(メタデータ) (2026-06-02T16:32:53Z) - AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent [80.83250816918861]
o3やDeepSeek-R1のようなLarge Reasoning Models (LRM)は、長いチェーン・オブ・シークレットを持つ自然言語推論において顕著な進歩を遂げている。
しかし、計算的に非効率であり、複雑な数学的操作を必要とする問題を解く際には精度に苦しむ。
本稿では,言語モデルの推論能力とコードインタプリタの計算精度をシームレスに統合するエージェントフレームワークであるAgentMathを紹介する。
論文 参考訳(メタデータ) (2025-12-23T19:57:49Z) - StreetMath: Study of LLMs' Approximation Behaviors [1.4119508208285607]
実世界の近似シナリオ下でのモデルの近似能力を評価するために設計されたベンチマークであるStreetMathを紹介する。
我々の分析によると、LLMは一般に近似を求めるタスクにおいても、正確な値や外部ツールを計算しようと試みている。
我々は、LLMは、人間が街路数学の設定で行うのと同じように、認知的ミスを示さないと論じる。
論文 参考訳(メタデータ) (2025-10-27T05:16:00Z) - Distilling LLM Agent into Small Models with Retrieval and Code Tools [65.73762766854192]
Agent Distillationは、推論能力とタスク解決の振る舞いを大きな言語モデルから小さな言語モデルに移行するためのフレームワークである。
その結果,SLMは0.5B,1.5B,3Bのパラメータで,次世代の1.5B,3B,7Bモデルと競合する性能が得られることがわかった。
論文 参考訳(メタデータ) (2025-05-23T08:20:15Z) - BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search [22.672130194493793]
大規模言語モデル(LLM)は、幅広いタスクやドメインで例外的なパフォーマンスを示している。
彼らは数学の厳密で論理的な性質のため、数学の問題を解くのに依然として困難に直面している。
本稿では,数学的問題解決能力を高めるための新しい手法BEATSを提案する。
論文 参考訳(メタデータ) (2024-09-26T15:47:42Z) - Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On [55.449818944278526]
一般的な7B言語モデル上での教師付き微調整(SFT)であるSkywork-Mathモデルシリーズを紹介する。
Skywork-Math 7Bは競争レベルのMATHベンチマークで51.2%の精度を達成した。
我々は,LLMの数学推論能力を高めるために,研究用と産業用の両方で,いくつかの実践的なテイクアウトを提供する。
論文 参考訳(メタデータ) (2024-07-11T09:56:51Z) - MindStar: Enhancing Math Reasoning in Pre-trained LLMs at Inference Time [51.5039731721706]
MindStarは、大言語モデルの純粋に推論に基づく探索手法である。
推論タスクを探索問題として定式化し、最適な推論経路を特定するための2つの探索アイデアを提案する。
Llama-2-13BやMistral-7Bのようなオープンソースモデルの推論能力を大幅に向上させ、GPT-3.5やGrok-1に匹敵する性能を実現している。
論文 参考訳(メタデータ) (2024-05-25T15:07:33Z) - MATHSENSEI: A Tool-Augmented Large Language Model for Mathematical Reasoning [2.9104279358536647]
数学的推論のためのツール強化された大規模言語モデルであるMathSenseiを提案する。
ツールの補完的な利点として、知識検索(Bing Web Search)、プログラムジェネレータ+エグゼキュータ(Python)、記号方程式ソルバ(Wolfram-Alpha API)について検討する。
論文 参考訳(メタデータ) (2024-02-27T05:50:35Z) - Evaluating LLMs' Mathematical and Coding Competency through Ontology-guided Interventions [47.83142414018448]
算術的推論とコード生成という,2つの一般的な推論タスクに注目します。
i) 数学やコーディング問題に対する摂動の一般的なオントロジー, (ii) 摂動を応用するための半自動手法, (iii) 2つのデータセットを紹介する。
混乱した質問に対して、すべてのモデルで大幅なパフォーマンス低下を示します。
論文 参考訳(メタデータ) (2024-01-17T18:13:07Z) - Modeling Complex Mathematical Reasoning via Large Language Model based
MathAgent [15.81048994298046]
大規模言語モデル (LLM) は複雑な数学的問題を解く上で困難に直面している。
本稿では, エージェントベースのゼロショットフレームワークを用いて, LLMの数学的解法を公式に記述し, 拡張する。
miniF2FとMATHの実験では、PreRとMathAgentsの有効性が実証されている。
論文 参考訳(メタデータ) (2023-12-14T13:33:50Z) - WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct [130.37945867605302]
本稿では,大規模言語モデル(LLM)の数学的CoT推論能力を向上させるWizardMathを提案する。
注目すべきは、WizardMath-Mistral 7BがトップクラスのオープンソースLLMをはるかに上回り、データ効率が向上したことだ。
予備的な調査では、卓越した数学性能を達成する上で、命令の進化とプロセスの監督が重要な役割を担っていることを強調した。
論文 参考訳(メタデータ) (2023-08-18T14:23:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。