論文の概要: AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction
- arxiv url: http://arxiv.org/abs/2607.29549v1
- Date: Fri, 31 Jul 2026 15:42:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.784545
- Title: AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction
- Title(参考訳): AMTFV: LLM自己補正のためのエージェント数学的ツールフロー検証
- Abstract要約: 大規模言語モデルは強力な数学的問題解決能力を示してきたが、その答えを確実に検証することは依然として困難である。
本稿では,具体的な実行から検証モデリングを分離するAMTFV(Agentic Mathematical Tool-Flow Verification)を提案する。
AMTFVをDeepSeek, GPT, Geminiの7つのモデル構成を持つ難解な数学的推論データセットで評価した。
- 参考スコア(独自算出の注目度): 58.27846292449026
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models have demonstrated strong mathematical problem-solving capabilities, yet reliably verifying their candidate answers remains challenging. Existing representative methods mainly revise outputs through natural-language reflection or assist verification by directly generating verification programs; the former may not reliably support exact computation, whereas the latter prematurely couples mathematical modeling with low-level implementation. We propose AMTFV (Agentic Mathematical Tool-Flow Verification). By introducing Mathematical Tool Flow (MTF) as an interrupt--execute--resume interface, AMTFV decouples verification modeling from concrete execution and supports exact computation through a mathematical toolbox. Specifically, the verification agent first constructs a verification workflow, encodes the mathematical objects and computational intent requiring reliable execution in an MTF request, and sends it to the mathematical toolbox agent. The latter parses the request, generates executable calls, and dispatches them to the backend for exact computation. Tool outputs then support candidate-answer adjudication, answer revision, and verification-workflow revision. We evaluate AMTFV on five challenging mathematical reasoning datasets with seven model configurations from DeepSeek, GPT, and Gemini. Experimental results show that AMTFV outperforms the representative baselines evaluated in this study overall; under an individual model configuration, it improves average accuracy over the strongest baseline by up to 8.3 percentage points, with larger gains on samples of medium and high verification complexity.
- Abstract(参考訳): 大規模言語モデルは強力な数学的問題解決能力を示してきたが、その答えを確実に検証することは依然として困難である。
既存の代表的手法は、主に自然言語のリフレクションや、検証プログラムを直接生成することで出力を補正するが、前者は正確な計算を確実にサポートしていない。
本稿では,AMTFV (Agentic Mathematical Tool-Flow Verification)を提案する。
数学ツールフロー(MTF)を割り込み-実行-再帰インターフェースとして導入することにより、AMTFVは具体的な実行から検証モデリングを分離し、数学的ツールボックスによる正確な計算をサポートする。
具体的には、検証エージェントは、まず検証ワークフローを構築し、MSF要求で信頼性の高い実行を必要とする数学的対象と計算意図を符号化し、数学的ツールボックスエージェントに送信する。
後者はリクエストを解析し、実行可能呼び出しを生成し、それらをバックエンドにディスパッチして正確な計算を行う。
ツール出力は、候補-回答の判断、回答の修正、検証-ワークフローの修正をサポートする。
AMTFVをDeepSeek, GPT, Geminiの7つのモデル構成を持つ難解な数学的推論データセットで評価した。
実験結果から,AMTFVは個々のモデル構成で最強基準値の平均精度を最大8.3ポイント向上し,中規模および高い検証複雑性のサンプルよりも高い精度で向上することがわかった。
関連論文リスト
- ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning [110.46431027868954]
ThinkBoosterは、大規模言語モデル(LLM)推論のシームレスなテスト時間計算スケーリングのためのフレームワークである。
最新のTTCスケーリング戦略とスコアファミリを実装するモジュール型のPythonライブラリで構成されている。
デプロイ可能なOpenAI互換プロキシサービスにより、現実のアプリケーションへの適応推論のドロップイン統合が可能になる。
論文 参考訳(メタデータ) (2026-06-05T05:28:46Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent [80.83250816918861]
o3やDeepSeek-R1のようなLarge Reasoning Models (LRM)は、長いチェーン・オブ・シークレットを持つ自然言語推論において顕著な進歩を遂げている。
しかし、計算的に非効率であり、複雑な数学的操作を必要とする問題を解く際には精度に苦しむ。
本稿では,言語モデルの推論能力とコードインタプリタの計算精度をシームレスに統合するエージェントフレームワークであるAgentMathを紹介する。
論文 参考訳(メタデータ) (2025-12-23T19:57:49Z) - CoSineVerifier: Tool-Augmented Answer Verification for Computation-Oriented Scientific Questions [32.14674040685995]
本稿では,外部ルーリックを利用して正確な計算と記号の単純化を行うツール拡張検証器モデルを提案する。
STEM科目、一般QA、長文推論タスクで行った実験は、モデルの強力な一般化を示している。
論文 参考訳(メタデータ) (2025-12-01T03:08:43Z) - Pessimistic Verification for Open Ended Math Questions [6.715841196629822]
検証性能の重要な制限は、エラー検出の能力にある。
悲観的検証では、同じ証明に対して複数の並列検証を構築し、その1つが誤りを報告した場合、証明は誤りとみなされる。
この単純な手法は、かなりの計算資源を得ることなく、多くの数学検証ベンチマークで性能を著しく向上させる。
論文 参考訳(メタデータ) (2025-11-26T15:52:52Z) - On Generalization in Agentic Tool Calling: CoreThink Agentic Reasoner and MAVEN Dataset [16.921428284844684]
エージェントツールコール環境間の一般化は、信頼できる推論システムを開発する上で重要な未解決課題である。
本稿では、構造化分解と適応ツールオーケストレーションのための軽量なシンボリック推論層を用いて、大規模言語モデルを強化するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-27T00:58:48Z) - Agentic Predictor: Performance Prediction for Agentic Workflows via Multi-View Encoding [56.565200973244146]
Agentic Predictorは、効率的なエージェントワークフロー評価のための軽量な予測器である。
Agentic Predictorはタスク成功率の近似を学ぶことで、最適なエージェントワークフロー構成の迅速かつ正確な選択を可能にする。
論文 参考訳(メタデータ) (2025-05-26T09:46:50Z) - T1: Tool-integrated Self-verification for Test-time Compute Scaling in Small Language Models [9.674458633565111]
テスト時間スケーリングにおいて,小言語モデル(sLM)がアウトプットを確実に自己検証できるかどうかを検討する。
本稿では,コードインタプリタなどの外部ツールに多量の検証ステップを委譲するツール統合自己検証(T1)を提案する。
理論解析により,ツール統合は記憶の要求を減らし,テストタイムのスケーリング性能を向上することが示された。
論文 参考訳(メタデータ) (2025-04-07T04:01:17Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers [36.1723136776532]
マルチエージェント検証(Multi-Agent Verification、MAV)は、複数の検証器を組み合わせて性能を向上させるテスト時間計算パラダイムである。
我々は,n個のベスト・オブ・nサンプリングと複数の検証器を組み合わせた,単純なマルチエージェント検証アルゴリズムであるBoN-MAVを紹介する。
この結果から,テスト時の言語モデルの性能向上に期待できる新たな次元として,検証者の数を拡大することが確認できた。
論文 参考訳(メタデータ) (2025-02-27T18:53:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。