論文の概要: Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning
- arxiv url: http://arxiv.org/abs/2608.28447v1
- Date: Fri, 28 Aug 2026 15:35:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.38321
- Title: Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning
- Title(参考訳): ツールの活用を学ぶ: ツールを組み込んだ数学的推論のための強化学習
- Abstract要約: カウントダウンタスクの数学的推論を改善するための計算機ツールについて検討する。
RLOO, RLOO++, GRPO, DAPOなどのオンライン強化学習手法を適用した。
その結果、計算機ツールの統合はSFTとRLのベースラインを一貫して改善し、pass@kで約10ポイントのゲインが得られることがわかった。
- 参考スコア(独自算出の注目度): 8.739632908951696
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current large language models (LLMs) increasingly benefit from external tool integration, especially for tasks requiring reliable computation and verification. Motivated by this, we study calculator tool calling for improving mathematical reasoning on the Countdown task. We first analyze reasoning failures and find that calculation errors account for a substantial portion of incorrect responses. We then construct supervised fine-tuning datasets to teach the model useful tool-use patterns and how to interpret returned outputs. Building on this tool-formatted policy, we apply several on-policy reinforcement learning methods, including RLOO, RLOO++, GRPO, and DAPO, using automatically verifiable final-answer rewards. To enable a more reliable evaluation, we construct a fresh 1,024-problem held-out Countdown benchmark with no exact overlap with the training data. Our results show that calculator tool integration consistently improves both SFT and RL baselines, yielding roughly 10 percentage-point gains across pass@k. Among the RL methods, Tool-DAPO achieves the strongest performance, improving pass@1 from 35.8% for Tool-SFT to 66.0%. Further analysis shows that RL encourages more effective tool use even when only final-answer rewards are provided. These findings suggest that tool integration reduces arithmetic and verification errors, while RL increases the probability of correct reasoning traces.
- Abstract(参考訳): 現在の大規模言語モデル(LLM)は、特に信頼性の高い計算と検証を必要とするタスクに対して、外部ツール統合の恩恵をますます受けています。
そこで我々は,Countdownタスクの数学的推論を改善するための計算機ツールについて検討した。
まず、推論の失敗を分析し、計算エラーが誤応答のかなりの部分を占めていることを確認する。
次に、教師付き微調整データセットを構築し、モデルに有用なツール使用パターンと返却出力の解釈方法を教える。
このツールフォーマットのポリシーに基づいて, RLOO, RLOO++, GRPO, DAPOなどのオンライン強化学習手法を, 自動検証された最終回答報酬を用いて適用する。
より信頼性の高い評価を実現するため、トレーニングデータと正確に重複しない新しい1,024個のホールドアウトカウントダウンベンチマークを構築した。
その結果,計算機ツールの統合はSFTとRLの両方のベースラインを一貫して改善し,パス@kで約10ポイントのゲインが得られることがわかった。
RLメソッドの中で、Tool-DAPOは最強のパフォーマンスを達成し、Tool-SFTで35.8%のpass@1を66.0%に改善した。
さらなる分析により、RLは最終回答の報酬しか提供されていなくても、より効果的なツールの使用を促進することが示されている。
これらの結果から,ツール統合は算術的および検証的誤りを低減し,RLは正しい推論トレースの確率を高めることが示唆された。
関連論文リスト
- Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning [26.34952204312613]
エージェント強化学習は、内部推論によって解決可能なクエリであっても、モデルが外部ツールを過剰に使用するツールの乱用を引き起こす可能性がある。
本稿では,効率的なエージェントポリシー最適化フレームワークEAPOを提案する。
GRPOと比較して、EAPOは平均パフォーマンスを10.45%、7.27%、9.69%改善し、平均ツールコールを18.33%、18.33%、および24.59%削減した。
論文 参考訳(メタデータ) (2026-06-01T11:58:55Z) - When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning [58.75883713573783]
Tool-Integrated Reasoningは、推論軌道にツール呼び出しと実行を組み込む有望なパラダイムとして登場した。
モデルの推論がツールの結果と矛盾する場合、モデルは自身の推論を信じる傾向にあります。
アダプティブ・ツール・トラスト(ATTC、Adaptive Tool Trust)は、モデルに対して、ツール結果の信頼性や無視を適応的に選択するフレームワークである。
論文 参考訳(メタデータ) (2026-04-09T14:14:37Z) - Tool-R1: Sample-Efficient Reinforcement Learning for Agentic Tool Use [50.02614257515131]
大規模言語モデル(LLM)は、言語理解と推論において強力な能力を示している。
本稿では,LLMの汎用的,構成的,多段階的なツール使用を可能にする強化学習フレームワークであるTool-R1を提案する。
論文 参考訳(メタデータ) (2025-09-16T09:22:21Z) - Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training [121.5858973157225]
本研究では,長期強化学習が多種多様な推論領域にまたがる小言語モデルに及ぼす影響について検討する。
我々は,長期的パフォーマンス向上の鍵となる重要な要素として,制御KL正規化,クリッピング率,定期参照ポリシーリセットを導入する。
私たちのモデルは、数学の+14.7%、コーディングの+13.9%、論理パズルの+54.8%など、強力なベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-07-16T17:59:24Z) - Advancing Tool-Augmented Large Language Models via Meta-Verification and Reflection Learning [63.2198957755528]
本稿では,2つの重要なイノベーションを通じてシステム2推論を包括的に行う新しいツール拡張LDMであるTool-MVRを提案する。
具体的には、まず、API、クエリ、推論トラジェクトリを厳格に検証する体系的なパイプラインであるMulti-Agent Meta-Verification(MAMV)を紹介します。
第2に,ツールフィードバックを活用することで,ツールのリフレクション機能を向上させるExploration-based Reflection Learning (EXPLORE)を提案する。
論文 参考訳(メタデータ) (2025-06-05T04:35:49Z) - Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving [26.413753656936688]
大規模言語モデル(LLM)は、正確で検証可能な計算を必要とする数学的推論タスクに苦慮することが多い。
結果に基づく報酬から強化学習(RL)がテキストベースの推論を強化する一方で、エージェントがコード実行のような外部ツールを活用するために自律的に学習する方法を理解することは依然として重要である。
論文 参考訳(メタデータ) (2025-05-12T17:23:34Z) - Acting Less is Reasoning More! Teaching Model to Act Efficiently [87.28134636548705]
ツール統合推論は、タスクを解決するために外部ツールを呼び出す機能によって、大きな言語モデルを拡張します。
現在のアプローチは、外部ツールの使用効率や必要性を考慮せずに、最終的な正確性のためにのみ最適化されている。
最小限のツールコールで正確な回答をモデルに提示するフレームワークを提案する。
このアプローチでは,ツールコールを最大68.3%削減し,ツールの生産性を最大215.4%向上すると同時に,同等の回答精度を維持している。
論文 参考訳(メタデータ) (2025-04-21T05:40:05Z) - ToolRL: Reward is All Tool Learning Needs [54.16305891389931]
大規模言語モデル(LLM)は、ツールの使用能力を得るために、しばしば監督された微調整(SFT)を行う。
近年の強化学習(RL)の進歩は、有望な推論と一般化能力を示している。
本稿では、RLパラダイムにおけるツール選択とアプリケーションタスクに対する報酬設計に関する最初の総合的研究について述べる。
論文 参考訳(メタデータ) (2025-04-16T21:45:32Z) - ReTool: Reinforcement Learning for Strategic Tool Use in LLMs [27.07998056454784]
ReToolは、ツール統合学習によるロングフォーム推論を強化する。
モデルは400のトレーニングステップで67%の精度を達成する。
注目すべきは、ReTool-32Bが72.5%の精度で設定できることだ。
論文 参考訳(メタデータ) (2025-04-15T18:10:22Z) - ToRL: Scaling Tool-Integrated RL [25.477841726836836]
ToRLは、計算ツールを自律的に使用するために、大規模言語モデルをトレーニングするためのフレームワークである。
ToRLは、モデルがツール使用のための最適な戦略を探索し、発見することを可能にする。
Qwen2.5-Mathモデルによる実験では大きな改善が見られた。
論文 参考訳(メタデータ) (2025-03-30T10:16:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。