論文の概要: One Policy Is Enough: Single-Agent Reinforcement Learning Outperforms Tree Search for Chemistry Tool Learning
- arxiv url: http://arxiv.org/abs/2608.30952v1
- Date: Mon, 31 Aug 2026 15:22:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.477799
- Title: One Policy Is Enough: Single-Agent Reinforcement Learning Outperforms Tree Search for Chemistry Tool Learning
- Title(参考訳): 一つの政策が十分である: 単エージェント強化学習は、化学ツール学習のための木探索に優れる
- Abstract要約: CheMatAgentは、2人の学者によるツールコールツリーを検索する。
我々のモデルは、左右の世代で推論、ツールコール、リターンをインターリーブし、教師付きウォームアップと結果レベルの強化学習によって訓練する。
ChemToolBench多ツール化学では、両バックボーンのCheMatAgentを用いてツールF1を5.5%改善し、Qwen-2.5-7Bでは9.6%改善し、Llama-3.1-8Bでは3.7%と3.9%改善した。
- 参考スコア(独自算出の注目度): 24.13351033268791
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chemistry questions often demand exact computation and database lookups that a language model cannot supply from its parameters, so it must reach for external tools. Tool use here is a three-part problem: select the right tool from a large pool, fill it with correctly typed arguments, and chain calls so that each consumes the outputs of the last. CheMatAgent, a previously published system, addresses this with hierarchical evolutionary MCTS: separate policy and execution models searching tool-call trees under two learned critics, one regressed partly onto GPT-assigned scores. We show that a single policy suffices. Our model interleaves reasoning, tool calls, and returns in one left-to-right generation, trained by a supervised warm-up and then outcome-level reinforcement learning against a programmatic reward read directly off the gold call chain, which leaves no learned critic and no judge in the training loop. On ChemToolBench multiple-tool comprehensive chemistry, on both backbones CheMatAgent use, we improve Tool F1 by 5.5% and Return F1 by 9.6% on Qwen-2.5-7B, and by 3.7% and 3.9% on Llama-3.1-8B, compared with their strongest search configuration, at one model invocation per question, against a search whose cost grows with the tree; we also lead answer Pass Rate on Qwen-2.5-7B.
- Abstract(参考訳): 化学の問題は、しばしば、言語モデルがそのパラメータから供給できない正確な計算とデータベースのルックアップを要求するため、外部ツールに到達する必要がある。
ここでのツールの使用は、大きなプールから適切なツールを選択し、正しく型付けされた引数でそれを埋め、各ツールが最後に出力を消費するようにチェーンコールする、という3つの問題である。
前述したCheMatAgentは、階層的な進化的MCTS(英語版)でこの問題に対処している。
一つの政策が十分であることを示す。
我々のモデルは、指導されたウォームアップによって訓練された1つの左右世代の推論、ツールコール、返却をインターリーブし、その後、ゴールドコールチェーンから直接読み取ったプログラムレベルの報酬に対して結果レベルの強化学習を行い、学習した批評家は残らず、トレーニングループに審査員は残らない。
ChemToolBench 多重ツール化学では、両バックボーンの CheMatAgent では、ツール F1 を5.5%改善し、ツール F1 を9.6%改善し、Qwen-2.5-7B では3.7%と3.9%改善した。
関連論文リスト
- Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents [24.448485225924106]
CoEvoKGは知識グラフを、検証可能なトレーニングタスクのソースと、エージェント進化のための永続的なエビデンスメモリに変換する。
検索が成功すると、CoEvoKGは検索した証拠を検証し、復号し、対応するグラフノードとエッジに書き戻す。
論文 参考訳(メタデータ) (2026-08-03T08:39:16Z) - AIR: Adaptive Interleaved Reasoning with Code in MLLMs [26.910280225921934]
マルチモーダル言語モデル(MLLM)を強化するためのコードとのインターリーブ推論は、重要な研究フロンティアとなっている。
本稿では、コード強化複素数値タスクにおける強化学習訓練により、適応的インターリーブ推論機能を有するMLLMを増強する。
実験により,グループ制約付き報酬関数を用いた強化学習の学習後,評価ベンチマークにおいて平均6.1ポイント(pp)の性能向上が示された。
論文 参考訳(メタデータ) (2026-06-22T17:58:54Z) - Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents [0.8714519393367773]
符号化エージェントは、次のステップで各観察のごく一部だけであっても、長いツール観察を繰り返し消費する。
タスク条件付きツールアウトプットプルーニングについて検討する: 集中クエリと1つのツールアウトプットが与えられたら、エージェントが次に検査すべき最小の動詞のエビデンスを返します。
論文 参考訳(メタデータ) (2026-04-04T18:52:44Z) - AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning [79.65732142949014]
エージェント強化学習は、長いチェーン・オブ・シークレット・トラジェクトリを通して推論するために進歩した大規模言語モデル(LLM)である。
既存のアプローチでは、LLMエージェントの適応性を新しいツールセットや進化するツールセットに制限する、固定されたツールの在庫を前提としている。
本稿では, LLMエージェントに動的ツール選択機能を持たせるためのフレームワークであるAutoToolについて述べる。
論文 参考訳(メタデータ) (2025-12-15T12:38:04Z) - One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning [54.580646706013965]
リワードモデル(RM)は、大きな言語モデルと人間の嗜好の整合において重要な役割を果たす。
一般的なツール使用シナリオに適した軽量な生成型RMのファミリーであるToolRMを紹介する。
これらのモデルを構築するために,ルールベースのスコアリングと多次元サンプリングを用いたペアワイズ選好データを構築するパイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-30T06:08:27Z) - An Auditable Agent Platform For Automated Molecular Optimisation [0.0]
薬物発見は、データ、専門知識、ツールが散在すると、しばしば勢いを失う。
このループを短くするため、分子最適化を自動化するエージェントフレームワークを使用した階層的なツールを構築しました。
論文 参考訳(メタデータ) (2025-08-05T13:41:32Z) - Acting Less is Reasoning More! Teaching Model to Act Efficiently [87.28134636548705]
ツール統合推論は、タスクを解決するために外部ツールを呼び出す機能によって、大きな言語モデルを拡張します。
現在のアプローチは、外部ツールの使用効率や必要性を考慮せずに、最終的な正確性のためにのみ最適化されている。
最小限のツールコールで正確な回答をモデルに提示するフレームワークを提案する。
このアプローチでは,ツールコールを最大68.3%削減し,ツールの生産性を最大215.4%向上すると同時に,同等の回答精度を維持している。
論文 参考訳(メタデータ) (2025-04-21T05:40:05Z) - MALT: Improving Reasoning with Multi-Agent LLM Training [67.76186488361685]
MALT(Multi-Agent LLM Training)は、推論プロセスを生成、検証、改善ステップに分割する、新しいポストトレーニング戦略である。
MATH、GSM8K、CSQAでは、MALTは、それぞれ15.66%、7.42%、9.40%の相対的な改善で同じベースラインLLMを上回っている。
論文 参考訳(メタデータ) (2024-12-02T19:30:36Z) - Tool-Augmented Reward Modeling [58.381678612409]
本稿では,外部環境へのアクセスによるRMの強化により,制約に対処するツール拡張された嗜好モデリング手法であるThemisを提案する。
我々の研究は、外部ツールをRMに統合し、様々な外部ソースとの相互作用を可能にすることを目的としている。
人間の評価では、テミスで訓練されたRLHFはベースラインと比較して平均32%の勝利率を得る。
論文 参考訳(メタデータ) (2023-10-02T09:47:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。