論文の概要: TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs
- arxiv url: http://arxiv.org/abs/2607.22639v1
- Date: Mon, 22 Jun 2026 23:15:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.999867
- Title: TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs
- Title(参考訳): TRACE:企業LLMにおける知識保存型パラメトリックツール検索のためのビジネスルール付き推論カリキュラム
- Abstract要約: パラメトリック検索は、各APIにユニークな仮想トークンを割り当て、制約されたビームサーチを通じてモデルをトレーニングすることで、ツールを暗黙的に検索することを可能にする。
トレーニング中にパラメトリックツールの知識を破壊し、ビーム検索のデコーディングはリアルタイムデプロイメントには遅すぎる。
本稿では,この解離を解決する2段階のカリキュラムであるTRACE(Tool Retrieval via Augmented Chain-of-thinkt and Enterprise Rule)を紹介する。
- 参考スコア(独自算出の注目度): 1.4680035572775534
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Parametric retrieval enables LLMs to retrieve tools implicitly by assigning each API a unique virtual token and training the model to generate it via constrained beam search. Toolsense shows that this regime has two critical drawbacks: it destroys parametric tool knowledge during training, and its beam-search decoding is too slow for real-time deployment. We introduce TRACE (Tool Retrieval via Augmented Chain-of-thought and Enterprise rules), a two-stage curriculum that resolves this dissociation. Stage 1 reuses the multi-format memorization SFT from ToolSense to seed tool knowledge with LoRA. Stage 2 is our core contribution: the model is trained to emit a thinking trace before producing a JSON list of tool tokens, using two data sources -- RRB pairs from ToolSense and queries synthesized to target business rules curated by domain experts -- both augmented with reasoning traces. This training objective preserves Stage 1 MCQ and QA probing accuracy while enabling single-beam greedy decoding at production latency. Evaluated on a combined enterprise catalog of 8,300+ tools across two enterprise product lines, TRACE training for Stage 2 not only preserves but improves tool understanding: MCQ accuracy gains +3.2 pp and QA probing gains +9 pp over Stage 1. On retrieval, TRACE achieves ~86% recall on Domain A and ~60% on Domain B -- compared to embedding baseline performance of ~27% & ~52% -- both with single-beam greedy decoding, making it directly deployable at production latency.
- Abstract(参考訳): パラメトリック検索は、各APIにユニークな仮想トークンを割り当て、制約されたビームサーチを通じてモデルをトレーニングすることで、ツールを暗黙的に検索することを可能にする。
トレーニング中にパラメトリックツールの知識を破壊し、ビーム検索のデコーディングはリアルタイムデプロイメントには遅すぎる。
本稿では,この解離を解決する2段階のカリキュラムであるTRACE(Tool Retrieval via Augmented Chain-of-thinkt and Enterprise Rule)を紹介する。
ステージ1は、ToolSenseからLoRAのシードツール知識まで、マルチフォーマット記憶SFTを再利用する。
モデルには2つのデータソース -- ToolSenseのRBBペアと、ドメインの専門家がキュレートしたビジネスルールをターゲットとしたクエリ -- を使用して、ツールトークンのJSONリストを生成する前に、思考トレースを出力するようにトレーニングされています。
このトレーニングの目的は、ステージ1のMCQとQAの精度を保ちつつ、運用遅延時にシングルビームのグレディ復号を可能にすることである。
2つのエンタープライズ製品ラインにまたがる8,300以上のツールの組み合わせのエンタープライズカタログで評価されたTRACEトレーニングは、Stage 2のトレーニングを保存するだけでなく、ツールの理解を改善する。
検索において、TRACEはドメインAを86%リコールし、ドメインBを60%リコールする。
関連論文リスト
- Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents [54.050506620820784]
エージェントツールアンラーニング(ATU)は、通常のツール使用を保持しながら、パラメトリックリコールとツールによるリカバリの両方を削減することを目的としている。
ATUは、ツール強化されたエージェントデプロイメント下で、ターゲットの忘れと保持ユーティリティのバランスを向上し、未学習をより堅牢にする。
論文 参考訳(メタデータ) (2026-08-21T18:34:48Z) - Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement [16.192937389387982]
モデル固有の知識境界を動的に探索するオンライン手法であるAKBE(Agentic Knowledge boundary Enhancement)を提案する。
7つのQAベンチマークの実験では、AKBEはタスクの精度を平均で+1.85改善し、標準のエージェントRLよりも18%向上した。
論文 参考訳(メタデータ) (2026-05-26T12:42:23Z) - ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning [91.51460129144654]
我々はParaVTを紹介した。ParaVTは、Parallel Video Tool呼び出しのための、最初のマルチエージェントのエンドツーエンドRLトレーニングフレームワークである。
ParaVTはQwen3-VLベースラインを平均で+7.9%改善し、PARA-GRPOはトレーニングタイムのフォーマット準拠を0.13から0.64に引き上げた。
論文 参考訳(メタデータ) (2026-05-19T18:01:26Z) - SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding [41.98672557723593]
SWEQA-Proは,多種多様な長期リポジトリと実行可能な環境から構築されたベンチマークである。
さらに,2段階のトレーニングレシピであるSupervised Fine-Tuning(SFT)とReinforcement Learning from AI Feedback(RLAIF)という,スケーラブルな合成データパイプラインを提案する。
SWE-QA-ProのGPT-4oを2.3ポイント超え、最先端モデルとのギャップを大幅に狭める。
論文 参考訳(メタデータ) (2026-03-17T05:12:48Z) - Machine Learning as a Tool (MLAT): A Framework for Integrating Statistical ML Models as Callable Tools within LLM Agent Workflows [0.152622865871084]
機械学習・アズ・ア・ツール(MLAT: Machine Learning as a Tool)は、学習前の統計的機械学習モデルを大言語モデル(LLM)エージェント内で呼び出し可能なツールとして公開するデザインパターンである。
ML推論を静的な前処理ステップとして扱う従来のパイプラインとは異なり、MLATでは、モデルをWeb検索、データベースクエリ、APIとともにファーストクラスのツールとして位置付けている。
我々は、発見通話記録をML予測価格でプロの提案に変換するパイロット生産システムであるPitchCraftを紹介する。
論文 参考訳(メタデータ) (2026-02-15T20:00:28Z) - ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration [68.89572566071575]
ETAgentはエージェントのツール使用行動を調整するためのトレーニングフレームワークである。
過誤行動パターンを最適行動に段階的に校正するように設計されている。
論文 参考訳(メタデータ) (2026-01-11T11:05:26Z) - VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use [78.29315418819074]
VerlToolは、体系的な設計原則を通じて制限に対処する統一的でモジュール化されたフレームワークです。
我々のフレームワークはARLTをマルチターントラジェクトリとして定式化し、マルチモード観測トークン(テキスト/画像/ビデオ)を単一ターンRLVRパラダイムを超えて拡張する。
モジュール化されたプラグインアーキテクチャは、軽量Python定義のみを必要とする迅速なツール統合を可能にする。
論文 参考訳(メタデータ) (2025-09-01T01:45:18Z) - RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use [50.52940111891476]
大きな言語モデルは基本的な推論では優れているが、外部ツールとのインタラクションを必要とするタスクには苦労する。
マルチラウンドツール用プラグイン・アンド・プレイ強化学習フレームワークであるRLFactoryを提案する。
論文 参考訳(メタデータ) (2025-08-31T16:47:31Z) - R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning [23.795932850992816]
R1-Code-Interpreterは,マルチターン制御微調整(SFT)と強化学習(RL)によって訓練されたテキストのみの大規模言語モデル(LLM)の拡張である。
144種類の多種多様な推論・計画タスクにまたがる汎用コードインタープリタのトレーニングは,タスクの不均一性や有効サンプルの不足による重大な課題を呈している。
最終モデルであるR1-CI-14Bは、37のテストタスクの平均精度を44.1%から72.4%に改善し、テキストのみのGPT-4o (58.6%) と GPT-4o with Code Interpreter (70.9%) を上回りました。
論文 参考訳(メタデータ) (2025-05-27T18:47:33Z) - ReTool: Reinforcement Learning for Strategic Tool Use in LLMs [27.07998056454784]
ReToolは、ツール統合学習によるロングフォーム推論を強化する。
モデルは400のトレーニングステップで67%の精度を達成する。
注目すべきは、ReTool-32Bが72.5%の精度で設定できることだ。
論文 参考訳(メタデータ) (2025-04-15T18:10:22Z) - TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use [72.32614703504122]
大規模言語モデル(LLM)は、環境と対話するツールを活用することで、目覚ましい進歩を遂げる。
大規模なデータセットに依存する標準教師付き微調整アプローチでは、ツール使用時のタスク固有の特性を見落としていることが多い。
本稿では,最適下トレーニングデータの効果を緩和するタスク機能ベースのフレームワークであるTL-Trainingを提案する。
論文 参考訳(メタデータ) (2024-12-20T02:21:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。