論文の概要: MLToolBench: Learning Tool-Augmented Agents for Machine Learning Development
- arxiv url: http://arxiv.org/abs/2609.36679v2
- Date: Tue, 06 Oct 2026 06:57:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 12:27:30.82658
- Title: MLToolBench: Learning Tool-Augmented Agents for Machine Learning Development
- Title(参考訳): MLToolBench: 機械学習開発のための学習ツール拡張エージェント
- Abstract要約: データ検査、コード検証、実験診断のための実行可能なツールスイートであるToolMLBenchを紹介します。
SPICEは、特権付きコンテキストがサンプルツールアクションの可能性をいかに変えるかを測定する。
80の合成タスクをトレーニングし、25のドメイン内タスクと10のドメイン外タスクを評価します。
- 参考スコア(独自算出の注目度): 16.30409316099456
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Machine learning engineering (MLE) agents have made substantial progress, but learning through ML experimentation remains costly in time and computation. Synthetic environments reduce these costs while introducing variations in data and experimental settings that require task-specific diagnosis. Access to diagnostic tools alone does not ensure that agents learn when to use them or how to act on their findings. We introduce ToolMLBench, a suite of executable tools for data inspection, code verification, and experiment diagnosis, together with an SFT and RL pipeline for learning their use. Diagnostic calls acquire evidence whose value depends on subsequent decisions, so final outcomes provide limited guidance on which calls to reinforce. We address this challenge with SPICE, which measures how privileged context changes the likelihood of a sampled tool action and uses this difference as a turn-level reward alongside the final outcome. We train on 80 synthetic tasks and evaluate on 25 in-domain and 10 out-of-domain tasks. Providing tool interfaces and descriptions alone yields inconsistent gains across unadapted models. With the same diagnostic interface, our training pipeline raises in-domain success from 24.8% to 52.4% for Qwen3-8B and from 35.6% to 69.2% for Qwen3.5-35B-A3B. The latter also improves from 31% to 48% out-of-domain, supporting learned diagnostic tool use on held-out sources and targets.
- Abstract(参考訳): 機械学習エンジニアリング(MLE)エージェントは大きな進歩を遂げているが、ML実験による学習は時間と計算に費用がかかる。
合成環境は、タスク固有の診断を必要とするデータや実験的な設定のバリエーションを導入しながら、これらのコストを削減します。
診断ツールへのアクセスだけでは、エージェントがいつ使うか、どのようにその発見に対処するかを確実に学ばない。
データ検査、コード検証、実験診断のための実行可能なツールスイートであるToolMLBenchと、それらの使用を学ぶためのSFTおよびRLパイプラインを紹介する。
診断コールは、その後の決定に価値が依存する証拠を取得するため、最終的な結果は、どの呼び出しを補強するかの限定的なガイダンスを提供する。
この課題に対処するSPICEでは、特権付きコンテキストがサンプルツールアクションの可能性をいかに変化させるかを測定し、最終結果とともにターンレベルの報酬として利用する。
80の合成タスクをトレーニングし、25のドメイン内タスクと10のドメイン外タスクを評価します。
ツールインターフェースと記述を提供することだけで、適応しないモデル間で一貫性のない利得が得られる。
また,Qwen3.5-35B-A3Bでは,Qwen3-8Bでは24.8%から52.4%,Qwen3.5-35B-A3Bでは69.2%に向上した。
後者はドメイン外の31%から48%に改善され、ホールドアウトソースやターゲットでの学習診断ツールの使用をサポートする。
関連論文リスト
- Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents [35.967227261886435]
AgentEscapeBenchは、エージェントが明示的な長距離依存性制約の下で新しいツールの使用手順を推論、実行、修正できるかどうかをテストする。
16個のLDMエージェントとヒトの被験者による実験では、依存性の深さが増加するにつれて性能が急激に低下することが示された。
軌道解析は、主に長距離状態追跡、手がかり付着、中間相対伝播における故障をモデル化する。
論文 参考訳(メタデータ) (2026-05-08T15:59:27Z) - Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence? [35.30497528897595]
Agentic-MMEはマルチモーダルエージェント能力のプロセス検証ベンチマークである。
6つのドメインにまたがる418の現実世界タスクと3つの困難レベルを含んでいる。
2,000以上のステップワイズなチェックポイントがあり、1タスクあたり平均10時間以上の手動アノテーションがある。
論文 参考訳(メタデータ) (2026-04-03T13:02:01Z) - AlphaApollo: Orchestrating Foundation Models and Professional Tools into a Self-Evolving System for Deep Agentic Reasoning [110.57865233597762]
自己進化型エージェント推論システムであるAlphaApolloについて述べる。
基礎モデル(FM)における2つのボトルネックに対処することを目的としている。
AlphaApolloは、意図的に検証可能な推論を可能にするために、複数のモデルをプロのツールで編成する。
論文 参考訳(メタデータ) (2025-10-05T15:42:24Z) - InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents [60.89180545430896]
InfoMosaic-Benchは、ツール拡張されたエージェントを探すマルチソース情報に特化した最初のベンチマークである。
汎用検索とドメイン固有のツールを組み合わせるにはエージェントが必要である。
この設計は信頼性と非自明性の両方を保証する。
論文 参考訳(メタデータ) (2025-10-02T17:48:03Z) - Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall [19.839833440257813]
本稿では、継続的に更新された体験プールから、きめ細かなステップワイズ検索を行うステップワイド体験リコールを提案する。
ToolQAベンチマークで評価すると、SEERは難しい質問では6.1%、難しい質問では4.7%の平均的な改善を達成している。
Qwen2.5-7BとQwen2.5-72Bのモデルにより、SEERはそれぞれ7.44%と23.38%の精度向上を示した。
論文 参考訳(メタデータ) (2025-08-21T03:56:38Z) - Tool-Augmented Reward Modeling [58.381678612409]
本稿では,外部環境へのアクセスによるRMの強化により,制約に対処するツール拡張された嗜好モデリング手法であるThemisを提案する。
我々の研究は、外部ツールをRMに統合し、様々な外部ソースとの相互作用を可能にすることを目的としている。
人間の評価では、テミスで訓練されたRLHFはベースラインと比較して平均32%の勝利率を得る。
論文 参考訳(メタデータ) (2023-10-02T09:47:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。