論文の概要: Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents
- arxiv url: http://arxiv.org/abs/2601.20144v2
- Date: Fri, 30 Jan 2026 18:44:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-02 14:22:45.228518
- Title: Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents
- Title(参考訳): Trajectory2Task: 複雑なユーザインテントのための合成検証可能なデータによるロバストなツールカートリングエージェントのトレーニング
- Abstract要約: Trajectory2Taskは,3つの現実的なユーザシナリオの下で大規模なツール使用を研究するための,検証可能なデータ生成パイプラインである。
有効なツールコールトラジェクトリを、制御されたインテント適応を伴うユーザ向けタスクに変換する。
我々は、生成された複雑なユーザシナリオタスクに対して、7つの最先端のLCMをベンチマークし、頻繁な障害を観察する。
- 参考スコア(独自算出の注目度): 52.30603055218294
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Tool-calling agents are increasingly deployed in real-world customer-facing workflows. Yet most studies on tool-calling agents focus on idealized settings with general, fixed, and well-specified tasks. In real-world applications, user requests are often (1) ambiguous, (2) changing over time, or (3) infeasible due to policy constraints, and training and evaluation data that cover these diverse, complex interaction patterns remain under-represented. To bridge the gap, we present Trajectory2Task, a verifiable data generation pipeline for studying tool use at scale under three realistic user scenarios: ambiguous intent, changing intent, and infeasible intents. The pipeline first conducts multi-turn exploration to produce valid tool-call trajectories. It then converts these trajectories into user-facing tasks with controlled intent adaptations. This process yields verifiable task that support closed-loop evaluation and training. We benchmark seven state-of-the-art LLMs on the generated complex user scenario tasks and observe frequent failures. Finally, using successful trajectories obtained from task rollouts, we fine-tune lightweight LLMs and find consistent improvements across all three conditions, along with better generalization to unseen tool-use domains, indicating stronger general tool-calling ability.
- Abstract(参考訳): ツール呼び出しエージェントは、現実の顧客向けワークフローにますますデプロイされる。
しかし、ツールコールエージェントに関するほとんどの研究は、一般的な、固定された、そして明確に定義されたタスクによる理想的な設定に焦点を当てている。
現実世界のアプリケーションでは、ユーザ要求は(1)あいまい、(2)時間とともに変化する、(3)ポリシーの制約により実現不可能、そして、これらの多様な複雑な相互作用パターンをカバーするトレーニングと評価データが、まだ不足している。
ギャップを埋めるために、私たちはTrajectory2Taskを紹介します。Trajectory2Taskは、3つの現実的なユーザシナリオ(曖昧な意図、変更の意図、実現不可能な意図)の下で、ツールの使用を大規模に研究するための検証可能なデータ生成パイプラインです。
パイプラインはまず、有効なツールコールトラジェクトリを生成するために、マルチターン探索を行う。
そして、これらのトラジェクトリを、制御された意図適応を伴うユーザ向けタスクに変換する。
このプロセスは、クローズドループの評価とトレーニングをサポートする検証可能なタスクをもたらす。
我々は、生成された複雑なユーザシナリオタスクに対して、7つの最先端のLCMをベンチマークし、頻繁な障害を観察する。
最後に,タスクロールアウトから得られた軌道を用いて,軽量LCMを微調整し,これら3つの条件に一貫した改善点を見出した。
関連論文リスト
- AgentBrew: Offline Tool-Use Agent Learning from Raw Real-World Trajectories [36.7302669545557]
現実世界のアプリケーションは、事前に定義されたタスクや検証、忠実なシミュレーター、大規模環境相互作用のための限られた予算を提供する。
オフラインのトレーニングフレームワークである textbfAgentBrew を提案する。
AgentBrew は Qwen3-32B を +8.7 Acc / +9.7 Score で改善し、Qwen3-235B (+2.3 / +4.4) を上回り、拒絶サンプリングより優れている。
論文 参考訳(メタデータ) (2026-09-05T03:04:23Z) - Knowledge Reutilization in Meta-Reinforcement Learning [51.07319647819108]
本稿では,動的に単純化されたエージェント上でタスクレベルの知識を学習し,それを異種エージェントに転送するメタ知識再利用フレームワークを提案する。
我々のフレームワークは、最新の最先端ベースラインと比較して、最終段階のトラッキングエラーを94.75% -- 99.79%削減している。
論文 参考訳(メタデータ) (2026-06-16T16:32:28Z) - Task Editing for Generalizable 3D Visuomotor Policy Learning [50.590696755853365]
3Dビジュモータポリシーは、深度マップと点雲が空間的推論のための豊富な幾何学的情報を提供するため、複雑なロボット操作に有望な方向を提供する。
既存の手法では、人間中心のデモにオブジェクト中心の変換を適用することで、データ効率を改善するためにデモ生成戦略が一般的である。
本稿では,タスク中心の編集の観点から多様な軌道を生成する新しいデモ生成フレームワークであるTask-Editを提案する。
論文 参考訳(メタデータ) (2026-06-05T07:54:49Z) - Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards [76.49428173793386]
LLMは、中間出力を伝搬しながら、正しい順序で複数の依存APIを呼び出す必要がある。
既存の環境は、シミュレーションデータを使った単純なターン毎の関数呼び出しとバイナリ報酬に重点を置いている。
まず、実APIレスポンスの大規模キャッシュを背景とした強化学習環境を構築し、有効なマルチステップオーケストレーショントレースをサンプリングするデータ合成パイプラインを実現する。
第二に、正当性を原子の妥当性とオーケストレーションに分解する、段階的な報酬設計を提案する。
論文 参考訳(メタデータ) (2026-03-25T18:31:39Z) - HATS: Hardness-Aware Trajectory Synthesis for GUI Agents [46.54830370011904]
本稿では,ハードネスを意識した軌道合成フレームワークHATSを提案する。
我々は、硬さをアクションに関連する意味的あいまいさの度合いとして定義する。
HATSでトレーニングされたエージェントは、ベンチマークGUI環境における最先端のベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-03-12T16:40:59Z) - Benchmarking LLM Tool-Use in the Wild [10.664145474355445]
実際のユーザインタラクションは本質的にワイルドで、複雑で、乱雑で、柔軟です。
我々は,ツールコールトポロジの効率的なオーケストレーションを必要とする構成タスク,対話のターンに広がる暗黙の意図,命令遷移という,ユーザの行動から3つの重要な課題を識別する。
WildToolBenchは,実世界のユーザ行動パターンをベースとしたLLMツール使用ベンチマークである。
論文 参考訳(メタデータ) (2026-02-13T08:55:46Z) - From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents [23.583947864141162]
EigenDataは階層的なマルチエージェントエンジンで、ツール基底の対話と実行可能なインスタンスごとのチェッカーを合成する。
合成データに基づいて、まずユーザモデルを微調整し、GRPOスタイルのトレーニングを適用するRLレシピを開発する。
以上の結果から,高価なアノテーションを使わずに,複雑なツールの動作をブートストラップするためのスケーラブルな経路が示唆された。
論文 参考訳(メタデータ) (2026-01-30T06:01:23Z) - Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards [13.784988950752195]
既存のオープンソースエージェントトレーニングデータはタスクの多様性が狭く、容易に解決できる。
現実世界のAPIには多様性がなく、大規模な強化学習のロールアウトプロセスでは不安定である。
多様なツール使用トレーニングデータを共同で合成し,完全な環境をシミュレートするフレームワークであるSynTHAGENTで,これらの課題に対処する。
論文 参考訳(メタデータ) (2026-01-30T03:43:42Z) - ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration [68.89572566071575]
ETAgentはエージェントのツール使用行動を調整するためのトレーニングフレームワークである。
過誤行動パターンを最適行動に段階的に校正するように設計されている。
論文 参考訳(メタデータ) (2026-01-11T11:05:26Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use [74.47746287181383]
大規模言語モデル(LLM)ベースのエージェントは、現実のタスクを完了するためのツールの使用にますます依存している。
LLMのツール使用能力を総合的に評価するためのトラジェクトリ対応ベンチマークであるTRAJECT-Benchを紹介する。
論文 参考訳(メタデータ) (2025-10-06T07:30:25Z) - ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks [64.86209459039313]
ThinkGeoは、構造化ツールの使用とマルチステップ計画を通じて、リモートセンシングタスクにおけるツール拡張エージェントを評価するために設計されたエージェントベンチマークである。
我々はReActスタイルの対話ループを実装し,486 個の構造化エージェントタスク上でのオープンソース LLM とクローズドソース LLM の両方を1,773 個の専門家が検証した推論ステップで評価する。
分析の結果、ツールの精度とモデル間の計画整合性に顕著な相違が明らかになった。
論文 参考訳(メタデータ) (2025-05-29T17:59:38Z) - TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use [72.32614703504122]
大規模言語モデル(LLM)は、環境と対話するツールを活用することで、目覚ましい進歩を遂げる。
大規模なデータセットに依存する標準教師付き微調整アプローチでは、ツール使用時のタスク固有の特性を見落としていることが多い。
本稿では,最適下トレーニングデータの効果を緩和するタスク機能ベースのフレームワークであるTL-Trainingを提案する。
論文 参考訳(メタデータ) (2024-12-20T02:21:36Z) - STRAP: Robot Sub-Trajectory Retrieval for Augmented Policy Learning [8.860366821983211]
STRAPは、トレーニング済みの視覚基盤モデルと動的時間ワープを利用して、大規模なトレーニングコーパスからトラジェクトリのサブシーケンスを堅牢に検索する技術である。
本研究では、事前学習された視覚基盤モデルと動的時間ワープを活用して、大規模学習コーパスからのトラジェクトリのサブシーケンスをロバストに検索するSTRAPを提案する。
論文 参考訳(メタデータ) (2024-12-19T18:54:06Z) - AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials [53.376263056033046]
既存のアプローチは高価な人間のアノテーションに依存しており、大規模には持続不可能である。
本稿では,Webエージェントトラジェクトリを生成するスケーラブルなデータ合成パイプラインであるAgentTrekを提案する。
完全に自動化されたアプローチは、データ収集コストを大幅に削減し、人間のアノテータを使わずに、高品質な軌道を0.55ドルに抑えることができます。
論文 参考訳(メタデータ) (2024-12-12T18:59:27Z) - Spatial Reasoning and Planning for Deep Embodied Agents [2.7195102129095003]
この論文は空間的推論と計画タスクのためのデータ駆動手法の開発を探求する。
学習効率、解釈可能性、新しいシナリオ間の伝達可能性の向上に重点を置いている。
論文 参考訳(メタデータ) (2024-09-28T23:05:56Z) - GTA: A Benchmark for General Tool Agents [32.443456248222695]
229個の実世界のタスクと実行可能なツールチェーンを設計し、主要な大言語モデル(LLM)を評価する。
GPT-4 はタスクの 50% 以下であり,ほとんどの LLM は 25% 以下である。
この評価は、現実シナリオにおける現在のLLMのツール利用能力のボトルネックを明らかにし、汎用ツールエージェントを前進させるための今後の方向性を提供する。
論文 参考訳(メタデータ) (2024-07-11T17:50:09Z) - Learning to Use Tools via Cooperative and Interactive Agents [58.77710337157665]
ツール学習は、外部ツールを使用してユーティリティを拡張するエージェントとして、大きな言語モデル(LLM)を促進する。
ツール選択,ツール実行,アクションキャリブレーションの3つの特別なエージェントを個別にコーディネートする,協調型対話型エージェントフレームワークであるConAgentsを提案する。
3つのデータセットに対する実験により、LLMは、ConAgentsを装備した場合、大幅に改善されたベースラインよりも優れた性能を示した。
論文 参考訳(メタデータ) (2024-03-05T15:08:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。