論文の概要: Execution-First Synthetic Tool-Use Trace Generation for LLM Agents
- arxiv url: http://arxiv.org/abs/2607.29175v1
- Date: Fri, 31 Jul 2026 08:52:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.657622
- Title: Execution-First Synthetic Tool-Use Trace Generation for LLM Agents
- Title(参考訳): LLMエージェントのための実行第一合成ツール利用トレーサ生成
- Abstract要約: SyntheticAgentTraceQAは、ツールエージェントのためのスケーラブルな監視データを生成するための実行ファーストフレームワークである。
4つのツールエコシステムにまたがるフレームワークを評価し、結果のデータを微調整し、Qwenモデルの変種を評価する。
- 参考スコア(独自算出の注目度): 10.291533584425252
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic software-engineering and industrial systems increasingly operate through executable workflows rather than code genera- tion alone: they search artifacts, invoke tools, inspect structured observations, and query databases. Training these agents requires supervision data that captures valid tool interactions and executable workflows. However, traditional query-first data synthesis can fail because plausible user requests may not correspond to valid tool sequences, compatible parameters, or available data. To address this limitation, we propose SyntheticAgentTraceQA, an execution- first framework for generating scalable supervision data for tool- augmented agents. Our framework first constructs high-level work- flow structures, maps them to available tools through dependency- aware assignment, executes and validates the resulting traces in con- trolled environments, and only then synthesizes natural-language user tasks, teacher-generated reasoning annotations, and reference answers. We evaluate the framework across four tool ecosystems and use the resulting data to fine-tune and evaluate Qwen model variants. The results show that execution-grounded supervision improves tool execution behavior, reference-trace agreement, and answer-generation performance on the evaluated tasks. Further analysis reveals a supervision trade-off: masked supervision, which excludes reasoning annotations from the training objective, im- proves final-answer metrics, whereas full supervision, computing loss over the complete assistant output including reasoning tokens, underperforms on answer quality and does not consistently im- prove reference-trace agreement, particularly at the 9B scale. These findings highlight the importance of designing synthetic supervi- sion according to the desired capabilities of tool-augmented agents.
- Abstract(参考訳): エージェントソフトウェアエンジニアリングや産業システムは、コードジェネラオンではなく実行可能なワークフローを通じて、アーティファクトを検索し、ツールを起動し、構造化された観察を検査し、データベースをクエリするようになっている。
これらのエージェントのトレーニングには、有効なツールインタラクションと実行可能なワークフローをキャプチャする監視データが必要である。
しかし、従来のクエリファーストのデータ合成は、有効なツールシーケンスや互換性のあるパラメータ、利用可能なデータに対応できないため失敗する可能性がある。
この制限に対処するため,ツールエージェントのためのスケーラブルな監視データを生成するための実行ファーストフレームワークであるSyntheticAgentTraceQAを提案する。
筆者らのフレームワークはまず,高レベルな作業フロー構造を構築し,依存関係を意識したアサインを通じて利用可能なツールにマップし,コントロル環境におけるトレースの実行と検証を行い,その後,自然言語のユーザタスク,教師生成の推論アノテーション,参照回答を合成する。
4つのツールエコシステムにまたがるフレームワークを評価し、結果のデータを微調整し、Qwenモデルの変種を評価する。
その結果, 評価作業におけるツール実行行動, 基準トレース合意, 応答生成性能の向上が得られた。
仮面監督は、トレーニング目標から推論アノテーションを除外し、Im-はファイナル・アンサー・メトリクスを証明し、一方、完全な監督、推論トークンを含む完全なアシスタント出力に対するコンピューティング損失は、回答品質の過小評価であり、特に9Bスケールにおいて、一貫して証明されていない。
これらの知見は, ツール強化剤の望ましい能力に応じて, 合成スーパービジョンを設計することの重要性を浮き彫りにした。
関連論文リスト
- Terminal Agents: A Survey of AI Agents in Command-Line Environments [102.48222742145474]
大規模言語モデルエージェントは、ターミナルを通してますます行動するが、既存の調査は、ソフトウェア工学、ツールの使用、コンピュータ利用の研究にまたがって端末による振る舞いを分散させている。
我々は,端末エージェントを,端末コマンドの実行,テキストフィードバック,ステートフルな環境相互作用を介し,進行を伴う動作を主とするシステムとみなす。
我々の合成は、実現された行動はモデル、インターフェース、ハーネス、ランタイム、環境によって共同で形成されていることを示している。
論文 参考訳(メタデータ) (2026-08-20T18:16:44Z) - FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis [37.074035615771066]
FACET(Fine-fine Agentic Construction of Executable Tasks)は、情報保存とクロスアーティファクトの整合性に対処するフレームワークである。
関連するエージェントスキルを一貫性のある情報豊富なシナリオに再構築し、実行環境を実現し、修復する。
複雑な端末タスクを高密度な実行可能チェックで生成し、これらのタスクから収集された軌道は、効果的なデータ効率の監視を提供する。
論文 参考訳(メタデータ) (2026-08-19T06:19:20Z) - LEDGER: Claim-to-Evidence Trace Graphs for Auditing LLM Agents [2.9951905451976106]
LEDGERは観察されたエージェントセッションにトレースグラフを構築する。
結果として得られたトレースが、ワークフローの決定、アーティファクトの系統、修復ステップ、検証ステップ、エビデンス中心の監査のためのクレームサポートパスを公開する方法を示す。
論文 参考訳(メタデータ) (2026-08-19T00:10:04Z) - Formal Verification of Agentic Systems over Operational Data [59.98246281888422]
大規模言語モデル(LLM)によって駆動されるエージェントシステムは、永続的な運用データを扱う現実世界にますます展開されている。
既存のアプローチはそのようなシステムレベルの保証を提供していません。
本稿では, 1 つの LLM とツールオーケストレーションハーネスからなるエージェントシステムのリレーショナル操作データに対する検証について述べる。
論文 参考訳(メタデータ) (2026-08-04T13:01:30Z) - From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents [56.187590188698955]
大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
縦断的相互作用履歴から構築した暗黙的行動アライメントのベンチマークであるIBA-Benchを紹介する。
IBA-Agentは、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-08-03T12:52:04Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows [18.6534256358905]
本稿では,リアルエージェントシステムにおける構成レベルのハーネス効果を評価するための診断ベンチマークであるHarness-Benchを紹介する。
ベンチマークには、実用的なエージェント使用パターンから構築された106のサンドボックス化されたオフラインタスクが含まれている。
5,194個の実行軌道にまたがって、完了、プロセス品質、効率、障害挙動のかなりの変化を観察する。
論文 参考訳(メタデータ) (2026-05-27T03:47:35Z) - Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception [18.565166776233223]
SVLM(Small Vision-Language Models)は効率的なタスクコントローラであるが、視覚的脆さとツールオーケストレーションの貧弱さに悩まされることが多い。
SPECTRA(Cascaded Tool Rollout Alignment)で実現可能な自己教師型知覚法を提案する。
SPECTRAはSVLMのコールドスタート強化学習を通じてエージェント機能をブートストラップする。
論文 参考訳(メタデータ) (2026-04-19T15:06:30Z) - GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows [90.35728421223673]
GTA-2はジェネラル・ツール・エージェント(GTA)の階層的なベンチマークである
現実世界の認証に基づいて構築され、実際のユーザクエリ、デプロイツール、マルチモーダルコンテキストを活用する。
実験では、フロンティアモデルは既に原子タスクに苦戦しているが、トップモデルは14.39%の成功しか達成していない。
論文 参考訳(メタデータ) (2026-04-17T05:36:00Z) - Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent [45.450766613995135]
Tool-Genesisは、複数の次元にわたるエージェント能力の定量化のために設計された診断ベンチマークである。
最先端モデルでさえ、ワンショット設定で正確なツールインターフェースや実行可能なロジックを生成するのに苦労しています。
論文 参考訳(メタデータ) (2026-03-05T17:44:29Z) - FABRIC: Framework for Agent-Based Realistic Intelligence Creation [3.940391073007047]
大規模言語モデル(LLM)はエージェントとしてますます多くデプロイされ、目標を分解し、ツールを実行し、動的環境で結果を検証することが期待されている。
本稿では,LLMのみを用いたエージェントデータの統一化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-20T18:20:22Z) - Agentic Predictor: Performance Prediction for Agentic Workflows via Multi-View Encoding [56.565200973244146]
Agentic Predictorは、効率的なエージェントワークフロー評価のための軽量な予測器である。
Agentic Predictorはタスク成功率の近似を学ぶことで、最適なエージェントワークフロー構成の迅速かつ正確な選択を可能にする。
論文 参考訳(メタデータ) (2025-05-26T09:46:50Z) - Large Language Models as Realistic Microservice Trace Generators [48.730974361862366]
本稿では,大規模言語モデル (LLM) を用いて, 合成作業負荷トレースを生成する手法を提案する。
我々はTraceLLMが様々な条件下で多様なリアルなトレースを生成し、精度と妥当性の両方において既存のアプローチよりも優れていることを示す。
TraceLLMは、キートレース機能を予測したり、欠落したデータを埋め込むといった、下流のトレース関連タスクに適応する。
論文 参考訳(メタデータ) (2024-12-16T12:48:04Z) - Learning to Use Tools via Cooperative and Interactive Agents [58.77710337157665]
ツール学習は、外部ツールを使用してユーティリティを拡張するエージェントとして、大きな言語モデル(LLM)を促進する。
ツール選択,ツール実行,アクションキャリブレーションの3つの特別なエージェントを個別にコーディネートする,協調型対話型エージェントフレームワークであるConAgentsを提案する。
3つのデータセットに対する実験により、LLMは、ConAgentsを装備した場合、大幅に改善されたベースラインよりも優れた性能を示した。
論文 参考訳(メタデータ) (2024-03-05T15:08:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。