論文の概要: Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems
- arxiv url: http://arxiv.org/abs/2607.08010v1
- Date: Thu, 09 Jul 2026 00:27:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.374457
- Title: Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems
- Title(参考訳): 低レイテンシシステムにおけるツールメイキングと自己進化型LDMエージェント
- Abstract要約: プロダクションLLMエージェントは、要求毎に同じ手続きステップのコードを再生することで、レイテンシと信頼性を無駄にすることが多い。
我々は、この推論時コーディングループをエージェントツール作成パイプラインに置き換え、繰り返しSOPステップを検証済みのバージョンツールにコンパイルします。
我々はFulfillment Centerアラームトリアージシステムにアプローチを展開し、エージェントが異種計量バックエンド上で44ノードのSOPに対してアラームを診断する。
- 参考スコア(独自算出の注目度): 19.269603229704355
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Production LLM agents often waste latency and reliability by regenerating code for the same procedural steps on every request. We replace this inference-time coding loop with an agentic tool-making pipeline that compiles repeated SOP steps into validated, versioned tools before deployment. The tool-maker grounds synthesis in the live environment as it collects execution traces, observes backend schemas and values, generates candidate tools, and repairs them against labeled cases. At runtime, the production agent calls these tools directly and falls back to code generation only when needed. We deploy the approach in a Fulfillment Center alarm-triage system, where an agent diagnoses alarms against a 44-node SOP over heterogeneous metric backends. In production, tool calls reduce p50 latency by 42%. On 1,500 historical alarms, they reduce end-to-end error rate by up to 53% by suppressing run-to-run variance in repeated steps. Because tools return compact structured verdicts, they also enable a simpler direct-call architecture, reducing p50 latency by a further 62% in a controlled ablation. Versioned tools also improve auditability and expose specification gaps and upstream data drift. Our results show that self-evolving agents can make industrial LLM systems faster, more reliable, and easier to operate.
- Abstract(参考訳): プロダクションLLMエージェントは、要求毎に同じ手続きステップのコードを再生することで、レイテンシと信頼性を無駄にすることが多い。
私たちは、この推論時コーディングループをエージェントツール作成パイプラインに置き換えて、繰り返しSOPステップをデプロイ前に検証されたバージョン管理ツールにコンパイルします。
ツールメーカーは、実行トレースを収集し、バックエンドのスキーマと値を観察し、候補ツールを生成し、ラベル付きケースに対して修正する。
実行時に、本番エージェントはこれらのツールを直接呼び出し、必要に応じてコード生成にフォールバックする。
我々はFulfillment Centerアラームトリアージシステムにアプローチを展開し、エージェントが異種計量バックエンド上で44ノードのSOPに対してアラームを診断する。
実運用では、ツールコールによってp50レイテンシが42%削減される。
1500の履歴アラームでは、繰り返しステップでラン・ツー・ランのばらつきを抑えることで、エンドツーエンドのエラー率を最大53%削減する。
ツールはコンパクトな構造化された検証を返すため、より単純なダイレクトコールアーキテクチャを可能にし、制御されたアブレーションでp50レイテンシを更に62%削減する。
バージョン管理ツールは監査性を改善し、仕様ギャップと上流データドリフトを公開する。
以上の結果から, 産業用LLMシステムの高速化, 信頼性向上, 操作性の向上が期待できる。
関連論文リスト
- From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents [90.3279207163486]
EvoSOPは、エージェントが実行軌跡からSOPを抽出し、反復的にツールセットを最適化することを可能にするフレームワークである。
EvoSOPはタスク成功率を大幅に向上し,インタラクションラウンドの回数を大幅に削減することを示す。
論文 参考訳(メタデータ) (2026-07-08T12:09:49Z) - When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents [7.986500985812644]
私たちはこの問題をInfinite Agentic Loops (IALs)と呼んでいる。
IALはエージェントロジック、フレームワークセマンティクス、実行時の観察、終了メカニズム間の相互作用から生まれる。
本研究では,実世界のLLMエージェントプロジェクトにおけるALF検出のための静的解析ツールであるIAL-Scanを提案する。
論文 参考訳(メタデータ) (2026-07-02T03:14:27Z) - PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems [59.730861364166174]
PlanBench-XLは、327の小売タスクを1,665以上のツールでインタラクティブにベンチマークする。
エージェントが使用可能なツールを反復的に検索できるかどうかをテストし、最終目標に対するその後の呼び出しの中間的証拠を明らかにするためにそれらを呼び出す。
論文 参考訳(メタデータ) (2026-06-21T08:29:12Z) - Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning [82.89535601592739]
マルチレベル検証を用いた自己進化型合成により,信頼性の高い基本ツール利用軌跡を生成する2段階パイプラインを提案する。
これらの拡張は、トラクタツール、間接的または曖昧なユーザクエリ、ノイズ、マルチフォーマット、あるいは誤ったツール出力を導入します。
本設計では,標準事例に対する参照マッチングによる報酬の自動計算と,エラー検出などの特別な動作に対する軽量な判断支援検証を実現する。
論文 参考訳(メタデータ) (2026-04-10T18:38:52Z) - Act While Thinking: Accelerating LLM Agents via Pattern-Aware Speculative Tool Execution [18.50317396128381]
PASTEは、推測によってツールの遅延を隠すように設計されたPattern-Aware Speculative Tool Executionメソッドである。
PASTEは平均タスク完了時間を48.5%削減し、ツールの実行スループットを1.8倍改善する。
論文 参考訳(メタデータ) (2026-03-19T13:36:50Z) - RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection [3.494935876363005]
既存のエージェントシステムは、彼らが呼び出すツールが常に正しい出力を返すと暗黙的に仮定している。
我々は,ツールが誤りや誤解を招く出力を生成する場合でも,堅牢なIaC検証を行う,新しいマルチエージェントシステムであるRIVAを紹介する。
この結果から,多種多様なツールコールの相互検証により,実運用環境におけるより信頼性の高い自律的インフラストラクチャ検証が可能であることが示唆された。
論文 参考訳(メタデータ) (2026-03-02T19:28:27Z) - Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls [56.407063247662336]
本稿では,ルールとLLMを組み合わせてツール応答をシミュレートする総合環境であるGeckoを紹介する。
GATS は GPT-4o, GPT-5, Gemini-3.0-pro など様々な LLM のツールコール性能を一貫して改善している。
論文 参考訳(メタデータ) (2026-02-22T15:02:00Z) - DLLM Agent: See Farther, Run Faster [94.74432470237817]
拡散大言語モデル(DLLM)は、自己回帰(AR)デコーディングの代替として、魅力的な効率とモデリング特性を持つ。
我々は、DLLMとARのバックボーンを同一のエージェントワークフロー内でインスタンス化することで、制御された環境でこれを研究する。
DLLMエージェントはARエージェントよりも平均30%以上速く、場合によっては8倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2026-02-07T09:01:18Z) - ToolGym: an Open-world Tool-using Environment for Scalable Agent Testing and Data Curation [42.479399507055454]
一般的な204のアプリにまたがって,571フォーマットの統一ツール上に構築された,オープンワールドのツール使用環境を紹介します。
これには、ロングホライゾンを合成するタスク生成エンジン、ワイルド制約付きマルチツール、ストレス-テストの堅牢性に割り込みと失敗を注入するステートコントローラが含まれる。
最先端のLLMの総合評価では、ツール計画と実行能力の相違、既存のLLMの弱点に続く制約、DeepSeek-v3.2の強靭さが明らかにされている。
論文 参考訳(メタデータ) (2026-01-09T21:59:31Z) - Dynamic System Instructions and Tool Exposure for Efficient Agentic LLMs [1.2691047660244335]
大きな言語モデル(LLM)エージェントは、長いシステム命令と大きなツールカタログを毎回繰り返しながら、多くのステップで実行されることが多い。
Instruction-Tool Retrieval (ITR)は,段階ごとに最小限のシステムプロンプトフラグメントと最小限のツールサブセットを検索するRAG変異体である。
ITRはステップ単位のコンテキストトークンを95%削減し、適切なツールルーティングを32%改善し、エンドツーエンドのエピソードコストをモノリシックベースラインに対して70%削減する。
論文 参考訳(メタデータ) (2025-12-01T06:43:43Z) - DS-Agent: Automated Data Science by Empowering Large Language Models with Case-Based Reasoning [56.887047551101574]
大規模言語モデル(LLM)エージェントとケースベース推論(CBR)を利用した新しいフレームワークであるDS-Agentを提案する。
開発段階では、DS-AgentはCBRフレームワークに従い、自動イテレーションパイプラインを構築する。
デプロイメントの段階では、DS-Agentは、シンプルなCBRパラダイムで低リソースのデプロイメントステージを実装し、LCMの基本能力に対する需要を大幅に削減する。
論文 参考訳(メタデータ) (2024-02-27T12:26:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。