論文の概要: ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration
- arxiv url: http://arxiv.org/abs/2608.07925v1
- Date: Sat, 08 Aug 2026 05:05:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.567757
- Title: ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration
- Title(参考訳): ZhuLong: オフラインAPIによるEDAスクリプティングのための実行Grounded LLM Agent
- Authors: Yang Liu, Shiwei Hou, Xiyuan Chen, Yu Wang, Sen Yuan, Qirui Gan, Shao You, Feifan Chen, Wencheng Li, Shuyang Hu, Yongzhou Liu, Emma Xia, Xiaojing Lu, Hao Wang, Fan Xu, Yanfeng Li,
- Abstract要約: 本稿では,PyAether と SKILL のための実行基底型 LLM 符号化エージェント ZhuLong について述べる。
ZhuLongは、API検索、ドキュメントインスペクション、統合MPPツールによるサンドボックス実行を組み合わせたものだ。
レイアウトとスキーマに関する20のインタラクティブなタスクにおいて、ZhuLongはPyAetherの60.0% Pass@1、SKILLの50.0%を達成した。
- 参考スコア(独自算出の注目度): 12.947455562295081
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: EDA scripting with tool-specific, often undocumented APIs remains a long-tail bottleneck that existing LLMs fail to address. This paper presents ZhuLong, an execution-grounded LLM coding agent for PyAether and SKILL that combines API retrieval, documentation inspection, and sandbox execution via unified MCP tools, augmented by an offline API self-exploration mechanism that infers undocumented API behaviors through counterfactual experimentation. We evaluate ZhuLong on EDA-Eval-PyAether, a benchmark of 158 real-world tasks with assertion-based execution, where the complete system achieves 78.5% Pass@1 in the commercial Empyrean Aether environment, substantially outperforming a pure LLM baseline (23.6%). Ablation studies identify sandbox execution as the dominant performance driver (41.2 pp drop when removed), with the self-exploration mechanism contributing an additional 3.2 pp accuracy gain and a 22.1% reduction in per-task tool calls. On 20 interactive tasks involving unsaved layouts and schematics, ZhuLong achieves 60.0% Pass@1 for PyAether and 50.0% for SKILL.
- Abstract(参考訳): ツール固有の、しばしば文書化されていないAPIを使ったEDAスクリプティングは、既存のLLMが対処できない長いボトルネックのままである。
本稿では,PyAether と SKILL の LLM コーディングエージェントである ZhuLong について述べる。これは API 検索,ドキュメント検査,サンドボックス実行を統合 MCP ツールで組み合わせたもので,非文書化された API の動作を偽物実験によって推測するオフライン API 探索機構によって拡張したものである。
EDA-Eval-PyAetherは158個の実世界のタスクをアサーションベースの実行でベンチマークし,商用のEmpyrean Aether環境において78.5%のPass@1を達成した。
アブレーション研究では、サンドボックスの実行が主要なパフォーマンスドライバ(除去すると41.2ppドロップ)であり、自己探索機構により3.2ppの精度が向上し、タスク毎のツールコールが22.1%削減された。
未解決のレイアウトとスキーマを含む20のインタラクティブタスクにおいて、ZhuLongはPyAetherの60.0% Pass@1、SKILLの50.0%を達成した。
関連論文リスト
- Environment-free Synthetic Data Generation for API-Calling Agents [68.95520739708304]
API呼び出し大型言語モデル(LLM)エージェントの訓練には、大量の高品質なトラジェクトリが必要である。
本研究では,LLMをオンザフライデジタルワールドモデルとして活用する環境不要な合成データ生成手法を提案する。
我々は,情報検索タスクと状態変更タスクの両方を含む,挑戦的なAppWorldとOfficeBenchベンチマークに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-07-18T17:36:44Z) - Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems [19.269603229704355]
プロダクションLLMエージェントは、要求毎に同じ手続きステップのコードを再生することで、レイテンシと信頼性を無駄にすることが多い。
我々は、この推論時コーディングループをエージェントツール作成パイプラインに置き換え、繰り返しSOPステップを検証済みのバージョンツールにコンパイルします。
我々はFulfillment Centerアラームトリアージシステムにアプローチを展開し、エージェントが異種計量バックエンド上で44ノードのSOPに対してアラームを診断する。
論文 参考訳(メタデータ) (2026-07-09T00:27:13Z) - AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs [55.8213573429699]
AISE-Benchは、学術知識グラフに基づく情報検索のための実世界のフルサイクルアノテートベンチマークである。
AISE-Benchリリースには1,133のQAペアが含まれている。クエリ、完全なAPI実行、検証されたパラメータ、リファレンスリンクによるソースグラウンドの回答などだ。
我々は,回答の品質,参照基盤,API計画の正確性,実行成功を総合的に評価するプロトコルを開発した。
論文 参考訳(メタデータ) (2026-06-16T07:59:46Z) - Firefly: Illuminating Large-Scale Verified Tool-Call Data Generation from Real APIs [46.60041435990374]
本稿では,実世界のMPPサーバから検証済みのツールコールデータを生成するためのパイプラインFireFlyを紹介する。
実世界のツール空間のスケールを扱うために、ペアワイズツールグラフとサンプルサブDAGを構築します。
このパイプラインを適用すると、240のサーバと93のツールにまたがる5,144の検証タスクが生成される。
論文 参考訳(メタデータ) (2026-05-17T17:38:17Z) - ExploraCoder: Advancing code generation for multiple unseen APIs via planning and chained exploration [70.26807758443675]
ExploraCoderはトレーニング不要のフレームワークで、大規模な言語モデルにコードソリューションで見えないAPIを呼び出す権限を与える。
実験の結果、ExploreaCoderは、事前のAPI知識に欠けるモデルのパフォーマンスを大幅に改善することが示された。
論文 参考訳(メタデータ) (2024-12-06T19:00:15Z) - AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation [16.590226868986296]
AutoFeedbackは、効率的で正確なAPIリクエスト生成のためのフレームワークである。
大規模言語モデルによるAPIリクエストの生成プロセス中に2つのフィードバックループを実装している。
実際のAPIデータセットで100.00%の精度を実現し、GPT-3.5 Turboとのインタラクションコストを23.44%削減し、GPT-4 Turboを11.85%削減する。
論文 参考訳(メタデータ) (2024-10-09T14:38:28Z) - NESTFUL: A Benchmark for Evaluating LLMs on Nested Sequences of API Calls [24.183027762617233]
API呼び出しのネストシーケンスに基づいて,大規模言語モデル(LLM)を評価するベンチマークであるNESTFULを提案する。
最適性能モデル (GPT-4o) は, 完全一致精度が28%, 勝率が60%であることを示す。
論文 参考訳(メタデータ) (2024-09-04T17:53:24Z) - API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs [84.45284695156771]
API-Bankは、ツール強化された大規模言語モデルのための画期的なベンチマークである。
73のAPIツールからなる実行評価システムを開発した。
我々は、1,000の異なるドメインにまたがる2,138のAPIから1,888のツール使用対話を含む総合的なトレーニングセットを構築した。
論文 参考訳(メタデータ) (2023-04-14T14:05:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。