論文の概要: Can AI Agents Really Complete RTL-to-GDS? Lessons from Benchmarking Tool-Interactive EDA Workflows
- arxiv url: http://arxiv.org/abs/2607.17528v2
- Date: Tue, 21 Jul 2026 16:02:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.405047
- Title: Can AI Agents Really Complete RTL-to-GDS? Lessons from Benchmarking Tool-Interactive EDA Workflows
- Title(参考訳): AIエージェントは本当にRTL-to-GDSを完成できるか?ベンチマークツールの対話型EDAワークフローから学ぶ
- Authors: Jinyuan Deng, Zhengrui Chen, Xufeng Wei, Tianyu Xing, Chenyi Wen, Cheng Zhuo,
- Abstract要約: 我々は,統合されたプロンプト,ツール環境,技術ライブラリ設定の下で,エンド・ツー・エンドのEDA上でAIエージェントを体系的に評価する。
本評価では,オープンソースツールチェーンを用いたRTL生成や,オープンソース商用EDAツールを用いたRTL-to-GDSフローなどの代表的なシナリオについて述べる。
- 参考スコア(独自算出の注目度): 3.363103854836554
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: LLM-driven agent systems have emerged as a promising paradigm for electronic design automation (EDA), demonstrating strong potential for automating complex design workflows. However, existing evaluations primarily examine individual language models on isolated EDA tasks, providing limited insight into how different agent systems perform across complete EDA flows. In this work, we present FluxBench, a systematic evaluation of AI agents on end-to-end EDA workflows under unified prompts, tool environments, and technology library settings. Our evaluation covers representative scenarios, including RTL generation with open-source toolchains and an RTL-to-GDS flow using closed-source commercial EDA tools for industrial applications. Through these workflows, we assess agents' capabilities in RTL code generation, iterative repair, tool-feedback utilization, logic synthesis, placement and routing (P&R), and Engineering Change Order (ECO) automation. To further characterize the efficiency of agent systems, we introduce Token ROI, a cost-efficiency metric that measures effective improvements in EDA artifacts relative to token usage and runtime cost. Experimental results show that, even when built on the same foundation model, different agent system architectures can exhibit performance gaps of up to 86.27%. Moreover, among systems with comparable task performance, Token ROI can differ by as much as $105.92\times$. In the RTL-to-GDS flow using PicoRV32 as a case study, FluxEDA achieves an end-to-end score of up to 97.94, outperforming Claude Code equipped with domain-specific EDA skills by up to $8.39\times$. These results indicate that domain-specific skills alone are insufficient to improve agent performance in large-scale EDA scenarios. Instead, both agent system design and foundation model capability play critical roles in enabling effective automated EDA workflows.
- Abstract(参考訳): LLM駆動のエージェントシステムは電子設計自動化(EDA)の有望なパラダイムとして登場し、複雑な設計ワークフローを自動化する強力な可能性を示している。
しかし、既存の評価では、分離されたEDAタスクの個々の言語モデルを主に検討しており、完全なEDAフロー間で異なるエージェントシステムがどのように機能するかについての限られた洞察を与えている。
本稿では、統合されたプロンプト、ツール環境、技術ライブラリ設定の下で、エンドツーエンドのEDAワークフロー上でAIエージェントを体系的に評価するFluxBenchを紹介する。
評価では、オープンソースのツールチェーンを用いたRTL生成や、産業アプリケーションのためのクローズドソース商用EDAツールを用いたRTL-to-GDSフローなど、代表的なシナリオを取り上げている。
これらのワークフローを通じて、RTLコード生成、反復的修復、ツールフィードバック利用、ロジック合成、配置とルーティング(P&R)、エンジニアリング変更順序(ECO)自動化におけるエージェントの能力を評価する。
エージェントシステムの効率をさらに評価するために,トークン使用量や実行時コストに対して,EDAアーティファクトの効果的な改善を計測する費用効率指標であるToken ROIを導入する。
実験の結果、同じ基礎モデル上に構築された場合でも、異なるエージェント・システム・アーキテクチャは86.27%のパフォーマンスのギャップを示すことが示されている。
さらに、タスクパフォーマンスに匹敵するシステムでは、Token ROIは最大105.92\times$と異なる。
ケーススタディとしてPicoRV32を用いたRTL-to-GDSフローにおいて、FluxEDAは最大97.94のエンドツーエンドスコアを獲得し、ドメイン固有のEDAスキルを備えたClaude Codeを最大8.39\times$で上回った。
これらの結果から,大規模なEDAシナリオにおいて,ドメイン固有のスキルだけでエージェント性能を向上させるには不十分であることが示唆された。
代わりに、エージェントシステム設計とファンデーションモデル機能の両方が、効率的なEDAワークフローを実現する上で重要な役割を果たす。
関連論文リスト
- GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows [90.35728421223673]
GTA-2はジェネラル・ツール・エージェント(GTA)の階層的なベンチマークである
現実世界の認証に基づいて構築され、実際のユーザクエリ、デプロイツール、マルチモーダルコンテキストを活用する。
実験では、フロンティアモデルは既に原子タスクに苦戦しているが、トップモデルは14.39%の成功しか達成していない。
論文 参考訳(メタデータ) (2026-04-17T05:36:00Z) - AVDA: Autonomous Vibe Detection Authoring for Cybersecurity [0.1633272850273525]
AVDAは、モデルコンテキストプロトコル(MCP)を活用して、組織コンテキストをAI支援コード生成に統合することで検出を自動化するフレームワークである。
我々は,多種多様な生産検出コーパスと最先端LCMの3つのオーサリング戦略 – Baseline, Sequential, Agentic – を評価した。
その結果,エージェント品質の87%をトークンコストの40倍以下で達成できた。
論文 参考訳(メタデータ) (2026-03-26T21:52:33Z) - Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem [90.17610617854247]
本稿では,エージェントモデルの生産パイプラインを最適化する基盤インフラであるエージェント学習エコシステム(ALE)を紹介する。
ALEは、重量最適化のためのトレーニング後のフレームワークであるROLL、軌道生成のためのサンドボックス環境マネージャであるROCK、効率的なコンテキストエンジニアリングのためのエージェントフレームワークであるiFlow CLIの3つのコンポーネントで構成されている。
ROMEはALEが基盤として100万件以上のトラジェクトリをトレーニングしたオープンソースエージェントです。
論文 参考訳(メタデータ) (2025-12-31T14:03:39Z) - LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering [90.84806758077536]
textbfLoCoBench-Agentは,大規模言語モデル(LLM)エージェントを現実的,長期的ソフトウェア工学で評価するための総合的な評価フレームワークである。
我々のフレームワークは、LoCoBenchの8000のシナリオを対話型エージェント環境に拡張し、マルチターン会話の体系的評価を可能にする。
我々のフレームワークは,8つの特殊なツール(ファイル操作,検索,コード解析)をエージェントに提供し,それを10Kから1Mトークンの範囲で評価する。
論文 参考訳(メタデータ) (2025-11-17T23:57:24Z) - AgentEvolver: Towards Efficient Self-Evolving Agent System [51.54882384204726]
本稿では,自律型エージェント学習を駆動する自己進化型エージェントシステムであるAgentEvolverを紹介する。
AgentEvolverは、セルフクエスト、セルフナビゲート、セルフコントリビューションという3つのシナジスティックメカニズムを導入している。
予備実験により、AgentEvolverは従来のRLベースのベースラインと比較して、より効率的な探索、より優れたサンプル利用、より高速な適応を実現していることが示された。
論文 参考訳(メタデータ) (2025-11-13T15:14:47Z) - Agentic AI Sustainability Assessment for Supply Chain Document Insights [0.0]
本稿では,エージェント人工知能(AI)を中心としたサプライチェーン運用におけるドキュメントインテリジェンスのための総合的持続可能性評価フレームワークを提案する。
文書集約紙抽出において, 評価可能な環境性能を提供しながら, 自動化効率を向上させるという2つの目的に対処する。
我々は,AI支援型HITLとエージェントAIのシナリオにより,エネルギー消費の最大7倍,二酸化炭素排出量の90-97%,水利用の89-98%を手作業で行うことができることを示した。
論文 参考訳(メタデータ) (2025-11-10T13:38:08Z) - AutoEDA: Enabling EDA Flow Automation through Microservice-Based LLM Agents [15.41283323575065]
AutoEDAは、標準化されたスケーラブルな自然言語エクスペリエンスに特化したモデルコンテキストプロトコル(MCP)を通じて並列学習を活用する、EDA自動化のためのフレームワークである。
実験の結果、既存の手法と比較して、自動化の精度と効率が向上し、スクリプトの品質も向上した。
論文 参考訳(メタデータ) (2025-08-01T18:23:57Z) - Divergent Thoughts toward One Goal: LLM-based Multi-Agent Collaboration System for Electronic Design Automation [5.536630285985836]
EDAidは多エージェントの協調システムであり,複数のエージェントが多元的思考を担い、共通の目標に向かって収束する。
具体的には、各エージェントは、EDAフロー自動化のために微調整された専門家LLMであるChipLlamaモデルによって制御される。
実験では,ChipLlamaモデルのSOTA(State-of-the-art)性能を実証し,EDAidの有効性を検証した。
論文 参考訳(メタデータ) (2025-02-15T16:59:29Z) - Flow: Modularized Agentic Workflow Automation [53.073598156915615]
大規模言語モデル(LLM)を利用したマルチエージェントフレームワークは、自動計画とタスク実行において大きな成功を収めている。
しかし, 実行中のエージェントの効果的な調整は十分に研究されていない。
本稿では,エージェントによる継続的なワークフロー改善を可能にするアクティビティ・オン・頂点(AOV)グラフを定義する。
提案するマルチエージェントフレームワークは,サブタスクの効率的な同時実行,効果的なゴール達成,エラー耐性の向上を実現している。
論文 参考訳(メタデータ) (2025-01-14T04:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。