論文の概要: Benchmarking AI Agents for Hardware Design Automation via MCP Tool Calling
- arxiv url: http://arxiv.org/abs/2608.26199v1
- Date: Tue, 25 Aug 2026 15:33:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.119609
- Title: Benchmarking AI Agents for Hardware Design Automation via MCP Tool Calling
- Title(参考訳): MCPツール呼び出しによるハードウェア設計自動化のためのベンチマークAIエージェント
- Authors: Leonardo Liparulo, Francesco Pierri,
- Abstract要約: ローカルにデプロイされた大規模言語モデルを利用したAIエージェントが、業界現実的なツールコール設定で、専門家が定義したハードウェア設計を確実に自動化できるかどうかを問う。
この設定を研究するために、組み込みシステム開発に使用されるプロプライエタリなハードウェア設計ツールの状態と依存性ロジックを再現するモデルコンテキストプロトコル(MCP)サーバを構築した。
我々は、システムプロンプト、ツール記述の詳細、コンテキストスコープ、シングルエージェント対マルチエージェントアーキテクチャを含むパイプライン選択を比較した7つのオープンソースモデルを評価する。
- 参考スコア(独自算出の注目度): 1.6639892342953113
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We ask whether AI agents powered by locally deployed large language models can reliably automate expert-defined hardware design workflows in an industry-realistic tool-calling setting. In these environments, engineers issue repetitive, dependency-ordered operations---such as creating components, adding ports, and wiring connections---through specialised tools. Confidentiality constraints on component specifications and naming conventions often preclude hosted proprietary APIs, motivating the use of locally deployed models. To study this setting, we build a Model Context Protocol (MCP) server that reproduces the state and dependency logic of a proprietary hardware design tool used in embedded system development and construct a benchmark covering single-operation edits, multi-step dependency chains, invalid requests, misspelled prompts, and multi-server tool contexts. We evaluate seven open-source models comparing pipeline choices including system prompts, tool-description detail, context scope, and single-agent versus multi-agent architectures. Results show that strong models can achieve near-complete expected-call coverage on the benchmarked workflows, but reliability depends strongly on both task structure and agent configuration. Comprehensive tool descriptions consistently reduce failures, few-shot prompting can cause severe inaction for some models, cumulative context harms constrained models, and multi-agent decomposition helps weak workers or long sessions at the cost of additional calls. These findings provide practical guidance for deploying local LLM agents in stateful hardware design environments.
- Abstract(参考訳): ローカルにデプロイされた大規模言語モデルを利用したAIエージェントが、業界現実的なツールコール設定で、専門家が定義したハードウェア設計ワークフローを確実に自動化できるかどうかを問う。
これらの環境では、エンジニアは、コンポーネントの作成、ポートの追加、接続の接続など、繰り返し、依存関係の順序付けされた操作を発行する。
コンポーネント仕様や命名規則に対する信頼性の制約は、しばしばホストされたプロプライエタリなAPIを阻害し、ローカルにデプロイされたモデルの使用を動機付けます。
この設定を研究するために、組み込みシステム開発で使用されるプロプライエタリなハードウェア設計ツールの状態と依存性ロジックを再現するモデルコンテキストプロトコル(MCP)サーバを構築し、単一操作編集、複数ステップの依存関係チェーン、無効なリクエスト、ミススペルプロンプト、マルチサーバツールコンテキストをカバーするベンチマークを構築する。
我々は、システムプロンプト、ツール記述の詳細、コンテキストスコープ、シングルエージェント対マルチエージェントアーキテクチャを含むパイプライン選択を比較した7つのオープンソースモデルを評価する。
その結果、強力なモデルでは、ベンチマークされたワークフロー上でほぼ完全なコールカバレッジを実現することができるが、信頼性はタスク構造とエージェント構成の両方に強く依存している。
包括的なツール記述は、失敗を継続的に減らし、数発のプロンプトは、いくつかのモデルで深刻な不動作を引き起こし、累積的コンテキストは制約されたモデルに害を与え、マルチエージェント分解は、追加呼び出しのコストで、弱いワーカーや長いセッションを支援する。
これらの知見は,ローカルなLCMエージェントをステートフルなハードウェア設計環境にデプロイするための実用的なガイダンスを提供する。
関連論文リスト
- The Auton Agentic AI Framework [5.410458076724158]
人工知能の分野では、ジェネレーティブAIからエージェントAIへの移行が進行中である。
大規模言語モデル(LLM)は構造化されていない出力を生成するが、それらが制御しなければならないバックエンドインフラストラクチャは決定論的でスキーマに適合する入力を必要とする。
本稿では,自律エージェントの作成,作成,管理を行うための原則アーキテクチャであるAuton Agentic AI Frameworkについて述べる。
論文 参考訳(メタデータ) (2026-02-27T06:42:08Z) - A Lightweight Modular Framework for Constructing Autonomous Agents Driven by Large Language Models: Design, Implementation, and Applications in AgentForge [1.932555230783329]
LLM駆動の自律エージェントの構築を民主化するために設計された軽量でオープンソースのPythonフレームワーク。
AgentForgeは、(1)正式に定義された入出力契約できめ細かいタスク分解を可能にする構成可能なスキル抽象化、(2)クラウドベースのAPIとローカル推論エンジンのシームレスな切り替えをサポートする統一されたバックエンドインターフェース、(3)エージェントロジックと実装の詳細を分離する宣言型YAMLベースの構成システムである。
論文 参考訳(メタデータ) (2026-01-19T20:33:26Z) - ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development [72.4729759618632]
本稿では,現実的かつ実行可能なワークフロー内でエージェントバックエンドコーディングを評価するベンチマークであるABC-Benchを紹介する。
オープンソースリポジトリから8つの言語と19のフレームワークにまたがる224の実践的なタスクをキュレートしました。
我々の評価は、最先端モデルでさえ、これらの総合的なタスクに対して信頼性の高いパフォーマンスを提供するのに苦労していることを示している。
論文 参考訳(メタデータ) (2026-01-16T08:23:52Z) - Orchestral AI: A Framework for Agent Orchestration [45.946776875141666]
Orchestralは軽量なPythonフレームワークで、主要なプロバイダ間でLLMエージェントを構築するための統一型安全なインターフェースを提供する。
プロバイダ間でシームレスに動作し、手作業によるフォーマット変換を排除し、フレームワークが引き起こす複雑さを低減します。
リッチなツールコール、コンテキストのコンパクト化、サンドボックス、ユーザ承認、サブエージェント、メモリ管理、MPP統合など、より大きなフレームワークで見られる高度なエージェント機能をサポートする。
論文 参考訳(メタデータ) (2026-01-05T22:02:11Z) - Monadic Context Engineering [59.95390010097654]
本稿では,エージェント設計の正式な基盤を提供するために,モナディックコンテキストエンジニアリング(MCE)を紹介する。
我々は、モナドがロバストなコンポジションをどのように実現し、Applicativesが並列実行に原則化された構造を提供し、また、モナドトランスフォーマーがこれらの機能の体系的なコンポジションをどのように可能にしているかを実証する。
この階層化されたアプローチにより、開発者は、単純で独立した検証可能なコンポーネントから、複雑でレジリエントで効率的なAIエージェントを構築することができる。
論文 参考訳(メタデータ) (2025-12-27T01:52:06Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - FABRIC: Framework for Agent-Based Realistic Intelligence Creation [3.940391073007047]
大規模言語モデル(LLM)はエージェントとしてますます多くデプロイされ、目標を分解し、ツールを実行し、動的環境で結果を検証することが期待されている。
本稿では,LLMのみを用いたエージェントデータの統一化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-20T18:20:22Z) - A Framework for Testing and Adapting REST APIs as LLM Tools [11.757827071584737]
大きな言語モデル(LLM)は、外部ツールで複雑なタスクを実行する自律エージェントを構築するために、ますます使われています。
現在のベンチマークではこれらの課題を見落としており、エージェント駆動自動化のためのAPI準備性の評価のギャップが残っている。
LLMエージェント用のPythonツールとしてラップされたエンタープライズAPIを体系的に評価するテストフレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-22T02:52:08Z) - CRAFT: Customizing LLMs by Creating and Retrieving from Specialized
Toolsets [75.64181719386497]
大規模言語モデル(LLM)のためのツール作成・検索フレームワークであるCRAFTを提案する。
タスク用に特別にキュレートされたツールセットを作成し、複雑なタスクを解決する能力を高めるためにこれらのセットからツールを取得するコンポーネントをLLMに装備する。
本手法はフレキシブルに設計されており,既製のLCMを細かな調整なしに未確認領域やモダリティに適応するためのプラグアンドプレイ方式を提供する。
論文 参考訳(メタデータ) (2023-09-29T17:40:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。