論文の概要: Agentic Hardware Design as Repository-Level Code Evolution
- arxiv url: http://arxiv.org/abs/2606.28279v1
- Date: Fri, 26 Jun 2026 17:21:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.5485
- Title: Agentic Hardware Design as Repository-Level Code Evolution
- Title(参考訳): リポジトリレベルのコード進化としてのエージェントハードウェア設計
- Abstract要約: HORIZONは、ハードウェア設計をリポジトリレベルのコード進化として扱うセルフ進化エージェントフレームワークである。
我々はChipBench, RTLLM, Verilog-Eval, 9つのCVDPカテゴリについて検討した。
- 参考スコア(独自算出の注目度): 8.614736536216526
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present HORIZON, a self-evolving agent framework that treats hardware design as repository-level code evolution. A Markdown harness is compiled into a project pack containing domain knowledge, an executable evaluator, an acceptance predicate, and a git/runtime policy; a hands-free agent loop then evolves an isolated git worktree, using repository operations for state management, tracing, and replay. This extends prior works of repository-scale self-evolution from EDA software systems, to hardware-design artifacts themselves. We evaluate our approach on ChipBench, RTLLM, Verilog-Eval, and nine CVDP categories, achieving 100\% benchmark completion across all suites with a fully hands-free agentic loop. However, we do not claim that agentic AI for hardware design is solved: these benchmarks are controlled proxies for a much broader engineering problem in chip design. Section~\ref{sec:discuss} examines the limitations of the current study and highlights open research challenges.
- Abstract(参考訳): 本稿では,ハードウェア設計をリポジトリレベルのコード進化として扱う自己進化型エージェントフレームワークであるHoriZONを紹介する。
マークダウンハーネスは、ドメイン知識、実行可能な評価器、受け入れ述語、git/ランタイムポリシーを含むプロジェクトパックにコンパイルされる。
これは、EDAソフトウェアシステムからハードウェア設計アーティファクト自体へのリポジトリスケールの自己進化の以前の作業を拡張します。
我々はChipBench、RTLLM、Verilog-Eval、および9つのCVDPカテゴリに対するアプローチを評価し、完全にハンズフリーなエージェントループを持つ全スイートで100倍のベンチマーク補完を実現した。
しかし、ハードウェア設計のためのエージェントAIが解決されたと主張するわけではない。これらのベンチマークは、チップ設計においてより広範なエンジニアリング上の問題に対して、制御されたプロキシである。
section~\ref{sec:discuss} は、現在の研究の限界を調べ、オープンな研究課題を強調する。
関連論文リスト
- DeepRepro: State-Aware Subplanning for Paper-to-Code Reproduction in Evolving Repositories [116.27249583403871]
本稿では,実行状態対応サブプランニングに基づく,紙からコードへの再生のための状態認識フレームワークを提案する。
DeepReproは、進化するリポジトリの状態とランタイムフィードバックを、きめ細かい実装サブプランに変換する。
PaperBench Code-Devの実験によると、DeepReproは強力な科学的および商業的なコードエージェントベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-08-27T02:54:30Z) - Loop Engineering: Building Blocks, Adoption, and Impact [9.402135587560347]
2026年6月、実践者はループエンジニアリングと呼ばれるさらなるレベルを記述し始めた。
この用語は、大胆な主張と声楽的な懐疑主義を伴って急速に広まったが、ソフトウェアプロジェクトへの導入は測定されていない。
本研究は, 先進的なグレー文学の探索的考察であり, 十分に設計されたループが含んでいるものについて概ね一致している。
論文 参考訳(メタデータ) (2026-08-22T09:52:23Z) - Vero: Can AI Agents Build Formally Verified Software Repositories? [45.09790101960906]
Veroはリポジトリレベルで共同実装と証明を評価する最初のベンチマークである。
Python、Dafny、Verus、Coqにまたがる実世界のリポジトリから43のマルチモジュールインスタンスが含まれている。
ベンチマークの信頼性を改善するため、Veroには、エージェントが提供された仕様の不満足さを正式に証明できる監査メカニズムも含まれている。
論文 参考訳(メタデータ) (2026-08-13T17:41:27Z) - Self-Evolving Coding Agents [11.43197414613246]
自己進化型コーディングエージェントは、リポジトリを検査し、ツールを実行し、テストを実行し、障害をデバッグし、パッチを生成することができる。
まず、自己進化型プログラミングエージェントを定義し、それらを従来のコーディングエージェントや一般的な自己進化型エージェントと区別する。
実行可能なフィードバック、リポジトリレベルのコンテキスト、コーディングトラジェクトリは、ソフトウェアエンジニアリングをエージェントの自己進化のための自然なドメインとして、ユニークな役割を与えます。
論文 参考訳(メタデータ) (2026-08-04T09:43:46Z) - LoopsBench: From Harness Engineering to Loop Engineering in Benchmarking Coding Agent [60.27239351179265]
LOOPSBENCHは、符号化エージェント評価におけるループエンジニアリングのベンチマークである。
8つのプログラミング言語と9つのドメインにまたがる、本物のソースからの112のタスクで構成されている。
フロー対応ランタイムは、準備されたフロンティアに沿ってテストをリリースし、レグレッション義務として完了したノードを保持します。
論文 参考訳(メタデータ) (2026-07-31T20:18:25Z) - GitInject: Real-World Prompt Injection Attacks in AI-Powered CI/CD Pipelines [22.29523291822444]
GitInjectは、実際のGitHubでインジェクションのプロンプト脆弱性を評価するためのオープンソースのフレームワークです。
4つのAIプロバイダにわたるワークフロー構成を研究し、設定ファイルインジェクション、クレデンシャル・エクスプロイト、判断操作、可用性にまたがる11の命名された攻撃を文書化する。
テスト対象のプロバイダはすべて、デフォルト設定で少なくとも1つのアタッククラスに影響を受けており、最も重要な脆弱性は構造的であることに気付きました。
論文 参考訳(メタデータ) (2026-06-07T19:17:18Z) - Agentic Agile-V: From Vibe Coding to Verified Engineering in Software and Hardware Development [0.0]
エージェントAIコーディングシステムは、リポジトリを検査し、実装手順を計画し、ファイルを編集し、テストを実行し、プルリクエストを送信できる。
現在の証拠は、自律的なコード生成がエンジニアリングの結果を自動的に改善するという単純な主張を支持していない。
この論文は、中心的な問題は、もはや迅速なエンジニアリングではなく、エンジニアリングプロセスの制御である、と論じている。
論文 参考訳(メタデータ) (2026-05-19T20:10:13Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - CktEvo: Repository-Level RTL Code Benchmark for Design Evolution [7.09459001862514]
本稿では、レポレベルのRTL進化のためのベンチマークおよび参照フレームワークであるCktEvoを紹介する。
以前のベンチマークとは異なり、我々のベンチマークは、PPAがファイル間の依存関係から現れる完全なIPコアをターゲットにしています。
初期リポジトリが与えられたら、PPAを改善しながら機能的な動作を保存する編集を生成します。
実験の結果, 参照フレームワークは人間のインタラクションを伴わずに, PPAの改善を実現していることがわかった。
論文 参考訳(メタデータ) (2026-02-10T02:46:15Z) - ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development [72.4729759618632]
本稿では,現実的かつ実行可能なワークフロー内でエージェントバックエンドコーディングを評価するベンチマークであるABC-Benchを紹介する。
オープンソースリポジトリから8つの言語と19のフレームワークにまたがる224の実践的なタスクをキュレートしました。
我々の評価は、最先端モデルでさえ、これらの総合的なタスクに対して信頼性の高いパフォーマンスを提供するのに苦労していることを示している。
論文 参考訳(メタデータ) (2026-01-16T08:23:52Z) - RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph [63.87660059104077]
RepoGraphは、現代のAIソフトウェアエンジニアリングソリューションのためのリポジトリレベルの構造を管理するプラグインモジュールである。
RepoGraphはすべてのシステムのパフォーマンスを大幅に向上させ、オープンソースフレームワークの間で新たな最先端技術を生み出している。
論文 参考訳(メタデータ) (2024-10-03T05:45:26Z) - Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [60.84912551069379]
Code-Development Benchmark (Codev-Bench)は、細粒度で現実世界、リポジトリレベル、開発者中心の評価フレームワークです。
Codev-Agentは、リポジトリのクローリングを自動化し、実行環境を構築し、既存のユニットテストから動的呼び出しチェーンを抽出し、データ漏洩を避けるために新しいテストサンプルを生成するエージェントベースのシステムである。
論文 参考訳(メタデータ) (2024-10-02T09:11:10Z) - Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration [64.19431011897515]
本稿では,問題解決のためにソフトウェアリポジトリ全体を包括的に理解し,活用するために設計された,新しいソフトウェアエンジニアリング手法であるAlibaba LingmaAgentを提案する。
提案手法では,重要なリポジトリ情報を知識グラフに凝縮し,複雑さを低減し,モンテカルロ木探索に基づく戦略を採用する。
Alibaba Cloudの製品展開と評価において、LingmaAgentは、開発エンジニアが直面した社内問題の16.9%を自動で解決し、手作業による介入で43.3%の問題を解決した。
論文 参考訳(メタデータ) (2024-06-03T15:20:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。