論文の概要: CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents
- arxiv url: http://arxiv.org/abs/2607.16632v1
- Date: Sat, 18 Jul 2026 04:28:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.201356
- Title: CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents
- Title(参考訳): CLOSER-Bench: ハードウェアエージェントの予算横断設計クロージャの評価
- Authors: Peilong Zhou, Zhirong Chen, Cangyuan Li, Haoyu Gao, Kaiyan Chang, Ziming Qu, Ying Wang,
- Abstract要約: CLOSER-Bench (CLOSER-Bench) は、予算付きクロスステージ設計クロージャのための制御された評価プロトコルである。
Spec-to-RTL、RTL-to-GDS、Spec-to-GDSタスクを組み合わせ、すべてのシミュレータ、合成、STA、プレース・アンド・ルートの呼び出しを記録する。
最終品質、任意の進捗状況、ツールコスト、ステージ間のリカバリを測定します。
- 参考スコア(独自算出の注目度): 5.604484678527336
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hardware engineering exposes coding agents to a form of long-horizon work that is difficult to capture with pass-at-k: progress is continuous, tool feedback is delayed and heterogeneous, and a backend failure may require revising RTL rather than tuning another physical-design parameter. Existing benchmarks measure RTL generation, repository repair, verification, PPA evolution, or physical implementation, but their different designs and oracles make it hard to determine where an agent succeeds or fails across abstraction boundaries. We introduce CLOSER-Bench, a controlled evaluation protocol for budgeted cross-stage design closure. For one design and one hidden objective, it pairs spec-to-RTL, RTL-to-GDS, and spec-to-GDS tasks, records every simulator, synthesis, STA, and place-and-route invocation, and measures final quality, anytime progress, tool cost, and cross-stage recovery. The benchmark is built on open-source Verilator, Yosys, OpenROAD, KLayout, Sky130, and the Harbor agent harness. A ten-task pilot spanning RTL repair, mutation-based verification, coverage, PPA optimization, design-space exploration, cross-model debugging, and security establishes the executable harness and exposes a sharp completion--closure gap: three agents solve a localized AXI repair task, while the matched verification-closure task separates a frontier agent from two otherwise successful baselines. We further validate a full RTL-to-GDS flow and construct a macro-based AXI/DMA streaming accelerator for the stage-paired evaluation. These results motivate treating hardware closure as a budgeted sequential decision problem rather than a collection of independent code generation tasks.
- Abstract(参考訳): ハードウェアエンジニアリングはコーディングエージェントを、パスアット-kでキャプチャするのが困難なロングホライズンワークの形式に公開する。進捗は連続的であり、ツールフィードバックは遅延し、不均一であり、バックエンドの障害では、他の物理設計パラメータをチューニングするのではなく、RTLを修正する必要がある。
既存のベンチマークは、RTLの生成、リポジトリの修復、検証、PPAの進化、物理的実装を計測するが、それらの異なる設計とオーラクルにより、エージェントが抽象境界を越えて成功したり、失敗したりするのは困難である。
CLOSER-Benchは, 予算のかかるクロスステージデザインクロージャのための制御された評価プロトコルである。
1つの設計と1つの隠れた目的のために、Spec-to-RTL、RTL-to-GDS、およびSpec-to-GDSタスクを組み合わせ、すべてのシミュレーター、合成、STA、場所と経路の呼び出しを記録し、最終的な品質、いつでも進歩、ツールコスト、およびステージ間の回復を測定する。
このベンチマークは、オープンソースのVerilator、Yosys、OpenROAD、KLayout、Sky130、Harborエージェントハーネス上に構築されている。
RTL修復、突然変異ベースの検証、カバレッジ、PPA最適化、設計空間探索、クロスモデルデバッグ、セキュリティにまたがる10タスクのパイロットが実行可能ハーネスを確立し、3人のエージェントが局所化されたAXI修復タスクを解決し、マッチした検証閉鎖タスクがフロンティアエージェントを2つの成功したベースラインから分離する。
さらに,RTL-to-GDSフローの完全な検証を行い,ステージペア評価のためのマクロベースのAXI/DMAストリーミングアクセラレータを構築した。
これらの結果は、独立したコード生成タスクの集合よりも、ハードウェアのクロージャを予算付きシーケンシャルな決定問題として扱う動機となっている。
関連論文リスト
- PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents [67.03593791535786]
強化学習(Reinforcement Learning, RL)は、長期のデジタル環境においてGUIエージェントを改善するための有望なアプローチである。
この問題を軽減するため、最近の研究はプロセス・リワード・モデル(PRM)を導入している。
PRMは、グローバルマイルストーン検証やローカルステップレベルの評価を通じて、よりきめ細かいトレーニングフィードバックを提供する。
本稿では,GUIエージェントのためのエンティティ・スタンフロープロセス報酬モデルであるStainFlowを提案する。
論文 参考訳(メタデータ) (2026-06-05T08:17:28Z) - Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents [0.3733676450456031]
テスト時間スケーリングフレームワークであるTrace2Skillを提案する。
新しいモデルをトレーニングしたり、より多くの候補ソリューションをサンプリングする代わりに、Trace2Skillはエージェントの自然言語スキルを進化可能なポリシーとして扱う。
成功と失敗モードのために繰り返しロールアウトトレースをマイニングし、それらを密集した診断やオラクルのレッスンに変換し、オラクル、ミューテータ、セレクタループを使用してタスク固有のスキルを生成する。
論文 参考訳(メタデータ) (2026-05-20T23:10:49Z) - CodeTracer: Towards Traceable Agent States [40.51936201889185]
異種実行アーティファクトを解析し,抽出器を進化させるトレースアーキテクチャであるCodeTracerを提案する。
CodeTracerは、永続的なメモリを持つ階層的なトレースツリーとして、完全な状態遷移履歴を再構築する。
障害発生元とその下流チェーンを特定するために、障害オンセットのローカライゼーションを実行する。
論文 参考訳(メタデータ) (2026-04-13T15:52:03Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Veri-Sure: A Contract-Aware Multi-Agent Framework with Temporal Tracing and Formal Verification for Correct RTL Code Generation [4.723302382132762]
シリコングレードの正しさは、 (i) シミュレーション中心の評価の限られたカバレッジと信頼性、 (ii) 回帰と修復幻覚、 (iii) エージェントハンドオフ間で意図が再解釈される意味的ドリフトによってボトルネックが残っている。
エージェントの意図を整合させる設計契約を確立するマルチエージェントフレームワークであるVeri-Sureを提案する。
論文 参考訳(メタデータ) (2026-01-27T16:10:23Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。