論文の概要: Benchmarking LLMs for Verilog Design Flows
- arxiv url: http://arxiv.org/abs/2607.22759v1
- Date: Thu, 23 Jul 2026 21:00:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.867935
- Title: Benchmarking LLMs for Verilog Design Flows
- Title(参考訳): VerilogデザインフローのためのLLMのベンチマーク
- Abstract要約: 大規模言語モデル(LLM)は、コード生成において有望であるが、正しい合成可能なハードウェア記述言語(HDL)コードを生成する能力は、まだ適切にベンチマークされている。
本稿では,Verilog RTL 生成におけるオープンソース LLM の評価を行う再現可能なベンチマークプラットフォームを提案する。
このパイプラインは構文の妥当性を0%から70.43%に改善し、シミュレーションパスレートは3つのオープンソースモデルで51.8%に向上した。
- 参考スコア(独自算出の注目度): 6.24010225101442
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) show promise in code generation, but their capabilities to produce correct, synthesizable hardware description language (HDL) code still remain to be properly benchmarked. Existing evaluations are primarily relying on pass@k metrics and lack proper end-to-end toolchain validation. This paper presents a reproducible benchmarking platform that evaluates open-source LLMs on Verilog RTL generation across 50 curated tasks consisting of combinational, sequential, finite state machine (FSM), and mixed designs. The pipeline consisting of constrained prompting, post-processing, and semantic-aware iterative refinement with waveform analysis, formal equivalence verification, and Abstract Syntax Tree (AST)-based repair validates the generated code via Verilator compilation and Icarus Verilog simulation. Across the 12 benchmarks and the 1,610 total runs evaluating three models of different sizes (Llama-3-8B, StarCoder2-7B, and TinyLlama-1.1B), the pipeline improved syntax validity from 0% to a 70.43% average and simulation pass rate to 51.8% across three open-source models. Most notably TinyLlama (1.1B parameters) achieved the highest individual syntax validity at 80.0%, with functional correctness comparable to the 8B model. The platform and dataset are open-source, enabling reproducible evaluation of generative AI for hardware design workflows.
- Abstract(参考訳): 大規模言語モデル(LLM)は、コード生成において有望であるが、正しい合成可能なハードウェア記述言語(HDL)コードを生成する能力は、まだ適切にベンチマークされている。
既存の評価は主にpass@kメトリクスに依存しており、適切なエンドツーエンドツールチェーン検証がない。
本稿では,組合わせ,シーケンシャル,有限状態マシン (FSM) と混合設計からなる50のキュレートタスクに対して,Verilog RTL生成におけるオープンソースのLLMを評価する再現可能なベンチマークプラットフォームを提案する。
このパイプラインは、波形解析、形式的等価性検証、抽象構文木(AST)に基づく修復により、制約付きプロンプト、後処理、意味対応型反復改善で構成され、VerilatorコンパイルとIcarus Verilogシミュレーションによって生成されたコードを検証する。
12のベンチマークと1,610回の合計で、異なるサイズの3つのモデル(Llama-3-8B、StarCoder2-7B、TinyLlama-1.1B)を評価し、パイプラインは構文の妥当性を0%から70.43%に改善し、シミュレーションパスレートは3つのオープンソースモデルで51.8%に改善した。
中でも、TinyLlama (1.1Bパラメータ) は80.0%で、機能的正しさは8Bモデルに匹敵する。
プラットフォームとデータセットはオープンソースで、ハードウェア設計ワークフローのための生成AIの再現可能な評価を可能にする。
関連論文リスト
- ToolLoop: Closed-Loop Tool-Use Data Synthesis via Decomposed Generation and Dynamic Self-Feedback [10.658946043856124]
高品質のツール使用データは、言語モデルをトレーニングし、外部ツールと効果的に対話するために重要である。
合成を3段階に分解するクローズドループフレームワークであるToolLoopを提案する。
動的自己フィードバックは、モデルを高品質な生成に向けて反復的に導く。
論文 参考訳(メタデータ) (2026-09-08T17:26:35Z) - Generating Workflow DAGs from Natural Language with Non-Reasoning LLMs [0.08537603362277842]
ニューロシンボリックな分解により、より低コストで非合理的な大規模言語モデルにより複雑なワークフローDAGを生成することができることを示す。
本手法は,判定精度を24ポイント向上し,推論モデルのアウト・オブ・ザ・ボックス品質に対する統計的等価性を実現する。
論文 参考訳(メタデータ) (2026-08-31T05:01:29Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design [0.4499833362998488]
3つの評価次元を持つベンチマークスイートを導入する。
本稿では,LangGraph上に構築されたマルチエージェントシステム(MAS)の実装であるEngiAIを紹介する。
論文 参考訳(メタデータ) (2026-05-19T12:12:09Z) - LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening [69.1037790901185]
現実的な状況シナリオから構築した中国の論理的推論ベンチマークLLMEval-Logicを提案する。
パイプラインのフォワードオーサとエキスパート-オーディット 自然言語アイテムは、参照の形式化とともに、Z3による注釈付き回答を検証し、自然言語から形式へのグレーディングのためのエキスパートルーブリックを構築し、クローズドループの逆行ワークフローを通じて選択されたアイテムを硬化させる。
論文 参考訳(メタデータ) (2026-05-19T09:40:29Z) - LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources [0.7734726150561088]
行方不明者や子どもの安全に関する調査は、構造化フォーム、掲示板スタイルのポスター、物語ウェブプロファイルなど、異種ケース文書に依存している。
レイアウト、用語、データ品質の変化は、急激なトリアージ、大規模分析、探索計画を妨げる。
本稿では、AIによる解析および正規化パイプラインであるGuardian Packを紹介し、マルチソース調査文書を統一されたスキーマ準拠の表現に変換する。
論文 参考訳(メタデータ) (2026-04-08T01:35:56Z) - Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation [3.225273674498579]
我々は,大言語モデルがコンパイルフェーズ中に実行可能なコードアーティファクトを生成するパラダイムであるコンパイルAIについて研究し,その後,さらなるモデル実行を必要とせずに決定的に実行する。
当社のコントリビューションは、ハイテイクなランタイムエンタープライズへの適用に関するシステム指向の研究です。
論文 参考訳(メタデータ) (2026-04-06T20:25:20Z) - DiffuRank: Effective Document Reranking with Diffusion Language Models [71.16830004674513]
拡散言語モデル(dLLM)に基づいて構築されたフレームワークであるDiffuRankを提案する。
dLLMは、左から右への順序に制約されないより柔軟なデコーディングと生成プロセスをサポートする。
モデルサイズが類似した自己回帰LDMに匹敵する性能を示す。
論文 参考訳(メタデータ) (2026-02-13T02:18:14Z) - Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models [96.0074341403456]
LLM推論を改善するための実用的な方法として、推論時計算が再導入されている。
テスト時間スケーリング(TTS)アルゴリズムの多くは、自動回帰デコーディングに依存している。
そこで我々は,dLLM のための効率的な TTS フレームワーク Prism を提案する。
論文 参考訳(メタデータ) (2026-02-02T09:14:51Z) - QiMeng-CodeV-R1: Reasoning-Enhanced Verilog Generation [51.393569044134445]
大きな言語モデル(LLM)は、強化学習と検証可能な報酬(RLVR)によって訓練され、明示的で自動化可能な検証を伴うタスクにおいてブレークスルーを達成した。
しかし、自然言語(NL)仕様からVerilogのようなハードウェア記述言語(HDL)を自動的に生成するRLVRの拡張には、3つの大きな課題がある。
本稿では,Verilog 生成 LLM をトレーニングするための RLVR フレームワークである CodeV-R1 を紹介する。
論文 参考訳(メタデータ) (2025-05-30T03:51:06Z) - AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models [86.83875864328984]
本稿では,オープンエンド論理パズルを自動合成する手法を提案し,それをバイリンガルベンチマークであるAutoLogiの開発に利用する。
提案手法は,プログラムベースの検証と制御可能な難易度を特徴とし,モデルの推論能力をよりよく区別する信頼性の高い評価を可能にする。
論文 参考訳(メタデータ) (2025-02-24T07:02:31Z) - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking [58.15568681219339]
大規模言語モデル(LLM)を評価するための新しいベンチマークであるEquiBenchを紹介する。
このタスクは、プログラムのセマンティクスについて推論するモデルの能力を直接テストする。
19の最先端LCMを評価し、最も難しいカテゴリでは、最高の精度は63.8%と76.2%であり、50%のランダムベースラインよりわずかに高い。
論文 参考訳(メタデータ) (2025-02-18T02:54:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。