論文の概要: Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation
- arxiv url: http://arxiv.org/abs/2608.26588v1
- Date: Thu, 27 Aug 2026 03:59:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.239524
- Title: Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation
- Title(参考訳): 安全でないか? LLMベースのRTLコード生成におけるセキュリティ侵害
- Abstract要約: SECRTL-GEN: 5つのCWEファミリーに392のタスクと、ブラックボックス機能およびセキュリティテストベンチを備えた4つのHDL。
機能仕様は、故意にセキュリティ義務を省略し、実際に機能文書から義務がどのように守られているかに一致します。
RTL-Obligerは,これらの暗黙の義務を推論するニューロシンボリックな枠組みである。
- 参考スコア(独自算出の注目度): 16.148817642071638
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) generate register-transfer-level (RTL) code with rapidly improving functional correctness. Security of LLM-generated code, however, has been studied mainly for software, where flaws can still be patched after deployment. Insecure RTL offers no such remedy once taped out into silicon. We construct SECRTL-GEN, a multi-language resource-access security benchmark grounded in real SoC IP: 392 tasks over five CWE families and four HDLs (Verilog, SystemVerilog, VHDL, and Python), each with black-box functional and security testbenches. Functional specifications intentionally omit security obligations, matching how obligations are often kept out of functional docs in practice. An empirical study of five frontier LLMs shows a sharp gap: under vanilla prompts they pass functional tests in about 73-79% of cases but security tests in only 14-35%, and stronger functional models are not safer. Adding CWE knowledge raises security, while unaided self-thinking helps less and both security-oriented prompts cut functional pass rates, showing that the bottleneck is missing weakness awareness in the specification, not an inability to write defensive RTL. We present RTL-Obliger, a neuro-symbolic framework that infers these implicit obligations. An LLM extracts a functional-semantic graph from the specification; a symbolic engine then matches it against a CWE pattern ontology to surface mitigation-evidence gaps and signal-level obligations; the LLM finally revises RTL under those obligations in a functionality-preserving two-stage generation. Across five models and four languages, RTL-Obliger raises mean all-pass from 49.6-51.4% (SecV/RESCUE) to 61.6%, with higher security and functional rates than these secure-generation baselines.
- Abstract(参考訳): LLM(Large Language Models)はレジスタ転送レベル(RTL)コードを生成する。
しかし、LLM生成コードのセキュリティは、主にソフトウェア向けに研究されており、デプロイ後にも欠陥をパッチできる。
安全でないRTLは、かつてシリコンに突き刺されたような治療法を提供しない。
5つのCWEファミリーと4つのHDL(Verilog、SystemVerilog、VHDL、Python)に392のタスクがあり、それぞれブラックボックス機能とセキュリティテストベンチがある。
機能仕様は、故意にセキュリティ義務を省略し、実際に機能ドキュメントから義務がどのように守られているかに適合する。
5つのフロンティア LLM の実証的研究は、73-79%のケースで機能テストに合格するが、セキュリティテストは14-35%に過ぎず、より強力な機能モデルの方が安全ではない、という明確なギャップを示している。
セキュリティ指向のプロンプトが機能的なパスレートを減らし、ボトルネックが仕様の弱点の認識を欠いていることを示し、防御的なRTLを書くことができないことを示しています。
RTL-Obligerは,これらの暗黙の義務を推論するニューロシンボリックな枠組みである。
LLMは仕様から関数意味グラフを抽出し、シンボリックエンジンはCWEパターンのオントロジーとマッチングし、表面緩和証拠ギャップと信号レベル義務を解消し、LLMは最終的にこれらの義務の下で2段階生成の機能を更新する。
5つのモデルと4つの言語にまたがって、RTL-Obligerは49.6-51.4%(SecV/RESCUE)から61.6%に全パスを引き上げ、セキュリティと機能率はこれらのセキュアな世代ベースラインよりも高い。
関連論文リスト
- LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - Is Vibe Coding the Future? An Empirical Assessment of LLM Generated Codes for Construction Safety [0.14504054468850666]
本研究では,450のビブ符号化Pythonスクリプトの信頼性,ソフトウェアアーキテクチャ,ドメイン固有の安全性を実証的に評価する。
その結果、ユーザペルソナとデータ幻覚の極めて重要な関係が明らかとなり、フォーマルでないプロンプトがAIの適合性を劇的に増加させ、欠落した安全変数を発明することを示した。
論文 参考訳(メタデータ) (2026-04-14T05:42:29Z) - SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - Internal Safety Collapse in Frontier Large Language Models [65.00730294617382]
この研究は、フロンティア大言語モデル(LLM)における重要な障害モードを特定する。
特定のタスク条件下では、モデルは有害なコンテンツを連続的に生成し、そうでなければ良質なタスクを実行する状態に入る。
有害なコンテンツを生成することが唯一有効な完了であるドメインタスクを通じてISCをトリガーするフレームワークであるTVDを紹介する。
論文 参考訳(メタデータ) (2026-03-04T12:55:34Z) - Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model [60.60587869092729]
大規模言語モデル(LLM)は、ソフトウェア開発でますます使われているが、安全でないコードを生成する傾向は、現実世界のデプロイメントにとって大きな障壁である。
機能保存型セキュアコード生成のためのオンライン強化学習フレームワークSecCoderXを提案する。
論文 参考訳(メタデータ) (2026-02-07T07:42:07Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - TypePilot: Leveraging the Scala Type System for Secure LLM-generated Code [46.747768845221735]
大規模言語モデル(LLM)は、様々なプログラミング言語のコード生成タスクにおいて顕著な習熟度を示している。
それらのアウトプットには微妙だが重要な脆弱性があり、セキュリティに敏感なシステムやミッションクリティカルなシステムにデプロイすると重大なリスクが生じる。
本稿では,LLM生成コードのセキュリティとロバスト性を高めるために設計されたエージェントAIフレームワークであるTypePilotを紹介する。
論文 参考訳(メタデータ) (2025-10-13T08:44:01Z) - Assessing the Quality and Security of AI-Generated Code: A Quantitative Analysis [0.0]
本研究では,Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B, OpenCoder 8Bの5大言語モデル(LLM)のコード品質とセキュリティを定量的に評価する。
LLMは機能的なコードを生成することができるが、バグやセキュリティ上の脆弱性、コードの臭いなど、さまざまなソフトウェア欠陥も導入している。
論文 参考訳(メタデータ) (2025-08-20T14:16:21Z) - HALURust: Exploiting Hallucinations of Large Language Models to Detect Vulnerabilities in Rust [5.539291692976558]
2018年以降、442のRust関連の脆弱性が現実世界のアプリケーションで報告されている。
本稿では,大規模言語モデル(LLM)の幻覚を利用して,現実のRustシナリオの脆弱性を検出する新しいフレームワークであるHALURustを紹介する。
HALURustは、54のアプリケーションにまたがる447の関数と18,691行のコードを含む、81の現実世界の脆弱性のデータセットで評価された。
論文 参考訳(メタデータ) (2025-03-13T18:38:34Z) - Understanding the Effectiveness of Large Language Models in Detecting Security Vulnerabilities [12.82645410161464]
5つの異なるセキュリティデータセットから5,000のコードサンプルに対して、16の事前学習された大規模言語モデルの有効性を評価する。
全体として、LSMは脆弱性の検出において最も穏やかな効果を示し、データセットの平均精度は62.8%、F1スコアは0.71である。
ステップバイステップ分析を含む高度なプロンプト戦略は、F1スコア(平均0.18まで)で実世界のデータセット上でのLLMのパフォーマンスを著しく向上させることがわかった。
論文 参考訳(メタデータ) (2023-11-16T13:17:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。