論文の概要: Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation
- arxiv url: http://arxiv.org/abs/2608.02672v1
- Date: Sun, 02 Aug 2026 14:45:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.883001
- Title: Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation
- Title(参考訳): テキスト・ツー・Terraformのセキュリティファースト評価:セキュアIaC生成のためのLLMとSLMのベンチマーク
- Authors: Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz,
- Abstract要約: クラウドの構成ミスはセキュリティインシデントの主要な原因であり続けているが、LLMとSLMがセキュリティに準拠したインフラストラクチャ・アズ・コードを生成することができるかどうかは未解決の問題だ。
7つのモデル(Claude Opus 4, GPT-5.4, Gemini 2.5 Pro)と4つのオープンなSLM(Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B, Magicoder-S-CL-7B)をAWS Terraform生成で17のシナリオにわたってベンチマークし、CheckovとTrivyスキャナをGitLab CI/CDパイプラインに統合し、3つのセキュリティレベル(3つのセキュリティレベル(それぞれ)で2つの迅速な戦略を評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cloud misconfiguration remains a leading cause of security incidents, yet whether LLMs and SLMs can generate security-compliant Infrastructure-as-Code is an open question. We benchmark seven models, three closed LLMs (Claude Opus 4, GPT-5.4, Gemini 2.5 Pro) and four open SLMs (Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B, Magicoder-S-CL-7B), on AWS Terraform generation across 17 scenarios, integrating Checkov and Trivy scanners into a GitLab CI/CD pipeline and evaluating two prompt strategies at three security levels (pass@5). Syntactic validity and security compliance are largely orthogonal properties in LLM-generated IaC, a model that reliably produces well-formed Terraform does not necessarily produce secure Terraform: WizardCoder-33B achieves 77.8% validate rate yet zero Checkov compliance, while Claude Opus 4 reaches 23.1% Checkov and 92.5% Trivy pass rates under detailed security prompting. Consequently, prompt engineering alone is insufficient: automated multi-tool scanning remains a necessary complement to LLM-assisted IaC generation regardless of model family or prompt strategy. All artifacts are publicly available.
- Abstract(参考訳): クラウドの構成ミスはセキュリティインシデントの主要な原因であり続けているが、LLMとSLMがセキュリティに準拠したインフラストラクチャ・アズ・コードを生成することができるかどうかは未解決の問題だ。
私たちはAWS Terraform生成に7つのモデル(Claude Opus 4, GPT-5.4, Gemini 2.5 Pro)と4つのオープンなSLM(Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B, Magicoder-S-CL-7B)をベンチマークし、CheckovとTrivyスキャナをGitLab CI/CDパイプラインに統合し、3つのセキュリティレベル(pass@5)で2つの迅速な戦略を評価する。
WizardCoder-33Bは77.8%の検証レートを達成しているが、Crede Opus 4は23.1%、Trivyのパスレート92.5%に達している。
自動マルチツールスキャンは、モデルファミリやプロンプト戦略に関わらず、LLM支援IaC生成に必須の補完となる。
すべてのアーティファクトが公開されています。
関連論文リスト
- Enhancing Reliability in LLM-Based Secure Code Generation [10.791767027934858]
大規模言語モデル(LLM)はコード生成に広く使用されているが、セキュリティの信頼性は言語間で不整合であり、戦略を推進している。
タスク固有のCWE緩和ガイダンスと言語対応セーフガードを組み込んだtextitMitigation-Aware Chain-of-Thought(MA-CoT)フレームワークを紹介する。
我々は、3つのLLM(gpt-5, claude-4.5, gemini-2.5)、3つのプログラミング言語(C, Java, Python)、4つのプロンプト戦略についてMA-CoTを評価した。
論文 参考訳(メタデータ) (2026-05-22T23:58:56Z) - Are Frontier LLMs Ready for Cybersecurity? Evidence for Vertical Foundation Models from Dual-Mode Vulnerability Benchmarks [0.3303672705634661]
デュアルモードベンチマークにより,フロンティアLSMがサイバーセキュリティの準備ができているかを評価する。
我々は6つのフロンティアモデル(GPT-5.4、Codex5.3、Claude Opus4.6、Sonnet4.6、Gemini3.1Pro、Gemini3Flash)と4つのテストパラダイムにまたがる2つのドメイン特化モデルをテストする。
論文 参考訳(メタデータ) (2026-05-22T05:24:43Z) - Does Teaming-Up LLMs Improve Secure Code Generation? A Comprehensive Evaluation with Multi-LLMSecCodeEval [22.812621042022105]
Multi-LLMSECCODEEVALは、脆弱性管理ライフサイクル全体にわたるセキュリティの評価と強化のためのフレームワークである。
シングルモデル、アンサンブル、コラボレーティブ、ハイブリッドデザインにまたがる10のパイプラインをベンチマークします。
論文 参考訳(メタデータ) (2026-03-24T02:13:31Z) - Internal Safety Collapse in Frontier Large Language Models [65.00730294617382]
この研究は、フロンティア大言語モデル(LLM)における重要な障害モードを特定する。
特定のタスク条件下では、モデルは有害なコンテンツを連続的に生成し、そうでなければ良質なタスクを実行する状態に入る。
有害なコンテンツを生成することが唯一有効な完了であるドメインタスクを通じてISCをトリガーするフレームワークであるTVDを紹介する。
論文 参考訳(メタデータ) (2026-03-04T12:55:34Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities [50.980446687774645]
本稿では,対戦型LDMをジェイルブレイク能力に富んだ反復的自己調整プロセスであるADV-LLMを紹介する。
我々のフレームワークは,様々なオープンソース LLM 上で ASR を100% 近く達成しながら,逆接接尾辞を生成する計算コストを大幅に削減する。
Llama3のみに最適化されているにもかかわらず、GPT-3.5では99%のASR、GPT-4では49%のASRを達成している。
論文 参考訳(メタデータ) (2024-10-24T06:36:12Z) - HexaCoder: Secure Code Generation via Oracle-Guided Synthetic Training Data [60.75578581719921]
大規模言語モデル(LLM)は、自動コード生成に大きな可能性を示している。
最近の研究は、多くのLLM生成コードが深刻なセキュリティ脆弱性を含んでいることを強調している。
我々は,LLMがセキュアなコードを生成する能力を高めるための新しいアプローチであるHexaCoderを紹介する。
論文 参考訳(メタデータ) (2024-09-10T12:01:43Z) - How Well Do Large Language Models Serve as End-to-End Secure Code Agents for Python? [42.119319820752324]
GPT-3.5 と GPT-4 の 4 つの LLM で生成されたコードの脆弱性を識別し,修復する能力について検討した。
4900のコードを手動または自動でレビューすることで、大きな言語モデルにはシナリオ関連セキュリティリスクの認識が欠けていることが判明した。
修復の1ラウンドの制限に対処するため,LLMにより安全なソースコード構築を促す軽量ツールを開発した。
論文 参考訳(メタデータ) (2024-08-20T02:42:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。