論文の概要: Evaluating and Preventing Security Smells in AI-Generated Ansible Code
- arxiv url: http://arxiv.org/abs/2608.24962v1
- Date: Tue, 25 Aug 2026 07:15:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.300909
- Title: Evaluating and Preventing Security Smells in AI-Generated Ansible Code
- Title(参考訳): AI生成アンシブルコードにおけるセキュリティスメルの評価と防止
- Abstract要約: CISベンチマークに対して、Apache Tomcat v10とMongoDB v7のロールを生成する16のAIモデルを評価します。
セキュリティガイダンスがなければ、すべての16のAIモデルは、セキュリティの臭いを含むコードを生成し、結果として、コンプライアンスの検証に失敗し、人間の開発者が書いたコードを過小評価する脆弱なインフラストラクチャを生み出した。
我々は、ベストプラクティスとCISベンチマークをプロンプトに統合するアプローチを導入し、デプロイ後の検出よりも、合成中のセキュリティの臭い防止を可能にする。
- 参考スコア(独自算出の注目度): 0.3262230127283452
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI coding assistants generate Infrastructure as Code, yet no work has examined whether this code meets security requirements. This matters because security smells in infrastructure code propagate to deployed systems, producing infrastructure that is insecure and untrustworthy. We evaluate 16 AI models generating Ansible roles for Apache Tomcat v10 and MongoDB v7, analysing 278 Ansible roles against CIS benchmarks. Without security guidance, all 16 AI models produced code containing security smells, resulting in vulnerable infrastructure that fails compliance verification and underperforms code written by human developers. We introduce an approach integrating Ansible best practices and CIS benchmarks into prompts through an extended CO-STAR framework, enabling security smell prevention during synthesis rather than detection after deployment. When this approach is applied, 4 out of 16 models generate compliant code, with the leading model achieving 95%-100% CIS compliance, a fourfold improvement over humans at 23%-43%, with overall code quality improving by 19%-49%. The remaining 12 models fail not because they cannot generate code but because they cannot follow instructions with multiple constraints. For capable models, the approach requires no retraining and can be adopted through system prompts.
- Abstract(参考訳): AIコーディングアシスタントはインフラストラクチャ・アズ・コードを生成するが、このコードがセキュリティ要件を満たすかどうかを調査する作業は行われていない。
これは、インフラストラクチャコードのセキュリティの臭いが、デプロイされたシステムに伝播し、安全で信頼できないインフラストラクチャを生成するためである。
我々は、Apache Tomcat v10とMongoDB v7のAnsibleロールを生成する16のAIモデルを評価し、CISベンチマークに対して278のAnsibleロールを分析した。
セキュリティガイダンスがなければ、すべての16のAIモデルは、セキュリティの臭いを含むコードを生成し、結果として、コンプライアンスの検証に失敗し、人間の開発者が書いたコードを過小評価する脆弱なインフラストラクチャを生み出した。
我々は,拡張CO-STARフレームワークを通じて,AnsibleのベストプラクティスとCISベンチマークをプロンプトに統合するアプローチを導入する。
このアプローチを適用すると、16モデル中4つのモデルが準拠コードを生成し、95%-100%のCIS準拠を実現し、人間の4倍の改善が23%-43%となり、全体的なコード品質が19%-49%向上した。
残りの12モデルは、コードを生成することができないためではなく、複数の制約を持つ命令に従うことができないため失敗する。
有能なモデルでは、このアプローチは再トレーニングを必要とせず、システムプロンプトを通じて適用することができる。
関連論文リスト
- CoGate: Confidence-Gated Co-Decoding for Secure Code Generation [13.805072106442042]
本稿では,その信頼度に基づいて,専門家のコデコーディングプロセスへの影響を制御できる信頼度付きコデコーディング手法を提案する。
提案手法は,複数のベンチマークで既存のココード手法(CoSec+)より優れている。
論文 参考訳(メタデータ) (2026-07-30T17:02:12Z) - Security Vulnerability Patterns in AI-Generated Code: A Cross-Model Comparative Study [0.0]
リスクは特定のモデルではなく、タスクカテゴリに結びついています。
プラットフォーム間でのCVSSスコアの重み付けは10%以下であった。
論文 参考訳(メタデータ) (2026-07-22T20:31:11Z) - Selective Safety Steering via Value-Filtered Decoding [54.87935112120107]
大型言語モデル(LLM)は人間の価値観に合わせるように訓練されているが、その世代は安全上の制約に反する可能性がある。
既存のデコード時のステアリング手法は、しばしば不要に介入し、ベースモデルの下で安全であった世代を変更する。
安全でない応答の安全性を向上しつつ、そのような不要な介入を減らすための新しいテストタイムステアリング手法を提案する。
論文 参考訳(メタデータ) (2026-05-14T12:13:08Z) - SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - LLMs + Security = Trouble [5.235480194772795]
「火を点ける」アプローチでは、セキュリティバグの長い尾尾に対処できない。
コード生成中にセキュリティ制約を強制することで、より強力なセキュリティ保証を得ることができる、と私たちは主張する。
論文 参考訳(メタデータ) (2026-02-09T09:27:28Z) - Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model [60.60587869092729]
大規模言語モデル(LLM)は、ソフトウェア開発でますます使われているが、安全でないコードを生成する傾向は、現実世界のデプロイメントにとって大きな障壁である。
機能保存型セキュアコード生成のためのオンライン強化学習フレームワークSecCoderXを提案する。
論文 参考訳(メタデータ) (2026-02-07T07:42:07Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - SecureCode v2.0: A Production-Grade Dataset for Training Security-Aware Code Generation Models [0.0]
SecureCode v2.0は、構造検証と専門家によるセキュリティレビューをパスした1,215のセキュリティ中心のコーディングサンプルのプロダクショングレードデータセットである。
データセットは11言語にわたる11の脆弱性カテゴリ(トップ10:2025とAI/MLセキュリティ脅威)をカバーする。
それぞれの例には、SIEM統合戦略、インフラストラクチャ強化レコメンデーション、言語対応フレームワークを使用したテストアプローチなどがある。
論文 参考訳(メタデータ) (2025-12-20T23:52:12Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - RedCode: Risky Code Execution and Generation Benchmark for Code Agents [50.81206098588923]
RedCodeはリスクの高いコード実行と生成のためのベンチマークである。
RedCode-Execは、危険なコード実行につながる可能性のある、挑戦的なプロンプトを提供する。
RedCode-Genは160のプロンプトに関数シグネチャとドキュメントを入力として提供し、コードエージェントが命令に従うかどうかを評価する。
論文 参考訳(メタデータ) (2024-11-12T13:30:06Z) - Enhancing Security of AI-Based Code Synthesis with GitHub Copilot via Cheap and Efficient Prompt-Engineering [1.7702475609045947]
開発者や企業がその潜在能力を最大限に活用することを避けている理由の1つは、生成されたコードに対する疑わしいセキュリティである。
本稿ではまず,現状を概観し,今後の課題について述べる。
我々は、GitHub CopilotのようなAIベースのコードジェネレータのコードセキュリティを改善するために、プロンプト変換手法に基づく体系的なアプローチを提案する。
論文 参考訳(メタデータ) (2024-03-19T12:13:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。