論文の概要: Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining
- arxiv url: http://arxiv.org/abs/2607.12089v1
- Date: Mon, 13 Jul 2026 19:10:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.938569
- Title: Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining
- Title(参考訳): メタモルフィックテストとアソシエーションルールマイニングによるLLM生成コードのクロスカッティングセキュリティ解析
- Abstract要約: 大規模言語モデル(LLM)はセキュリティ上の脆弱性のあるコードを生成することが多いが、これらの弱点を分離することは滅多にない。
本稿では,セキュリティ指向のメタモルフィックリレーショナル(MR)とアソシエーションルール(AR)マイニングを組み合わせて,LLM生成コードの脆弱性を検出するフレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.7844254062143549
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) frequently generate code with security vulnerabilities, yet these weaknesses are rarely isolated: they often span multiple concern areas simultaneously, reflecting the cross-cutting nature of security in software. We present a framework that combines security-oriented Metamorphic Relations (MRs) with Association Rule (AR) mining to detect vulnerabilities in LLM-generated code, uncover their co-violation structure, and trace that structure back to prompt-level risk factors. We define nine MRs covering major CWE categories, including SQL injection, XSS, command injection, path traversal, hard-coded credentials, weak cryptography, and memory-safety errors, and apply them using an LLM-based judge to 3,700 code snippets generated by five open models from the LLMSecEval benchmark. The results show that 68.8% of snippets violate at least one MR, with hard-coded credentials (79.1%) and command injection (74.4%) among the most prevalent applicable failures. AR mining reveals strong cross-cutting co-violation patterns, notably that XSS and weak cryptography co-violations predict hard-coded credentials with 82.5% confidence (lift = 3.23), along with tightly coupled clusters linking authentication, credential handling, and cryptographic weakness, as well as input-handling and memory-safety failures. We then perform prompt-level risk analysis and find that database- and authentication-related prompts are strong predictors of broad cross-cutting insecurity, while 65.5% of prompts yield consistent violation outcomes across all five models. These findings show that insecure code generation is not merely a collection of independent defects, but a structured and prompt-conditioned phenomenon, motivating cluster-aware verification and prompt-level intervention for safer LLM-assisted programming.
- Abstract(参考訳): 大規模言語モデル(LLM)はセキュリティ上の脆弱性のあるコードを生成することが多いが、これらの弱点は分離されることが稀である。
本稿では,セキュリティ指向のメタモルフィックリレーション(MR)とアソシエーションルール(AR)マイニングを組み合わせて,LLM生成コードの脆弱性を検出し,その共犯構造を明らかにし,その構造を即時リスク要因に遡るフレームワークを提案する。
SQLインジェクション、XSS、コマンドインジェクション、パストラバーサル、ハードコード認証、弱い暗号、メモリセーフティエラーなど、主要なCWEカテゴリをカバーする9つのMRを定義し、LLMSecEvalベンチマークから5つのオープンモデルによって生成された3,700個のコードスニペットに対してLSMベースの判断を用いてそれらを適用する。
その結果、68.8%のスニペットが少なくとも1つのMRに違反しており、最も一般的な障害のうち、ハードコードされた資格情報(79.1%)とコマンドインジェクション(74.4%)があることがわかった。
ARマイニングは、XSSと弱い暗号の共違反が82.5%の信頼性(リフト=3.23)でハードコードされた認証を予測し、認証、クレデンシャルハンドリング、暗号化の弱点をリンクする密結合クラスタと、入力処理とメモリ安全性の障害を予測している。
次に、プロンプトレベルのリスク分析を行い、データベースおよび認証関連プロンプトが、広範囲にわたる横断的セキュリティの強い予測因子であるのに対して、65.5%のプロンプトは、5つのモデルすべてに一貫性のある違反結果をもたらす。
これらの結果は、安全性の低いコード生成は、単に独立した欠陥の集合ではなく、構造化された、迅速な条件付き現象であり、クラスタ認識検証の動機付けと、より安全なLCM支援プログラミングのための即時介入であることを示している。
関連論文リスト
- Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs [46.747768845221735]
単一文字の変更ほど小さな突然変異は、生成されたコードをセキュアから脆弱に切り替えることが可能であることを示す。
その結果、入力ハンドリングの欠陥は生成前に捕捉可能である一方で、セキュアなデフォルトの欠陥はデコード時に介入を必要とすることがわかった。
論文 参考訳(メタデータ) (2026-05-28T10:30:28Z) - Enhancing Reliability in LLM-Based Secure Code Generation [10.791767027934858]
大規模言語モデル(LLM)はコード生成に広く使用されているが、セキュリティの信頼性は言語間で不整合であり、戦略を推進している。
タスク固有のCWE緩和ガイダンスと言語対応セーフガードを組み込んだtextitMitigation-Aware Chain-of-Thought(MA-CoT)フレームワークを紹介する。
我々は、3つのLLM(gpt-5, claude-4.5, gemini-2.5)、3つのプログラミング言語(C, Java, Python)、4つのプロンプト戦略についてMA-CoTを評価した。
論文 参考訳(メタデータ) (2026-05-22T23:58:56Z) - An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods [11.454777386934632]
自動コード生成のための大規模言語モデル(LLM)は、ソフトウェア開発の効率を向上するが、しばしばセキュリティの犠牲になる。
5つのLLMおよび4つのプログラミング言語にわたるLLM生成コードのセキュリティ品質を総合的に評価する。
モデル推論を導くために,CWEマッピングを用いてセキュリティコンテキストでプロンプトを充実させる手法として,弱点を意識したゼロショット・チェーン・オブ・ソート(WA-0CoT)を導入する。
論文 参考訳(メタデータ) (2026-05-22T23:52:33Z) - SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization [61.91729298584227]
SecureForgeは、フロンティアモデルのセキュリティリスクを監査し、監査インフォームされたセキュアなシステムプロンプトを生成する自動化パイプラインである。
SecureForgeは、まず静的に検出可能な脆弱性を生成する良性プロンプトを特定し、その後、さまざまなシナリオの大規模な合成プロンプトコーパスに増幅する。
フロンティアモデルでは、SecureForgeは、ユニットテストの成功と出力セキュリティの両方において統計的に有意な改善をもたらし、出力脆弱性は最大48%削減された。
論文 参考訳(メタデータ) (2026-05-08T18:40:47Z) - SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security [0.0]
大規模言語モデル(LLM)は、ネイティブコードインタプリタを統合し、リアルタイム実行機能を実現する。
これらの統合は、システムレベルのサイバーセキュリティの脅威をもたらす可能性がある。
本稿では、CPU、メモリ、ディスクリソースの枯渇をターゲットとした1,260プロンプトからなる単純なベンチマークであるCIRCLE(Code-Interpreter Resilience Check for LLM Exploits)を提案する。
論文 参考訳(メタデータ) (2025-07-25T16:06:16Z) - Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories [8.583591493627276]
JitVulは、各関数をその脆弱性導入とコミットの修正にリンクする脆弱性検出ベンチマークである。
思考・行動・観察と相互言語的文脈を活用するReAct Agentsは,良性のあるコードと区別する上で,LLMよりも優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2025-03-05T15:22:24Z) - Exploring Automatic Cryptographic API Misuse Detection in the Era of LLMs [60.32717556756674]
本稿では,暗号誤用の検出において,大規模言語モデルを評価するための体系的評価フレームワークを提案する。
11,940個のLCM生成レポートを詳細に分析したところ、LSMに固有の不安定性は、報告の半数以上が偽陽性になる可能性があることがわかった。
最適化されたアプローチは、従来の手法を超え、確立されたベンチマークでこれまで知られていなかった誤用を明らかにすることで、90%近い顕著な検出率を達成する。
論文 参考訳(メタデータ) (2024-07-23T15:31:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。