論文の概要: Newer and Bigger, but Safer? A Longitudinal Study of the Functionality-Security Gap in LLM-Generated Code
- arxiv url: http://arxiv.org/abs/2610.08240v1
- Date: Tue, 06 Oct 2026 12:25:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.97844
- Title: Newer and Bigger, but Safer? A Longitudinal Study of the Functionality-Security Gap in LLM-Generated Code
- Title(参考訳): LLM生成符号における機能・セキュリティギャップの経時的検討
- Abstract要約: 大規模言語モデル(LLM)は、コードを生成するために広く使われている。
それらの機能的信頼性は改善され続けているが、生成されたコードにはセキュリティ上の脆弱性がしばしば含まれている。
最近の3つのモデルファミリーの縦断的研究は、LSMはより賢く、より安全ではないと結論づけた。
- 参考スコア(独自算出の注目度): 3.2556572148785605
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are widely used to generate code. Although their functional plausibility keeps improving, the generated code often contains security vulnerabilities. The functionality-security gap captures code that passes functional tests but fails security tests. A recent longitudinal study of three model families concluded that LLMs become smarter but not safer, with the only considered open-weight family stagnating. Whether this holds for other (open-weight) families and particularly for compact models remains open. We present a longitudinal study of the gap across 32 LLMs from seven model families (five open-weight), covering three successive releases per family in flagship and compact variants. Using CWEval with 119 tasks in five programming languages and 31 CWEs, we compare trajectories across families, model sizes, and languages. Newer models do become safer in absolute terms, although no family closes the gap. Unlike prior work, we find that openness does not separate the families: every considered open-weight family narrows the gap significantly, while Gemini 3.1 Pro keeps a gap as wide as the one reported for Llama. Compact models usually produce less secure code than their flagship counterparts, with notable exceptions (e.g., Gemini 3.7 Flash). At the CWE level, we confirm persistent weaknesses such as log injection (CWE-117) and HTTP response splitting (CWE-113) and regressions in the newest proprietary models on memory and integer weaknesses, and show that the same CWE carries very different risk across languages. From these results, we derive implications for LLM vendors, researchers, and developers. In particular, developers should assume neither that upgrades improve security nor that proprietary models are more secure; they should rerun security checks after each model change and provide secure APIs in the model's context.
- Abstract(参考訳): 大規模言語モデル(LLM)は、コードを生成するために広く使われている。
それらの機能的信頼性は改善され続けているが、生成されたコードにはセキュリティ上の脆弱性がしばしば含まれている。
機能-セキュリティギャップは、機能テストに合格するがセキュリティテストに失敗するコードをキャプチャする。
最近の3つのモデルファミリーの縦断的研究は、LLMはより賢く、より安全ではないと結論付けている。
これが他の(オープンウェイトな)族、特にコンパクトモデルに当てはまるかどうかは未定である。
フラッグシップおよびコンパクトな7つのモデルファミリー(5つのオープンウェイト)から32個のLLM間のギャップについて縦断的研究を行い、各ファミリーの3つのリリースをフラッグシップおよびコンパクトなバリエーションでカバーした。
5つのプログラミング言語と31のCWEで119のタスクを持つCWEvalを用いて、家族、モデルサイズ、言語間のトラジェクトリを比較する。
新しいモデルは絶対的に安全になるが、そのギャップを埋める家族はいない。
従来の研究とは異なり、オープンネスは家族を分離しない: オープンウェイトとみなされたすべての家族がギャップを著しく狭くし、ジェミニ3.1 Proはラマが報告したようにギャップを狭めている。
コンパクトモデルは通常、フラッグシップモデルよりも安全性の低いコードを生成するが、例外はある(例: Gemini 3.7 Flash)。
CWEレベルでは、ログインジェクション(CWE-117)やHTTP応答分割(CWE-113)といった永続的な弱点と、メモリおよび整数の弱点に関する最新のプロプライエタリモデルにおける回帰を確認し、同じCWEが言語間で非常に異なるリスクを持つことを示す。
これらの結果から, LLMベンダ, 研究者, 開発者への影響が示唆された。
特に開発者は、アップグレードによってセキュリティが改善されたり、プロプライエタリなモデルがよりセキュアになったりしないと仮定する必要がある。
関連論文リスト
- Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation [16.148817642071638]
SECRTL-GEN: 5つのCWEファミリーに392のタスクと、ブラックボックス機能およびセキュリティテストベンチを備えた4つのHDL。
機能仕様は、故意にセキュリティ義務を省略し、実際に機能文書から義務がどのように守られているかに一致します。
RTL-Obligerは,これらの暗黙の義務を推論するニューロシンボリックな枠組みである。
論文 参考訳(メタデータ) (2026-08-27T03:59:55Z) - Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions [52.50730821321986]
大規模言語モデル(LLM)におけるバージョンレベルのリスクの大規模評価を初めて行った。
我々は1000のStack OverflowプログラミングタスクのベンチマークであるPinTrace上で10のLLMを評価した。
LLM バージョン選択は LLM ベース開発における第1級, 以前は見落とされたリスクサーフェスとして確認された。
論文 参考訳(メタデータ) (2026-05-07T13:52:59Z) - SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model [60.60587869092729]
大規模言語モデル(LLM)は、ソフトウェア開発でますます使われているが、安全でないコードを生成する傾向は、現実世界のデプロイメントにとって大きな障壁である。
機能保存型セキュアコード生成のためのオンライン強化学習フレームワークSecCoderXを提案する。
論文 参考訳(メタデータ) (2026-02-07T07:42:07Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models [63.54707418559388]
ソフトウェアバージョンのような大型言語モデル(LLM)に対するパッチを提案する。
提案手法は,既存のモデルにコンパクトで学習可能なプレフィックスを前もって,迅速な修復を可能にする。
論文 参考訳(メタデータ) (2025-11-11T17:25:44Z) - Secure Code Generation at Scale with Reflexion [0.0]
Pythonは最高安全率、CとC#は最低である。
反射により全てのモデルのセキュリティが向上し、平均精度はt0で70.74%からt3で79.43%に向上した。
論文 参考訳(メタデータ) (2025-11-05T22:46:24Z) - When AI Takes the Wheel: Security Analysis of Framework-Constrained Program Generation [20.940139710065306]
本研究では,最先端LLMが生成するフレームワーク制約プログラムのセキュリティ特性について検討する。
複数の特権境界と分離されたコンポーネントを含む複雑なセキュリティモデルのために、Chromeエクステンションに特化しています。
これらのプロンプトを使用して、9つの最先端のLCMに、完全なChromeエクステンションを生成するように指示し、脆弱性を解析しました。
論文 参考訳(メタデータ) (2025-10-19T13:19:20Z) - Qwen3Guard Technical Report [127.69960525219051]
Qwen3Guardは、多言語安全ガードレールモデルである。
生成的Qwen3Guardは、きめ細かい三級判定を可能にする命令追従タスクとして安全分類をキャストする。
Stream Qwen3Guardは、リアルタイム安全監視のためのトークンレベルの分類ヘッドを導入している。
論文 参考訳(メタデータ) (2025-10-16T04:00:18Z) - The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models [5.984437476321095]
我々は,最先端のオープンウェイトモデルの安全性ギャップを推定するツールキットをオープンソースとして公開した。
生物化学的, サイバー的能力, 拒絶率, モデル生成品質を2つの家系で評価した。
実験の結果,モデルスケールの増大とともに安全ギャップが拡大し,安全ガードを取り外すと有効危険能力が著しく増大することがわかった。
論文 参考訳(メタデータ) (2025-07-08T23:58:01Z) - How secure is AI-generated Code: A Large-Scale Comparison of Large Language Models [3.4887856546295333]
本研究では,C言語記述時の脆弱性発生傾向について,最先端のLarge Language Model (LLM)を比較した。
生成されたプログラムの少なくとも62.07%は脆弱性がある。
論文 参考訳(メタデータ) (2024-04-29T01:24:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。