論文の概要: The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code
- arxiv url: http://arxiv.org/abs/2607.00107v1
- Date: Tue, 30 Jun 2026 19:48:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.610674
- Title: The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code
- Title(参考訳): 安全のイラシオン:AI対人間のC++コードの多層検証
- Authors: Saif Mahmud, Fadul Sikder, Yuede Ji, Zhang Haotian, Jeff, Lei,
- Abstract要約: 大規模な言語モデルでは、単一の見落とされた違反が悪用可能なバグとなるメモリアンセーフな言語であるC++がますます生成される。
AI生成コードのほとんどのセキュリティ評価は、静的解析のみに依存しており、実行時の違反を確認したり、テストされていないパスを推論することなく警告をフラグ付けする。
AI生成のC++は、人間が書いたコードほど安全ではないのか、そして、一般的な検証ツールがリスクに一致しているかを問う。
- 参考スコア(独自算出の注目度): 2.29899053485986
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models increasingly generate C++, a memory-unsafe language where a single overlooked violation can become an exploitable bug. Yet most security evaluations of AI-generated code rely on static analysis alone, which flags warnings without confirming runtime violations or reasoning about untested paths. We ask whether AI-generated C++ is measurably less safe than human-written code, and whether common verification tools agree on the risk. We introduce VULBENCH-CPP, a benchmark of 8,918 C++ programs from three open-weight LLMs (Gemma 3 27B IT, LLaMA 3.3 70B Instruct, Qwen 2.5 Coder 32B Instruct) and human authors across 851 competitive-programming tasks. Each program is annotated by four verification tiers: functional testing, static analysis (cppcheck, clang-tidy), dynamic analysis (ASan/UBSan), and bounded model checking (ESBMC). Accounting for the correlation among solutions to a shared task, we find that AI-generated code is roughly twice as likely as human code to trigger a confirmed runtime violation, even after controlling for code length and test pass-rate. Under static analysis the two look equally safe, but this is misleading: the apparent similarity reflects code length rather than real safety, and the tiers detect largely different classes of violation, so no single tier is sufficient. The gap is consistent across independent generations.
- Abstract(参考訳): 大規模な言語モデルでは、単一の見落とされた違反が悪用可能なバグとなるメモリアンセーフな言語であるC++がますます生成される。
しかし、AI生成コードのほとんどのセキュリティ評価は、静的解析のみに依存しており、実行時違反を確認したり、テストされていないパスを推論することなく警告をフラグ付けする。
AI生成のC++は、人間が書いたコードほど安全ではないのか、そして、一般的な検証ツールがリスクに一致しているかを問う。
VULBENCH-CPPはオープンウェイトLLM(Gemma 3 27B IT, LLaMA 3.3 70B Instruct, Qwen 2.5 Coder 32B Instruct)の8,918個のC++プログラムのベンチマークである。
各プログラムには,機能テスト,静的解析(cppcheck, clang-tidy),動的解析(ASan/UBSan),境界モデル検査(ESBMC)という,4つの検証層がアノテートされている。
共有タスクに対するソリューション間の相関を考慮すると、AI生成コードは、コードの長さとテストパスレートを制御した後でも、確認されたランタイム違反を引き起こすための人間のコードとほぼ2倍の確率で存在していることが分かる。
明らかな類似性は実際の安全性よりもコードの長さを反映しており、層はほぼ異なる種類の違反を検知しているため、単一の層で十分ではない。
ギャップは独立した世代間で一致している。
関連論文リスト
- AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - AICD Bench: A Challenging Benchmark for AI-Generated Code Detection [91.21422299346199]
AICD Benchは、AI生成コード検出の最も包括的なベンチマークである。
これは$emph2Mサンプル$、$emph77モデル$、$emph11ファミリー$、$emph9プログラミング言語$で、最近の推論モデルを含む。
論文 参考訳(メタデータ) (2026-02-02T13:24:14Z) - Human-Written vs. AI-Generated Code: A Large-Scale Study of Defects, Vulnerabilities, and Complexity [4.478789600295493]
本稿では,人間の開発者と最先端のLLMであるChatGPT,DeepSeek-Coder,Qwen-Coderの3つのコードを比較した。
我々の評価は、PythonとJavaの2つの広く使われている言語で500万以上のコードサンプルにまたがっており、Orthogonal Defect ClassificationとCommon Weaknessionを使ったセキュリティ脆弱性によって欠陥を分類している。
AI生成コードは一般的にシンプルで、未使用のコンストラクトやハードコードになりがちであるのに対して、人間書きのコードはより構造的な複雑さを示し、保守性の問題の集中度が高い。
論文 参考訳(メタデータ) (2025-08-29T13:51:28Z) - Comparative Analysis of the Code Generated by Popular Large Language Models (LLMs) for MISRA C++ Compliance [0.0]
安全クリティカルなシステムのソフトウェア開発には厳格なエンジニアリングプラクティスとアビオニクスのDO-178Cのような認定基準の遵守が必要です。
DO-178Cは、MISRA C++のようなよく定義されたソフトウェアコーディング標準に準拠する必要があるガイダンス文書である。
MISRA C++に準拠するために、人気のあるLLMが生成するC++コードの比較分析を行った。
論文 参考訳(メタデータ) (2025-06-30T05:53:45Z) - Decompiling Smart Contracts with a Large Language Model [51.49197239479266]
Etherscanの78,047,845のスマートコントラクトがデプロイされているにも関わらず(2025年5月26日現在)、わずか767,520 (1%)がオープンソースである。
この不透明さは、オンチェーンスマートコントラクトバイトコードの自動意味解析を必要とする。
バイトコードを可読でセマンティックに忠実なSolidityコードに変換する,先駆的な逆コンパイルパイプラインを導入する。
論文 参考訳(メタデータ) (2025-06-24T13:42:59Z) - A Comparative Study of Fuzzers and Static Analysis Tools for Finding Memory Unsafety in C and C++ [24.60320701097142]
C/C++プログラムにおける100以上の既知のセキュリティ脆弱性に適用した5つの静的アナライザと13個のファザの実証分析を行った。
どちらのテクニックもさまざまなタイプのバグを発見していますが、それぞれに明確な勝者があります。
論文 参考訳(メタデータ) (2025-05-28T07:22:29Z) - Towards Exception Safety Code Generation with Intermediate Representation Agents Framework [54.03528377384397]
大規模言語モデル(LLM)は、しばしば生成されたコードの堅牢な例外処理に苦しむ。
中間表現(IR)アプローチにより,LLM生成コードの例外安全性を実現する新しいマルチエージェントフレームワークであるSeekerを提案する。
Seekerは例外処理をScanner, Detector, Predator, Ranker, Handlerの5つの特殊エージェントに分解する。
論文 参考訳(メタデータ) (2024-10-09T14:45:45Z) - GWP-ASan: Sampling-Based Detection of Memory-Safety Bugs in Production [30.534320345970286]
Heap-use-after-freeとheap-buffer-overflowのバグは、CやC++で記述されたアプリケーションのセキュリティ、信頼性、開発者の生産性の主要な問題である。
本稿では,この2種類のメモリセーフなバグを実運用環境でほぼゼロのオーバーヘッドで検出するツール群について述べる。
論文 参考訳(メタデータ) (2023-11-15T21:41:53Z) - A Static Evaluation of Code Completion by Large Language Models [65.18008807383816]
単純なプログラミング問題に対するモデル生成コードの機能的正当性を評価するために,実行ベースベンチマークが提案されている。
プログラムを実行せずにエラーを検出するlinterのような静的解析ツールは、コード生成モデルを評価するために十分に研究されていない。
抽象構文木を利用して,Pythonのコード補完における静的エラーを定量化する静的評価フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-05T19:23:34Z) - Fault-Aware Neural Code Rankers [64.41888054066861]
サンプルプログラムの正しさを予測できる故障認識型ニューラルネットワークローダを提案する。
我々のフォールト・アウェア・ローダは、様々なコード生成モデルのpass@1精度を大幅に向上させることができる。
論文 参考訳(メタデータ) (2022-06-04T22:01:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。