論文の概要: Residual Risk Analysis in Benign Code: How Far Are We? A Multi-Model Semantic and Structural Similarity Approach
- arxiv url: http://arxiv.org/abs/2604.21051v1
- Date: Wed, 22 Apr 2026 19:51:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-24 14:40:06.160442
- Title: Residual Risk Analysis in Benign Code: How Far Are We? A Multi-Model Semantic and Structural Similarity Approach
- Title(参考訳): 良性符号の残留リスク分析:どこまでの距離にあるか?多モデル意味的・構造的類似性アプローチ
- Authors: Mohammad Farhad, Shuvalaxmi Dass,
- Abstract要約: 既存の脆弱性ベンチマークでは、パッチされた関数を本質的に良識として扱い、セキュリティ上のリスクが残存する可能性を見落としていることが多い。
本稿では、埋め込みに基づく意味的類似性、局所的なASTに基づく構造的類似性、コード内の残余リスクを推定するためのクロスモデル合意を統合する統合フレームワークであるResidual Risk Scoring(RRS)を提案する。
我々の分析では、良性関数は意味的にも構造的にも脆弱な関数と非常によく似ており、残留リスクの潜在的持続性を示している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Software security relies on effective vulnerability detection and patching, yet determining whether a patch fully eliminates risk remains an underexplored challenge. Existing vulnerability benchmarks often treat patched functions as inherently benign, overlooking the possibility of residual security risks. In this work, we analyze vulnerable-benign function pairs from the PrimeVul, a benchmark dataset using multiple code language models (Code LMs) to capture semantic similarity, complemented by Tree-sitter-based abstract syntax tree (AST) analysis for structural similarity. Building on these signals, we propose Residual Risk Scoring (RRS), a unified framework that integrates embedding-based semantic similarity, localized AST-based structural similarity, and cross-model agreement to estimate residual risk in code. Our analysis shows that benign functions often remain highly similar to their vulnerable counterparts both semantically and structurally, indicating potential persistence of residual risk. We further find that approximately $61\%$ of high-RRS code pairs exhibit $13$ distinct categories of residual issues (e.g., null pointer dereferences, unsafe memory allocation), validated using state-of-the-art static analysis tools including Cppcheck, Clang-Tidy, and Facebook-Infer. These results demonstrate that code-level similarity provides a practical signal for prioritizing post-patch inspection, enabling more reliable and scalable security assessment in real-world open-source software pipelines.
- Abstract(参考訳): ソフトウェアセキュリティは、効果的な脆弱性検出とパッチ処理に依存していますが、パッチがリスクを完全に排除するかどうかは、まだ未調査の課題です。
既存の脆弱性ベンチマークでは、パッチされた関数を本質的に良識として扱い、セキュリティ上のリスクが残存する可能性を見落としていることが多い。
本研究では,複数のコード言語モデル (Code LMs) を用いたベンチマークデータセット PrimeVul から,木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-木-
これらの信号に基づいて、埋め込みに基づく意味的類似性、局所的なASTに基づく構造的類似性、およびコード内の残留リスクを推定するためのクロスモデル合意を統合する統合フレームワークであるResidual Risk Scoring (RRS)を提案する。
我々の分析では、良性関数は意味的にも構造的にも脆弱な関数と非常によく似ており、残留リスクの潜在的持続性を示している。
さらに、約611\%の高RRSコードペアは、Cppcheck、Clang-Tidy、Facebook-Inferといった最先端の静的解析ツールを使用して検証された残差問題(例えば、nullポインタの参照、安全でないメモリ割り当て)の13$のカテゴリを示す。
これらの結果は、コードレベルの類似性は、パッチ後の検査の優先順位付けに実用的な信号を提供し、実際のオープンソースのソフトウェアパイプラインにおいて、より信頼性が高くスケーラブルなセキュリティアセスメントを可能にすることを実証している。
関連論文リスト
- ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis [96.92417622318267]
ATBenchは、エージェント安全性の構造化、多様性、現実的な評価のための軌道レベルのベンチマークである。
リスクソース、障害モード、現実世界の危害の3つの側面に沿ってエージェント的リスクを編成する。
1000個の軌道(安全503個、安全497個)があり、平均9.01ターンと3.95kトークンがあり、2,084個のツールにまたがるプールから1,954個のツールが呼び出されている。
論文 参考訳(メタデータ) (2026-04-02T13:26:20Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - VulnAgent-X: A Layered Agentic Framework for Repository-Level Vulnerability Detection [9.51089779418208]
VulnAgentXは階層化されたエージェントフレームワークであり、軽量なリスクスクリーニング、コンテキスト拡張、特殊分析エージェント、選択的動的検証、エビデンスを統合パイプラインに融合する。
段階的、エビデンス駆動の監査プロセスは、デ・テクションの品質を改善し、偽陽性を低減し、リポジトリレベルのソフトウェアセキュリティ分析のための解釈可能な再侮辱を生成する。
論文 参考訳(メタデータ) (2026-03-11T04:57:17Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - The Semantic Trap: Do Fine-tuned LLMs Learn Vulnerability Root Cause or Just Functional Pattern? [14.472036099680961]
そこで我々は,脆弱性根本原因を機能パターンから切り離すための総合評価フレームワークTrapEvalを提案する。
我々は、3つのモデルファミリーにまたがる5つの最先端LCMを微調整し、それらを、CodeBLEUによって測定されたクロスデータセットテスト、セマンティック保存、および様々なセマンティックギャップの下で評価する。
従来のデータセットに対する高いベンチマークスコアは、モデルが脆弱性の真の因果論理を理解できないことを隠蔽している可能性がある。
論文 参考訳(メタデータ) (2026-01-30T07:19:17Z) - Cracking IoT Security: Can LLMs Outsmart Static Analysis Tools? [1.8549313085249322]
本研究は,多カテゴリー間相互作用脅威分類におけるLarge Language Models (LLMs) の総合評価を初めて行った。
Llama 3.1 8B, Llama 70B, GPT-4o, Gemini-2.5-Pro, DeepSeek-R1を0, 1, 2ショット設定でベンチマークする。
以上の結果から, LLMは有望な意味理解を示すが, 相互構造的推論を必要とする脅威に対して, 精度は著しく低下することがわかった。
論文 参考訳(メタデータ) (2026-01-02T04:17:36Z) - Distributionally Robust Safety Verification of Neural Networks via Worst-Case CVaR [3.0458514384586404]
本稿では、ニューラルネットワーク検証のためのFazlyabの2次制約(QC)と半定値プログラミング(SDP)フレームワークを構築する。
この統合により、入力不確かさをカバーする楕円体、ポリトープ、超平面が拡張され、安全クリティカルドメインへの適用性も拡張される。
論文 参考訳(メタデータ) (2025-09-22T07:04:53Z) - Advancing Neural Network Verification through Hierarchical Safety Abstract Interpretation [52.626086874715284]
我々は、安全でない出力の階層構造を検証する抽象的DNN検証と呼ばれる新しい問題定式化を導入する。
出力到達可能な集合に関する抽象的解釈と推論を活用することにより,形式的検証プロセスにおいて,複数の安全性レベルを評価することができる。
我々の貢献には、新しい抽象的安全性の定式化と既存のアプローチとの関係を理論的に探求することが含まれる。
論文 参考訳(メタデータ) (2025-05-08T13:29:46Z) - Exploring Robustness of Unsupervised Domain Adaptation in Semantic
Segmentation [74.05906222376608]
クリーンな画像とそれらの逆の例との一致を、出力空間における対照的な損失によって最大化する、逆向きの自己スーパービジョンUDA(ASSUDA)を提案する。
i) セマンティックセグメンテーションにおけるUDA手法のロバスト性は未解明のままであり, (ii) 一般的に自己スーパービジョン(回転やジグソーなど) は分類や認識などのイメージタスクに有効であるが, セグメンテーションタスクの識別的表現を学習する重要な監視信号の提供には失敗している。
論文 参考訳(メタデータ) (2021-05-23T01:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。