論文の概要: Memoir: Learning, Verifying, and Evolving False-Positive Memories for Static Application Security Testing Tools
- arxiv url: http://arxiv.org/abs/2608.09181v1
- Date: Mon, 10 Aug 2026 06:47:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.106985
- Title: Memoir: Learning, Verifying, and Evolving False-Positive Memories for Static Application Security Testing Tools
- Title(参考訳): Memoir: 静的アプリケーションセキュリティテストツールのための偽陽性メモリの学習、検証、進化
- Authors: Shenyuan Guan, Qiaodan Hou, Yanjun Chen, Xincheng Wen, Jia Feng, Keke Lian, Cuiyun Gao,
- Abstract要約: Memoirは、過去のFPアラートを再利用可能なセマンティックメモリに変換することによって、偽陽性を識別するためのメモリ駆動フレームワークである。
MemoirのF1スコアは99.43%、リコールは98.88%、完全精度は一貫して他のベースラインを上回っている。
- 参考スコア(独自算出の注目度): 9.706697938664137
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Static Application Security Testing (SAST) tools have become indispensable in modern secure software devel- opment. However, these tools often generate false-positive (FP) alerts, imposing substantial manual inspection costs and reducing the trust from developers. Existing FP reduction methods still face two primary challenges. First, the large differences among SAST tools and vulnerability categories make it difficult for these methods to learn recurring patterns in historical false positives. Moreover, the knowledge used by these methods are largely static and cannot be updated as newly validated cases accumulate. To address these challenges, we propose Memoir, a memory- driven framework for identifying false positives by transform- ing historical FP alerts into reusable semantic memories. It consists of two key modules. First, historical semantic memory construction converts historical FP alerts into structured semantic memories through LLM-guided annotation, pattern clustering, and memory synthesis to capture reusable behavioral patterns. Moreover, memory-driven identification and evolution retrieves relevant memories and performs semantic verification against taxonomy consistency and security invariants before making the final prediction. It then incorporates verified predictions back into the memory repository, allowing the knowledge base to evolve as new cases accumulate. We evaluate Memoir on CWE- Bench-Java to demonstrate its effectiveness in real-world security analysis. Specifically, Memoir achieves an F1-score of 99.43% with a Recall of 98.88% and perfect Precision, consistently outperforming other baselines. Furthermore, an industrial case study on production software systems from a top IT company shows that the learned memory base generalizes effectively across different SAST tools without retraining.
- Abstract(参考訳): 静的アプリケーションセキュリティテスト(SAST)ツールは、現代のセキュアなソフトウェア開発において欠かせないものになっている。
しかしながら、これらのツールは、しばしば偽陽性(FP)アラートを生成し、手作業による検査コストを大幅に削減し、開発者からの信頼を減らす。
既存のFP削減手法は、依然として2つの大きな課題に直面している。
第一に、SASTツールと脆弱性カテゴリの大きな違いは、これらの手法が歴史的偽陽性の繰り返しパターンを学習することを困難にしている。
さらに、これらの手法で用いられる知識は概ね静的であり、新たに検証された事例が蓄積されるため更新はできない。
これらの課題に対処するために,過去のFPアラートを再利用可能なセマンティックメモリに変換することによって,偽陽性を識別するメモリ駆動フレームワークであるMemoirを提案する。
2つの重要なモジュールから構成される。
まず、過去のFPアラートをLLMガイダンスアノテーション、パターンクラスタリング、メモリ合成を通じて構造化されたセマンティックメモリに変換することで、再利用可能な振る舞いパターンをキャプチャする。
さらに、メモリ駆動の識別と進化は関連する記憶を復元し、最終予測を行う前に分類の一貫性とセキュリティ不変性に対する意味検証を行う。
その後、検証済みの予測をメモリリポジトリに組み込んで、新たなケースが蓄積されるにつれて、知識ベースが進化する。
我々は,CWE-Bench-Java上でのMemoirの評価を行い,実世界のセキュリティ解析におけるその有効性を実証した。
具体的には、Memoirは98.88%のリコールと完全精度でF1スコア99.43%を獲得し、他のベースラインを一貫して上回っている。
さらに、トップIT企業の生産ソフトウェアシステムに関する産業ケーススタディでは、学習したメモリベースが、再トレーニングせずにさまざまなSASTツールを効果的に一般化できることが示されている。
関連論文リスト
- The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory [7.707732051915869]
エージェントメモリシステムの診断では、メモリはクリーンな入力の推論を改善するが、それらが存在するときのスプリアスパターンへの依存を増幅する。
本稿では,CAMELを提案する。CAMELは,書き込み時間と検索時間の両方で,多様なメモリアーキテクチャ間で動作可能な,プラグアンドプレイキャリブレーション方式である。
全体として、CAMELはより信頼性の高いエージェントメモリデプロイメントに対して、原則的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2026-05-10T05:04:13Z) - VulKey: Automated Vulnerability Repair Guided by Domain-Specific Repair Patterns [36.99523534749563]
VulKeyは、パッチ生成をガイドする専門家知識の階層的な抽象化である。
新たな3レベル抽象化は,CWEタイプ,構文的アクション,意味的キー要素の観点から,修復戦略を定式化する。
VulKeyは31.5%の精度を達成し、最高のベースラインを7.6%上回り、VulMasterやGPT-5といった先進的なツールを上回っている。
論文 参考訳(メタデータ) (2026-05-03T08:07:41Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - Log-Augmented Generation: Scaling Test-Time Reasoning with Reusable Computation [80.69067017594709]
大規模言語モデル(LLM)とそのエージェントモデルは、以前のタスクからの推論を維持するのに苦労する。
本稿では,従来の計算を直接再利用し,テスト時に過去のログから推論する新しいフレームワークであるLAGを提案する。
本手法は,ログを使用しない標準的なエージェントシステムよりも優れている。
論文 参考訳(メタデータ) (2025-05-20T14:14:38Z) - Memorization vs. Reasoning: Updating LLMs with New Knowledge [12.214561228023511]
我々は、現実的な知識更新をシミュレートする自動パイプラインであるKUP(Knowledge Update Playground)を紹介する。
本稿では,自己生成した「メモリ」トークンの更新コーパスにトークンを条件付ける,MCT(Memory Conditioned Training)という軽量な手法を提案する。
以上の結果から,(1) KUPベンチマークは非常に困難であり, 最高のCPTモデルでは, 間接的推論設定(推論)で2%$を達成し, (2) MCTトレーニングでは, 先行事前学習(CPT)ベースラインよりも有意に優れていた。
論文 参考訳(メタデータ) (2025-04-16T23:03:40Z) - Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models [81.62767292169225]
我々は,その一般化に着目して,大規模言語モデルにおける知識の忘れについて検討する。
確率摂動に基づく新しいアンラーニングパラダイムであるPerMUを提案する。
TOFU、Harry Potter、ZsRE、WMDP、MUSEなど、さまざまなデータセットで実験が行われている。
論文 参考訳(メタデータ) (2025-02-27T11:03:33Z) - A Memory Transformer Network for Incremental Learning [64.0410375349852]
本研究では,モデルが学習する時間とともに,新しいデータクラスが観察される学習環境であるクラスインクリメンタルラーニングについて検討する。
素直な問題定式化にもかかわらず、クラス増分学習への分類モデルの素直な適用は、これまで見られたクラスの「破滅的な忘れ込み」をもたらす。
これは、過去のデータのサブセットをメモリバンクに保存し、将来のタスクをトレーニングする際の忘れの防止にそれを活用することで、破滅的な忘れの問題を克服するものだ。
論文 参考訳(メタデータ) (2022-10-10T08:27:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。