論文の概要: Insecure Coding Preferences in Long-Term Memory: Security Risks for LLM-based Code Generation
- arxiv url: http://arxiv.org/abs/2607.17619v1
- Date: Mon, 20 Jul 2026 07:15:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.53296
- Title: Insecure Coding Preferences in Long-Term Memory: Security Risks for LLM-based Code Generation
- Title(参考訳): 長期記憶における安全性の低い符号化--LLMベースのコード生成におけるセキュリティリスク
- Authors: Yuchen Chen, Wei Cheng, Yuan Xiao, Zhou Yang, Weifeng Sun, Chunrong Fang, Xiang Chen, Baowen Xu, David Lo, Zhenyu Chen,
- Abstract要約: 本研究は,LLMベースのコード生成の安全性に対する,長期記憶に記憶された安全でない符号化嗜好の影響に関する,最初の系統的研究である。
5つのプログラミング言語(Python、C、C++、Go、JavaScript)で4つのLCMを評価します。
- 参考スコア(独自算出の注目度): 32.05457233792888
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-based systems increasingly incorporate long-term memory to improve cross-session continuity. However, once insecure coding preferences are stored, they may silently influence security-critical decisions in subsequent generations. In this study, we conduct the first systematic empirical study on the impact of insecure coding preferences stored in long-term memory on the security of LLM-based code generation. We evaluate four LLMs (ChatGPT, Gemini, Qwen, and Grok) across five programming languages (Python, C, C++, Go, and JavaScript). Our results show that insecure memories significantly increase the risk of generating vulnerable code by 2.7-50.3 percentage points (pp). Moreover, they create a 5.4-14.0 percentage-point risk-warning gap, where warning-rate increases lag behind vulnerability-rate increases. Further analysis reveals that insecure memories are difficult to overwrite through normal interactions and can broadly influence model outputs even when prompts are phrased differently. Finally, we evaluate three mitigation strategies: security-requirement appending and memory storage reduce vulnerability rates by 19.7-33.6 pp but may degrade functional correctness by up to 15.9 pp; memory-level safety filtering achieves a 100\% detection rate on our evaluated risky memory entries and restores generation behavior to the without-memory baseline. Based on these findings, we provide actionable suggestions to improve the security of long-term memory in LLM-based code generation.
- Abstract(参考訳): LLMベースのシステムは、クロスセッション連続性を改善するために、長期記憶をますます取り入れている。
しかし、もし安全でないコーディングの好みが保存されれば、それらはその後の世代におけるセキュリティクリティカルな決定に静かに影響を及ぼす可能性がある。
本研究では,LLMベースのコード生成の安全性に対する,長期記憶に格納された安全でない符号化嗜好の影響について,最初の系統的研究を行った。
我々は5つのプログラミング言語(Python, C, C++, Go, JavaScript)で4つのLLM(ChatGPT, Gemini, Qwen, Grok)を評価した。
その結果,安全性の低いメモリでは2.7-50.3ポイント(pp。
さらに、彼らは5.4-14.0パーセントのリスク警告ギャップを作り、警告レートは脆弱性率の遅れを増大させる。
さらに解析により、安全でない記憶は正常な相互作用を通して上書きすることが困難であり、プロンプトが異なる言い回しであっても、モデル出力に広範囲に影響を及ぼすことが明らかとなった。
最後に、セキュリティ要求の付加とメモリストレージによる脆弱性率19.7-33.6ppの低減を行うが、機能的正しさを最大15.9ppまで低下させる可能性がある。
これらの知見に基づいて,LLMベースのコード生成における長期記憶の安全性向上のための実用的な提案を行う。
関連論文リスト
- MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - Learned or Memorized ? Quantifying Memorization Advantage in Code LLMs [12.31163751026309]
4つのタスクファミリーにまたがる19のベンチマークで8つのオープンソースコードLLMを評価した。
感度パターンはモデルやタスクによって大きく異なる。
これらのデータセットでは、モデルは直接記憶よりも学習された一般化に依存する可能性がある。
論文 参考訳(メタデータ) (2026-04-15T15:43:10Z) - SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - PersistBench: When Should Long-Term Memories Be Forgotten by LLMs? [4.657424818207681]
PersistBenchを導入し、長期記憶に特有な安全性リスクの度合いを計測する。
我々は,クロスドメインリークと長期記憶障害の2つのリスクを同定した。
我々のベンチマークは、フロンティアの会話システムにおいて、より堅牢で安全な長期メモリ使用量の開発を促進する。
論文 参考訳(メタデータ) (2026-02-01T10:44:58Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents [57.38404718635204]
大規模言語モデル (LLM) エージェントは、有限コンテキストウィンドウによる長距離推論において基本的な制限に直面している。
既存のメソッドは通常、長期記憶(LTM)と短期記憶(STM)を独立したコンポーネントとして扱う。
本稿では,エージェントのポリシーに LTM と STM 管理を直接統合する統合フレームワークである Agentic Memory (AgeMem) を提案する。
論文 参考訳(メタデータ) (2026-01-05T08:24:16Z) - An Exploratory Study on Fine-Tuning Large Language Models for Secure Code Generation [16.000227726163967]
脆弱性修正コミットのデータセット上で学習済みの大規模言語モデルがセキュアなコード生成を促進するかどうかを検討する。
オープンソースのリポジトリから、確認済みの脆弱性のコード修正を収集することで、セキュアなコード生成のための微調整データセット(14,622 C/C++ファイル)をクロールします。
C言語のセキュリティの最大改善は6.4%、C++言語の5.0%です。
論文 参考訳(メタデータ) (2024-08-17T02:51:27Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。