論文の概要: Does Fixing Break Security? An Empirical Study of Security Degradation in Iterative LLM-Driven Infrastructure-as-Code Repair
- arxiv url: http://arxiv.org/abs/2608.13404v2
- Date: Fri, 14 Aug 2026 16:41:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.241084
- Title: Does Fixing Break Security? An Empirical Study of Security Degradation in Iterative LLM-Driven Infrastructure-as-Code Repair
- Title(参考訳): 修正はセキュリティを損なうか? 反復的LLM駆動型インフラストラクチャ・アズ・コード修復におけるセキュリティ劣化の実証的研究
- Authors: Benjamin Agyekum, Fabio Santos,
- Abstract要約: イテレーティブなIaC修復はセキュリティのレグレッションを導入するが、保守的で防御可能なレートはおよそ3.3%のシナリオである。
本研究は,セキュリティに配慮したフィードバックループ設計と,実行可能な反復予算指導の動機付けである。
- 参考スコア(独自算出の注目度): 2.4063592468412276
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background: Iterative feedback loops are the dominant paradigm for improving LLM-generated Infrastructure-as-Code (IaC): validators such as Checkov and terraform validate feed error signals back for successive repair attempts. Prior work reports cumulative-best metrics, which are non-decreasing by construction, so the raw per-iteration security trajectory has never been examined for IaC. Aims: We study security regression (a previously-passing CIS Benchmark check that fails after a repair iteration) to determine whether and how often iterative LLM repair degrades security while fixing other issues. Method: We analyze 5,968 scenario timelines from the IaC-Eval benchmark, each one scenario run through one configuration for up to 5 repair iterations. The 15 configurations (six model-specific RAG, nine model-aggregated non-RAG, three temperatures each) yield 4,440 iteration transitions with Checkov data on both sides. We track 30 individual CIS check IDs and classify root causes from code diffs, under two detection modes: standard (inclusive) and strict (exclusive check failures only). Results: Under standard detection, 13.8% of scenarios (24.8% of transitions) exhibit at least one regression. Under strict detection the rate falls to 3.3% of scenarios (5.2% of transitions), indicating most apparent regressions are multi-resource measurement artifacts. Resource restructuring (79.0%) is the dominant root cause. Regression transitions show 2.6x more code churn (Cohen's d=0.90) and 4.9x higher strict-mode check volatility (d=1.49). Of standard-mode regressions, 36.6% self-correct within an average of 1.2 iterations; iteration 3 is the optimal stopping point. Conclusions: Iterative IaC repair does introduce security regressions, but the conservative, defensible rate is about 3.3% of scenarios. Our findings motivate security-aware feedback-loop design and actionable iteration-budget guidance.
- Abstract(参考訳): 背景: 反復フィードバックループは、LCMの生成するインフラストラクチャ・アズ・コード(IaC)を改善する主要なパラダイムである。
これまでの作業では, 累積利得の指標は建設によって非減少しているため, IaC では, 原単位のセキュリティ・トラジェクトリが検討されていない。
Aims: セキュリティレグレッション(以前パスしたCISベンチマークチェックは、修正イテレーション後にフェールする)を調査して、他の問題を修正しながら、繰り返しLLMの修復がセキュリティを低下させるかどうかを判断します。
メソッド: IaC-Evalベンチマークから5,968のシナリオタイムラインを分析し、各シナリオは1つの設定を通して最大5回の修正を繰り返します。
15の構成(6つのモデル固有のRAG、9つのモデル集約非RAG、それぞれ3つの温度)は、Checkovデータによる4,440回の反復遷移をもたらす。
コード差分による根本原因を、標準(包括的)と厳密(排他的チェック障害のみ)の2つの検出モードの下で、30の個別のCISチェックIDを追跡し、分類する。
結果: 標準検出では、13.8%のシナリオ(遷移の24.8%)が少なくとも1つの回帰を示す。
厳密な検出の下では、シナリオの3.3%(遷移の5.2%)に減少し、最も顕著な回帰はマルチリソースの測定成果物であることを示している。
資源再構成(79.0%)が主な根本原因である。
回帰遷移は2.6倍のコードチャーン(コーエンのd=0.90)と4.9倍の厳密なモードチェックボラティリティ(d=1.49)を示す。
標準モード回帰では、平均1.2回のイテレーションで36.6%が自己修正される。
結論: イテレーティブIaC修復はセキュリティのレグレッションを導入するが、保守的で防御可能なレートはおよそ3.3%のシナリオである。
本研究は,セキュリティに配慮したフィードバックループ設計と,実行可能な反復予算指導の動機付けである。
関連論文リスト
- Detecting Safety Training Modification in Language Models via Activation Analysis [0.0]
本稿では,アクティベーション空間における安全関連概念の幾何学的構造を測定することで,言語モデルにおける安全訓練の修正を検出するツールであるAMSを紹介する。
4つのアーキテクチャファミリにまたがる14のモデル構成のAMSを検証する。
メカニスティック分析は、アクティベーション空間のシグネチャによって区別される安全訓練の修正の4つのクラス分類を識別する。
論文 参考訳(メタデータ) (2026-08-06T03:57:38Z) - A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination [51.06539604709775]
本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
論文 参考訳(メタデータ) (2026-08-05T14:01:10Z) - Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection [0.0]
大規模言語モデル(LLM)は、潜在能力と一貫したアクティベーションの間に、十分に文書化されたギャップを示す。
以前の報告では、構造的事前は分配性能を劇的に向上させるが、ゼロショットベースラインのアウト・オブ・ディストリビューション以下に崩壊する。
我々は、ソースコードの脆弱性検出においてSAIR設計を再現することにより、この現象がクロスドメインであるかどうかを検証する。
論文 参考訳(メタデータ) (2026-07-16T06:45:08Z) - Regression Accumulation in Multi-Turn LLM Programming Conversations [25.94870617800846]
回帰累積は6つのモデルにまたがる
後続のコードが以前の要件と競合するクロスTurn Conflictは、主要な障害クラスである。
検証ゲートは、すべてのモデルを一貫して改善する唯一の戦略である。
論文 参考訳(メタデータ) (2026-07-02T08:15:40Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - SCAFFOLD-CEGIS: Preventing Latent Security Degradation in LLM-Driven Iterative Code Refinement [12.69450437027072]
マルチオブジェクト最適化における仕様のドリフトは、連続する繰り返しに対してセキュリティを徐々に低下させます。
本稿では,セキュリティ制約を暗黙的なプロンプトから明示的な検証可能な制約に変換するSCAFFOLD-CEGISフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-09T15:54:18Z) - Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away [97.11976870616273]
本稿では,安全回復を目的ではなく満足度の高い制約として扱う軽量な推論時防衛法を提案する。
6つのオープンソースMLRMと4つのjailbreakベンチマークで評価した結果、SafeThinkは攻撃成功率を30~60%削減しました。
論文 参考訳(メタデータ) (2026-02-11T18:09:17Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。