論文の概要: Deployment Risk Assessment Using Diff-Aware Features: A Case Study at Prime Video
- arxiv url: http://arxiv.org/abs/2607.06766v2
- Date: Fri, 10 Jul 2026 00:08:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.709369
- Title: Deployment Risk Assessment Using Diff-Aware Features: A Case Study at Prime Video
- Title(参考訳): Diff-Aware特徴を用いたデプロイリスク評価:プライムビデオのケーススタディ
- Authors: Mayur Kurup, Hyunjae Suh, Swathi Vaidyanathan, Pranesh Vyas, Srinidhi Madabhushi, Yegor Silyutin,
- Abstract要約: 現在の変更管理アプローチでは、リスクに関わらず、すべての変更をブロックするブランケットデプロイメントフリーズを使用している。
コード修正から直接派生した特徴である差分認識機能を中心にしたフレームワークを導入する。
我々はLLMを多言語特徴抽出器として使用し、生成タスクを超えたコード解析の有効性を実証した。
- 参考スコア(独自算出の注目度): 0.4310167974376404
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: At Amazon Prime Video, we face the critical operational challenge of managing code deployments during live events and rapid feature releases without causing service outages. Current change control approaches use blanket deployment freezes that block all changes regardless of risk, creating significant developer toil. While prior research has explored risky change predictors, these rely on developer-specific metadata or extensive historical data, raising privacy concerns and limiting applicability to new projects. We introduce a framework centered on diff-aware features, characteristics derived directly from code modifications. Our key contribution is the systematic identification of which quantitative metrics (code-level and change-level metrics) and qualitative indicators (coding style violations, change type classification) are necessary for risk prediction. We employ LLMs as multi-language feature extractors, demonstrating their effectiveness for code analysis beyond generation tasks and eliminating the need for language-specific tooling. We evaluated our framework on two datasets: Prime Video's production environment and the public ApacheJIT dataset. Our best-performing model achieves an average recall of 0.83 and F1 score of 0.81 across both datasets for detecting risky code changes. Notably, ablation analysis reveals that change-level volume metrics (e.g., lines added/deleted) are noisy predictors, while structural code complexity provides a substantially stronger risk signal. These results demonstrate that thoughtful feature curation enables effective change risk assessment across different programming languages and organizational contexts while avoiding privacy concerns.
- Abstract(参考訳): Amazon Prime Videoでは、ライブイベントや迅速な機能リリースにおいて、サービス停止を発生させずにコードデプロイメントを管理するという、重要な運用上の課題に直面しています。
現在の変更管理アプローチでは,リスクに関わらず,すべての変更をブロックするスクラッチ展開フリーズが使用されている。
以前の調査では、リスクのある変更予測器について検討されていたが、これらは開発者固有のメタデータや、広範な履歴データに依存し、プライバシの懸念を高め、新しいプロジェクトへの適用性を制限している。
コード修正から直接派生した特徴である差分認識機能を中心にしたフレームワークを導入する。
私たちの重要な貢献は、リスク予測に量的指標(コードレベルと変更レベル)と質的指標(コーディングスタイル違反、変更タイプ分類)が必要とされるかの体系的な識別です。
我々はLLMを多言語特徴抽出器として採用し、生成タスクを超えたコード解析の有効性を実証し、言語固有のツールの必要性を排除した。
Prime Videoのプロダクション環境とパブリックなApacheJITデータセットの2つのデータセットでフレームワークを評価した。
我々の最高のパフォーマンスモデルは、リスクのあるコード変更を検出するために、両方のデータセットの平均リコール率0.83とF1スコア0.81を達成する。
アブレーション分析では、変化レベルのボリュームメトリクス(例えば、追加/削除された行など)がノイズの多い予測子であるのに対して、構造的なコードの複雑さは、より強力なリスク信号を提供する。
これらの結果は、思慮深い機能キュレーションが、プライバシーの懸念を回避しつつ、異なるプログラミング言語や組織状況における効果的な変更リスク評価を可能にすることを示している。
関連論文リスト
- A Preliminary Study on Explaining Risk of Code Changes using LLM-Based Prediction Models [12.235188801401153]
LLMベースのDiff Risk Scoreモデルからの注目度を利用して、ソフトウェア変更の一部を強調します。
実際の機能停止の原因となった専門家ラベルの変更を使って、我々のアプローチを評価します。
論文 参考訳(メタデータ) (2026-07-02T21:31:09Z) - Are AI-Generated Fixes Secure? Analyzing LLM and Agent Patches on SWE-bench [9.229310642804036]
我々は,SWE-benchデータセットから2万以上の問題を用いて,LLM生成パッチの大規模セキュリティ解析を行った。
スタンドアロンのLCM(Llama 3.3)によるパッチを評価し,開発者によるパッチと比較した。
また、データのサブセットに基づいて、トップパフォーマンスのエージェントフレームワーク(OpenHands、AutoCodeRover、HoneyComb)3つによって生成されたパッチのセキュリティを評価します。
論文 参考訳(メタデータ) (2025-06-30T21:10:19Z) - Reasoning with LLMs for Zero-Shot Vulnerability Detection [0.9208007322096533]
textbfVulnSageは,多種多様な大規模オープンソースソフトウェアプロジェクトから収集した,総合的な評価フレームワークである。
このフレームワークは、関数レベル、ファイルレベル、関数間の複数の粒度解析をサポートする。
Baseline、Chain-of-context、Think、Think & verifyの4つの異なるゼロショットプロンプト戦略を採用している。
論文 参考訳(メタデータ) (2025-03-22T23:59:17Z) - SeCodePLT: A Unified Platform for Evaluating the Security of Code GenAI [58.29510889419971]
コード生成大型言語モデル(LLM)のセキュリティリスクと能力を評価するための既存のベンチマークは、いくつかの重要な制限に直面している。
手動で検証し、高品質なシード例から始める、汎用的でスケーラブルなベンチマーク構築フレームワークを導入し、ターゲット突然変異を通じて拡張する。
このフレームワークをPython、C/C++、Javaに適用すると、44のCWEベースのリスクカテゴリと3つのセキュリティ機能にまたがる5.9k以上のサンプルデータセットであるSeCodePLTが構築されます。
論文 参考訳(メタデータ) (2024-10-14T21:17:22Z) - Outside the Comfort Zone: Analysing LLM Capabilities in Software Vulnerability Detection [9.652886240532741]
本稿では,ソースコードの脆弱性検出における大規模言語モデルの機能について,徹底的に解析する。
我々は6つの汎用LCMに対して脆弱性検出を特別に訓練した6つのオープンソースモデルの性能を評価する。
論文 参考訳(メタデータ) (2024-08-29T10:00:57Z) - Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models [81.27391252152199]
大規模言語モデル(LLM)は、さまざまな自然言語ベンチマークで素晴らしいパフォーマンスを実現している。
本稿では、データセットの自動更新と、その有効性に関する体系的な分析を提案する。
1) 類似したサンプルを生成するための戦略を模倣すること,2) 既存のサンプルをさらに拡張する戦略を拡張すること,である。
論文 参考訳(メタデータ) (2024-02-19T07:15:59Z) - Discovering and Reasoning of Causality in the Hidden World with Large Language Models [109.62442253177376]
我々はCausal representatiOn AssistanT(COAT)と呼ばれる新しいフレームワークを開発し、因果発見に有用な測定変数を提案する。
大規模言語モデル (LLM) と因果関係を直接推論する代わりに、COAT は中間因果発見結果から LLM へのフィードバックを構築し、提案した変数を洗練させる。
論文 参考訳(メタデータ) (2024-02-06T12:18:54Z) - Analysis of the Memorization and Generalization Capabilities of AI
Agents: Are Continual Learners Robust? [91.682459306359]
連続学習(CL)では、AIエージェントが動的環境下で非定常データストリームから学習する。
本稿では,過去の知識を維持しつつ,動的環境への堅牢な一般化を実現するための新しいCLフレームワークを提案する。
提案フレームワークの一般化と記憶性能を理論的に解析した。
論文 参考訳(メタデータ) (2023-09-18T21:00:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。