論文の概要: A Preliminary Study on Explaining Risk of Code Changes using LLM-Based Prediction Models
- arxiv url: http://arxiv.org/abs/2607.02782v1
- Date: Thu, 02 Jul 2026 21:31:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.421008
- Title: A Preliminary Study on Explaining Risk of Code Changes using LLM-Based Prediction Models
- Title(参考訳): LLMに基づく予測モデルを用いたコード変更の説明リスクに関する予備的検討
- Abstract要約: LLMベースのDiff Risk Scoreモデルからの注目度を利用して、ソフトウェア変更の一部を強調します。
実際の機能停止の原因となった専門家ラベルの変更を使って、我々のアプローチを評価します。
- 参考スコア(独自算出の注目度): 12.235188801401153
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Predictions by machine learning (ML) and artificial intelligence (AI) models are often received skeptically unless they are paired with intelligible explanations. In the context of just-in-time defect prediction, highlighting small portions of a software change (diff) -- beyond rule-based lints -- where risk may be concentrated has not yet been extensively investigated. In this work, we leverage attention weights from an LLM-based Diff Risk Score (DRS) model to highlight parts of a diff that the model focuses on when predicting risk. We aggregate token-level attention into interpretable code units (lines, hunks, and files), and present the top-K units to developers as a lightweight form of guidance during code review. We evaluate our approach using expert-labeled changes that have caused real outages. Results show that the highlighted snippets cover expert-labeled outage-causing change lines 53.85% of the time when highlighting the top-2 hunks, while requiring developers to review 26.28% of the changed lines on average. Because attention is produced during standard model inference, the approach is scalable for large development workflows and can be surfaced in the code review UI with low additional latency.
- Abstract(参考訳): 機械学習(ML)と人工知能(AI)モデルによる予測は、理解不能な説明と組み合わせない限り、懐疑的に受け取られることが多い。
ジャスト・イン・タイムの欠陥予測(Just-in-time defect prediction)の文脈では、ソフトウェア変更(diff)の小さな部分、すなわちルールベースのリント(lints)を越えて、リスクに集中する可能性がある部分について、まだ広く調査されていない。
本研究では,LLMに基づくDiff Risk Score(DRS)モデルからの注意重みを利用して,モデルがリスクを予測する際に重視する差分の一部を強調する。
トークンレベルの注意を解釈可能なコードユニット(ライン、ハンク、ファイル)に集約し、コードレビュー中の軽量なガイダンスとして、トップKユニットを開発者に提示します。
実際の機能停止の原因となった専門家ラベルの変更を使って、我々のアプローチを評価します。
その結果、ハイライトされたスニペットは、トップ2ハンクをハイライトする時間の53.85%を、開発者が平均26.28%の変更ラインをレビューする必要があることを示している。
標準モデル推論中に注意が向けられるため、このアプローチは大規模な開発ワークフローにスケーラブルであり、コードレビューUIで追加のレイテンシを低くすることができる。
関連論文リスト
- Deployment Risk Assessment Using Diff-Aware Features: A Case Study at Prime Video [0.4310167974376404]
現在の変更管理アプローチでは、リスクに関わらず、すべての変更をブロックするブランケットデプロイメントフリーズを使用している。
コード修正から直接派生した特徴である差分認識機能を中心にしたフレームワークを導入する。
我々はLLMを多言語特徴抽出器として使用し、生成タスクを超えたコード解析の有効性を実証した。
論文 参考訳(メタデータ) (2026-07-07T19:54:16Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Adapting Language Balance in Code-Switching Speech [60.296574524609575]
大規模な基礎モデルは、コードスイッチングテストケースといまだに苦労しています。
我々は、世代間のコンテキストバイアスを軽減するために、微分可能なサロゲートを使用します。
アラビア語と中国語による実験では、モデルの切り替え位置をより正確に予測できることが示されている。
論文 参考訳(メタデータ) (2025-10-21T15:23:55Z) - Evaluating Line-level Localization Ability of Learning-based Code Vulnerability Detection Models [9.543689542888599]
脆弱性検出のための説明可能性に基づく評価手法を提案する。
提案手法は検出アライメント(DA)として定義され,入力されたソースコード間の一致を定量化する。
このようなモデルの予測は、常に非負の線に偏っていることを示す。
論文 参考訳(メタデータ) (2025-10-13T09:34:40Z) - Mechanistic Interpretability of Code Correctness in LLMs via Sparse Autoencoders [0.0]
スパースオートエンコーダを用いて大規模言語モデルを分解し,コード正当性に対応する方向を特定する。
LLMにおける符号の正当性方向は誤りを確実に予測するのに対して、補正能力は統計的に有意であるが、修正エラーと正しい符号の保存との間にはトレードオフがある。
戦略の推進は、詳細な問題記述よりもテスト例を優先すべきであり、予測器の指示は、開発者レビューのエラーアラームとして機能し、これらの予測器は選択的なステアリングをガイドできる。
論文 参考訳(メタデータ) (2025-10-03T11:44:21Z) - LLM-Based Detection of Tangled Code Changes for Higher-Quality Method-Level Bug Datasets [8.166584296080805]
本稿では,コミットメッセージとメソッドレベルのコード差分の両方を活用することで,絡み合ったコード変化を検出するための大規模言語モデルの有用性について検討する。
その結果,コミットメッセージとコード差分を組み合わせることで,モデルの性能が著しく向上することがわかった。
49のオープンソースプロジェクトにアプローチを適用することで、バグギーと非バグギーメソッド間のコードのメトリクスの分散分離性が向上します。
論文 参考訳(メタデータ) (2025-05-13T06:26:13Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - Uncertainty-Aware Decoding with Minimum Bayes Risk [70.6645260214115]
予測されたリスクに応じてモデル生成を選択する最小ベイズリスク復号法を,原理化された不確実性認識復号法に一般化する方法を示す。
この修正された予測リスクは、出力の選択と生成をいつ中止するかの判断の両方に有用であり、オーバーヘッドを発生させることなく改善を提供できることを示す。
論文 参考訳(メタデータ) (2025-03-07T10:55:12Z) - If LLMs Would Just Look: Simple Line-by-line Checking Improves Vulnerability Localization [33.42741297088634]
手動のコード監査やルールベースのツールなど、従来の脆弱性のローカライゼーションの方法は、多くの場合、時間をかけてスコープに制限される。
本稿では,大規模言語モデルに固有の自己認識機構を活用する新しいフレームワークであるLOVAを紹介する。
LOVA は既存の LLM ベースのアプローチよりも大幅に優れており,F1 スコアの最大 5.3 倍の改善が達成されている。
論文 参考訳(メタデータ) (2024-10-20T05:02:18Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - IRJIT: A Simple, Online, Information Retrieval Approach for Just-In-Time Software Defect Prediction [10.084626547964389]
Just-in-Timeソフトウェア欠陥予測(JIT-SDP)は、コミットチェックイン時にそれらを特定することによって、ソフトウェアへの欠陥の導入を防止する。
現在のソフトウェア欠陥予測アプローチは、変更メトリクスなどの手作業による機能に依存しており、マシンラーニングやディープラーニングモデルのトレーニングにコストがかかる。
我々は,ソースコード上の情報検索を利用して,過去のバグやクリーンなコミットと類似性に基づいて,新しいコミットをバグやクリーンとしてラベル付けするIRJITという手法を提案する。
論文 参考訳(メタデータ) (2022-10-05T17:54:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。