論文の概要: SieveFL: Hierarchical Runtime-Aware Pruning for Scalable LLM-Based Fault Localization
- arxiv url: http://arxiv.org/abs/2605.13491v1
- Date: Wed, 13 May 2026 13:16:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:28.064179
- Title: SieveFL: Hierarchical Runtime-Aware Pruning for Scalable LLM-Based Fault Localization
- Title(参考訳): SieveFL: スケーラブルなLLMベースのフォールトローカライゼーションのための階層型ランタイム対応プルーニング
- Authors: Mahdi Farzandway, Fatemeh Ghassemi,
- Abstract要約: 自動障害ローカライゼーションは、観測されたテスト失敗を数千の候補にわたる責任あるメソッドに接続する必要がある。
攻撃的なLLM前フィルタリングによってこの緊張を解消する5段階階層型フレームワークであるSieveFLを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated fault localization requires connecting an observed test failure to the responsible method across thousands of candidates--a task that purely statistical approaches handle with limited precision and that LLMs cannot yet handle at full project scale due to prohibitive token cost and signal dilution. We present SieveFL, a five-stage hierarchical framework that resolves this tension through aggressive pre-LLM filtering. SieveFL converts a failing test into a natural-language failure description, uses dense vector retrieval to narrow the search to a small set of suspicious files, and then eliminates any method not executed during the failing test via JaCoCo runtime traces. Only the surviving candidates are passed to the LLM, which screens each method individually and re-ranks the confirmed suspects in a single comparative pass. We evaluate SieveFL on 395 bugs from Defects4J v1.2.0 using a mid-sized, openly available MoE model deployed on a commodity workstation (32 GB RAM, 8 GB GPU) via Ollama--no frontier APIs or datacenter hardware required. Treating 12 incomplete runs as failures, SieveFL achieves Top-1 accuracy of 41.8% (165/395 bugs) and an MRR of 0.469, outperforming the strongest prior agent-based baseline (AgentFL) by 2.1 pp in Top-1. Runtime pruning removes 79% of candidate methods and reduces input token consumption by 49%, while simultaneously improving ranking quality: Top-1 is preserved exactly and Top-3 through Top-10 improve by up to 2.4 pp. These results demonstrate that, with the right filtering architecture, capable fault localization does not require proprietary frontier models.
- Abstract(参考訳): 自動障害ローカライゼーションは、観測されたテスト失敗を数千の候補にまたがる責任あるメソッドに接続する必要がある。
攻撃的なLLM前フィルタリングによってこの緊張を解消する5段階階層型フレームワークであるSieveFLを提案する。
SieveFLは、失敗するテストを自然言語の失敗記述に変換し、密度の高いベクトル検索を使用して、不審なファイルの小さなセットに絞り込み、JaCoCoランタイムトレースを介してフェールテスト中に実行されないメソッドを除去する。
生き残った候補のみがLSMに渡され、それぞれのメソッドを個別にスクリーニングし、確認された容疑者を1回の比較パスで再ランクする。
我々は、Defects4J v1.2.0の395のバグに対して、Ollama-no Frontier APIまたはデータセンターハードウェアを介して、コモディティワークステーション(32GB RAM、8GB GPU)にデプロイされた、中規模のオープンソースMoEモデルを使用してSieveFLを評価した。
12個の不完全な動作を障害として扱い、SieveFLはTop-1の精度を41.8%(165/395のバグ)で、MRRは0.469で、Top-1の2.1ppで最強のエージェントベースベースライン(AgentFL)を上回った。
実行時のプルーニングは、候補メソッドの79%を削除し、入力トークンの消費を49%削減すると同時に、ランキング品質も改善する。
これらの結果は、適切なフィルタリングアーキテクチャでは、有能なフォールトローカライゼーションはプロプライエタリなフロンティアモデルを必要としないことを示している。
関連論文リスト
- Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions [52.50730821321986]
大規模言語モデル(LLM)におけるバージョンレベルのリスクの大規模評価を初めて行った。
我々は1000のStack OverflowプログラミングタスクのベンチマークであるPinTrace上で10のLLMを評価した。
LLM バージョン選択は LLM ベース開発における第1級, 以前は見落とされたリスクサーフェスとして確認された。
論文 参考訳(メタデータ) (2026-05-07T13:52:59Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - LLM2: Let Large Language Models Harness System 2 Reasoning [65.89293674479907]
大規模言語モデル(LLM)は、無数のタスクにまたがって印象的な機能を示してきたが、時には望ましくない出力が得られる。
本稿では LLM とプロセスベースの検証器を組み合わせた新しいフレームワーク LLM2 を紹介する。
LLMs2は妥当な候補を生成するのに責任を持ち、検証者は望ましい出力と望ましくない出力を区別するためにタイムリーなプロセスベースのフィードバックを提供する。
論文 参考訳(メタデータ) (2024-12-29T06:32:36Z) - Order Matters! An Empirical Study on Large Language Models' Input Order Bias in Software Fault Localization [17.03610523319531]
本研究では,入力順序と文脈サイズが大規模言語モデル(LLM)の性能に及ぼす影響について検討する。
JavaプロジェクトのTop-1 FL精度は57%から20%に低下しますが、Pythonプロジェクトでは、コード順序を逆転すると38%から約3%に低下します。
入力を小さなコンテキストに分割することで、このバイアスを減らし、FLのパフォーマンスギャップを22%から6%に減らし、両方のベンチマークで1%に減らします。
論文 参考訳(メタデータ) (2024-12-25T02:48:53Z) - A Multi-Agent Approach to Fault Localization via Graph-Based Retrieval and Reflexion [8.22737389683156]
従来のフォールトローカライゼーション技術は、広範なトレーニングデータセットと高い計算資源を必要とする。
大規模言語モデル(LLM)の最近の進歩は、コード理解と推論を強化することで、新たな機会を提供する。
LLM4FLは3つの特殊なLLMエージェントを利用するマルチエージェントの故障局所化フレームワークである。
14のJavaプロジェクトから675の障害を含むDefects4Jベンチマークで評価され、LLM4FLはAutoFLよりも18.55%、SoapFLより4.82%、Top-1の精度が18.55%向上した。
論文 参考訳(メタデータ) (2024-09-20T16:47:34Z) - Large Language Models for Test-Free Fault Localization [11.080712737595174]
テストカバレッジ情報なしでバグの行を特定できる言語モデルに基づくフォールトローカライズ手法を提案する。
5億5000万、60億、160億のパラメータを持つ言語モデルを、手作業でキュレートされた小さなプログラムコーパスで微調整します。
実験により、LLMAOは最先端の機械学習フォールトローカライゼーション(MLFL)ベースラインを2.3%-54.4%改善し、トップ5の結果を14.4%-35.6%改善した。
論文 参考訳(メタデータ) (2023-10-03T01:26:39Z) - Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting [65.00288634420812]
Pairwise Ranking Prompting (PRP)は、大規模言語モデル(LLM)の負担を大幅に軽減する手法である。
本研究は,中等級のオープンソースLCMを用いた標準ベンチマークにおいて,最先端のランク付け性能を達成した文献としては初めてである。
論文 参考訳(メタデータ) (2023-06-30T11:32:25Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。