論文の概要: Does Fault Localization Beat a Fresh Attempt? A Placebo-Controlled Study of Test-Guided Code Repair
- arxiv url: http://arxiv.org/abs/2609.00854v1
- Date: Tue, 01 Sep 2026 07:48:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.441883
- Title: Does Fault Localization Beat a Fresh Attempt? A Placebo-Controlled Study of Test-Guided Code Repair
- Title(参考訳): フォールトローカライゼーションは新たな試みに勝るか? テストガイドコード修復のプラセボ制御による検討
- Authors: Anik Jha,
- Abstract要約: フォールトローカライゼーションは、失敗したテストが意味するステートメントにコードモデルの修復に集中することができるが、ターゲットの編集が成功するのは、それが小さいためだけである。
我々はこれらの説明を3つの腕で分け、同じ失敗候補に当てはめます。
3つのフリーズ26-32Bモデル、3つのベンチマーク、488の候補が失敗し、3つの結果が続いた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fault localization can focus a code model's repair on the statements a failing test implicates, but a targeted edit may succeed merely because it is small, and a second model call may succeed without using the failure at all. We separate these explanations with three arms applied to the same failed candidate: blind whole-solution resampling, spectrum-based localization followed by suspect-span infilling, and same-length infilling at a disjoint random code span. Across three frozen 26-32B models, three benchmarks and 488 failing candidates, plus a separately declared 24B fourth model from a third family, three results follow. First, localization is rarely available: only 9.0% of failing candidates expose a failing public test with a usable spectrum. Second, among the 177 candidates localizable from a strong suite, localized infilling loses decisively to blind resampling at a matched attempt count (3:40, p = 3.0 x 10^-9), opposite to our hypothesis; the loss replicates in a third family at -11.3 points (95% CI [-16.6, -6.8]), and widening the edit does not rescue it. Third, against the random-span placebo localized infilling leads pooled (11:1, Holm-adjusted p = .019), but that lead resolves in no individual model under the analysis our shipped plan designates primary (best Holm p = .087), so we report the location effect as suggestive rather than established. Re-pricing attempts as tokens narrows but does not overturn this: a span attempt spends 21.7 generated tokens against 371.1, yet 16 localized attempts reach 6.8% while one blind attempt already reaches 10.1%. Infilling reproduces the removed span verbatim in 48.9% of attempts, which is why more budget does not help. We restrict every localization conclusion to the 24-32B models tested.
- Abstract(参考訳): フォールトローカライゼーションは、フェールテストが意味するステートメントにコードモデルの修復を集中させることができるが、ターゲットの編集が成功するのは、それが小さいだけで、失敗をまったく使わずに第二のモデルコールが成功する可能性があるためである。
我々はこれらの説明を、同じ失敗候補に適用した3つのアームで分離する:ブラインド全解法サンプリング、スペクトルベースの局所化、疑似スパンの埋め込み、不連続なランダムコードで同じ長さの埋め込み。
3つの凍結された26-32Bモデル、3つのベンチマーク、488の失敗候補に加えて、第3ファミリーから別々に24Bモデルが宣言され、3つの結果が続いた。
第一に、ローカライゼーションはまれであり、失敗した候補の9.0%だけが、使用可能なスペクトルで失敗する公開テストを公開する。
第2に、強いスイートからローカライズ可能な177の候補のうち、ローカライズされたインフィルは、我々の仮説に反して、マッチした試行数 (3:40, p = 3.0 x 10^-9) でブラインドリサンプリングに決定的に負け、第3のファミリーにおける損失は-11.3ポイント (95% CI [-16.6, -6.8]) で複製され、編集を広げても救われることはない。
第三に、ランダム・スパン・プラセボ局所化埋込鉛がプールされた(11:1, Holm-adjusted p = .019)に対して、その鉛は、出荷された計画がプライマリ(ベスト・ホルム p = .087)を指定した個々のモデルでは解決しないので、その位置効果は確立されるよりも示唆的なものとして報告する。
トークンとしての再価格設定の試みは縮小するが、これを覆すことはない: スパン試行は21.7個の生成トークンを371.1に対して使用するが、16個の局所化試行は6.8%に達し、1つの盲点試行はすでに10.1%に達している。
埋め込みは48.9%の試行で除去された動詞を再現するので、より多くの予算が役に立たない。
テストした24-32Bモデルにすべてのローカライゼーションの結論を限定する。
関連論文リスト
- When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs [0.0]
多数決による自己整合性は、小命令チューニングモデルのGPQAダイアモンド問題において、プロブレム毎の精度を低下させる。
このバージョンでは、最も自然な修復も失敗し、v1が1つとして扱われた3つの信号障害を分離する。
論文 参考訳(メタデータ) (2026-08-11T20:08:51Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints [0.0]
我々は、同じ決定がロール微分マルチエージェントパイプラインに分散されたとき、バイアスに何が起こるかを研究する。
2つの条件の間に偏りが生じる頻度について、測定可能な違いは見つからない。
バイアスが捕捉されるかどうかに監査能力が大きな、そして重大な影響を与えることが分かっています。
論文 参考訳(メタデータ) (2026-08-07T08:25:53Z) - Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel [0.0]
戦略ゲームにおける16個の軽量人格条件付きGPT-4.1構成の固定パネルについて検討した。
変化は急激なインデクシングであったが、そのシェアは不確実性の仮定に依存していた。
結果は、1つの固定されたモデル・プロンプトパネルに関係し、人間の置換性を確立しない。
論文 参考訳(メタデータ) (2026-08-02T04:10:11Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance [0.0]
我々は, 強制選択項目上でのBCBによるサンドバッグの識別が, 症状妥当性試験ロジックで可能かどうかを検証した。
12個のモデルドメインの細胞のうち0個がサンドバッグ指導下において有意に低い性能を示した。
本研究では, 位置分布シフトは, このモデルスケールでのインジェクションアンダーパフォーマンスの検出において, 精度以下よりも効果的な行動シグネチャである可能性が示唆された。
論文 参考訳(メタデータ) (2026-04-28T05:57:23Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - SBEST: Spectrum-Based Fault Localization Without Fault-Triggering Tests [17.90798133817018]
本研究は, 事故報告から得られたスタックトレースを, スペクトルベース断層定位における故障トリガー試験のプロキシとして用いる可能性について検討した。
本稿では,スタックトレース情報とテストカバレッジデータを統合する新たな手法であるSBESTを提案する。
論文 参考訳(メタデータ) (2024-05-01T15:15:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。