論文の概要: A Systematic Methodology for Evaluating Failure Independence in LLM-Generated Code
- arxiv url: http://arxiv.org/abs/2607.02808v1
- Date: Thu, 02 Jul 2026 22:49:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 13:25:44.544373
- Title: A Systematic Methodology for Evaluating Failure Independence in LLM-Generated Code
- Title(参考訳): LLM生成符号の独立性評価のための体系的手法
- Abstract要約: N-Version Programming (NVP)は、複数の独立した実装を実行し、出力を組み合わせることで、ソフトウェアの信頼性を向上させる。
大規模言語モデル(LLM)の最近の進歩は、複数の実装を生成するコストを削減している。
LLM生成コードにおける障害独立性を評価するための最初の体系的手法を提案する。
- 参考スコア(独自算出の注目度): 9.367986419783147
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: N-Version Programming (NVP) improves software reliability by executing multiple independent implementations and combining outputs, but its adoption is limited by high cost and the assumption of failure independence, which empirical studies have challenged. Recent advances in Large Language Models (LLMs) reduce the cost of generating multiple implementations, shifting focus to whether their failures are independent. We propose the first systematic methodology to assess failure independence in LLM-generated code and apply it to 224 problems across twelve models, five languages, and three prompting strategies. We analyze both structural and behavioral diversity (i.e., whether implementations fail on the same test cases), complemented by N-version reliability analysis under majority voting and manual inspection of the generated code. Structural diversity analysis shows that implementations from the same model are highly similar, while different models produce more distinct solutions. The same trend appears in behavioral diversity, with implementations from different models showing higher diversity yet still failing on the same tests far more often than expected under independence. N-version reliability analysis reinforces this: three- and five-version ensembles realize only 0.43 and 0.44 of the reliability gain achievable under independence, dropping below 0.3 when ensembles are built from the same model. Manual fault analysis shows that even different failure patterns often share root causes. Overall, these results suggest LLM-generated solutions do not satisfy NVP's failure independence assumption, though heterogeneous models help partially. They also validate our methodology as a tool for systematically evaluating failure independence as models evolve.
- Abstract(参考訳): N-Version Programming (NVP)は、複数の独立した実装を実行し、アウトプットを組み合わせることで、ソフトウェアの信頼性を向上させるが、その採用は、高コストと実証研究が挑戦した失敗独立の仮定によって制限される。
大規模言語モデル(LLM)の最近の進歩は、複数の実装を生成するコストを削減し、障害が独立しているかどうかに焦点を移している。
LLM生成コードにおける障害独立性を評価するための最初の体系的手法を提案し、それを12のモデル、5つの言語、3つのプロンプト戦略で224の問題に適用する。
我々は、多数決によるNバージョン信頼性解析と生成されたコードの手動検査によって補完される構造的および行動的多様性(つまり、同じテストケースで実装が失敗するかどうか)を解析する。
構造的多様性解析は、同じモデルの実装が極めて類似していることを示し、異なるモデルはより異なる解を生成する。
同じ傾向が振る舞いの多様性に現れ、異なるモデルによる実装では、より高い多様性を示しながら、同じテストでまだ失敗している。
3と5のアンサンブルは独立して得られる信頼性の0.43と0.44のみを実現し、同じモデルからアンサンブルを構築すると0.3以下となる。
手動の障害分析は、異なる障害パターンでさえ根本原因を共有することが多いことを示している。
これらの結果は、不均一モデルが部分的に役立つにもかかわらず、LLM生成した解はNVPの失敗独立性の仮定を満たさないことを示唆している。
また、モデルが進化するにつれて、障害独立性を体系的に評価するためのツールとして、私たちの方法論を検証する。
関連論文リスト
- Collective Intelligence with Foundation Models [0.0]
本章では、解法モデルが独立したドラフトを生成するマルチエージェントフレームワークを提示し、それぞれが構造化された批評と批評エージェントによる改訂を行い、集約エージェントが最終的なコンセンサスソリューションを合成する。
スコアリングモジュールは、すべてのエージェントに対して意味的、数値的、手続き的評価を提供する。
異種多エージェント協調が, 科学的, 産業的領域における透明性, 監査性, 高信頼な意思決定をいかに支援しているかを示す。
論文 参考訳(メタデータ) (2026-07-06T19:52:39Z) - Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification in Large Language Models [44.59799077650502]
本研究では,大規模言語モデルにおける不確実性定量化のための簡易かつ効果的な自己評価手法を提案する。
提案手法は,世代を意味的に異なるクラスタに分類し,構造化された複数選択質問の回答オプションに変換し,モデルによって割り当てられた確率を信頼度推定として利用する。
論文 参考訳(メタデータ) (2026-06-02T16:25:54Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - ProbeLLM: Automating Principled Diagnosis of LLM Failures [89.44131968886184]
ProbeLLMはベンチマークに依存しない自動探索フレームワークで、個々の障害から構造的障害モードへの脆弱性発見を増大させる。
ProbeLLMは、検証可能なテストケースにプローブを制限し、ツールの拡張された生成と検証を活用することで、信頼性のある証拠として障害発見を根拠とする。
論文 参考訳(メタデータ) (2026-02-13T14:33:13Z) - Harnessing Consistency for Robust Test-Time LLM Ensemble [88.55393815158608]
CoREは、堅牢なLLMアンサンブルにモデル一貫性を利用するプラグイン・アンド・プレイ技術である。
トークンレベルの一貫性は、ダウンウェイト不確実なトークンにローパスフィルタを適用することで、きめ細かい不一致を捕捉する。
モデルレベルの一貫性は、自己自信の高いモデル出力を促進することで、グローバルな合意をモデル化する。
論文 参考訳(メタデータ) (2025-10-12T04:18:45Z) - LENS: Learning Ensemble Confidence from Neural States for Multi-LLM Answer Integration [0.0]
大きな言語モデル(LLM)は、様々なタスクで素晴らしいパフォーマンスを示しています。
LENS(Learning ENsemble confidence from Neural States)は、内部表現を分析してモデル信頼度を推定する新しい手法である。
論文 参考訳(メタデータ) (2025-07-31T00:35:45Z) - Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models [104.55763564037831]
我々は、注意マップ、現在の生成ステップにおける確率、および以前に生成されたトークンから繰り返し計算された不確実性スコアを利用する回帰モデルを訓練する。
評価の結果,提案手法は選択的生成に極めて有効であり,教師なしアプローチと教師なしアプローチに比較して大幅な改善が得られた。
論文 参考訳(メタデータ) (2024-08-20T09:42:26Z) - Two Failures of Self-Consistency in the Multi-Step Reasoning of LLMs [78.31625291513589]
自己整合性は、解が複数のサブステップに対する解からなるタスクにおいて、有効な多段階推論の重要な基準であると主張する。
仮説的整合性と構成的整合性という,多段階推論において特に重要である2種類の自己整合性を提案する。
GPT-3/4モデルの複数変種は,多種多様なタスクにおける両タイプの整合性に不整合性を示すことを示した。
論文 参考訳(メタデータ) (2023-05-23T17:25:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。