論文の概要: Fail-Aware and Explainable Test Oracle Prediction
- arxiv url: http://arxiv.org/abs/2607.11342v1
- Date: Mon, 13 Jul 2026 10:04:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.422921
- Title: Fail-Aware and Explainable Test Oracle Prediction
- Title(参考訳): Fail-Awareと説明可能なテスト Oracle予測
- Abstract要約: 新たなコードLLMに基づく識別オラクル予測器であるFOCALを提案する。
テスト中のテストプレフィックスとメソッドのラベル付きペアから学習し、トレーニング中に失敗するケースを強調する損失を採用し、ステートメントレベルの行動証拠にその予測を根拠とする。
ベースライン手法SEERと比較すると,未確認プロジェクトのフェールケースの性能は著しく向上する。
- 参考スコア(独自算出の注目度): 4.6927139685668315
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite their central role in fault detection, test oracles remain challenging to construct effectively. Recent learning based methods address this challenge by automatically generating test assertions, yet even if syntactically correct, they are often ineffective in revealing bugs. Rather than generating assertions, this study explores a different approach by training a model to directly predict whether a given test prefix passes or fails. We present FOCAL, an emerging code LLM-based discriminative oracle predictor. It learns from labeled pairs of test prefixes and methods under test, employs losses that emphasize failing cases during training, and grounds its predictions in statement level behavioral evidence. Compared with the baseline method SEER, we substantially improve performance on failing cases for unseen projects and provide richer explanations. A preliminary evaluation on fault-detection benchmarks and automated test-generation artifacts shows that our approach is highly accurate within its training distribution and substantially improves failure detection on previously unseen projects where prior discriminative oracles collapse. Moreover, the highlighted statements are supported by behavioral explanation checks. These early results suggest that fail-aware discriminative oracle prediction can complement existing approaches such as fuzzing, search-based testing, and LLM-based test generation. These techniques produce test prefixes at scale but often lack fault oriented oracles. In future work, FOCAL could take generated test prefixes and attach fault-aware predicted oracles to them, turning high-volume input generation into executable tests that are more likely to expose semantic failures.
- Abstract(参考訳): 断層検出における中心的な役割にもかかわらず、テストオラクルは、効果的に構築することが困難なままである。
近年の学習ベースの手法では,テストアサーションを自動的に生成することでこの問題に対処している。
この研究では、アサーションを生成するのではなく、モデルに与えられたテストプレフィックスが通過するかどうかを直接予測するようにトレーニングすることで、別のアプローチを模索する。
新たなコードLLMに基づく識別オラクル予測器であるFOCALを提案する。
テスト中のテストプレフィックスとメソッドのラベル付きペアから学習し、トレーニング中に失敗するケースを強調する損失を採用し、ステートメントレベルの行動証拠にその予測を根拠とする。
ベースライン手法SEERと比較して、未確認プロジェクトのフェールケースの性能を大幅に改善し、よりリッチな説明を提供する。
故障検出ベンチマークと自動テスト生成アーティファクトの予備評価は,本手法がトレーニング分布内で極めて正確であることを示し,事前の差別的オラクルが崩壊した未確認プロジェクトの故障検出を大幅に改善することを示した。
さらに、強調されたステートメントは行動説明チェックによってサポートされます。
これらの初期の結果は、ファジィ、サーチベーステスト、LLMベースのテスト生成といった既存のアプローチを補完するフェールアウェアの識別オラクル予測が可能であることを示唆している。
これらのテクニックは大規模なテストプレフィックスを生成するが、しばしば障害指向のオラクルを欠いている。
将来の作業では、FOCALは生成されたテストプレフィックスを取り込み、フォールトアウェアの予測オーラクルをアタッチすることで、高ボリュームの入力生成をセマンティック障害を暴露しやすい実行可能なテストに変換することができる。
関連論文リスト
- How effective are traditional test criteria at detecting bugs in large language models generated code? [5.2762490553598065]
大規模言語モデルによって導入されたほとんどの障害は、比較的簡単にキャッチできる。
断層検出率は極端に低く、多くの場合ゼロに近い。
急進的なオラクルは断層検出を改善することができるが、全体的な効果は限られている。
論文 参考訳(メタデータ) (2026-09-08T18:04:21Z) - On the risk of coding before testing: An empirical study on LLM-based test generation workflow [5.317864735982288]
大規模言語モデル(LLM)は、ソフトウェア工学において、ソースコードとテストスイートの両方を生成するためにますます使われています。
生成したコードの欠陥が関連するテストアーティファクトに体系的に複製されるエラー伝播現象について検討する。
本研究は, (i) 誤ったコードアーチファクトがテスト生成をバイアスするかどうか, (ii) 異なるプロンプト戦略の下でそのようなバイアスが持続するかどうか, (iii) 複数ステップの検証でエラーが伝播する方法について検討する。
論文 参考訳(メタデータ) (2026-07-06T14:23:30Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - How LLMs Fail and Generalize in RTL Coding for Hardware Design? [56.361436215029045]
我々は,認知理論に触発された問題解決性に基づく新しい誤り分類法を導入する。
我々の分類学は、障害を構文、意味、解決可能な機能、解決不可能な機能タイプに分類する。
論文 参考訳(メタデータ) (2026-04-26T14:34:49Z) - VIBEPASS: Can Vibe Coders Really Pass the Vibe Check? [46.85901599242161]
emphFault-Triggering Test Generation(FT-Test)とemphFault-targeted Program repair(FPR)の2つの組み合わせタスクを評価した。
故障対象推論は一般的な符号化能力ではスケールしないことがわかった。
自己生成テストが障害の発見に成功すると、結果として得られた修復結果が外部から提供されたテストによってガイドされた修復と一致したり、性能が低下する。
論文 参考訳(メタデータ) (2026-03-16T21:14:28Z) - ProbeLLM: Automating Principled Diagnosis of LLM Failures [89.44131968886184]
ProbeLLMはベンチマークに依存しない自動探索フレームワークで、個々の障害から構造的障害モードへの脆弱性発見を増大させる。
ProbeLLMは、検証可能なテストケースにプローブを制限し、ツールの拡張された生成と検証を活用することで、信頼性のある証拠として障害発見を根拠とする。
論文 参考訳(メタデータ) (2026-02-13T14:33:13Z) - Towards Automated Error Discovery: A Study in Conversational AI [48.735443116662026]
本稿では,会話型AIにおけるエラーの検出と定義のためのフレームワークであるAutomated Error Discoveryを紹介する。
また,その実装に対するエンコーダに基づくアプローチとして,SEEED(Soft Clustering Extended-Based Error Detection)を提案する。
論文 参考訳(メタデータ) (2025-09-13T14:53:22Z) - Large-scale, Independent and Comprehensive study of the power of LLMs for test case generation [11.517293765116307]
ユニットテストはソフトウェアの信頼性に不可欠だが、手動のテスト作成には時間がかかり、しばしば無視される。
本研究は,LLM生成単体テストの大規模評価をクラスレベルで行った最初の大規模評価である。
論文 参考訳(メタデータ) (2024-06-28T20:38:41Z) - Test Oracle Automation in the era of LLMs [52.69509240442899]
大規模言語モデル(LLM)は、多様なソフトウェアテストタスクに取り組むのに顕著な能力を示した。
本研究の目的は, 各種のオラクル生成時に生じる課題とともに, LLMs によるオラクルの自動化の可能性について検討することである。
論文 参考訳(メタデータ) (2024-05-21T13:19:10Z) - Test Generation Strategies for Building Failure Models and Explaining
Spurious Failures [4.995172162560306]
テスト入力は、テスト対象のシステムが故障している場合だけでなく、入力が無効または非現実的である場合も失敗する。
テストインプットに対して解釈可能なルールを推論し,重大な障害を引き起こす障害モデルを構築することを提案する。
提案手法は, 平均精度83%の故障モデルを生成する。
論文 参考訳(メタデータ) (2023-12-09T18:36:15Z) - Towards Automatic Generation of Amplified Regression Test Oracles [44.45138073080198]
回帰テストオラクルを増幅するためのテストオラクル導出手法を提案する。
このアプローチはテスト実行中にオブジェクトの状態を監視し、以前のバージョンと比較して、SUTの意図した振る舞いに関連する変更を検出する。
論文 参考訳(メタデータ) (2023-07-28T12:38:44Z) - Understanding Classifier Mistakes with Generative Models [88.20470690631372]
ディープニューラルネットワークは教師付き学習タスクに有効であるが、脆弱であることが示されている。
本稿では、生成モデルを利用して、分類器が一般化に失敗するインスタンスを特定し、特徴付ける。
我々のアプローチは、トレーニングセットのクラスラベルに依存しないため、半教師付きでトレーニングされたモデルに適用できる。
論文 参考訳(メタデータ) (2020-10-05T22:13:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。