論文の概要: The Vocabulary of Flaky Tests in Swift
- arxiv url: http://arxiv.org/abs/2609.25516v2
- Date: Thu, 24 Sep 2026 09:57:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.316475
- Title: The Vocabulary of Flaky Tests in Swift
- Title(参考訳): スウィフトにおけるフレーカーテストの語彙
- Abstract要約: 不安定なテストは、コード変更なしで非決定論的結果をもたらす。
Swiftの語彙に基づく機械学習予測を評価する研究はない。
15のオープンソースプロジェクトから91の不安定なテストと22,349の安定テストを集めています。
- 参考スコア(独自算出の注目度): 0.9636309816613796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Flaky tests produce non-deterministic outcomes without code change, eroding CI confidence and delaying deliveries. While vocabulary-based machine learning prediction has proven effective for Java and JavaScript, no study has evaluated it for Swift, a language whose testing style is dominated by UI and asynchronous code. We collect 91 flaky and 22,349 stable tests from 15 open-source Swift projects via re-execution and commit-history mining, then train five classifiers (Random Forest, Decision Tree, Naive Bayes, SVM, KNN) on TF-IDF unigram+bigram features under stratified 5-fold cross-validation. Random Forest achieves the best performance (Precision = 0.92, F1 = 0.86, AUC = 0.95) and substantially outperforms trivial baselines, among them a vocabulary-threshold rule applied to the most informative tokens, confirming a genuine discriminative signal (MCC = 0.75 vs. 0.08 for the best baseline). Information-gain analysis reveals two complementary signal types. Flakiness markers appear predominantly in unstable tests and comprise concurrency primitives (async, await), expectation-based synchronisation (expectation, fulfill), error propagation (throws), and explicit timing dependence (timeout, wait, now). Stability markers, chiefly the assertion vocabulary of plainly synchronous tests (xctassertequal), count as evidence against flakiness. Error analysis shows that the model fails when flakiness is hidden in shared infrastructure outside the test body or when async constructs are used in a deterministic context, exposing the intrinsic limit of lexical prediction. These results extend vocabulary-based flakiness detection to the Swift ecosystem and characterise both its effectiveness and its boundaries.
- Abstract(参考訳): 不安定なテストは、コードの変更やCIの信頼性の侵食、デリバリの遅延なしに、非決定的な結果をもたらす。
語彙ベースの機械学習予測はJavaとJavaScriptに有効であることが証明されているが、テストスタイルがUIと非同期コードに支配されているSwiftでは、それを評価する研究は行われていない。
我々は15のオープンソースSwiftプロジェクトから91のフレキと22,349の安定テストを収集し、再実行とコミット履歴マイニングを行い、5つの分類子(Random Forest、Decision Tree、Naive Bayes、SVM、KNN)を、階層化された5倍のクロスバリデーションの下でTF-IDFユニグラム+ビグラム機能でトレーニングします。
ランダムフォレストは最高の性能(精度=0.92, F1 = 0.86, AUC = 0.95)を達成し、自明なベースラインを実質的に上回り、最も情報性の高いトークンに適用される語彙的閾値ルール(MCC = 0.75 対 0.08 対 最良ベースライン)を確認する。
情報ゲイン分析は2つの補完的な信号型を明らかにする。
フレキネスマーカーは主に不安定なテストに現れ、並行プリミティブ(async, await)、期待ベースの同期(expectation, fulfill)、エラー伝搬(throws)、明示的なタイミング依存(timeout, wait, now)で構成される。
安定性マーカー、主に平易な同期テスト(xctassertequal)のアサーション語彙は、フレキネスの証拠として数えられる。
エラー解析は、フレキネスがテスト本体外の共有インフラストラクチャに隠されている場合や、非同期コンストラクトが決定論的文脈で使用されている場合に失敗し、語彙予測の本質的な限界を露呈することを示している。
これらの結果は、語彙ベースのフレキネス検出をSwiftエコシステムに拡張し、その有効性と境界の両方を特徴付ける。
関連論文リスト
- Do Code Language Models Use Tests? A Behavioral and Representational Study of Test-Driven Code Generation [14.44743150931186]
我々は,HumanEval+,MBPP+および最近のLiveCodeBenchタスクを用いて,テスト駆動コード生成について検討した。
我々は、自然言語のみのプロンプトを、関連する可視性テスト、シャッフルアウトプット、無関係性テスト、アサーションのみのテスト、より強力なモデル生成合成テストと比較する。
論文 参考訳(メタデータ) (2026-07-28T20:25:42Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - From Flows to Words: Can Zero-/Few-Shot LLMs Detect Network Intrusions? A Grammar-Constrained, Calibrated Evaluation on UNSW-NB15 [0.41998444721319217]
大規模言語モデル(LLM)は自然言語入力を推論できるが、微調整なしでの侵入検出におけるそれらの役割は未だ不明である。
本研究では、各ネットワークフローをコンパクトなテキストレコードに変換し、軽量でドメインにインスパイアされたフラグで拡張することで、プロンプトオンリーなアプローチを評価する。
ゼロショット,命令誘導,スプリットショットを比較して,同一のスプリット下での強い神経ベースライン,精度,精度,リコール,F1,マクロスコアを比較した。
論文 参考訳(メタデータ) (2025-10-18T02:11:50Z) - Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B [1.948261185683419]
本研究では,「評価香り」がコンメンシュレート能力を得ることなく測定性能を膨らませるかどうかを考察する。
6つのペアのA/Bシナリオを実行し、タスク内容を保持し、フレーミングの異なる状態でデコードします。
再現可能なA/Bフレームワーク(バンキング、バリデータ、ラン毎のスコア、スクリプト)と実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2025-10-08T09:49:05Z) - CTC-based Non-autoregressive Speech Translation [51.37920141751813]
非自己回帰音声翻訳における接続性時間分類の可能性について検討する。
我々は、CTCによって誘導される2つのエンコーダからなるモデルを構築し、ソースおよびターゲットテキストを予測する。
MuST-Cベンチマークの実験では、我々のNASTモデルは平均BLEUスコアが29.5であり、スピードアップは5.67$times$である。
論文 参考訳(メタデータ) (2023-05-27T03:54:09Z) - Double Perturbation: On the Robustness of Robustness and Counterfactual
Bias Evaluation [109.06060143938052]
テストデータセットを超えたモデル弱点を明らかにするための"ダブル摂動"フレームワークを提案する。
この枠組みを,モデルの頑健さと英語における反事実バイアスの分析に使用される2つの摂動に基づくアプローチに応用する。
論文 参考訳(メタデータ) (2021-04-12T06:57:36Z) - MASKER: Masked Keyword Regularization for Reliable Text Classification [73.90326322794803]
文脈に基づく予測を容易にする微調整手法であるマスク付きキーワード正規化(MASKER)を提案する。
maskerはモデルを規則化し、他の単語からキーワードを再構築し、十分な文脈なしに低信頼の予測を行う。
分類精度を低下させることなくOOD検出とクロスドメインの一般化を改善したMASKERを提案する。
論文 参考訳(メタデータ) (2020-12-17T04:54:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。