論文の概要: Large Language Models for Multi-Lingual Equivalent Mutant Detection: An Extended Empirical Study
- arxiv url: http://arxiv.org/abs/2607.00511v1
- Date: Wed, 01 Jul 2026 06:46:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.763951
- Title: Large Language Models for Multi-Lingual Equivalent Mutant Detection: An Extended Empirical Study
- Title(参考訳): 多言語等価変異検出のための大規模言語モデル:拡張経験的研究
- Authors: Honglin Shu, Zhao Tian, Dong Wang, Junji Yu, Jiazhe Zhang, Xuejie Cao, Junjie Chen, Yasutaka Kamei,
- Abstract要約: 大規模言語モデル(LLM)は、プログラムのセマンティクスをよりよくキャプチャすることで、様々なコード関連のタスクにまたがる顕著なパフォーマンスを最近示した。
本稿では,3つのJavaと1,088のミュータントペアを用いたLLMの総合的研究を行い,最先端手法に対するベンチマークを行った。
LLMは評価された従来の方法よりも高いF1スコアを実現し、微調整されたコード埋め込みにより高い検出精度が得られる。
- 参考スコア(独自算出の注目度): 8.372242332246508
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mutation testing is a powerful technique for ensuring software quality. However, the presence of equivalent mutants introduces unnecessary costs and biases, limiting its practical effectiveness. Although numerous equivalent mutant detection (EMD) methods have been proposed, they often face distinct challenges: pure-code analysis methods can be limited by their reliance on specific compiler infrastructures, while existing machine-learning approaches remain constrained by scarce training data and limited generalization to unseen mutants. Large language models (LLMs) have recently demonstrated remarkable performance across diverse code-related tasks by better capturing program semantics. Yet their potential for EMD remains largely unexplored, particularly in the multi-lingual context. This paper presents the first comprehensive empirical study on LLMs for EMD, using 3,302 Java and 1,088 C mutant pairs to benchmark against state-of-the-art methods, explore strategy variations, assess efficiency, and evaluate cross-lingual generalization. Experimental results show that LLM-based approaches achieve higher F1-scores than the evaluated traditional methods, with fine-tuned code embedding yielding the highest detection accuracy among the tested strategies. Moreover, LLM-based approaches strike a practical balance between effectiveness and efficiency with inference times comparable to existing machine-learning models. Importantly, fine-tuned LLMs demonstrate measurable generalization across programming languages. These findings establish LLMs as a viable and efficient approach for tackling the longstanding challenge of equivalent mutant detection, offering new directions for advancing mutation testing in practice.
- Abstract(参考訳): 変異テストは、ソフトウェア品質を保証するための強力なテクニックです。
しかし、等価変異体の存在は不要なコストとバイアスをもたらし、実用的効果を制限している。
多くの等価なミュータント検出(EMD)法が提案されているが、純粋なコード解析法は特定のコンパイラ基盤に依存して制限されるが、既存の機械学習手法は訓練データ不足と未確認ミュータントへの限定的な一般化によって制約される。
大規模言語モデル(LLM)は、プログラムのセマンティクスをよりよくキャプチャすることで、様々なコード関連のタスクにまたがる顕著なパフォーマンスを最近示した。
しかし、EMDに対する彼らのポテンシャルは、特に多言語的文脈において、ほとんど解明されていない。
本稿では,3,302個のJavaと1,088個のCのミュータントペアを用いて,MD用LLMの総合的研究を行い,現状の手法をベンチマークし,戦略のバリエーションを探究し,効率を評価し,言語間一般化を評価する。
実験結果から,LLM法は従来の評価手法よりも高いF1スコアを達成でき,コード埋め込みはテスト戦略の中で最も高い検出精度が得られることがわかった。
さらに、LLMベースのアプローチは、既存の機械学習モデルに匹敵する推論時間で有効性と効率の実践的なバランスをとる。
重要なことに、微調整 LLM はプログラミング言語間で測定可能な一般化を示す。
これらの知見は、LLMsを、等価変異検出の長年にわたる課題に取り組むための、実用的で効率的なアプローチとして確立し、実際に突然変異試験を進めるための新しい方向を提供する。
関連論文リスト
- Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters [56.051481747681315]
クロスモーダルスキルインジェクションは、ドメインエキスパートLEMをビジョンランゲージモデル(VLM)に統合することにより、創発的クロスモーダル能力を誘導することを目的としている。
シナリオでは、クロスモーダルなスキルインジェクションは一般的に命令追従や言語間セッティングにおいてよく機能するが、数学的推論では困難である。
提案手法では,TAやDAREといった古典的手法が,代替マージ手法よりも優れた性能を実現している。
論文 参考訳(メタデータ) (2026-05-19T08:24:19Z) - Robust Uncertainty Quantification for Factual Generation of Large Language Models [22.060021788289202]
大規模言語モデル(LLM)技術は、プロや日常生活の様々な領域への統合を促進する。
LLM幻覚の永続的な課題は、AI生成コンテンツの信頼性と信頼性を著しく損なう重要な限界として現れている。
本研究では,複数の事象を発生させるタスクにおける不確実な定量化シナリオを提案する。
論文 参考訳(メタデータ) (2026-01-01T14:06:58Z) - A Preliminary Study of Multilingual Code Language Models for Code Generation Task Using Translated Benchmarks [0.0]
コード生成のために構築されたオープンソースの多言語CLMであるPoly-Coderの性能を評価する。
以上の結果から,これらのベンチマークで得られた結果は,トレーニングフェーズで使用する評価指標とよく一致していることがわかった。
これらの初期の洞察は、より包括的な実証研究の必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2024-11-23T06:40:47Z) - Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models [104.55763564037831]
我々は、注意マップ、現在の生成ステップにおける確率、および以前に生成されたトークンから繰り返し計算された不確実性スコアを利用する回帰モデルを訓練する。
評価の結果,提案手法は選択的生成に極めて有効であり,教師なしアプローチと教師なしアプローチに比較して大幅な改善が得られた。
論文 参考訳(メタデータ) (2024-08-20T09:42:26Z) - Large Language Models for Equivalent Mutant Detection: How Far Are We? [9.126998558502914]
我々は3,302個のメソッドレベルのJavaミュータントペアについて実験的検討を行い、等価なミュータント検出のための大規模言語モデル(LLM)の有効性と効率について検討した。
以上の結果から,LLM技術は既存の技術よりも優れており,コード埋め込み戦略が最も効果的であることが示唆された。
論文 参考訳(メタデータ) (2024-08-03T11:58:16Z) - Benchmarking Uncertainty Quantification Methods for Large Language Models with LM-Polygraph [83.90988015005934]
不確実性定量化は機械学習アプリケーションにおいて重要な要素である。
最新のUQベースラインの集合を実装した新しいベンチマークを導入する。
我々は、11タスクにわたるUQと正規化技術に関する大規模な実証的研究を行い、最も効果的なアプローチを特定した。
論文 参考訳(メタデータ) (2024-06-21T20:06:31Z) - A Comprehensive Study on Large Language Models for Mutation Testing [36.00296047226433]
大規模言語モデル(LLM)は、最近、研究作業と産業実践の両方においてミュータントを生成するために使用されている。
BugFarm と LLMorpheus (最先端の2つの LLM ベースのアプローチ) を,Java の実世界の2つのバグベンチマークから,851 の実際のバグに対して評価した。
以上の結果から, LLMは既存のルールベースアプローチと比較して, 実際のバグに近づき, 111.29%の障害検出率を持つ, より多様な変異体を生成することが明らかとなった。
論文 参考訳(メタデータ) (2024-06-14T08:49:41Z) - Towards Effective Evaluations and Comparisons for LLM Unlearning Methods [97.2995389188179]
本稿では,大規模言語モデルにおける機械学習評価の精度向上を図る。
評価指標の堅牢性と、競合する目標間のトレードオフという、2つの重要な課題に対処します。
論文 参考訳(メタデータ) (2024-06-13T14:41:00Z) - Robust Analysis of Multi-Task Learning Efficiency: New Benchmarks on Light-Weighed Backbones and Effective Measurement of Multi-Task Learning Challenges by Feature Disentanglement [69.51496713076253]
本稿では,既存のMTL手法の効率性に焦点をあてる。
バックボーンを小さくしたメソッドの大規模な実験と,MetaGraspNetデータセットを新しいテストグラウンドとして実施する。
また,MTLにおける課題の新規かつ効率的な識別子として,特徴分散尺度を提案する。
論文 参考訳(メタデータ) (2024-02-05T22:15:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。