論文の概要: Explanation-Guided Metamorphic Testing of Specialized Language Models: An Empirical Study
- arxiv url: http://arxiv.org/abs/2608.07076v1
- Date: Fri, 07 Aug 2026 10:28:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.464984
- Title: Explanation-Guided Metamorphic Testing of Specialized Language Models: An Empirical Study
- Title(参考訳): 特殊化言語モデルの説明指導型メタモルフィックテスト:実証的研究
- Authors: Xingcheng Chen, Mehmet Besenk, Andrea Stocco,
- Abstract要約: タスク特化言語モデルは、課題トリアージ、文書分類、自動分析などの垂直領域アクティビティをサポートするために、ソフトウェア工学にますます統合されている。
本稿では,説明可能性誘導型メタモルフィックテストが,特殊言語モデルに対するロバストネステストの有効性と妥当性を向上するかどうかを検討する。
- 参考スコア(独自算出の注目度): 0.5368630420272898
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: \head{Background} Task-specialized language models are increasingly integrated into software engineering workflows to support vertical-domain activities such as issue triaging, document classification, and automated analysis. Despite their adoption, there is limited empirical evidence on how to test their robustness and detect brittle behaviors under semantics-preserving input transformations. \head{Aims} This paper investigates whether explainability-guided metamorphic testing can improve the effectiveness and validity of robustness testing for specialized language models compared to heuristic mutation strategies. \head{Method} We conduct a large-scale empirical study of explanation-guided metamorphic testing across three datasets, four model architectures, and 20 testing configurations derived from combinations of attribution methods and mutation strategies. The evaluated configurations combine attribution-based token prioritization, LLM-driven mutation, and automated semantic verification to generate linguistically valid test variants. We assess failure discovery capability, semantic validity, and testing efficiency against heuristic baselines. \head{Results} Explanation-guided metamorphic testing generates 2.30$\times$ more verified failure-inducing test cases than heuristic mutation strategies. Semantic verification substantially improves mutation validity and achieves high label-preservation precision among gate-accepted variants according to human annotation. The study further reveals systematic shortcut behaviors across models, including over-reliance on named entities and formatting cues. \head{Conclusions} The results provide evidence that explanation-guided metamorphic testing is an effective and practical approach for empirically evaluating the robustness of task-specialized language models used in vertical AI applications.
- Abstract(参考訳): タスク特化言語モデルは、イシュートリアージ、文書分類、自動分析などの垂直ドメインアクティビティをサポートするために、ソフトウェアエンジニアリングワークフローにますます統合されています。
採用されているにもかかわらず、その堅牢性をテストし、セマンティックス保存された入力変換の下で脆い振る舞いを検出する方法に関する実証的な証拠は限られている。
本稿では,説明可能性誘導型メタモルフィックテストが,ヒューリスティックな突然変異戦略と比較して,特殊言語モデルに対するロバストネステストの有効性と妥当性を向上するかどうかを検討する。
提案手法は,3つのデータセット,4つのモデルアーキテクチャ,20個のテスト構成からなる説明誘導型メタモルフィックテストの大規模な実証的研究である。
評価された構成は、属性ベースのトークン優先順位付け、LCMによる突然変異、自動意味検証を組み合わせることで、言語学的に有効なテスト変種を生成する。
我々は、ヒューリスティックベースラインに対する故障発見能力、意味的妥当性、およびテスト効率を評価する。
説明誘導メタモルフィックテストは、ヒューリスティックな突然変異戦略よりも2.30$\times$より検証された失敗誘発テストケースを生成する。
セマンティック検証は、変異の妥当性を大幅に向上させ、ヒトのアノテーションに従って、ゲートが受容する変種間で高いラベル保存精度を達成する。
この研究は、名前付きエンティティの過度な信頼やフォーマットの手がかりなど、モデル全体での系統的なショートカットの挙動をさらに明らかにしている。
The results provide evidence that explanation-guided metamorphic testing is a effective and practical approach for empirically evaluation of task-specialized language model used in vertical AI application。
関連論文リスト
- Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models [52.18157855348584]
エントロピー最小化(EM)によるテスト時間適応(TTA)は分類作業に有効であることが証明されているが、その応用は理論的に断片化されている。
本研究では,自己回帰モデルに適した厳密なEMの定式化を導出する。
本研究の目的は,トークンレベルの政策勾配損失とトークンレベルのエントロピー損失に自然に分解されることを示し,従来の手法を統一された定式化の部分的実現として再解釈する。
テストベッドとしてWhisper ASRを用いることで、音響ノイズ、アクセント、多言語設定を含む20以上の異なる領域のパフォーマンスを継続的に向上することを示す。
論文 参考訳(メタデータ) (2026-05-05T12:00:06Z) - FACTOR: Counterfactual Training-Free Test-Time Adaptation for Open-Vocabulary Object Detection [63.91351553178842]
FACTORはオープン語彙オブジェクト検出のためのトレーニング不要なテスト時間適応である。
属性依存性の予測を選択的に抑制するために、属性の感度、意味的関連性、予測のバリエーションを定量化する。
PASCAL-C, COCO-C, FoggyCityscapes の実験では、FACTOR が従来の TTA 法より一貫して優れていたことが示されている。
論文 参考訳(メタデータ) (2026-05-05T02:31:18Z) - Feature-Aware Test Generation for Deep Learning Models [0.5368630420272898]
本研究では,視覚に基づくディープラーニング(DL)モデルのための機能認識型テスト生成フレームワークであるTectを紹介する。
潜在空間内で非絡み合ったセマンティック属性を摂動することで入力を生成する。
行動シフトにつながる特徴を特定し、セマンティック属性に視覚言語モデルを使用する。
論文 参考訳(メタデータ) (2026-01-20T15:41:06Z) - Autoformalizer with Tool Feedback [52.334957386319864]
自動形式化は、数学的問題を自然言語から形式的ステートメントに変換することによって、ATP(Automated Theorem Proving)のデータ不足に対処する。
既存のフォーミュラライザは、構文的妥当性とセマンティック一貫性を満たす有効なステートメントを一貫して生成することに苦慮している。
本稿では,ツールフィードバックを用いたオートフォーマライザ (ATF) を提案する。
論文 参考訳(メタデータ) (2025-10-08T10:25:12Z) - Test Case Generation from Bug Reports via Large Language Models: A Cognitive Layered Evaluation Framework [10.919459368597295]
テストケース生成におけるLarge Language Models(LLM)推論の体系的評価について述べる。
言語的・意味的課題を導入した欠陥4J, GHRB, 変異変種についてStarCoderとGPT-4oを評価した。
論文 参考訳(メタデータ) (2025-10-06T20:47:12Z) - Generating Highly Structured Test Inputs Leveraging Constraint-Guided Graph Refinement [4.121384394709256]
本研究では,グラフベース表現を用いて,構造化ドメインに対するテスト入力を統一できるかどうかを検討する。
我々は,8つのAIシステムにおける入力妥当性とセマンティックな保存性を高めるために,このアプローチの有効性を評価する。
論文 参考訳(メタデータ) (2025-07-28T18:54:04Z) - Improving Deep Learning Framework Testing with Model-Level Metamorphic Testing [19.880543046739252]
DL(Deep Learning)フレームワークは、DLベースのソフトウェアシステムに必須であり、フレームワークのバグは重大な災害につながる可能性がある。
研究者はDLモデルや単一インターフェースをテスト入力として採用し、実行結果を分析してバグを検出する。
浮動小数点誤差、固有のランダム性、そしてテスト入力の複雑さは、実行結果を効果的に分析することを困難にしている。
論文 参考訳(メタデータ) (2025-07-06T11:38:14Z) - Automatically Generating Single-Responsibility Unit Tests [0.0]
生成されたテストに事前プロセス構造を提供することの効果を検討することを目的としています。
進化のための異なるテスト表現を実装し,それらがカバレッジ,障害検出,理解可能性に与える影響を評価することを提案する。
論文 参考訳(メタデータ) (2025-04-08T21:05:04Z) - Causality can systematically address the monsters under the bench(marks) [64.36592889550431]
ベンチマークはさまざまなバイアス、アーティファクト、リークに悩まされている。
モデルは、調査の不十分な障害モードのため、信頼できない振る舞いをする可能性がある。
因果関係はこれらの課題を体系的に解決するための 理想的な枠組みを提供します
論文 参考訳(メタデータ) (2025-02-07T17:01:37Z) - Context-Aware Testing: A New Paradigm for Model Testing with Large Language Models [49.06068319380296]
我々は,コンテキストを帰納バイアスとして用いて意味のあるモデル障害を探索するコンテキスト認識テスト(CAT)を導入する。
最初のCATシステムSMART Testingをインスタンス化し、大きな言語モデルを用いて、関連性があり、起こりうる失敗を仮説化します。
論文 参考訳(メタデータ) (2024-10-31T15:06:16Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。