論文の概要: A semantic mutation metric for metamorphic relation adequacy in scientific computing programs
- arxiv url: http://arxiv.org/abs/2605.17437v1
- Date: Sun, 17 May 2026 13:16:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:48.019223
- Title: A semantic mutation metric for metamorphic relation adequacy in scientific computing programs
- Title(参考訳): 科学計算プログラムにおけるメタモルフィック関係の等価性のための意味突然変異計量
- Authors: Meng Li, Xiaohua Yang, Jie Liu, Shiyu Yan,
- Abstract要約: 5つのドメイン・セマンティック演算子上に構築されたSemantic Mutation Score (SMS)を提案する。
SMSは、ほとんどどこでも、特徴化された制限でMSに縮退する。
SMSは、科学計算におけるドメイン・セマンティック・リレーション・セットの後方互換性の尺度である。
- 参考スコア(独自算出の注目度): 6.691613382732758
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Context. Metamorphic Testing addresses the test-oracle problem in scientific computing, but classical Mutation Score operates on syntactic AST mutations and misses domain semantics. Objective. We propose the Semantic Mutation Score (SMS), built on five domain-semantic operators (Conservation Erosion, Operator Substitution, Hyperparameter, Trajectory Flip, Structural Injection). SMS degenerates almost everywhere to MS in a characterised limit, so any SMS-based conclusion remains consistent with prior mutation-testing literature in the classical regime. Method. A 12-PUT x 5-MP design over four single-output float-to-float classes (numeric, probabilistic, surrogate, machine-learning) is paired with a three-layer attribution classifier separating true semantic faults from tolerance, OOD, statistical, and artefact categories. A same-source / cross-source ablation under an identical prompt isolates the LLM-source-diversity contribution. LLM-generated mutants are compared against a default-configuration cosmic-ray syntactic pool at the AST-normalised level. Results. The pre-registered large-effect threshold for Cliff's delta is not met under the point-estimate criterion; the observed effect lies in the medium-effect range. Cross-source pooling under an identical prompt does not appreciably shift delta, indicating that LLM identity is not the lever within this design. AST-level overlap between LLM-generated and default cosmic-ray syntactic mutants is small; the Hyperparameter, Structural Injection, and Trajectory Flip classes are unreachable under default first-order syntactic configurations. Conclusion. SMS is a backward-compatible adequacy metric for domain-semantic metamorphic-relation sets in scientific computing. The first-order unreachability evidence is independent of the effect-size question.
- Abstract(参考訳): コンテキスト。
メタモルフィックテストは、科学計算におけるテストオークル問題に対処するが、古典的なミューテーションスコアは、統語的AST突然変異を実行し、ドメイン意味論を見逃す。
目的。
本研究では,5つのドメイン・セマンティック演算子(Conservation Erosion, Operator Substitution, Hyperparameter, Trajectory Flip, Structure Injection)上に構築されたSemantic Mutation Score(SMS)を提案する。
SMSは特徴化された限界においてほぼどこでもMSに縮退するので、SMSに基づく結論は、古典的な体制における以前の突然変異テストの文献と一致している。
方法。
12-PUT x 5-MPの設計は、4つの単一出力フロート・トゥ・フロート・クラス(数値、確率、サロゲート、機械学習)に対して、真のセマンティック・フォールトをトレランス、OOD、統計、アーティファクトのカテゴリから分離する3層帰属分類器と組み合わせている。
同一のプロンプトの下での同一ソース/クロスソースアブレーションは、LLM-ソース-ダイバーシティコントリビューションを分離する。
LLM生成変異体は、ASTの正常化レベルにおいて、デフォルト構成の宇宙線シンタクティックプールと比較される。
結果。
クリフのデルタに対する事前登録された大きな効果閾値は、点推定基準の下では満たされず、観測された効果は中効果範囲にある。
同一のプロンプトの下でのクロスソースプーリングはデルタを確実にシフトせず、LLMアイデンティティがこの設計のレバーではないことを示している。
LLMが生成する宇宙線シンタクティック変異体とデフォルトの宇宙線シンタクティック変異体のASTレベルオーバーラップは小さく、ハイパーパラメーター、構造注入、トラジェクトリー・フリップクラスはデフォルトの1次シンタクティック構成では到達できない。
結論。
SMSは、科学計算におけるドメイン・セマンティック・メタモルフィック・リレーション・セットの後方互換性の尺度である。
一階の到達不可能な証拠は、効果の大きさの問題とは無関係である。
関連論文リスト
- CasualSynth: Generating Structurally Sound Synthetic Data [44.80087038178069]
大言語モデル(LLM)は、現実的な合成データを生成するが、その出力がターゲットドメインを管理する因果的メカニズムを尊重することを保証しない。
本稿では,意味的実現から因果構造の生成を分離するフレームワークCausal Synthを紹介し,因果的妥当性と言語学的にリッチな合成データを生成する。
論文 参考訳(メタデータ) (2026-05-17T16:21:01Z) - SAM-NER: Semantic Archetype Mediation for Zero-Shot Named Entity Recognition [50.82878172248818]
emphSemantic Archetype Mediationは中間的、領域不変なアーキタイプ空間を介してクロスドメイン転送を安定化する。
SAM-NERは、クロスドメイン設定でZS-NERベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-05T12:54:17Z) - SMART: A Spectral Transfer Approach to Multi-Task Learning [9.362937796676855]
マルチタスク学習は関連するアプリケーションに有効であるが,対象のサンプルサイズが小さい場合には性能が低下する可能性がある。
本稿では、音源部分空間間のスペクトル類似性を前提としたマルチタスク線形回帰のための特異特異部分空間を提案する。
論文 参考訳(メタデータ) (2026-04-22T04:00:31Z) - From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks [49.57538588967748]
LLM(Large Language Model)は、複雑なベンチマークでは優れているにもかかわらず、単語中の文字数などの基本的な記号的タスクにおいて失敗を示す。
我々は、LLaMA、Qwen、Gemmaなど、現代のアーキテクチャにまたがる一貫した現象を発見した。
LLMにおけるシンボリック推論失敗は,表現不足やスケール不足によるものではなく,モデル計算グラフ内の構造的干渉によるものであることを示す。
論文 参考訳(メタデータ) (2026-04-01T11:40:12Z) - DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation [24.086354908256293]
textbfDVDは、温度サンプリングによって誘導される局所的な出力分布をモデル化する単一サンプル検出器である。
我々は,Omni-MATH と SuperGPQA の2つの領域にわたる変異汚染の最初のベンチマークを構築した。
textbfDVDは、パープレキシティベース、Min-$k$%++、編集距離(CDD)、埋め込み類似性ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-01-08T12:48:40Z) - Hybrid Fuzzing with LLM-Guided Input Mutation and Semantic Feedback [0.0]
本稿では,静的および動的解析をLarge Language Model(LLM)誘導入力変異と意味フィードバックと統合したハイブリッドファジリングフレームワークを提案する。
本手法は,最先端のファジィよりも高速な時間対第一のバグ,意味的多様性の向上,およびユニークなバグの競合数を実現する。
論文 参考訳(メタデータ) (2025-11-06T02:38:24Z) - Lost in Tokenization: Context as the Key to Unlocking Biomolecular Understanding in Scientific LLMs [78.18336140706471]
Sci-LLMは、生物発見を加速するための有望なフロンティアとして登場した。
現在の戦略では生の生体分子配列を処理する際にSci-LLMの推論能力を制限する。
より効果的な戦略は、Sci-LLMに高レベルな構造化コンテキストを提供することである。
論文 参考訳(メタデータ) (2025-10-27T09:03:21Z) - You only need 4 extra tokens: Synergistic Test-time Adaptation for LLMs [50.54173262572369]
大規模言語モデル (LLM) は、金融、医療、農業などの専門分野にますます導入されている。
本稿では,言語モデルに対するラベルフリーテスト時適応について検討し,追加の監督なしにモデルをオンザフライで適応する推論時フレームワークであるSyTTAについて述べる。
論文 参考訳(メタデータ) (2025-10-11T14:00:39Z) - Fuzzing MLIR Compilers with Custom Mutation Synthesis [6.617861009996863]
我々は、文法に基づくファジィとカスタム合成突然変異を組み合わせたSynTHFUZZと呼ばれる新しいテストジェネレータを開発した。
各方言のカスタム突然変異演算子を手動で定義する必要がなくなる。
評価の結果,SynTHFUZはMLIRの方言対のカバレッジを1.75倍に改善し,ブランチのカバレッジを1.22倍に向上させることがわかった。
論文 参考訳(メタデータ) (2024-04-25T18:00:37Z) - Diagnosing and Rectifying Fake OOD Invariance: A Restructured Causal
Approach [51.012396632595554]
不変表現学習(IRL)は、不変因果的特徴から環境から切り離されたラベルへの予測を促進する。
最近の理論的結果は、IRLによって回復されたいくつかの因果的特徴は、訓練環境ではドメイン不変のふりをするが、目に見えない領域では失敗する。
本研究では,RS-SCMに関する条件付き相互情報に基づく手法を開発し,その効果を巧みに補正する。
論文 参考訳(メタデータ) (2023-12-15T12:58:05Z) - Boosting Continuous Sign Language Recognition via Cross Modality
Augmentation [135.30357113518127]
連続手話認識は不整合のビデオテキストペアを扱う。
クロスモーダル拡張を用いた新しいアーキテクチャを提案する。
提案するフレームワークは、既存のCTCベースの連続SLRアーキテクチャに容易に拡張できる。
論文 参考訳(メタデータ) (2020-10-11T15:07:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。