論文の概要: The Replication Assessment Problem in Software Engineering
- arxiv url: http://arxiv.org/abs/2607.13815v1
- Date: Wed, 15 Jul 2026 13:24:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.783303
- Title: The Replication Assessment Problem in Software Engineering
- Title(参考訳): ソフトウェア工学におけるレプリケーションアセスメントの問題
- Abstract要約: 実験ソフトウェア工学において、現在、複製学習の結果がどのように評価されているかを示す。
一貫性のない基準から生じる問題を特定し,有意義な評価のための原則的枠組みを提案する。
- 参考スコア(独自算出の注目度): 1.0374041927838908
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background: Replication studies in software engineering are increasingly common, yet their interpretation remains uncertain and inconsistent because assessments frequently rely on loosely defined or ad hoc criteria. Aim: This study aims to document how replication study outcomes are currently assessed in empirical software engineering, identify problems arising from inconsistent criteria and propose a principled framework for meaningful evaluation. Method: We conducted a systematic review of replication studies, with the search covering recent empirical software engineering replications (2021--2025). For each study, we extracted the criteria used to assess replication outcomes and analysed these for heterogeneity, logical consistency, and alignment with established statistical principles. Results: A total of 10 replication studies were located. The analysis reveals substantial heterogeneity in assessment practices, with contradictory criteria applied to similar data, limited acknowledgement of measurement uncertainty, and an absence of shared standards. We propose a principled framework grounded in statistical, methodological, and measurement considerations, and demonstrate its application through worked examples. Conclusions: Adopting consistent and transparent assessment principles would reduce ambiguity, improve comparability, and support more reliable evidence accumulation in software engineering replication research.
- Abstract(参考訳): 背景: ソフトウェア工学におけるレプリケーション研究はますます一般的になっているが、その解釈は不確実で矛盾している。
Aim: 本研究の目的は, 実験ソフトウェア工学において, 複製学習の結果が現在どのように評価されているか, 一貫性のない基準から生じる問題を特定すること, 有意義な評価のための原則的枠組みを提案することである。
方法:本研究では,最近の経験的ソフトウェア工学の複製(2021-2025)を網羅した,複製研究の体系的レビューを行った。
各研究は、複製結果を評価するために用いられる基準を抽出し、不均一性、論理的整合性、確立された統計的原理との整合性について分析した。
結果: 合計10回の再現実験が実施された。
この分析は、類似データに適用された矛盾基準、測定の不確実性の限定、共有基準の欠如など、評価実践におけるかなりの不均一性を明らかにしている。
本稿では,統計的,方法論的,測定的な考察を基礎とした基本的枠組みを提案し,その応用を実例を通して実証する。
結論: 一貫性と透過的な評価原則を採用することで、曖昧さを低減し、互換性を改善し、ソフトウェアエンジニアリングのレプリケーション研究に蓄積されたより信頼性の高い証拠をサポートする。
関連論文リスト
- To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias [61.40435736418359]
異質なベンチマークを標準化する統一的なフレームワークを導入し、孤立した人口統計評価と強制選択比較設定を対比する。
比較設定は、主に不特定文脈によって引き起こされる潜在識別のアグレッシブな触媒として機能することを示す。
最後に、この比較偏見はモデルサイズと正にスケールする一般化された現象であることを示す。
論文 参考訳(メタデータ) (2026-06-23T13:53:50Z) - Position: Anthropomorphic Misalignment Research Needs Stronger Evidence [52.76826423649968]
概念的曖昧さ,非ロバストデータセット,実験設計,不十分な因果的介入が,モデル行動の過度な解釈につながることを示す。
本研究の目的は,AMRの方法論的厳密性向上に寄与する明らかな考察のガイダンスを提供することである。
論文 参考訳(メタデータ) (2026-05-29T16:38:53Z) - Rethinking Software Empirical Studies with Structural Causal Models [12.18241004961061]
因果推論(Causal Inference)は、経験的ソフトウェアエンジニアリング(ESE)を従来の統計的アソシエーションを超えて進めるための基本的なアプローチを提供する。
本稿では,Judea Pearl の因果推論パラダイムを ESE コンテキストで運用するフレームワーク CausalSE を紹介する。
論文 参考訳(メタデータ) (2026-05-27T13:41:05Z) - Practical validation of synthetic pre-crash scenarios [5.031637169030579]
ギャップは、現実のシナリオと合成前のシナリオの実用的等価性の堅牢な評価に残っている。
実用的等価性を確立するのではなく、違いを検出することに焦点を当てているため、従来の重要度試験は不十分である。
本研究は、適切な統計量と等価基準を定義するためのビンニングに基づくアプローチを提案する。
論文 参考訳(メタデータ) (2026-05-06T07:08:06Z) - The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research [56.80927148740585]
我々は、動的に進化し、研究評価者としてAIエージェントを開発することで、スケーラビリティと厳密さの課題に対処する。
我々は,機械的解釈可能性の研究をテストベッドとして使用し,標準化された研究成果を構築し,MechEvalAgentを開発した。
我々の研究は、AIエージェントが研究評価を変革し、厳格な科学的実践の道を開く可能性を実証している。
論文 参考訳(メタデータ) (2026-02-05T19:00:02Z) - On Meta-Evaluation [11.44925492599594]
観察研究、実験の設計(DoE)、ランダム化制御試験(RCT)といった手法は現代の科学的実践を形作っている。
評価空間,その構造的表現,および我々がAxiaBenchと呼ぶベンチマークを定義することで,メタ評価のための公式なフレームワークを導入する。
AxiaBenchは、8つの代表的なアプリケーションドメインで広く使用されている10の評価手法を、初めて大規模で定量的に比較することを可能にする。
論文 参考訳(メタデータ) (2025-11-27T06:31:16Z) - Causality can systematically address the monsters under the bench(marks) [64.36592889550431]
ベンチマークはさまざまなバイアス、アーティファクト、リークに悩まされている。
モデルは、調査の不十分な障害モードのため、信頼できない振る舞いをする可能性がある。
因果関係はこれらの課題を体系的に解決するための 理想的な枠組みを提供します
論文 参考訳(メタデータ) (2025-02-07T17:01:37Z) - A Call for Critically Rethinking and Reforming Data Analysis in Empirical Software Engineering [5.687882380471718]
経験的方法論の正しい適用に関する懸念は、2006年のDagtuhl Seminar on Empirical Software Engineeringから存在する。
LLMを用いて,27,000件の実証研究の文献調査を行い,統計的方法論を適切あるいは不十分と分類した。
我々は,30の初等研究を選定し,統計問題を特定し,解決する能力を評価するために,33人のESE専門家とワークショップを開催した。
論文 参考訳(メタデータ) (2025-01-22T09:05:01Z) - A Double Machine Learning Approach to Combining Experimental and Observational Data [58.05402364136958]
実験と観測を組み合わせた二重機械学習手法を提案する。
本フレームワークは, より軽度な仮定の下で, 外部の妥当性と無知性に対するファルシフィケーションテストを提案する。
論文 参考訳(メタデータ) (2023-07-04T02:53:11Z) - Improved Policy Evaluation for Randomized Trials of Algorithmic Resource
Allocation [54.72195809248172]
提案する新しい概念を応用した新しい推定器を提案する。
我々は,このような推定器が,サンプル手段に基づく一般的な推定器よりも精度が高いことを理論的に証明した。
論文 参考訳(メタデータ) (2023-02-06T05:17:22Z) - Targeting Learning: Robust Statistics for Reproducible Research [1.1455937444848387]
ターゲティング・ラーニング(Targeted Learning)は、因果推論、機械学習、統計理論の進歩を統一して、科学的に影響のある質問に統計的信頼性で答えるのに役立つ統計分野である。
ターゲット学習のロードマップは、仮説を最小化し、利用可能な科学的知識にのみ注意深く根ざすように、統計的手続きを調整することを強調する。
論文 参考訳(メタデータ) (2020-06-12T17:17:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。