論文の概要: Stop Using the Wilcoxon Test: Myth, Misconception and Misuse in IR Research
- arxiv url: http://arxiv.org/abs/2604.25349v1
- Date: Tue, 28 Apr 2026 08:08:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.768975
- Title: Stop Using the Wilcoxon Test: Myth, Misconception and Misuse in IR Research
- Title(参考訳): Wilcoxonテストの中止:IR研究における神話、誤解、誤解
- Authors: Julián Urbano,
- Abstract要約: 情報検索システムのベンチマークでは、ウィルコクソンの符号付きランクテストはtテストのより安全な代替品として扱われることが多い。
この物語は誤解を招くものであり有害であると主張する。
IR設定において、WilcoxonテストがType Iエラー率の制御を失う理由と理由を示す。
- 参考スコア(独自算出の注目度): 1.8782750537161614
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In benchmarking of Information Retrieval systems, the Wilcoxon signed-rank test is often treated as a safer alternative to the t-test. This belief is fueled by textbooks and recommendations that portray Wilcoxon as the proper non-parametric alternative because metric scores are not normally distributed. We argue that this narrative is misleading and harmful. A careful review of Statistics textbooks reveals inconsistencies and omissions in how the assumptions underlying these tests are presented, fostering confusion that has propagated into IR research. As a result, Wilcoxon has been routinely misapplied for decades, creating a false sense of safety against a threat that was never there to begin with, while introducing another one so severe that it virtually guarantees the test will break down and mislead researchers. Through a combination of systematic literature review, analysis and empirical demonstrations with TREC data, we show how and why the Wilcoxon test easily loses control of its Type I error rate in IR settings. We conclude that the continued use of Wilcoxon in IR evaluation is unjustified and that abandoning it would improve the methodological soundness of our field.
- Abstract(参考訳): 情報検索システムのベンチマークでは、ウィルコクソンの符号付きランクテストはtテストのより安全な代替品として扱われることが多い。
この信念は、ウィルコクソンを適切な非パラメトリックな代替品として描写する教科書やレコメンデーションによって支えられている。
この物語は誤解を招くものであり有害であると主張する。
統計学教科書の注意深いレビューでは、これらのテストの基礎となる仮定がどのように提示されるかの矛盾と省略が明らかとなり、IR研究に伝播した混乱を助長している。
その結果、Wilcoxonは何十年にもわたって誤って悪用され、最初から存在しなかった脅威に対して誤った安全感を生じさせてきた。
系統的な文献レビュー、分析、実証実験とTRECデータを組み合わせることで、WilcoxonテストがIR設定におけるタイプIエラー率の制御を容易に失う理由と理由を示す。
我々は、IR評価におけるウィルコクソンの継続的な使用は不当であり、それを捨てることは、我々の分野の方法論的健全性を改善すると結論付けた。
関連論文リスト
- Stop Misusing t-SNE and UMAP for Visual Analytics [18.996556756922054]
視覚分析における t-SNE と UMAP の誤用はますます一般的になっている。
誤用の有無を検証するため136件の論文をレビューする。
我々はDRの専門家にインタビューを行い、なぜこれまでの取り組みが誤用に対処しなかったのかを調べた。
論文 参考訳(メタデータ) (2025-06-10T12:21:42Z) - Towards Reliable Testing for Multiple Information Retrieval System Comparisons [2.9180406633632523]
我々は、シミュレーションおよび実TRECデータを用いて、複数の比較手順の信頼性を評価するために、新しいアプローチを用いる。
実験により、ウィルコクソンとベンジャミン・ホックバーグの補正は、典型的なサンプルサイズの重要度に応じてタイプIの誤差率をもたらすことが示された。
論文 参考訳(メタデータ) (2025-01-07T16:48:21Z) - Missci: Reconstructing Fallacies in Misrepresented Science [84.32990746227385]
ソーシャルネットワーク上の健康関連の誤報は、意思決定の貧弱さと現実世界の危険につながる可能性がある。
ミスシは、誤った推論のための新しい議論理論モデルである。
大規模言語モデルの批判的推論能力をテストするためのデータセットとしてMissciを提案する。
論文 参考訳(メタデータ) (2024-06-05T12:11:10Z) - On the Blind Spots of Model-Based Evaluation Metrics for Text Generation [79.01422521024834]
テキスト生成評価指標のロバスト性分析に有用であるが,しばしば無視される手法を探索する。
我々は、幅広い潜在的な誤差を設計、合成し、それらが測定値の余計な低下をもたらすかどうかを確認する。
私たちの実験では、既存のメトリクスの興味深い不感、バイアス、あるいは抜け穴が明らかになりました。
論文 参考訳(メタデータ) (2022-12-20T06:24:25Z) - Rethinking Knowledge Graph Evaluation Under the Open-World Assumption [65.20527611711697]
ほとんどの知識グラフ(KG)は不完全であり、知識グラフを自動補完する重要な研究トピックの動機となっている。
すべての未知の三つ子を偽として扱うことは、閉世界仮定(close-world assumption)と呼ばれる。
本稿では,KGCの評価を,より現実的な条件,すなわちオープンワールドの仮定の下で研究する。
論文 参考訳(メタデータ) (2022-09-19T09:01:29Z) - Calibration of prediction rules for life-time outcomes using prognostic
Cox regression survival models and multiple imputations to account for
missing predictor data with cross-validatory assessment [0.0]
検閲対象の生存モデルにおけるインプテーションと予測キャリブレーションを組み合わせた手法について述べる。
予測平均化は、ルービンの規則の直接適用とは対照的に、優れた統計的特性、特により小さい予測的変化を有するように見える。
論文 参考訳(メタデータ) (2021-05-04T20:10:12Z) - Maximum Mean Discrepancy Test is Aware of Adversarial Attacks [122.51040127438324]
最大平均誤差(MMD)テストは、原則として2つのデータセット間の分布誤差を検出できる。
MMD検査は敵の攻撃に気づいていないことが示されている。
論文 参考訳(メタデータ) (2020-10-22T03:42:12Z) - Kernelized Stein Discrepancy Tests of Goodness-of-fit for Time-to-Event
Data [24.442094864838225]
本稿では,時間対イベントデータに対するカーネル化されたStein不一致テストのコレクションを提案する。
実験の結果,提案手法は既存の試験よりも優れた性能を示した。
論文 参考訳(メタデータ) (2020-08-19T12:27:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。