論文の概要: Metrics or Mirage? An Audit of Evaluation Inconsistencies in Colonoscopy Polyp Segmentation Benchmarks
- arxiv url: http://arxiv.org/abs/2607.08203v1
- Date: Thu, 09 Jul 2026 08:01:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.458982
- Title: Metrics or Mirage? An Audit of Evaluation Inconsistencies in Colonoscopy Polyp Segmentation Benchmarks
- Title(参考訳): メトリクスとミラージュ : 大腸ポリプセグメンテーションベンチマークにおける不整合の評価
- Authors: Aisha Urooj, Zain Ul Abdien, Neelu Madan,
- Abstract要約: 2015年から2026年にかけて発行された27の論文の体系的な監査では、コミュニティがモデルを評価する方法に関する3つの構造的な問題を明らかにしている。
テキスト互換性のない少なくとも5つのトレイン/テストスプリットプロトコルが、同じデータセットで結果を報告する論文間で共存している。
27件の論文のうち26件は、統計的に有意なテストなしに、テキストパフォーマンスのクレームを作成している。
- 参考スコア(独自算出の注目度): 0.9121437356699356
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Progress in colonoscopy polyp segmentation is routinely reported through leaderboard comparisons on a small set of public benchmarks. We argue that this apparent progress is difficult to verify: a systematic audit of \textbf{27 papers} published between 2015 and 2026 reveals three structural problems in how the community evaluates models. \textbf{First}, 25 of 27 papers \textit{omit the Hausdorff distance}. Hausdorff distance is a boundary-accuracy metric with direct clinical relevance for detecting flat or small polyps, and is a standard in radiotherapy segmentation. \textbf{Second}, at least five \textit{incompatible train/test split protocols} co-exist across papers reporting results on the same two datasets (Kvasir-SEG and CVC-ClinicDB), making published Dice scores non-comparable even when they appear in the same leaderboard column. \textbf{Third}, 26 of 27 papers make \textit{performance claims without any statistical significance test}. Strikingly, four papers published \emph{after} the Metrics Reloaded framework~\cite{metricsreloaded2024} (Maier-Hein et al., \textit{Nature Methods} 2024) perpetuate these same problems, suggesting that general-purpose metric guidance has not yet reached the colonoscopy sub-community. To show these problems are not merely cosmetic, we re-evaluate five representative models under three controlled protocols with a single uniform scorer, and find that the reported metric conceals large boundary and recall failures, that the ``best'' model changes with the metric, and that near-tied rankings reverse across random splits. We propose a five-point \textbf{Polyp Segmentation Reporting Checklist}~(PSRC) as a lightweight, domain-adapted corrective.
- Abstract(参考訳): 大腸内視鏡のポリプセグメンテーションの進展は、少数の公開ベンチマーク上でのリーダーボード比較を通じて定期的に報告される。
2015年から2026年にかけて発行された『textbf{27>』の体系的な監査は、コミュニティがモデルをどのように評価するかという3つの構造的な問題を明らかにしている。
textbf{First}, 25 of 27 papers \textit{omit the Hausdorff distance}。
ハウスドルフ距離(Hausdorff distance)は、扁平なポリープや小さなポリープを検出するための直接臨床関連性を持つ境界精度の指標であり、放射線療法のセグメンテーションにおける標準である。
同じ2つのデータセット(Kvasir-SEG と CVC-ClinicDB)で結果を報告した論文間で、少なくとも5つの \textit{in compatible train/test split protocol} が共存している。
27の論文のうち26の論文は、統計的に有意な検定を伴わずに \textit{ Performance claims を作成する。
興味深いことに、4つの論文が『Metrics Reloaded framework~\cite{metricsreloaded2024}』(Maier-Hein et al , \textit{Nature Methods} 2024)を出版した。
これらの問題は単に化粧品であるだけでなく、単一の一様スコアで3つの制御されたプロトコルの下で5つの代表モデルを再評価し、報告された指標が大きな境界とリコール障害を隠蔽し、'best'モデルがメートル法によって変化すること、そして、近周期ランキングがランダムスプリットを越えて逆転していることを見出した。
本稿では,軽量で領域適応的な修正法として,5点の「textbf{Polyp Segmentation Reporting Checklist}」~(PSRC)を提案する。
関連論文リスト
- Beyond the Reranker: Do RAG Retrieval Enhancements Help Once a Strong Reranker Is Present? [3.77661940418406]
クエリ拡張,階層的およびクロスドキュメント要約,グラフベースの拡張,クエリごとのルーティング,ランク融合,修正的再検索について検討した。
パイプラインの品質の大部分を、強力なクロスエンコーダリランカが占めていることを示す。
残りの再ランク法とプール拡張法は、階層的な要約、グラフ展開、ルーティング、ランク融合など、一般的な用途では、再ランカが存在すれば信頼できる利得は得られない。
論文 参考訳(メタデータ) (2026-06-14T20:50:41Z) - A Geometric Profile of Semantic Information in Text: Frame-Conditional Uniqueness and a Trade-Off Triangle for Scalar Summaries [0.0]
テキストの文の埋め込み構造から意味的内容を測定するフレームワークを開発する。
推奨のランク正規化構成は、28の順序チェックのうち25をポイント推定としてパスする。
別個の変動結果は、幅座標を行列点過程の対数行列式に接続する。
論文 参考訳(メタデータ) (2026-05-27T04:37:26Z) - MATCHA: Matching Text via Contrastive Semantic Alignment [23.871585688798802]
MATCHAは、参照とのセマンティックな合意を報い、矛盾を罰する自動計量である。
参照のみに基づいて誤った文と正しい文を区別するのは最も正確である。
論文 参考訳(メタデータ) (2026-05-26T17:47:14Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - Reconstructing Trust Embeddings from Siamese Trust Scores: A Direct-Sum Approach with Fixed-Point Semantics [0.0]
本研究では,多くの分散セキュリティフレームワークが公開している1次元シームズ信頼スコアから高次元信頼埋め込みを再構築する逆問題について検討する。
合成ベンチマークのスイートは、ガウスノイズの存在下でも、回収された埋め込みはユークリッドとコサインの計測値によって測定されたデバイス間幾何学を保存することを確認している。
詳細な信頼スコアを公開することで、デバイスと評価モデルの両方に関する潜伏した行動情報が漏洩する可能性がある。
論文 参考訳(メタデータ) (2025-08-02T20:19:22Z) - The Medium Is Not the Message: Deconfounding Document Embeddings via Linear Concept Erasure [98.71456610527598]
埋め込みベースの類似度メトリクスは、テキストのソースや言語のような刺激的な属性に影響される可能性がある。
本稿では,エンコーダ表現から観測された共同創設者に関する情報を除去するデバイアスアルゴリズムにより,これらのバイアスを最小の計算コストで大幅に低減することを示す。
論文 参考訳(メタデータ) (2025-07-01T23:17:12Z) - Revisiting Evaluation Metrics for Semantic Segmentation: Optimization
and Evaluation of Fine-grained Intersection over Union [113.20223082664681]
そこで本研究では,mIoUsの微細化と,それに対応する最悪の指標を提案する。
これらのきめ細かいメトリクスは、大きなオブジェクトに対するバイアスの低減、よりリッチな統計情報、モデルとデータセット監査に関する貴重な洞察を提供する。
ベンチマークでは,1つの測定値に基づかないことの必要性を強調し,微細なmIoUsが大きな物体への偏りを減少させることを確認した。
論文 参考訳(メタデータ) (2023-10-30T03:45:15Z) - End-to-End Page-Level Assessment of Handwritten Text Recognition [69.55992406968495]
HTRシステムは、文書のエンドツーエンドのページレベルの書き起こしに直面している。
標準メトリクスは、現れる可能性のある不整合を考慮していない。
本稿では、転写精度とROの良さを別々に検討する2つの評価法を提案する。
論文 参考訳(メタデータ) (2023-01-14T15:43:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。