論文の概要: On Revisiting Entropy for Identifying Mislabeled Images
- arxiv url: http://arxiv.org/abs/2605.31090v1
- Date: Fri, 29 May 2026 09:59:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.52466
- Title: On Revisiting Entropy for Identifying Mislabeled Images
- Title(参考訳): 誤り画像の同定のための再検討エントロピーについて
- Authors: Chunlei Li, Zixuan Zheng, Yilei Shi, Guanglu Dong, Pengfei Li, Jingliang Hu, Xiao Xiang Zhu, Lichao Mou,
- Abstract要約: そこで本研究では,トレーニングダイナミクスを利用したラベルミス検出手法を提案する。
我々は,予測エントロピーの規模と時間的傾向の両方を捉える符号付きエントロピー積分 (SEI) 統計学を導入する。
本報告では,SEIが従来の手法よりも優れていることを示す。
- 参考スコア(独自算出の注目度): 21.219096729721816
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mislabeled samples in training datasets severely degrade the performance of deep networks, as overparameterized models tend to memorize erroneous labels. We address this challenge by proposing a novel approach for mislabeled data detection that leverages training dynamics. Our method is grounded in the key observation that correctly labeled samples exhibit consistent entropy decrease during training, while mislabeled samples maintain relatively high entropy throughout the training process. Building on this insight, we introduce a signed entropy integral (SEI) statistic that captures both the magnitude and temporal trend of prediction entropy across training epochs. SEI is broadly applicable to classification networks and demonstrates particular effectiveness when integrated with contrastive language-image pretraining (CLIP) architectures. Through extensive experiments on four medical imaging datasets -- a domain particularly susceptible to labeling errors due to diagnostic complexity -- spanning diverse modalities and pathologies, we demonstrate that SEI achieves state-of-the-art performance in mislabeled data identification, outperforming existing methods while maintaining computational efficiency and implementation simplicity. Our code is available at https://github.com/MedAITech/SEI.
- Abstract(参考訳): トレーニングデータセットにおけるミスラベル付きサンプルは、過パラメータ化モデルが誤ラベルを記憶する傾向があるため、ディープネットワークのパフォーマンスを著しく低下させる。
この課題に対処するために、トレーニングのダイナミクスを活用する、ラベルの間違えたデータ検出のための新しいアプローチを提案する。
本手法は, トレーニング過程において, ラベル付きサンプルが一貫したエントロピー低下を示すのに対して, ラベル付きサンプルはトレーニング過程を通じて比較的高いエントロピーを維持していることを示す。
この知見に基づいて,予測エントロピーの規模と時間的傾向を学習エポックにわたって捉える,符号付きエントロピー積分 (SEI) 統計学を導入する。
SEIは分類網に適用可能であり、対照的な言語画像事前学習(CLIP)アーキテクチャと統合した場合に、特に有効性を示す。
4つの医用画像データセット(特に診断複雑性によるエラーのラベル付けが難しい領域)に関する広範な実験を通じて、SEIは、誤ってラベル付けされたデータの識別において最先端のパフォーマンスを達成し、計算効率と実装の単純さを維持しながら、既存の手法を上回ることを実証した。
私たちのコードはhttps://github.com/MedAITech/SEI.comで公開されています。
関連論文リスト
- Iterative Misclassification Error Training (IMET): An Optimized Neural Network Training Technique for Image Classification [0.5115559623386964]
カリキュラム学習とコアセット選択に触発された新しいフレームワークであるIMET(Iterative Misclassification Error Training)を紹介する。
IMETは、トレーニングプロセスの合理化を図りつつ、エッジケースに対するモデルの注意を先入観的かつ稀な結果に優先順位付けしながら、誤分類されたサンプルを特定することを目的としている。
本稿では,最新のResNetアーキテクチャに対するベンチマーク医用画像分類データセット上でのIMETの性能を評価する。
論文 参考訳(メタデータ) (2025-07-01T04:14:16Z) - Z-Error Loss for Training Neural Networks [0.0]
異常勾配を伝播することで、モデル性能と一般化を低下させることができる。
本稿では,Z-Error Lossを提案する。Z-Error Lossは,各バッチにおけるアウト・オブ・ディストリビューション(out-of-distribution)として認識されるデータポイントの寄与を隠蔽することにより,トレーニング中のアウトラヤの影響を最小限に抑える,統計的に原理化されたアプローチである。
論文 参考訳(メタデータ) (2025-06-02T18:35:30Z) - Leveraging Latent Diffusion Models for Training-Free In-Distribution Data Augmentation for Surface Defect Detection [9.784793380119806]
データ拡張のためのトレーニング不要な拡散型In-Distribution Anomaly GenerationパイプラインであるDIAGを紹介する。
従来の画像生成技術とは異なり、我々は、ドメインの専門家がモデルにマルチモーダルガイダンスを提供する、Human-in-the-loopパイプラインを実装している。
我々は、挑戦的なKSDD2データセットに対する最先端データ拡張アプローチに関して、DIAGの有効性と汎用性を実証する。
論文 参考訳(メタデータ) (2024-07-04T14:28:52Z) - Cluster-level pseudo-labelling for source-free cross-domain facial
expression recognition [94.56304526014875]
表情認識のためのSFUDA法を提案する。
本手法は,自己教師付き事前学習を利用して,対象データから優れた特徴表現を学習する。
提案手法の有効性を4つの適応方式で検証し,FERに適用した場合,既存のSFUDA法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2022-10-11T08:24:50Z) - Learning from Data with Noisy Labels Using Temporal Self-Ensemble [11.245833546360386]
ディープニューラルネットワーク(DNN)はノイズラベルを記憶する膨大な能力を持つ。
現在最先端の手法では、損失の少ないサンプルを用いて二重ネットワークを訓練するコトレーニング方式が提案されている。
本稿では,単一のネットワークのみをトレーニングすることで,シンプルで効果的なロバストトレーニング手法を提案する。
論文 参考訳(メタデータ) (2022-07-21T08:16:31Z) - Self-Supervised Training with Autoencoders for Visual Anomaly Detection [61.62861063776813]
我々は, 正規サンプルの分布を低次元多様体で支持する異常検出において, 特定のユースケースに焦点を当てた。
我々は、訓練中に識別情報を活用する自己指導型学習体制に適応するが、通常の例のサブ多様体に焦点をあてる。
製造領域における視覚異常検出のための挑戦的なベンチマークであるMVTec ADデータセットで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2022-06-23T14:16:30Z) - Incorporating Semi-Supervised and Positive-Unlabeled Learning for
Boosting Full Reference Image Quality Assessment [73.61888777504377]
フル参照(FR)画像品質評価(IQA)は、その知覚的差異をプリズム品質基準で測定することにより、歪み画像の視覚的品質を評価する。
ラベルなしデータは、画像劣化または復元プロセスから容易に収集することができ、ラベルなしのトレーニングデータを利用してFR-IQA性能を高めることを奨励する。
本稿では, 半教師付き, 正の未ラベル学習(PU)を用いて, ラベルなしデータを活用し, オフレーヤの悪影響を軽減することを提案する。
論文 参考訳(メタデータ) (2022-04-19T09:10:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。