論文の概要: Learning from Lost Provenance: Multiple Instance Learning for Cancer Registry Tumor Group Classification
- arxiv url: http://arxiv.org/abs/2607.03481v1
- Date: Fri, 03 Jul 2026 16:48:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.629965
- Title: Learning from Lost Provenance: Multiple Instance Learning for Cancer Registry Tumor Group Classification
- Title(参考訳): 失明から学ぶ:がん登録腫瘍グループ分類のための複数事例学習
- Authors: Leonard Ruocco, Jonathan Simkin, Lovedeep Gondora, Gregory Arbour, Raymond Ng,
- Abstract要約: ディープラーニングによるがん登録の近代化が、労働集約的なタスクを自動化する新たな機会を開きつつある。
がん登録所は、その運営の定期的な製品として、相当量の専門家指定ラベルを生成する。
これらは患者レベルで存在し、患者に知らせる個々の病理報告とは無関係である。
- 参考スコア(独自算出の注目度): 0.46805910521893007
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modernizing cancer registries with deep learning is opening new opportunities to automate labor-intensive tasks such as the coding of pathology reports. However, progress is constrained by the scarcity of report-level human-annotated training data. Cancer registries generate substantial volumes of expert-assigned labels as a routine product of their operations, but these exist at the patient level and are not linked to the individual pathology reports that informed them, limiting their direct use for training models. We develop an efficient framework for training deep learning classifiers by leveraging these operationally-generated labels without requiring per-report human annotation, demonstrated for tumor group classification at the BC Cancer Registry. We use Attention-Based Multiple Instance Learning (ABMIL) to recover the lost link between patient-level labels and the reports that informed them, leveraging the attention the model places on each report to distil a large, noisily-labeled corpus into a compact, high-quality per-report training dataset. A classifier fine-tuned on a distilled dataset achieved a macro F1 of 0.83, outperforming established baselines across most tumor groups. By turning routine operational labels into high-quality training data without additional annotation or large-scale computing infrastructure, ABMIL offers a practical and accessible route to automating cancer registry workflows.
- Abstract(参考訳): 深層学習によるがん登録の近代化は、病理報告のコーディングなど、労働集約的なタスクを自動化する新たな機会を開きつつある。
しかし、進捗はレポートレベルの人手によるトレーニングデータの不足によって制約されている。
がん登録所は、手術の日常的な製品として、相当量の専門家指定ラベルを生成するが、これらは患者レベルで存在し、それらを知らせる個々の病理報告に関連付けられておらず、訓練モデルの直接の使用を制限している。
我々は,BC がん登録簿における腫瘍群分類のために,ヒトのアノテーションごとの報告を必要とせずに,これらの操作によって生成されたラベルを活用することによって,ディープラーニング分類器を訓練するための効率的なフレームワークを開発した。
我々は、ABMIL(Attention-Based Multiple Instance Learning)を用いて、患者レベルのラベルと報告の失われたリンクを回復し、各レポートのモデル位置の注意を生かして、大規模でノイズに標識されたコーパスを、コンパクトで高品質なレポート毎のトレーニングデータセットに活用する。
蒸留データセットを微調整した分類器は0.83のマクロF1を達成し、多くの腫瘍群で確立されたベースラインを上回った。
定期的なオペレーショナルラベルを、追加のアノテーションや大規模コンピューティングインフラストラクチャなしで高品質なトレーニングデータに変換することで、ABMILは、がんレジストリワークフローを自動化するための実用的でアクセス可能なルートを提供する。
関連論文リスト
- SPARS: Self-Play Adversarial Reinforcement Learning for Segmentation of Liver Tumours [2.5229190642019286]
完全に教師付き機械学習モデルは、ローカライゼーションタスクを自動化することを目的としている。
トレーニングには、コストが高く、しばしば主観的な3Dボクセルレベルのラベルを必要とする。
そこで我々は,SPARSと呼ばれる弱い教師付き機械学習フレームワークを提案する。
CTスキャンで癌領域をローカライズするために、オブジェクトレベルのバイナリ癌の存在ラベルを使用する。
論文 参考訳(メタデータ) (2025-05-25T06:14:41Z) - Classifying Cancer Stage with Open-Source Clinical Large Language Models [0.35998666903987897]
オープンソースの臨床大言語モデル(LLMs)は、実世界の病理報告から病理組織学的腫瘍-リンパ節転移(pTNM)のステージング情報を抽出することができる。
以上より, LLMは腫瘍 (T) 分類においてサブパーパフォーマンスを示すが, プロンプト戦略の適切な適用により, 転移 (M) では同等の性能を示し, Node (N) 分類では性能が向上することが示唆された。
論文 参考訳(メタデータ) (2024-04-02T02:30:47Z) - DALSA: Domain Adaptation for Supervised Learning From Sparsely Annotated
MR Images [2.352695945685781]
そこで本研究では,自動腫瘍セグメンテーションのための教師あり学習において,スパースアノテーションによるサンプル選択誤差を補正するトランスファーラーニング手法を提案する。
提案手法は,スパースおよび曖昧なアノテーションから,異なる組織クラスに対する高品質な分類法を導出する。
完全ラベル付きデータを用いたトレーニングと比較して, ラベル付け時間とトレーニング時間は, 精度を犠牲にすることなく, 70倍, 180倍に短縮した。
論文 参考訳(メタデータ) (2024-03-12T09:17:21Z) - XAL: EXplainable Active Learning Makes Classifiers Better Low-resource Learners [71.8257151788923]
低リソーステキスト分類のための新しい説明可能なアクティブラーニングフレームワーク(XAL)を提案する。
XALは分類器に対して、推論を正当化し、合理的な説明ができないラベルのないデータを掘り下げることを推奨している。
6つのデータセットの実験では、XALは9つの強いベースラインに対して一貫した改善を達成している。
論文 参考訳(メタデータ) (2023-10-09T08:07:04Z) - Automated Labeling of German Chest X-Ray Radiology Reports using Deep
Learning [50.591267188664666]
本稿では,ルールベースのドイツ語CheXpertモデルによってラベル付けされたレポートに基づいて,ディープラーニングに基づくCheXpertラベル予測モデルを提案する。
その結果,3つのタスクすべてにおいて,ルールベースモデルを大幅に上回ったアプローチの有効性が示された。
論文 参考訳(メタデータ) (2023-06-09T16:08:35Z) - Clinically Acceptable Segmentation of Organs at Risk in Cervical Cancer
Radiation Treatment from Clinically Available Annotations [0.0]
子宮頸癌放射線治療におけるOAR(Organs at Risk)の自動セグメンテーションのためのディープラーニングモデルを学習するためのアプローチを提案する。
我々は、データの不均一性、ラベルノイズ、アノテーションの欠如を最小限に抑えるために、自動データのクリーニングにシンプルな手法を採用している。
そこで本研究では,教師が指導するシステム,アノテーション命令,不確実性誘導学習を利用して,アノテーションの欠如の有無を学習する半教師付き学習手法を開発した。
論文 参考訳(メタデータ) (2023-02-21T13:24:40Z) - ORDisCo: Effective and Efficient Usage of Incremental Unlabeled Data for
Semi-supervised Continual Learning [52.831894583501395]
連続学習は、入力されたデータが完全にラベル付けされていると仮定し、実際のアプリケーションでは適用できないかもしれない。
我々は、条件付き生成逆数ネットワーク(GAN)を用いた分類器を相互に学習するために、識別器整合(ORDisCo)を用いたディープオンライン再生を提案する。
ORDisCo が SSCL の様々な半教師付き学習ベンチマークデータセットで大幅なパフォーマンス向上を達成していることを示します。
論文 参考訳(メタデータ) (2021-01-02T09:04:14Z) - Hierarchical Deep Learning Classification of Unstructured Pathology
Reports to Automate ICD-O Morphology Grading [0.0]
本稿では,畳み込みニューラルネットワークモデルを用いた階層的深層学習分類手法を提案する。
ICD-O形態素分類のためのフラット・マルチクラスCNNモデルと比較して,階層的深層学習分類法では性能が向上することが実証された。
論文 参考訳(メタデータ) (2020-08-28T12:36:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。