論文の概要: Dissecting Neuro-Symbolic Quality Assurance for Synthetic Oncology Data Generation
- arxiv url: http://arxiv.org/abs/2608.22085v1
- Date: Sat, 22 Aug 2026 19:34:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.944919
- Title: Dissecting Neuro-Symbolic Quality Assurance for Synthetic Oncology Data Generation
- Title(参考訳): 合成オンコロジーデータ生成のための神経回路品質保証
- Abstract要約: 1つの臨床的に不可能なステージング割り当ては、トレーニングされた下流モデル全てを汚染する。
ゲートの必要性,制約属性,検索条件を分離する3つの研究を報告する。
- 参考スコア(独自算出の注目度): 2.142353127874576
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthetic clinical data generation with large language models addresses the scarcity that limits cancer staging research, but oncology hallucinations are categorically harmful: one clinically impossible staging assignment contaminates every downstream model trained on it. Neuro-symbolic pipelines validate during generation, yet the contribution of individual quality-assurance components remains unclear. We report three controlled studies isolating gate necessity, constraint attribution, and retrieval conditionality, holding generation protocol, diversity thresholds, and fine-tuning hyperparameters constant across adapter conditions. The symbolic gate enforces schema completeness, ontology coverage against the Systematized Nomenclature of Medicine, and staging-logic consistency under American Joint Committee on Cancer eighth-edition rules. Ungated, 29.9% of records contain schema failures and 20.1% contain clinically invalid staging. Schema validation is the load-bearing filter: within the fully gated corpus it rejects 148 of 512 records, ontology grounding a further 24, and staging-logic validation none---the only generator producing logic violations is already excluded on schema, making clinical-logic validation a generator-conditional safeguard rather than the dominant filter. Retrieval augmentation is strongly model-dependent: it improves gate compliance for one generator by 12.5 percentage points, has no measurable effect for a second, and collapses output in a third. Across gated configurations ontology density is largely unchanged, indicating that symbolic validation improves clinical validity rather than vocabulary richness. Symbolic gating therefore buys corpus validity but no commensurate gain on real lung-cancer notes in this study; retrieval should be evaluated per model, and ontology density should not be reported as a proxy for corpus quality.
- Abstract(参考訳): 大きな言語モデルによる合成臨床データ生成は、がんのステージング研究を制限する不足に対処するが、腫瘍学の幻覚は分類的に有害である。
ニューロシンボリックパイプラインは世代によって検証されるが、個々の品質保証コンポーネントの寄与は未だ不明である。
本稿では, ゲートの必要性, 制約属性, 検索条件の分離, 生成プロトコルの保持, 多様性しきい値, アダプタ条件間で一定となる微調整ハイパーパラメータの3つの制御された研究について報告する。
シンボルゲートは、スキーマの完全性、医学の体系化された命名法に対するオントロジーのカバレッジ、およびアメリカがん8次編集規則合同委員会の下でのステージング・ロジカルな一貫性を強制する。
公表されていないが、29.9%のレコードはスキーマ障害を含み、20.1%は臨床的に無効なステージングを含んでいる。
スキーマ検証はロードバリングフィルタであり、完全なゲート付きコーパス内では、512レコードの148レコードを拒否し、オントロジーによりさらに24レコードが根拠となり、ステージング論理検証は不要である。
1つのジェネレータのゲートコンプライアンスを12.5ポイント改善し、秒間測定可能な効果を持たず、3分の1で出力が崩壊する。
接頭辞構成のオントロジー密度はほとんど変化せず、記号的検証は語彙豊かさよりも臨床的妥当性を向上させることを示唆している。
そこでシンボリックゲーティングは, コーパスの妥当性を高く評価するが, 実際の肺がん検診では高い利得は得られず, オントロジー密度はコーパスの品質の指標として報告すべきではない。
関連論文リスト
- SynthSentry: Detecting Synthetic Data Contamination in Language Model Training Data [2.998247765202193]
コーパスレベルのモデルに依存しない汚染信号は生成モデルへのアクセスを必要とせず、生成履歴も合成ラベルも不要である。
我々は,小型オープンウェイト発生器が汚染したコーパスと,アウト・ワン・ジェネレータ・アウトプロトコルに基づく命令調整オープンウェイト・モデルについて検討した。
スコアは、ジェネレータファミリー全体が持ち出されるときにほとんど損失のない重大さでコーパスをランク付けする。
論文 参考訳(メタデータ) (2026-09-11T02:25:18Z) - Destroy Me: Automatic Artifact Generation for Histopathology Images [0.0]
Destroy Meは、現実的なアーティファクト合成とロバストなデータ拡張のためのフレームワークである。
パッチでトレーニングされたモデルは、独立した実世界のデータセットのベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-08-27T10:12:09Z) - The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports [0.0]
インディアナ大学のデータセットから450個の胸部X線レポートを用いて、3つのリアルな書き換えタスクによって合成版を生成する。
我々は, 実体浸食(医学的NER), ヘッジ崩壊(臨床不確実性言語の欠如), クロスモーダルアライメント劣化を測定した。
劣化の主要な要因は、臨床内容ではなく、AI書き換えタスクの種類である。
論文 参考訳(メタデータ) (2026-06-16T11:07:48Z) - Phenotyping TPF via Self-Supervised Learning: A Label-Agnostic Framework with Expert Validation [2.201241345037463]
我々は、観測者指定のラベルなしで、画像データから直接フラクチャー表現を学習するためのラベルに依存しないフレームワークを設計、実装、検証する。
RadImageNet-pretrained ResNet-50 encoderは154個の膝X線写真に微調整されている。
ラベルに依存しないSSL表現は,従来の分類を再現し,臨床的に解釈可能な補完であることを示す。
論文 参考訳(メタデータ) (2026-06-15T21:04:31Z) - AI-generated data contamination erodes pathological variability and diagnostic reliability [16.066388735910074]
この自己参照サイクルは, 人体検査が必須でない場合に, 病的変動と診断信頼性の急激な侵食を引き起こすことを示す。
我々の結果は、政策管理された人間の監視がなければ、生成的AIの展開は、それが依存する医療データエコシステムを劣化させる恐れがあることを示唆している。
論文 参考訳(メタデータ) (2026-01-19T10:54:03Z) - Improving Cardiac Risk Prediction Using Data Generation Techniques [37.94487163156369]
本研究は,実世界の観測と整合したリアルな臨床記録の合成のためのアーキテクチャを提案する。
主な目的は、心的リスク予測モデルの性能を高めるため、利用可能なデータセットのサイズと多様性を高めることである。
論文 参考訳(メタデータ) (2025-12-19T10:17:00Z) - A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis [82.01597026329158]
本稿では,組織合成のための相関調整フレームワーク(CRAFTS)について紹介する。
CRAFTSは、生物学的精度を確保するためにセマンティックドリフトを抑制する新しいアライメント機構を組み込んでいる。
本モデルは,30種類の癌にまたがる多彩な病理像を生成する。
論文 参考訳(メタデータ) (2025-12-15T10:22:43Z) - Prostate-VarBench: A Benchmark with Interpretable TabNet Framework for Prostate Cancer Variant Classification [14.190646211771073]
VUS(Variants of Uncertain Significance)は前立腺癌ゲノムの臨床的有用性を制限する。
Prostate-VarBenchは、prostate固有のベンチマークを作成するための、キュレートされたパイプラインである。
論文 参考訳(メタデータ) (2025-11-12T06:13:50Z) - PathoSCOPE: Few-Shot Pathology Detection via Self-Supervised Contrastive Learning and Pathology-Informed Synthetic Embeddings [42.42150241818321]
教師なしの病理検出では、非病理データに基づいて、偏差を病理としてモデル化する。
そこで我々は,少数の非病理サンプルのみを必要とする,数発の非教師付き病理診断フレームワークPathoSCOPEを提案する。
PathoSCOPEは計算効率(2.48 GFLOP, 166 FPS)を維持しながら教師なし手法の最先端性能を実現する
論文 参考訳(メタデータ) (2025-05-23T08:21:58Z) - Generalizing electrocardiogram delineation: training convolutional
neural networks with synthetic data augmentation [63.51064808536065]
ECGのデライン化のための既存のデータベースは小さく、サイズやそれらが表す病態の配列に不足している。
まず、原データベースから抽出した基本セグメントのプールを与えられたECGトレースを確率的に合成し、その整合性のある合成トレースに配置するための一連のルールを考案した。
第二に、2つの新しいセグメンテーションに基づく損失関数が開発され、これは、正確な数の独立構造の予測を強制し、サンプル数の削減に焦点をあてて、より密接なセグメンテーション境界を創出することを目的としている。
論文 参考訳(メタデータ) (2021-11-25T10:11:41Z) - G-MIND: An End-to-End Multimodal Imaging-Genetics Framework for
Biomarker Identification and Disease Classification [49.53651166356737]
診断によって誘導される画像データと遺伝データを統合し、解釈可能なバイオマーカーを提供する新しいディープニューラルネットワークアーキテクチャを提案する。
2つの機能的MRI(fMRI)パラダイムとSingle Nucleotide Polymorphism (SNP)データを含む統合失調症の集団研究で本モデルを評価した。
論文 参考訳(メタデータ) (2021-01-27T19:28:04Z) - Weakly-Supervised Cross-Domain Adaptation for Endoscopic Lesions
Segmentation [79.58311369297635]
異なるデータセットにまたがるトランスファー可能なドメイン不変知識を探索できる,新しい弱い教師付き病巣移動フレームワークを提案する。
wasserstein quantified transferability frameworkは、広い範囲の転送可能なコンテキスト依存性を強調するために開発されている。
新規な自己監督型擬似ラベル生成器は、送信困難かつ転送容易なターゲットサンプルの両方に対して、確実な擬似ピクセルラベルを等しく提供するように設計されている。
論文 参考訳(メタデータ) (2020-12-08T02:26:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。