論文の概要: KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models
- arxiv url: http://arxiv.org/abs/2607.28608v1
- Date: Thu, 30 Jul 2026 17:57:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.709266
- Title: KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models
- Title(参考訳): カイゼン:臨床リスクモデルのための再現可能なサブグループフェアネス
- Abstract要約: KAISENは、サブグループの成層、不均質の測定、メカニズム診断、ポストホック緩和、ドリフトモニタリングを含む5段階の監査パイプラインである。
すべての結果は、既知の根拠の真実と共に合成され、臨床的妥当性が確立されない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Clinical risk models routinely achieve strong aggregate performance while producing materially different error rates across patient subgroups. Audit pipelines have been proposed to catch this, but their components are rarely stress-tested, so it is unclear which parts of an audit can be trusted and under what conditions. We present KAISEN, a five-phase audit pipeline covering subgroup stratification, disparity measurement, mechanism diagnostics, post-hoc mitigation, and drift monitoring, evaluated to the point of failure on a synthetic benchmark of 16 disease tasks, 15 social-determinant axes from Healthy People 2030, and three prespecified intersections. Four findings follow. (i) Significance tracks each axis's gap against its own minimum detectable effect: rank correlation between significance count and raw equalized-odds difference (EOD) across the 15 axes is rho = 0.56, rising to rho = 0.78 once EOD is standardized by that floor. (ii) Per-group threshold optimization reduces EOD in 48 of 48 held-out runs (paired delta = -0.285, 95% CI [-0.313, -0.252]), while group-wise Platt scaling -- the better calibrator -- behaves as a coin flip on EOD (19 of 48 runs improved, 95% CI [0.26, 0.55]) with mean effect near zero, so what an audit should report is the variance, not the average. (iii) The mechanism diagnostic classifies 144 of 144 controlled cases correctly but recovers none of 48 model-driven cases under proxy misspecification, with no signal that it failed. (iv) CUSUM failures and false alarms track cohort realization far more than disease: at the reference threshold, all 27 false alarms and 7 of 8 missed shifts come from different seeds (chi-squared p = 0.002), so a threshold tuned on one cohort fails to transfer. All results are synthetic with known ground truth and do not establish clinical validity. Code, artifacts, and scripts reproducing every number are released.
- Abstract(参考訳): 臨床リスクモデルは、患者サブグループ間で実質的に異なるエラー率を発生させながら、強力な集計性能を定期的に達成する。
これをキャッチするために監査パイプラインが提案されているが、そのコンポーネントがストレステストされることはめったにないため、監査のどの部分が信頼でき、どのような条件下にあるかは定かではない。
本報告では, サブグループ階層化, 分散度測定, メカニズム診断, ポストホック緩和, ドリフトモニタリングを含む5段階の監査パイプラインであるKAISENについて, 16の疾患タスクと15の社会的決定軸, および3つの所定の交差点の総合ベンチマークで, 障害点の評価を行った。
以下の4つの発見がある。
(i)重要度は、各軸のギャップを、その最小検出効果に対して追跡する:重み数と15軸にわたる生等化オードス差(EOD)のランク相関は、rho = 0.56であり、EODがそのフロアによって標準化されるとrho = 0.78に上昇する。
(ii)グループごとのしきい値最適化により48回のうち48回(paired delta = -0.285, 95% CI [-0.313, -0.252])のEODが減少する一方、グループごとのPlattスケーリング -- より良いキャリブレータ -- は、EOD(48回のうち19回は改善、95% CI [0.26, 0.55])のコインフリップとして振る舞う。
3) このメカニズムは144例のうち144例を正しく分類するが,48例のモデル駆動型症例をプロキシミスで回収することはなく, シグナルは得られなかった。
基準閾値では、27の誤報と8の誤報のうち7の欠落は、異なる種子(chi-squared p = 0.002)から生じるため、1つのコホートに調整された閾値は転送に失敗する。
すべての結果は、既知の根拠の真実と共に合成され、臨床的妥当性が確立されない。
すべての数値を再生するコード、アーティファクト、スクリプトがリリースされる。
関連論文リスト
- Counterfactual Fairness Audits of Multi-Step Clinical LLM Agents Require a Measured Per-Action Instability Floor [3.0704370207786265]
本研究は, アクションフロアを横に置かずに報告した反実的公正度推定値が, 相違の証拠として読めないことを示す。
FairMedAgentは, 臨床適応剤の作用の差異を評価するための評価ハーネスである。
論文 参考訳(メタデータ) (2026-09-02T23:38:17Z) - Wolff-Parkinson-White Detection at 471:1 Class Imbalance: A Leakage-Controlled Study of the Data Bottleneck [0.0]
Wolff-Parkinson-White症候群 (WPW) は先天性心前駆症であり、臨床的には重要であり、12誘導心電図では欠落することが多い。
PTB-XL と Chapman-Shaoxing-Ningbo の2つの公開 12-lead corpora: 66,951 レコード,142 レコードの WPW は 0.21% (約471:1) である。
事前に規定された1つのリーク制御プロトコルの下では、ホールドアウトフォールドが正確に1回接触し、信号の7つの表現を比較し、分割と評価を固定する。
論文 参考訳(メタデータ) (2026-07-27T20:57:46Z) - RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning [42.80742579670377]
RareLensは、まれな疾患の軌跡全体にわたる臨床的意思決定を支援するシステムである。
RareBenchは、33のOrphanetカテゴリと7000以上の条件にまたがる157,525件の実際のデータセットである。
検診で0.917、診断と治療で65.5%、89.8%の成績を収めた。
論文 参考訳(メタデータ) (2026-07-25T16:58:10Z) - Calibrated Alzheimer's Conversion Risk in Mild Cognitive Impairment: Persistent Homology of Clinical Trajectories with Conformal Guarantees [0.0]
軽度の認知障害からアルツハイマー病への転換を予測することは、臨床試験とケア計画の中心である。
既存のモデルは個々のレベルの不確実性評価を提供しておらず、透明な漏洩監査を含むことは滅多にない。
本研究は, 持続的ホモロジーの経時的臨床軌道点雲への応用について紹介する。
論文 参考訳(メタデータ) (2026-07-20T00:00:17Z) - CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning [37.91882261875461]
大規模言語モデル (LLMs) は多くの医学ベンチマークにおいて強い結果が得られたが, 臨床的理由を確実に評価することは困難である。
プログレッシブな情報マスキング下でのLCM臨床推論を評価するための人為的ループ・フレームワークであるCLExEvalを紹介した。
論文 参考訳(メタデータ) (2026-06-30T12:56:42Z) - Evaluation Awareness Is Not One Capability: Evidence from Open Language Models [1.758143872501506]
安全ベンチマークは、テスト条件の振る舞いがデプロイメントの振る舞いを予測すると仮定する。
これにより、ベンチマークパフォーマンスとデプロイメントの動作のギャップが開ける。
我々は、37のオープンウェイトモデルと7つのファミリーにわたる8つの実験を通して、この評価意識を特徴づける。
論文 参考訳(メタデータ) (2026-06-22T16:48:43Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes [4.738949927143789]
隠れ状態における線形デオード可能な故障信号が、それらの故障を修正するために活用できるかどうかを検討する。
固定されたリニアステアリングファミリーが修正に利用できない場合でも、デオード可能な故障構造がポストジェネレーションの信頼性評価をサポートすることがわかった。
論文 参考訳(メタデータ) (2026-05-07T05:58:38Z) - Predictive Entropy Links Calibration and Paraphrase Sensitivity in Medical Vision-Language Models [2.064612766965483]
我々は,MedGemma 4BITの分布MIMIC CXRと外分布PadChest chest X ray データセットの5つの不確実性定量化手法を示し,LLaVA RAD7Bのクロスアーキテクチャ検証を行った。
うまく校正された単一モデル法では、一方のフォワードパスからの予測エントロピーは、メドジェマのAUROC 0.711、LLaVARAD p 10 4の0.878、信頼できないと敏感な予測の両方を1つのエントロピーしきい値でフラグ付けることができる。
論文 参考訳(メタデータ) (2026-04-10T04:18:47Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - Robust Fair Disease Diagnosis in CT Images [6.957497306200416]
クラス不均衡とグループアンダー表現はしばしば一致し、複合的な障害モードを生み出します。
この問題の両軸を対象とする2段階の目標を提案する。
Kinetics-400で事前訓練した3D ResNet-18を用いたFair Disease Diagnosisベンチマークについて検討した。
論文 参考訳(メタデータ) (2026-04-08T03:37:44Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Leveraging the Mahalanobis Distance to enhance Unsupervised Brain MRI Anomaly Detection [35.46541584018842]
教師なし異常検出(UAD)法は、異常を外れ値として識別するために健全なデータ分布に依存する。
脳MRIでは、再生モデルが正常な脳MRIを再構成し、異常が入力と再構成のずれとして検出される。
我々は確率的拡散モデルを用いて複数の再構成を構築し、マハラノビス距離を用いてこれらの再構成結果の分布を分析し、異常を外れ値として同定する。
論文 参考訳(メタデータ) (2024-07-17T11:02:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。