論文の概要: Decomposing Error and Style in Automated Clinical Coding
- arxiv url: http://arxiv.org/abs/2609.24877v1
- Date: Mon, 21 Sep 2026 16:47:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.418071
- Title: Decomposing Error and Style in Automated Clinical Coding
- Title(参考訳): 自動符号化における誤りとスタイルの分解
- Abstract要約: 2つのチームが110のACI-Bench遭遇をコーディングすると、同じメモに対して73%のコードで合意する。
私たちは、システマティックコンポーネントをコーディングスタイル$、コーディングするコードやドキュメントの量に関するコーダやサイト固有のポリシーとしてモデル化し、コーディングを$p(mathrmcodemidmathrmnote)$として再キャストします。
5つのデータセットにわたって、データマッチングスタイルで条件付けられたモデルでは、ICD F1が最大26ポイント上昇し、極端なミスマッチが最大21ポイント低下する。
- 参考スコア(独自算出の注目度): 3.754755158590017
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In automated clinical coding, where the label space spans tens of thousands of diagnosis and procedure codes, models are currently evaluated against a single gold annotation, treating any deviation as error. But we find when two teams code the same 110 ACI-Bench encounters, they agree on only 73% of codes (Jaccard similarity) for the same note; even after an independent clinical audit removes erroneous codes, agreement rises only to 77%. Is that gap error or something systematic? We model the systematic component as coding style $ψ$, a coder- or site-specific policy over what to code and how much to document, and recast coding as $p(\mathrm{code}\mid\mathrm{note},ψ)$, estimating $ψ$ with a 10-dimension rubric. If style were noise, conditioning on it would do nothing. Instead, across five datasets a model conditioned with a data-matching style raises ICD F1 by up to 26 points and an extreme mismatched one lowers it by up to 21. Four prompt based coding methods spanning 39-49 F1 converge to 52-56 once style is supplied (All p<0.05). Much of what single-gold evaluation charges to model error is recoverable, unmodeled style.
- Abstract(参考訳): ラベル空間が数万の診断および手順コードにまたがる自動臨床コーディングにおいて、モデルは現在、単一のゴールドアノテーションに対して評価され、偏差を誤りとして扱う。
しかし、2つのチームが同じ110のACI-Bench遭遇をコードする場合、同じメモに対して73%のコード(Jaccardの類似性)しか合意していません。
そのギャップエラーか、あるいはシステマティックなものか?
私たちは、システマティックなコンポーネントをコーディングスタイルとして、コードとドキュメントの量に関するコーダまたはサイト固有のポリシーである$ $としてモデル化し、コーディングを$p(\mathrm{code}\mid\mathrm{note}, )$として再キャストします。
もしスタイルがノイズだったら、何もしないでしょう。
代わりに、データマッチングスタイルで条件付けられたモデルが5つのデータセットにまたがって、ICD F1を最大26ポイント引き上げ、極端なミスマッチしたモデルが最大21ポイント下げる。
39-49 F1にまたがる4つのプロンプトベースの符号化手法は、1つのスタイルが供給されると52-56に収束する(全p<0.05)。
モデルエラーに対する単金評価の料金の多くは、回復可能で、モデルなしのスタイルである。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Lost and Found in Translation: Variational Diagnostics for Neural Codebook Channels [0.0]
変分オートエンコーダ(VAE)は、エンコーダ$q_$とデコーダ$p_$を共同でトレーニングし、実践者は結果として生じる遅延空間を離散コードとして扱う。
標準的なVAE診断は、このコードが使用されているかどうか、デコーダがエンコーダのコードの下で各潜伏者を読み取るかどうかのみを認証する。
我々は,アーキテクチャフリーなBernoulli-KL証明書によって,対角線外質量を束縛したエンコーダデコーダ診断法を開発した。
論文 参考訳(メタデータ) (2026-05-13T06:52:21Z) - Training a Large Language Model for Medical Coding Using Privacy-Preserving Synthetic Clinical Data [10.24013423253024]
本稿では,現代のオープンウェイト基盤モデルが,専門家レベルの医療用コーディングタスクに適応できるかどうかを検討する。
Llama 3-70B を EHR-grounded templates と code policy から生成された臨床ノートとゴールドコードに微調整する。
合成コーパスの微調整の後、精度の高いF1は0.70を超え、両方のコードシステムで絶対的な利得を示している。
論文 参考訳(メタデータ) (2026-03-06T02:02:49Z) - SciCoQA: Quality Assurance for Scientific Paper--Code Alignment [53.70401063640645]
SciCoQAは,学術出版物と論文の相違を検出するためのデータセットである。
我々のデータセットは611の紙コード不一致(81のリアル、530の合成)で構成されており、様々な計算科学分野にまたがっている。
評価における最高の性能モデルである GPT-5 は、実世界の紙コード差の45.7%しか検出できない。
論文 参考訳(メタデータ) (2026-01-19T10:04:33Z) - Estimating the Decoding Failure Rate of Binary Regular Codes Using Iterative Decoding [84.0257274213152]
並列ビットフリップデコーダのDFRを高精度に推定する手法を提案する。
本研究は,本症候群のモデル化およびシミュレーションによる重み比較,第1イテレーション終了時の誤りビット分布の誤検出,復号化復号化率(DFR)について検証した。
論文 参考訳(メタデータ) (2024-01-30T11:40:24Z) - Can GPT-3.5 Generate and Code Discharge Summaries? [45.633849969788315]
ICD-10のコード記述リストに基づいて,9,606個の放電サマリーを生成し,符号化した。
ニューラルネットワークモデルはベースラインと拡張データに基づいて訓練された。
マイクロF1スコアとマクロF1スコアを全コードセット、生成コードおよびそれらの家族について報告する。
論文 参考訳(メタデータ) (2024-01-24T15:10:13Z) - Automated clinical coding using off-the-shelf large language models [10.365958121087305]
診断用ICD符号を患者病院入院に割り当てる作業は、典型的には、熟練した人間のコーダーによって行われる。
自動ICD符号化への取り組みは、教師付きディープラーニングモデルによって支配されている。
本研究では,既製の事前学習型大規模言語モデルを活用し,実用的ソリューションを開発する。
論文 参考訳(メタデータ) (2023-10-10T11:56:48Z) - Code Compliance Assessment as a Learning Problem [0.15229257192293197]
コードコンプライアンスアセスメントを機械学習(ML)問題として定式化する。
コードのコンプライアンス、非コンプライアンス、あるいは無関係に関する予測を生成します。
当社のツール Policy2Code は分類精度 (59%, 71%) と検索MSR (0.05, 0.21) を実現している。
ユーザ調査では、24%のPolicy2Code検出が、CodeBERTの7%に対して受け入れられた。
論文 参考訳(メタデータ) (2022-09-10T05:41:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。