論文の概要: Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models
- arxiv url: http://arxiv.org/abs/2607.27384v1
- Date: Wed, 29 Jul 2026 18:43:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.309566
- Title: Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models
- Title(参考訳): 同じ事実と診断の相違:臨床言語モデルにおけるナラティブ・アンコリングの測定と緩和
- Abstract要約: 我々は,1,000USMLE臨床ヴィグネットのデータセットを構築し,それぞれが3つの社会言語学的に異なるペルソナに書き換えた。
ナラティブ・アンチョリングは、テストされた全てのモデルにおいて直接的なプロンプトの下で統計的に有意であり、ナラティブ・アンチョリングギャップは0.064から0.151である。
診断開始前の臨床事実を構造的に抽出し,検証する3エージェントパイプラインであるNarrativeShieldを紹介した。
- 参考スコア(独自算出の注目度): 0.15293427903448023
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models used for clinical diagnostic reasoning are sensitive to sociolinguistic register, not just clinical content. We term this failure mode Narrative Anchoring: identical clinical facts expressed in different registers cause diagnostic outputs to diverge. Unlike prior demographic-bias work, which manipulates explicit identity tokens such as race or income, our benchmark isolates register as the sole channel of variation, with no demographic marker present in any form. We construct a dataset of 1,000 USMLE clinical vignettes, each rewritten into three sociolinguistically distinct personas under an independently audited fact-preservation guarantee, verified by a separate model that never sees the generation prompt. Across seven language models spanning three architecture families and scales, Narrative Anchoring is statistically significant under direct prompting in every model tested, with a Narrative Anchoring Gap of 0.064 to 0.151. Chain-of-thought reasoning and explicit debiasing instructions reduce the bias only partially, and their apparent gains are frequently confounded by accuracy collapse. We introduce NarrativeShield, a three-agent pipeline that structurally extracts and verifies clinical facts before diagnostic reasoning begins, reducing the Narrative Anchoring Gap to near-zero ($-0.004$ to $0.037$) and achieving the lowest rate of severely unstable decisions (DSS $<$ 0.8) of any method across all models, at a modest and mechanistically expected accuracy cost for most models. A stress test using a non-instruction-tuned base model shows that executing a debiasing intervention at all is gated by zero-shot instruction-following ability, not prompt content alone. We release our dataset, human-validated for fact preservation, as a standalone resource for studying register-based clinical bias.
- Abstract(参考訳): 臨床診断推論に使用される大きな言語モデルは、臨床内容だけでなく、社会言語登録に敏感である。
この障害モードをナラティブ・アンチョリング(Narrative Anchoring):異なるレジスタで表される同一の臨床事実が診断出力のばらつきを引き起こす。
人種や収入などの明示的なアイデンティティトークンを操作する従来の人口統計バイアス処理とは異なり、我々のベンチマークでは、レジスタを唯一の変化チャネルとして分離し、いかなる形でも人口統計マーカーは存在しない。
我々は,1,000 USMLE 臨床ヴィグネットのデータセットを構築し,それぞれが独立に監査された事実保存保証の下で,社会言語学的に異なる3つの人格に書き換え,生成プロンプトを決して見ることのない別のモデルで検証した。
3つのアーキテクチャファミリとスケールにまたがる7つの言語モデルにおいて、Narrative Anchoringはテスト対象のモデルごとに直接プロンプトの下で統計的に有意であり、Narrative Anchoring Gapは0.064から0.151である。
思考の連鎖的推論と明示的な偏見的指示は偏見を部分的に減らし、その明らかな利得は精度の崩壊によってしばしば理解される。
診断的推論が始まる前に臨床事実を構造的に抽出し検証し、Narrative Anchoring Gapをほぼゼロ($-0.004$から$0.037$)に減らし、全てのモデルにおいて極めて不安定な決定(DSS $<$ 0.8)の最低率を達成するための3エージェントパイプラインであるNarrativeShieldを紹介した。
非インストラクションチューニングベースモデルを用いたストレステストでは,非インストラクションフォロー能力によって,非インストラクションの介入を全く行わないことが示され,コンテンツのみをプロンプトするものではない。
我々は,登録ベースの臨床バイアスを研究するためのスタンドアロンのリソースとして,事実保存のための人間検証データセットをリリースする。
関連論文リスト
- Conformalized Large Language Models under Configuration Shift [46.502741608809174]
コンフォーマル予測は不確実性定量化のための分布のないフレームワークである。
非整合性スコアは、単に固定モデルではなく、推論パイプラインによって引き起こされることが多い。
構成シフトがCPの妥当性を損なうことを示す。
論文 参考訳(メタデータ) (2026-08-02T19:34:41Z) - RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning [42.80742579670377]
RareLensは、まれな疾患の軌跡全体にわたる臨床的意思決定を支援するシステムである。
RareBenchは、33のOrphanetカテゴリと7000以上の条件にまたがる157,525件の実際のデータセットである。
検診で0.917、診断と治療で65.5%、89.8%の成績を収めた。
論文 参考訳(メタデータ) (2026-07-25T16:58:10Z) - The C-index illusion: discrimination without calibration in published survival models [0.0]
我々は3つの構造的に異なる領域にまたがって3つのサバイバル-MLモデルを再現する。
ホルム補正された家族的誤り率の下で,5つの事前登録仮説を検証した。
論文 参考訳(メタデータ) (2026-07-21T19:13:54Z) - Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation [0.0]
モデルが生成した統計量を検出する能力を持っているが、マルチソース合成においてこの能力を採用していないことを示す。
具体的には、ソースの影響は、解析テキストの分布レジスタに応答するが、数値の有効性には反応しない方法論登録ゲートによって制御される。
論文 参考訳(メタデータ) (2026-06-03T20:15:48Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - SAAG: Structured Agent Assessment and Grounding [13.62148061055744]
本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-30T19:33:58Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - Agentic Cognitive Profiling: Realigning Automated Alzheimer's Disease Detection with Clinical Construct Validity [66.94391219005291]
本稿では,臨床プロトコルロジックによる自動スクリーニングを実現するエージェント認知プロファイリング(ACP)を提案する。
我々の設計の中心は、すべての定量化を決定論的関数呼び出しに委譲することで、測定から意味的理解を分離することである。
ACPは、タスク試験で90.5%のスコアマッチ率、AD予測で85.3%の精度を達成し、一般的な基準を上回っている。
論文 参考訳(メタデータ) (2026-03-18T06:15:35Z) - MeCaMIL: Causality-Aware Multiple Instance Learning for Fair and Interpretable Whole Slide Image Diagnosis [40.3028468133626]
MIL(Multiple Case Learning)は、コンピュータ病理学における全スライド画像(WSI)解析の主流パラダイムとして登場した。
因果関係を意識したMILフレームワークである textbfMeCaMIL は、構造化因果グラフを通じて、階層的共同創設者を明示的にモデル化する。
MeCaMILは優れた公正性を達成する -- 人口格差の分散は、属性全体の平均で65%以上減少する。
論文 参考訳(メタデータ) (2025-11-14T06:47:21Z) - MEDEQUALQA: Evaluating Biases in LLMs with Counterfactual Reasoning [7.167933033102407]
重篤な症状と症状を一定に保ちながら,患者代名詞のみを摂動する反ファクト・ベンチマークであるMEDEQUALQAを紹介する。
我々は、GPT-4.1モデルを評価し、代名詞の変種間の安定性を測定するために、推論トレース間のセマンティックテキスト類似性(STS)を計算する。
以上の結果から,総じて高い類似性(平均STS >0.80)を示した。
論文 参考訳(メタデータ) (2025-10-09T22:12:58Z) - Clinical Uncertainty Impacts Machine Learning Evaluations [40.773483049446426]
機械学習評価は, 直接分布に作用する確率的指標を用いて, アノテーションの不確かさを明示的に考慮すべきである,と論じる。
我々は、データセットの生アノテーションをコミュニティに公開し、パフォーマンス推定が臨床データをよりよく反映できるように、不確実性を考慮した評価を採用するよう促す。
論文 参考訳(メタデータ) (2025-09-26T11:56:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。