論文の概要: Same Predictions, Different Harms: Causal Auditing of Patient World Models
- arxiv url: http://arxiv.org/abs/2610.05198v1
- Date: Sun, 04 Oct 2026 13:11:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 22:42:00.399536
- Title: Same Predictions, Different Harms: Causal Auditing of Patient World Models
- Title(参考訳): 同じ予測、異なるハーム:患者世界モデルの因果監査
- Abstract要約: 患者世界モデルは、移行カーネルと腕固有のリスクについて合意するが、治療を切り替えることによって傷つく患者の割合には同意しない。
我々はこの信頼性ギャップを2段階の共有応答型SCMで評価する。
その結果、患者世界モデルが対実的被害に対して安全であるかどうかを決定するための具体的なプロトコルが提供される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Patient world models used for clinical trial simulation can agree on transition kernels and arm-specific risks, yet disagree on the fraction of patients harmed by switching treatment---the counterfactual quantity that matters for intervention-aware reasoning. We audit this reliability gap in a two-stage shared-response SCM: a categorical intermediate health state is followed by common terminal care. Under independent stages, the sharp harm interval has closed-form endpoints for at most three intermediate states, with an exactness boundary at four states. Declared dependence and response-mismatch budgets yield calibrated outer bounds when stage independence or complete mediation is relaxed; in a symmetric three-state model the entire sensitivity frontier is sharp, $[0,\min\{1/2,1/3+(ρ+δ)/2\}]$, and shows exactly how budgets erase the gain over endpoint-only bounds. Two eight-variable response LPs propagate interventional uncertainty for finite-sample audits. Exact witnesses verify attainability. On public clinical simulators (EpiCare; sepsis), native configurations show little resolved stage dependence and no additional joint-compatibility gain over pairwise transport---honest negative results for reliability claims. All experiments are locally reproducible; guarantees remain conditional on the stated causal model. The results provide a concrete protocol for deciding when a patient world model is safe to trust for counterfactual harm.
- Abstract(参考訳): 臨床試験シミュレーションに使用される患者世界モデルは、トランジションカーネルと腕固有のリスクに合意できるが、治療を切り替えることによって傷つく患者の割合には同意できない。
本研究では、この信頼性ギャップを2段階の共有応答型SCMで評価する。
独立した段階下では、鋭い調和区間は、少なくとも3つの中間状態の閉形式の終点を持ち、4つの状態の正確な境界を持つ。
宣言された依存性と応答ミスマッチの予算は、ステージ独立または完全なメディエーションが緩和されたときに、キャリブレーションされた外界を生じる; 対称的な三状態モデルでは、すべての感度フロンティアは鋭く、$[0,\min\{1/2,1/3+(ρ+δ)/2\}]$であり、予算がエンドポイントのみの境界を超える利得を正確に消去する方法を示している。
2つの8変数の応答LPは、有限サンプル監査に対する介入の不確実性を伝播させる。
厳密な証人は到達可能性を確認する。
公立臨床シミュレータ (EpiCare; sepsis) では, 段階依存がほとんどなく, 相互輸送よりも共同適合性が向上しない。
すべての実験は局所的に再現可能である。
その結果、患者世界モデルが対物的被害に対して安全であるかどうかを決定するための具体的なプロトコルが提供される。
関連論文リスト
- Semantic Fibers and Cross-Gram Interference: A Calculus of Safety Drift in Overcomplete Representations [0.0]
デプロイされた言語モデルは、英語の有害な要求を拒否するが、その忠実な翻訳に従う。
我々はこの現象を監査同値関係で定式化する。
定式化された商、表現、メートル法、特徴辞書、スコアリングヘッド、しきい値、コントラストモデルに対して、得られた安全ドリフトは正確な線形代数的特徴を持つことを示す。
論文 参考訳(メタデータ) (2026-09-14T00:23:32Z) - Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records [16.68744679025527]
一般ドメイン大言語モデル(LLM)は、実世界の放電サマリーから表れる。
LLMは3,460人の候補者の不一致を表面化し、69.7%が入院した。
論文 参考訳(メタデータ) (2026-07-24T23:43:35Z) - The Digital Twin Counterfactual Framework: A Validation Architecture for Simulated Potential Outcomes [0.0]
Digital Twin Counterfactual Framework (DTCF)
五段階検証アーキテクチャは、シミュレーターが正しい反事実を生成できるという不当な主張を、観測可能なデータに対する偽証可能なテストに変換する。
分解は因果量から極端に検証されるものへと分離する。
共同因果関係の主張は明示的な前提付きとなる。
論文 参考訳(メタデータ) (2026-04-01T19:04:15Z) - Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness [49.2667937337333]
不完全な患者の医療反応を検出するために,この仮定をストレステストする。
我々は,2つの臨床診断データセットにわたる3つの粒度(General-Likert,Analytical-Rubric,Dynamic-Checklist)と3つのバックボーンモデルを評価する。
論文 参考訳(メタデータ) (2026-03-26T19:01:55Z) - The Confidence Gate Theorem: When Should Ranked Decision Systems Abstain? [0.0]
ランク付けされた決定システムは、いつランク付けされたアウトプットに介入するか、いつ停止するかを判断しなければならない。
信頼に基づく棄権が意思決定の質を単調に改善し、いつ失敗するかを考察する。
論文 参考訳(メタデータ) (2026-03-10T17:44:10Z) - Discovering Causal Relationships using Proxy Variables under Unmeasured Confounding [42.70985072862832]
観測研究における変数ペア間の因果関係の推測は極めて重要であるが,困難である。
我々は,不測の共同設立者の下で因果仮説をテストするために,離散的かつ連続的な設定を両立する一般的な非パラメトリックアプローチを開発する。
Intensive Care Data and World Values Surveyの広範囲なシミュレーションと実世界データによるアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2025-10-20T05:13:12Z) - MEDEQUALQA: Evaluating Biases in LLMs with Counterfactual Reasoning [7.167933033102407]
重篤な症状と症状を一定に保ちながら,患者代名詞のみを摂動する反ファクト・ベンチマークであるMEDEQUALQAを紹介する。
我々は、GPT-4.1モデルを評価し、代名詞の変種間の安定性を測定するために、推論トレース間のセマンティックテキスト類似性(STS)を計算する。
以上の結果から,総じて高い類似性(平均STS >0.80)を示した。
論文 参考訳(メタデータ) (2025-10-09T22:12:58Z) - Evaluating AI systems under uncertain ground truth: a case study in dermatology [43.8328264420381]
不確実性を無視することは、モデル性能の過度に楽観的な推定につながることを示す。
皮膚状態の分類では,データセットの大部分が重大な真理不確実性を示すことが判明した。
論文 参考訳(メタデータ) (2023-07-05T10:33:45Z) - Nonparametric Identifiability of Causal Representations from Unknown
Interventions [63.1354734978244]
本研究では, 因果表現学習, 潜伏因果変数を推定するタスク, およびそれらの変数の混合から因果関係を考察する。
我々のゴールは、根底にある真理潜入者とその因果グラフの両方を、介入データから解決不可能なあいまいさの集合まで識別することである。
論文 参考訳(メタデータ) (2023-06-01T10:51:58Z) - Causal Discovery via Conditional Independence Testing with Proxy Variables [35.3493980628004]
潜伏した共同設立者のような未観測変数の存在は、条件付き独立テストにバイアスをもたらす可能性がある。
本研究では,連続変数に対する因果関係の存在を効果的に検証できる仮説テスト手法を提案する。
論文 参考訳(メタデータ) (2023-05-09T09:08:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。