論文の概要: Counterfactual Fairness Audits of Multi-Step Clinical LLM Agents Require a Measured Per-Action Instability Floor
- arxiv url: http://arxiv.org/abs/2609.03221v2
- Date: Fri, 04 Sep 2026 13:47:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 13:53:00.625869
- Title: Counterfactual Fairness Audits of Multi-Step Clinical LLM Agents Require a Measured Per-Action Instability Floor
- Title(参考訳): 多段階LLM治療薬の対物フェアネス監査 : 経時的不安定性測定装置を用いて
- Authors: Rohith Reddy Bellibatlu, Manpreet Singh, Deepak Parashar, Rahul Joshi,
- Abstract要約: 本研究は, アクションフロアを横に置かずに報告した反実的公正度推定値が, 相違の証拠として読めないことを示す。
FairMedAgentは, 臨床適応剤の作用の差異を評価するための評価ハーネスである。
- 参考スコア(独自算出の注目度): 3.0704370207786265
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Counterfactual audits are the standard tool for checking whether a clinical agent treats demographically distinct but clinically identical patients differently. They report a flip rate: how often an action changes when only the patient descriptor changes. We show that this quantity is uninterpretable on its own. Re-running an identical condition ten times over sixteen vignettes (same narrative, same descriptor string, nothing varied) moved a clinical agent's action in 8.7% of outcome-vignette cells, and instability was heterogeneous across actions by a factor of eight, from 0.022 for ICU escalation to 0.179 for controlled-substance caution. No demographic contrast in our data was distinguishable from that floor. A second model gives a pooled floor of 6.7% and ranks the six actions almost identically (Spearman 0.94, exact p=0.017), so the floor is not one system's artefact. Majority-vote aggregation over five draws removes 39% of it and then flattens, and a null simulation attributes the residue to heterogeneous per-cell rates, so replication mitigates without eliminating. Any counterfactual fairness estimate reported without a per-action floor beside it therefore cannot be read as evidence of disparity. The measurements were taken with FairMedAgent, an evaluation harness for disparity in the actions of clinical LLM agents whose estimand, the within-range counterfactual flip rate, counts only flips between actions a published decision rule admits and a clinician has adjudicated. That estimand requires band adjudication, which is under way; no disparity result is claimed here. Each synthetic vignette runs a six-stage trajectory (five model-facing decisions around a deterministic environment step) under fixed-form conditions spanning race, sex, age, insurance, English proficiency, and their intersections. The harness, the floor protocol, and every analysis script are released.
- Abstract(参考訳): 臨床エージェントが人口統計学的に異なるが臨床的に同一の患者を別々に扱うかどうかを確認するための標準的なツールである。
患者記述子だけを変えると、どれくらいの頻度でアクションが変わるかが報告される。
私たちはこの量自体が解釈不能であることを示します。
16個のビグネット(同じ物語、同じ記述文字列、何も変化しない)に10回同じ条件を再度実行し、臨床薬の作用を8.7%の結果ビグネット細胞に移動させ、不安定性は8因子で異質となり、ICUエスカレーションは0.022から0.179まで変化した。
私たちのデータでは、そのフロアと区別できる人口統計上のコントラストはありませんでした。
第2のモデルでは、プールされた床の6.7%が与えられ、6つのアクションはほぼ同じ(スピアマン0.94、正確にはp=0.017)ため、床は1つのシステムの人工物ではない。
5つのドローを超えるメジャー・ボイト・アグリゲーションは、その39%を除去し、それから平坦化し、ヌルシュミレーションは残基を不均一なセル当たりのレートとみなすので、複製は除去せずに軽減される。
したがって、その横にアクション・フロアがないと報告された反実的公正性の推定は、不一致の証拠として読めない。
評価法としてFairMedAgentを用いて測定した。この評価法は,臨床LSMエージェントの作用の相違,すなわち範囲内反事実フリップ率を推定し,公表された判定規則と臨床医が適応した作用の相違をカウントする。
その推定法はバンドの判断を必要とするが、これは現在進行中であり、ここでは不一致の結果は主張されない。
それぞれの合成ヴィグネットは、人種、性別、年齢、保険、英語の習熟度、およびそれらの交点にまたがる固定形の条件下で、6段階の軌道(決定論的環境ステップを中心とした5つのモデル対面決定)を実行する。
ハーネス、フロアプロトコル、すべての分析スクリプトがリリースされる。
関連論文リスト
- A Judge Should Know What Changed:Construct Validity for LLM-as-a-Judge Evaluation [14.867869624585886]
評価器の構成妥当性を2次元プロファイルとして定式化する。
S と R は独立であり、スカラーの要約がすべての関連する比較を保存することはないことを示す。
これらの結果から, 評価対象構造の変化に対して, 高判定基準は弱い感度で共存できることが示唆された。
論文 参考訳(メタデータ) (2026-08-25T11:32:54Z) - Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel [0.0]
戦略ゲームにおける16個の軽量人格条件付きGPT-4.1構成の固定パネルについて検討した。
変化は急激なインデクシングであったが、そのシェアは不確実性の仮定に依存していた。
結果は、1つの固定されたモデル・プロンプトパネルに関係し、人間の置換性を確立しない。
論文 参考訳(メタデータ) (2026-08-02T04:10:11Z) - KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models [0.0]
KAISENは、サブグループの成層、不均質の測定、メカニズム診断、ポストホック緩和、ドリフトモニタリングを含む5段階の監査パイプラインである。
すべての結果は、既知の根拠の真実と共に合成され、臨床的妥当性が確立されない。
論文 参考訳(メタデータ) (2026-07-30T17:57:18Z) - RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning [42.80742579670377]
RareLensは、まれな疾患の軌跡全体にわたる臨床的意思決定を支援するシステムである。
RareBenchは、33のOrphanetカテゴリと7000以上の条件にまたがる157,525件の実際のデータセットである。
検診で0.917、診断と治療で65.5%、89.8%の成績を収めた。
論文 参考訳(メタデータ) (2026-07-25T16:58:10Z) - Enhancing Clinician Decision-Making via Uncertainty-Aware Multi-Expert Fusion for Stroke Rehabilitation [0.32553561239735207]
臨床的判断に取って代わるのではなく、拡張するように設計されたエンジンであるxAARAを提示する。
xAARAは、タスク、ムーブメントフェーズ、ムーブメント品質のレベルを越えて、キャリブレーションされた不確実性と説明でARATアセスメントを返します。
105回のストロークサバイバー(788回の運動)では、xAARAは94.2%のタスク精度と81.3%の移動位相精度を達成した。
論文 参考訳(メタデータ) (2026-06-23T09:00:15Z) - AgentFairBench: Do LLM Agents Discriminate When They Act? [2.3004655342211078]
AgentFairBenchは、LLMエージェントの動作における人口格差に対する、安価で再現可能なマルチドメインベンチマークである。
これは、雇用、貸与、医療トリアージという、規制対象の3つの領域にまたがっている。
NumPyのみのハーネスは、反ファクト的なフリップ率、平均絶対スコア差(MASD)、アクションレートの相違、ツール起動の相違を計算する。
論文 参考訳(メタデータ) (2026-06-15T13:50:26Z) - Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness [45.148328075418156]
デプロイされた注文エージェントは、階層の固定された分類に分解される。
純粋なスイートは、ロックされたスライス単位のベースラインに対して、すべての変更でCIで動作する。
制御されたレグレッションインジェクションにより、安全でない7つの層に一度に1つの層を分解し、検証する。
論文 参考訳(メタデータ) (2026-06-10T05:55:13Z) - Compared to What? Baselines and Metrics for Counterfactual Prompting [39.56472929066589]
患者の性別を外科的に変化させると,MedQAの14.9%のフリップ率を予測する。
本稿では,目標介入下で観察される相違点と,パラフレーズ入力によって引き起こされる相違点を比較検討する枠組みを提案する。
一般モデル感度を考慮すると,これらの効果は大きく消散することがわかった。
論文 参考訳(メタデータ) (2026-05-01T19:23:33Z) - A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models [34.38896321208398]
大規模言語モデル(LLM)は、ますます医療全体に展開されているが、既存のベンチマークでは、敵対的あるいは倫理的に複雑な条件下でのモデルの振る舞いを捉えていない。
我々は690の臨床的根拠のあるシナリオにまたがる11の現代LPMを評価する多ドメインレッド・チームリング・フレームワークを開発した。
その結果, 平均スコアは0.791~0.984。
論文 参考訳(メタデータ) (2026-04-15T14:57:55Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Correcting Class Imbalances with Self-Training for Improved Universal Lesion Detection and Tagging [43.06199185109424]
CT研究におけるユニバーサル病変検出・タグング(ULDT)は,腫瘍の負担評価と経過に伴う病変の進行(成長・収縮)の追跡に重要である。
以前の研究では、DeepLesionデータセット(4,427人、研究10,594人、CTスライス32,120人、病変32,735人、体の一部のラベル8人)をアルゴリズム開発に使用していたが、このデータセットは完全に注釈付けされておらず、クラス不均衡を含んでいる。
我々は,DeepLesionの11.5%のサブセットを限定的に使用して,ULDTのための自己学習パイプラインを開発した。
論文 参考訳(メタデータ) (2025-04-07T15:57:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。