論文の概要: Language-model ratings of depression reflect the rater more than the patient
- arxiv url: http://arxiv.org/abs/2610.08501v1
- Date: Tue, 06 Oct 2026 15:08:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.068498
- Title: Language-model ratings of depression reflect the rater more than the patient
- Title(参考訳): 抑うつの言語モデル評価は患者よりもレーダを反映する
- Abstract要約: 言語モデルはタイヤレスで一貫した評価を約束するが、正確なラッカーは個人について意見が一致しないだろうか?
モデル選択では、総症状スコアのばらつきの30.0%、安定した参加者差の10.5%が説明されている。
受信機操作特性曲線 (AUC) >= 0.70 の領域がランダムに描画された2つのラッカーは、平均40%の被験者のスクリーニング決定に異を唱えた。
- 参考スコア(独自算出の注目度): 13.033343345709207
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Depression has no diagnostic blood test. Language models promise tireless, consistent assessment, but can accurate raters disagree about individuals? We pre-registered 880 language-model raters, crossing 11 open models with prompting and scoring choices, and applied them to 189 interviews against the eight-item Patient Health Questionnaire. Model choice explained 30.0% of summed-symptom score variance, stable participant differences 10.5%. Two randomly drawn raters with area under the receiver operating characteristic curve (AUC) >= 0.70 disagreed on screening decisions for 40% of participants, on average. Average over-rating governed how many were flagged, yet equal-capacity raters chose differently for about one participant in five. A locked analysis of 86 new interviews reproduced the main pre-registered findings. Exploratory recalibration with 40 labelled participants raised accuracy from about 60% to 75% and halved disagreement, leaving one participant in five decided differently. Calibration repaired much of the rater dependence without securing agreement about individuals.
- Abstract(参考訳): うつ病には血液検査がない。
言語モデルはタイヤレスで一貫した評価を約束するが、正確なラッカーは個人について意見が一致しないだろうか?
我々は880の言語モデルレーダを事前登録し、11のオープンモデルを横断して選択を促し、その結果を189の面接に応用した。
モデル選択では、総症状スコアのばらつきの30.0%、安定した参加者差の10.5%が説明されている。
受信機操作特性曲線 (AUC) >= 0.70 の領域がランダムに描画された2つのラッカーは、平均40%の被験者のスクリーニング決定に異を唱えた。
平均的な過度な評価では、フラグ付きでも同等の能力を持つラッカーが5人に1人ずつ、それぞれ異なる選択をした。
86件の新規面接のロック解析により, 主登録済みの症例を再現した。
40名のラベル付き参加者による探索的リカレーションにより、約60%から75%の精度が向上し、意見の不一致が半減し、5名のうち1名が異なる決定をした。
キャリブレーションは、個人に関する合意を確保することなく、レーダ依存の多くを修復した。
関連論文リスト
- Differentially Private and Fairness-Audited Score Diffusion for Irregular Longitudinal Health Records [0.0]
本報告では,有界な統計量を組み合わせた患者レベルプライベートジェネレータであるTRUST LONGSYNTHについて述べる。
720例を含む5つのコホート・ベンチマークを独立に評価した。
一方、ブライア、キャリブレーション、相関、自己相関の誤差はそれぞれ6.1%、17.0%、28.0%、30.1%減少した。
論文 参考訳(メタデータ) (2026-09-18T12:36:22Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - Counterfactual Fairness Audits of Multi-Step Clinical LLM Agents Require a Measured Per-Action Instability Floor [3.0704370207786265]
本研究は, アクションフロアを横に置かずに報告した反実的公正度推定値が, 相違の証拠として読めないことを示す。
FairMedAgentは, 臨床適応剤の作用の差異を評価するための評価ハーネスである。
論文 参考訳(メタデータ) (2026-09-02T23:38:17Z) - Benchmarking Open-Source Speech Emotion Recognition in Naturalistic Mandarin Spine Clinic Consultations: A Pilot Validation Study [5.110846032142439]
音声感情認識(SER)は、臨床診断における受動的影響モニタリングを可能にする。
我々は,3つのオープンソースSERモデルを,自然主義的スピン・クリニック音声における研究者合意基準と比較した。
高いインターモデル(90.8%)にもかかわらず、全てのモデルはサッド、フィア、アンガー、ニュートラル、サプライズドをほぼゼロにリコールした。
論文 参考訳(メタデータ) (2026-08-24T13:36:23Z) - RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning [42.80742579670377]
RareLensは、まれな疾患の軌跡全体にわたる臨床的意思決定を支援するシステムである。
RareBenchは、33のOrphanetカテゴリと7000以上の条件にまたがる157,525件の実際のデータセットである。
検診で0.917、診断と治療で65.5%、89.8%の成績を収めた。
論文 参考訳(メタデータ) (2026-07-25T16:58:10Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Explainable Admission-Level Predictive Modeling for Prolonged Hospital Stay in Elderly Populations: Challenges in Low- and Middle-Income Countries [65.4286079244589]
長期滞在期間 (pLoS) は, 院内感染のリスクに関連する重要な要因である。
入院レベルの患者と病院の診療データを用いて, pLosの予測モデルを開発し, 解説する。
論文 参考訳(メタデータ) (2026-01-07T23:35:24Z) - Medical Hallucinations in Foundation Models and Their Impact on Healthcare [71.15392179084428]
基礎モデルの幻覚は自己回帰訓練の目的から生じる。
トップパフォーマンスモデルは、チェーン・オブ・シークレット・プロンプトで強化された場合、97%の精度を達成した。
論文 参考訳(メタデータ) (2025-02-26T02:30:44Z) - Automatically measuring speech fluency in people with aphasia: first
achievements using read-speech data [55.84746218227712]
本研究の目的は,言語習得の分野で開発された信号処理algorithmの関連性を評価することである。
論文 参考訳(メタデータ) (2023-08-09T07:51:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。