論文の概要: Investigating Linear Probe Robustness to Linguistic Register, Medical Specialty, and Corpus Shifts in Medical QA
- arxiv url: http://arxiv.org/abs/2609.01361v1
- Date: Tue, 01 Sep 2026 15:01:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.789205
- Title: Investigating Linear Probe Robustness to Linguistic Register, Medical Specialty, and Corpus Shifts in Medical QA
- Title(参考訳): 医学QAにおけるリニアプローブロバストネスの言語登録, 専門性, コーパスの変化に関する調査研究
- Authors: Nishant Mishra, Ameen Abu-Hanna, Iacer Calixto,
- Abstract要約: 幾何学的には、真と偽の文は隠れ状態空間の安定な方向に沿って分離される。
私たちは、真理の方向性が書体に強くなっていることに気付きました。
レジスタ結果は第2のジェネレータで複製され、人書きの患者質問に受け継がれる。
- 参考スコア(独自算出の注目度): 1.991257277281412
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Linear classifiers trained on hidden states of a large language model (LLM), linear probes, can flag factual errors from a single forward pass. Geometrically, that implies that true and false statements separate along a stable direction in hidden state space, i.e., the truth direction. Prior work disagrees on whether this generalises across input shifts, but the disagreement is hard to interpret because cross-dataset probe transfer experiments confound several kinds of input change at once. We isolate three such variables in medical question-answering (QA): writing style (register), domain (medical specialty), and corpus (dataset). We build a benchmark using 500 MedQA entries, each rewritten into four styles (textbook, patient, clinical note, colloquial), annotated with clinical specialty, and grouped with two other exam corpora, MedMCQA and MMLU-medical, for cross-dataset evaluation. Probing four open-weight LLMs (2--8B), we find that the truth direction is largely robust to writing style (mean $Δ_\text{register} \approx 0.10$ AUROC on held-out facts) and to medical specialty ($Δ_\text{specialty} \approx 0.03$), but degrades unevenly across corpora: by $0.12$ AUROC on MMLU-medical and by $0.21$ on MedMCQA, roughly twice the register gap. The register result replicates with a second generator and carries over to human-written patient questions. The truth direction is therefore largely stable within the medical domain but breaks under some corpus shifts, and question format does not explain the break, which suggests that the signal a linear probe recovers is partly bound to dataset structure rather than to medical knowledge alone.
- Abstract(参考訳): 大規模言語モデル(LLM)の隠れ状態に基づいて訓練された線形分類器は、単一の前方通過から事実エラーをフラグできる。
幾何学的には、真と偽の言明が隠れ状態空間の安定な方向に沿って分離していることを意味する。
以前の研究では、入力シフトが一般化されるかどうかについては意見が一致していないが、クロスデータセットプローブ転送実験が複数の入力変更を同時に組み合わせているため、この意見の相違は解釈が難しい。
医療質問応答(QA)では,書字スタイル(登録),ドメイン(医療専門),コーパス(データセット)の3つの変数を分離する。
我々は500のMedQAエントリを使用してベンチマークを作成し、それぞれが4つのスタイル(テキスト、患者、臨床ノート、口語)に書き換えられ、臨床専門に注釈付けされ、他の2つの試験コーパスであるMedMCQAとMMLU-メディカルをグループ化して、クロスデータセット評価を行った。
4つのオープンウェイト LLM (2--8B) を仮定すると、真理方向は書式(保留事実について$Δ_\text{register} \approx 0.10$ AUROC)と医療専門($Δ_\text{specialty} \approx 0.03$)に大きく頑健であるが、MMLU-メディカルでは$0.12$ AUROC、MedMCQAでは$0.21$である。
レジスタ結果は第2のジェネレータで複製され、人書きの患者質問に受け継がれる。
したがって、真理方向は医学領域内では安定しているが、いくつかのコーパスシフトで破壊され、質問形式ではこの破壊を説明せず、線形プローブが回復する信号は、医療知識だけでなく、部分的にデータセット構造に結びついていることを示唆している。
関連論文リスト
- Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports [0.0]
インディアナ大学のデータセットから450個の胸部X線レポートを用いて、3つのリアルな書き換えタスクによって合成版を生成する。
我々は, 実体浸食(医学的NER), ヘッジ崩壊(臨床不確実性言語の欠如), クロスモーダルアライメント劣化を測定した。
劣化の主要な要因は、臨床内容ではなく、AI書き換えタスクの種類である。
論文 参考訳(メタデータ) (2026-06-16T11:07:48Z) - Internal Representation, Not Clinical Knowledge: Where Apparent LLM Triage Failures Originate [2.581200752140087]
患者投票型臨床トリアージベンチマークでは、制約付き多重選択出力における消費者LCMの低トライアージ率が高いことが報告されている。
両フォーマットで共有された臨床物語に同一の医療的特徴が現れるが、すべてのモデルにおいて、複数の選択決定トークンに沈黙する。
論文 参考訳(メタデータ) (2026-05-28T13:14:17Z) - ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows [7.27267618572654]
ProtoMedAgentは、反復的なゼロ段階のテスト時間最適化問題としてマルチモーダルな臨床報告を定式化する。
オンライン生成は、厳密な集合論微分と反射的スクリーブ・クリティカルループによって制限される。
ProtoMedAgentは91.2%の比較集合Fithfulnessを実現し、標準RAG(46.2%)を根本的に上回る
論文 参考訳(メタデータ) (2026-05-13T20:57:37Z) - Statistics, Not Scale: Modular Medical Dialogue with Bayesian Belief Engine [51.722324399751294]
大規模言語モデルは、自律的な診断エージェントとしてますますデプロイされているが、基本的に異なる2つの機能を説明する。
本稿では,言語と推論を厳格に分離するモジュール型診断対話フレームワークBMBEを紹介する。
論文 参考訳(メタデータ) (2026-04-21T21:59:57Z) - LLMs Can Get "Brain Rot"! [68.08198331505695]
ジャンクウェブテキストへの連続曝露は、大規模言語モデル(LLM)の持続的認知低下を誘導する
実Twitter/Xコーパスで制御された実験を行い、ジャンクと逆制御されたデータセットを構築します。
その結果、データ品質がLLM能力の崩壊の原因であることを示す重要な多視点的証拠が得られた。
論文 参考訳(メタデータ) (2025-10-15T13:28:49Z) - MedQARo: A Large-Scale Benchmark for Medical Question Answering in Romanian [50.767415194856135]
ルーマニア初の大規模医療QAベンチマークであるMedQARoを紹介する。
がん患者に関連する102,646のQAペアからなる高品質で大規模なデータセットを構築した。
論文 参考訳(メタデータ) (2025-08-22T13:48:37Z) - Localizing Anomalies via Multiscale Score Matching Analysis [13.898576482792173]
本稿では,脳MRIにおける異常局所化のための新しい教師なし手法であるSpatial-MSMAを紹介する。
パッチ位置とグローバル画像の特徴を条件としたフレキシブルな正規化フローモデルを用いて、パッチワイド異常スコアを推定する。
この方法は、通常発達している幼児の1,650T1およびT2重み付き脳MRIのデータセットで評価される。
論文 参考訳(メタデータ) (2024-06-28T17:57:12Z) - MURAL: An Unsupervised Random Forest-Based Embedding for Electronic
Health Record Data [59.26381272149325]
異なる変数型でデータを表現するための教師なしランダムフォレストを提案する。
muraL forestsは、ノード分割変数がランダムに選択される一連の決定ツリーで構成されている。
提案手法を用いることで,競合するアプローチよりも正確なデータの視覚化と分類が可能であることを示す。
論文 参考訳(メタデータ) (2021-11-19T22:02:21Z) - DeepEnroll: Patient-Trial Matching with Deep Embedding and Entailment
Prediction [67.91606509226132]
臨床試験は医薬品開発に不可欠であるが、高価で不正確で不十分な患者募集に苦しむことが多い。
DeepEnrollは、入力基準(タブラリデータ)を一致する推論のための共有潜在空間に共同でエンコードする、クロスモーダル推論学習モデルである。
論文 参考訳(メタデータ) (2020-01-22T17:51:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。