論文の概要: When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
- arxiv url: http://arxiv.org/abs/2603.25960v1
- Date: Thu, 26 Mar 2026 23:04:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-30 21:49:48.309344
- Title: When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
- Title(参考訳): チェーン・オブ・サードのバックファイア : 医学的言語モデルにおけるプロンプト感受性の評価
- Authors: Binesh Sadanandan, Vahid Behzadan,
- Abstract要約: MedMCQA(4,183質問)とPubMedQA(1,000質問)でMedGemma(4Bおよび27Bパラメータ)を評価する。
実験の結果,いくつかの知見が得られた。
- 参考スコア(独自算出の注目度): 2.064612766965483
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are increasingly deployed in medical settings, yet their sensitivity to prompt formatting remains poorly characterized. We evaluate MedGemma (4B and 27B parameters) on MedMCQA (4,183 questions) and PubMedQA (1,000 questions) across a broad suite of robustness tests. Our experiments reveal several concerning findings. Chain-of-Thought (CoT) prompting decreases accuracy by 5.7% compared to direct answering. Few-shot examples degrade performance by 11.9% while increasing position bias from 0.14 to 0.47. Shuffling answer options causes the model to change predictions 59.1% of the time, with accuracy dropping up to 27.4 percentage points. Front-truncating context to 50% causes accuracy to plummet below the no-context baseline, yet back-truncation preserves 97% of full-context accuracy. We further show that cloze scoring (selecting the highest log-probability option token) achieves 51.8% (4B) and 64.5% (27B), surpassing all prompting strategies and revealing that models "know" more than their generated text shows. Permutation voting recovers 4 percentage points over single-ordering inference. These results demonstrate that prompt engineering techniques validated on general-purpose models do not transfer to domain-specific medical LLMs, and that reliable alternatives exist.
- Abstract(参考訳): 大規模言語モデル (LLM) は、医療現場にますます配備されているが、素早いフォーマッティングに対する感度は、まだ不十分である。
MedMCQA (4,183質問) とPubMedQA (1,000質問) に対するMedGemma (4B, 27Bパラメータ) の評価を行った。
実験の結果,いくつかの知見が得られた。
CoT(Chain-of-Thought)は直接応答に比べて精度を5.7%低下させる。
少数の例ではパフォーマンスが11.9%低下し、位置バイアスは0.14から0.47に増加した。
シャッフル解答オプションは、モデルの予測を59.1%変更し、精度は27.4ポイントまで低下する。
フロントトランケーションのコンテキストを50%にすると、非コンテキストベースライン以下に精度が低下するが、バックトランケーションはフルコンテクストの精度の97%を保っている。
さらに、クローゼスコア(最高ログ確率オプショントークンの選択)が51.8%(4B)および64.5%(27B)に達し、全てのプロンプト戦略を超越し、生成したテキストショーよりも「ノウ」なモデルを明らかにする。
置換投票は、単一順序推論で4パーセントのポイントを回復する。
これらの結果は、汎用モデルで検証された迅速な技術技術は、ドメイン固有の医療用LLMに移行せず、信頼できる代替手段が存在することを示している。
関連論文リスト
- FairMed-XGB: A Bayesian-Optimised Multi-Metric Framework with Explainability for Demographic Equity in Critical Healthcare Data [1.7915158401181968]
批判的ケア設定にデプロイされた機械学習モデルは、人口統計バイアス、特に性別格差を示す。
本稿では,ジェンダーベースの予測バイアスを体系的に検出し緩和する新しいフレームワークであるFairMed-XGBを紹介する。
FairMed-XGBは、公平な臨床試験のための堅牢で解釈可能で倫理的に整合したソリューションを提供する。
論文 参考訳(メタデータ) (2026-03-16T07:57:40Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - TAGS: A Test-Time Generalist-Specialist Framework with Retrieval-Augmented Reasoning and Verification [27.918192794935255]
テストタイムフレームワークであるTAGSについて述べる。このフレームワークは、幅広い能力を持つ模範とドメイン固有のスペシャリストを組み合わせることで、補完的な視点を提供する。
TAGSは9つのMedQAベンチマークで強力なパフォーマンスを実現し、GPT-4oの精度は13.8%、DeepSeek-R1は16.8%、バニラ7Bモデルは14.1%から23.9%向上した。
論文 参考訳(メタデータ) (2025-05-23T18:28:59Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Medical Hallucinations in Foundation Models and Their Impact on Healthcare [71.15392179084428]
基礎モデルの幻覚は自己回帰訓練の目的から生じる。
トップパフォーマンスモデルは、チェーン・オブ・シークレット・プロンプトで強化された場合、97%の精度を達成した。
論文 参考訳(メタデータ) (2025-02-26T02:30:44Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions [6.19084217044276]
大規模言語モデル(LLM)における明示的バイアスと暗黙的バイアスの緩和は、自然言語処理の分野において重要な焦点となっている。
我々は,2700のユニークな文を含む450の攻撃的進行を含む,攻撃的進行に関する感性テストデータセットを紹介した。
以上の結果から,最も優れたモデルでさえバイアスを不整合に検出し,成功率は19.3%から69.8%であった。
論文 参考訳(メタデータ) (2024-09-20T18:34:38Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。