論文の概要: Quantization Effects on Biomedical LLM Reliability
- arxiv url: http://arxiv.org/abs/2608.03854v2
- Date: Wed, 05 Aug 2026 02:34:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.314846
- Title: Quantization Effects on Biomedical LLM Reliability
- Title(参考訳): 生体用LDMの信頼性に及ぼす量子化の影響
- Authors: Anton Rasmussen, Hong Qin,
- Abstract要約: PubMed文分類に基づく3つのMistral-7B変種(Base, BioMistral, Instruct)の制御評価を行った。
我々の主要な発見は、確率抽出プロトコルが明らかに校正を支配していることである。
プロンプトテンプレートの選択は、モデルレベルの効果に匹敵する7~24ポイントの精度差を生み出す。
- 参考スコア(独自算出の注目度): 7.3368947626054215
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When decoder language models are used as classifiers, predicted class probabilities depend on implementation choices, including the prompt template, verbalizer (label-to-token mapping), and scoring rule, that are rarely treated as experimental variables. We present a controlled evaluation of three Mistral-7B variants (Base, BioMistral, and Instruct) on PubMed RCT sentence classification (n=2000) under FP16, INT8, and INT4 precision using four answer-text prompt templates. Our primary finding is that the probability extraction protocol dominates apparent calibration. Switching from summed to mean token log-likelihood scoring reverses the calibration ranking between models: BioMistral average expected calibration error increases from 0.097 to 0.289, whereas Instruct decreases from 0.237 to 0.096, while accuracy changes by less than 1 percentage point for the specialized models but 4-6 percentage points for the base model. Prompt template choice produces accuracy differences of 7-24 percentage points, comparable to or larger than model-level effects. On one template, BioMistral outperforms Instruct although the overall mean favors Instruct by only 1.3 percentage points. For BioMistral and Instruct, INT8 quantization changes accuracy and F1 by only 1-2 percentage points relative to FP16, whereas the base model shows larger INT8 effects on some templates (up to +4.2 percentage points). INT4 produces heterogeneous but non-catastrophic effects. Temperature scaling reduces expected calibration error under summed scoring for both models but only for that scoring rule. A fine-tuned PubMedBERT reference achieves 82.7% accuracy but uses about 176000 labeled training examples, precluding direct comparison. These results demonstrate that prompt template design and scoring normalization are first-order experimental decisions when evaluating decoder language model calibration.
- Abstract(参考訳): デコーダ言語モデルを分類器として使用する場合、予測されたクラス確率は、プロンプトテンプレート、動詞変換(ラベル・ツー・トケンマッピング)、スコアリングルールなどの実装選択に依存するが、これは実験変数として扱われることは滅多にない。
FP16,INT8,INT4の4つの応答文プロンプトテンプレートを用いて,PubMed RCT文分類(n=2000)に基づく3種類のMistral-7B変種(Base, BioMistral, Instruct)の制御評価を行った。
我々の主要な発見は、確率抽出プロトコルが明らかに校正を支配していることである。
バイオミストラル平均のキャリブレーション誤差は0.097から0.289に増加し、Instructは0.237から0.096に減少する一方、特別なモデルでは1ポイント未満の精度で変化するが、ベースモデルでは4-6ポイントである。
プロンプトテンプレートの選択は、モデルレベルの効果に匹敵する7~24ポイントの精度差を生み出す。
あるテンプレートでは、BioMistralはインストラクトよりもパフォーマンスが良いが、全体的な平均はインストラクトをわずか1.3ポイントしか好まない。
BioMistralとInstructでは、INT8量子化は精度とF1をFP16と比較して1-2パーセントしか変化しないが、ベースモデルはいくつかのテンプレート(+4.2ポイントまで)に対してINT8の効果が大きい。
INT4は不均一だが非破滅的な効果を生じる。
温度スケーリングは、両方のモデルの合計スコアリングで期待されるキャリブレーション誤差を低減しますが、そのスコアリングルールに限られます。
微調整されたPubMedBERT参照は82.7%の精度を達成するが、直接比較を除いた176000のラベル付きトレーニング例を使用する。
これらの結果は,デコーダ言語モデルのキャリブレーションを評価する際に,テンプレート設計と正規化の迅速化が一階実験決定であることを示す。
関連論文リスト
- ConfidenceBench: Evaluating Confidence Calibration in Large Language Models [14.831793255747181]
ConfidenceBenchは、大規模言語モデルのキャリブレーションベンチマークである。
15のフロンティア大言語モデルにおいて、言語化された信頼度の評価を行う。
信頼性はプロンプトを通じて引き起こされ、モデルロジットへのアクセスは不要である。
論文 参考訳(メタデータ) (2026-07-10T01:56:30Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - When Does LLM Self-Correction Help? A Control-Theoretic Markov Diagnostic and Verify-First Intervention [0.9525172018746524]
反復的自己補正はエージェントLLMシステムで広く用いられているが、反復的な改善が痛みと痛みを和らげるときにはまだ不明瞭である。
我々は,自己補正をサイバネティックフィードバックループとみなし,同じ言語モデルがコントローラとプラントの両方の役割を担っている。
有害な自己補正から有益に分離した近赤外域(=0.5%)の鋭いしきい値(=0.5%)が得られた。
論文 参考訳(メタデータ) (2026-04-24T06:34:40Z) - MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models [0.0]
MIRRORは、大規模言語モデルがより優れた意思決定に自己知識を使用できるかどうかを評価するベンチマークである。
約25万の評価インスタンスに対して,8つの実験室から16のモデルを評価した。
論文 参考訳(メタデータ) (2026-04-15T08:41:12Z) - The Verification Tax: Fundamental Limits of AI Auditing in the Rare-Error Regime [0.0]
最も引用されているキャリブレーションの結果は、CIFAR-100上での温度スケーリング後のECEの0.012は、統計的ノイズフロアより下である。
モデル誤差率のエプシロンによるキャリブレーション誤差を推定するミニマックスレートは Theta((Lepsilon/m)2/3) であり、推定器が打ち負かせない。
論文 参考訳(メタデータ) (2026-04-14T16:48:24Z) - Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures [87.75098311090642]
現在の選好学習法は、標準ベンチマークで高い精度を達成するが、客観的な品質信号を取り除いた場合、顕著な性能劣化を示す。
我々は、8つのクリエイティブな著作ジャンルにまたがる1,800の人手による好みペア(1,200の英語、600の中国語)のデータセットであるWriteingPreferenceBenchを紹介した。
論文 参考訳(メタデータ) (2025-10-16T12:23:13Z) - Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference [31.2331188304598]
評価バッチサイズ、GPUカウント、GPUバージョンなどのシステム構成の変更は、生成されたレスポンスに大きな違いをもたらす可能性がある。
この変数の根本原因は、限定的な数値精度で浮動小数点算術の非連想性に遡る。
そこで我々は16ビットの精度で重みを格納するが、FP32では全ての計算を実行する軽量な推論パイプラインLayerCastを開発した。
論文 参考訳(メタデータ) (2025-06-11T08:23:53Z) - CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction [11.731590131260424]
CorBenchXは胸部X線レポートにおける自動エラー検出と修正のためのスイートである。
まず,26,326個の胸部X線誤差の大規模データセットを合成した。
オープンソースとクローズドなビジョン言語モデルの両方をベンチマークします。
論文 参考訳(メタデータ) (2025-05-17T15:39:39Z) - Calibrating Language Models with Adaptive Temperature Scaling [58.056023173579625]
本稿では,各トークンの温度スケーリングパラメータを予測するポストホックキャリブレーション法であるAdaptive Temperature Scaling (ATS)を紹介する。
ATSは、以前のキャリブレーション法と比較して、3つの下流自然言語評価ベンチマークで10-50%以上のキャリブレーションを改善する。
論文 参考訳(メタデータ) (2024-09-29T22:54:31Z) - Program-Aided Reasoners (better) Know What They Know [59.29201607431494]
プログラム支援言語モデル(PAL)の校正と,5つのデータセットにまたがるテキストベースのChain-of-Thought(COT)技術の比較を行った。
以上の結果から, PALは75%の症例で校正の改善につながることが示唆された。
論文 参考訳(メタデータ) (2023-11-16T04:17:49Z) - DOMINO: Domain-aware Model Calibration in Medical Image Segmentation [51.346121016559024]
現代のディープニューラルネットワークはキャリブレーションが不十分で、信頼性と信頼性を損なう。
本稿では,クラスラベル間のセマンティック・コンフューザビリティと階層的類似性を利用したドメイン認識モデルキャリブレーション手法であるDOMINOを提案する。
その結果,DOMINOを校正したディープニューラルネットワークは,頭部画像分割における非校正モデルや最先端形態計測法よりも優れていた。
論文 参考訳(メタデータ) (2022-09-13T15:31:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。