論文の概要: Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization
- arxiv url: http://arxiv.org/abs/2607.03704v1
- Date: Sat, 04 Jul 2026 04:49:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.68615
- Title: Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization
- Title(参考訳): 薬理工学における因果性評価のための大規模言語モデルの最適化:ベイズハイパーパラメータ最適化のための性能指標の開発
- Abstract要約: 我々はGP互換の最適化目標を開発し、温度最適化が因果分類合意を改善するかどうかを検討する。
症例特異的な温度選択は有意義な改善をもたらし、LLM補助薬局の温度最適化を支援した。
- 参考スコア(独自算出の注目度): 0.48861336570452174
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background: Growing individual case safety report (ICSR) volumes have intensified demand for scalable automated causality assessment. Large Language Models (LLMs) show promise, yet performance on clinically demanding tasks remains suboptimal and inference-time hyperparameter optimization has not been investigated. Objective: To develop a Gaussian Process (GP)-compatible optimization objective and investigate whether temperature optimization improves LLM-expert agreement on Naranjo causality assessment of FAERS ICSRs. Methods: Expert causality assessments were performed on 723 stratified FAERS cases. OpenAI's GPT-5.2 was evaluated using chain-of-thought (CoT) prompting. Four composite metrics were developed: Weighted Cosine Similarity (WCS), Information-Weighted Agreement Score (IWAS), Entropy-Weighted Agreement and Cosine Similarity Score (EWACS), and Consensus-Weighted Cosine Similarity (CWCS) and Bayesian optimization using a GP surrogate with Probability of Improvement (PoI) acquisition was applied across temperature [0, 2]. Results: GPT-5.2 outperformed prior biomedical LLMs at baseline (T = 0), achieving 74.1% agreement on question 5 and 65.4% on question 10 of Naranjo algorithm. Entropy analysis identified these as the sole informative optimization targets. Temperature showed no systematic population-level effect (\b{eta} = 0.002, p = 0.959). EWACS-guided Bayesian optimization improved causality classification agreement from 45.0% to 72.0% (+27 pp), with the largest gain in Doubtful cases (+42.9 pp). Conclusion: EWACS was identified as the optimal GP-compatible metric. The absence of a universal temperature optimum indicates LLM performance is driven primarily by ICSR content, yet case-specific temperature selection produced meaningful improvements, supporting temperature optimization for LLM-assisted pharmacovigilance.
- Abstract(参考訳): 背景: 個別ケースセーフティレポート(ICSR)ボリュームの増大は、スケーラブルな自動因果性評価への需要を強めている。
大規模言語モデル (LLMs) は将来性を示すが, 臨床に要求されるタスクの性能は依然として最適以下であり, 推論時ハイパーパラメータ最適化は検討されていない。
目的: ガウス過程(GP)互換の最適化目標を開発し, 温度最適化がFAERS ICSRのNaranjo因果性評価に関するLLM-Expert Agreementを改善するかどうかを検討する。
方法: FAERS723例について専門的因果性評価を行った。
OpenAIのGPT-5.2はチェーン・オブ・ソート(CoT)プロンプトを用いて評価された。
重み付きコサイン類似度 (WCS) , 情報重み付き合意スコア (IWAS) , エントロピー重み付き合意・コサイン類似度スコア (EWACS) , コンセンサス重み付きコサイン類似度 (CWCS) , GPサロゲートを用いたベイズ最適化 (PoI) の4つの複合指標を温度 [0, 2] にわたって適用した。
結果: GPT-5.2 はベースライン (T = 0) で, 74.1% で質問 5 で, 65.4% で回答した。
エントロピー分析は、これらを唯一の情報的最適化ターゲットとして特定した。
温度は、体系的な集団レベルの効果は示さなかった(\b{eta} = 0.002, p = 0.959)。
EWACSが指導するベイズ最適化は因果分類契約を45.0%から72.0%(+27 pp)に改善した。
結論: EWACS は最適GP互換計量として同定された。
ユニバーサル温度最適化の欠如は、LCMの性能が主にICSR量によって駆動されることを示しているが、ケース固有の温度選択は、LCMアシスト薬局の温度最適化をサポートする有意義な改善をもたらした。
関連論文リスト
- A Physics-Informed Framework for PID Tuning of Chemical Processes Using Large Language Model Agents [0.0]
この作業は、大小言語モデル(LLMs/SLMs)に適用可能な言語モデル支援PIDチューニングフレームワークを形式化する。
ローカルデプロイメントでは、Qwen3-0.6B はシミュレーション検証された IMC ターゲットを持つ教師付き微調整 (SFT) と、非補償安定性と性能の報奨を伴う物理インフォームドグループ相対ポリシー最適化 (PI-GRPO) によって適応される。
論文 参考訳(メタデータ) (2026-07-29T08:14:31Z) - Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0 [53.71882250666667]
エージェント最適化法で報告されているほとんどの利得はワンショットである。
これは、デプロイされたエージェントにとって重要な設定をテストするものではない。
エージェントハーネス最適化に対する3つのアプローチを比較する。
論文 参考訳(メタデータ) (2026-07-15T16:36:04Z) - MAGE: Understanding Stability-Performance Trade-offs in Multi-component Prompt Optimization [3.7323766833175718]
MAGE(Memory-Augmented Goal Prompt Evolution)は、コンポーネント間の相互作用を即時最適化する制御分析フレームワークである。
我々の実験は、複数の最適化信号が閉じた反射ループ内で動作しているときに、以前に報告されていない現象である、Prompt Optimization Coupling Effect (POCE)を発見した。
論文 参考訳(メタデータ) (2026-07-11T10:05:58Z) - SAFE ma-QAOA: Surrogate-Assisted and Fine-Tuning Enhanced Multi-Angle QAOA with Parameter Distillation [4.822952500424597]
多角量子近似最適化アルゴリズム(ma-QAOA)は量子近似最適化アルゴリズム(QAOA)を拡張する
勾配最適化のためのSurrogate-Assisted and Fine-tuning Enhanced (SAFE) フレームワークを提案する。
シェリントン・カークモデル, 2次元2乗格子スピンガラス, Max-Cutのインスタンス上でSAFEを評価する。
論文 参考訳(メタデータ) (2026-05-22T08:43:07Z) - Adaptive Rigor in AI System Evaluation using Temperature-Controlled Verdict Aggregation via Generalized Power Mean [51.56484100374058]
本稿では,5段階判定システムと一般化されたパワー平均アグリゲーションと直感的な温度パラメータT[0.1, 1.0]を組み合わせて評価リガーを制御する手法を提案する。
低温は安全クリティカルな領域に適した悲観的なスコアをもたらし、高温は会話AIに適した寛大なスコアを生み出します。
論文 参考訳(メタデータ) (2026-04-04T09:04:38Z) - Adaptive Conditional Forest Sampling for Spectral Risk Optimisation under Decision-Dependent Uncertainty [1.14219428942199]
期待されるコストと条件付き価値の凸組み合わせとして定義されたスペクトルリスク目標の最小化は困難である。
本研究では,4相シミュレーション最適化フレームワークである適応条件森林サンプリング(ACFS)を提案する。
ACFSは、一般的なランダムフォレストを統合して、意思決定条件の分布近似、CEMによるグローバルな探索、ランク重みの集中強化、サロゲートとオーラルの2段階の再評価を行う。
論文 参考訳(メタデータ) (2026-03-12T22:53:24Z) - Empirical Evaluation of QAOA with Zero Noise Extrapolation on NISQ Hardware for Carbon Credit Portfolio Optimization in the Brazilian Cerrado [0.0]
炭素クレジットポートフォリオの最適化は 気候変動の 重要な課題です
本研究では,多目的領域計画問題への量子近似最適化(QAOA)とゼロノイズ補間(ZNE)を併用した実用的応用について検討する。
我々は、中間スケールのIBM Quantumハードウェア上で実行される、炭素隔離、生物多様性接続、社会影響メトリクスを含む88変数のポートフォリオ最適化をモデル化する。
論文 参考訳(メタデータ) (2026-02-06T18:17:28Z) - Hierarchical Evaluation Function: A Multi-Metric Approach for Optimizing Demand Forecasting Models [0.479839492673697]
ハイパーパラメータ最適化のためのマルチメトリックフレームワークとして階層評価関数(HEF)を提案する。
HEFは説明力(R2)、過度エラーに対する感度(RMSE)、平均精度(MAE)を統合している。
HEFの性能は予測領域で広く認識されている4つのベンチマークデータセットを用いて評価した。
論文 参考訳(メタデータ) (2025-08-18T16:25:49Z) - ELSPR: Evaluator LLM Training Data Self-Purification on Non-Transitive Preferences via Tournament Graph Reconstruction [25.85736569130897]
大規模言語モデル(LLM)のペアワイズ評価は、オープンエンドタスクのベンチマークにおいて支配的なパラダイムとなっている。
この重要な問題は、本質的に曖昧な選好ペアを含む低品質データに起因していることを示す。
トーナメントグラフとしてペアの選好をモデル化する,原則付きグラフ理論フレームワークであるESSPRを提案する。
論文 参考訳(メタデータ) (2025-05-23T10:00:03Z) - Dynamic Noise Preference Optimization for LLM Self-Improvement via Synthetic Data [51.62162460809116]
我々は、イテレーション間で一貫した改善を保証するために、動的ノイズ優先最適化(DNPO)を導入します。
Zephyr-7Bでの実験では、DNPOは既存の手法を一貫して上回り、平均性能は2.6%向上した。
DNPOは、GPT-4評価のベースラインに比べて29.4%のウィンロス率差で、モデル生成データの品質が大幅に向上したことを示している。
論文 参考訳(メタデータ) (2025-02-08T01:20:09Z) - On the Convergence of DP-SGD with Adaptive Clipping [56.24689348875711]
勾配クリッピングによるグラディエントDescentは、微分プライベート最適化を実現するための強力な技術である。
本稿では,量子クリッピング(QC-SGD)を用いたSGDの総合収束解析について述べる。
本稿では,QC-SGDが一定閾値クリッピングSGDに類似したバイアス問題にどのように悩まされているかを示す。
論文 参考訳(メタデータ) (2024-12-27T20:29:47Z) - EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation [58.546205554954454]
臨界観測(EACO)によるMLLMのアライメント向上を提案する。
EACOは、経済的に5k画像のみを使用して、MLLMを自己生成の選好データで整列する。
EACOは幻覚全体の65.6%をHalusionBenchで減らし、MME-Cognitionで21.8%改善する。
論文 参考訳(メタデータ) (2024-12-06T09:59:47Z) - Stochastic Optimization of Areas Under Precision-Recall Curves with
Provable Convergence [66.83161885378192]
ROC(AUROC)と精度リコール曲線(AUPRC)の下の領域は、不均衡問題に対する分類性能を評価するための一般的な指標である。
本稿では,深層学習のためのAUPRCの最適化手法を提案する。
論文 参考訳(メタデータ) (2021-04-18T06:22:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。