論文の概要: HealMed: Multilingual Evaluation of Large Language Models in Medicine
- arxiv url: http://arxiv.org/abs/2608.19981v1
- Date: Thu, 20 Aug 2026 12:52:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.566165
- Title: HealMed: Multilingual Evaluation of Large Language Models in Medicine
- Title(参考訳): HealMed:医学における大規模言語モデルの多言語評価
- Authors: Yingjian Chen, Fan Gao, Sherry T. Tong, Haoyu Zhang, Aosong Feng, Kevin W. Jin, Xing Wu, Jinghui Lu, Abdul Samad, Akbar Faruqi, Cesar Caraballo, Cibele Brandão, Dhruva, Gupta, Eunji Jeon, Gabriel Madera-Santiago, Geon Lee, Hugo Toshio Itikawa, Insook Cho, Isabelli Martins, Isarar Siddique, Israr Ahmed, Jihyo Kwak, Kanyakorn Veerakanjana, Luis Guilherme Cardoso, Minjin Kim, Piyalitt Ittichaiwong, Renee Dua, Santiago Gudiño-Rosales, Xiujie Chen, Zeo Lapalus, Zixin Xu, Michihiro Yasunaga, Rex Ying, Heuiseok Lim, Jaewoo Kang, Chanjun Park, Hang Jiang, Ethan Goh, Hyunjae Kim, Edison Marrese-Taylor, Yusuke Iwasawa, Yutaka Matsuo, Qingyu Chen, Irene Li,
- Abstract要約: 本稿では,医学における大規模言語モデルの多言語評価のための専門家レビューベンチマークであるHealMedを紹介する。
このベンチマークは、9か国と地域を拠点に23人の医師と医療専門家によって2年間にわたって開発された。
最強のプロプライエタリモデルは言語間で最も安定しており、多くのオープンソースおよび医療専門のモデルはより大きく、一貫性の低いギャップを示した。
- 参考スコア(独自算出の注目度): 82.79641241632788
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present HealMed, an expert-reviewed benchmark for multilingual evaluation of large language models in medicine. HealMed contains 1,000 examples in each of nine languages, drawn from nine datasets and covering three task formats: MCQA, NLI and open-ended QA. The benchmark was developed over two years by 23 physicians and medical experts based across nine countries and regions. Each translation was evaluated and revised by two experts fluent in English and the corresponding target language. On HealMed, performance declined most in low-resource languages, although the size of the gap varied markedly across languages and models. The strongest proprietary models were the most stable across languages, whereas many open-source and medically specialized models showed larger and less consistent gaps. Medical specialization alone did not ensure multilingual robustness. Furthermore, expert revision could either raise or lower measured performance, indicating that translation quality materially affects cross-language evaluation results.
- Abstract(参考訳): 本稿では,医学における大規模言語モデルの多言語評価のための専門家レビューベンチマークであるHealMedを紹介する。
HealMedには9つの言語それぞれで1,000のサンプルが含まれており、9つのデータセットから作成され、3つのタスク形式(MCQA、NLI、オープンエンドQA)をカバーする。
このベンチマークは、9か国と地域を拠点に23人の医師と医療専門家によって2年間にわたって開発された。
それぞれの翻訳は、英語と対応するターゲット言語に精通した2人の専門家によって評価され、改訂された。
HealMedでは、低リソース言語ではパフォーマンスが最も低下したが、ギャップの大きさは言語やモデルによって大きく異なっていた。
最強のプロプライエタリモデルは言語間で最も安定しており、多くのオープンソースおよび医療専門のモデルはより大きく、一貫性の低いギャップを示した。
医療専門化だけでは多言語性は保証されなかった。
さらに、専門家による改訂は、翻訳品質が言語間評価結果に実質的に影響を及ぼすことを示すため、測定結果の上昇または低下が可能である。
関連論文リスト
- Toward Global Large Language Models in Medicine [67.38063166560406]
GlobMedは、12言語にまたがる50,000以上のエントリを含む、大規模な多言語医療データセットである。
GlobMed-Benchは、複数の多言語医療タスクにわたる56の最先端のプロプライエタリでオープンなLLMを評価し、言語間での大幅なパフォーマンス格差を明らかにしている。
GlobMed-LLMはベースラインモデルと比較して平均40%以上のパフォーマンス向上を実現し、低リソース言語では3倍以上のパフォーマンス向上を実現した。
論文 参考訳(メタデータ) (2026-01-05T15:05:49Z) - PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark [3.2640411992544345]
大規模言語モデル(LLM)は、広範囲の自然言語処理(NLP)ベンチマークにおいて、顕著なパフォーマンスを実現している。
イランの14年間の医学試験から得られた,20,785名の専門資格を持つペルシア人医療質問の大規模データセットであるペルシャMedQAを紹介した。
我々は、ゼロショットとチェーンオブ思考の設定で、汎用、ペルシャ細調整、医療用LLMを含む40の最先端モデルをベンチマークする。
論文 参考訳(メタデータ) (2025-05-30T21:34:30Z) - MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation [12.644932351174786]
医療領域のための大規模STデータセットであるMultiMed-STをリリースし、5つの言語で全ての翻訳方向を網羅した。
290,000のサンプルを持つこのデータセットは、すべてのドメインの中で最大の医療用MTデータセットであり、多言語多言語STである。
実験的ベースライン、バイリンガル-マルチリンガル比較研究、エンドツーエンド対カスケード比較研究、タスク特化対マルチタスクシーケンス-シーケンス比較研究、コード・スウィッチ分析、量的品質比較など、この分野の歴史における最も包括的なST分析を、我々の最も優れた知識に提示する。
論文 参考訳(メタデータ) (2025-04-04T15:49:17Z) - Towards Building Multilingual Language Model for Medicine [54.1382395897071]
6つの主要言語を含む約25.5Bトークンを含む多言語医療コーパスを構築した。
MMedBench と呼ばれる有理性を持つ多言語医療用多言語質問応答ベンチマークを提案する。
我々の最終モデルであるMMed-Llama 3は、8Bパラメータしか持たないが、MMedBenchおよび英語ベンチマークの他のすべてのオープンソースモデルと比較して優れた性能が得られる。
論文 参考訳(メタデータ) (2024-02-21T17:47:20Z) - MedEval: A Multi-Level, Multi-Task, and Multi-Domain Medical Benchmark
for Language Model Evaluation [22.986061896641083]
MedEvalは、医療のための言語モデルの開発を促進するために、マルチレベル、マルチタスク、マルチドメインの医療ベンチマークである。
22,779の文と21,228のレポートを収集し、専門家のアノテーションを複数のレベルで提供し、データの詳細な使用可能性を提供します。
論文 参考訳(メタデータ) (2023-10-21T18:59:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。