論文の概要: Multi-Method Validation of Large Language Model Medical Translation Across High- and Low-Resource Languages
- arxiv url: http://arxiv.org/abs/2603.22642v1
- Date: Mon, 23 Mar 2026 23:34:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.220198
- Title: Multi-Method Validation of Large Language Model Medical Translation Across High- and Low-Resource Languages
- Title(参考訳): 高次・低次言語における大規模言語モデル医学翻訳の多方法検証
- Authors: Chukwuebuka Anyaegbuna, Eduardo Juan Perez Guerrero, Jerry Liu, Timothy Keyes, April Liang, Natasha Steele, Stephen Ma, Jonathan Chen, Kevin Schulman,
- Abstract要約: 言語障壁は、英語を好まない米国住民2730万人に影響を及ぼす。
22の医療文書を8言語に翻訳した4つのフロンティア大言語モデルを評価した。
- 参考スコア(独自算出の注目度): 2.1295825321376465
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language barriers affect 27.3 million U.S. residents with non-English language preference, yet professional medical translation remains costly and often unavailable. We evaluated four frontier large language models (GPT-5.1, Claude Opus 4.5, Gemini 3 Pro, Kimi K2) translating 22 medical documents into 8 languages spanning high-resource (Spanish, Chinese, Russian, Vietnamese), medium-resource (Korean, Arabic), and low-resource (Tagalog, Haitian Creole) categories using a five-layer validation framework. Across 704 translation pairs, all models achieved high semantic preservation (LaBSE greater than 0.92), with no significant difference between high- and low-resource languages (p = 0.066). Cross-model back-translation confirmed results were not driven by same-model circularity (delta = -0.0009). Inter-model concordance across four independently trained models was high (LaBSE: 0.946), and lexical borrowing analysis showed no correlation between English term retention and fidelity scores in low-resource languages (rho = +0.018, p = 0.82). These converging results suggest frontier LLMs preserve medical meaning across resource levels, with implications for language access in healthcare.
- Abstract(参考訳): 言語障壁は、英語を好まない米国住民2730万人に影響を与えるが、専門的な医学翻訳は費用がかかり、しばしば利用できない。
4つのフロンティア大言語モデル (GPT-5.1, Claude Opus 4.5, Gemini 3 Pro, Kimi K2) を評価し,22の医療文書を高リソース(スペイン語,中国語,ロシア語,ベトナム語),中リソース(韓国語,アラビア語),低リソース(タガログ語,ハイチクレオール語)の8言語に翻訳した。
704の翻訳ペアを通して、全てのモデルは高いセマンティック保存(LaBSEは0.92以上)を達成し、高リソース言語と低リソース言語の間に有意差はない(p = 0.066)。
クロスモデル逆翻訳の結果は,同じモデル円度(デルタ=0.0009)で駆動されなかった。
4つの独立したモデル間でのモデル間の一致は高く(LaBSE: 0.946)、語彙借入分析では低リソース言語(rho = +0.018, p = 0.82)における英語用語の保持率と忠実度スコアの相関は認められなかった。
これらの収束結果は、フロンティアLSMは、医療における言語アクセスに影響を及ぼすとともに、リソースレベル全体にわたって医療的意味を保っていることを示唆している。
関連論文リスト
- Left Behind: Cross-Lingual Transfer as a Bridge for Low-Resource Languages in Large Language Models [0.0]
我々は、英語、カザフ語、モンゴル語で、精度、流布度、完全性に関する大規模な言語モデルをベンチマークする。
英語と低リソースの言語条件の間には,13.8~16.7ポイントという一貫したパフォーマンスギャップがある。
論文 参考訳(メタデータ) (2026-03-22T03:27:47Z) - CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning [38.90826150840053]
我々はCUREMED-BENCHを紹介した。CUREMED-BENCHは、高品質な多言語医療推論データセットであり、単一の検証可能な答えを持つオープンエンド推論クエリである。
本稿では,コードスイッチング・アウェア・教師付き微調整を統合したカリキュラムインフォームド強化学習フレームワークCURE-MEDを提案する。
13言語にまたがって、我々のアプローチは一貫して強いベースラインを上回り、効果的にスケールする。
論文 参考訳(メタデータ) (2026-01-19T17:51:00Z) - Toward Global Large Language Models in Medicine [67.38063166560406]
GlobMedは、12言語にまたがる50,000以上のエントリを含む、大規模な多言語医療データセットである。
GlobMed-Benchは、複数の多言語医療タスクにわたる56の最先端のプロプライエタリでオープンなLLMを評価し、言語間での大幅なパフォーマンス格差を明らかにしている。
GlobMed-LLMはベースラインモデルと比較して平均40%以上のパフォーマンス向上を実現し、低リソース言語では3倍以上のパフォーマンス向上を実現した。
論文 参考訳(メタデータ) (2026-01-05T15:05:49Z) - Translate, then Detect: Leveraging Machine Translation for Cross-Lingual Toxicity Classification [35.35733615199578]
翻訳ベースと言語特化/多言語分類パイプラインを比較した。
対象言語のリソースレベルと機械翻訳システムの品質に強く相関している。
論文 参考訳(メタデータ) (2025-09-17T23:58:07Z) - MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages [33.450081592217074]
MuBenchは61の言語をカバーし、幅広い機能を評価するベンチマークです。
我々は、最先端の多言語LLMを評価し、請求項と実際の言語カバレッジとの間に顕著なギャップを見いだした。
論文 参考訳(メタデータ) (2025-06-24T09:53:00Z) - PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark [3.2640411992544345]
大規模言語モデル(LLM)は、広範囲の自然言語処理(NLP)ベンチマークにおいて、顕著なパフォーマンスを実現している。
イランの14年間の医学試験から得られた,20,785名の専門資格を持つペルシア人医療質問の大規模データセットであるペルシャMedQAを紹介した。
我々は、ゼロショットとチェーンオブ思考の設定で、汎用、ペルシャ細調整、医療用LLMを含む40の最先端モデルをベンチマークする。
論文 参考訳(メタデータ) (2025-05-30T21:34:30Z) - Towards Building Multilingual Language Model for Medicine [54.1382395897071]
6つの主要言語を含む約25.5Bトークンを含む多言語医療コーパスを構築した。
MMedBench と呼ばれる有理性を持つ多言語医療用多言語質問応答ベンチマークを提案する。
我々の最終モデルであるMMed-Llama 3は、8Bパラメータしか持たないが、MMedBenchおよび英語ベンチマークの他のすべてのオープンソースモデルと比較して優れた性能が得られる。
論文 参考訳(メタデータ) (2024-02-21T17:47:20Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - AmericasNLI: Evaluating Zero-shot Natural Language Understanding of
Pretrained Multilingual Models in Truly Low-resource Languages [75.08199398141744]
我々は、XNLI(Conneau et al)の拡張である AmericasNLI を提示する。
は、アメリカ大陸の10の原住民の言語である。
XLM-Rで実験を行い、複数のゼロショットおよび翻訳ベースのアプローチをテストします。
XLM-Rのゼロショット性能は全10言語で低調であり、平均性能は38.62%である。
論文 参考訳(メタデータ) (2021-04-18T05:32:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。