論文の概要: Gaokerena: A Small Persian Medical Language Model Family
- arxiv url: http://arxiv.org/abs/2608.00932v1
- Date: Sun, 02 Aug 2026 02:17:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.028352
- Title: Gaokerena: A Small Persian Medical Language Model Family
- Title(参考訳): ガオケレナ(Gaokerena) - ペルシアの医療言語モデル家族。
- Abstract要約: ガオケレナ(Gaokerena)は、一般向けハードウェアへの展開に最適化された、ペルシアのコンパクトな医療用言語モデルのファミリーである。
まず,9千万トンものペルシャ人医療コーパスのベースラインモデルをトレーニングして開発したGaokerena-Vについて紹介する。
我々は、Chain-of-Thoughtアプローチと2つの新しい強化学習とAIフィードバックフレームワークを統合することで、Gaokerena-Rを開発した。
- 参考スコア(独自算出の注目度): 2.339805471804333
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The integration of artificial intelligence into medical question-answering systems has advanced rapidly; however, research remains predominantly focused on English, leaving low resource languages like Persian significantly underserved. To address this gap, this paper introduces Gaokerena, a novel family of compact Persian medical language models optimized for deployment on consumer grade hardware. As a foundational step toward localized digital healthcare, we first present Gaokerena-V, developed by training a baseline model on a newly curated 90-million-token Persian medical corpus and 20,000 expert-vetted physician Q&A pairs, which improved performance on a translated medical MMLU benchmark from 46.28% to 49.31%. Second, recognizing the critical demands of clinical reasoning, we developed Gaokerena-R by integrating a Chain-of-Thought approach with two novel Reinforcement Learning with AI Feedback (RLAIF) frameworks to optimize preference-based reasoning. Despite utilizing the same baseline architecture and a smaller dataset than Gaokerena-V, Gaokerena-R achieved a superior benchmark score of 52.98%. Furthermore, both models are equipped with custom-developed uncertainty heads that predict the model's confidence in its responses based solely on internal hidden states. While these results demonstrate significant progress in Persian medical language modeling and proactive safety estimation, current performance levels remain insufficient for direct clinical application, highlighting the necessity for further research into robust knowledge acquisition and rigorous safety verification prior to real world deployment.
- Abstract(参考訳): 人工知能の医学的質問応答システムへの統合は急速に進んでいるが、研究は主に英語に焦点が当てられており、ペルシア語のような低リソース言語は著しく守られていない。
このギャップに対処するために,コンシューマグレードハードウェアへの展開に最適化された,コンパクトなペルシア語医療言語モデル群であるGaokerenaを紹介した。
ローカライズされたデジタルヘルスケアに向けた基礎的なステップとして、我々はまず、新しくキュレーションされた90万のペルシアの医療コーパスと2万の専門医のQ&Aペアのベースラインモデルをトレーニングし、翻訳された医療MMLUベンチマークのパフォーマンスを46.28%から49.31%に改善したGaokerena-Vを提示する。
第2に,臨床推論の重要要件を認識し,好みに基づく推論を最適化する2つの新しいReinforcement Learning with AI Feedback(RLAIF)フレームワークに,Chain-of-Thoughtアプローチを統合することにより,Gaokerena-Rを開発した。
ガオケレナ-Vと同じベースラインアーキテクチャと小さなデータセットを使用しているにもかかわらず、ガオケレナ-Rは52.98%という優れたベンチマークスコアを得た。
さらに、両方のモデルには、内部の隠れ状態のみに基づいてモデルが応答に自信を持つことを予測する、カスタムに発達した不確実性ヘッドが備わっている。
これらの結果はペルシアの医療言語モデリングと積極的な安全性評価において著しい進歩を示しているが、現在のパフォーマンスレベルは直接臨床応用には不十分なままであり、実世界の展開に先立って、堅牢な知識獲得と厳密な安全性検証のさらなる研究の必要性を浮き彫りにしている。
関連論文リスト
- EviCare: Enhancing Diagnosis Prediction with Deep Model-Guided Evidence for In-Context Reasoning [62.61394722212386]
EviCareは、大規模言語モデルにディープモデルガイダンスを統合する、コンテキスト内推論フレームワークである。
LLMのみのベースラインと深層モデルのみのベースラインを2つの実世界のEHRベンチマークで連続的に上回っている。
論文 参考訳(メタデータ) (2026-04-12T04:35:14Z) - A DeepSeek-Powered AI System for Automated Chest Radiograph Interpretation in Clinical Practice [83.11942224668127]
Janus-Pro-CXR (1B) はDeepSeek Janus-Proモデルに基づく胸部X線解釈システムである。
本システムは, 自動レポート生成において, 最先端のX線レポート生成モデルより優れる。
論文 参考訳(メタデータ) (2025-12-23T13:26:13Z) - Grounding Large Language Models in Clinical Evidence: A Retrieval-Augmented Generation System for Querying UK NICE Clinical Guidelines [1.9615061725959186]
本稿では,Large Language Models (LLMs) を用いたNICE (National Institute for Health and Care Excellence) 臨床ガイドラインを検索するための検索型生成システムの開発と評価について述べる。
このシステムの検索アーキテクチャは,300のガイドラインから抽出した10,195個のテキストチャンクのデータベースに対して,ハイブリッドな埋め込み機構によって構成されている。
平均相反ランク(MRR)が0.814、第1チャンクで81%、検索チャンクで99.1%のリコールが7901クエリで評価されている。
論文 参考訳(メタデータ) (2025-10-03T12:57:13Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - MedQARo: A Large-Scale Benchmark for Medical Question Answering in Romanian [50.767415194856135]
ルーマニア初の大規模医療QAベンチマークであるMedQARoを紹介する。
がん患者に関連する102,646のQAペアからなる高品質で大規模なデータセットを構築した。
論文 参考訳(メタデータ) (2025-08-22T13:48:37Z) - PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark [3.2640411992544345]
大規模言語モデル(LLM)は、広範囲の自然言語処理(NLP)ベンチマークにおいて、顕著なパフォーマンスを実現している。
イランの14年間の医学試験から得られた,20,785名の専門資格を持つペルシア人医療質問の大規模データセットであるペルシャMedQAを紹介した。
我々は、ゼロショットとチェーンオブ思考の設定で、汎用、ペルシャ細調整、医療用LLMを含む40の最先端モデルをベンチマークする。
論文 参考訳(メタデータ) (2025-05-30T21:34:30Z) - Leveraging Online Data to Enhance Medical Knowledge in a Small Persian Language Model [2.339805471804333]
そこで本研究では,20万名の医師と医師のQ&Aペアと,90万名の医療雑誌のクロールコーパスの60%を新たに収集したデータセットについて紹介した。
パラメータ効率の良い微調整手法を用いて,ベースラインモデルの医学的知識を高めた。
ベンチマーク評価により, 微調整モデルにより, 医療質問応答の精度が向上することが示された。
論文 参考訳(メタデータ) (2025-05-21T20:30:47Z) - Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization [0.06554326244334867]
本稿では,日本の医療領域に最適化された72BパラメータモデルであるPreferred-MedLLM-Qwen-72Bを紹介する。
我々は、Qwen2.5-72Bベースモデルに2段階の微調整プロセスを適用し、高い精度と安定した推論を実現する。
論文 参考訳(メタデータ) (2025-04-25T05:15:31Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - UNITE: Uncertainty-based Health Risk Prediction Leveraging Multi-sourced
Data [81.00385374948125]
我々はUNcertaInTyベースのhEalth Risk Prediction(UNITE)モデルを提案する。
UNITEは、複数ソースの健康データを活用した正確な疾患リスク予測と不確実性推定を提供する。
非アルコール性脂肪肝疾患(NASH)とアルツハイマー病(AD)の実態予測タスクにおけるUNITEの評価を行った。
UNITEはAD検出のF1スコアで最大0.841点、NASH検出のPR-AUCで最大0.609点を達成し、最高のベースラインで最大19%の高パフォーマンスを達成している。
論文 参考訳(メタデータ) (2020-10-22T02:28:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。