論文の概要: Single-Pass Uncertainty Heads for Claim-Level Hallucination Detection in Persian Medical Language Models
- arxiv url: http://arxiv.org/abs/2610.03482v2
- Date: Mon, 05 Oct 2026 08:35:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.546041
- Title: Single-Pass Uncertainty Heads for Claim-Level Hallucination Detection in Persian Medical Language Models
- Title(参考訳): ペルシア語医療用言語モデルにおけるクレームレベル幻覚検出のための単一パス不確実性ヘッド
- Abstract要約: LLM Uncertainty HeadフレームワークをAya-Expanse-8Bベースのペルシアの医療モデルに適用する。
2組の幻覚データセットをペルシャ語で直接構築し、それぞれの背骨に対して1,600の応答を含む。
ホールドアウト試験分割では、各ランダムベースラインの2.30倍と2.66倍に対応する0.4820倍と0.4652倍のPR−AUCと、0.7852倍と0.7810倍のROC−AUCを得る。
- 参考スコア(独自算出の注目度): 2.4792948967354236
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Hallucination detection is particularly important for medical language models, but repeated-sampling approaches are expensive and existing uncertainty-head resources do not directly transfer to a new backbone and language. We adapt the LLM Uncertainty Head (LUH) framework to Aya-Expanse-8B-based Persian medical models, using Gaokerena-V and Gaokerena-R as two previously developed backbones. We first examine response variability on a 168-question Iranian medical entrance examination and observe substantially lower five-run consistency for Gaokerena-V than for Aya-Expanse-8B, whereas Gaokerena-R is comparable to Aya-Expanse-8B. We then construct two paired claim-level hallucination datasets directly in Persian, containing 1,600 responses for each backbone, and train lightweight claim-level heads on frozen backbone attention maps and token probabilities. On held-out test splits, the heads obtain PR-AUCs of 0.4820 and 0.4652, corresponding to 2.30 and 2.66 times their respective random baselines, and ROC-AUCs of 0.7852 and 0.7810. The heads require neither retrieval nor repeated sampling at inference time. These results provide an initial study of single-pass claim-level uncertainty estimation for Persian medical language models; the test splits are small and the labels are automatically generated.
- Abstract(参考訳): 幻覚検出は医療言語モデルにおいて特に重要であるが、繰り返しサンプリングするアプローチは高価であり、既存の不確実性のあるリソースは、新しいバックボーンや言語に直接転送しない。
我々は、以前開発された2つのバックボーンとして、ガオケレナ-Vとガオケレナ-Rを用いて、Aya-Expanse-8Bをベースとしたペルシアの医療モデルにLLM不確実性ヘッド(LUH)フレームワークを適用した。
イランの168項目の医療受験試験における応答のばらつきについて検討し,Aya-Expanse-8Bよりもガオケレナ-Vの5ラン一貫性が著しく低いのに対して,ガオケレナ-RはAya-Expanse-8Bに匹敵する。
次に,2組のクレームレベルの幻覚データセットをペルシャで直接構築し,各バックボーンに対する1600の応答と,凍結したバックボーンのアテンションマップとトークンの確率で軽量クレームレベルのヘッドを訓練する。
ホールドアウト試験分割では、各ランダムベースラインの2.30倍と2.66倍に対応する0.4820倍と0.4652倍のPR−AUCと、0.7852倍と0.7810倍のROC−AUCを得る。
ヘッドは、推論時に検索も繰り返しサンプリングも必要としない。
これらの結果は,ペルシア語医療言語モデルに対する単一パス要求レベル不確実性推定の初期研究であり,テストスプリットは小さく,ラベルは自動生成される。
関連論文リスト
- Gaokerena: A Small Persian Medical Language Model Family [2.339805471804333]
ガオケレナ(Gaokerena)は、一般向けハードウェアへの展開に最適化された、ペルシアのコンパクトな医療用言語モデルのファミリーである。
まず,9千万トンものペルシャ人医療コーパスのベースラインモデルをトレーニングして開発したGaokerena-Vについて紹介する。
我々は、Chain-of-Thoughtアプローチと2つの新しい強化学習とAIフィードバックフレームワークを統合することで、Gaokerena-Rを開発した。
論文 参考訳(メタデータ) (2026-08-02T02:17:10Z) - HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation [7.512887610816016]
HalluCXRは、856個の胸部X線写真から6つのアーキテクチャ的に多様な視覚言語モデルを評価するベンチマークである。
61.9--82.3%のアウトプットには幻覚が含まれており、臨床的に危険なエラーは最大80.2%である。
これらの結果から, 幻覚検査, 冗長性に基づくリスクモニタリング, アンサンブルに基づく安全層が臨床展開の前提条件であることが確認された。
論文 参考訳(メタデータ) (2026-05-19T20:30:32Z) - HalluScan: A Systematic Benchmark for Detecting and Mitigating Hallucinations in Instruction-Following LLMs [0.0]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにまたがる顕著な機能を示している。
しかし、それらは幻覚に影響を受けやすい - 事実的に不正確で、提供されたコンテキストに反するコンテンツを生成したり、ユーザ指示に反する。
本稿では,72構成の幻覚検出と緩和を体系的に評価する総合ベンチマークフレームワークであるHaluScanを紹介する。
論文 参考訳(メタデータ) (2026-05-04T10:43:27Z) - Neuro-Oracle: A Trajectory-Aware Agentic RAG Framework for Interpretable Epilepsy Surgical Prognosis [4.726777092009554]
トラジェクトリベースの分類器は、シングルポイントのResNet-50ベースラインで0.793に対して0.834から0.905のAUC値を達成する。
i) 3Dシームスコントラストエンコーダを用いたコンパクトな512次元トラジェクトリベクトルへの術前MRI変化の除去、(ii)近辺探索による人口アーカイブからの歴史的に類似した外科的トラジェクトリの検索、(iii)定量化を用いて検索された証拠に基づいた自然言語的予後を合成する3段階のフレームワークであるEmphNeuro-Oracleを提案する。
論文 参考訳(メタデータ) (2026-04-10T21:47:25Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models [82.30696225661615]
MedHalluは、医学的幻覚検出に特化して設計された最初のベンチマークである。
GPT-4o, Llama-3.1, および医学的に微調整されたUltraMedicalを含む最先端のLSMは、このバイナリ幻覚検出タスクに苦慮している。
双方向の包絡クラスタリングを用いて, 難解な幻覚は, 意味論的に真実に近いことを示す。
論文 参考訳(メタデータ) (2025-02-20T06:33:23Z) - Agent-Based Uncertainty Awareness Improves Automated Radiology Report Labeling with an Open-Source Large Language Model [1.7064514726335305]
クローン病患者のヘブライ語9,683例について検討した。
我々は不確実性を認識したプロンプトアンサンブルとエージェントに基づく決定モデルを導入した。
論文 参考訳(メタデータ) (2025-02-02T16:57:03Z) - "Knowing When You Don't Know": A Multilingual Relevance Assessment Dataset for Robust Retrieval-Augmented Generation [90.09260023184932]
Retrieval-Augmented Generation (RAG) は、外部の知識源を活用して、事実の幻覚を減らすことで、Large Language Model (LLM) を出力する。
NoMIRACLは18言語にまたがるRAGにおけるLDM堅牢性を評価するための人為的アノテーション付きデータセットである。
本研究は,<i>Halucination rate</i>,<i>Halucination rate</i>,<i>Halucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sorucination rate</i>,<i>Sr。
論文 参考訳(メタデータ) (2023-12-18T17:18:04Z) - Automatically measuring speech fluency in people with aphasia: first
achievements using read-speech data [55.84746218227712]
本研究の目的は,言語習得の分野で開発された信号処理algorithmの関連性を評価することである。
論文 参考訳(メタデータ) (2023-08-09T07:51:40Z) - Learning to diagnose cirrhosis from radiological and histological labels
with joint self and weakly-supervised pretraining strategies [62.840338941861134]
そこで本稿では, 放射線学者が注釈付けした大規模データセットからの転写学習を活用して, 小さい付加データセットで利用できる組織学的スコアを予測することを提案する。
我々は,肝硬変の予測を改善するために,異なる事前訓練法,すなわち弱い指導法と自己指導法を比較した。
この方法は、METAVIRスコアのベースライン分類を上回り、AUCが0.84、バランスの取れた精度が0.75に達する。
論文 参考訳(メタデータ) (2023-02-16T17:06:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。