論文の概要: Evaluating Health Misinformation in Low-Resource Languages: Integrating Small Language Models with a Culturally-Sensitive Responsible NLP Framework (Bangla as a Case Study)
- arxiv url: http://arxiv.org/abs/2607.12336v1
- Date: Tue, 14 Jul 2026 04:34:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.035199
- Title: Evaluating Health Misinformation in Low-Resource Languages: Integrating Small Language Models with a Culturally-Sensitive Responsible NLP Framework (Bangla as a Case Study)
- Title(参考訳): 低リソース言語における健康的誤情報の評価:文化に敏感なNLPフレームワークによる小言語モデルの統合(バンガラを事例として)
- Authors: Farnaz Farid, Raihan Alam, Al Al-Areqi, Farhad Ahamed, Muhammad Hassan Khan, Sadia Hossain, Irena Veljanova, Anika Tabassum Binte Hossain,
- Abstract要約: 本稿では,CALDに親しみやすいAIを用いた健康情報検出装置を提案し,医療従事者がこの誤情報を分析するためのダッシュボードを提供する。
各種小言語モデル(SLM)の性能評価のために,バングラ翻訳による健康情報誤報データセットを用いて実験を行った。
次に、責任自然言語処理(NLP)に基づく新しい健康情報検出フレームワークの設計とテストを行う。
このフレームワークは、文化的な感受性、害の可能性、通信品質を取り入れ、低リソース言語における誤情報を評価するための総合的なレンズを提供する。
- 参考スコア(独自算出の注目度): 0.9214837952221063
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Artificial Intelligence (AI) technologies, while serving as a foundational enabler for modern social media and digital health services, exert a bivalent effect by simultaneously acting as a combatant against and a spread vector for misinformation. A prevalent challenge in mitigating this issue arises in non-English contexts and low socioeconomic classes, where limited data hinders the training of AI models for effective detection. Consequently, culturally and linguistically diverse (CALD) communities struggle to access trustworthy health information through AI-driven tools. Current AI tools underperform due to a lack of training data and are largely unable to consider language nuances and traditions in non-English contexts. This research addresses these gaps by proposing a CALD-friendly AI-based health misinformation detector and providing a dashboard for medical professionals to analyse this misinformation, a critical step toward mitigating a growing concern among CALD populations. To this end, we conduct a series of experiments using a Bangla-translated health misinformation dataset to evaluate the performance of various Small Language Models (SLMs). SLMs are particularly relevant in this context given the frequent underperformance of Large Language Models (LLMs), which often stems from insufficient domain-specific knowledge and the prohibitive costs of resource-intensive fine-tuning. The results demonstrate that Phi-4 is the superior model, achieving an ideal balance between precision and recall in claim extraction. Then, to mitigate the limitations of SLMs, we design and test a novel health misinformation detection framework grounded in Responsible Natural Language Processing (NLP), which incorporates cultural sensitivity, potential for harm, and communication quality, thereby providing a holistic lens for evaluating misinformation in low-resource languages.
- Abstract(参考訳): 人工知能(AI)技術は、現代のソーシャルメディアやデジタルヘルスサービスの基盤として機能する一方で、戦闘員と誤情報の拡散ベクトルを兼ねて二分効果を発揮する。
この問題を緩和する上で一般的な課題は、非英語の文脈や低社会経済のクラスで発生し、限られたデータが効果的な検出のためにAIモデルのトレーニングを妨げる。
その結果、文化的・言語学的に多様(CALD)なコミュニティは、AI駆動のツールを通じて信頼できる健康情報にアクセスするのに苦労している。
現在のAIツールは、トレーニングデータがないためにパフォーマンスが悪く、非英語の文脈で言語ニュアンスや伝統を考えることはほとんどできない。
この研究は、CALDに親しみやすいAIベースの健康情報検出装置を提案し、医療専門家がこの偽情報を分析するためのダッシュボードを提供する。
そこで本研究では,バングラ変換された健康情報データを用いて,各種小言語モデル(SLM)の性能評価を行う。
大規模言語モデル(LLM)は、ドメイン固有の知識の不足とリソース集約的な微調整の禁止コストから生じることが多い。
その結果,Phi-4が優れたモデルであることが示され,クレーム抽出における精度とリコールの理想的なバランスが得られた。
そこで我々は,SLMの限界を緩和するために,文化的感受性,有害性,コミュニケーション品質を取り入れた,責任自然言語処理(NLP)に基づく新たな健康誤情報検出フレームワークを設計,テストし,低リソース言語における誤情報評価のための総合レンズを提供する。
関連論文リスト
- A Patient-Doctor-NLP-System to contest inequality for less privileged [0.688204255655161]
この研究は、視覚障害者やヒンディー語のような低リソース言語話者が利用できる限られたサポートに対処する。
本稿では, モデル蒸留, 周波数領域変調, アンサンブル学習, ランダム化アクティベーションパターンを統合した小型トランスフォーマーアーキテクチャであるPDFTEMRAを提案する。
その結果, PDFTEMRA は計算性能が著しく低く, 高い性能を示した。
論文 参考訳(メタデータ) (2025-12-07T08:59:15Z) - Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models [56.61984030508691]
言語混乱に関する最初の機械論的解釈可能性研究について述べる。
混乱点(CP)がこの現象の中心であることを示す。
比較分析によって同定された少数の臨界ニューロンを多言語で調整したニューロンで編集すると、混乱が著しく軽減されることがわかった。
論文 参考訳(メタデータ) (2025-05-22T11:29:17Z) - Towards Scalable and Cross-Lingual Specialist Language Models for Oncology [4.824906329042275]
汎用大規模モデル(LLM)は、臨床用語、文脈に依存した解釈、マルチモーダルデータ統合といった課題に対処する。
本研究では,教師調律,検索強化生成(RAG),グラフベースの知識統合を組み合わせた,オンコロジー特化,効率的,適応可能なNLPフレームワークを開発する。
論文 参考訳(メタデータ) (2025-03-11T11:34:57Z) - LlaMADRS: Prompting Large Language Models for Interview-Based Depression Assessment [75.44934940580112]
LlaMADRSは、オープンソースのLarge Language Models(LLM)を利用して、うつ病の重症度評価を自動化する新しいフレームワークである。
本研究は,クリニカルインタヴューの解釈・スコアリングにおけるモデル指導のために,慎重に設計された手がかりを用いたゼロショットプロンプト戦略を用いている。
実世界における236件のインタビューを対象とし,臨床評価と強い相関性を示した。
論文 参考訳(メタデータ) (2025-01-07T08:49:04Z) - Monolingual and Multilingual Misinformation Detection for Low-Resource Languages: A Comprehensive Survey [2.5459710368096586]
誤報は言語境界を超越し、モデレーションシステムに挑戦する。
誤情報検出に対するほとんどのアプローチはモノリンガルであり、高リソース言語に焦点を当てている。
この調査は、低リソース言語における誤情報検出に関する現在の研究の概要を概観する。
論文 参考訳(メタデータ) (2024-10-24T03:02:03Z) - Speaking the Same Language: Leveraging LLMs in Standardizing Clinical Data for AI [0.0]
本研究は、医療データの標準化など、特定の課題に対処するため、大規模言語モデルの採用を念頭においている。
この結果から,大規模言語モデルを用いることで手作業によるデータキュレーションの必要性が著しく低下することが示唆された。
提案手法は、医療におけるAIの統合を迅速化し、患者のケアの質を向上させるとともに、AIのためのデータ作成に必要な時間と資金を最小化する。
論文 参考訳(メタデータ) (2024-08-16T20:51:21Z) - Trustworthy and Practical AI for Healthcare: A Guided Deferral System with Large Language Models [1.2281181385434294]
大規模言語モデル(LLM)は、医療における様々なアプリケーションに有用な技術を提供する。
彼らの幻覚化傾向と既存のプロプライエタリなシステムへの依存は、批判的な意思決定に関する環境に課題をもたらす。
本稿では,障害分類のための医療報告を同時に解析し,ヒトへの知的な指導による不確実な予測を推論する新しいHAICガイド型deferralシステムを提案する。
論文 参考訳(メタデータ) (2024-06-11T12:41:54Z) - Improving Classifier Training Efficiency for Automatic Cyberbullying
Detection with Feature Density [58.64907136562178]
言語支援の異なる特徴前処理手法を用いて特徴密度(FD)の有効性を検討した。
データセットの複雑さを推定することで、必要な実験の数を削減できると仮定する。
データセットの言語的複雑さの違いにより、言語的に支援された単語前処理の有効性を議論することが可能になる。
論文 参考訳(メタデータ) (2021-11-02T15:48:28Z) - InfoBERT: Improving Robustness of Language Models from An Information
Theoretic Perspective [84.78604733927887]
BERTのような大規模言語モデルは、幅広いNLPタスクで最先端のパフォーマンスを実現している。
近年の研究では、このようなBERTベースのモデルが、テキストの敵対的攻撃の脅威に直面していることが示されている。
本稿では,事前学習した言語モデルの堅牢な微調整のための新しい学習フレームワークであるInfoBERTを提案する。
論文 参考訳(メタデータ) (2020-10-05T20:49:26Z) - Data Augmentation for Spoken Language Understanding via Pretrained
Language Models [113.56329266325902]
音声言語理解(SLU)モデルの訓練は、しばしばデータ不足の問題に直面している。
我々は,事前学習言語モデルを用いたデータ拡張手法を提案し,生成した発話の変動性と精度を向上した。
論文 参考訳(メタデータ) (2020-04-29T04:07:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。