論文の概要: Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu
- arxiv url: http://arxiv.org/abs/2608.18142v1
- Date: Thu, 06 Aug 2026 11:28:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-23 14:54:39.991935
- Title: Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu
- Title(参考訳): 低音源言語におけるヘイト音声検出のためのLLMの効率的な適応:ローマ語ウルドゥー語の比較検討
- Authors: Toneema Zubair, Muhammad Junaid Asif, Faisal Kamiran, Hafiz Hassan Saeed, Rana Fayyaz Ahmad,
- Abstract要約: 低資源言語(LRL)におけるヘイトスピーチの検出は、注釈付きデータがないこと、言語構造が非公式であること、標準化された文法がないことなどから困難である。
本研究の目的は,ローマ・ウルドゥー文字におけるHate Speech Detection (HSD) のためのLarge Language Models (LLMs) の包括的な評価を行うことである。
PURUTT(Parallel UrduとRoman Urdu Corpus for Toxic Comments and Transliteration)データセットで72,000以上の注釈付きコメントで実験が行われた。
- 参考スコア(独自算出の注目度): 0.3436215734071903
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: It is challenging to detect hate speech in Low Resource Languages (LRLs) because of the absence of annotated data, the informality of its language structure, and the lack of standardized grammar. A good example of such a challenge is Roman Urdu which is broadly used by South Asians on social media and has a high variation while lacking contextually consistent spellings. The objective of this paper is to conduct a comprehensive assessment of Large Language Models (LLMs) for Hate Speech Detection (HSD) in Roman Urdu script and fine-tune these models using the Parameter-Efficient Fine-Tuning (PEFT) method called Low-Rank Adaptation (LoRA). To evaluate zero-shot inference, we benchmarked it against PEFT on different transformer models, including Mistral, LLaMA, Falcon, and multilingual BERT. Experiments are conducted on the PURUTT (Parallel Urdu and Roman Urdu Corpus for Toxic Comments and Transliteration) dataset with over 72,000 annotated comments. The results suggest that zero shot models perform moderately (F1 = 0.56), but updating a small fraction of the model trainable parameters improves the classification performance significantly (F1 > 0.93). Our results have shown that PEFT delivers outstanding performance alongside excellent computational efficiency, making it highly suitable for low-resource language processing tasks.
- Abstract(参考訳): 低資源言語(LRL)におけるヘイトスピーチの検出は、注釈付きデータがないこと、言語構造が非公式であること、標準化された文法がないことなどから困難である。
そのような課題のよい例は、南アジア人がソーシャルメディアで広く用い、文脈的に一貫した綴りを欠きながら高いバリエーションを持つロマン・ウルドゥである。
本研究の目的は,ローランク適応法 (LoRA) と呼ばれるパラメータ・エフェクト・ファイン・チューニング (PEFT) 法を用いて,ローマ・ウルドゥー文字のヘイトスピーチ検出 (HSD) のための大規模言語モデル (LLM) を包括的に評価することである。
ゼロショット推論を評価するため,ミストラル,LLaMA,ファルコン,多言語BERTなど,異なるトランスフォーマーモデルを用いてPEFTと比較した。
PURUTT(Parallel UrduとRoman Urdu Corpus for Toxic Comments and Transliteration)データセットで72,000以上の注釈付きコメントで実験が行われた。
その結果、ゼロショットモデルは適度に実行する(F1 = 0.56)が、モデルのトレーニング可能なパラメータのごく一部を更新することで、分類性能が大幅に向上する(F1 > 0.93)。
その結果,PEFTは計算効率に優れ,低リソース言語処理タスクに非常に適していることがわかった。
関連論文リスト
- Winning with Less for Low Resource Languages: Advantage of Cross-Lingual English_Persian Argument Mining Model over LLM Augmentation [0.12744523252873352]
本稿では,低リソース言語における議論マイニングのための言語間アプローチを活用することを目的とする。
我々は、高リソース言語として英語、低リソース言語としてペルシア語でモデルを検証した。
論文 参考訳(メタデータ) (2025-11-25T21:36:39Z) - Fine-Tuning Large Language Models with QLoRA for Offensive Language Detection in Roman Urdu-English Code-Mixed Text [5.908448629364552]
ローマ・ウルドゥー語文における攻撃的言語検出を改善するためのQLoRAに基づく微調整フレームワークを提案する。
ローマ・ウルドゥー語と英語の混成データセットをGoogle Translateを使って英語に翻訳し、英語のLLMを活用する。
私たちはMeta LLaMA 3 8B、Mistral 7B v0.1、LLaMA 2 7B、ModernBERT、RoBERTaなど、いくつかのトランスフォーマーと大規模言語モデルを微調整した。
論文 参考訳(メタデータ) (2025-10-04T05:38:46Z) - Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrieval [49.1574468325115]
トレーニング済みのAmharic BERTとRoBERTaのバックボーンをベースとした,Amharic固有の高密度検索モデルを提案する。
提案したRoBERTa-Base-Amharic-Embedモデル(110Mパラメータ)は,MRR@10の相対的な改善を17.6%達成する。
RoBERTa-Medium-Amharic-Embed (42M)のようなよりコンパクトな派生型は13倍以上小さいまま競争力を維持している。
論文 参考訳(メタデータ) (2025-05-25T23:06:20Z) - Code-Mixed Telugu-English Hate Speech Detection [0.0]
本研究では,TeleguHateBERT,HateBERT,DeBERTa,Muril,IndicBERT,Roberta,Hindi-Abusive-MuRILなどのトランスフォーマーモデルを用いて,Teluguにおけるヘイトスピーチの分類を行った。
低ランク適応(LoRA)を用いてこれらのモデルを微調整し、効率と性能を最適化する。
Google Translateを使ってTeluguのテキストを英語に翻訳し、分類精度への影響を評価する。
論文 参考訳(メタデータ) (2025-02-15T02:03:13Z) - Challenges in Adapting Multilingual LLMs to Low-Resource Languages using LoRA PEFT Tuning [0.4194295877935868]
本研究では,ローランド適応 (LoRA) -高効率ファインチューニング (PEFT) がマラウイの多言語Gemmaモデルに及ぼす影響について検討した。
52,000対の命令応答対を持つ翻訳データセットを用いて、評価結果が微調整後に低下する一方で、手動による評価では、微調整されたモデルが元のモデルよりも優れていることがしばしば示唆されている。
論文 参考訳(メタデータ) (2024-11-27T18:14:38Z) - Making Retrieval-Augmented Language Models Robust to Irrelevant Context [55.564789967211844]
ALMの重要なデシプラタムは、検索された情報が関連する場合のパフォーマンスをモデル化するのに役立つことである。
近年の研究では、検索の増大がパフォーマンスに悪影響を及ぼすことが示されている。
論文 参考訳(メタデータ) (2023-10-02T18:52:35Z) - Extrapolating Large Language Models to Non-English by Aligning Languages [109.09051737966178]
既存の大きな言語モデルは、異なる言語間で異なる能力を示す。
本稿では,言語間のセマンティックアライメントを構築することで,英語以外の言語に事前学習したLLMを強化する。
論文 参考訳(メタデータ) (2023-08-09T13:32:06Z) - Comparison of Interactive Knowledge Base Spelling Correction Models for
Low-Resource Languages [81.90356787324481]
低リソース言語に対する正規化の推進は、パターンの予測が難しいため、難しい作業である。
この研究は、ターゲット言語データに様々な量を持つニューラルモデルとキャラクタ言語モデルの比較を示す。
我々の利用シナリオは、ほぼゼロのトレーニング例によるインタラクティブな修正であり、より多くのデータが収集されるにつれてモデルを改善する。
論文 参考訳(メタデータ) (2020-10-20T17:31:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。