論文の概要: Addressing Data Scarcity in Bangla Fake News Detection: An LLM-Based Dataset Augmentation Approach
- arxiv url: http://arxiv.org/abs/2605.01292v1
- Date: Sat, 02 May 2026 07:02:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:49.687471
- Title: Addressing Data Scarcity in Bangla Fake News Detection: An LLM-Based Dataset Augmentation Approach
- Title(参考訳): バングラフェイクニュース検出におけるデータスカーシティの対応:LLMに基づくデータ拡張アプローチ
- Authors: Ahmed Alfey Sani, Kazi Akib Zaoad, Shefayat E Shams Adib, Md Abdul Muqtadir, Ajwad Abrar,
- Abstract要約: 本研究では,Large Language Model (LLM) に基づく拡張が,制限に効果的に対応し,Bangla偽ニュース分類を改善することができるかどうかを検討する。
既存のデータセットは、価値はあるものの、非常に不均衡であり、モデルパフォーマンスを制限している。
本稿では, Gemma 3 27B ITモデルを用いて, 合成バングラニュース記事を生成するシステム拡張フレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The growing spread of misinformation in digital media highlights the need for reliable fake news detection systems, yet progress in under-resourced languages such as Bangla is limited by small and imbalanced datasets. This study investigates whether Large Language Model (LLM) based augmentation can effectively address this limitation and improve Bangla fake news classification. Existing datasets remain valuable but highly imbalanced, limiting model performance, and LLM based augmentation for Bangla has been scarcely explored. To fill this gap, we propose a systematic augmentation framework that generates synthetic Bangla news articles using the instruction tuned Gemma 3 27B IT model, supported by semantic filtering and controlled subsampling to preserve label consistency and diversity. We compare zero shot and few shot prompting, evaluate multiple augmentation rates, and examine random versus similarity-based selection strategies. Our experiments show that augmenting only the minority class with a high augmentation rate and random subsampling yields the strongest gains, raising the Fake News F1 score from 0.85 to 0.88. To support reproducibility and further research in this low-resource domain, we publicly release 4,545 synthetically generated Bangla fake news samples along with our full implementation. These findings demonstrate that well-designed LLM-driven augmentation can significantly improve fake news detection in low resource settings and provide a practical foundation for advancing multilingual misinformation research.
- Abstract(参考訳): デジタルメディアにおける誤情報の普及は、信頼できる偽ニュース検知システムの必要性を浮き彫りにしているが、Banglaのような未公開言語における進歩は、小さく不均衡なデータセットによって制限されている。
本研究では,Large Language Model(LLM)に基づく拡張が,この制限に効果的に対処し,Bangla偽ニュース分類を改善することができるかどうかを検討する。
既存のデータセットは、価値はあるものの、非常に不均衡であり、モデルパフォーマンスが制限され、LLMベースのBanglaの拡張は、ほとんど調査されていない。
このギャップを埋めるために、セマンティックフィルタリングと制御サブサンプリングによってサポートされた命令付きGemma 3 27B ITモデルを用いて、Banglaニュース記事を生成する体系的な拡張フレームワークを提案し、ラベルの一貫性と多様性を維持する。
ゼロショットと少ないショットプロンプトを比較し、複数の増大率を評価し、ランダムと類似度に基づく選択戦略を検討する。
以上の結果から,Fake News F1 スコアは 0.85 から 0.88 に上昇した。
この低リソース領域における再現性とさらなる研究を支援するため、我々は、全実装とともに、合成された4,545個のBangla偽ニュースサンプルを公開リリースした。
これらの結果から,LLMによる拡張により,低資源環境下での偽ニュースの検出が大幅に向上し,多言語誤報研究の実践的基盤となることが示唆された。
関連論文リスト
- Bangla BERT for Hyperpartisan News Detection: A Semi-Supervised and Explainable AI Approach [0.0]
超党派ニュースの分類精度を高めるための最先端トランスフォーマーベースモデル
95.65%の精度で、Bangla BERTは従来の手法より優れている。
論文 参考訳(メタデータ) (2025-07-28T18:02:01Z) - Breaking the Fake News Barrier: Deep Learning Approaches in Bangla Language [0.0]
本稿では,特にGRU(Gated Repetitive Unit)を用いて,バングラ方言における偽ニュースを識別する手法を提案する。
本研究の戦略は, トレンマ化, トークン化, オーバーサンプリングによる不規則な性質の傾向を含む, 集中的な情報前処理を取り入れたものである。
モデルの性能は、精度、リコール、F1スコア、精度などの信頼性の高い指標によって調査される。
論文 参考訳(メタデータ) (2025-01-30T21:41:26Z) - Detect, Investigate, Judge and Determine: A Knowledge-guided Framework for Few-shot Fake News Detection [53.41813030290324]
Few-Shot Fake News Detection (FS-FND) は、極めて低リソースのシナリオにおいて、非正確なニュースを実際のニュースと区別することを目的としている。
ソーシャルメディア上でのフェイクニュースの拡散や有害な影響により、このタスクは注目を集めている。
本稿では,内外からLLMを増強するDual-perspective Knowledge-Guided Fake News Detection (DKFND)モデルを提案する。
論文 参考訳(メタデータ) (2024-07-12T03:15:01Z) - Tackling Fake News in Bengali: Unraveling the Impact of Summarization vs. Augmentation on Pre-trained Language Models [0.07696728525672149]
ベンガル語で偽ニュースを分類するための4つの異なるアプローチからなる方法論を提案する。
弊社のアプローチは、英語ニュース記事の翻訳や、偽ニュース記事の欠陥を抑えるための強化技術の利用を含む。
ベンガル語偽ニュース検出における要約と拡張の有効性を示す。
論文 参考訳(メタデータ) (2023-07-13T14:50:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。