論文の概要: BanglaDial-Abuse: A Corpus-Grounded Dataset for Regional Dialect Identification in Abusive Bangla Text
- arxiv url: http://arxiv.org/abs/2610.01150v1
- Date: Thu, 01 Oct 2026 06:29:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.934267
- Title: BanglaDial-Abuse: A Corpus-Grounded Dataset for Regional Dialect Identification in Abusive Bangla Text
- Title(参考訳): Bangladial-Abuse: Acorpus-Grounded Dataset for Regional Dialect Identification in Abusive Bangla Text
- Abstract要約: 本稿では,ベンガル文字のバランスが取れたBanglaDial-Abuseについて紹介する。
このデータセットには、Standard Bangla、Chattagram、Sylhet、Barishalの4つの言語品種に等しく分布する1000の文が含まれており、1クラス250のサンプルがある。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Regional linguistic variation remains an important challenge for Bangla natural language processing, particularly in informal and non-standard text. This paper introduces BanglaDial-Abuse, a balanced Bengali-script dataset developed for regional dialect identification in abusive and hostile Bangla text. The dataset contains 1,000 sentences distributed equally across four linguistic varieties: Standard Bangla, Chattagram, Sylhet, and Barishal, with 250 samples per class. The resource was constructed using a corpus-grounded synthetic procedure incorporating regional variation in pronouns, possessive forms, verb morphology, negation, interrogative structures, postpositions, vocabulary, and Bengali-script spelling conventions while preserving the underlying hostile or abusive meaning. Descriptive analysis shows broadly comparable sentence-length distributions but partially distinct lexical spaces across the four classes. Pairwise Jaccard vocabulary similarity ranges from 0.37 to 0.56. The primary task is four-class regional dialect identification rather than binary abusive-text detection. The dataset is publicly available through Zenodo under a Creative Commons Attribution 4.0 license. The current version is intended as a research and prototyping corpus rather than a native-speaker-validated gold-standard linguistic resource. Keywords: Bangla, Bengali, dialect identification, regional dialect, abusive language, low-resource NLP, Chattagram, Sylhet, Barishal, dataset
- Abstract(参考訳): 地域言語の変化は、特に非公式テキストや非標準テキストにおいて、バングラの自然言語処理にとって重要な課題である。
本稿では,Bangla-Abuseについて紹介する。Bangla-Abuseは,Banglaテキストにおける地域方言識別のためのバランスの取れたBengali-scriptデータセットである。
このデータセットには、Standard Bangla、Chattagram、Sylhet、Barishalの4つの言語品種に等しく分布する1000の文が含まれており、1クラス250のサンプルがある。
この資料は、代名詞、所有形、動詞形態、否定、疑問構造、ポストポジション、語彙、ベンガル文字の綴り規則の局所的変化を取り入れたコーパスグラウンドの合成手順を用いて構築され、根底にある敵意や虐待の意味を保っている。
記述的分析は、文長の分布に広く匹敵するが、4つのクラスにまたがる部分的に異なる語彙空間を示す。
Pairwise Jaccard vocabulary similarityは0.37から0.56の範囲である。
主な課題は、二分的嫌悪テキスト検出ではなく、4階級の地域方言識別である。
データセットはZenodoを通じてCreative Commons Attribution 4.0ライセンスで公開されている。
現在のバージョンは、ネイティブスピーカーで検証された金標準言語資源ではなく、研究とプロトタイプコーパスとして意図されている。
キーワード:バングラ、ベンガル、方言識別、地域方言、乱用言語、低リソースNLP、チャタグラム、シルヘット、バリシャル、データセット
関連論文リスト
- 5-Dialects-BN: Unmasking the Impact of Transliteration on Bangla Dialectal LLMs [0.45740558095423056]
5-Dialects-BNはバングラ方言の最初のマルチアノテーションベンチマークである。
データセットは5つの主要な方言にまたがる 6,000の注釈付きエントリで構成されています
論文 参考訳(メタデータ) (2026-09-09T09:52:19Z) - BIDWESH: A Bangla Regional Based Hate Speech Detection Dataset [0.0]
本研究は,バングラヘイトスピーチデータセットであるBIDWESHを紹介する。
BD-SHSコーパスから9,183のインスタンスを3つの主要地域方言に翻訳し、注釈付けすることで構築された。
その結果得られたデータセットは、バングラでヘイトスピーチの検出を進めるための言語的にリッチでバランスの取れた、包括的なリソースを提供する。
論文 参考訳(メタデータ) (2025-07-22T02:53:48Z) - ANUBHUTI: A Comprehensive Corpus For Sentiment Analysis In Bangla Regional Languages [0.5062312533373298]
ANUBHUTIは、低資源バングラ方言における感情分析のためのリソースの重大なギャップを埋める。
このデータセットは、バングラデシュの現代社会の政治的景観を反映して、政治的および宗教的な内容が特徴的である。
データセットは、欠落したデータ、異常、不整合の体系的なチェックによってさらに改善された。
論文 参考訳(メタデータ) (2025-06-26T18:13:54Z) - Bridging Dialects: Translating Standard Bangla to Regional Variants Using Neural Models [1.472830326343432]
この研究は、言語多様性を保ち、方言話者間のコミュニケーションを改善する必要性によって動機付けられている。
モデルは"Vashantor"データセットを使用して微調整され、様々な方言で32,500の文が含まれている。
BanglaT5はCERが12.3%、WERが15.7%で優れた性能を示し、方言のニュアンスを捉える効果を強調した。
論文 参考訳(メタデータ) (2025-01-10T06:50:51Z) - BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization [7.059964549363294]
本研究は、方言のNoakhali音声を標準のBangla音声に変換するためのエンドツーエンドパイプラインを提案する。
約55の異なる方言が1億6000万人が話しており、バングラ方言に対処することは包括的コミュニケーションツールの開発に不可欠である。
実験の結果,Whisper ASRモデルが0.8%,WERが1.5%,BanglaT5モデルが41.6%,BLEUが41.6%であった。
論文 参考訳(メタデータ) (2024-11-16T20:20:15Z) - Voices Unheard: NLP Resources and Models for Yorùbá Regional Dialects [72.18753241750964]
Yorub'aは、約4700万人の話者を持つアフリカの言語である。
アフリカ語のためのNLP技術開発への最近の取り組みは、彼らの標準方言に焦点を当てている。
我々は、このギャップを埋めるために、新しい高品質のパラレルテキストと音声コーパスを導入する。
論文 参考訳(メタデータ) (2024-06-27T22:38:04Z) - NusaWrites: Constructing High-Quality Corpora for Underrepresented and
Extremely Low-Resource Languages [54.808217147579036]
インドネシアの地方言語について事例研究を行う。
データセット構築におけるオンラインスクラップ,人文翻訳,および母語話者による段落作成の有効性を比較した。
本研究は,母語話者による段落作成によって生成されたデータセットが,語彙的多様性と文化的内容の点で優れた品質を示すことを示す。
論文 参考訳(メタデータ) (2023-09-19T14:42:33Z) - Multi-VALUE: A Framework for Cross-Dialectal English NLP [49.55176102659081]
マルチディレクト (Multi-Dilect) は、50の英語方言にまたがる制御可能なルールベースの翻訳システムである。
ストレステストは、非標準方言の先行モデルに対する顕著な性能格差を示す。
私たちはチカノやインド英語のネイティブスピーカーと提携して、人気のあるCoQAタスクの新しいゴールドスタンダード版をリリースしています。
論文 参考訳(メタデータ) (2022-12-15T18:17:01Z) - Phoneme Recognition through Fine Tuning of Phonetic Representations: a
Case Study on Luhya Language Varieties [77.2347265289855]
音韻アノテーションに基づく多言語認識手法であるAllosaurus を用いた音素認識に焦点を当てた。
挑戦的な実世界シナリオで評価するために,我々は,ケニア西部とウガンダ東部のluhya言語クラスタの2つの種類であるbukusuとsaamiaの音声認識データセットをキュレートした。
私たちは、アロサウルスの微調整がわずか100発話であっても、電話のエラー率を大幅に改善することが分かりました。
論文 参考訳(メタデータ) (2021-04-04T15:07:55Z) - Factorization of Fact-Checks for Low Resource Indian Languages [44.94080515860928]
FactDRILは、インドの地域言語のための最初の大規模多言語ファクトチェックデータセットです。
本データセットは英語9,058サンプル,ヒンディー語5,155サンプルからなり,残りの8,222サンプルは様々な地域言語に分布する。
このデータセットは貴重なリソースであり、低リソース言語での偽ニュースの拡散と戦う出発点となると期待しています。
論文 参考訳(メタデータ) (2021-02-23T16:47:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。