Fugu-MT 論文翻訳(概要): Bambara Language Dataset for Sentiment Analysis

論文の概要: Bambara Language Dataset for Sentiment Analysis

arxiv url: http://arxiv.org/abs/2108.02524v1
Date: Thu, 5 Aug 2021 11:07:18 GMT
ステータス: 翻訳完了
システム内更新日: 2021-08-06 18:58:02.989321
Title: Bambara Language Dataset for Sentiment Analysis
Title（参考訳）: 感性分析のためのBambara言語データセット
Authors: Mountaga Diallo and Chayma Fourati and Hatem Haddad
Abstract要約: アフリカでは、様々な言語や方言が存在するが、それらはいまだに不足しており、分析研究や研究目的のために完全に活用されていない。本稿では,感性分析専用のバンバラ方言データセットについて紹介する。
参考スコア（独自算出の注目度）: 0.0
License: http://creativecommons.org/licenses/by/4.0/
Abstract: For easier communication, posting, or commenting on each others posts, people use their dialects. In Africa, various languages and dialects exist. However, they are still underrepresented and not fully exploited for analytical studies and research purposes. In order to perform approaches like Machine Learning and Deep Learning, datasets are required. One of the African languages is Bambara, used by citizens in different countries. However, no previous work on datasets for this language was performed for Sentiment Analysis. In this paper, we present the first common-crawl-based Bambara dialectal dataset dedicated for Sentiment Analysis, available freely for Natural Language Processing research purposes.
Abstract（参考訳）: コミュニケーションや投稿、コメントをしやすくするために、人々は自分の方言を使う。アフリカでは様々な言語や方言が存在する。しかし、それらはまだ不十分であり、分析研究や研究目的には十分に活用されていない。機械学習やディープラーニングのようなアプローチを実行するには、データセットが必要である。アフリカの言語の1つがバンバラ語であり、各国の市民が使用している。しかし、この言語のデータセットに関する以前の研究はSentiment Analysisでは行われなかった。本稿では,自然言語処理研究目的で利用可能となる感性分析専用の共通crawlベースのバンバラ方言データセットについて紹介する。

関連論文リスト

One Language, Many Gaps: Evaluating Dialect Fairness and Robustness of Large Language Models in Reasoning Tasks [68.33068005789116]
本研究は,大言語モデル(LLM)の標準推論タスクにおける方言処理における妥当性と頑健さを客観的に評価することを目的とした最初の研究である。我々は、コンピュータサイエンスのバックグラウンドの専門家を含むAAVEスピーカーを雇い、HumanEvalやGSM8Kといった7つの人気のあるベンチマークを書き換えます。以上の結果から,これら広く使用されているモデルのほとんどは,AAVEにおけるクエリに対する不安定さと不公平さを顕著に示していることがわかった。
論文参考訳（メタデータ） (2024-10-14T18:44:23Z)
Voices Unheard: NLP Resources and Models for Yorùbá Regional Dialects [72.18753241750964]
Yorub'aは、約4700万人の話者を持つアフリカの言語である。アフリカ語のためのNLP技術開発への最近の取り組みは、彼らの標準方言に焦点を当てている。我々は、このギャップを埋めるために、新しい高品質のパラレルテキストと音声コーパスを導入する。
論文参考訳（メタデータ） (2024-06-27T22:38:04Z)
The First Swahili Language Scene Text Detection and Recognition Dataset [55.83178123785643]
低リソース言語、特にスワヒリ語には大きなギャップがある。スワヒリ語は東アフリカ諸国で広く話されているが、依然としてシーンテキスト認識において未発見言語である。本研究では,スワヒリシーンのテキスト画像の包括的データセットを提案し,異なるシーンのテキスト検出および認識モデルに基づくデータセットの評価を行う。
論文参考訳（メタデータ） (2024-05-19T03:55:02Z)
Natural Language Processing for Dialects of a Language: A Survey [56.93337350526933]
最先端自然言語処理(NLP)モデルは、大規模なトレーニングコーパスでトレーニングされ、評価データセットで最上位のパフォーマンスを報告します。この調査は、これらのデータセットの重要な属性である言語の方言を掘り下げる。方言データセットに対するNLPモデルの性能劣化と言語技術のエクイティへのその影響を動機として,我々はデータセットやアプローチの観点から,方言に対するNLPの過去の研究を調査した。
論文参考訳（メタデータ） (2024-01-11T03:04:38Z)
NusaWrites: Constructing High-Quality Corpora for Underrepresented and Extremely Low-Resource Languages [54.808217147579036]
インドネシアの地方言語について事例研究を行う。データセット構築におけるオンラインスクラップ,人文翻訳,および母語話者による段落作成の有効性を比較した。本研究は,母語話者による段落作成によって生成されたデータセットが,語彙的多様性と文化的内容の点で優れた品質を示すことを示す。
論文参考訳（メタデータ） (2023-09-19T14:42:33Z)
XRICL: Cross-lingual Retrieval-Augmented In-Context Learning for Cross-lingual Text-to-SQL Semantic Parsing [70.40401197026925]
大規模言語モデルを用いたインコンテキスト学習は、最近セマンティック解析タスクの驚くべき結果を示している。この研究は、あるクエリに対して関連する英語の例を検索する学習を行うXRICLフレームワークを導入している。また、大規模言語モデルの翻訳プロセスを容易にするために、対象言語に対するグローバルな翻訳例も含んでいる。
論文参考訳（メタデータ） (2022-10-25T01:33:49Z)
Urdu Speech and Text Based Sentiment Analyzer [1.4630964945453113]
本研究は,ユーザ評価に基づく新しいマルチクラスUrduデータセットを提案する。提案したデータセットには1万のレビューが含まれており、人間の専門家によって慎重に2つのカテゴリに分類されている。 Naivebayes、Stanza、Textblob、Vader、Frairを含む5種類のレキシコンおよびルールベースのアルゴリズムが採用され、実験の結果、Flairが70%の精度で他のテストアルゴリズムより優れていることが示された。
論文参考訳（メタデータ） (2022-07-19T10:11:22Z)
NaijaSenti: A Nigerian Twitter Sentiment Corpus for Multilingual Sentiment Analysis [5.048355865260207]
ナイジェリアでもっとも広く話されている4言語に対して、人手によるTwitter感情データセットを初めて導入する。データセットは1言語あたり約30,000の注釈付きツイートで構成されている。私たちは、データセット、訓練されたモデル、感情レキシコン、コードをリリースし、表現不足言語における感情分析の研究にインセンティブを与えます。
論文参考訳（メタデータ） (2022-01-20T16:28:06Z)
Multilingual transfer of acoustic word embeddings improves when training on languages related to the target zero-resource language [32.170748231414365]
たった一つの関連言語でトレーニングを行うことで、最大の利益が得られます。また、関係のない言語からのデータを追加することは、一般的にパフォーマンスを損なわないこともわかりました。
論文参考訳（メタデータ） (2021-06-24T08:37:05Z)
Blow the Dog Whistle: A Chinese Dataset for Cant Understanding with Common Sense and World Knowledge [49.288196234823005]
カントは、広告、喜劇、ドッグウィストル政治を理解するために重要である。カントの作成と理解のための大規模で多様な中国データセットを提案します。
論文参考訳（メタデータ） (2021-04-06T17:55:43Z)
The first large scale collection of diverse Hausa language datasets [0.0]
ハウサ語はサハラ以南のアフリカ諸言語の中でよく研究され文書化された言語と考えられている。 1億人以上がこの言語を話すと推定されている。言語の公式な形式と非公式な形式の両方からなる、拡張されたデータセットのコレクションを提供する。
論文参考訳（メタデータ） (2021-02-13T19:34:20Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。