論文の概要: Ideological Stance Detection in a Low-Resource Language: Polarization in Bangladeshi Public vs Private University Discourse on Social Media
- arxiv url: http://arxiv.org/abs/2610.04401v1
- Date: Sat, 03 Oct 2026 09:49:27 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:14:18.581956
- Title: Ideological Stance Detection in a Low-Resource Language: Polarization in Bangladeshi Public vs Private University Discourse on Social Media
- Title(参考訳): 低リソース言語におけるイデオロギースタンス検出:バングラデシュの公共と私立大学におけるソーシャルメディアに関する議論の分極
- Abstract要約: 公立と私立の大学は議論の余地があり、バングラデシュのソーシャルメディア上で偏光を発生させる。
本稿では,Ad-Public,Pro-Private,Neutralとラベル付けされた4,060のBengaliコメントを手動でアノテートしたデータセットを提案する。
機械学習(ML)、ディープラーニング(DL)、トランスフォーマーモデルは、ゼロショットのLlama 4 Maverickモデルよりも優れていた。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: Public vs. private universities is a debatable issue, and it creates polarization on social media in Bangladesh. Debate on quality, jobs, and prestige is passionate among the students, parents, and graduates, the majority of whom speak Bengali, a low-resource language. To measure this polarization, this paper introduces a manually annotated dataset of 4,060 Bengali comments labeled as Pro-Public, Pro-Private, or Neutral. We evaluated the quality of our annotations by Fleiss's Kappa agreement that was 0.89, corresponding to a high agreement among annotators. The classical ML (SVM, Random Forest, XGBoost), BiLSTM network, hybrid BanglaBERT+XGBoost models and the state-of-the-art zero-shot LLMs (Claude Sonnet 4, DeepSeek-V3.1, Llama 4 Maverick, Kimi K2 Thinking, Qwen3-235B Thinking) models are evaluated. The accuracy of BanglaBERT+XGBoost is 91.81% and macro F1 score is 91.70%, which is higher than all the supervised baselines. The zero-shot Llama 4 Maverick Thinking achieves a macro F1 of 0.931 (overall accuracy of 93.31%) without any fine-tuning. All machine learning (ML), deep machine learning (DL) and transformer models were outperformed by the zero-shot Llama 4 Maverick model. Polarization also is evident, in some ways more clearly in the Pro-Private comments, which emphasize modern facilities and timely graduation, versus the Pro-Public comments, which emphasize affordability and government jobs. Our findings open new directions for analyzing social media polarization in low-resource languages.
- Abstract(参考訳): 公立と私立の大学は議論の余地があり、バングラデシュのソーシャルメディア上で偏光を発生させる。
品質、職業、名声に関する議論は、学生、両親、卒業生の間で情熱的であり、その大多数は低リソース言語であるベンガル語を話す。
この偏光を測定するために,本稿では,Pro-Public,Pro-Private,Neutralとラベル付けされた4,060のBengaliコメントを手動でアノテートしたデータセットを提案する。
Fleiss's Kappa agreement that is 0.89, corresponding to a high agreement of annotators。
古典的ML(SVM、ランダムフォレスト、XGBoost)、BiLSTMネットワーク、ハイブリッドBanglaBERT+XGBoostモデル、最先端のゼロショットLCM(Claude Sonnet 4、DeepSeek-V3.1、Llama 4 Maverick、Kim K2 Thinking、Qwen3-235B Thinking)モデルを評価する。
BanglaBERT+XGBoostの精度は91.81%、マクロF1スコアは91.70%であり、教師付きベースラインよりも高い。
ゼロショットのLlama 4 Maverick Thinkingは微調整なしで0.931(全精度93.31%)のマクロF1を達成する。
機械学習(ML)、ディープラーニング(DL)、トランスフォーマーモデルは、ゼロショットのLlama 4 Maverickモデルよりも優れていた。
ポーラライゼーションは、近代的な施設とタイムリーな卒業を強調するPro-Privateのコメントと、価格と政府の仕事を強調するPro-Publicのコメントで明らかにされている。
その結果,低リソース言語におけるソーシャルメディアの分極分析の新たな方向性が明らかにされた。
関連論文リスト
- How Far Can Sub-3B Open Language Models Go in Zero-Shot Essay Scoring on an 8 GB Consumer GPU? [0.0]
モデルがFP16で完全にローカルで動作するサブ3Bオープンモデルでなければならない場合、どの程度の能力が存続するかを問う。
我々は,8つのASAP-AESプロンプトに対して,4つの命令調整モデル(Qwen2.5 at 0.5B/1.5B/3B,SmolLM2 at 1.7B)について検討した。
論文 参考訳(メタデータ) (2026-07-29T02:35:36Z) - Do We Still Need Humans in the Loop? Comparing Human and LLM Annotation in Active Learning for Hostility Detection [68.37351671559675]
アクティブな学習は、無視可能なコストで短いプロンプトから何千ものインスタンスに注釈を付けることができる。
LLMラベルはALループ内で人間のラベルを置き換えることができ、ALはコーパス全体を一度にラベル付けできるときに必要か?
277,902人のドイツの政治的TikTokコメントの新しいデータセットについて、両方の質問を調査した。
論文 参考訳(メタデータ) (2026-04-15T14:10:58Z) - Moderating Harm: Benchmarking Large Language Models for Cyberbullying Detection in YouTube Comments [0.0]
本研究は,OpenAI GPT-4.1, Google Gemini 1.5 Pro, Anthropic Claude 3 Opusの3つの主要な言語モデルを,5,080コメントのコーパスでベンチマークする。
YouTubeのデータセットは、英語、アラビア語、インドネシア語で1,334件の有害メッセージと3,746件の有害メッセージで構成されている。
論文 参考訳(メタデータ) (2025-05-25T01:28:30Z) - Motamot: A Dataset for Revealing the Supremacy of Large Language Models over Transformer Models in Bengali Political Sentiment Analysis [0.0]
政治的感情を分析することは、特に選挙期間中の世論過程の複雑さを理解するために重要である。
本研究は, 肯定的, 否定的な感情を付加した7,058件からなる「モタモット」データセットの作成に焦点を当てた。
バングラバート,バングラバートベース,XLM-RoBERTa,mBERT,sahajBERT,およびジェミニ1.5 Pro,GPT3.5 TurboなどのPLMの性能評価を行った。
論文 参考訳(メタデータ) (2024-07-28T16:34:53Z) - White Men Lead, Black Women Help? Benchmarking and Mitigating Language Agency Social Biases in LLMs [58.27353205269664]
社会的バイアスは、Large Language Model(LLM)生成コンテンツにおいて言語エージェンシーに現れる。
LLMのバイアスを包括的に評価するLanguage Agency Bias Evaluationベンチマークを導入する。
LABEを用いて,近年の3つのLLM(ChatGPT,Llama3,Mistral)における言語エージェントの社会的バイアスを明らかにした。
論文 参考訳(メタデータ) (2024-04-16T12:27:54Z) - Locally Differentially Private Document Generation Using Zero Shot
Prompting [61.20953109732442]
本稿では,DP-Prompt と呼ばれる局所的に異なるプライベートなメカニズムを提案し,作者の匿名化攻撃に対処する。
DP-PromptをChatGPT(gpt-3.5)のような強力な言語モデルで使用すると、匿名化攻撃の成功率の顕著な低下が観察される。
論文 参考訳(メタデータ) (2023-10-24T18:25:13Z) - The False Promise of Imitating Proprietary LLMs [158.65692029352584]
より弱い言語モデルを安価に改善するための新しい方法は、より強力なモデルからの出力に対してそれを微調整することである。
このアプローチは、より弱いオープンソースモデルを使用して、プロプライエタリなモデルの機能を安価に模倣することを目指している。
まず、様々なベースモデルサイズを用いてChatGPTを模倣する一連のLMを微調整する。
次に、群衆レーダと標準NLPベンチマークを用いてモデルを評価する。
論文 参考訳(メタデータ) (2023-05-25T05:00:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。