論文の概要: Polarization Detection: A Hybrid Approach with AfroXLMR-Social and DeBERTa for Low- and High-Resource Settings
- arxiv url: http://arxiv.org/abs/2607.10312v1
- Date: Sat, 11 Jul 2026 13:37:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.392961
- Title: Polarization Detection: A Hybrid Approach with AfroXLMR-Social and DeBERTa for Low- and High-Resource Settings
- Title(参考訳): 偏光検出:AfroXLMR-Social と DeBERTa を併用した低資源・高資源化手法
- Authors: Muhammad Abdullahi Said,
- Abstract要約: 本稿では,英語とハウサ語における分極談話の検出と特徴に着目し,POLARタスク2026のシステム記述について述べる。
英語のバイナリ検出のためのハイブリッドモデリング手法を提案し,textbfDeBERTaの単言語的強度を利用する。
3つのサブタスクにまたがる競争結果を報告し、特定のサブタスク要求に合わせたモデル選択がパフォーマンスの最良のバランスをもたらすことを示した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid proliferation of online polarization threatens social cohesion, necessitating robust automated detection systems that operate effectively across diverse linguistic contexts. This paper presents our system description for the POLAR Shared Task 2026, focusing on the detection and characterization of polarized discourse in English and Hausa. We propose a hybrid modeling strategy: for English binary detection, we leverage the monolingual strength of \textbf{DeBERTa}, while for Hausa and all fine-grained subtasks (Types and Manifestations), we utilize \textbf{AfroXLMR-Social}. This domain-adapted multilingual model proved critical for capturing the nuances of polarization in social media text. To further address computational constraints and data scarcity, we implement Low-Rank Adaptation (LoRA) and textual data augmentation via \texttt{nlpaug}. We report competitive results across all three subtasks, demonstrating that model selection tailored to specific subtask requirements yields the best balance of performance.
- Abstract(参考訳): オンライン分極の急速な普及は社会的結束を脅かし、多様な言語文脈で効果的に機能する堅牢な自動検出システムを必要とする。
本稿では,英語とハウサ語における分極談話の検出と特徴に着目し,POLAR共有タスク2026のシステム記述について述べる。
英語のバイナリ検出では,textbf{DeBERTa} の単言語的強度を利用する一方,Hausa およびすべてのきめ細かいサブタスク (Types and Manifestations) では,textbf{AfroXLMR-Social} を利用する。
このドメイン適応型多言語モデルは、ソーシャルメディアテキストにおける偏極のニュアンスを捉えるのに重要であることが証明された。
計算制約とデータの不足にさらに対処するため,低ランク適応 (LoRA) とテキストデータ拡張を \texttt{nlpaug} で実装する。
3つのサブタスクにまたがる競争結果を報告し、特定のサブタスク要求に合わせたモデル選択がパフォーマンスの最良のバランスをもたらすことを示した。
関連論文リスト
- YEZE at SemEval-2026 Task 9: Detecting Multilingual, Multicultural and Multievent Online Polarization via Heterogeneous Ensembling [3.3438708071539445]
XLM-RoBERTa-largeとmDeBERTa-v3-baseを組み合わせた多言語事前学習モデルの異種アンサンブルを提案する。
本研究では,多タスク学習,翻訳に基づくデータ拡張,クラス重み付けなどの手法を用いて,重度ラベルの不均衡下での分類性能の向上を図る。
論文 参考訳(メタデータ) (2026-05-07T13:21:40Z) - mdok-style at SemEval-2026 Task 9: Finetuning LLMs for Multilingual Polarization Detection [5.3677118215189585]
SemEval-2026 Task 9は多言語偏光検出に重点を置いている。
それは3つの軸に沿った多言語、多文化、多領域の分極、すなわち検出、型、および表現の識別をカバーしている。
我々は,このSemEvalタスクに対して,QLoRAパラメータ効率の高い微調整手法を用いて,配列分類タスクのための中規模のLLMを微調整した。
トレーニングデータは、匿名化、下ケース化、上ケース化、ホモグリフィドによるマルチリンガル(22言語)トレーニングセットを拡張し、検出をより堅牢にする。
論文 参考訳(メタデータ) (2026-05-04T15:08:24Z) - All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG [87.74635133954975]
現在のマルチ言語検索・拡張生成システム(mRAG)は,再ランク付け時に言語バイアスに悩まされていることを示す。
textittextbfLanguage-textbfAgnostic textbfUtility-driven textbfReranker textbfAlignment (LAURA)を提案する。
論文 参考訳(メタデータ) (2026-04-22T05:33:06Z) - BITS Pilani at SemEval-2026 Task 9: Structured Supervised Fine-Tuning with DPO Refinement for Polarization Detection [2.2588605422113606]
ソーシャルメディアのテキストに政治的偏極を検出するための2段階のアプローチを提案する。
解釈可能なスロットフィリングテンプレートを用いてQwen 2.5-7B-インストラクションをLoRAで微調整する。
SemEval 2026 POLAR共有タスクデータセットの実験では、嗜好ベースの改善は両方の精度を改善し、付加的なアノテーションなしで偽陰性を減少させる。
論文 参考訳(メタデータ) (2026-04-13T07:35:17Z) - A fully automated and scalable Parallel Data Augmentation for Low Resource Languages using Image and Text Analytics [2.943391000885789]
本稿では,新聞記事からバイリンガル並列コーパスを抽出する,スケーラブルで完全に自動化された手法を提案する。
2つの異なる言語の組み合わせに対して並列データコーパスを構築することでアプローチを検証するとともに,機械翻訳の下流タスクを通じて,このデータセットの価値を実証する。
論文 参考訳(メタデータ) (2025-10-15T06:57:23Z) - DPP-Based Adversarial Prompt Searching for Lanugage Models [56.73828162194457]
Auto-Regressive Selective Replacement Ascent (ASRA)は、決定点プロセス(DPP)と品質と類似性の両方に基づいてプロンプトを選択する離散最適化アルゴリズムである。
6種類の事前学習言語モデルに対する実験結果から,ASRAによる有害成分の抽出の有効性が示された。
論文 参考訳(メタデータ) (2024-03-01T05:28:06Z) - Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue [71.15186328127409]
パラリンGPT(Paralin GPT)
モデルは、シリアライズされたマルチタスクフレームワーク内の入力プロンプトとして、テキスト、音声埋め込み、およびパラ言語属性の会話コンテキストを取る。
音声対話データセットとして,感情ラベルをパラ言語属性として含むSwitchboard-1コーパスを利用する。
論文 参考訳(メタデータ) (2023-12-23T18:14:56Z) - Mitigating Data Imbalance and Representation Degeneration in
Multilingual Machine Translation [103.90963418039473]
Bi-ACLは、MNMTモデルの性能を向上させるために、ターゲット側モノリンガルデータとバイリンガル辞書のみを使用するフレームワークである。
Bi-ACLは、長い尾の言語でも、高リソースの言語でも、より効果的であることを示す。
論文 参考訳(メタデータ) (2023-05-22T07:31:08Z) - Joint Contextual Modeling for ASR Correction and Language Understanding [60.230013453699975]
言語理解(LU)と協調してASR出力の文脈的言語補正を行うマルチタスクニューラルアプローチを提案する。
そこで本研究では,市販のASRおよびLUシステムの誤差率を,少量のドメイン内データを用いてトレーニングしたジョイントモデルと比較して14%削減できることを示した。
論文 参考訳(メタデータ) (2020-01-28T22:09:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。