論文の概要: SPAR-Hate: An Auditor-Guided Multi-Agent Framework for Bilingual Hate Speech Parsing
- arxiv url: http://arxiv.org/abs/2608.22018v1
- Date: Sat, 22 Aug 2026 15:40:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.557241
- Title: SPAR-Hate: An Auditor-Guided Multi-Agent Framework for Bilingual Hate Speech Parsing
- Title(参考訳): SPAR-Hate:バイリンガルヘイト音声解析のためのオーディタガイド型マルチエージェントフレームワーク
- Abstract要約: SPAR-Hateは、バイリンガルヘイトスピーチ解析のための監査者誘導型マルチエージェントフレームワークである。
文書を節レベルの決定単位に分解し、3つの視点から証拠に基づく判断を生成する。
STATE-ToxiCNとTBOベンチマークの実験は、SPAR-Hateが多種多様な大規模言語モデルのバイリンガルヘイト解析を一貫して改善していることを示している。
- 参考スコア(独自算出の注目度): 12.62180137889734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hate speech detection has recently shifted from coarse-grained classification to structured parsing, where systems must jointly identify hateful targets, arguments, and target-level labels. However, existing studies primarily emphasize benchmark evaluation while paying less attention to the cultural, linguistic, and social-group challenges involved in structured hate speech parsing. To address these challenges, we propose SPAR-Hate, an auditor-guided multi-agent framework for bilingual hate speech parsing. The framework first decomposes documents into clause-level decision units and then generates evidence-grounded judgments from three complementary perspectives: Victim, Moderator, and Cultural Bystander. An evidence-constrained arbitration process resolves conflicts among role-specific predictions and aggregates them into structured sample-level outputs. Experiments on the STATE-ToxiCN and TBO benchmarks show that SPAR-Hate consistently improves bilingual hate parsing across diverse large language models. The framework achieves state-of-the-art results on bilingual multi-tuple extraction tasks, with the largest gains observed under stricter structural evaluation metrics.
- Abstract(参考訳): ヘイトスピーチ検出は、最近、粗粒度分類から構造化解析に移行し、システムはヘイトフルなターゲット、引数、ターゲットレベルのラベルを共同で識別する必要がある。
しかし、既存の研究は主に、構造化ヘイトスピーチ解析に関わる文化的、言語的、社会的グループの課題に注意を払っている一方で、ベンチマーク評価に重点を置いている。
これらの課題に対処するため,バイリンガルヘイト音声解析のための監査者誘導型マルチエージェントフレームワークであるSPAR-Hateを提案する。
このフレームワークはまず文書を節レベルの決定単位に分解し、次に3つの相補的な視点から証拠に基づく判断を生成する。
エビデンスに制約された仲裁プロセスは、ロール固有の予測間の紛争を解決し、それらを構造化されたサンプルレベルの出力に集約する。
STATE-ToxiCNとTBOベンチマークの実験は、SPAR-Hateが多種多様な大規模言語モデルのバイリンガルヘイト解析を一貫して改善していることを示している。
このフレームワークは、より厳密な構造評価指標の下で観測される最大のゲインを持つ、バイリンガルなマルチタプル抽出タスクの最先端結果を達成する。
関連論文リスト
- Better Decomposition, Free Aggregation: A Synthesizer-Folding Framework for Multilingual Multi-Hop Question Answering [48.94279718429342]
マルチリンガルなマルチホップ質問応答のためのフレームワークであるSyferを紹介する。
Syferは、デフォルトで適用するのではなく、翻訳をデフェクトする。
複数の言語で実験した結果、Syferは競争の正確さを達成できた。
論文 参考訳(メタデータ) (2026-08-13T12:25:59Z) - Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization [14.571581599991331]
教師なしシラビックトークン化は、生音声から潜在言語コンテンツ関連構造をキャプチャする離散シラビックトークンを学習することを目的としている。
近年のシラバストークン化手法では,教師が学習したHuBERTを蒸留して,潜在音声フレーム表現をシラバスセグメントに整理する手法が提案されている。
そこで本研究では, 教師対象を一定長のチャンク内に配置し, 教師対象に適応する話者分散型シラビック・トークンーザを提案する。
論文 参考訳(メタデータ) (2026-07-05T00:39:57Z) - CATCH-ME if you RAG: a dataset of Contextually Annotated multi-Turn Counterspeech against Hate and Misinformation Exchanges [9.965670989893267]
本稿では,憎悪と誤情報との交わりに対処する対話の大規模,専門家による多言語データセットについて紹介する。
5つの言語をカバーし、7つの辺境化グループに向けられた憎悪を狙うこの新たなリソースは、より説得力があり、事実に根ざした反音声モデルのトレーニングと評価を可能にする。
論文 参考訳(メタデータ) (2026-06-18T15:32:14Z) - Job Skill Extraction via LLM-Centric Multi-Module Framework [51.37063712967151]
本稿では,意味検索,文脈内学習,教師付き微調整を組み合わせたLLM中心のフレームワークであるSRICLを提案する。
SRICLは、6つの公的なスパンラベル付きジョブアド文のコーパスにおいて、GPT-3.5よりも相当なSTRICT-F1の改善を達成し、ベースラインを加速し、無効なタグと幻覚したスパンを激減する。
論文 参考訳(メタデータ) (2026-04-23T10:46:07Z) - All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG [87.74635133954975]
現在のマルチ言語検索・拡張生成システム(mRAG)は,再ランク付け時に言語バイアスに悩まされていることを示す。
textittextbfLanguage-textbfAgnostic textbfUtility-driven textbfReranker textbfAlignment (LAURA)を提案する。
論文 参考訳(メタデータ) (2026-04-22T05:33:06Z) - Coupling Local Context and Global Semantic Prototypes via a Hierarchical Architecture for Rhetorical Roles Labeling [5.444158140267451]
修辞的役割ラベルリング(RRL)は、文書内の各文の機能的役割を特定する。
ローカルコンテキストとグローバル表現を統合する2つのプロトタイプベースの手法を提案する。
法、医学、科学的ベンチマークの実験は、強い基準線よりも一貫した改善を示している。
論文 参考訳(メタデータ) (2026-03-04T09:05:24Z) - Lost in Speech: Benchmarking, Evaluation, and Parsing of Spoken Code-Switching Beyond Standard UD Assumptions [23.2725831877861]
Spoken Code-switching (CSW) は、テキストで見えない方法で構文解析に挑戦する。
分散、反復、楕円、談話駆動構造は、通常、標準の普遍依存(UD)前提に反する。
論文 参考訳(メタデータ) (2026-02-06T02:02:07Z) - What Really Counts? Examining Step and Token Level Attribution in Multilingual CoT Reasoning [0.03499870393443267]
本研究では,多言語LLMにおけるChain-of-Thought(CoT)推論の帰属パターンについて検討した。
ステップレベルの属性に対するContextCiteとトークンレベルの属性に対するInseqの2つの補完属性手法をQwen2.5 1.5B-Instructモデルに適用する。
実験結果から,(1)帰属スコアは最終推論ステップ,特に不正確な世代において過度に強調され,(2)構造化CoTは高解像度ラテン文字言語の精度を著しく向上させ,(3)否定文や散逸文による制御摂動はモデル精度と帰属コヒーレンスを低下させる,といった重要な結果が得られた。
論文 参考訳(メタデータ) (2025-11-19T21:23:58Z) - Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection [39.748035737067745]
本稿では,言語に基づく物体検出のための文内階層関係に基づく言語表現の再構成を提案する。
重要な洞察は、テキストトークンを中核となる構成要素、属性、関係("talk in pieces")に切り離し、その後階層的に構造化された文レベルの表現に集約する必要性である。
OmniLabelベンチマークによる実験結果は24%のパフォーマンス向上を示し、言語構成の重要性を示している。
論文 参考訳(メタデータ) (2025-09-29T02:14:26Z) - Fine-Grained Chinese Hate Speech Understanding: Span-Level Resources, Coded Term Lexicon, and Enhanced Detection Frameworks [13.187315629074428]
Span-level Target-Aware Toxicity extract dataset (STATE ToxiCN)を導入する。
我々は、中国語のコード化されたヘイト用語、LLMのヘイトセマンティクスを解釈する能力について、初めて包括的な研究を行った。
本稿では,注釈付き辞書をモデルに統合し,ヘイトスピーチ検出性能を大幅に向上させる手法を提案する。
論文 参考訳(メタデータ) (2025-07-15T13:19:18Z) - Dual-Class Prompt Generation: Enhancing Indonesian Gender-Based Hate Speech Detection through Data Augmentation [0.0]
インドネシアのソーシャルメディアにおけるジェンダーベースのヘイトスピーチの検出は、ラベル付きデータセットが限られているため、依然として困難である。
我々は,逆翻訳,単一クラスプロンプト生成,および提案する2クラスプロンプト生成を評価した。
両クラスからサンプルを組み込むことで,言語モデルがより多様だが代表的なサンプルを生成することが示唆された。
論文 参考訳(メタデータ) (2025-03-06T10:07:51Z) - BanTH: A Multi-label Hate Speech Detection Dataset for Transliterated Bangla [0.0]
我々は,37.3kサンプルからなるバングラヘイト音声データセットであるBanTHを紹介する。
サンプルはYouTubeコメントからソースされ、各インスタンスに1つ以上のターゲットグループをラベル付けする。
実験により、さらに事前訓練されたエンコーダが、BanTHデータセット上で最先端のパフォーマンスを実現していることが明らかになった。
論文 参考訳(メタデータ) (2024-10-17T07:15:15Z) - Cascading and Direct Approaches to Unsupervised Constituency Parsing on
Spoken Sentences [67.37544997614646]
本研究は,教師なし音声補聴における最初の研究である。
目的は, 音声文の階層的構文構造を, 選挙区解析木の形で決定することである。
正確なセグメンテーションだけでは、音声文を正確に解析するのに十分であることを示す。
論文 参考訳(メタデータ) (2023-03-15T17:57:22Z) - Addressing the Challenges of Cross-Lingual Hate Speech Detection [115.1352779982269]
本稿では,低リソース言語におけるヘイトスピーチ検出を支援するために,言語間移動学習に着目した。
言語間単語の埋め込みを利用して、ソース言語上でニューラルネットワークシステムをトレーニングし、ターゲット言語に適用します。
本研究では,ヘイトスピーチデータセットのラベル不均衡の問題について検討する。なぜなら,ヘイトサンプルと比較して非ヘイトサンプルの比率が高いことがモデル性能の低下につながることが多いからだ。
論文 参考訳(メタデータ) (2022-01-15T20:48:14Z) - On Cross-Lingual Retrieval with Multilingual Text Encoders [51.60862829942932]
言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性について検討する。
教師なしのアドホック文と文書レベルのCLIR実験でそれらの性能をベンチマークする。
我々は、ゼロショット言語とドメイン転送CLIR実験のシリーズにおける英語関連データに基づいて、教師付き方式で微調整された多言語エンコーダの評価を行った。
論文 参考訳(メタデータ) (2021-12-21T08:10:27Z) - AM2iCo: Evaluating Word Meaning in Context across Low-ResourceLanguages
with Adversarial Examples [51.048234591165155]
本稿では, AM2iCo, Adversarial and Multilingual Meaning in Contextを提案する。
言語間文脈における単語の意味の同一性を理解するために、最先端(SotA)表現モデルを忠実に評価することを目的としている。
その結果、現在のSotAプリトレーニングエンコーダは人間のパフォーマンスにかなり遅れていることが明らかとなった。
論文 参考訳(メタデータ) (2021-04-17T20:23:45Z) - Evaluating Multilingual Text Encoders for Unsupervised Cross-Lingual
Retrieval [51.60862829942932]
本稿では,言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性に着目した体系的実証研究を行う。
文レベルのCLIRでは、最先端のパフォーマンスが達成できることを実証する。
しかし、ピーク性能は、汎用の多言語テキストエンコーダをオフ・ザ・シェルフで使うのではなく、文の理解タスクにさらに特化したバリエーションに依存している。
論文 参考訳(メタデータ) (2021-01-21T00:15:38Z) - Probing Task-Oriented Dialogue Representation from Language Models [106.02947285212132]
本稿では,タスク指向対話タスクにおいて,どのモデルが本質的に最も有意義な表現を担っているかを明らかにするために,事前学習された言語モデルについて検討する。
我々は、アノテートラベルを教師付き方法で固定された事前学習言語モデルの上に、分類器プローブとしてフィードフォワード層を微調整する。
論文 参考訳(メタデータ) (2020-10-26T21:34:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。