論文の概要: SPAR-Hate: Auditor-Guided Multi-Perspective Role Reasoning for Bilingual Hate Speech Parsing
- arxiv url: http://arxiv.org/abs/2608.22018v2
- Date: Tue, 25 Aug 2026 15:31:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:33.999561
- Title: SPAR-Hate: Auditor-Guided Multi-Perspective Role Reasoning for Bilingual Hate Speech Parsing
- Title(参考訳): SPAR-Hate:バイリンガルヘイト音声解析のためのオーディタガイド型マルチパースペクティブ・ロール推論
- Authors: Yifan Lyu, Dianqing Lin, Xinran Li, Jiaqi Qiao, Xiujuan Xu,
- Abstract要約: SPAR-Hateは、バイリンガルヘイトスピーチ解析のための監査者向け多視点ロール推論フレームワークである。
それぞれの文書をローカル・フォーカス・ユニットに分解し、ヴィクティム、モデレーター、文化的傍観者の視点から証拠に基づく候補者を導き出す。
STATE-ToxiCNと制御されたTBOスプリットの実験は、ローカルとAPIのバックボーン間で利得を示している。
- 参考スコア(独自算出の注目度): 12.62180137889734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hate speech research has moved from coarse-grained classification towards structured parsing, where systems jointly identify targets, supporting arguments, and target-level labels. Documents with multiple targets, conflicting local readings, or culturally coded language make these bindings difficult to recover. SPAR-Hate is an auditor-guided multi-perspective role-reasoning framework for bilingual hate speech parsing. It decomposes each document into local focus units, elicits evidence-grounded candidates from Victim, Moderator, and Cultural Bystander perspectives, resolves candidate conflicts under grounding and schema constraints, and reassembles sample-level predictions. Experiments on STATE-ToxiCN and a controlled TBO split show gains across local and API backbones, concentrated on strict joint target-argument-label metrics. Full-test integrated-prompt controls, component ablations, and bounded-arbitration diagnostics identify the contribution of separated perspective generation and arbitration. Structured teacher traces also support training a smaller student model.
- Abstract(参考訳): ヘイトスピーチ研究は、粗粒度分類から構造化解析へ移行し、システムはターゲットを共同で識別し、引数をサポートし、ターゲットレベルのラベルをラベル化する。
複数のターゲットを持つドキュメント、ローカルな読みと矛盾する言語、あるいは文化的にコーディングされた言語は、これらのバインディングを回復するのが困難である。
SPAR-Hateは、バイリンガルヘイトスピーチ解析のための監査者向け多視点ロール推論フレームワークである。
それぞれの文書を局所的な焦点単位に分解し、ヴィクティム、モデレーター、文化的傍観者の視点から証拠に基づく候補者を導き、根拠とスキーマの制約の下での対立を解決し、サンプルレベルの予測を再組み立てする。
STATE-ToxiCNと制御されたTBOスプリットの実験では、局所およびAPIバックボーン間での利得が示され、厳密な関節ターゲット・アグメント・ラベルの指標に集中している。
完全テスト統合プロンプト制御、コンポーネントアブレーション、および有界軌道診断は、分離された視点生成と仲裁の寄与を識別する。
構造化された教師のトレースは、より小さな学生モデルのトレーニングもサポートする。
関連論文リスト
- Better Decomposition, Free Aggregation: A Synthesizer-Folding Framework for Multilingual Multi-Hop Question Answering [48.94279718429342]
マルチリンガルなマルチホップ質問応答のためのフレームワークであるSyferを紹介する。
Syferは、デフォルトで適用するのではなく、翻訳をデフェクトする。
複数の言語で実験した結果、Syferは競争の正確さを達成できた。
論文 参考訳(メタデータ) (2026-08-13T12:25:59Z) - All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG [87.74635133954975]
現在のマルチ言語検索・拡張生成システム(mRAG)は,再ランク付け時に言語バイアスに悩まされていることを示す。
textittextbfLanguage-textbfAgnostic textbfUtility-driven textbfReranker textbfAlignment (LAURA)を提案する。
論文 参考訳(メタデータ) (2026-04-22T05:33:06Z) - Lost in Speech: Benchmarking, Evaluation, and Parsing of Spoken Code-Switching Beyond Standard UD Assumptions [23.2725831877861]
Spoken Code-switching (CSW) は、テキストで見えない方法で構文解析に挑戦する。
分散、反復、楕円、談話駆動構造は、通常、標準の普遍依存(UD)前提に反する。
論文 参考訳(メタデータ) (2026-02-06T02:02:07Z) - What Really Counts? Examining Step and Token Level Attribution in Multilingual CoT Reasoning [0.03499870393443267]
本研究では,多言語LLMにおけるChain-of-Thought(CoT)推論の帰属パターンについて検討した。
ステップレベルの属性に対するContextCiteとトークンレベルの属性に対するInseqの2つの補完属性手法をQwen2.5 1.5B-Instructモデルに適用する。
実験結果から,(1)帰属スコアは最終推論ステップ,特に不正確な世代において過度に強調され,(2)構造化CoTは高解像度ラテン文字言語の精度を著しく向上させ,(3)否定文や散逸文による制御摂動はモデル精度と帰属コヒーレンスを低下させる,といった重要な結果が得られた。
論文 参考訳(メタデータ) (2025-11-19T21:23:58Z) - Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection [39.748035737067745]
本稿では,言語に基づく物体検出のための文内階層関係に基づく言語表現の再構成を提案する。
重要な洞察は、テキストトークンを中核となる構成要素、属性、関係("talk in pieces")に切り離し、その後階層的に構造化された文レベルの表現に集約する必要性である。
OmniLabelベンチマークによる実験結果は24%のパフォーマンス向上を示し、言語構成の重要性を示している。
論文 参考訳(メタデータ) (2025-09-29T02:14:26Z) - Fine-Grained Chinese Hate Speech Understanding: Span-Level Resources, Coded Term Lexicon, and Enhanced Detection Frameworks [13.187315629074428]
Span-level Target-Aware Toxicity extract dataset (STATE ToxiCN)を導入する。
我々は、中国語のコード化されたヘイト用語、LLMのヘイトセマンティクスを解釈する能力について、初めて包括的な研究を行った。
本稿では,注釈付き辞書をモデルに統合し,ヘイトスピーチ検出性能を大幅に向上させる手法を提案する。
論文 参考訳(メタデータ) (2025-07-15T13:19:18Z) - Dual-Class Prompt Generation: Enhancing Indonesian Gender-Based Hate Speech Detection through Data Augmentation [0.0]
インドネシアのソーシャルメディアにおけるジェンダーベースのヘイトスピーチの検出は、ラベル付きデータセットが限られているため、依然として困難である。
我々は,逆翻訳,単一クラスプロンプト生成,および提案する2クラスプロンプト生成を評価した。
両クラスからサンプルを組み込むことで,言語モデルがより多様だが代表的なサンプルを生成することが示唆された。
論文 参考訳(メタデータ) (2025-03-06T10:07:51Z) - Addressing the Challenges of Cross-Lingual Hate Speech Detection [115.1352779982269]
本稿では,低リソース言語におけるヘイトスピーチ検出を支援するために,言語間移動学習に着目した。
言語間単語の埋め込みを利用して、ソース言語上でニューラルネットワークシステムをトレーニングし、ターゲット言語に適用します。
本研究では,ヘイトスピーチデータセットのラベル不均衡の問題について検討する。なぜなら,ヘイトサンプルと比較して非ヘイトサンプルの比率が高いことがモデル性能の低下につながることが多いからだ。
論文 参考訳(メタデータ) (2022-01-15T20:48:14Z) - On Cross-Lingual Retrieval with Multilingual Text Encoders [51.60862829942932]
言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性について検討する。
教師なしのアドホック文と文書レベルのCLIR実験でそれらの性能をベンチマークする。
我々は、ゼロショット言語とドメイン転送CLIR実験のシリーズにおける英語関連データに基づいて、教師付き方式で微調整された多言語エンコーダの評価を行った。
論文 参考訳(メタデータ) (2021-12-21T08:10:27Z) - AM2iCo: Evaluating Word Meaning in Context across Low-ResourceLanguages
with Adversarial Examples [51.048234591165155]
本稿では, AM2iCo, Adversarial and Multilingual Meaning in Contextを提案する。
言語間文脈における単語の意味の同一性を理解するために、最先端(SotA)表現モデルを忠実に評価することを目的としている。
その結果、現在のSotAプリトレーニングエンコーダは人間のパフォーマンスにかなり遅れていることが明らかとなった。
論文 参考訳(メタデータ) (2021-04-17T20:23:45Z) - Evaluating Multilingual Text Encoders for Unsupervised Cross-Lingual
Retrieval [51.60862829942932]
本稿では,言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性に着目した体系的実証研究を行う。
文レベルのCLIRでは、最先端のパフォーマンスが達成できることを実証する。
しかし、ピーク性能は、汎用の多言語テキストエンコーダをオフ・ザ・シェルフで使うのではなく、文の理解タスクにさらに特化したバリエーションに依存している。
論文 参考訳(メタデータ) (2021-01-21T00:15:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。