論文の概要: Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation
- arxiv url: http://arxiv.org/abs/2608.23152v2
- Date: Tue, 25 Aug 2026 17:25:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.207895
- Title: Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation
- Title(参考訳): Evidence! Hate Category Informed Counterspeech 生成のためのマルチエージェントメモリ効率的な推論フレームワーク
- Authors: Sujoy Nath, Aswini Kumar, Tanmoy Chakraborty,
- Abstract要約: FIRE(Factuality Informed Multi-Agent Reasoning Framework)を導入し,まずヘイトスピーチを5つのカテゴリーの1つに分解する。
FIREは, コンパクトエージェントを用いても, 既存の手法をはるかに上回っていることを示す。
我々は、ヘイトスピーチの根底にある意図を分解することは、安全で効果的で、文脈的に正確な反音声を生成するために不可欠である、と結論付けた。
- 参考スコア(独自算出の注目度): 18.971004344254755
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Counterspeech effectively neutralizes the impact of online hate. Although prior work explores automated counterspeech generation, it largely emphasizes stylistic control while treating hate speech as homogeneous, overlooking that distinct forms of abuse require fundamentally different counterspeech strategies. To address this gap, we introduce FIRE (Factuality Informed Multi-Agent Reasoning Framework) that first decomposes hate speech into one of the five distinct categories (misinformation, stereotype, conspiracy, dehumanizing, non-factual), and then maps it to a targeted counterspeech style. To facilitate FIRE, we curate FactualCS, a novel dataset of $4,784$ instances that provides the annotations regarding hate categories, reasoning traces, and evidence mappings, which are critical elements for grounded generation that are missing in prior work. A comprehensive evaluation across $28$ baseline configurations demonstrates that FIRE significantly surpasses existing methods, despite using compact agents ($<$2B). FIRE achieves a $\sim$ $12 \%$ and $\sim$ $11 \%$ improvements in factual and category-specific accuracy respectively, while simultaneously reducing toxicity by $\sim$ $11 \%$ relative to the strongest baselines. Further human evaluation confirms that responses generated by FIRE are significantly preferred over the strongest baselines, underscoring its effectiveness for real-world deployment. These findings show that decomposing the underlying intent of hate speech is essential for generating safe, effective, and contextually precise counterspeech.
- Abstract(参考訳): Counterspeechは、オンラインヘイトの影響を効果的に中和する。
以前の研究では、自動対音声生成を探求していたが、ヘイトスピーチを均質なものとして扱い、異なる形態の乱用が本質的に異なる対音声戦略を必要とすることを見越しながら、概ね様式的な制御を強調した。
このギャップに対処するために、まずヘイトスピーチを5つのカテゴリー(誤情報、ステレオタイプ、陰謀、非人間化、非現実化)の1つに分解するFIRE(Factuality Informed Multi-Agent Reasoning Framework)を導入する。
FIREを促進するために、我々は、ヘイトカテゴリ、推論トレース、エビデンスマッピングに関するアノテーションを提供する4,784ドルのインスタンスからなる新しいデータセットであるFactualCSをキュレートした。
28ドルのベースライン構成に対する総合的な評価は、FIREがコンパクトエージェント($2B)を使用しながら、既存のメソッドをはるかに上回っていることを示している。
FIREは、実際の精度とカテゴリ固有の精度をそれぞれ改善した$\sim$ $112 \%$と$\sim$ $111 \%$を達成し、同時に毒性を最強のベースラインと比較して$\sim$ $111 \%$に減らした。
さらに人間による評価では、FIREによって生成された応答は最強のベースラインよりもかなり好まれており、実世界の展開におけるその有効性を裏付けている。
これらの結果から,ヘイトスピーチの根底にある意図を分解することは,安全で効果的で文脈的に正確な反音声を生成する上で不可欠であることが示唆された。
関連論文リスト
- Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation [46.54749884988069]
大規模言語モデル(LLM)は、ヘイトスピーチのモデレーションに、しばしば人間AI内で使われるようになった。
本研究は,アノテータ型属性に対する初期正解モデル判定の感受性について検討した。
我々は,決定境界の摂動と対角的理性との直接的な矛盾を延長するリジャッジプロトコルを導入する。
論文 参考訳(メタデータ) (2026-08-23T05:59:25Z) - Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations [48.69228180369574]
ヘイトスピーチアノテーションはコストが高く、主観的で、アノテータの意見の相違がちである。
大規模言語モデル(LLM)が人間の判断とどのように一致しているかを分析する。
本研究では, ヘイトスピーチコーパスから連続ヘイトスピーチスコアを再構成する。
論文 参考訳(メタデータ) (2026-05-26T13:44:48Z) - More Than Sum of Its Parts: Deciphering Intent Shifts in Multimodal Hate Speech Detection [49.07221734365168]
ソーシャルメディア上でのヘイトスピーチは、サイバースペースの確保には不可欠だが、自動検出システムに大きく依存している。
我々は、モダリティが相互作用する意味的意図変化を特徴付け、良心的憎悪から暗黙的憎悪を構築するか、意味的逆転を通じて毒性を中和する。
本稿では,これらの複雑な手がかりを効果的に解読するために,裁判所エージェントによる非対称推論(Asymmetric Reasoning)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-22T15:46:23Z) - Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio [63.18443674004945]
この研究は、TSシステムを利用して有害なコンテンツを含む音声を生成する、コンテンツ中心の脅威を探究する。
HARMGENは、これらの課題に対処する2つのファミリーにまとめられた5つの攻撃群である。
論文 参考訳(メタデータ) (2025-11-14T03:00:04Z) - Dealing with Annotator Disagreement in Hate Speech Classification [0.0]
本稿では,アノテータの不一致に対処するための戦略について検討する。
トルコのツイートにおけるヘイトスピーチ分類の文脈において、複数のアノテーションを集約するための様々な自動アプローチを評価する。
本研究は,問題の重要性を強調し,オンライン談話におけるヘイトスピーチの検出と理解に最先端のベンチマーク結果を提供する。
論文 参考訳(メタデータ) (2025-02-12T10:19:50Z) - Intent-conditioned and Non-toxic Counterspeech Generation using Multi-Task Instruction Tuning with RLAIF [14.2594830589926]
オンラインヘイトスピーチに対する反応として定義されているCounterspeechは、非センセーショナルソリューションとしてますます利用されている。
ヘイトフルステートメントにおける社会的バイアスの背景にある実践的意味をモデル化し,反音声生成を促進させる新しいフレームワークであるCoARLを紹介した。
CoARLの最初の2つのフェーズは、連続的なマルチインストラクションチューニング、インテント、反応、攻撃的ステートメントの害を理解するためのモデルを教えること、そしてインテント条件付き逆音声を生成するためのタスク固有の低ランクアダプタ重みを学習することである。
論文 参考訳(メタデータ) (2024-03-15T08:03:49Z) - An Investigation of Large Language Models for Real-World Hate Speech
Detection [46.15140831710683]
既存の手法の大きな制限は、ヘイトスピーチ検出がコンテキストの問題である点である。
近年,大規模言語モデル (LLM) はいくつかの自然言語処理において最先端の性能を示した。
本研究は, ヘイトスピーチの文脈を効果的に把握する上で, 巧妙な推論プロンプトが有効であることを明らかにする。
論文 参考訳(メタデータ) (2024-01-07T00:39:33Z) - DisCGen: A Framework for Discourse-Informed Counterspeech Generation [34.75404551612012]
本稿では,言論理論に基づく枠組みを提案し,反声と憎しみのあるコメントを結びつける推論リンクについて検討する。
本稿では,Reddit から現在地にある反音声のデータセットを収集するプロセスを提案する。
提案するデータセットとフレームワークを用いて,大規模言語モデルを用いて,談話理論に基づいて文脈的に接地した対音声を生成することができることを示す。
論文 参考訳(メタデータ) (2023-11-29T23:20:17Z) - HARE: Explainable Hate Speech Detection with Step-by-Step Reasoning [29.519687405350304]
本稿では,大規模言語モデル(LLM)の推論能力を利用して,ヘイトスピーチの説明のギャップを埋めるヘイトスピーチ検出フレームワークHAREを紹介する。
SBICとImplicit Hateベンチマークの実験では、モデル生成データを用いた手法がベースラインを一貫して上回ることを示した。
提案手法は,訓練されたモデルの説明品質を高め,未知のデータセットへの一般化を改善する。
論文 参考訳(メタデータ) (2023-11-01T06:09:54Z) - Addressing the Challenges of Cross-Lingual Hate Speech Detection [115.1352779982269]
本稿では,低リソース言語におけるヘイトスピーチ検出を支援するために,言語間移動学習に着目した。
言語間単語の埋め込みを利用して、ソース言語上でニューラルネットワークシステムをトレーニングし、ターゲット言語に適用します。
本研究では,ヘイトスピーチデータセットのラベル不均衡の問題について検討する。なぜなら,ヘイトサンプルと比較して非ヘイトサンプルの比率が高いことがモデル性能の低下につながることが多いからだ。
論文 参考訳(メタデータ) (2022-01-15T20:48:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。