論文の概要: To Jev or Not? Evaluating the Accuracy and Efficiency of Structured Decision Models for Hate-Speech Moderation
- arxiv url: http://arxiv.org/abs/2610.03324v1
- Date: Fri, 02 Oct 2026 13:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.407553
- Title: To Jev or Not? Evaluating the Accuracy and Efficiency of Structured Decision Models for Hate-Speech Moderation
- Title(参考訳): Jev か否か?Hate-Speech モデレーションのための構造化決定モデルの精度と効率の評価
- Abstract要約: HendedECIDEは4つのヘイトスピーチデータセットに対する6つの決定モデル構成の評価である。
データセットの定義を提供するか、複数の質問に分解して分類を改善するかを検討する。
商用LLMは1つのデータセットですべての決定モデルを大幅に上回っていることがわかった。
- 参考スコア(独自算出の注目度): 0.17478203318226307
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The scale of online content makes hate-speech moderation challenging, while Large Language Models (LLMs) enable harmful material to be produced and adapted more easily. Moderation therefore requires efficient classifiers that can accommodate different definitions of hate speech. Recent structured decision models accept natural-language criteria and select among specified answers, raising the question of whether they can meet these requirements without task-specific training. We present HATEDECIDE, an evaluation of six decision-model configurations on four hate-speech datasets against specialized moderation, zero-shot, commercial, and supervised baselines. We examine whether supplying a dataset's definition, or decomposing it into multiple questions, improves classification, and we measure their latency and cost. We find that commercial LLMs significantly outperform all decision models on only one dataset. Supplying definitions changes up to 28\% of predictions without consistently improving classification, and decomposition significantly improves performance in only 20\% of the comparisons. On a diagnostic set of test cases, the best hosted decision model comes within 1.6 macro-F1 points of the best commercial LLM at approximately 97\% lower inference cost. These results identify opportunities for inexpensive moderation, while showing that explicit criteria and additional questions do not reliably improve classification.
- Abstract(参考訳): オンラインコンテンツの規模はヘイトスピーチのモデレーションを難しくする一方、Large Language Models (LLMs) は有害物質をより容易に生成し、適応させることができる。
したがって、モデレーションはヘイトスピーチの異なる定義に適合できる効率的な分類器を必要とする。
近年の構造化決定モデルは、自然言語の基準を受け入れ、特定の回答の中から選択し、タスク固有のトレーニングなしでこれらの要件を満たすことができるかどうかという疑問を提起している。
HendedECIDEは,4つのヘイトスピーチデータセットに対する6つの決定モデル構成を,特定のモデレーション,ゼロショット,コマーシャル,教師付きベースラインに対して評価する。
データセットの定義を提供するか、複数の質問に分解するか、分類を改善し、レイテンシとコストを測定します。
商用LLMは1つのデータセットですべての決定モデルを大幅に上回っていることがわかった。
供給定義は、一貫した分類を改善することなく、予測の28.5%まで変化し、分解は比較のわずか20.%で性能を著しく改善する。
テストケースの診断セットでは、最高のホスト決定モデルが、最高の商用LCMの1.6マクロF1ポイント以内で、約97 %の推論コストで提供される。
これらの結果は、明確な基準と追加の質問が分類を確実に改善しないことを示しながら、安価なモデレーションの機会を特定する。
関連論文リスト
- Likelihood Ranking doesn't Scale Like Prompting in LLMs [91.56564968539271]
多重選択QAでは、質問セットと回答セットに標準確率ベースのスコアがまだ条件付けられている。
我々は,同じ質問対から構築された宣言文の確率ランキングに基づく補完的プロトコルについて検討する。
論文 参考訳(メタデータ) (2026-09-24T11:16:53Z) - An Explainable DistilBERT-BiLSTM-Attention Framework for Binary and Multi-Class Hate Speech Detection [3.1798318618973362]
ソーシャルメディア上でのヘイトスピーチは、社会的調和、精神的幸福、公衆安全に深刻なリスクをもたらす。
本研究では,マルチレベルかつ説明可能なヘイトスピーチ検出フレームワークを提案する。
バイナリとマルチクラスの両方の分類を用いて、2つのベンチマークデータセットで評価する。
論文 参考訳(メタデータ) (2026-09-23T18:39:07Z) - Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models [0.0]
15の家系にまたがる41のオープンウェイト言語モデルと135M--9Bパラメータ範囲の体系的ゼロショット評価を行った。
我々は,信頼性キャリブレーション,現実的な入力摂動に対する堅牢性,モデルランキングの統計的信頼性,デプロイメント効率,ベンチマーク飽和度を分析した。
これらの知見は、意図分類のためのオープンウェイト言語モデルの選択と評価のための実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-07-29T19:42:33Z) - From Errors to Rules: Iterative Prompt Optimization for Text Classification [2.952559770088323]
エラーガイド最適化(Error-Guided Optimization、ERGO)は、分類失敗を診断し、対象とする決定ルールを生成するエラー駆動方式である。
ERGOは、エラーが特定の混乱ラベルペアに集中するタスクにおいて、最高の精度を達成する。
タスク特性を最適パラダイム選択にリンクする補完的なフレームワークを提供し、実践者に対して実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-06-15T23:39:06Z) - Forget What You Know about LLMs Evaluations -- LLMs are Like a Chameleon [12.13060272830352]
大規模言語モデル(LLM)は、しばしば公開ベンチマークで優れているように見える。
これらの高いスコアは、真の言語理解よりもデータセット固有のサーフェスキューへの過度な依存を隠蔽する可能性がある。
本稿では,ベンチマークプロンプトを歪ませるメタ評価フレームワークであるChameleon Benchmark Overfit Detector (C-BOD)を紹介する。
論文 参考訳(メタデータ) (2025-02-11T10:43:36Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Evaluating Generative Language Models in Information Extraction as Subjective Question Correction [49.729908337372436]
本稿では,新しい評価手法SQC-Scoreを提案する。
主観的質問訂正の原則に着想を得て,新しい評価手法SQC-Scoreを提案する。
3つの情報抽出タスクの結果から,SQC-Scoreは基準値よりもアノテータの方が好ましいことが示された。
論文 参考訳(メタデータ) (2024-04-04T15:36:53Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z) - Investigating the Limitation of CLIP Models: The Worst-Performing
Categories [53.360239882501325]
コントラスト言語-画像事前学習(CLIP)は、自然言語を視覚概念に統合する基礎モデルを提供する。
通常、十分に設計されたテキストプロンプトによって、多くの領域で満足な全体的な精度が達成できると期待されている。
しかし、最悪のカテゴリにおけるパフォーマンスは、全体的なパフォーマンスよりも著しく劣っていることがわかった。
論文 参考訳(メタデータ) (2023-10-05T05:37:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。