論文の概要: Mitigating Biases to Embrace Diversity: A Comprehensive Annotation Benchmark for Toxic Language
- arxiv url: http://arxiv.org/abs/2410.13313v1
- Date: Thu, 17 Oct 2024 08:10:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-10-18 13:20:11.034074
- Title: Mitigating Biases to Embrace Diversity: A Comprehensive Annotation Benchmark for Toxic Language
- Title(参考訳): バイアスを多様性に移行する - トックス言語のための包括的なアノテーションベンチマーク
- Authors: Xinmeng Hou,
- Abstract要約: 本研究では、人文科学研究に基礎を置く規範的ベンチマークを導入し、攻撃的言語の一貫性のないラベル付けを確実にする。
我々は、人間と言語モデル(LLM)アノテーションのアノテーション間のより高いアノテータ合意を達成するために、2つの新しいアノテートデータセットをコントリビュートする。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: This study introduces a prescriptive annotation benchmark grounded in humanities research to ensure consistent, unbiased labeling of offensive language, particularly for casual and non-mainstream language uses. We contribute two newly annotated datasets that achieve higher inter-annotator agreement between human and language model (LLM) annotations compared to original datasets based on descriptive instructions. Our experiments show that LLMs can serve as effective alternatives when professional annotators are unavailable. Moreover, smaller models fine-tuned on multi-source LLM-annotated data outperform models trained on larger, single-source human-annotated datasets. These findings highlight the value of structured guidelines in reducing subjective variability, maintaining performance with limited data, and embracing language diversity. Content Warning: This article only analyzes offensive language for academic purposes. Discretion is advised.
- Abstract(参考訳): 本研究では人文科学研究に根ざした規範的ベンチマークを導入し、特にカジュアル言語および非主流言語の使用において、攻撃的言語の一貫性、偏りのないラベル付けを保証する。
我々は、記述的命令に基づくオリジナルのデータセットと比較して、人間と言語モデル(LLM)アノテーション間のアノテータ間合意を高くする2つの新しいアノテートデータセットをコントリビュートする。
実験の結果,LLMはプロのアノテータが利用できない場合に有効な代替手段として機能することがわかった。
さらに、マルチソースのLLMアノテーション付きデータに基づいて微調整された小さなモデルは、より大きな単一ソースの人間アノテーション付きデータセットでトレーニングされたモデルよりも優れています。
これらの知見は、主観的多様性の低減、限られたデータによるパフォーマンスの維持、言語多様性の受容における構造化されたガイドラインの価値を強調した。
コンテンツ警告: この記事では、学術的な目的のために攻撃的な言語を分析する。
判断は推奨される。
関連論文リスト
- ImpScore: A Learnable Metric For Quantifying The Implicitness Level of Language [40.4052848203136]
インプシット言語は, 自然言語処理システムにおいて, 正確なテキスト理解を実現し, ユーザとの自然な対話を促進するために不可欠である。
本稿では,外部参照に頼ることなく,言語の暗黙度を定量化するスカラー計量を開発した。
ImpScoreは、12,580$(単純文、明示文)のペアからなる特別なキュレートされたデータセットに対して、ペアのコントラスト学習を使用してトレーニングされる。
論文 参考訳(メタデータ) (2024-11-07T20:23:29Z) - Aligning Large Language Models with Self-generated Preference Data [72.99676237703099]
大規模言語モデル(LLM)と人間の嗜好との整合性を高める新しいフレームワークを提案する。
私たちのキーとなるアイデアは、小さな(種)データの中で人間の事前知識を活用することです。
本稿では,ノイズ認識型選好学習アルゴリズムを導入し,生成した選好データにおける品質低下のリスクを軽減する。
論文 参考訳(メタデータ) (2024-06-06T18:01:02Z) - Dissecting vocabulary biases datasets through statistical testing and
automated data augmentation for artifact mitigation in Natural Language
Inference [3.154631846975021]
我々は、データセットのアーティファクトを調査し、これらの問題に対処するための戦略を開発することに重点を置いている。
文字レベルから単語レベルにまたがる複数の自動データ拡張戦略を提案する。
実験により,提案手法はモデル精度を効果的に向上し,バイアスを最大0.66%,バイアスを1.14%低減することを示した。
論文 参考訳(メタデータ) (2023-12-14T08:46:26Z) - Evaluating Neural Language Models as Cognitive Models of Language
Acquisition [4.779196219827507]
我々は、ニューラルネットワークモデルの構文能力を評価するための最も顕著なベンチマークは、十分に厳密でないかもしれないと論じる。
小規模データモデリングによる子言語習得を訓練すると、LMは単純なベースラインモデルで容易にマッチングできる。
子どもの言語習得に関する実証的研究と、LMをよりよく結びつけるための提案をまとめて締めくくった。
論文 参考訳(メタデータ) (2023-10-31T00:16:17Z) - CoAnnotating: Uncertainty-Guided Work Allocation between Human and Large
Language Models for Data Annotation [94.59630161324013]
本稿では,非構造化テキストの大規模共同アノテーションのための新しいパラダイムであるCoAnnotatingを提案する。
我々の実証研究は、CoAnnotatingが、異なるデータセット上の結果から作業を割り当てる効果的な手段であることを示し、ランダムベースラインよりも最大21%のパフォーマンス改善を実現している。
論文 参考訳(メタデータ) (2023-10-24T08:56:49Z) - Evaluation of Faithfulness Using the Longest Supported Subsequence [52.27522262537075]
本稿では,文脈によって支持される請求項の最長不連続性を計算し,機械生成テキストの忠実さを評価する新しい手法を提案する。
新しい人間アノテーション付きデータセットを使用して、モデルを微調整してLongest Supported Subsequence(LSS)を生成する。
提案手法は,我々のデータセットの忠実度に対する最先端のメトリクスよりも18%向上していることを示す。
論文 参考訳(メタデータ) (2023-08-23T14:18:44Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z) - Reference-less Analysis of Context Specificity in Translation with
Personalised Language Models [3.527589066359829]
本研究は、リッチキャラクタとフィルムアノテーションがいかにパーソナライズ言語モデル(LM)に活用できるかを考察する。
非文脈モデルと比較して、難易度を最大6.5%削減するために、リッチな文脈情報を活用するLMを構築している。
我々の領域における専門翻訳の文脈特化度は、文脈機械翻訳モデルによりよりよく保存できることを示す。
論文 参考訳(メタデータ) (2023-03-29T12:19:23Z) - Beyond Contrastive Learning: A Variational Generative Model for
Multilingual Retrieval [109.62363167257664]
本稿では,多言語テキスト埋め込み学習のための生成モデルを提案する。
我々のモデルは、$N$言語で並列データを操作する。
本手法は, 意味的類似性, ビットクストマイニング, 言語間質問検索などを含む一連のタスクに対して評価を行う。
論文 参考訳(メタデータ) (2022-12-21T02:41:40Z) - mFACE: Multilingual Summarization with Factual Consistency Evaluation [79.60172087719356]
抽象的な要約は、事前訓練された言語モデルと大規模データセットの可用性のおかげで、近年で新たな関心を集めている。
有望な結果にもかかわらず、現在のモデルはいまだに現実的に矛盾した要約を生み出すことに苦しむ。
事実整合性評価モデルを利用して、多言語要約を改善する。
論文 参考訳(メタデータ) (2022-12-20T19:52:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。