Fugu-MT 論文翻訳(概要): Correcting Annotator Bias in Training Data: Population-Aligned Instance Replication (PAIR)

論文の概要: Correcting Annotator Bias in Training Data: Population-Aligned Instance Replication (PAIR)

arxiv url: http://arxiv.org/abs/2501.06826v2
Date: Fri, 07 Mar 2025 17:32:57 GMT
ステータス: 翻訳完了
システム内更新日: 2025-03-10 15:01:10.427881
Title: Correcting Annotator Bias in Training Data: Population-Aligned Instance Replication (PAIR)
Title（参考訳）: トレーニングデータにおけるアノテーションバイアスの補正:人口適応型インスタンス複製(PAIR)
Authors: Stephanie Eckman, Bolei Ma, Christoph Kern, Rob Chew, Barbara Plank, Frauke Kreuter,
Abstract要約: Population-Aligned Instance Replication (PAIR)は、非表現型アノテータプールによるバイアスに対処する手法である。ラベル付け傾向の異なるアノテータを2種類作成し、異なる比率のデータセットを生成する。
参考スコア（独自算出の注目度）: 24.280324949484406
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Models trained on crowdsourced labels may not reflect broader population views, because those who work as annotators do not represent the population. We propose Population-Aligned Instance Replication (PAIR), a method to address bias caused by non-representative annotator pools. Using a simulation study of offensive language and hate speech, we create two types of annotators with different labeling tendencies and generate datasets with varying proportions of the types. We observe that models trained on unbalanced annotator pools show poor calibration compared to those trained on representative data. By duplicating labels from underrepresented annotator groups to match population proportions, PAIR reduces bias without collecting additional annotations. These results suggest that statistical techniques from survey research can improve model performance. We conclude with practical recommendations for improving the representativity of training data and model performance.
Abstract（参考訳）: クラウドソースラベルで訓練されたモデルは、アノテーターとして働く人々が人口を表現していないため、より広い人口観を反映しない可能性がある。非表現型アノテータプールによるバイアスに対処する手法であるPAIR(Population-Aligned Instance Replication)を提案する。攻撃的言語とヘイトスピーチのシミュレーション研究を用いて,ラベル付け傾向の異なる2種類のアノテータを作成し,異なる比率のデータセットを生成する。アンバランスなアノテータプールでトレーニングしたモデルでは、代表データでトレーニングしたモデルに比べてキャリブレーションが低いことが観察された。ラベルを表現されていないアノテータグループから重複させて人口比率に合わせることで、PAIRは追加のアノテーションを収集することなくバイアスを減らす。これらの結果は,調査研究の統計手法がモデル性能を向上させることを示唆している。トレーニングデータの表現性を向上し、モデルの性能を向上させるための実践的な勧告で締めくくります。

関連論文リスト

No Training Wheels: Steering Vectors for Bias Correction at Inference Time [0.0]
本研究では,大規模言語モデルにおける振る舞いの編集に使用されるベクトルのステアリングにインスパイアされた,安価でトレーニング不要な手法を提案する。多数派と少数派の間の平均活性化の差を計算して「バイアスベクトル」を定義する。これにより分類バイアスが減少し、最悪のグループ精度が向上する。
論文参考訳（メタデータ） (2025-06-23T12:58:54Z)
Active Data Sampling and Generation for Bias Remediation [0.0]
トレーニング済みのクラスを微調整する際、不公平な分類を補うために、サンプリングとデータ生成の混合戦略が提案されている。視覚的セマンティック・ロール・ラベリングのためのDeep Modelsのケーススタディとして、提案手法は90/10の不均衡から始まるシミュレートされたジェンダーバイアスを完全に解決することができる。
論文参考訳（メタデータ） (2025-03-26T10:42:15Z)
Dataset Representativeness and Downstream Task Fairness [24.570493924073524]
そのデータセット上で訓練された分類器のデータセット代表性とグループフェアネスとの間に自然な緊張関係があることを実証する。また、過度にサンプル化されていない群は、それらの群に偏りを示す分類器を生じる可能性があることも見出した。
論文参考訳（メタデータ） (2024-06-28T18:11:16Z)
Data Debiasing with Datamodels (D3M): Improving Subgroup Robustness via Data Selection [80.85902083005237]
データモデルによるデータデバイアス(Data Debiasing with Datamodels, D3M)は、マイノリティグループにおけるモデルの障害を駆動する特定のトレーニング例を分離し、削除するデバイアス(debiasing)アプローチである。
論文参考訳（メタデータ） (2024-06-24T17:51:01Z)
Unsupervised Concept Discovery Mitigates Spurious Correlations [45.48778210340187]
トレーニングデータにおける急激な相関関係のモデルはしばしば脆い予測を発生させ、意図しないバイアスを導入する。本稿では,教師なし対象中心学習と突発的相関の緩和の新たな関連性を確立する。コバルト(CoBalT)は、サブグループの人間のラベル付けを必要とせず、効果的に素早い相関を緩和する概念バランス技術である。
論文参考訳（メタデータ） (2024-02-20T20:48:00Z)
Debiased Sample Selection for Combating Noisy Labels [24.296451733127956]
サンプル選択におけるバイアス学習のためのnoIse-Tolerant Expert Model (ITEM)を提案する。具体的には、トレーニングバイアスを軽減するために、複数の専門家と統合した堅牢なネットワークアーキテクチャを設計します。 2つのクラス識別型ミニバッチの混合によるトレーニングにより、モデルが不均衡なトレーニングセットの効果を緩和する。
論文参考訳（メタデータ） (2024-01-24T10:37:28Z)
IBADR: an Iterative Bias-Aware Dataset Refinement Framework for Debiasing NLU models [52.03761198830643]
IBADR(Iterative Bias-Aware dataset Refinement framework)を提案する。まず、プール内のサンプルのバイアス度を定量化するために浅いモデルを訓練する。次に、各サンプルにバイアス度を表すバイアス指標をペアにして、これらの拡張サンプルを使用してサンプルジェネレータを訓練する。このようにして、このジェネレータは、バイアスインジケータとサンプルの対応関係を効果的に学習することができる。
論文参考訳（メタデータ） (2023-11-01T04:50:38Z)
Tackling Diverse Minorities in Imbalanced Classification [80.78227787608714]
不均衡データセットは、様々な現実世界のアプリケーションで一般的に見られ、分類器の訓練において重要な課題が提示されている。マイノリティクラスとマイノリティクラスの両方のデータサンプルを混合することにより、反復的に合成サンプルを生成することを提案する。提案するフレームワークの有効性を,7つの公開ベンチマークデータセットを用いて広範な実験により実証する。
論文参考訳（メタデータ） (2023-08-28T18:48:34Z)
Stubborn Lexical Bias in Data and Models [50.79738900885665]
我々は、データに基づいてトレーニングされたモデルに、データのスプリアスパターンが現れるかどうかを調べるために、新しい統計手法を用いる。トレーニングデータに*reweight*に最適化アプローチを適用し、数千のスプリアス相関を低減します。驚くべきことに、この方法ではトレーニングデータの語彙バイアスを低減できますが、トレーニングされたモデルで対応するバイアスの強い証拠がまだ見つかっていません。
論文参考訳（メタデータ） (2023-06-03T20:12:27Z)
Improving Heterogeneous Model Reuse by Density Estimation [105.97036205113258]
本稿では,異なる参加者の個人データを用いてモデルを学習することを目的とした多人数学習について検討する。モデルの再利用は、各パーティーのためにローカルモデルがトレーニングされていると仮定して、マルチパーティの学習にとって有望なソリューションである。
論文参考訳（メタデータ） (2023-05-23T09:46:54Z)
Non-Invasive Fairness in Learning through the Lens of Data Drift [88.37640805363317]
データや学習アルゴリズムを変更することなく、機械学習モデルの公平性を向上する方法を示す。異なる集団間の傾向のばらつきと、学習モデルと少数民族間の連続的な傾向は、データドリフトと類似している。このドリフトを解決するための2つの戦略(モデル分割とリウィーディング)を探索し、基礎となるデータに対するモデル全体の適合性を改善することを目的としている。
論文参考訳（メタデータ） (2023-03-30T17:30:42Z)
Debiasing Vision-Language Models via Biased Prompts [79.04467131711775]
本稿では,テキスト埋め込みにおけるバイアスのある方向を投影することで,視覚言語基盤モデルを疎外する一般的な手法を提案する。偏平投影行列を組み込んだテキストのみをデバイアスすることで、ロバストな分類器と公正な生成モデルが得られることを示す。
論文参考訳（メタデータ） (2023-01-31T20:09:33Z)
Consistent Range Approximation for Fair Predictive Modeling [10.613912061919775]
このフレームワークは、トレーニング中の外部データの可用性に関わらず、ターゲット個体数に対して確実に公正な予測モデルを構築する。このフレームワークの有効性は、実データの評価を通じて実証され、既存の最先端手法よりも大幅に改善されている。
論文参考訳（メタデータ） (2022-12-21T08:27:49Z)
Toward Annotator Group Bias in Crowdsourcing [26.754873038110595]
また,同集団内のアノテータは,アノテーションタスクにおいて一貫したグループバイアスを呈する傾向にあることを示した。我々は、新しい拡張期待最大化(EM)トレーニングアルゴリズムを用いて、アノテータ群バイアスを捕捉する新しい確率的グラフィカルフレームワークGroupAnnoを開発した。
論文参考訳（メタデータ） (2021-10-08T05:54:36Z)
Balancing out Bias: Achieving Fairness Through Training Reweighting [58.201275105195485]
自然言語処理におけるバイアスは、性別や人種などの著者の特徴を学習するモデルから生じる。既存のバイアスの緩和と測定方法は、著者の人口統計学と言語変数の相関を直接考慮していない。本稿では,インスタンス再重み付けを用いたバイアス対策法を提案する。
論文参考訳（メタデータ） (2021-09-16T23:40:28Z)
Neighborhood-based Pooling for Population-level Label Distribution Learning [5.790608871289107]
監視された機械学習は、しばしば人間の注釈付きデータを必要とする。人口レベルのラベル分布学習は、人間のアノテータの集団の意見のサンプルとして、各データ項目に対するアノテーションの収集を扱う。本稿では,サンプリングサイズを考慮したPLDLのためのアルゴリズムフレームワークと新しい統計的テストを提案する。
論文参考訳（メタデータ） (2020-03-16T18:52:56Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。