論文の概要: A Heuristic Perspective on Debiasing Language Models
- arxiv url: http://arxiv.org/abs/2608.00622v1
- Date: Sat, 01 Aug 2026 12:27:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.828342
- Title: A Heuristic Perspective on Debiasing Language Models
- Title(参考訳): 言語モデルのデバイアスに関するヒューリスティックな視点
- Abstract要約: 言語モデル(LM)は、事前訓練中に様々なバイアスを取得し、それらを相互作用で表現し、社会的な害をもたらす可能性がある。
本稿では, HEIMAT(HEurIstic-style autoMATic debiasing framework for LMs)を提案する。
最初のステップでは、シンプルなテンプレートを使用してプロンプトを構築し、モデルバイアスを明らかにし、対応するコンテキストプロンプトを生成する。
2番目のステップでは、これらの文脈における予測のJensen-Shannon分散を最小化することにより、モデルを微調整し、バイアスを減少させる。
- 参考スコア(独自算出の注目度): 26.430062244587234
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models (LMs) often acquire various biases during pre-training and may express them in interactions, potentially causing social harm. Existing methods often rely on counterfactual augmentation or representation projection. These strategies remain limited in practice due to their high computational costs and difficulty in scaling to larger models. Additionally, many of these strategies require manual data annotation, narrowing their scope to specific cultures and bias categories. To overcome these limitations, we propose HEIMAT, a HEurIstic-style autoMATic debiasing framework for LMs. HEIMAT consists of two main steps: bias disclosure and debiasing fine-tuning. In the first step, it uses simple templates to construct heuristic prompts, which are applied to reveal model biases and generate corresponding context prompts. In the second step, it fine-tunes the model by minimizing the Jensen-Shannon divergence of predictions on these context prompts to reduce bias. Extensive experiments show that HEIMAT effectively mitigates bias in different cultures while maintaining the model's natural language understanding (NLU) performance.
- Abstract(参考訳): 言語モデル(LM)は、事前訓練中に様々なバイアスを取得し、それらを相互作用で表現し、社会的な害をもたらす可能性がある。
既存の手法は、しばしば反ファクト的な拡張や表現のプロジェクションに依存している。
これらの戦略は、計算コストが高く、より大きなモデルへのスケーリングが困難であるため、実際には制限されている。
さらに、これらの戦略の多くは手動のデータアノテーションを必要とし、その範囲を特定の文化やバイアスカテゴリに絞り込む。
これらの制約を克服するために, HEIMAT は HEurIstic-style autoMATic debiasing framework for LMs を提案する。
HEIMATは2つの主要なステップで構成されている。
最初のステップでは、単純なテンプレートを使用してヒューリスティックなプロンプトを構築し、モデルバイアスを明らかにし、対応するコンテキストプロンプトを生成する。
2番目のステップでは、これらの文脈における予測のJensen-Shannon分散を最小化することにより、モデルを微調整し、バイアスを減少させる。
大規模な実験により、HEIMATはモデルの自然言語理解(NLU)性能を維持しながら、異なる文化におけるバイアスを効果的に軽減することが示された。
関連論文リスト
- Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts [29.864293711943038]
本研究では, 言語モデルにおいて, ステレオタイプ誘導語を検出し, ニューロンレベルのバイアスをもたらすフレームワークを提案する。
本フレームワークはまず, 集団間の比較分析により, ステレオタイプ誘導形容詞と名詞を識別する。
3つの LLM 実験により,本手法はモデル全体の性能を保ちながらバイアスを効果的に低減することを示した。
論文 参考訳(メタデータ) (2026-02-04T10:27:36Z) - RobustDebias: Debiasing Language Models using Distributionally Robust Optimization [0.39774453005697336]
そこで本研究では,分散ロバスト最適化をデバイアス言語モデルに適用する機構である itRobustDebias を提案する。
我々のアプローチは、微調整中にモデルを複数の人口層に分散させ、任意のデータセットやタスクに一般化する。
論文 参考訳(メタデータ) (2026-01-30T23:49:11Z) - Bias in, Bias out: Annotation Bias in Multilingual Large Language Models [4.032367157209129]
NLPデータセットのバイアスは、多言語大言語モデルを開発する上で、依然として大きな課題である。
本稿では, アノテーションバイアスの理解, 指示バイアス, アノテーションバイアス, 文脈バイアス, 文化バイアスを総合的に検討する。
論文 参考訳(メタデータ) (2025-11-18T17:02:12Z) - DBR: Divergence-Based Regularization for Debiasing Natural Language Understanding Models [50.54264918467997]
プレトレーニング言語モデル(PLM)は、様々な自然言語処理タスクにおいて印象的な結果を得た。
近年の研究では、これらのモデルが言語を真に理解するのではなく、表面的な特徴やショートカットに依存していることが明らかになっている。
本稿では,このショートカット学習行動を軽減するために,ダイバージェンスに基づく正規化(DBR)を提案する。
論文 参考訳(メタデータ) (2025-02-25T16:44:10Z) - REFINE-LM: Mitigating Language Model Stereotypes via Reinforcement Learning [18.064064773660174]
本稿では、強化学習を用いて様々なバイアスを微調整せずに処理する脱バイアス法REFINE-LMを紹介する。
LMの単語確率分布の上に簡単なモデルをトレーニングすることにより、バイアス強化学習法により、人間のアノテーションを使わずにモデルの偏りを抑えることができる。
複数のLMを含む多種多様なモデルで行った実験により,本手法は,LMの性能を維持しながら,ステレオタイプバイアスを著しく低減することを示した。
論文 参考訳(メタデータ) (2024-08-18T14:08:31Z) - Identifying and Mitigating Social Bias Knowledge in Language Models [52.52955281662332]
個々人の社会的偏見をきめ細かなキャリブレーションを可能にする新しいデバイアス・アプローチであるFairness Stamp(FAST)を提案する。
FASTは最先端のベースラインを超え、デバイアス性能が優れている。
これは、大きな言語モデルにおける公平性を達成するためのきめ細かいデバイアス戦略の可能性を強調している。
論文 参考訳(メタデータ) (2024-08-07T17:14:58Z) - Self-Debiasing Large Language Models: Zero-Shot Recognition and
Reduction of Stereotypes [73.12947922129261]
ステレオタイピングを減らすために,大規模言語モデルのゼロショット機能を活用している。
自己嫌悪は、9つの異なる社会集団におけるステレオタイピングの度合いを著しく低下させることが示される。
この研究が、バイアス軽減のための他のゼロショット技術に関する調査をオープンにすることを願っている。
論文 参考訳(メタデータ) (2024-02-03T01:40:11Z) - Bias and Fairness in Large Language Models: A Survey [73.87651986156006]
本稿では,大規模言語モデル(LLM)のバイアス評価と緩和手法に関する総合的な調査を行う。
まず、自然言語処理における社会的偏見と公平性の概念を統合し、形式化し、拡張する。
次に,3つの直感的な2つのバイアス評価法と1つの緩和法を提案し,文献を統一する。
論文 参考訳(メタデータ) (2023-09-02T00:32:55Z) - Debiasing Vision-Language Models via Biased Prompts [79.04467131711775]
本稿では,テキスト埋め込みにおけるバイアスのある方向を投影することで,視覚言語基盤モデルを疎外する一般的な手法を提案する。
偏平投影行列を組み込んだテキストのみをデバイアスすることで、ロバストな分類器と公正な生成モデルが得られることを示す。
論文 参考訳(メタデータ) (2023-01-31T20:09:33Z) - Learning from others' mistakes: Avoiding dataset biases without modeling
them [111.17078939377313]
最先端自然言語処理(NLP)モデルは、意図したタスクをターゲットとする機能ではなく、データセットのバイアスや表面形状の相関をモデル化することを学ぶことが多い。
これまでの研究は、バイアスに関する知識が利用できる場合に、これらの問題を回避するための効果的な方法を示してきた。
本稿では,これらの問題点を無視する学習モデルについて述べる。
論文 参考訳(メタデータ) (2020-12-02T16:10:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。