論文の概要: LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering
- arxiv url: http://arxiv.org/abs/2607.06845v1
- Date: Tue, 07 Jul 2026 22:36:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.234917
- Title: LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering
- Title(参考訳): LLMs Silently correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering (英語)
- Authors: Huan Wu, Ali Emami, Muhammad Furquan Hassan, Osaretin Igbinoba, Osakpolor Idusuyi, Osamede Igbinoba, Faiza Khan Khattak, Laleh Seyyed-Kalantari,
- Abstract要約: アフリカ・アメリカン・イングリッシュ (AAE) は、3000万人以上が話す言語である。
AAEにおける先行文脈であっても、最先端のモデルは標準アメリカ英語の継続を体系的に好んでいることを示す。
このバイアスを監査し緩和するためのエンドツーエンドのフレームワークを提示します。
- 参考スコア(独自算出の注目度): 8.881511097899983
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: African American English (AAE), a rule-governed dialect spoken by over 30 million people, is routinely misinterpreted and "corrected" by large language models (LLMs). Across six instruction-tuned LLMs (14B to 70B), we show that state-of-the-art models systematically prefer Standard American English (SAE) continuations even when the preceding context is in AAE, effectively rewriting AAE into SAE. We present an end-to-end framework to audit and mitigate this bias. For auditing, we introduce conditional Dialect Group Invariance (cDGI), which isolates true model bias from translator-induced artifacts, and a feature-level localization analysis that identifies which AAE markers most strongly trigger bias; we find that syntactic constructions, especially negative concord (e.g., "ain't nobody"), are universal triggers across all models. For mitigation, we introduce, to our knowledge, the first application of activation steering to dialect bias: a training-free, test-time method that extracts dialect directions via causal tracing and injects them into bias-relevant layers. Activation steering reduces bias 5 to 20 times more than prompting while preserving SAE fluency. To enable this work, we release REAL-AAE , the largest real-AAE parallel corpus to date: 17,479 AAE/SAE/ AAE_back triplets from natural tweets (2 to 6 times larger than prior real-AAE resources), validated automatically (BERTScore F1 = 0.95) and by three native AAE speakers (83.0% semantic agreement).
- Abstract(参考訳): アフリカ・アメリカン・イングリッシュ(英語: African American English, AAE)は、3000万人以上の人々が話しており、大言語モデル(LLM)によって日常的に誤解され、「修正」される方言である。
6つの命令調整 LLM (14Bから70B) を通して, AAE に先行する文脈であっても, 最先端のモデルは体系的に標準アメリカ英語 (SAE) の継続を好んでおり, 実質的に AAE を SAE に書き換えていることを示す。
このバイアスを監査し緩和するためのエンドツーエンドのフレームワークを提示します。
監査には,実モデルバイアスをトランスレータによって誘導されるアーティファクトから分離する条件付き方言群不変性(cDGI)と,AAEマーカーが最も強く引き起こすバイアスを識別する特徴レベルの局所化分析を導入する。
緩和のために、我々の知識に対して、アクティベーションステアリングの最初の応用を方言バイアスに適用する: 因果的トレースを通じて方言の方向を抽出し、バイアス関連層に注入する訓練不要でテストタイムの方法である。
活性化ステアリングは、SAE流速を保ちながら、刺激の5倍から20倍のバイアスを減少させる。
17,479 AAE/SAE/AAE_back triplet from natural tweet (2~6倍)、自動検証(BERTScore F1 = 0.95)、3つのネイティブAEスピーカー(83.0%)。
関連論文リスト
- Side-by-side Comparison Amplifies Dialect Bias in Language Models [13.147713730335775]
言語モデル(LM)は、方言のバリエーションに基づいたバイアスを示すことができる。
我々は、LMが定型的特徴と意図等価なつぶやきをどう関連づけるかを評価することで、隠れ方言バイアスを定量化する。
論文 参考訳(メタデータ) (2026-05-23T03:51:44Z) - Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models [12.338320566839483]
データキュレーション,デジタル支配,言語標準化の地政学的ヒストリーが,大規模言語モデル(LLM)開発パイプラインをどう形成するかを検討する。
我々は1,813個のAmE-BrE変異体をキュレートしたコーパスを構築し、方言のアライメントを推定するための訓練不要な方法であるDiAlignを導入する。
現代LLMの特権は、AmEを事実上の規範としており、グローバルAI展開における言語的均質化、疫学的不正、不平等に対する懸念を高めている。
論文 参考訳(メタデータ) (2026-04-05T17:59:34Z) - Assessing Dialect Fairness and Robustness of Large Language Models in Reasoning Tasks [68.33068005789116]
本稿では、標準英語とAAVEで1.2K以上の並列クエリペアを含むベンチマークであるReDialを紹介する。
我々は、GPT、Claude、Llama、Mistral、Phiモデルファミリーなど、広く使われているモデルを評価した。
我々の研究は、方言クエリにおけるLLMバイアスを分析するための体系的で客観的な枠組みを確立する。
論文 参考訳(メタデータ) (2024-10-14T18:44:23Z) - ALIF: Low-Cost Adversarial Audio Attacks on Black-Box Speech Platforms using Linguistic Features [25.28307679567351]
ALIFは、最初のブラックボックス対応言語機能ベースのアタックパイプラインである。
本稿では,デジタルドメインと物理再生環境の両方で攻撃を開始するためのALIF-OTLおよびALIF-OTAスキームを提案する。
論文 参考訳(メタデータ) (2024-08-03T15:30:16Z) - Reasons to Reject? Aligning Language Models with Judgments [72.39858230784002]
言語フィードバックを用いた大規模言語モデル(LLM)の整合性について検討する。
本稿では,不適切なコンテンツ検出と判断に基づく修正が可能なコントラスト型異種訓練(Contrastive Unlikelihood Training, CUT)を提案する。
以上の結果から,CUTは175BのDaVinci003を破り,AlpacaEvalの50.84ポイントを達成できた。
論文 参考訳(メタデータ) (2023-12-22T10:29:43Z) - What Do Llamas Really Think? Revealing Preference Biases in Language
Model Representations [62.91799637259657]
大規模言語モデル(LLMs)は、応答を辞退しても、社会的な偏見を示すか?
本研究は,文脈的埋め込みを探索し,このバイアスが潜在表現にエンコードされているかどうかを探索することによって検討する。
単語の隠れベクトルからLLMの単語ペア選好を予測するロジスティックなBradley-Terryプローブを提案する。
論文 参考訳(メタデータ) (2023-11-30T18:53:13Z) - Sequence-level self-learning with multiple hypotheses [53.04725240411895]
我々は、自動音声認識(ASR)のためのアテンションベースシーケンス・ツー・シーケンス(seq2seq)モデルを用いた新しい自己学習手法を開発した。
従来の教師なし学習手法とは対照的に,我々はEmphmulti-task Learning(MTL)フレームワークを採用する。
実験の結果,本手法は,英語データのみを用いてトレーニングしたベースラインモデルと比較して,英文音声データのWERを14.55%から10.36%に削減できることがわかった。
論文 参考訳(メタデータ) (2021-12-10T20:47:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。