論文の概要: The Dialect Tax: Dialectal Biases Persist throughout the Language Modeling Pipeline
- arxiv url: http://arxiv.org/abs/2608.24952v1
- Date: Mon, 24 Aug 2026 22:46:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.289578
- Title: The Dialect Tax: Dialectal Biases Persist throughout the Language Modeling Pipeline
- Title(参考訳): 方言税:言語モデリングパイプラインを通して存続する方言バイアス
- Abstract要約: 我々の研究は、自然言語処理パイプラインにまたがるこの「方言税」を辿る。
まず、LMが標準アメリカ英語(SAE)と方言のテキストを意味論的に等価と認識していることを確認した。
モデルファミリや世代にわたって、現代のLMは、トークン化、事前訓練、ポストトレーニング、推論の間、方言のテキストを不平等にエンコードしている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Systematic dialectal performance gaps in language models (LMs) are well documented, but the source of these disparities within the modern language modeling pipeline remains unclear. Our study traces this "dialect tax" across the natural language processing pipeline. Using parallel English dialect corpora that hold meaning fixed while varying surface form, we first confirm that LMs recognize matched Standard American English (SAE) and dialectal texts as semantically equivalent. However, we discover further representational gaps corresponding to downstream performance gaps. Across model families and generations, modern LMs still encode dialectal texts unequally during tokenization, pre-training, post-training, and inference. Strikingly, bypassing traditional subword segmentation via a character-level counterfactual tokenizer removes neither input and output asymmetries nor dialectal accuracy gaps. During pre-training, dialect pairs induce more divergent gradient updates than pairs of entirely unrelated SAE documents, indicating that models find semantically equivalent dialectal content harder to learn from than unrelated SAE documents. During post-training, reward models show contextual, unstable dialect preferences, assigning higher values to isolated AAVE-exclusive tokens than to SAE-exclusive tokens, while full reasoning contexts receive task- and model-dependent dialect penalties. Overall, our findings suggest that the dialect tax is encoded and accumulated not by any one step in isolation, but at every step of the language modeling process.
- Abstract(参考訳): 言語モデル(LM)の体系的方言性能ギャップは十分に文書化されているが、現代の言語モデリングパイプラインにおけるこれらの差異の源泉はいまだ不明である。
我々の研究は、自然言語処理パイプラインにまたがるこの「方言税」を辿る。
パラレル・イングリッシュ・コーパス(英語版)を用いて、異なる表面形状で固定された意味を保持することで、まず、標準アメリカ英語(SAE)と方言のテキストが意味論的に等価であることを認めた。
しかし、下流のパフォーマンスギャップに対応するさらなる表現的ギャップが発見できる。
モデルファミリや世代にわたって、現代のLMは、トークン化、事前訓練、ポストトレーニング、推論の間、方言のテキストを不平等にエンコードしている。
興味深いことに、文字レベルの反事実トークン化器によって従来のサブワードセグメンテーションをバイパスすることは、入力や出力の非対称性も弁証精度のギャップも排除しない。
事前学習中、方言ペアは、全く関係のないSAE文書のペアよりも分岐勾配の更新を誘導し、モデルが非関連なSAE文書よりも意味的に等価な方言コンテンツを見つけるのが困難であることを示す。
訓練後、報酬モデルは文脈的、不安定な方言嗜好を示し、孤立したAAVE排他トークンにSAE排他トークンよりも高い値を割り当て、完全な推論コンテキストはタスクおよびモデル依存の方言罰を受ける。
総じて, 方言税は, 独立した一段階ではなく, 言語モデリングプロセスのあらゆる段階において, 符号化され, 蓄積されることが示唆された。
関連論文リスト
- Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models [27.16462631523899]
音声言語モデル(SLM)は、大規模言語モデル(LLM)と音声処理コンポーネントを統合する。
本研究では,日本語方言を用いたSLMとLSMの方言的堅牢性について検討した。
実験の結果,SLMのロバスト性はテキストベースと相関していることがわかった。
論文 参考訳(メタデータ) (2026-06-24T05:57:45Z) - IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation [88.98544786373212]
既存の文表現は主に、その表現方法ではなく、ある文が何を言っているかを符号化する。
本研究は,意味内容から分離したスタイルと方言をキャプチャする文表現を開発する。
IDIOLEX(IDIOLEX)は,文の証明から文の内容の言語的特徴までを統括するモデルを訓練するためのフレームワークである。
論文 参考訳(メタデータ) (2026-04-06T14:17:24Z) - Tokens with Meaning: A Hybrid Tokenization Approach for NLP [0.2826977330147589]
自然言語処理(NLP)におけるトークン化の役割
規則に基づく形態素解析と統計的サブワードセグメンテーションを組み合わせたハイブリッドトークン化フレームワークを提案する。
本手法は, 音韻正規化, ルートアフィックス, および形態素保存と語彙効率のバランスをとる新しいアルゴリズムを用いる。
論文 参考訳(メタデータ) (2025-08-19T22:17:42Z) - ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models [70.56468982313834]
本稿では,韻律学習に適した単純なトークン化方式であるProsodyLMを提案する。
ProsodyLMは事前学習だけで驚くほど多様なプロソディ処理能力を学習できることがわかった。
論文 参考訳(メタデータ) (2025-07-27T00:59:01Z) - Languages in Multilingual Speech Foundation Models Align Both Phonetically and Semantically [58.019484208091534]
事前訓練された言語モデル(LM)における言語間アライメントは、テキストベースのLMの効率的な転送を可能にしている。
テキストに基づく言語間アライメントの発見と手法が音声に適用されるかどうかについては、未解決のままである。
論文 参考訳(メタデータ) (2025-05-26T07:21:20Z) - Pixel Sentence Representation Learning [67.4775296225521]
本研究では,視覚表現学習プロセスとして,文レベルのテキスト意味論の学習を概念化する。
タイポスや単語順シャッフルのような視覚的に接地されたテキスト摂動法を採用し、人間の認知パターンに共鳴し、摂動を連続的に認識できるようにする。
我々のアプローチは、大規模に教師なしのトピックアライメントトレーニングと自然言語推論監督によってさらに強化されている。
論文 参考訳(メタデータ) (2024-02-13T02:46:45Z) - The Interpreter Understands Your Meaning: End-to-end Spoken Language
Understanding Aided by Speech Translation [13.352795145385645]
音声翻訳(ST)は、エンドツーエンドの音声言語理解のために、音声モデルを事前訓練する良い方法である。
我々は,本モデルが単言語および多言語意図分類に基づくベースラインよりも高い性能を達成することを示す。
また、音声要約のための新しいベンチマークデータセットを作成し、低リソース/ゼロショットを英語からフランス語またはスペイン語に転送する。
論文 参考訳(メタデータ) (2023-05-16T17:53:03Z) - Towards Language Modelling in the Speech Domain Using Sub-word
Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。
限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。
補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文 参考訳(メタデータ) (2021-10-31T22:48:30Z) - Provable Limitations of Acquiring Meaning from Ungrounded Form: What
will Future Language Models Understand? [87.20342701232869]
未知のシステムが意味を習得する能力について検討する。
アサーションによってシステムが等価性のような意味関係を保存する表現をエミュレートできるかどうか検討する。
言語内のすべての表現が参照的に透明であれば,アサーションによってセマンティックエミュレーションが可能になる。
しかし、言語が変数バインディングのような非透過的なパターンを使用する場合、エミュレーションは計算不能な問題になる可能性がある。
論文 参考訳(メタデータ) (2021-04-22T01:00:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。