論文の概要: \textit{Versteasch du mi?} Computational and Socio-Linguistic Perspectives on GenAI, LLMs, and Non-Standard Language
- arxiv url: http://arxiv.org/abs/2603.28213v1
- Date: Mon, 30 Mar 2026 09:34:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.322652
- Title: \textit{Versteasch du mi?} Computational and Socio-Linguistic Perspectives on GenAI, LLMs, and Non-Standard Language
- Title(参考訳): GenAI, LLMs, 非標準言語に関する計算的・社会言語学的考察
- Authors: Verena Platzgummer, John McCrae, Sina Ahmadi,
- Abstract要約: 大規模言語モデルと生成的人工知能は、より難解な言語に「不公平」であり、デジタル言語分割の深化を図っている。
本稿では,これらの技術が「モノリス的,モノリンガル的,統語的,統語論的に標準化された意味体系」として言語認識を悪化させていることを論じる。
南チロル方言はイタリア・南チロルの非公式なコミュニケーションに広く用いられているが、クルド語の変種は、GenAIと言語的変動と標準化の交差点を学際的に探究するための出発点である。
- 参考スコア(独自算出の注目度): 2.6461502412805062
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The design of Large Language Models and generative artificial intelligence has been shown to be "unfair" to less-spoken languages and to deepen the digital language divide. Critical sociolinguistic work has also argued that these technologies are not only made possible by prior socio-historical processes of linguistic standardisation, often grounded in European nationalist and colonial projects, but also exacerbate epistemologies of language as "monolithic, monolingual, syntactically standardized systems of meaning". In our paper, we draw on earlier work on the intersections of technology and language policy and bring our respective expertise in critical sociolinguistics and computational linguistics to bear on an interrogation of these arguments. We take two different complexes of non-standard linguistic varieties in our respective repertoires--South Tyrolean dialects, which are widely used in informal communication in South Tyrol, Italy, as well as varieties of Kurdish--as starting points to an interdisciplinary exploration of the intersections between GenAI and linguistic variation and standardisation. We discuss both how LLMs can be made to deal with nonstandard language from a technical perspective, and whether, when or how this can contribute to "democratic and decolonial digital and machine learning strategies", which has direct policy implications.
- Abstract(参考訳): 大規模言語モデルと生成人工知能の設計は、より難解な言語に対して「不公平」であり、デジタル言語分割の深化を図っている。
批判的社会言語学の研究は、これらの技術は、しばしばヨーロッパのナショナリストや植民地のプロジェクトに根ざした、言語標準化の社会史的なプロセスによって実現されるだけでなく、「モノリシック、モノリンガル、統語論的に標準化された意味体系」として言語の認識を悪化させると主張している。
本稿では,技術と言語政策の共通点に関する初期の研究を取り上げ,批判社会言語学と計算言語学の専門知識を,これらの議論の尋問に生かした。
南チロル方言はイタリア・南チロルの非公式なコミュニケーションに広く用いられているが、クルド語の変種は、GenAIと言語的変動と標準化の交差点を学際的に探究するための出発点である。
技術的観点から、LLMが非標準言語にどう対応できるか、そして、それが直接的な政策的な意味を持つ「民主的かつ非植民地的デジタルおよび機械学習戦略」にどのように貢献できるかを論じる。
関連論文リスト
- Breaking Boundaries: Investigating the Effects of Model Editing on Cross-linguistic Performance [6.907734681124986]
本稿では,多言語文脈における知識編集技術を検討することにより,言語的平等の必要性を戦略的に識別する。
Mistral, TowerInstruct, OpenHathi, Tamil-Llama, Kan-Llamaなどのモデルの性能を,英語,ドイツ語,フランス語,イタリア語,スペイン語,ヒンディー語,タミル語,カンナダ語を含む言語で評価した。
論文 参考訳(メタデータ) (2024-06-17T01:54:27Z) - Standard Language Ideology in AI-Generated Language [1.2815904071470705]
標準言語イデオロギーは、大言語モデル(LLM)によって生成された言語に反映され、強化される
我々は、AI生成言語における標準言語イデオロギーがどのように現れるかを示す、オープンな問題の表層分類を提示する。
論文 参考訳(メタデータ) (2024-06-13T01:08:40Z) - What Do Dialect Speakers Want? A Survey of Attitudes Towards Language Technology for German Dialects [60.8361859783634]
我々はドイツ語に関連する方言と地域言語に関する話者を調査した。
回答者は特に、方言入力で動作する潜在的なNLPツールを好んでいる。
論文 参考訳(メタデータ) (2024-02-19T09:15:28Z) - Quantifying the Dialect Gap and its Correlates Across Languages [69.18461982439031]
この研究は、明らかな相違を明らかにし、マインドフルなデータ収集を通じてそれらに対処する可能性のある経路を特定することによって、方言NLPの分野を強化する基盤となる。
論文 参考訳(メタデータ) (2023-10-23T17:42:01Z) - Towards Bridging the Digital Language Divide [4.234367850767171]
多言語言語処理システムは、しばしばハードワイヤで、通常不随意で、特定の言語に対して隠された表現的嗜好を示す。
偏りのある技術は、しばしば表現される言語の複雑さに不公平な研究・開発手法の結果であることを示す。
我々は,技術設計と方法論の両面から,言語バイアスを減らすことを目的とした新しいイニシアティブを提案する。
論文 参考訳(メタデータ) (2023-07-25T10:53:20Z) - Discovering Representation Sprachbund For Multilingual Pre-Training [139.05668687865688]
多言語事前学習モデルから言語表現を生成し、言語分析を行う。
すべての対象言語を複数のグループにクラスタリングし、表現のスプラックバンドとして各グループに名前を付ける。
言語間ベンチマークで実験を行い、強いベースラインと比較して大幅な改善が達成された。
論文 参考訳(メタデータ) (2021-09-01T09:32:06Z) - AM2iCo: Evaluating Word Meaning in Context across Low-ResourceLanguages
with Adversarial Examples [51.048234591165155]
本稿では, AM2iCo, Adversarial and Multilingual Meaning in Contextを提案する。
言語間文脈における単語の意味の同一性を理解するために、最先端(SotA)表現モデルを忠実に評価することを目的としている。
その結果、現在のSotAプリトレーニングエンコーダは人間のパフォーマンスにかなり遅れていることが明らかとなった。
論文 参考訳(メタデータ) (2021-04-17T20:23:45Z) - Crossing the Conversational Chasm: A Primer on Multilingual
Task-Oriented Dialogue Systems [51.328224222640614]
大規模な学習済みニューラルネットワークモデルに基づく最新のTODモデルは、データ空腹です。
ToDのユースケースのデータ取得は高価で面倒だ。
論文 参考訳(メタデータ) (2021-04-17T15:19:56Z) - Bridging Linguistic Typology and Multilingual Machine Translation with
Multi-View Language Representations [83.27475281544868]
特異ベクトル標準相関解析を用いて、各情報源からどのような情報が誘導されるかを調べる。
我々の表現は類型学を組み込み、言語関係と相関関係を強化する。
次に、多言語機械翻訳のための多視点言語ベクトル空間を利用して、競合する全体的な翻訳精度を実現する。
論文 参考訳(メタデータ) (2020-04-30T16:25:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。