論文の概要: When AI Writes, Whose Voice Remains? Quantifying Cultural Marker Erasure Across World English Varieties in Large Language Models
- arxiv url: http://arxiv.org/abs/2602.22145v1
- Date: Wed, 25 Feb 2026 17:54:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-26 18:19:16.936167
- Title: When AI Writes, Whose Voice Remains? Quantifying Cultural Marker Erasure Across World English Varieties in Large Language Models
- Title(参考訳): AIが書き残されるとき、誰が音声を残せるか? 大規模言語モデルにおける世界各国の英語の文化マーカーの消去を定量化する
- Abstract要約: 文化ゴースト(Cultural Ghosting)とは、テキスト処理において、非ネイティブな英語の品種に特有の言語マーカーを体系的に消去することである。
我々はこの現象を、IER(Identity Erasure Rate)とSPS(Semantic Preservation Score)の2つの新しい指標を用いて定量化する。
本実験は, 明示的な文化的保存により, セマンティック品質を犠牲にすることなく, 消毒を29%削減できることを実証した。
- 参考スコア(独自算出の注目度): 6.821769033209393
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are increasingly used to ``professionalize'' workplace communication, often at the cost of linguistic identity. We introduce "Cultural Ghosting", the systematic erasure of linguistic markers unique to non-native English varieties during text processing. Through analysis of 22,350 LLM outputs generated from 1,490 culturally marked texts (Indian, Singaporean,& Nigerian English) processed by five models under three prompt conditions, we quantify this phenomenon using two novel metrics: Identity Erasure Rate (IER) & Semantic Preservation Score (SPS). Across all prompts, we find an overall IER of 10.26%, with model-level variation from 3.5% to 20.5% (5.9x range). Crucially, we identify a Semantic Preservation Paradox: models maintain high semantic similarity (mean SPS = 0.748) while systematically erasing cultural markers. Pragmatic markers (politeness conventions) are 1.9x more vulnerable than lexical markers (71.5% vs. 37.1% erasure). Our experiments demonstrate that explicit cultural-preservation prompts reduce erasure by 29% without sacrificing semantic quality.
- Abstract(参考訳): 大規模言語モデル (LLMs) は、職場でのコミュニケーションを「専門化」するために、しばしば言語的アイデンティティーの犠牲として使われるようになっている。
テキスト処理中に非ネイティブな英語品種に特有の言語マーカーを系統的に消去する「カルチャー・ゴーストリング」を導入する。
文化的にマークされた1,490個のテキスト(インド、シンガポール、ナイジェリア英語)を3つの迅速な条件下で処理した22,350個のLCM出力の分析を通じて、この現象を2つの新しい指標であるIER(Identity Erasure Rate)とSPS(Semantic Preservation Score)を用いて定量化する。
すべてのプロンプト全体で、全体的なIERは10.26%で、モデルレベルの変化は3.5%から20.5%(5.9倍)である。
モデルは、文化的マーカーを体系的に消去しながら、高い意味的類似性(SPS = 0.748)を維持する。
実用マーカー(政治慣習)は、語彙マーカーよりも1.9倍脆弱である(71.5%対37.1%の消去)。
本実験は, 明示的な文化的保存により, セマンティック品質を犠牲にすることなく, 消毒を29%削減できることを実証した。
関連論文リスト
- Evaluating Multilingual Sentence Embeddings for Translation Error Detection:An English--Greek Contrastive Study [0.0]
本研究は,多言語埋め込みモデルが正しい英語-ギリシャ語翻訳を区別できるかどうかを考察する。
10コアに1,850のサンプルと5つの探索エラーカテゴリが含まれている。
埋め込みモデルは、テンソル・アンド・アスペクトや代名詞・基準誤差よりも明確な事実・語彙的変化を確実に検出した。
論文 参考訳(メタデータ) (2026-08-28T18:32:54Z) - On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation [79.18001266925245]
LingT2Iは、33Kプロンプトを持つ10の広く使われている言語をカバーするベンチマークである。
我々は、言語不平等と言語依存のトレードオフを明らかにする包括的な言語間分析を行う。
論文 参考訳(メタデータ) (2026-08-11T14:49:23Z) - Benchmarking Frontier LLMs on Arabic Cultural and Sociolinguistic Knowledge: A Cross-Evaluation Framework with Human SME Ground Truth [0.34797121357690153]
クロス評価フレームワークは、エジプト語とイラク語という2つの未表現のアラビア語方言のコミュニティをインスタンス化した。
提案手法は,母国語話者が作成した103組のプロンプト・ルブリックペアをコントリビュートする。
1,307人の審査員: GPT-5.4は最も信頼できる裁判官(MADj = 10.21 pp, Signed Error = -1.12%)である。
論文 参考訳(メタデータ) (2026-06-30T20:18:32Z) - Characterizing Cultural Localization in AI-Generated Stories [46.04734349145654]
本稿では,テンプレートによるローカライゼーションによって生成したコンテンツの度合いを計測する手法を提案する。
我々は、民族間で物語を区別する語彙的トークンを特定し、それらを取り除いた後に残る物語の類似性を測定する。
我々は、そのステレオタイプと攻撃性の文化的指標を特徴付け、主にグローバル・サウスに位置する19カ国のマーカーが平均攻撃的であることを発見した。
論文 参考訳(メタデータ) (2026-06-12T16:51:52Z) - The Cost of Perfect English: Pragmatic Flattening and the Erasure of Authorial Voice in L2 Writing Supported by GenAI [1.8115445236898322]
我々は、文化的に好まれる丁寧さと権威的スタンスを体系的に消去する「実用的平坦化」について検討する。
発見は、セマンティック保存パラドックス内のニュアンスな「次元のばらつき」を明らかにする。
我々は、多言語作家が言語強化にGenAIを使用することを許可するために、将来の指導は誤り訂正を超えて進めなければならないと論じている。
論文 参考訳(メタデータ) (2026-05-13T06:26:18Z) - The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models [51.61416200800499]
GaoYaoは182.3kサンプル、26言語、51か国/地域からなる総合ベンチマークである。
まず、GaoYao氏は評価タスクを3つの文化階層に分類する統一的なフレームワークを提案する。
第二に、専門家を活用して、主観的なベンチマークを19言語に厳格にローカライズすることで、ネイティブ品質の拡大を実現しています。
第3に,20以上のフラッグシップおよびコンパクトLCMの詳細な診断を行う。
論文 参考訳(メタデータ) (2026-04-22T06:19:46Z) - Nationality encoding in language model hidden states: Probing culturally differentiated representations in persona-conditioned academic text [4.0057643036291815]
本研究では, Gemma-3-4b-itが学術テキストを生成する際に, 隠れ状態の国籍識別情報を符号化するかどうかを検証した。
270のテキストのコーパスが45のプロンプトテンプレートから生成され、2×3の設計で6つのペルソナ条件が交わった。
発見は、探索手法を社会言語学的属性に拡張し、EAPと言語教育に実践的な意味を持つ。
論文 参考訳(メタデータ) (2026-04-11T10:52:05Z) - Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation [58.01855677487771]
本研究では,多言語大言語モデル (MLLM) が,プロンプトの言語変化に伴う不整合性を示すことを示す。
コンセンサス駆動型アライメントフレームワークであるC-3POを提案する。
C-3POは、非整合モデルよりも0.10ポイントの$_S$を絶対的に増加させ、強力なプロンプトと表現のステアリングベースラインを上回る。
論文 参考訳(メタデータ) (2026-04-02T14:04:06Z) - "Be My Cheese?": Cultural Nuance Benchmarking for Machine Translation in Multilingual LLMs [0.0]
本稿では,機械翻訳における文化的ローカライゼーションを評価するための大規模評価ベンチマークを提案する。
言語毎に5つのネイティブスピーカーレーダを持つ15言語を対象に,多言語大言語モデル (LLM) を7つ評価した。
GPT-5 (2.10/3)、Claude Sonnet 3.7 (1.97/3)、Mistral Medium 3.1 (1.84/3)は破滅的な失敗が少ない最強の層である。
論文 参考訳(メタデータ) (2026-02-04T16:35:48Z) - Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses [28.3173238194554]
CEDARは、文化的にアンダーラインのscElicited underlinetextscDistinct underlinetextscAffective underlinetextscResponsesをキャプチャするシナリオから構築されたベンチマークである。
その結果得られたベンチマークは、7つの言語に10,962のインスタンスと14のきめ細かい感情カテゴリで構成され、各言語には400のマルチモーダルと1,166のテキストのみのサンプルが含まれている。
論文 参考訳(メタデータ) (2026-01-19T13:04:26Z) - Understanding Emotion in Discourse: Recognition Insights and Linguistic Patterns for Generation [0.36980845568339205]
認識のための10シード評価を併用した厳格なアブレーション試験を行った。
言語分析では,5,286件の談話マーカーを解析する。
感情とマーカー位置の有意な関連性を見いだす。
論文 参考訳(メタデータ) (2026-01-01T02:49:44Z) - Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish [12.286855282078305]
GPT-4o, GPT-4, Claude3.5Sonnet, LLaMA3.1, MistralLarge2, LLaMA-2Chat13B, Mistral7B Instructを評価した。
我々のベンチマークは、オープンドメイン質問応答、文書要約、英語からXへの翻訳、文化的根拠のある対話の4つのタスクにまたがっている。
論文 参考訳(メタデータ) (2025-11-05T22:09:53Z) - DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation [111.94720088481614]
多モーダル生成モデルは方言テキスト入力を効果的に生成できるのか?
6つの共通英語方言にまたがる大規模ベンチマークを構築した。
マルチモーダル生成モデルのための一般的なエンコーダに基づく緩和戦略を設計する。
論文 参考訳(メタデータ) (2025-10-16T17:56:55Z) - COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes [83.84578306665976]
大規模な言語モデルは、創造的な文章、特に非英語の文脈において体系的な欠陥を示す。
提案するCOIG-Writerは,多種多様なアウトプットと,その基盤となる思考プロセスの両方をキャプチャする,中国のクリエイティブな文章データセットである。
論文 参考訳(メタデータ) (2025-10-16T15:01:19Z) - How Well Do LLMs Imitate Human Writing Style? [2.3754840025365183]
大規模言語モデル(LLM)は、流動的なテキストを生成することができるが、特定の人間の作者の独特のスタイルを再現する能力は、まだ不明である。
著者の検証とスタイルの模倣分析のための,高速かつトレーニング不要なフレームワークを提案する。
学術エッセイでは97.5%、クロスドメイン評価では94.5%の精度を達成している。
論文 参考訳(メタデータ) (2025-09-29T15:34:40Z) - MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation [86.7047714187813]
MMLU-ProXは29の言語をカバーするベンチマークであり、英語のベンチマーク上に構築されている。
それぞれの言語バージョンは11,829の同一の質問で構成されており、直接言語間比較を可能にする。
効率的な評価ニーズを満たすため,言語毎の質問数は658件である。
論文 参考訳(メタデータ) (2025-03-13T15:59:20Z) - Beyond No: Quantifying AI Over-Refusal and Emotional Attachment Boundaries [0.0]
大規模言語モデル(LLM)における感情境界処理を評価するためのオープンソースのベンチマークと評価フレームワークを提案する。
パターンマッチング応答解析により,3つのLLMを適切な感情境界を維持する能力で評価した。
本フレームワークは, 直接拒絶, 謝罪, 説明, 偏向, 認知, 境界設定, 感情認識の7つの主要なパターンにまたがる応答を定量化する。
論文 参考訳(メタデータ) (2025-02-20T19:09:40Z) - NusaWrites: Constructing High-Quality Corpora for Underrepresented and
Extremely Low-Resource Languages [54.808217147579036]
インドネシアの地方言語について事例研究を行う。
データセット構築におけるオンラインスクラップ,人文翻訳,および母語話者による段落作成の有効性を比較した。
本研究は,母語話者による段落作成によって生成されたデータセットが,語彙的多様性と文化的内容の点で優れた品質を示すことを示す。
論文 参考訳(メタデータ) (2023-09-19T14:42:33Z) - We're Afraid Language Models Aren't Modeling Ambiguity [136.8068419824318]
あいまいさの管理は人間の言語理解の重要な部分です。
文中のあいまいさは,他の文との係り受け関係に与える影響によって特徴付けられる。
我々は,多ラベルNLIモデルが曖昧さによって誤解を招く野生の政治的主張にフラグを付けることができることを示す。
論文 参考訳(メタデータ) (2023-04-27T17:57:58Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - Few-shot Learning with Multilingual Language Models [66.49496434282564]
多様な言語群をカバーするバランスの取れたコーパス上で,多言語の自動回帰言語モデルを訓練する。
私たちの最大のモデルは、20以上の代表言語で数ショットの学習において、新しい最先端の技術を定めています。
本稿では,モデルがどこで成功し,失敗するかを詳細に分析し,特に言語間の文脈内学習を可能にすることを示す。
論文 参考訳(メタデータ) (2021-12-20T16:52:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。