論文の概要: Large language models underestimate and partly misrepresent cultural variation in everyday norms
- arxiv url: http://arxiv.org/abs/2609.30896v1
- Date: Fri, 25 Sep 2026 07:04:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.263633
- Title: Large language models underestimate and partly misrepresent cultural variation in everyday norms
- Title(参考訳): 日常の規範における文化的変化の過小評価と部分的には誤表現の大きい言語モデル
- Abstract要約: 大きな言語モデル(LLM)は、日常の規範における文化的な違いをどの程度正確に表現できるか?
我々は最近のGlobal Study of Everyday Norms(GSEN)を用いて90の社会で150のシナリオのレーティングを収集した。
より発達した社会の規範は、ある程度正確に見積もられる傾向にあった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A key aspect of culture is a society's norms about everyday behavior. How accurately do large language models (LLMs) represent cultural differences in such norms? To answer this question we used the recent Global Study of Everyday Norms (GSEN), which collected ratings of 150 scenarios in 90 societies, as the human benchmark. We prompted GPT-5 to estimate each society's average rating for every scenario, and later repeated the benchmark in three other LLMs: GPT-5.4, Claude Opus 4.6, and Gemini 3.1 Pro. Compared to GSEN estimates, all four LLMs misrepresented cultural variation in two ways. First, they greatly underestimated its magnitude, estimating differences between societies to be, on average, less than half their measured size. Second, for many scenarios the LLMs poorly identified the pattern of variation, that is, which societies judged the behavior less acceptable and which societies judged it more acceptable. The pattern of variation was identified better for scenarios that elicit concerns about vulgarity, especially scenarios involving kissing and flirting. We also found that norms in more developed societies tended to be estimated somewhat more accurately, and that prompting in local survey languages rather than English produced only a modest improvement in accuracy. Local-language prompting also reduced, but did not remove, the underestimation of between-society differences. Cultural differences in everyday norms are only weakly and unevenly represented by LLMs.
- Abstract(参考訳): 文化の重要な側面は、日常生活に関する社会の規範である。
大規模言語モデル(LLM)はそのような規範における文化的差異をどの程度正確に表現できるのか?
この質問に答えるために、私たちは90の社会で150のシナリオのレーティングを人間のベンチマークとして収集した最近のGlobal Study of Everyday Norms(GSEN)を使用しました。
我々はGPT-5に各シナリオの平均評価を見積もるよう促し、その後、GPT-5.4、Claude Opus 4.6、Gemini 3.1 Proの3つのLSMでベンチマークを繰り返した。
GSENの推定と比較すると、4つのLSMはいずれも文化的変化を2つの点で誤解している。
第一に、彼らはその大きさを非常に過小評価し、社会間の差を平均して、測定された大きさの半分以下と見積もった。
第二に、多くのシナリオにおいて、LSMは変化のパターン、つまり、社会は行動がより受け入れられないと判断し、社会はそれをより受け入れやすいと判断した。
バラツキのパターンは、華やかさ、特にキスやいびきを含むシナリオを悩ませるシナリオにおいて、よりよく同定された。
また, より発達した社会の規範は, より正確に推定される傾向にあり, 英語よりも現地のサーベイ言語の方が, わずかに精度が向上した。
局所的なプロンプトも減ったが、除去されなかったため、社会性の違いが過小評価された。
日常の規範における文化的差異は、LLMによって弱く不均一にしか表現されない。
関連論文リスト
- Whose Norms? Disentangling Cultural and Personal Alignment in Large Language Models [66.34115263472931]
大規模言語モデルは、文化的規範と個人の嗜好のバランスを必要とする社会的意思決定の状況にますます使われてきている。
PACT(Personal-Preference and Cultural-Norm Trade-off framework)を導入し,モデルが文化的規範に従うか,あるいは個人の嗜好を許容するかを評価する。
PACTに関する5つの国による研究は、人間の文化のフォローは主にシナリオ国によって行われており、参加者が自身の文化的文脈を判断する際の合意は最低であることを示している。
論文 参考訳(メタデータ) (2026-06-05T22:20:30Z) - CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs [59.09971492475217]
TextitCultural Norm Grounded ReasoningのベンチマークであるCultureForestを紹介する。
CultureForestは8つのドメインで5,378のサンプルと53の国/リージョンで構成されている。
大規模な実験では、トップ層モデルでさえ、オープンな設定で大幅に劣化していることが明らかになった。
論文 参考訳(メタデータ) (2026-06-01T08:25:12Z) - Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment [75.88231994139132]
GPT-4.1のような最先端モデルでさえ、モーダル選好を予測する精度は57.4%に過ぎなかった。
モデルでは、若者、男性、中国人、キリスト教のペルソナをよりうまくエミュレートする。
論文 参考訳(メタデータ) (2026-04-14T15:06:13Z) - NormAd: A Framework for Measuring the Cultural Adaptability of Large Language Models [26.64843536942309]
大規模言語モデル(LLM)は、ユーザ価値や文化にアウトプットを適応させる必要があります。
LLMの文化的適応性を評価するための評価フレームワークであるNormAdを紹介する。
我々はNormAd-Etiを作成した。これは、75か国における、社会的な倫理的関連文化規範を表す2.6kの状況記述のベンチマークである。
論文 参考訳(メタデータ) (2024-04-18T18:48:50Z) - Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in
Large Language Models [89.94270049334479]
本稿では,大規模言語モデル(LLM)における文化的優位性について述べる。
LLMは、ユーザーが非英語で尋ねるときに期待する文化とは無関係な、不適切な英語文化関連の回答を提供することが多い。
論文 参考訳(メタデータ) (2023-10-19T05:38:23Z) - NormSAGE: Multi-Lingual Multi-Cultural Norm Discovery from Conversations
On-the-Fly [61.77957329364812]
本稿では,対話型多言語・多文化規範発見の新たな課題に対処する枠組みを提案する。
NormSAGEはノルム発見タスクと会話コンテキストを表す有向質問を通じてノルムに関する知識を導き出す。
さらに、発見される規範が正しいことを保証する自己検証メカニズムにより、言語モデル幻覚のリスクに対処する。
論文 参考訳(メタデータ) (2022-10-16T18:30:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。