論文の概要: Representational Equality in Cross-country Value Simulation: A Systematic Analysis of Large Language Models
- arxiv url: http://arxiv.org/abs/2608.08058v1
- Date: Sat, 08 Aug 2026 10:53:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.62835
- Title: Representational Equality in Cross-country Value Simulation: A Systematic Analysis of Large Language Models
- Title(参考訳): クロスカントリー価値シミュレーションにおける表現平等:大規模言語モデルの体系的解析
- Authors: Xiaowen Jian, Xinyi Mou, Daisong Gong, Chen Qian, Huimin Chen, Maosong Sun,
- Abstract要約: 大規模言語モデル(LLM)は、人間の意見をシミュレートするためのスケーラブルなプロキシとして機能する。
不均一なシミュレーション精度は、下流のアプリケーションにおける社会的バイアスを再現または増幅することができる。
本研究は、59か国における国レベルの表現平等を体系的に検討する。
- 参考スコア(独自算出の注目度): 46.49379509882212
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Traditional methods for studying human opinions often struggle to support representative and scalable research across countries. Large language models (LLMs) can serve as scalable proxies for simulating human opinions, enabling more efficient opinion analysis. However, this use of LLMs requires not only high average accuracy but also representational equality, that is, comparable simulation accuracy across populations. Uneven simulation accuracy may reproduce or amplify societal biases in downstream applications. This study systematically investigates country-level representational equality across 59 countries and finds substantial, systematic inequality. Populations from wealthier and more technologically advanced countries are simulated more accurately. We further compare two foundational intervention pathways, contextual adaptation and parametric modification, and show that improvements in average or target-group accuracy do not necessarily translate into greater representational equality. For contextual adaptation, native-language prompting generally improves accuracy but remains model-dependent, whereas additional information more often improves both accuracy and equality. For parametric modification, language-specific continued post-training improves accuracy for targeted language groups but unevenly, while preference alignment yields no systematic gains in accuracy or equality. Human-annotated preference data generally preserve accuracy better than AI-annotated data. These findings highlight the need for representational equality alongside accuracy and offer guidance for more inclusive, socially responsible LLM-based simulations.
- Abstract(参考訳): 人間の意見を研究する伝統的な手法は、国全体の代表的かつスケーラブルな研究を支援するのに苦労することが多い。
大規模言語モデル(LLM)は、人間の意見をシミュレートするためのスケーラブルなプロキシとして機能し、より効率的な意見分析を可能にする。
しかし、この LLM の使用には、高い平均精度だけでなく、表現的等式、すなわち人口間でのシミュレーションの精度も必要である。
不均一なシミュレーション精度は、下流のアプリケーションにおける社会的バイアスを再現または増幅することができる。
本研究は、59か国における国レベルの表現平等を体系的に検討し、実質的かつ体系的な不平等を見いだす。
より富裕で技術的に進んだ国の人口は、より正確にシミュレートされている。
さらに、文脈適応とパラメトリック修正の2つの基本的な介入経路を比較し、平均または目標群精度の改善が必ずしも表現的平等に変換されないことを示す。
文脈適応では、ネイティブ言語のプロンプトは一般的に精度を向上するが、モデルに依存しない。
パラメトリックな修正では、言語固有のポストトレーニングにより、ターゲット言語グループの精度は向上するが、好みのアライメントは正確性や平等性において体系的な利得を得られない。
ヒューマンアノテートされた好みデータは、一般的にAIアノテートされたデータよりも正確さを保っている。
これらの知見は、精度とともに表現的平等の必要性を強調し、より包括的で社会的に責任を負うLCMに基づくシミュレーションのためのガイダンスを提供する。
関連論文リスト
- Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment [75.88231994139132]
GPT-4.1のような最先端モデルでさえ、モーダル選好を予測する精度は57.4%に過ぎなかった。
モデルでは、若者、男性、中国人、キリスト教のペルソナをよりうまくエミュレートする。
論文 参考訳(メタデータ) (2026-04-14T15:06:13Z) - Framework for Machine Evaluation of Reasoning Completeness in Large Language Models For Classification Tasks [0.0]
本稿では、説明の完全性のためのRAS-Reasoning Alignmentを紹介する。
我々は,広く使用されている4つのテキスト分類データセット,WIKI ONTOLOGY, AG NEWS, IMDB, GOEMOTIONSを分析した。
正解予測はサポート特徴のカバレッジが高く,正解予測は矛盾する特徴のカバレッジの増大と関連していることを示す。
論文 参考訳(メタデータ) (2025-10-23T20:22:22Z) - Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning [77.120955854093]
我々は,データ多様性が言語モデルにおける一般化の強力な予測因子であることを示す。
モデル誘起勾配のエントロピーを通して多様性を定量化する計量であるG-Vendiを導入する。
多様な合成データを生成するためのフレームワークであるPrismatic Synthesisを提案する。
論文 参考訳(メタデータ) (2025-05-26T16:05:10Z) - Designing Domain-Specific Large Language Models: The Critical Role of Fine-Tuning in Public Opinion Simulation [0.0]
本稿では,英国家庭縦断研究の社会デマトグラフィーデータを統合した,新しい微調整手法を提案する。
多様な合成プロファイルをエミュレートすることで、微調整されたモデルは、事前訓練されたモデルよりも大幅に優れている。
より広範な意味は、医療や教育などの分野にLLMをデプロイすること、包括的でデータ駆動型意思決定を促進することである。
論文 参考訳(メタデータ) (2024-09-28T10:39:23Z) - Identifying and Mitigating Social Bias Knowledge in Language Models [52.52955281662332]
個々人の社会的偏見をきめ細かなキャリブレーションを可能にする新しいデバイアス・アプローチであるFairness Stamp(FAST)を提案する。
FASTは最先端のベースラインを超え、デバイアス性能が優れている。
これは、大きな言語モデルにおける公平性を達成するためのきめ細かいデバイアス戦略の可能性を強調している。
論文 参考訳(メタデータ) (2024-08-07T17:14:58Z) - Uncertainty Aware Learning for Language Model Alignment [97.36361196793929]
異なるタスクシナリオのモデルアライメントを改善するために,不確実性認識学習(UAL)を提案する。
トレーニングのラベルの平滑化値を個々のサンプルの不確実性に応じて適応的に設定する。
広く使われているベンチマーク実験では、我々のUALは標準教師あり微調整よりも著しく優れています。
論文 参考訳(メタデータ) (2024-06-07T11:37:45Z) - Measuring Social Biases in Masked Language Models by Proxy of Prediction Quality [0.0]
トランスフォーマーモデルは、様々な自然言語タスクに対して最先端のパフォーマンスを達成したが、望ましくないバイアスを符号化することが示されている。
本研究では,トランスフォーマーモデルの予測の質を評価するために,提案するプロキシ関数を用いて,マスク付き言語モデリングの目的を訓練したトランスフォーマーによって符号化された社会的バイアスを評価する。
我々は,すべてのモデルが社会的偏見をエンコードしているのを見出した。ベンチマークデータセットを用いた他の評価手法による偏見推定と比較する。
論文 参考訳(メタデータ) (2024-02-21T17:33:13Z) - Learning Optimal Fair Classification Trees: Trade-offs Between
Interpretability, Fairness, and Accuracy [7.215903549622416]
最適分類木を学習するための混合整数最適化フレームワークを提案する。
我々は、一般的なデータセットの公平な分類のための最先端アプローチに対して、我々の手法をベンチマークする。
我々の手法は、ほぼ完全に一致した決定を一貫して見つけ出すが、他の手法は滅多にない。
論文 参考訳(メタデータ) (2022-01-24T19:47:10Z) - Towards Understanding and Mitigating Social Biases in Language Models [107.82654101403264]
大規模事前訓練言語モデル(LM)は、望ましくない表現バイアスを示すのに潜在的に危険である。
テキスト生成における社会的バイアスを軽減するためのステップを提案する。
我々の経験的結果と人的評価は、重要な文脈情報を保持しながらバイアスを緩和する効果を示す。
論文 参考訳(メタデータ) (2021-06-24T17:52:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。