論文の概要: Cultural Misalignment in Large Language Models: Detection, Measurement, and Mitigation Through Targeted Fine-Tuning
- arxiv url: http://arxiv.org/abs/2609.04485v1
- Date: Thu, 03 Sep 2026 21:11:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.821344
- Title: Cultural Misalignment in Large Language Models: Detection, Measurement, and Mitigation Through Targeted Fine-Tuning
- Title(参考訳): 大規模言語モデルにおける文化的相違--ターゲットとした微調整による検出・測定・緩和
- Abstract要約: 3か国で63人の人口統計者を対象に,世界価値調査ウェーブ7データに対して3つのオープンウェイトLDMを評価した。
中国製のQwen3-4Bは、中国国内では最悪だ。
異文化間バイアス軽減のためのLoRAファインチューニングによる最悪の人口動態をターゲットにした最初の研究である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We evaluate three open-weight LLMs (Gemma3-12B from the USA, Bielik-11B-v3 from Poland, and Qwen3-4B from China) against World Values Survey Wave 7 data for 63 demographic personas across three countries, using normalized Wasserstein distance to quantify distributional misalignment. Contrary to expectations, no model favors its home country: the Chinese-built Qwen3-4B performs worst on its own Chinese population (W1 = 0.436, the highest misalignment in the entire model x country matrix). Targeted LoRA fine-tuning on the five worst-case personas, requiring fewer than 1,200 training pairs and under 15 minutes on a single GPU, reduces bias by 16.8% for Bielik-11B (p_Bonf = 0.002, d = -4.4) with all five targets improving. However, country-level decomposition reveals that fine-tuning redistributes rather than removes bias: Bielik's worst-case personas swap entirely from American to Chinese elderly, with zero overlap between pre- and post-correction sets. To our knowledge, this is the first study to target worst-case demographic personas with LoRA fine-tuning for cross-cultural bias mitigation.
- Abstract(参考訳): 我々は、3つのオープンウェイトLDM(米国Gemma3-12B、ポーランドBielik-11B-v3、中国Qwen3-4B)を3つの国で63人の人口動態に関する調査波7データに対して評価し、正規化ワッサーシュタイン距離を用いて分布不整合の定量化を行った。
予想に反して、中国製のQwen3-4Bは自国の中国人口で最悪(W1 = 0.436)である。
5つの最悪のペルソナをターゲットとしたLoRAの微調整は、1200組未満のトレーニングペアを1つのGPUで15分以下で行うことができ、バイアスを16.8%減らす(p_Bonf = 0.002, d = -4.4)。
しかし、国レベルでの分解では、偏見をなくすのではなく微調整された再編成が示される:ビエリクの最悪の人格は、アメリカ人から中国人の高齢者と完全に入れ替わるものであり、事前修正セットと後修正セットの重複はゼロである。
われわれの知る限り、この研究はLoRAによる異文化間の偏見緩和のための微調整による最悪の人口動態をターゲットにした初めての研究である。
関連論文リスト
- Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Anchoring LLM Gender Bias to Human Baselines: A Cross-Lingual Audit [0.9699640804685629]
我々は、英語、韓国語、中国語、日本語で性別ステレオタイピングのための6つの大きな言語モデルを評価する。
以上の結果から, ステレオタイピングはヒトのクロスカントリーの約2.5倍の範囲に及んでいることが明らかとなった。
韓国語で促された英語中心のモデルは、候補者が既に雇われていると表明した場合でも、現地のベースラインの5倍に達した。
論文 参考訳(メタデータ) (2026-05-29T03:45:24Z) - LegalBench-BR: A Benchmark for Evaluating Large Language Models on Brazilian Legal Decision Classification [0.0]
ブラジルの法律テキスト分類における言語モデル評価のための最初の公開ベンチマークであるLegalBench-BRを紹介する。
データセットは、サンタカタリーナ州裁判所(TJSC)による3,105の手続きからなる。
クラスバランステストセットでは、BERTimbau-LoRAは87.6%の精度と0.87のマクロF1を達成する(Claude 3.5 Haikuより+22pp、GPT-4o miniより+28pp)。
論文 参考訳(メタデータ) (2026-04-20T22:00:02Z) - Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment [75.88231994139132]
GPT-4.1のような最先端モデルでさえ、モーダル選好を予測する精度は57.4%に過ぎなかった。
モデルでは、若者、男性、中国人、キリスト教のペルソナをよりうまくエミュレートする。
論文 参考訳(メタデータ) (2026-04-14T15:06:13Z) - ALIGN: Word Association Learning for Cross-Cultural Generalization in Large Language Models [0.8999666725996975]
文化的な知識が限られているため、文化をモデル化し、調整することは依然として課題である。
本稿では,母語話者の自由な単語連想規範をパラメータ効率で微調整する手法を提案する。
私たちの研究は、数百万の文化に根ざした協会が、コストのかかる再トレーニングなしに価値アライメントを組み込むことができることを示している。
論文 参考訳(メタデータ) (2025-08-19T00:55:20Z) - Obscured but Not Erased: Evaluating Nationality Bias in LLMs via Name-Based Bias Benchmarks [0.0]
大きな言語モデル(LLM)は、明示的な人口統計マーカーが存在しない場合でも、特定の国籍に対する潜在バイアスを示す。
文化的に表象的な名前で明示的な国籍ラベルを置換することの影響を調査するために,新しい名称ベースのベンチマーク手法を導入する。
私たちの実験では、小さなモデルの方が精度が低く、大きなモデルに比べてバイアスが大きいことが示されています。
論文 参考訳(メタデータ) (2025-07-22T19:54:49Z) - Dissecting Human and LLM Preferences [80.55271307662365]
人間は誤りに敏感ではなく、自分の姿勢を支持する反応を好んでおり、モデルが限界を認めている場合、明確な嫌悪を示します。
GPT-4-Turboのような先進的なLCMは、より正確さ、明快さ、無害さを強調している。
嗜好に基づく評価は意図的に操作可能であることを示す。
論文 参考訳(メタデータ) (2024-02-17T14:34:31Z) - What Do Llamas Really Think? Revealing Preference Biases in Language
Model Representations [62.91799637259657]
大規模言語モデル(LLMs)は、応答を辞退しても、社会的な偏見を示すか?
本研究は,文脈的埋め込みを探索し,このバイアスが潜在表現にエンコードされているかどうかを探索することによって検討する。
単語の隠れベクトルからLLMの単語ペア選好を予測するロジスティックなBradley-Terryプローブを提案する。
論文 参考訳(メタデータ) (2023-11-30T18:53:13Z) - CBBQ: A Chinese Bias Benchmark Dataset Curated with Human-AI
Collaboration for Large Language Models [52.25049362267279]
本稿では,人的専門家と生成言語モデルによって共同で構築された100万以上の質問からなる中国語バイアスベンチマークデータセットを提案する。
データセットのテストインスタンスは、手作業による厳格な品質管理を備えた3K以上の高品質テンプレートから自動的に抽出される。
大規模な実験により、データセットがモデルバイアスを検出することの有効性が実証された。
論文 参考訳(メタデータ) (2023-06-28T14:14:44Z) - KoSBi: A Dataset for Mitigating Social Bias Risks Towards Safer Large
Language Model Application [45.3863281375947]
大規模言語モデル(LLM)は、自然テキスト生成能力だけでなく、現実世界のデータから異なる人口集団に対する社会的偏見も学習する。
既存の研究や資源は、言語や文化の違いから、韓国では容易には適用できない。
我々は,韓国における34k対の文脈と文からなる新しい社会的バイアスデータセット KO SB I を15のカテゴリーで72の人口集団をカバーした。
論文 参考訳(メタデータ) (2023-05-28T12:07:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。