論文の概要: MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark
- arxiv url: http://arxiv.org/abs/2607.00724v2
- Date: Thu, 02 Jul 2026 08:49:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 15:16:32.262257
- Title: MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark
- Title(参考訳): MSQA: ネイティブにソースされた多言語および多文化のSimpleQAベンチマーク
- Authors: Xianru Chen, Yukai Huang, Mingxiang Chen, Xinping Lei, Fangbing Deng, Jin Chen, Ge Zhang, Wenhao Huang, Jiaheng Liu,
- Abstract要約: ユーザの言語を話せるモデルは、その言語によってコード化された文化を理解する必要がある。
MSQAは,11の言語グループ,5つの文化的次元,3つの難易度を対象とする,1,064のネイティブソース質問のベンチマークである。
実質的な文化的劣化と顕著な局部性効果を見いだす。
- 参考スコア(独自算出の注目度): 31.67992649991894
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multilingual fluency often invites a stronger assumption: a model that can speak a user's language must also understand the culture encoded by that language. We call this the Illusion of Cultural Alignment. To test this assumption directly, we introduce MSQA, a benchmark of 1,064 natively sourced questions across 11 language groups, five cultural dimensions, and three difficulty tiers. Unlike translated benchmarks, MSQA targets locally grounded knowledge and reduces shortcuts from English-centric cross-lingual transfer. Evaluating 18 LLMs, we find substantial cultural degradation and a pronounced Locality Effect: cultural competence tracks pre-training exposure more closely than general reasoning ability. We further show that common inference-time remedies do not dissolve the illusion. Models remain overconfident on unfamiliar cultural questions, repeated sampling yields unstable rather than reliable correctness, and retrieval augmentation helps unevenly on long-tail facts. These findings indicate that cultural alignment cannot be inferred from multilingual ability alone and requires deeper intervention than calibration, sampling, or retrieval at inference time
- Abstract(参考訳): ユーザの言語を話せるモデルは、その言語によってコード化された文化を理解する必要がある。
これを文化意識の幻想と呼ぶ。
この仮定を直接テストするために,11の言語グループ,5つの文化的次元,3つの難易度からなる1,064のネイティブソース質問のベンチマークであるMSQAを紹介した。
翻訳されたベンチマークとは異なり、MSQAは現地の知識をベースとしており、英語中心の言語間移動によるショートカットを減らす。
文化能力は, 一般の推論能力よりも, 事前学習による露光をより密に追跡する。
さらに、一般的な推論時間の治療法が錯覚を解消しないことを示す。
モデルは、不慣れな文化的問題に過度に自信を持ち、繰り返しサンプリングされる収量は、信頼できる正確性よりも不安定であり、検索の増大は、ロングテールな事実に不均一に寄与する。
これらの結果から,多言語能力のみから文化的アライメントを推定することは不可能であり,推測時の校正,サンプリング,検索よりも深い介入が必要であることが示唆された。
関連論文リスト
- The Masked Advantage: Uncovering Local-Language Access to Cultural Knowledge in LLMs [23.21868527222738]
地域ベンチマークやローカルソースから収集した実世界の文化的質問に基づいて構築された,制御されたフレームワークを使用している。
我々は、文化に依存しない質問に対して、一貫した英語の優位性を見つけ、より強い英語の習熟度を示す。
ローカル言語は、ほとんどすべてのローカライズモデル設定において、肯定的な知識アクセスの優位性を示す。
論文 参考訳(メタデータ) (2026-06-05T16:16:59Z) - CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs [59.09971492475217]
TextitCultural Norm Grounded ReasoningのベンチマークであるCultureForestを紹介する。
CultureForestは8つのドメインで5,378のサンプルと53の国/リージョンで構成されている。
大規模な実験では、トップ層モデルでさえ、オープンな設定で大幅に劣化していることが明らかになった。
論文 参考訳(メタデータ) (2026-06-01T08:25:12Z) - JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors [38.543532383605545]
長文の言語応答における文化的・言語的誤りに関する,7,470のスパンレベルアノテーションのデータセットであるJuICEを提示する。
最強のLDMジャッジでさえ、誤ったスパン検出タスクにおいてF1の0.52しか達成していない。
文化的評価は, 文化的意味の深さと位置を考慮に入れた枠組みに向けて, 表面レベルの検出を超えて, 頑健な文化的評価を行なわなければならないことが示唆された。
論文 参考訳(メタデータ) (2026-05-26T12:45:21Z) - Cross-Lingual Consensus: Aligning Multilingual Cultural Knowledge via Multilingual Self-Consistency [1.338174941551702]
大規模言語モデル(LLM)は、言語間での大幅なパフォーマンスの相違を示す。
本稿では,この知識ギャップを埋める新たな自己教師型フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-21T08:11:01Z) - Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation [58.01855677487771]
本研究では,多言語大言語モデル (MLLM) が,プロンプトの言語変化に伴う不整合性を示すことを示す。
コンセンサス駆動型アライメントフレームワークであるC-3POを提案する。
C-3POは、非整合モデルよりも0.10ポイントの$_S$を絶対的に増加させ、強力なプロンプトと表現のステアリングベースラインを上回る。
論文 参考訳(メタデータ) (2026-04-02T14:04:06Z) - CRaFT: An Explanation-Based Framework for Evaluating Cultural Reasoning in Multilingual Language Models [0.42970700836450487]
CRaFTは,大規模言語モデル(LLM)が文化的文脈にどう影響するかを評価するために設計された,説明に基づく多言語評価フレームワークである。
我々はこの枠組みを、世界価値調査(World Values Survey)から50の文化的根拠のある質問に適用し、アラビア語、ベンガル語、スペイン語に翻訳し、2100以上の回答-説明ペアに対して3つのモデル(GPT、DeepSeek、FANAR)を評価する。
アラビア語は流布を減らし、ベンガル語はそれを強化し、スペイン語は概ね安定している。
論文 参考訳(メタデータ) (2025-10-15T18:49:10Z) - MMA-ASIA: A Multilingual and Multimodal Alignment Framework for Culturally-Grounded Evaluation [91.22008265721952]
MMA-ASIAは、アジア8か国と10か国を対象とする人為的、多言語的、マルチモーダルなベンチマークに重点を置いている。
これは、テキスト、画像(視覚的質問応答)、音声の3つのモードにまたがる入力レベルで整列された最初のデータセットである。
i) 国間の文化的認識格差、(ii) 言語間の整合性、(iii) 言語間の整合性、(iv) 文化知識の一般化、(v) 基礎的妥当性を評価する5次元評価プロトコルを提案する。
論文 参考訳(メタデータ) (2025-10-07T14:12:12Z) - CaLMQA: Exploring culturally specific long-form question answering across 23 languages [58.18984409715615]
CaLMQAは、文化的に異なる23言語にわたる51.7Kの質問のデータセットである。
我々は,LLM生成長文回答の事実性,関連性,表面品質を評価する。
論文 参考訳(メタデータ) (2024-06-25T17:45:26Z) - CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark [68.21939124278065]
言語と文化の豊富なセットをカバーするために設計された、文化的に多言語なビジュアル質問回答ベンチマーク。
CVQAには文化的に駆動されたイメージと、4大陸30カ国の質問が含まれ、31の言語と13のスクリプトをカバーし、合計10万の質問を提供する。
CVQA上で複数のマルチモーダル大言語モデル (MLLM) をベンチマークし、現在の最先端モデルではデータセットが困難であることを示す。
論文 参考訳(メタデータ) (2024-06-10T01:59:00Z) - Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in
Large Language Models [89.94270049334479]
本稿では,大規模言語モデル(LLM)における文化的優位性について述べる。
LLMは、ユーザーが非英語で尋ねるときに期待する文化とは無関係な、不適切な英語文化関連の回答を提供することが多い。
論文 参考訳(メタデータ) (2023-10-19T05:38:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。