論文の概要: CuBEs: Culturally-Situated Behavioral Evaluations and the Limitations of Culture-Blind LLM Judges
- arxiv url: http://arxiv.org/abs/2610.02622v1
- Date: Fri, 02 Oct 2026 00:26:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.135769
- Title: CuBEs: Culturally-Situated Behavioral Evaluations and the Limitations of Culture-Blind LLM Judges
- Title(参考訳): CuBEs:文化的行動評価とLLM審査員の限界
- Abstract要約: 文化的行動評価(CuBE)を提案する。
私たちは12の文化にまたがる行動理解の微妙な次元をキャプチャーする人間ラベル付きデータセットを構築します。
評価シナリオにおける文化的位置性の導入は,行動の有無に大きな変化をもたらすことが判明した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating the occurrence and triggers of large language model (LLM) behaviors - such as sycophancy, self-preference, or over-confidence - is critical for predicting real-world model deployment risks. However, existing situated behavioral evaluations typically ignore cultural context, limiting their generalizability across an increasingly global user base. To address this gap, we propose CuBEs - Culturally-situated Behavior Evaluations that probe for response patterns across diverse user cultures. We first extend an automated testing pipeline to inject cultural context into behavioral test scenarios and subsequent evaluation. We assess the cultural adaptability of this pipeline by building a human-labeled dataset that captures nuanced dimensions of behavior understanding across 12 distinct cultures. Our dataset reveals significant cross-cultural variations that one-size-fits all judgments fail to capture. Through evaluating 13 open- and closed-source LLMs, we find that introducing cultural situatedness in the evaluation scenario creates significant variation in the presence of a behavior. For example, while our baseline experiments testing for political bias capture localized Western political dimensions like the American conservative-progressive divide, non-Western culturally situated evaluations surface entirely different axes of bias such as religious and colonial political issues. Our findings demonstrate that standard, culturally-agnostic evaluations fail to capture these shifts, highlighting the necessity of culturally situated behavioral testing for global deployments.
- Abstract(参考訳): 大規模言語モデル(LLM)の行動の発生と引き金の評価は、現実のモデルデプロイメントのリスクを予測する上で重要である。
しかし、既存の行動評価は文化的な文脈を無視し、グローバルなユーザーベースをまたいだ一般化性を制限するのが一般的である。
このギャップに対処するために,多様なユーザ文化にまたがる応答パターンを探索するCuBEs - Culturally-situated Behavior Evaluationsを提案する。
まず、自動テストパイプラインを拡張して、振る舞いテストシナリオとその後の評価に文化的なコンテキストを注入します。
このパイプラインの文化的適応性を評価するために,12の異なる文化にまたがる行動理解の微妙な次元を捉えた人間ラベル付きデータセットを構築した。
われわれのデータセットは、すべての判断が捉えられない、大きな文化的バリエーションを明らかにしている。
13個のオープンおよびクローズドソースLCMを評価した結果、評価シナリオに文化的位置を導入することで、行動の有無に大きな変化が生じることがわかった。
例えば、我々の政治バイアス試験のベースライン実験は、アメリカの保守主義と進歩主義の分裂のような西洋の政治的側面を捉えていますが、非西洋の文化的に位置付けられた評価は、宗教や植民地の政治問題など、全く異なるバイアスの軸を表面化しています。
本研究は, 標準的, 文化的に非依存な評価ではこれらの変化を捉えられず, グローバル展開において, 文化的に位置する行動検査の必要性を浮き彫りにしている。
関連論文リスト
- CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia [72.20656906184539]
カルチャーコンバース(CultureConverse)は、文化的基盤を持つアシスタント対話のためのスケーラブルで多言語シミュレーションと評価ハーネスである。
その結果得られたCultureConverse-DSデータセットには、14,610のベンチマーク(評価)と274,295のオラクル誘導(ゴールドモード)ダイアログが含まれている。
人間のアノテーション実験は、評価フレームワークが人間の判断に十分なプロキシであることを示唆している。
論文 参考訳(メタデータ) (2026-08-28T14:56:46Z) - Whose Norms? Disentangling Cultural and Personal Alignment in Large Language Models [66.34115263472931]
大規模言語モデルは、文化的規範と個人の嗜好のバランスを必要とする社会的意思決定の状況にますます使われてきている。
PACT(Personal-Preference and Cultural-Norm Trade-off framework)を導入し,モデルが文化的規範に従うか,あるいは個人の嗜好を許容するかを評価する。
PACTに関する5つの国による研究は、人間の文化のフォローは主にシナリオ国によって行われており、参加者が自身の文化的文脈を判断する際の合意は最低であることを示している。
論文 参考訳(メタデータ) (2026-06-05T22:20:30Z) - CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs [59.09971492475217]
TextitCultural Norm Grounded ReasoningのベンチマークであるCultureForestを紹介する。
CultureForestは8つのドメインで5,378のサンプルと53の国/リージョンで構成されている。
大規模な実験では、トップ層モデルでさえ、オープンな設定で大幅に劣化していることが明らかになった。
論文 参考訳(メタデータ) (2026-06-01T08:25:12Z) - CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs [24.598338950728234]
大規模言語モデル(LLM)は、文化的に多様な環境にますます展開されている。
既存の方法は、非文脈的正当性や強制選択判断に重点を置いている。
現実的な状況下でモデルを提示するベンチマークのセットを紹介する。
論文 参考訳(メタデータ) (2025-11-15T03:39:13Z) - Culture is Everywhere: A Call for Intentionally Cultural Evaluation [36.20861746863831]
文献的文化的評価について論じる: 評価のあらゆる側面に埋め込まれた文化的仮定を体系的に検証するアプローチ。
我々は、現在のベンチマークプラクティスを超えて、意味と今後の方向性について議論する。
論文 参考訳(メタデータ) (2025-09-01T09:39:21Z) - CAIRe: Cultural Attribution of Images by Retrieval-Augmented Evaluation [61.130639734982395]
本稿では,画像の文化的関連度を評価する新しい評価指標であるCAIReを紹介する。
本フレームワークは,イメージ内の実体と概念を知識ベースに基盤として,実情報を用いて各文化ラベルに対して独立した評価を行う。
論文 参考訳(メタデータ) (2025-06-10T17:16:23Z) - From Surveys to Narratives: Rethinking Cultural Value Adaptation in LLMs [62.9861554207279]
LLM(Large Language Models)における文化的価値の適応は大きな課題である。
これまでの作業は主に、World Values Survey (WVS)データを使用して、LLMをさまざまな文化的価値と整合させる。
我々は,文化価値適応のためのWVSベースのトレーニングについて検討し,調査データのみに頼って文化規範を実践し,事実知識に干渉することを発見した。
論文 参考訳(メタデータ) (2025-05-22T09:00:01Z) - Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs [7.802103248428407]
我々は,現在の調査に基づく評価手法の背景にある3つの仮定を特定し,検証する。
提示形式間の不安定性,評価された文化次元と保持された文化的次元間の不整合性,即時操舵時の不整合性などについて検討した。
論文 参考訳(メタデータ) (2025-03-11T17:59:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。