論文の概要: Right Frame, Wrong Rule: Cultural Cues Expose the Financial Knowledge Gap They Were Meant to Close
- arxiv url: http://arxiv.org/abs/2609.00999v1
- Date: Tue, 01 Sep 2026 09:46:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.543763
- Title: Right Frame, Wrong Rule: Cultural Cues Expose the Financial Knowledge Gap They Were Meant to Close
- Title(参考訳): 正しい枠組み、間違ったルール:文化的なクイズは、閉鎖しようとしている金融知識のギャップを露呈する
- Authors: Rania Elbadry, Ahmed Heakl, Saeed Almheiri, Fan Zhang, Muhra AlMahri, Xueqing Peng, Mohsinul Kabir, Shuyao Wang, Yi Han, Saadeldine Eletter, Duzhen Zhang, Preslav Nakov, Yuxia Wang, Fajri Koto, Zhuohan Xie,
- Abstract要約: イスラム金融における規範的多元主義を4つの分類法を用いて研究する。
文化的キューは1つのフレームワークに向かってモデルを操縦するが、そのモデルはそのフレームワーク内で間違った答えを選択する。
- 参考スコア(独自算出の注目度): 57.963463622270275
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a question has valid answers under different normative frameworks, a language model must decide which framework to use and whether it can answer correctly within it. We call this setting normative pluralism and study it in Islamic finance using a four-choice taxonomy that separates framework selection from within-framework correctness. This separation reveals the stereotype trap: a cultural cue steers a model toward one framework, but the model selects an incorrect answer within that framework. Across twelve models, two languages, and fifty demographic signals, cultural cues change framework selection and reveal substantial differences in accuracy, especially among non-frontier models. Under the strongest signal, large open-weight models select the Islamic framework 97% of the time. A two-choice evaluation would report near-perfect alignment, although 57--66% of those selections are incorrect. These findings motivate, but do not directly test, the competence-conditioned routing hypothesis: models may favor frameworks where they are more accurate, while cultural cues may expose framework-specific competence gaps.
- Abstract(参考訳): ある質問が異なる規範的フレームワークの下で有効な答えを持っている場合、言語モデルはどのフレームワークを使うかを決め、その内部で正しく答えられるかどうかを判断しなければならない。
この設定を規範的多元主義と呼び、枠組み選択と枠内正しさを分離する4つの選択分類を用いてイスラム金融で研究する。
この分離によってステレオタイプトラップが明らかになる: 文化的なキューはモデルをひとつのフレームワークに向けて操るが、そのモデルはそのフレームワーク内で誤った答えを選択する。
12のモデル、2つの言語、50の人口統計信号、文化的な手がかりがフレームワークの選択を変え、特に非最前線モデルにおいて、精度のかなりの違いを明らかにしている。
最強の信号の下では、大きなオープンウェイトモデルでは、その97%がイスラムの枠組みを選択している。
2点評価では、ほぼ完全なアライメントが報告されるが、57~66%は正しくない。
モデルでは、より正確であるフレームワークが好まれる一方、文化的な手がかりはフレームワーク固有の能力ギャップを露呈する可能性がある。
関連論文リスト
- ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models [71.84650682660373]
大規模な言語モデルは、家庭教師、教師助手、コンテンツジェネレータとして、教育にますます導入されている。
既存のベンチマークでは、これらの要件を主に分離して評価しているため、統合されたプロファイルとして教育に直面する適合性は評価されていない。
ELBenchは,共通プロトコルの下で同じモデル上での4つの要件(一般能力,安全性,信頼性,基礎教育,高レベル栽培)すべてを評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-08-10T12:46:58Z) - EduArt: An educational-level benchmark for evaluating art history knowledge in large language models [0.764671395172401]
既存のアートに焦点を当てた評価は、合成質問に依存しており、アイテムレベルの特性を報告することは滅多にない。
本稿では,マルチモーダルLLMにおける美術史的知識と視覚的推論のための教育レベルのベンチマークであるEduArtを紹介する。
論文 参考訳(メタデータ) (2026-07-02T10:43:06Z) - Whose Norms? Disentangling Cultural and Personal Alignment in Large Language Models [66.34115263472931]
大規模言語モデルは、文化的規範と個人の嗜好のバランスを必要とする社会的意思決定の状況にますます使われてきている。
PACT(Personal-Preference and Cultural-Norm Trade-off framework)を導入し,モデルが文化的規範に従うか,あるいは個人の嗜好を許容するかを評価する。
PACTに関する5つの国による研究は、人間の文化のフォローは主にシナリオ国によって行われており、参加者が自身の文化的文脈を判断する際の合意は最低であることを示している。
論文 参考訳(メタデータ) (2026-06-05T22:20:30Z) - Training-Free Cultural Alignment of Large Language Models via Persona Disagreement [7.507356092823674]
本研究では、各国を世界価値サーベイグラウンドのペルソナエージェントのパネルとしてインスタンス化し、その不一致をバウンド・ロス・アバースロジット補正に変換する推論時手法であるdisCAを紹介する。
以上の結果から,推論時キャリブレーションは,グローバルな道徳的嗜好の長い尾を提供するための微調整に代わるスケーラブルな代替手段であることが示唆された。
論文 参考訳(メタデータ) (2026-05-11T16:55:16Z) - CCD-Bench: Probing Cultural Conflict in Large Language Model Decision-Making [0.9310318514564272]
大きな言語モデルは、合法的に異なる文化的価値システム間の明示的な衝突をナビゲートすることができる。
CCD-Benchは、文化的価値の対立の下で意思決定を評価するベンチマークである。
CCD-Benchは、孤立バイアス検出以上の評価を多元的意思決定にシフトする。
論文 参考訳(メタデータ) (2025-10-03T22:55:37Z) - Judging with Confidence: Calibrating Autoraters to Preference Distributions [56.17041629492863]
信頼性の高いオートラッターは、対象の個体群によって定義される嗜好の完全な分布をモデル化することを学ぶ必要がある、と我々は主張する。
異なるデータ条件に合わせた2つの学習方法を提案する。
この結果から, 分布マッチング目的の微調整オートレーダは, 目的の好み分布に整合した有言確率予測を導出することがわかった。
論文 参考訳(メタデータ) (2025-09-30T20:36:41Z) - Mathematics Isn't Culture-Free: Probing Cultural Gaps via Entity and Scenario Perturbations [40.515279067334596]
我々は,アフリカ,インド,中国,韓国,日本5地域を対象としたGSM8Kテストセットの文化的適応版を作成している。
8Bから72Bパラメータの6つの大言語モデル (LLM) を評価する。
論文 参考訳(メタデータ) (2025-07-01T15:51:46Z) - Why do you think that? Exploring Faithful Sentence-Level Rationales
Without Supervision [60.62434362997016]
文レベルで忠実な論理を出力するモデルを作成するために,異なる訓練枠組みを提案する。
本モデルでは,各理性に基づいて各課題を個別に解決し,その課題を最もよく解決した者に高いスコアを割り当てることを学ぶ。
論文 参考訳(メタデータ) (2020-10-07T12:54:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。