論文の概要: When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs
- arxiv url: http://arxiv.org/abs/2607.17828v1
- Date: Mon, 20 Jul 2026 11:17:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.602501
- Title: When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs
- Title(参考訳): 名前が名前でないとき--低資源LCMにおけるバングラホログラフィーのベンチマークデータセットと蒸留反応-
- Authors: Md. Asaduzzaman Shuvo,
- Abstract要約: 正しい読み方を選ぶには、近代言語モデルの事前学習データに不足する文化的な知識が必要である。
専門家が検証した1,516の文(ラベル付き3,032件)のBanglaベンチマークを作成した。
対照的なチェーン・オブ・ソート・プロンプトは、トレーニングなしでこのバイアスを著しく低減できることを示す。
- 参考スコア(独自算出の注目度): 0.12691047660244334
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many Bangla words are at once personal names and culturally loaded common nouns, "Maya" is both a girl's name and a word for affectionate compassion. Choosing the right reading demands cultural knowledge that is scarce in the pretraining data of modern language models. We introduce Culturally Entangled Homograph (CEH) disambiguation and build a Bangla benchmark of 1,516 expert-verified sentences (3,032 labelled occurrences) in which one word appears twice with two distinct readings, each labelled with a culturally grounded category and an explanation of the reasoning behind it. Across open- and closed-source models, we find a systematic dominant-meaning bias: models default to the common-noun sense and overlook the name. A Bangla-specific model fails under every prompting regime we test, showing that language-specific pretraining alone does not confer cultural grounding. We further show that contrastive chain-of-thought prompting can sharply reduce this bias without training, and that distilling cultural explanations teaches small (1-3B) models to reason toward the correct reading rather than memorise labels, cutting dominant-meaning bias from as high as 100% to under 5% and turning the failed Bangla-specific model into our strongest system. Dataset and code are available at https://github.com/ashuvo25/BanglaCEH.
- Abstract(参考訳): 多くのバングラ語は一度に個人名と文化的にロードされた一般的な名詞であり、「マヤ」は少女の名前と愛情的な思いやりを表す単語である。
正しい読み方を選ぶには、近代言語モデルの事前学習データに不足する文化的な知識が必要である。
文化的絡み合ったホモグラフ(CEH)の曖昧さを導入し、1語が2つの異なる読解で2回出現する1,516名の専門的証明された文(3,032件)のベンチマークを作成し,その背景にある理由を説明する。
オープンソースモデルとクローズドソースモデル全体で、システマティックな支配的な偏見が見つかります。
バングラ語固有のモデルは、我々がテストするすべてのプロンプト体制の下で失敗し、言語固有の事前訓練だけでは文化的な根拠を示さないことを示す。
さらに, コントラスト的なチェーン・オブ・プルーピングは, トレーニングを伴わずに, このバイアスを著しく低減できることを示すとともに, 文化的な説明を蒸留することで, 小さな (1-3B) モデルで, 記憶ラベルよりも正しい読解を推し進め, 支配的な偏見を100%から5%以下に減らし, 失敗したバングラ特化モデルを最強のシステムに転換することを示す。
データセットとコードはhttps://github.com/ashuvo25/BanglaCEHで入手できる。
関連論文リスト
- Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects [1.6884607868633077]
9つのドメインで1,152枚の手動でキュレートされた画像から構築されたこのベンチマークは、視覚的な質問応答とキャプションをサポートする。
実験の結果,標準バングラのみの評価が真のモデル能力を過大評価していることがわかった。
ドメイン全体において、主なボトルネックは、視覚的な基盤ではなく、文化的知識の欠如である。
論文 参考訳(メタデータ) (2026-03-22T10:55:08Z) - LongTail-Swap: benchmarking language models' abilities on rare words [16.946063624357745]
LongTail-Swapはディストリビューションのテールに焦点を当てたベンチマークである。
LMが新しい単語をほとんど露出せずに学習する能力を測定する。
LT-Swapは、許容できない文対と許容できない文対の、事前訓練されたコーパス固有のテストセットである。
論文 参考訳(メタデータ) (2025-10-05T16:17:33Z) - Surface Fairness, Deep Bias: A Comparative Study of Bias in Language Models [45.41676783204022]
大規模言語モデル(LLM)におけるバイアスの様々なプロキシ尺度について検討する。
MMLU (Multi-subject benchmark) を用いた人格評価モデルでは, スコアの無作為かつ大半がランダムな差が生じることがわかった。
LLMアシスタントメモリとパーソナライゼーションの最近の傾向により、これらの問題は異なる角度から開かれている。
論文 参考訳(メタデータ) (2025-06-12T08:47:40Z) - Multicultural Name Recognition For Previously Unseen Names [65.268245109828]
本論文は、人名の認識を改善することを目的としており、それは、誰かが生まれたり、名前を変えたりする際にも、成長できる多様なカテゴリーである。
私は103か国の名前を見て、モデルが異なる文化の名前でどれだけうまく機能するかを比較します。
文字入力と単語入力を組み合わせたモデルの方が単語のみのモデルより優れており,従来のNERモデルと比較して精度が向上する可能性がある。
論文 参考訳(メタデータ) (2024-01-23T17:58:38Z) - What Do Llamas Really Think? Revealing Preference Biases in Language
Model Representations [62.91799637259657]
大規模言語モデル(LLMs)は、応答を辞退しても、社会的な偏見を示すか?
本研究は,文脈的埋め込みを探索し,このバイアスが潜在表現にエンコードされているかどうかを探索することによって検討する。
単語の隠れベクトルからLLMの単語ペア選好を予測するロジスティックなBradley-Terryプローブを提案する。
論文 参考訳(メタデータ) (2023-11-30T18:53:13Z) - Having Beer after Prayer? Measuring Cultural Bias in Large Language Models [25.722262209465846]
多言語およびアラビア語のモノリンガルLMは、西洋文化に関連する実体に対して偏見を示すことを示す。
アラブ文化と西洋文化を対比する8つのタイプにまたがる628個の自然発生プロンプトと20,368個のエンティティからなる新しい資源であるCAMeLを紹介した。
CAMeLを用いて、物語生成、NER、感情分析などのタスクにおいて、16の異なるLMのアラビア語における異文化間性能について検討した。
論文 参考訳(メタデータ) (2023-05-23T18:27:51Z) - Discovering and Mitigating Visual Biases through Keyword Explanation [66.71792624377069]
視覚バイアスをキーワードとして解釈するBias-to-Text(B2T)フレームワークを提案する。
B2Tは、CelebAの性別バイアス、ウォーターバードの背景バイアス、ImageNet-R/Cの分布シフトなど、既知のバイアスを特定することができる。
B2Tは、Dollar StreetやImageNetのような大きなデータセットで、新しいバイアスを明らかにする。
論文 参考訳(メタデータ) (2023-01-26T13:58:46Z) - Approximating How Single Head Attention Learns [38.64433236359172]
2段階のプロセスとしてモデルトレーニングを近似する。
早い段階で、モデルは個々の入力単語iをoに翻訳することを学習する。
後にモデルが i に出席することを学習し、正しい出力は o に翻訳されるのを知っているため $o$ となる。
論文 参考訳(メタデータ) (2021-03-13T02:32:19Z) - Text Classification Using Label Names Only: A Language Model
Self-Training Approach [80.63885282358204]
現在のテキスト分類法は、訓練データとして多くの人ラベルの文書を必要とするのが一般的である。
本モデルでは,トピック分類や感情分類を含む4つのベンチマークデータセットにおいて,約90%の精度が得られた。
論文 参考訳(メタデータ) (2020-10-14T17:06:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。