論文の概要: To What Extent Do Large Language Models Understand Bangla Idioms?
- arxiv url: http://arxiv.org/abs/2609.03410v1
- Date: Thu, 03 Sep 2026 06:15:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.94106
- Title: To What Extent Do Large Language Models Understand Bangla Idioms?
- Title(参考訳): バングライディオムを理解する大規模言語モデルとは何か?
- Abstract要約: バングラ語における慣用表現の大規模ベンチマークデータセットについて述べる。
また、意味識別のための合成多重選択質問(MCQ)データセットも提示する。
- 参考スコア(独自算出の注目度): 3.1848820580333737
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Idiomatic expressions are an integral part of natural language, reflecting cultural nuances and posing unique challenges for computational models, particularly in low-resource languages. In this paper, we present the first large-scale benchmark dataset of Bangla idioms, complemented by a synthetic multiple-choice question (MCQ) dataset for idiom meaning identification. We conduct a comprehensive evaluation of recent large language models (LLMs) across three idiom-related tasks: paraphrasing, idiom span detection, and meaning identification, leveraging zero-shot and few-shot prompting strategies. Our results reveal substantial variability in model performance, with no single LLM consistently outperforming others across all tasks. Notably, Phi-4-mini-instruct excels in paraphrasing, Kimi-K2-32b-instruct in span detection, and Gemini-2.5-flash in meaning identification. We believe that our datasets and analyses will provide valuable resources to guide future research in improving LLM comprehension of idiomatic expressions, particularly in Bangla and other low-resource languages.
- Abstract(参考訳): 慣用表現は自然言語の不可欠な部分であり、文化的なニュアンスを反映し、特に低リソース言語において計算モデルに固有の課題を提起する。
本稿では,バングライディオムの大規模ベンチマークデータセットとして,イディオムを識別するための合成多重選択質問(MCQ)データセットを補完する。
我々は,最近の大規模言語モデル(LLM)をパラフレーズ,イディオムスパン検出,意味識別という3つのイディオム関連タスクで包括的に評価し,ゼロショットと少数ショットのプロンプト戦略を活用する。
以上の結果から,モデル性能の変動が顕著であり,全てのタスクにおいて一貫したLLMが他より優れることはないことが明らかとなった。
特に、Phi-4-mini-instructはパラフレーズ、Kim-K2-32b-instructはスパン検出、Gemini-2.5-flashは識別を意味する。
我々のデータセットと分析は,特にBanglaや他の低リソース言語において,慣用表現のLLM理解を改善する上で,今後の研究を導く上で貴重な資源となると信じている。
関連論文リスト
- MameLoshnLM: Yiddish Language Model and Evaluation Benchmark [62.936233688546984]
We present MameLoshnLM, a first open-source 8B- parameter language model built for Yiddish。
イディッシュ語のリッチテキストの伝統にもかかわらず、そのデジタル的存在と信頼性の高い評価資源の不足は、イディッシュ語のモデリングの進歩を妨げている。
この結果は,Yiddish NLPの基礎と,歴史的にリッチだがデジタルに表現されていない言語における言語モデル開発のための実践的テンプレートの両方を提供する。
論文 参考訳(メタデータ) (2026-08-06T10:24:08Z) - Benchmarking Open-Source Large Language Models for Persian in Zero-Shot and Few-Shot Learning [0.0]
本稿では,ペルシャ自然言語処理タスクのためのオープンソースの大規模言語モデル (LLM) のベンチマークを示す。
我々は、感情分析、名前付きエンティティ認識、読書理解、質問応答など、様々なタスクのモデルを評価する。
その結果、Gemma 2は両方の学習パラダイムにおいて、ほぼすべてのタスクで、他のモデルよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-10-05T10:10:04Z) - Multilingual Definition Modeling [1.9409995498330783]
私たちは4つの新言語(スペイン語、フランス語、ポルトガル語、ドイツ語)に単言語辞書データを使用します。
このデータに微調整を施すと, 単文単語の定義モデル上で, 事前学習した多言語言語モデルの性能を検証した。
結果から,多言語モデルでは英語のオンペア化が可能であるが,言語間相乗効果の可能性が示唆された。
論文 参考訳(メタデータ) (2025-06-02T09:48:37Z) - MMATH: A Multilingual Benchmark for Mathematical Reasoning [94.05289799605957]
MMATHは10言語にまたがる374の高品質な数学問題にまたがる多言語複雑推論のためのベンチマークである。
我々は、DeepSeek R1のような先進モデルでさえ、言語間での大幅な性能格差を示し、意図しない言語において重要な目標外問題発生応答に悩まされていることを観察する。
本研究は,大規模言語モデルの多言語推論能力向上のための新たな洞察と実践的戦略を提供する。
論文 参考訳(メタデータ) (2025-05-25T12:47:39Z) - BnMMLU: Measuring Massive Multitask Language Understanding in Bengali [0.0]
本稿では,ベンガル語モデルにおける言語理解能力を評価するベンチマークであるBnMMLUを紹介する。
データセットは科学、人文科学、数学、一般知識を含む23の領域にまたがる。
我々は、BnMMLUテストセット上で、プロプライエタリでオープンソースの大規模言語モデル(LLM)をベンチマークする。
論文 参考訳(メタデータ) (2025-05-25T02:54:31Z) - Evaluating Large Language Models on Multiword Expressions in Multilingual and Code-Switched Contexts [2.519319150166215]
本研究では,現在最先端の言語モデルが,潜在的に慣用的なマルチワード表現のあいまいさをどのように処理するかを評価する。
大きな言語モデルは、その強みにも拘わらず、ニュアンスド言語に苦戦している。
論文 参考訳(メタデータ) (2025-04-10T16:39:28Z) - New Dataset and Methods for Fine-Grained Compositional Referring Expression Comprehension via Specialist-MLLM Collaboration [49.180693704510006]
Referring Expression (REC) は、言語理解、画像理解、言語と画像の接点の相互作用を評価するためのクロスモーダルなタスクである。
MLLM(Multimodal Large Language Models)の試験場として機能する。
論文 参考訳(メタデータ) (2025-02-27T13:58:44Z) - Understanding and Mitigating Language Confusion in LLMs [76.96033035093204]
我々は,既存の英語および多言語プロンプトを用いた15の型的多様言語の評価を行った。
Llama Instruct と Mistral のモデルでは,言語的混乱の度合いが高いことがわかった。
言語混乱は,数発のプロンプト,多言語SFT,選好調整によって部分的に緩和できることがわかった。
論文 参考訳(メタデータ) (2024-06-28T17:03:51Z) - FAC$^2$E: Better Understanding Large Language Model Capabilities by Dissociating Language and Cognition [56.76951887823882]
大規模言語モデル(LLM)は、主に様々なテキスト理解および生成タスクにおける全体的なパフォーマンスによって評価される。
FAC$2$E, FAC$2$Eについて述べる。
論文 参考訳(メタデータ) (2024-02-29T21:05:37Z) - AStitchInLanguageModels: Dataset and Methods for the Exploration of
Idiomaticity in Pre-Trained Language Models [7.386862225828819]
本研究は、MWEを含む自然発生文のデータセットを、細かな意味の集合に手作業で分類する。
我々は,このデータセットを,idiomを含む文の表現生成における言語モデルの有効性と,idiomを用いた言語モデルの有効性を検証するために,2つのタスクで使用する。
論文 参考訳(メタデータ) (2021-09-09T16:53:17Z) - AM2iCo: Evaluating Word Meaning in Context across Low-ResourceLanguages
with Adversarial Examples [51.048234591165155]
本稿では, AM2iCo, Adversarial and Multilingual Meaning in Contextを提案する。
言語間文脈における単語の意味の同一性を理解するために、最先端(SotA)表現モデルを忠実に評価することを目的としている。
その結果、現在のSotAプリトレーニングエンコーダは人間のパフォーマンスにかなり遅れていることが明らかとなった。
論文 参考訳(メタデータ) (2021-04-17T20:23:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。