論文の概要: MameLoshnLM: Yiddish Language Model and Evaluation Benchmark
- arxiv url: http://arxiv.org/abs/2608.05850v1
- Date: Thu, 06 Aug 2026 10:24:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.739951
- Title: MameLoshnLM: Yiddish Language Model and Evaluation Benchmark
- Title(参考訳): MameLoshnLM: Yiddish言語モデルと評価ベンチマーク
- Abstract要約: We present MameLoshnLM, a first open-source 8B- parameter language model built for Yiddish。
イディッシュ語のリッチテキストの伝統にもかかわらず、そのデジタル的存在と信頼性の高い評価資源の不足は、イディッシュ語のモデリングの進歩を妨げている。
この結果は,Yiddish NLPの基礎と,歴史的にリッチだがデジタルに表現されていない言語における言語モデル開発のための実践的テンプレートの両方を提供する。
- 参考スコア(独自算出の注目度): 62.936233688546984
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We present MameLoshnLM, the first open-source 8B-parameter language model built specifically for Yiddish. Despite Yiddish's rich textual tradition, its limited digital presence and the scarcity of reliable evaluation resources have constrained progress in Yiddish language modeling. Existing multilingual corpora and benchmarks are often poor proxies for the language, containing substantial amounts of noisy, machine-translated, and misclassified text. We address these gaps by introducing Oytser, a high-quality Yiddish pretraining corpus that combines contemporary web-native sources with literary materials, and Kashes, a multi-task benchmark spanning translation, linguistic analysis, information extraction, and language understanding. Using these resources, we continue pretraining Llama 3.1 8B to obtain MameLoshnLM. Across the tasks in the benchmark, MameLoshnLM outperforms open baselines of similar scale. Our analyses show that these gains are not only quantitative: relative to general-purpose multilingual models, MameLoshnLM better captures language-defining lexical and morphological patterns, pointing to a broader failure mode of noisy web-scale multilingual data for low-resource languages. Our results provide both a foundation for Yiddish NLP and a practical template for language model development in historically rich but digitally underrepresented languages.
- Abstract(参考訳): We present MameLoshnLM, a first open-source 8B-parameter language model built for Yiddish。
イディッシュ語のリッチテキストの伝統にもかかわらず、そのデジタル的存在と信頼性の高い評価資源の不足は、イディッシュ語のモデリングの進歩を妨げている。
既存の多言語コーパスとベンチマークは、しばしば言語にとって不十分なプロキシであり、大量のノイズ、機械翻訳、誤分類テキストを含んでいる。
我々は、現代ウェブネイティブソースと文学素材を組み合わせた高品質なYiddish事前学習コーパスであるOytserと、翻訳、言語分析、情報抽出、言語理解にまたがるマルチタスクベンチマークであるKashesを導入することで、これらのギャップに対処する。
これらの資源を用いて、Llama 3.1 8B をプレトレーニングし、MameLoshnLM を得る。
ベンチマークのタスク全体で、MameLoshnLMは同様のスケールのオープンベースラインよりも優れています。
汎用多言語モデルと比較して、MameLoshnLMは言語定義の語彙的および形態的パターンをよりよく捉え、低リソース言語のためのノイズの多いWebスケール多言語データのより広い障害モードを指し示している。
この結果は,Yiddish NLPの基礎と,歴史的にリッチだがデジタルに表現されていない言語における言語モデル開発のための実践的テンプレートの両方を提供する。
関連論文リスト
- LLM Probe: Evaluating LLMs for Low-Resource Languages [6.177998679139308]
本稿では,低リソース言語における大規模言語モデル (LLM) の言語能力を評価するための語彙ベースアセスメントフレームワークを提案する。
このフレームワークは、語彙アライメント、音声認識、モルフォシンタクティック・プロービング、翻訳精度の4つの領域にわたるモデルを分析する。
論文 参考訳(メタデータ) (2026-03-31T10:03:38Z) - CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Language [10.19354135187181]
我々は,低リソース汎用言語であるCangjieの汚染のないベンチマークであるCangjieBenchを紹介する。
ベンチマークは、HumanEvalとClassEvalから手作業で翻訳された248の高品質なサンプルで構成されている。
実験の結果、ダイレクトジェネレーションは性能が悪く、シンタクス制約ジェネレーションは精度と計算コストの最良のトレードオフを提供することがわかった。
論文 参考訳(メタデータ) (2026-03-15T17:35:03Z) - NusaWrites: Constructing High-Quality Corpora for Underrepresented and
Extremely Low-Resource Languages [54.808217147579036]
インドネシアの地方言語について事例研究を行う。
データセット構築におけるオンラインスクラップ,人文翻訳,および母語話者による段落作成の有効性を比較した。
本研究は,母語話者による段落作成によって生成されたデータセットが,語彙的多様性と文化的内容の点で優れた品質を示すことを示す。
論文 参考訳(メタデータ) (2023-09-19T14:42:33Z) - Towards Language Modelling in the Speech Domain Using Sub-word
Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。
限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。
補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文 参考訳(メタデータ) (2021-10-31T22:48:30Z) - Can Character-based Language Models Improve Downstream Task Performance in Low-Resource and Noisy Language Scenarios? [15.995677143912474]
我々は、ナラビジ(NArabizi)と呼ばれるラテン文字の拡張を用いて書かれた北アフリカ方言のアラビア語に焦点を当てている。
ナラビジの99k文のみを学習し,小さな木バンクで微調整したキャラクタベースモデルは,大規模多言語モデルとモノリンガルモデルで事前学習した同じアーキテクチャで得られたものに近い性能を示す。
論文 参考訳(メタデータ) (2021-10-26T14:59:16Z) - Are Multilingual Models the Best Choice for Moderately Under-resourced
Languages? A Comprehensive Assessment for Catalan [0.05277024349608833]
この研究はカタルーニャ語に焦点を当て、中規模のモノリンガル言語モデルが最先端の大規模多言語モデルとどの程度競合するかを探求することを目的としている。
クリーンで高品質なカタルーニャ語コーパス(CaText)を構築し、カタルーニャ語(BERTa)のためのトランスフォーマーベースの言語モデルを訓練し、様々な設定で徹底的に評価する。
その結果,カタルーニャ語理解ベンチマーク(CLUB, Catalan Language Understanding Benchmark)が,オープンリソースとして公開された。
論文 参考訳(メタデータ) (2021-07-16T13:52:01Z) - Learning Contextualised Cross-lingual Word Embeddings and Alignments for
Extremely Low-Resource Languages Using Parallel Corpora [63.5286019659504]
そこで本稿では,小さな並列コーパスに基づく文脈型言語間単語埋め込み学習手法を提案する。
本手法は,入力文の翻訳と再構成を同時に行うLSTMエンコーダデコーダモデルを用いて単語埋め込みを実現する。
論文 参考訳(メタデータ) (2020-10-27T22:24:01Z) - Cross-lingual Machine Reading Comprehension with Language Branch
Knowledge Distillation [105.41167108465085]
言語間機械読解(CLMRC)は、ローソース言語に大規模なデータセットがないため、依然として難しい問題である。
本稿では,Language Branch Machine Reading (LBMRC) という新しい拡張手法を提案する。
LBMRCは、個々の言語に精通したMultiple Machine Read comprehension (MRC)モデルを訓練する。
複数の言語分岐モデルから全ての対象言語に対する単一モデルへのアマルガメート知識の多言語蒸留アプローチを考案する。
論文 参考訳(メタデータ) (2020-10-27T13:12:17Z) - XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning [68.57658225995966]
XCOPA (Cross-lingual Choice of Plausible Alternatives) は11言語における因果コモンセンス推論のための多言語データセットである。
提案手法は,翻訳に基づく転送と比較して,現在の手法の性能が低下していることを明らかにする。
論文 参考訳(メタデータ) (2020-05-01T12:22:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。