論文の概要: Large Language Models for Low-Resource Languages: A Conceptual Framework for an Electronic Explanatory Dictionary of the Tajik Language
- arxiv url: http://arxiv.org/abs/2608.04186v2
- Date: Thu, 06 Aug 2026 09:31:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.734447
- Title: Large Language Models for Low-Resource Languages: A Conceptual Framework for an Electronic Explanatory Dictionary of the Tajik Language
- Title(参考訳): 低リソース言語のための大規模言語モデル:タジク語電子解説辞書の概念的枠組み
- Authors: Mullosharaf K. Arabov, S. S. Pirov, B. Sultonov,
- Abstract要約: 形態解析,補題化,セマンティッククラスタリング,辞書エントリ生成のためのモジュールを統合する辞書アーキテクチャを提案する。
この作品の斬新さは、タジク語のための解説辞書の最初の全体論的概念的アーキテクチャの提案にある。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper presents a conceptual framework for developing an electronic explanatory dictionary of the Tajik language using large language models (LLMs). The relevance of the work stems from the absence of a comprehensive digital lexicographic resource for Tajik that is comparable in functionality to dictionaries for high-resource languages, and from the limited adaptation of modern natural language processing technologies to low-resource language systems. Based on a systematic survey of existing linguistic, statistical, and corpus resources, we propose a dictionary architecture that integrates modules for morphological analysis, lemmatization, semantic clustering, and dictionary entry generation using LLMs. The choice of subword tokenization is justified by the agglutinative nature of Tajik morphology and its high morphological variability, along with a parameter-efficient fine-tuning (PEFT) strategy suitable for limited annotated data. The novelty of the work lies in proposing the first holistic conceptual architecture of an explanatory dictionary for Tajik that unifies classical lexicographic methods, language statistics, and generative capabilities of LLMs into a single system. The practical significance of the study is the formation of a methodological foundation for developing a full-featured electronic dictionary that can serve both as a lexicographic tool and as a core resource for machine translation, automatic summarization, sentiment analysis, and other applied NLP tasks. The paper is intended for specialists in computational linguistics, lexicography, and developers of natural language processing systems working with low-resource languages.
- Abstract(参考訳): 本稿では,多言語モデル(LLM)を用いたタジク語電子解説辞書の開発のための概念的枠組みを提案する。
この研究の関連性は、タジク語のための包括的なデジタル辞書資源が存在しないこと、そして近代自然言語処理技術の低リソース言語システムへの限定的な適応から来ている。
既存の言語,統計,コーパス資源の体系的な調査に基づいて,LLMを用いた形態解析,補題化,セマンティッククラスタリング,辞書エントリ生成のためのモジュールを統合する辞書アーキテクチャを提案する。
サブワードのトークン化の選択は,タジク語形態の凝集特性と,その高形態的変動,および限られた注釈データに適したパラメータ効率細調整(PEFT)戦略によって正当化される。
この作品の斬新さは、古典的語彙法、言語統計学、LLMの生成能力を単一のシステムに統合するタジク語解説辞書の最初の全体論的概念的アーキテクチャを提案することである。
この研究の実際的な意義は、辞書ツールや機械翻訳、自動要約、感情分析、その他の応用NLPタスクのコアリソースとして機能する、フル機能の電子辞書を開発するための方法論の基礎を作ることである。
この論文は、計算言語学、語彙学、低リソース言語を扱う自然言語処理システムの開発を専門とする。
関連論文リスト
- CommonMorph: Participatory Morphological Documentation Platform [27.536522954572103]
textttCommonMorphは、形態的データ収集開発を合理化する包括的なプラットフォームである。
専門的な言語定義、コントリビュータの誘惑、コミュニティの検証が組み込まれている。
融合、凝集、根とパターンの形態を含む様々な形態体系に対応している。
論文 参考訳(メタデータ) (2026-04-06T08:27:39Z) - What Language is This? Ask Your Tokenizer [32.28976119949841]
言語識別(LID)は多くの多言語自然言語処理パイプラインの重要なコンポーネントである。
我々は,UnigramLMトークン化アルゴリズムに基づくシンプルで効率的なLID手法UniLIDを紹介する。
我々の定式化は、データと計算効率が良く、既存のモデルを再訓練することなく、新しい言語の漸進的な追加をサポートしています。
論文 参考訳(メタデータ) (2026-02-19T18:58:39Z) - A Rule-based Computational Model for Gaidhlig Morphology [0.0]
本稿では,Wiktionaryのデータを用いてガイドリーグ形態の規則に基づくモデルを構築する作業について述べる。
ルールベースのシステムは、限られたサンプルデータを効果的に活用し、より大きな解釈可能性をサポートし、教材の設計に有用な洞察を提供する、と論じている。
論文 参考訳(メタデータ) (2026-02-12T16:20:17Z) - RusLICA: A Russian-Language Platform for Automated Linguistic Inquiry and Category Analysis [0.0]
本稿では,レマを42の精神言語カテゴリーにマッピングするプロセスと,RusLICA Webサービスの一部としてのアナライザの実装について述べる。
論文 参考訳(メタデータ) (2026-01-28T05:43:40Z) - A Comprehensive Understanding of Code-mixed Language Semantics using
Hierarchical Transformer [28.3684494647968]
コード混合言語のセマンティクスを学習するための階層型トランスフォーマーベースアーキテクチャ(HIT)を提案する。
提案手法を17のデータセット上で6つのインド語と9つのNLPタスクで評価した。
論文 参考訳(メタデータ) (2022-04-27T07:50:18Z) - Reinforced Iterative Knowledge Distillation for Cross-Lingual Named
Entity Recognition [54.92161571089808]
言語間NERは、知識をリッチリソース言語から低リソース言語に転送する。
既存の言語間NERメソッドは、ターゲット言語でリッチなラベル付けされていないデータをうまく利用しない。
半教師付き学習と強化学習のアイデアに基づく新しいアプローチを開発する。
論文 参考訳(メタデータ) (2021-06-01T05:46:22Z) - Grounded Compositional Outputs for Adaptive Language Modeling [59.02706635250856]
言語モデルの語彙$-$典型的にはトレーニング前に選択され、後で永久に固定される$-$は、そのサイズに影響します。
言語モデルのための完全合成出力埋め込み層を提案する。
我々の知る限り、この結果はトレーニング語彙に依存しないサイズを持つ最初の単語レベル言語モデルである。
論文 参考訳(メタデータ) (2020-09-24T07:21:14Z) - Linguistic Typology Features from Text: Inferring the Sparse Features of
World Atlas of Language Structures [73.06435180872293]
我々は、バイト埋め込みと畳み込み層に基づく繰り返しニューラルネットワーク予測器を構築する。
様々な言語型の特徴を確実に予測できることを示す。
論文 参考訳(メタデータ) (2020-04-30T21:00:53Z) - Cross-lingual, Character-Level Neural Morphological Tagging [57.0020906265213]
文字レベルのリカレントなニューラルタグをトレーニングし、高リソース言語と低リソース言語を併用して形態的タグ付けを予測する。
複数の関連言語間の共同文字表現の学習は、高リソース言語から低リソース言語への知識伝達を成功させ、モノリンガルモデルの精度を最大30%向上させる。
論文 参考訳(メタデータ) (2017-08-30T08:14:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。