論文の概要: TajikNLP: An Open-Source Toolkit for Comprehensive Text Processing of Tajik (Cyrillic Script)
- arxiv url: http://arxiv.org/abs/2605.04583v1
- Date: Wed, 06 May 2026 07:32:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.701754
- Title: TajikNLP: An Open-Source Toolkit for Comprehensive Text Processing of Tajik (Cyrillic Script)
- Title(参考訳): TajikNLP - Tajik (Cyrillic Script) の総合テキスト処理のためのオープンソースツールキット
- Abstract要約: タジク語はキリル文字で書かれており、一般に公開されている自然言語処理(NLP)ツールキットの点では、いまだに過小評価されている。
本稿では,オープンソースのPythonライブラリであるTajikNLPを紹介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The Tajik language, written in Cyrillic script, remains severely under-resourced in terms of publicly available natural language processing (NLP) toolkits, hindering both linguistic research and applied development. This paper introduces TajikNLP, an open-source Python library that provides the first comprehensive pipeline for processing authentic Tajik text while preserving the original Cyrillic orthography. The library implements a modular architecture centered around a unified Doc object, enabling sequential application of components for cleaning, normalization, tokenization (including subword BPE), morphemic segmentation, part-of-speech tagging, stemming, lemmatization, and sentence splitting. A novel unified morphology engine is introduced, offering controlled and deep analysis modes that significantly improve handling of Tajik's agglutinative nominal and verbal inflections. The release further incorporates a lexicon-based sentiment analyser and pre-trained Word2Vec/FastText embeddings loaded directly from the Hugging Face Hub. To ensure reproducibility and facilitate future research, four accompanying linguistic datasets -- a POS-tagged corpus (52.5k entries), a sentiment lexicon (3.5k entries), a toponym gazetteer (5.6k entries), and a personal names dataset (3.8k entries) -- have been openly published under permissive licenses. The library's reliability is validated by an extensive test suite of 616 automated tests achieving 93% source code coverage. TajikNLP thus establishes a foundational technological infrastructure for Tajik language processing, lowering the barrier to entry for both academic and industrial applications in low-resource Cyrillic-script environments.
- Abstract(参考訳): タジク語はキリル文字で書かれており、一般に公開されている自然言語処理(NLP)ツールキットの点において、言語研究と応用開発の両方を妨げている。
本稿では,オープンソースのPythonライブラリであるTajikNLPについて紹介する。
このライブラリは、統合されたDocオブジェクトを中心としたモジュラーアーキテクチャを実装しており、クリーニング、正規化、トークン化(サブワードBPEを含む)、形態素セグメンテーション、音声タグ付け、スリーミング、補綴、文分割のためのコンポーネントのシーケンシャルな適用を可能にしている。
新たな統一形態素エンジンを導入し、タジクの絶対的名目および動詞のインフレクションの処理を大幅に改善する制御および深い分析モードを提供する。
このリリースではさらに、Hugging Face Hubから直接ロードされるレキシコンベースの感情分析と、事前訓練されたWord2Vec/FastTextの埋め込みが含まれている。
再現性を確保し、将来の研究を促進するため、POSタグ付きコーパス(52.5kエントリ)、感情レキシコン(3.5kエントリ)、トポニムガゼテア(5.6kエントリ)、個人名データセット(3.8kエントリ)の4つの言語データセットがパーミッシブライセンスの下で公開されている。
ライブラリの信頼性は、93%のソースコードカバレッジを達成する616の自動テストの広範なテストスイートによって検証されている。
そのため、TajikNLPはタジク語処理の基盤となる技術基盤を確立し、低リソースのCyrillic-script環境における学術的および工業的アプリケーションへの参入障壁を低くする。
関連論文リスト
- Analyzing and Encoding the Al-Mawrid Arabic-English Dictionary with the ISO Language Markup Framework and TEI Lex-0 [1.1267872663780352]
本稿ではアラビア語辞書Al-Mawridの体系的デジタル化と符号化のための堅牢な方法論を提案する。
従来の印刷資源から標準化された計算語彙に変換する。
辞書のマクロ構造とミクロ構造に編集ビューを適用することにより、20世紀のバイリンガル辞書に典型的な構造的曖昧さと不整合を解消する。
論文 参考訳(メタデータ) (2026-06-16T17:35:11Z) - DocAtlas: Multilingual Document Understanding Across 80+ Languages [58.715440331861295]
本稿では,82言語を対象とした高忠実度OCRデータセットとベンチマークを構築するフレームワークDocAtlasを紹介する。
我々のデュアルパイプライン、ネイティブDOCX文書の微分レンダリング、左右スクリプトの合成ベース生成は正確な構造アノテーションを生成する。
論文 参考訳(メタデータ) (2026-05-12T18:09:38Z) - FreeTxt-Vi: A Benchmarked Vietnamese-English Toolkit for Segmentation, Sentiment, and Summarisation [3.0712751539922394]
FreeTxt-Viは、ベトナム語のバイリンガルなテキストコレクションを作成し分析するための、フリーでオープンソースのWebベースのツールキットである。
システムは、コーパス分析機能、例えばコンコーディネートキーワード分析語句関係探索と対話的視覚化と、感情分析と要約のためのトランスフォーマーベースのNLPコンポーネントを組み合わせる。
論文 参考訳(メタデータ) (2026-03-05T21:26:08Z) - TurkicNLP: An NLP Toolkit for Turkic Languages [6.156016907917316]
TurkicNLPはPythonライブラリで、トルコ語のための単一の一貫したNLPパイプラインを提供する。
トークン化、形態解析、部分音声タグ付け、依存性解析、名前付きエンティティ認識、双方向スクリプトの文字変換、機械翻訳をカバーしている。
論文 参考訳(メタデータ) (2026-02-22T13:08:21Z) - COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing [1.2242530642524063]
COMI-lingUAは、ヒンディー語と英語のコード混成データセットとしては最大である。
5つのコアNLPタスクにわたる125K以上の高品質なインスタンスで構成されている。
各インスタンスには3つのバイリンガルアノテーションがアノテートされ、376K以上の専門家アノテーションが生成される。
論文 参考訳(メタデータ) (2025-03-27T16:36:39Z) - Enhancing Plagiarism Detection in Marathi with a Weighted Ensemble of TF-IDF and BERT Embeddings for Low-Resource Language Processing [0.0]
低リソース言語に適した堅牢な盗作検知システムを設計することが重要である。
本稿では,マラタイ文字の盗作検出精度を高める手法を提案する。
論文 参考訳(メタデータ) (2025-01-09T14:14:18Z) - A Novel Cartography-Based Curriculum Learning Method Applied on RoNLI: The First Romanian Natural Language Inference Corpus [71.77214818319054]
自然言語推論は自然言語理解のプロキシである。
ルーマニア語のNLIコーパスは公開されていない。
58Kの訓練文対からなるルーマニア初のNLIコーパス(RoNLI)を紹介する。
論文 参考訳(メタデータ) (2024-05-20T08:41:15Z) - Transformer-based Model for Word Level Language Identification in
Code-mixed Kannada-English Texts [55.41644538483948]
コードミキシングしたカンナダ英語テキストにおける単語レベル言語識別のためのトランスフォーマーベースモデルを提案する。
The proposed model on the CoLI-Kenglish dataset achieves a weighted F1-score of 0.84 and a macro F1-score of 0.61。
論文 参考訳(メタデータ) (2022-11-26T02:39:19Z) - textless-lib: a Library for Textless Spoken Language Processing [50.070693765984075]
我々はPyTorchベースのライブラリであるtextless-libを紹介した。
ライブラリが提供するビルディングブロックを説明し、そのユーザビリティを実証する。
論文 参考訳(メタデータ) (2022-02-15T12:39:42Z) - N-LTP: An Open-source Neural Language Technology Platform for Chinese [68.58732970171747]
textttN-は、中国の6つの基本的なNLPタスクをサポートする、オープンソースのニューラルネットワークテクノロジプラットフォームである。
textttN-は、中国のタスク間で共有知識をキャプチャする利点がある共有事前学習モデルを使用することで、マルチタスクフレームワークを採用する。
論文 参考訳(メタデータ) (2020-09-24T11:45:39Z) - FILTER: An Enhanced Fusion Method for Cross-lingual Language
Understanding [85.29270319872597]
我々は,XLMファインタニングの入力として言語間データを利用する拡張融合法を提案する。
推論中は、ターゲット言語で入力されたテキストとソース言語の翻訳に基づいて予測を行う。
この問題に対処するため,対象言語における翻訳テキストのための自動生成ソフト擬似ラベルに基づくモデル学習のためのKL分割自己学習損失を提案する。
論文 参考訳(メタデータ) (2020-09-10T22:42:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。