論文の概要: The Annotation Bottleneck in Persian Text NLP: Persian as an Annotation-Scarce Language
- arxiv url: http://arxiv.org/abs/2608.24698v1
- Date: Tue, 25 Aug 2026 15:22:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:35.061801
- Title: The Annotation Bottleneck in Persian Text NLP: Persian as an Annotation-Scarce Language
- Title(参考訳): ペルシャ語テキストNLPにおける注釈ボトルネック : アノテーション・スカース言語としてのペルシア語
- Abstract要約: ペルシア語は、自然言語処理における低リソース言語としてしばしば説明される。
この論文は、ペルシア語はより正確にアノテーション・スカースとして記述されていると論じている。
- 参考スコア(独自算出の注目度): 1.066291778823737
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Persian (Farsi) is often described as a low-resource language in natural language processing, but that label collapses distinct shortages into a single category. This paper argues that Persian is more precisely described as annotation-scarce, provided that the term is understood as a property of its NLP resource ecology rather than an intrinsic property of the language. The review covers 34 representative Persian text resources available by July 2026 and adds three quantitative cross-checks. First, independent web measurements place Persian among roughly the twenty most visible content languages: W3Techs reports Persian on about 0.9% of websites with a known content language, while Common Crawl CC-MAIN-2026-30 identifies Persian as the primary language of 0.7039% of HTML pages. Second, a selective speech review shows a long resource trajectory from FARSDAT to recent corpora containing hundreds or thousands of hours of speech. Third, a matched Persian-English comparison normalizes task-specific annotation volumes by relative Common Crawl web presence. The resulting ratios vary sharply: Persian syntax and news NER are comparatively dense, whereas natural-language inference falls below the web-proportional baseline. The evidence therefore does not support a simple claim that Persian is globally deficient in labeled volume. Instead, annotation scarcity is expressed through uneven task and domain coverage, incompatible schemes, access and documentation friction, and limited supervision for specialist domains, preference data, and varieties beyond standard Iranian Persian.
- Abstract(参考訳): ペルシア語 (Farsi) は、自然言語処理における低リソース言語としてしばしば言及されるが、そのラベルは異なる不足を一つのカテゴリーに分解する。
本論では,ペルシャ語は言語固有の性質ではなく,そのNLP資源生態学の特質として理解されていることを前提として,より正確にアノテーション・スカースとして記述されている。
レビューでは、2026年7月までに利用可能な34のペルシアのテキストリソースをカバーし、3つの量的クロスチェックを追加している。
W3Techsは、既知のコンテンツ言語を持つウェブサイトの約0.9%でペルシア語を報告し、Common Crawl CC-MAIN-2026-30は、HTMLページの0.7039%でペルシア語を主要な言語としている。
第2に、選択的な音声レビューは、FARSDATから数百時間から数千時間に及ぶ音声を含む最近のコーパスまでの長いリソース軌跡を示す。
第3に、マッチしたペルシア語と英語の比較は、相対的なCommon Crawl Webプレゼンスによってタスク固有のアノテーションボリュームを正規化する。
ペルシャ語の構文とニュースNERは比較的密度が高いのに対して、自然言語の推論はWebに比例する基準線以下である。
したがって、この証拠は、ペルシャ語がラベル付きボリュームで世界的に不足しているという単純な主張を支持していない。
代わりに、アノテーションの不足は、不均一なタスクとドメインのカバレッジ、互換性のないスキーム、アクセスとドキュメントの摩擦、専門ドメイン、選好データ、標準イランペルシア以外の品種の限定的な監督によって表現される。
関連論文リスト
- EDRAC: Benchmarking Arabic Dialect Reading Comprehension [43.861708347921336]
EDRACは、方言のアラビア機械読解(MRC)と生成的QAのための最初の大規模ベンチマークである。
EDRACは、自然発生の音声相互作用に由来する499の通路と、対応する4,977のQA対を含む。
その結果,意味的回答の品質と方言の忠実度の間には大きなギャップがあることがわかった。
論文 参考訳(メタデータ) (2026-09-01T11:51:49Z) - MameLoshnLM: Yiddish Language Model and Evaluation Benchmark [62.936233688546984]
We present MameLoshnLM, a first open-source 8B- parameter language model built for Yiddish。
イディッシュ語のリッチテキストの伝統にもかかわらず、そのデジタル的存在と信頼性の高い評価資源の不足は、イディッシュ語のモデリングの進歩を妨げている。
この結果は,Yiddish NLPの基礎と,歴史的にリッチだがデジタルに表現されていない言語における言語モデル開発のための実践的テンプレートの両方を提供する。
論文 参考訳(メタデータ) (2026-08-06T10:24:08Z) - Extending LLMs to New Languages: A Case Study of Llama and Persian Adaptation [36.92567530333872]
我々は,大言語モデル(LLM)に新しい言語,すなわちペルシア語を追加することを研究する。
我々は単言語ペルシャ語のデータの事前学習を含む多段階的アプローチを採用する。
生成タスクと分類タスクにおいて,各段階でのモデルの性能を評価する。
論文 参考訳(メタデータ) (2024-12-17T23:18:06Z) - FarSSiBERT: A Novel Transformer-based Model for Semantic Similarity Measurement of Persian Social Networks Informal Texts [0.0]
本稿では,ソーシャルメディアからペルシャの非公式短文間の意味的類似性を測定するための,トランスフォーマーに基づく新しいモデルを提案する。
これは、約9900万のペルシア語の非公式な短文をソーシャルネットワークから事前訓練しており、ペルシア語の一種である。
提案手法はPearsonとSpearmanの係数基準でParsBERT, laBSE, multilingual BERTより優れていた。
論文 参考訳(メタデータ) (2024-07-27T05:04:49Z) - SemRel2024: A Collection of Semantic Textual Relatedness Datasets for 13 Languages [44.017657230247934]
textitSemRelは13言語にまたがるネイティブスピーカーによって注釈付けされた新しいセマンティック関連データセットである。
これらの言語は5つの異なる言語族の出身であり、主にアフリカとアジアで話されている。
SemRelデータセットの各インスタンスは、2つの文間の意味的テキスト関連性の度合いを表すスコアに関連付けられた文対である。
論文 参考訳(メタデータ) (2024-02-13T18:04:53Z) - Graphemic Normalization of the Perso-Arabic Script [47.429213930688086]
本稿では,ペルソ・アラビア語が最良文書言語を超えて提示する課題について述べる。
自然言語処理(NLP)の状況に注目する。
ペルソ・アラビア文字ディアスポラの多言語語族8言語に対する正規化が機械翻訳および統計言語モデリングタスクに及ぼす影響を評価する。
論文 参考訳(メタデータ) (2022-10-21T21:59:44Z) - ViraPart: A Text Refinement Framework for ASR and NLP Tasks in Persian [0.0]
テキストの明確化にParsBERTを組み込んだViraPartフレームワークを提案する。
最終的に、提案されたZWNJ認識モデル、句読点復元モデル、ペルシャ・エザフ構成モデルは、それぞれ96.90%、92.13%、98.50%の平均的なF1マクロスコアを実行する。
論文 参考訳(メタデータ) (2021-10-18T08:20:40Z) - Sentiment analysis in tweets: an assessment study from classical to
modern text representation models [59.107260266206445]
Twitterで公開された短いテキストは、豊富な情報源として大きな注目を集めている。
非公式な言語スタイルや騒々しい言語スタイルといったそれらの固有の特徴は、多くの自然言語処理(NLP)タスクに挑戦し続けている。
本研究では,22データセットの豊富なコレクションを用いて,ツイートに表される感情を識別する既存言語モデルの評価を行った。
論文 参考訳(メタデータ) (2021-05-29T21:05:28Z) - The Challenges of Persian User-generated Textual Content: A Machine
Learning-Based Approach [0.0]
この研究は、ペルシャのユーザー生成テキストコンテンツがもたらすハードルに対処するために機械学習ベースのアプローチを適用します。
提示されたアプローチは、ペルシア語の感情分析を行うために機械翻訳データセットを使用する。
実験の結果は、これまでの試みとは対照的に、有望な最先端のパフォーマンスを示しています。
論文 参考訳(メタデータ) (2021-01-20T11:57:59Z) - ParsEL 1.0: Unsupervised Entity Linking in Persian Social Media Texts [6.866104126509981]
ソーシャルメディアデータの大部分は自然言語テキストである。
最近、ペルシャの知識グラフであるFarsBaseが50万近いエンティティを含む形で導入された。
本稿では,教師なしペルシャのエンティティリンクシステムを提案する。
論文 参考訳(メタデータ) (2020-04-22T19:34:13Z) - LSCP: Enhanced Large Scale Colloquial Persian Language Understanding [2.7249643773851724]
ラージスケール・コロクィアル・ペルシア語データセット」は、低リソース言語におけるコロクィアル言語を記述することを目的としている。
提案したコーパスは,2700万のツイートに解析木,音声タグ,感情の極性,5つの言語による翻訳を付加した1億2000万文からなる。
論文 参考訳(メタデータ) (2020-03-13T22:24:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。