論文の概要: Ossetic-COT: Designing a morphologically annotated corpus and morphological analyzer for Ossetic
- arxiv url: http://arxiv.org/abs/2607.04895v2
- Date: Tue, 07 Jul 2026 10:19:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.314816
- Title: Ossetic-COT: Designing a morphologically annotated corpus and morphological analyzer for Ossetic
- Title(参考訳): Ossetic-COT:Osseticのための形態的注釈コーパスと形態学的解析器の設計
- Authors: Anna Shatskikh, Alexey Sorokin,
- Abstract要約: ユニバーサル依存スキーマに準拠したIron Osseticのための形態的注釈付きコーパスを初めて提示する。
コーパスには、74032トークンを含むIron Ossetic Corpus of Oral Textsの5454の注釈文が含まれている。
- 参考スコア(独自算出の注目度): 0.2578242050187029
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this work we present the first morphologically annotated corpus for Iron Ossetic that conforms to the Universal Dependencies schema. The corpus includes 5454 manually annotated sentences from the Iron Ossetic Corpus of Oral Texts, containing 74032 tokens. We use this corpus to train a BERT-based morphological analyzer. The analyzer achieves tag accuracy of 95.60%.
- Abstract(参考訳): 本研究では,Universal Dependenciesスキーマに準拠したIron Osseticのための形態的注釈付きコーパスを初めて提示する。
コーパスには、74032トークンを含むIron Ossetic Corpus of Oral Textsの5454の注釈文が含まれている。
我々はこのコーパスを用いて、BERTベースの形態解析器を訓練する。
解析器は、タグ精度95.60%を達成する。
関連論文リスト
- PEACH: A sentence-aligned Parallel English-Arabic Corpus for Healthcare [0.0]
PEACHは、英語とアラビア語の平行した医療テキストのコーパスである。
コーパスには51,671のパラレルな文があり、約590,517の英語と567,707のアラビア語の単語トークンがある。
論文 参考訳(メタデータ) (2025-08-07T14:49:48Z) - The Russian Legislative Corpus [0.0]
コーパスは281,413通のテキスト(176,523,268通のトークン)とメタデータを収集する。
コーパスには、最小限の事前処理を備えた原文と、モルフォシンタクティックマークアップを用いた言語解析のためのバージョンの2つのバージョンがある。
論文 参考訳(メタデータ) (2024-06-07T11:38:12Z) - Homonym Sense Disambiguation in the Georgian Language [49.1574468325115]
本研究は,ジョージア語における単語センス曖昧化(WSD)課題に対する新しいアプローチを提案する。
これは、ジョージアのCommon Crawls corpusをフィルタリングすることによって形成されたデータセットに基づいて、事前訓練されたLarge Language Model(LLM)の教師付き微調整に基づいている。
論文 参考訳(メタデータ) (2024-04-24T21:48:43Z) - A Corpus for Sentence-level Subjectivity Detection on English News Articles [49.49218203204942]
我々はこのガイドラインを用いて、議論を呼んだ話題に関する英ニュース記事から抽出した638の目的語と411の主観的な文からなるNewsSD-ENGを収集する。
我々のコーパスは、語彙や機械翻訳といった言語固有のツールに頼ることなく、英語で主観的検出を行う方法を舗装している。
論文 参考訳(メタデータ) (2023-05-29T11:54:50Z) - Explaining Latent Representations with a Corpus of Examples [72.50996504722293]
本稿では,サンプルベースの説明を自由に選択されたサンプル集合を参照して提供するユーザ中心の手法であるSimplExを提案する。
SimplExは、ポストホックな説明で潜伏空間に対するユーザの理解を改善するためにコーパスを使用する。
SimplExは,モデル表現を説明するコーパス内の関連パターンを強調表示することで,ユーザを力づけることを示す。
論文 参考訳(メタデータ) (2021-10-28T17:59:06Z) - An analysis of full-size Russian complexly NER labelled corpus of
Internet user reviews on the drugs based on deep learning and language neural
nets [94.37521840642141]
我々は、インターネットユーザーレビューのフルサイズのロシアの複雑なNERラベルコーパスを提示します。
高度なディープラーニングニューラルネットワークセットは、ロシアのテキストから薬理学的に有意義な実体を抽出するために使用される。
論文 参考訳(メタデータ) (2021-04-30T19:46:24Z) - Validation and Normalization of DCS corpus using Sanskrit Heritage tools
to build a tagged Gold Corpus [0.0]
デジタル・コーパス・オブ・サンスクリット(Digital Corpus of Sanskrit)は、その形態的および語彙的タグ付けとともに約65万の文を記録している。
サンスクリット・ヘリテージ・エンジン(英語版)の読者は、形態学的および語彙的分析を伴うあらゆる可能な区分を生産している。
論文 参考訳(メタデータ) (2020-05-13T19:23:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。