論文の概要: The Morphological Core of Dungan: A Two-Dialect Finite-State Model and a Multi-Genre Evaluation
- arxiv url: http://arxiv.org/abs/2607.28766v1
- Date: Thu, 30 Jul 2026 18:35:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.436065
- Title: The Morphological Core of Dungan: A Two-Dialect Finite-State Model and a Multi-Genre Evaluation
- Title(参考訳): ダンガンの形態コア:2次元有限状態モデルと多世代評価
- Abstract要約: ダンガン語 (Dungan) は中央アジアのシニト語で、キリル文字で書かれている。
本稿では,有限状態形態解析器を計測器として利用する。
- 参考スコア(独自算出の注目度): 8.271866111695049
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dungan, a Sinitic language of Central Asia written in a Cyrillic-based script, is described in detail in the grammatical literature, yet the quantitative properties of its morphology in actual usage have, to the best of our knowledge, never been measured systematically. This paper uses a finite-state morphological analyzer as a measuring instrument. Implemented with HFST and covering both dialect groups (the Gansu variety, which is the literary standard, and the Shaanxi variety), the model offers no new grammatical description; it formalises the knowledge accumulated in Dungan studies and makes it measurable on corpora of three genres. Three results follow. Overt inflection is rare and limited: only 9.3% of recognized tokens in the encyclopaedic register have an overt marker, the system has just ten categories, and degree marking is almost absent. Ambiguity is genuine but sharply localized: 78.1% of tokens receive a single analysis, and the residue sits almost entirely on two clitics, -di (genitive/progressive) and -ni (locative/prospective). And the grammatical core proves effectively closed, the claim the instrument is really needed for: between 78% and 95% of the tokens the analyzer fails on, depending on register, are simply absent from the lexicon, and the phenomena the model deliberately declines to implement account for at most 4.5% of those failures. Held-out coverage (80 to 85%) is no lower than development coverage (73%), while a stem list with no morphology already reaches 67.4%, so the morphology is worth 5.2 points. The open frontier of Dungan is lexical. The analyzer, its sources and every evaluation script are released openly.
- Abstract(参考訳): 中央アジアの新言語ダンガン(Dungan)はキリル文字ベースの文字で書かれており、文法文献に詳細に記述されているが、実際の用法におけるその形態の量的特性は、私たちの知る限りでは、体系的に測定されることはなかった。
本稿では,有限状態形態解析器を計測器として利用する。
HFSTに実装され、両方の方言群(文体標準であるガンス種とシャアンシ種)をカバーし、ダンガン研究に蓄積された知識を定式化し、3つのジャンルのコーパスで測定できるようにする。
3つの結果が続く。
百科事典レジスタの認識トークンの9.3%だけがオーバートマーカーを持ち、システムは10のカテゴリしか持たず、度数マーキングはほとんど欠落している。
78.1%のトークンは1つの分析を受けており、残基はほとんどが2つのクリケット、-di(ジェネティヴ/プログレッシブ)と-ni(位置/プロスペクティヴ)の上に置かれている。
そして、文法コアが効果的に閉じていることが証明され、この装置が本当に必要な主張である: レジスタによっては、分析者が失敗するトークンの78%から95%は、単に辞書から欠落しており、これらの障害の少なくとも4.5%は、故意にモデルが実装を辞退する現象である。
80~85%のHeld-outカバレッジは開発カバレッジ (73%) よりも低くはないが、形態素を持たないステムリストは67.4%に達しており、形態素は5.2ポイントの価値がある。
ダンガンのオープンフロンティアはレキシカルである。
アナライザ、ソース、すべての評価スクリプトは、オープンにリリースされる。
関連論文リスト
- Beyond the Name: Demographic Leakage in De-Identified Résumés and Evaluation Artifacts in LLM Bias Audits [4.736836688901646]
本研究では,9つのオープンウェイトモデルと620レサムモデルにおいて,言語フィールドの除去がリークを解消するか否かを検討する。
5つの民族的条件と3つのクエー・サリエンス層にまたがる非構造的散文を分離した。
目標グループの回復平均は0.757であり、高塩分下では1.000で飽和する。
論文 参考訳(メタデータ) (2026-09-15T01:48:44Z) - Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking [53.172843070114475]
グラウンドをリンクするマルチモーダルエンティティは、テキストや画像から知識ベースのエントリに言及する。
これらのシステムは希少なエンティティで分解されるが、以前の作業は主にページビューのような人気ベースのメトリクスによって、希少性を測定する。
我々は、エンティティがいかにドキュメント化され、接続されているかをキャプチャする知識グラフ構造メトリクスを使用して、この見解を広げる。
その結果得られた希薄なスライス全体において、最先端の精度は15.4-39.9%低下し、異なる希薄な定義が異なる障害モードを示すことを示した。
論文 参考訳(メタデータ) (2026-09-09T18:41:35Z) - Beyond Fluency: A Rubric-Based Benchmark for Evaluating Saudi Dialect and Cultural Competence in Large Language Models [0.37331950863394864]
サウジアラビア方言の古風なベンチマークを示す。
9カテゴリの分類で466のエラー事例を分類する。
一貫性に反するトレードオフとモデル固有のエラーシグネチャを観察する。
論文 参考訳(メタデータ) (2026-08-30T19:31:35Z) - QuechuaTok: Morphological Boundary Accuracy as a Necessary Metric for Tokenizer Evaluation in Agglutinative Low-Resource Languages [0.0]
トークン化はNLPパイプラインの基本的なステップであるが、受精率などの標準的な評価指標では、凝集性言語の形態的正しさを捉えることができない。
南アメリカの8~10万人が話していた低リソースの凝集言語であるSouthern Quechua(quz)の4つのトークン化戦略を比較したベンチマークを提示する。
論文 参考訳(メタデータ) (2026-06-22T21:04:48Z) - PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions [48.69228180369574]
PersLitEvalは8つのきめ細かいカテゴリにわたる4,514のペルシア文学の多重選択質問のベンチマークである。
課題の難易度を3段階に分けて,カテゴリーレベルの相違が顕著であることを示す。
エラー解析では、意味的理解のギャップ、形式的言語的知識のギャップ、カウント/列挙エラーの3つの障害モードを識別する。
論文 参考訳(メタデータ) (2026-05-26T13:34:19Z) - BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation [34.429649156970015]
以前の評価では、検索なしでベースモデルをテストしたが、これは現在の慣行を反映していない。
3つの検索可能なフロンティアモデルでは、9つのフィールドと6方向のエラー分類に基づいてBibエントリを生成する。
全体的な精度は83.6%だが、完全な正確さは50.9%に過ぎない。
論文 参考訳(メタデータ) (2026-04-03T16:30:58Z) - Repetition Without Exclusivity: Scale Sensitivity of Referential Mechanisms in Child-Scale Language Models [0.0]
子ども指向音声で訓練された言語モデルにおいて、相互排他性は参照抑制として機能する。
子指向音声における分布学習は、語彙的排他性よりも反復に基づく参照追跡を生成する。
我々は、参照グラウンドディングは、ナチビストではなく、必要な入力構造に関する実証的な主張であるMEにとって必要な要素であるかもしれないと論じる。
論文 参考訳(メタデータ) (2026-03-14T01:59:50Z) - Generalization Gaps in Political Fake News Detection: An Empirical Study on the LIAR Dataset [0.764671395172401]
LIARベンチマークを用いて,9つの機械学習アルゴリズムの診断評価を行った。
モデルの重み付きF1スコアを超えないきめ細かい分類の「パフォーマンスシーリング」を発見した。
木に基づくアンサンブルの大規模な"一般化ギャップ"は、99%以上のトレーニング精度を達成したが、テストデータで約25%に崩壊した。
論文 参考訳(メタデータ) (2025-12-20T23:08:18Z) - Computational Linguistics Meets Libyan Dialect: A Study on Dialect Identification [0.0]
使用されるデータセットはQADIコーパスであり、18のアラビア方言で54万の文からなる。
カイ二乗分析の結果,メールの言及や感情指標などの特定の特徴が方言の分類に大きく関連していないことが明らかとなった。
分類実験の結果、MNB(Multinomial Naive Bayes)は85.89%の精度を達成した。
論文 参考訳(メタデータ) (2025-12-03T20:54:06Z) - Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking [68.77659513993507]
我々は,多言語ASRの精度を向上させるため,単純かつ効果的なN-best再分類手法を提案する。
その結果, 音声認識の精度は8.7%, 6.1%, 単語誤り率は3.3%, 単語誤り率は2.0%であった。
論文 参考訳(メタデータ) (2024-09-27T03:31:32Z) - We're Afraid Language Models Aren't Modeling Ambiguity [136.8068419824318]
あいまいさの管理は人間の言語理解の重要な部分です。
文中のあいまいさは,他の文との係り受け関係に与える影響によって特徴付けられる。
我々は,多ラベルNLIモデルが曖昧さによって誤解を招く野生の政治的主張にフラグを付けることができることを示す。
論文 参考訳(メタデータ) (2023-04-27T17:57:58Z) - Holistic Evaluation of Language Models [183.94891340168175]
言語モデル(LM)は、ほとんどすべての主要言語技術の基盤となっているが、その能力、制限、リスクはよく理解されていない。
本稿では,言語モデルの透明性を向上させるために,言語モデルの完全性評価(HELM)を提案する。
論文 参考訳(メタデータ) (2022-11-16T18:51:34Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。