論文の概要: Yorùbá in Unicode: An Overview of a Problem
- arxiv url: http://arxiv.org/abs/2609.33734v1
- Date: Sun, 27 Sep 2026 16:37:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.443697
- Title: Yorùbá in Unicode: An Overview of a Problem
- Title(参考訳): Unicodeにおけるヨルバ : 問題の概要
- Abstract要約: 本論文は,出版書籍からWebプラットフォーム,モバイルキーボードに至るまで,現実世界のさまざまなコンテキストにおける障害を文書化する。
UnicodeのNFC正規化安定ポリシーを、簡単な修正を防ぐ構造的制約として識別する。
4つのコアYirb文字に対する形式的なエンコーディング要求を、解決への最も耐久性の高いパスとして提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: There is a recurrent problem in the writing of Yorùbá on the internet and on the computer that has proven intractable over the years. The language, along with other African languages that depend on diacritics for disambiguation, requires a small set of precomposed characters that Unicode does not encode. This has forced writers and digital systems to rely on combining character sequences that behave inconsistently across platforms, corrupt under font substitution, and fail in search. This paper documents that failure across a range of real world contexts, from published books to web platforms to mobile keyboards, using personal and empirical evidence. It identifies Unicode's NFC normalization stability policy as the structural constraint that prevents a straightforward fix, arguing for direct intervention of the Consortium in solving the active problem, proposing a formal encoding request for the four core Yorùbá characters as the most durable path to resolution.
- Abstract(参考訳): インターネットやコンピュータ上でのヨルバの書き直しには、長年にわたって難解であることが証明されてきた問題が繰り返されている。
この言語は、曖昧さのためにダイアクリティカルティクスに依存する他のアフリカの言語と同様に、Unicodeがエンコードしていないいくつかのプリコンプリート文字を必要とする。
これにより、書き手やデジタルシステムは、プラットフォーム間で一貫性のない動作をし、フォント置換の下で腐敗し、検索に失敗する文字列の組み合わせに頼らざるを得なくなった。
本論文は,出版書籍からWebプラットフォーム,モバイルキーボードに至るまで,実世界のさまざまな状況における障害を,個人的および実証的な証拠を用いて文書化する。
これはUnicodeのNFC正規化安定ポリシーを、直感的な修正を防ぐ構造的制約として特定し、4つのコアのヨルバ文字に対する正式なエンコーディング要求を最も永続的な解決方法として提案した。
関連論文リスト
- SEDCoT: Enhancing LLM-Based COBOL Code Translation via Symbolic Execution and Delta Debugging [49.898541267264115]
古い技術や疎結合なドキュメンテーション、開発者の引退などによって、メンテナンスはますます難しくなっている。
従来のルールベースのトランスコンパイラは、読み書きが難しい出力を出力する。
本稿では,新しいC言語翻訳フレームワークであるSEDCoTを提案する。
論文 参考訳(メタデータ) (2026-07-05T03:07:10Z) - DohaScript: A Large-Scale Multi-Writer Dataset for Continuous Handwritten Hindi Text [1.299941371793082]
531名のコントリビュータから収集した手書きHindiテキストの大規模マルチライターデータセットであるDohaScriptを紹介した。
このデータセットは平行なスタイリスティックなコーパスとして設計されており、すべてのライターが6つの伝統的なヒンディー教のドーハ(カップレット)の同じ固定セットを転写する。
DohaScriptは、低リソースのスクリプト設定で連続手書きDevanagariテキストの研究を進めるための標準化され再現可能なベンチマークとして機能することを意図している。
論文 参考訳(メタデータ) (2026-02-20T09:25:14Z) - Enhanced Generative Structure Prior for Chinese Text Image Super-resolution [101.66745917380837]
低解像度(LR)漢字の正確なストロークを復元するためのテキスト画像フレームワークを提案する。
われわれのフレームワークはこの構造をStyleGANモデルに組み込む。
私たちのコードと事前トレーニングされたモデルは、https://github.com/csi2016/MARCONetPlus.comで公開されます。
論文 参考訳(メタデータ) (2025-08-11T01:34:45Z) - Skeleton and Font Generation Network for Zero-shot Chinese Character Generation [53.08596064763731]
そこで我々は,より堅牢な漢字フォント生成を実現するために,新しいSkeleton and Font Generation Network (SFGN)を提案する。
ミススペル文字について実験を行い、その大部分は共通文字とわずかに異なる。
提案手法は、生成した画像の有効性を視覚的に実証し、現在最先端のフォント生成方法より優れていることを示す。
論文 参考訳(メタデータ) (2025-01-14T12:15:49Z) - CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving [61.73180469072787]
インド語から英語のテキストへのコード変更音声の音声翻訳(ST)の問題に焦点をあてる。
本稿では、事前訓練された自動音声認識(ASR)と機械翻訳(MT)モジュールを足場として、新しいエンドツーエンドモデルアーキテクチャCOSTAを提案する。
COSTAは、多くの競合するカスケードおよびエンドツーエンドのマルチモーダルベースラインを3.5BLEUポイントまで上回っている。
論文 参考訳(メタデータ) (2024-06-16T16:10:51Z) - Triple-Encoders: Representations That Fire Together, Wire Together [51.15206713482718]
コントラスト学習(Contrastive Learning)は、バイエンコーダを介して発話間の相対距離を埋め込み空間に符号化する表現学習法である。
本研究では,これら独立に符号化された発話から分散発話混合物を効率よく計算する三重エンコーダを提案する。
トリプルエンコーダはバイエンコーダよりも大幅に改善され、シングルベクトル表現モデルよりもゼロショットの一般化が向上することがわかった。
論文 参考訳(メタデータ) (2024-02-19T18:06:02Z) - Unicode Normalization and Grapheme Parsing of Indic Languages [2.974799610163104]
インド語の表記体系は、一意の水平単位として、複素グラフエム(complex graphemes)としても知られる正書法音節を持つ。
提案した正規化器は、以前使用したIndic normalizerよりも効率的で効果的なツールである。
本研究では,7言語スクリプトのパイプラインを報告し,さらに多くのスクリプトを統合するためのフレームワークを開発する。
論文 参考訳(メタデータ) (2023-05-11T14:34:08Z) - Beyond Arabic: Software for Perso-Arabic Script Manipulation [67.31374614549237]
ペルソ・アラビア文字を使用する言語の書き起こしシステムを操作するための有限状態トランスデューサ(FST)コンポーネントとそれに対応するユーティリティのセットを提供する。
ライブラリはまた、単純なFSTベースのロマン化と文字変換も提供する。
論文 参考訳(メタデータ) (2023-01-26T20:37:03Z) - Enhancing Indic Handwritten Text Recognition Using Global Semantic
Information [36.01828106385858]
Indicの手書きテキストを認識するために,グローバルな意味情報を抽出するために,エンコーダ・デコーダフレームワークのセマンティックモジュールを使用する。
提案するフレームワークは、10のIndic言語で書かれた手書きテキストに対して最先端の結果を得る。
論文 参考訳(メタデータ) (2022-12-15T12:53:26Z) - Inference-only sub-character decomposition improves translation of
unseen logographic characters [18.148675498274866]
ログソース言語上のニューラルマシン翻訳(NMT)は、未知の文字を翻訳する際に苦労する。
中国語と日本語のNMTにおける既存のイデオログラフに基づくサブ文字分解手法について検討する。
完全部分文字分解は文字翻訳を損なうことが多く、概して矛盾する結果をもたらす。
論文 参考訳(メタデータ) (2020-11-12T17:36:22Z) - Investigating Machine Learning Methods for Language and Dialect
Identification of Cuneiform Texts [1.2183405753834562]
VarDial 2019のCuneiform Language Identificationタスクは、cuneiformで書かれた7つの言語と方言を識別する問題に対処する。
本稿では,SharifCLチームによるVarDial 2019におけるこの問題に対するアプローチについて述べる。
論文 参考訳(メタデータ) (2020-09-22T20:17:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。