論文の概要: Character Iconicity vs. Arbitrariness: An Arabic NLP Perspective
- arxiv url: http://arxiv.org/abs/2608.02935v1
- Date: Mon, 03 Aug 2026 22:47:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.955584
- Title: Character Iconicity vs. Arbitrariness: An Arabic NLP Perspective
- Title(参考訳): キャラクタ・イコニシティ対アービタリネス:アラビアのNLP観
- Abstract要約: 点のないアラビア語は、自然言語処理において読みやすく、効果的であることを示します。
我々は、標準的な点と点のないアラビア文字と、同じ19の未対応のラスムに制約された任意の文字のリマッピングを比較した。
以上の結果から,NLPの性能向上には,原文字の区別を保たず,従来のラスムに基づくグループ化を保たないことが示唆された。
- 参考スコア(独自算出の注目度): 1.827423028648118
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Arabic script uses 28 letters, many of which share a common base shape (rasm) and are distinguished only by dot placement. Because early Arabic manuscripts were written without dots yet remained interpretable, dot removal offers a natural test of whether these visual distinctions are functionally necessary. Prior work has shown that dotless Arabic can remain readable and effective for natural language processing (NLP), but it remains unclear whether this success depends on preserving the original rasm groupings or whether arbitrary but consistent remappings to the same reduced rasm set can achieve comparable performance. We address this question by comparing standard dotted and dotless Arabic with arbitrary character remappings constrained to the same 19 undotted rasms. We generated 2,000 random remappings under word- and character-level tokenization and selected four representative mappings with the highest and lowest entropy values. These representations were evaluated across language modeling, text classification, sequence labeling, machine translation, and restoration to the original script. The results show that neither preserving original character distinctions nor retaining traditional rasm-based groupings is necessary for strong NLP performance. Random remappings achieve competitive performance while reducing vocabulary size, out-of-vocabulary (OOV) rates, model size, and training cost. These findings suggest that, from an NLP perspective, Arabic character form-function relationships are largely arbitrary: models rely more on stable distributional structure than on the visual iconicity of letter forms.
- Abstract(参考訳): アラビア文字は28文字を使用しており、多くは共通の基形(ラスム)を共有しており、ドット配置によって区別されている。
初期のアラビア文字の写本は、ドットがまだ解釈できないまま書かれていたため、ドット除去はこれらの視覚的区別が機能的に必要かどうかの自然なテストを提供する。
以前の研究は、ドットレスアラビア語が自然言語処理(NLP)において読みやすく有効であることを示してきたが、この成功が元のラスム・グループ化を保存することに依存しているのか、同じラスム・セットに任意だが一貫した再マッピングが同等のパフォーマンスを達成できるのかは定かではない。
この問題は、標準のドットとドットレスのアラビア文字と、同じ19の未対応のラスムに制約された任意の文字のリマッピングを比較することで解決する。
単語レベルのトークン化と文字レベルのトークン化により2000個のランダムリマッピングを生成し,最も高いエントロピー値と低いエントロピー値の4つの代表写像を選択した。
これらの表現は、言語モデリング、テキスト分類、シーケンスラベリング、機械翻訳、オリジナルのスクリプトの復元で評価された。
以上の結果から,NLPの性能向上には,原文字の区別を保たず,従来のラスムに基づくグループ化を保たないことが示唆された。
ランダムリマッピングは、語彙サイズ、語彙外レート(OOV)、モデルサイズ、トレーニングコストを削減しながら、競争性能を達成する。
これらの結果は、NLPの観点から、アラビア文字の形式と機能の関係は概ね任意であることが示唆された。
関連論文リスト
- HeQ: a Large and Diverse Hebrew Reading Comprehension Benchmark [54.73504952691398]
我々は,抽出質問としてヘブライ語機械読解データセットの提供に着手した。
ヘブライ語の形態学的に豊かな性質はこの努力に挑戦している。
我々は,新しいガイドラインのセット,制御されたクラウドソーシングプロトコル,評価基準の改訂を考案した。
論文 参考訳(メタデータ) (2025-08-03T15:53:01Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Lemmatization as a Classification Task: Results from Arabic across Multiple Genres [9.896789483253189]
アラビア語のような曖昧な正書法を持つ形態学的に豊かな言語におけるNLPタスクには、レマタイゼーションが不可欠である。
本稿では,Lemma-POS-Gloss (LPG) タグセットの分類として,補題化を枠組み化する2つの新しい手法を提案する。
また、既存のデータセットと共に標準化された様々なジャンルをカバーする新しいアラビア語の補題化テストセットも提示する。
論文 参考訳(メタデータ) (2025-06-23T08:34:33Z) - ArabianGPT: Native Arabic GPT-based Large Language Model [2.8623940003518156]
本稿ではアラビアンLLMスイート内の一連のトランスフォーマーモデルであるアラビアンGPTを提案する。
これらのモデルに不可欠なアラナイザー・トークンーザはアラビア文字のユニークな形態的側面に対処する。
感情分析では、微調整されたアラビアのGPT-0.1Bモデルは95%の顕著な精度を達成し、ベースモデルの56%から大幅に増加した。
論文 参考訳(メタデータ) (2024-02-23T13:32:47Z) - Graphemic Normalization of the Perso-Arabic Script [47.429213930688086]
本稿では,ペルソ・アラビア語が最良文書言語を超えて提示する課題について述べる。
自然言語処理(NLP)の状況に注目する。
ペルソ・アラビア文字ディアスポラの多言語語族8言語に対する正規化が機械翻訳および統計言語モデリングタスクに及ぼす影響を評価する。
論文 参考訳(メタデータ) (2022-10-21T21:59:44Z) - Quark: Controllable Text Generation with Reinforced Unlearning [68.07749519374089]
大規模言語モデルは、しばしばユーザの期待に合わない振る舞いを学ぶ。
本稿では,(不必要な)特性を定量化する報酬関数を最適化するアルゴリズムQuarkを紹介する。
未学習の毒性、ネガティブな感情、反復について、我々の実験はQuarkが強いベースラインと最先端の強化学習法の両方より優れていることを示している。
論文 参考訳(メタデータ) (2022-05-26T21:11:51Z) - Word Shape Matters: Robust Machine Translation with Visual Embedding [78.96234298075389]
文字レベルNLPモデルの入力シンボルを新たに符号化する。
文字が印刷されたときの画像を通して各文字の形状をエンコードする。
我々はこの新たな戦略を視覚的埋め込みと呼び、NLPモデルの堅牢性を向上させることが期待されている。
論文 参考訳(メタデータ) (2020-10-20T04:08:03Z) - Neural Computing for Online Arabic Handwriting Character Recognition
using Hard Stroke Features Mining [0.0]
オンラインアラビア文字認識における書字ストローク特徴の垂直方向と水平方向から所望の臨界点を検出する方法を提案する。
バックプロパゲーション学習アルゴリズムと修正シグモイド関数に基づくアクティベーション関数を備えた多層パーセプトロンを用いて、文字の分類のためにこれらのトークンから最小の特徴セットを抽出する。
提案手法は,文字認識技術に匹敵する98.6%の平均精度を実現する。
論文 参考訳(メタデータ) (2020-05-02T23:17:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。