論文の概要: Romanized Arabic Across Dialects: Views, Usage Patterns, and Linguistic Variation
- arxiv url: http://arxiv.org/abs/2608.02555v1
- Date: Mon, 03 Aug 2026 17:39:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.73392
- Title: Romanized Arabic Across Dialects: Views, Usage Patterns, and Linguistic Variation
- Title(参考訳): アラビア方言のロマン化:視点, 使用形態, 言語的変化
- Abstract要約: 我々はアラビア語話者と関わり、アラビア語に対する認識と使用法についての洞察を集める。
さらに、アルジェリア語、エジプト語、レバノン語、モロッコ語、チュニジア・アラビア語に焦点をあてて、異なる方言話者の間での表記規範についても検討する。
本研究は,現在までのアラビジの認識と実践について,人間中心・言語横断研究として最大である。
- 参考スコア(独自算出の注目度): 9.224291786856323
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Arabizi refers to Arabic written in Latin script. Although previous studies have shown that the prevalence and usage of Arabizi vary by factors such as region and age group, most NLP research on Arabic texts treats it as a temporary phenomenon resulting from limited technological support for the Arabic script. In this work, we engage with Arabic speakers to collect insights on their perceptions and usage of Arabizi. We further examine writing norms among speakers of different dialects, focusing on Algerian, Egyptian, Lebanese, Moroccan, and Tunisian Arabic. To this end, we release two resources. First, a character-level alignment of Arabic words to study inter- and intra-dialectal variation across these five dialects, based on words transliterated by survey participants, finding systematic intra-dialectal regularity and inter-dialectal variation. Second, to study Arabic speakers' ability to identify this stylistic variation at the sentence-level, we build a manually curated parallel corpus of sentences written in Arabic script alongside multiple Arabizi transliterations, collected from speakers of the same five dialects. Our study presents the largest human-centered, cross-dialectal study of Arabizi's perceptions and practices to date.
- Abstract(参考訳): アラビジはラテン文字で書かれたアラビア語を指す。
以前の研究では、アラビジの流行と利用は地域や年齢などの要因によって異なることが示されているが、アラビア文字に関するほとんどのNLP研究は、アラビア文字の技術的サポートが限られているため、一時的な現象として扱っている。
本研究ではアラビア語話者と交流し、アラブ語話者の認識と使用法についての洞察を収集する。
さらに、アルジェリア語、エジプト語、レバノン語、モロッコ語、チュニジア・アラビア語に焦点をあてて、異なる方言話者の間での表記規範についても検討する。
この目的のために、私たちは2つのリソースをリリースします。
まず,アラビア語の単語の文字レベルのアライメントを行い,これらの5方言の言語間および方言内変化を調査し,調査参加者が翻訳した単語に基づいて,体系的な方言内規則性および方言間変分を見いだした。
第2に、アラビア語話者のこの文レベルでのスタイル変化を識別する能力を研究するために、同じ5つの方言の話者から収集された複数のアラビジ文字と共に、アラビ文字で書かれた文章のパラレルコーパスを手作業で作成する。
本研究は,現在までのアラビジの認識と実践について,人間中心・言語横断研究として最大である。
関連論文リスト
- AraMIP: Extending MIPVU Towards Metaphor Identification in Arabic [2.9389189107560862]
本稿ではアラビアメタファー同定法(AraMIP)を提案する。
Isti'ara(メタホル)、kinaya(メタミー/間接表現)、tashbih(シミレ)の3つの主要なアラビア語型を区別する。
本分析では, アラビア語固有の課題として, 形態的複雑性, 辞書知覚順序の不整合, およびアノテータの標準的な文脈資料の欠如などを明らかにした。
論文 参考訳(メタデータ) (2026-09-15T14:14:10Z) - DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models [54.10223256792762]
アラビア方言における大規模言語モデル(LLM)の性能評価のための新しいベンチマークであるDialectalArabicMMLUを提案する。
MMLU-Redux フレームワークを手動で翻訳し、3K 個の質問応答対を5つの主要な方言に適応することで拡張する。
論文 参考訳(メタデータ) (2025-10-31T15:17:06Z) - Arabizi vs LLMs: Can the Genie Understand the Language of Aladdin? [0.4751886527142778]
アラビジはラテン文字と数字を含むアラビア語のハイブリッド形である。
機械翻訳には形式的な構造が欠如しているため、大きな課題がある。
本研究は、アラビジ語を現代標準アラビア語と英語の両方に翻訳する際のモデルの性能について検討する。
論文 参考訳(メタデータ) (2025-02-28T11:37:52Z) - Second Language (Arabic) Acquisition of LLMs via Progressive Vocabulary Expansion [70.23624194206171]
本稿では,アラブ世界における大規模言語モデル(LLM)の民主化の必要性に対処する。
アラビア語のLLMの実用的な目的の1つは、復号を高速化するトークン化器にアラビア語固有の語彙を使用することである。
第二言語(アラビア語)による人への獲得の間に語彙学習に触発されたAraLLaMAは、進歩的な語彙拡張を採用している。
論文 参考訳(メタデータ) (2024-12-16T19:29:06Z) - Exploiting Dialect Identification in Automatic Dialectal Text Normalization [9.320305816520422]
我々は、方言アラビア語を標準オーソグラフィー(CODA)に標準化することを目指している。
我々はCODAフィケーションのタスクに基づいて,新たに開発されたシーケンス・ツー・シーケンスのモデルをベンチマークした。
方言識別情報を使用することで,すべての方言のパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2024-07-03T11:30:03Z) - ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic [51.922112625469836]
アラビア語における最初のマルチタスク言語理解ベンチマークである、データセット名を提案する。
我々のデータは、現代標準アラビア語(MSA)における40のタスクと14,575のマルチチョイス質問で構成されており、地域の母語話者と協調して慎重に構築されている。
35モデルについて評価した結果,特にオープンソースモデルにおいて,改善の余地がかなり高いことが判明した。
論文 参考訳(メタデータ) (2024-02-20T09:07:41Z) - ALDi: Quantifying the Arabic Level of Dialectness of Text [17.37857915257019]
我々は、アラビア語話者が方言のスペクトルを知覚し、文レベルでアラビア方言レベル(ALDi)として機能すると主張している。
AOC-ALDiの詳細な分析を行い、訓練したモデルが他のコーパスの方言のレベルを効果的に識別できることを示す。
論文 参考訳(メタデータ) (2023-10-20T18:07:39Z) - AceGPT, Localizing Large Language Models in Arabic [73.39989503874634]
本稿では,アラビア語のテキストによる事前学習,ネイティブなアラビア語命令を利用したSFT(Supervised Fine-Tuning),アラビア語のGPT-4応答を含む総合的なソリューションを提案する。
目標は、文化的に認知され、価値に整合したアラビア語のLLMを、多様で応用特有のアラビア語コミュニティのニーズに適応させることである。
論文 参考訳(メタデータ) (2023-09-21T13:20:13Z) - Beyond Arabic: Software for Perso-Arabic Script Manipulation [67.31374614549237]
ペルソ・アラビア文字を使用する言語の書き起こしシステムを操作するための有限状態トランスデューサ(FST)コンポーネントとそれに対応するユーティリティのセットを提供する。
ライブラリはまた、単純なFSTベースのロマン化と文字変換も提供する。
論文 参考訳(メタデータ) (2023-01-26T20:37:03Z) - Graphemic Normalization of the Perso-Arabic Script [47.429213930688086]
本稿では,ペルソ・アラビア語が最良文書言語を超えて提示する課題について述べる。
自然言語処理(NLP)の状況に注目する。
ペルソ・アラビア文字ディアスポラの多言語語族8言語に対する正規化が機械翻訳および統計言語モデリングタスクに及ぼす影響を評価する。
論文 参考訳(メタデータ) (2022-10-21T21:59:44Z) - Automatic Arabic Dialect Identification Systems for Written Texts: A
Survey [0.0]
アラビア語の方言識別は自然言語処理の特定のタスクであり、与えられたテキストのアラビア語方言を自動的に予測することを目的としている。
本稿では,アラビア語の方言識別研究をテキストで包括的に調査する。
本稿では、従来の機械学習手法、ディープラーニングアーキテクチャ、アラビア方言識別のための複雑な学習アプローチについてレビューする。
論文 参考訳(メタデータ) (2020-09-26T15:33:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。