論文の概要: Digital diglossia: Arabic between X and Facebook
- arxiv url: http://arxiv.org/abs/2609.28352v1
- Date: Wed, 23 Sep 2026 16:25:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.119849
- Title: Digital diglossia: Arabic between X and Facebook
- Title(参考訳): デジタルデジカメ:XとFacebookの間のアラビア語
- Abstract要約: 本研究は, 標準アラビア語 (SA; H(igh) 変種) と口語アラビア語 (CA; L(ow) 変種) の分布をXとFacebookで明らかにした。
16754のパブリックポストがPython経由で収集され、10000がネットデータセットとして保持された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: This study highlights the distribution of Standard Arabic (SA; H(igh) variety) and Colloquial Arabic (CA; L(ow) variety) across X and Facebook. 16754 public posts were collected via Python, with 10000 retained as the net dataset. Posts were classified into 7 discourse categories: *politics, technology, science, business, culture, fun,* and *sports*. Bivariate analyses, including Chi-square tests and Cramer's V (CV), examined associations among platform, discourse category, and diglossic choice, while binary logistic regression with Platform x Discourse Category interactions tested whether these associations varied across platforms. Findings reveal that there are significant associations between discourse category and diglossic choice on X, chi-square(6, *N* = 5000) = 600.35, p < .001, CV = .347, and Facebook, chi-square(6, N = 5000) = 1249.52, p < .001, CV = .500. Across platforms, platform was also associated with diglossic choice, chi-square(1, N = 10000) = 262.16, p < .001, CV = .162. Binary logistic regression further shows higher odds of SA use on X than Facebook in the political reference category (*OR* = 1.31, p = .0028), with significant platform-by-domain interactions for Culture (OR = 2.65), Fun (*OR* = 6.34), Sports (*OR* = 26.71), Science (OR = 0.41), and Technology (OR = 0.71). The study concludes that the diglossic use of SA and CA contributes to the growing body of research on digital discourse, unveiling that the digital age reshapes but does not erode diglossic boundaries, giving rise instead to a reconfigured digital diglossia.
- Abstract(参考訳): 本研究は, 標準アラビア語 (SA; H(igh) 変種) と口語アラビア語 (CA; L(ow) 変種) の分布をXとFacebookで明らかにした。
16754のパブリックポストがPython経由で収集され、10000がネットデータセットとして保持された。
投稿は、政治、技術、科学、ビジネス、文化、楽しみ、スポーツ*の7つのカテゴリーに分類された。
Chi-square test や Cramer's V (CV) などの二変量解析では, プラットフォーム間の関係, 談話カテゴリ, 地質学的選択について検討した。
発見によると、X 上での談話圏と厳密な選択の間には、chi-square(6, *N* = 5000) = 600.35, p < .001, CV = .347, Facebook, chi-square(6, N = 5000) = 1249.52, p < .001, CV = .500 がある。
プラットフォーム全体でも、プラットフォームは高名な選択(chi-square(1, N = 10000) = 262.16, p < .001, CV = .162)と関連付けられていた。
バイナリロジスティック回帰は、文化(OR = 2.65)、ファン(*OR* = 6.34)、スポーツ(*OR* = 26.71)、サイエンス(OR = 0.41)、テクノロジー(OR = 0.71)のための重要なプラットフォーム間相互作用を持つ政治的参照カテゴリ(*OR* = 1.31, p = .0028)において、Facebookよりも高いSAの使用確率を示す。
この研究は、SAとCAの豪華な使用がデジタル談話の研究の成長に寄与し、デジタル年齢が好ましくないが、豪華な境界を逸脱せず、代わりに再構成されたデジタルの豪華さをもたらすことを明らかにしている。
関連論文リスト
- Cohesion-6K: An Arabic Dataset for Analyzing Social Cohesion and Conflict in Online Discourse [0.6546712656847457]
本稿では,パレスチナのイスラエル占領に関連する6万件の公的なFacebook投稿の,手動およびChatGPTによる注釈付きデータセットを提案する。
Cohesion-6Kは、オンライン凝集と分極の研究のために透明で再現可能な資源を提供する。
論文 参考訳(メタデータ) (2026-05-21T13:16:28Z) - Machine learning and emoji prediction: How much accuracy can MARBERT achieve? [0.0]
本研究では,(最先端)MARBERTモデルを用いたアラビア語ツイートにおける絵文字の予測について検討した。
複数のアラビア方言を表す11379のCAツイートのコーパスがPython経由でX.comから収集された。
前処理パイプラインは解釈可能なベースラインとして設計され,語彙的特徴と絵文字のカテゴリの関係を調べることができる。
論文 参考訳(メタデータ) (2026-04-22T21:51:49Z) - The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models [12.320824168302908]
本研究では,8つの言語モデル(LLM)の言語性現象を体系的に解析する。
本研究は,VTI (Verbal Tic Index) を用いて, 梅毒の有病率を定量化し, 梅毒, 語彙の多様性, 人間の知覚する自然性との相関を解析した。
論文 参考訳(メタデータ) (2026-04-21T06:43:01Z) - PerSoMed: A Large-Scale Balanced Dataset for Persian Social Media Text Classification [0.052017164170440056]
本研究は,ペルシア初の大規模かつバランスの取れたソーシャルメディアテキスト分類データセットを紹介する。
このデータセットは、9つのカテゴリ(経済、芸術、スポーツ、政治、社会、健康、心理学、歴史、科学技術)にわたる36,000のポストで構成されている。
論文 参考訳(メタデータ) (2026-02-22T20:53:08Z) - SenWave: A Fine-Grained Multi-Language Sentiment Analysis Dataset Sourced from COVID-19 Tweets [42.98177831933239]
SenWaveは、新型コロナウイルス(COVID-19)のツイートを分析するために特別に設計された、新しい微粒な多言語感情分析データセットである。
このデータセットは、英語とアラビア語でそれぞれ1万の注釈付きツイートと、スペイン語、フランス語、イタリア語で3万の翻訳ツイートで構成されている。
本研究は,言語,国,トピック間の進化する情緒的景観を詳細に分析し,時間とともに重要な洞察を明らかにする。
論文 参考訳(メタデータ) (2025-10-09T13:38:05Z) - Lost in Translation, Found in Spans: Identifying Claims in Multilingual
Social Media [40.26888469822391]
クレームスパン識別(CSI)は、ファクトチェックパイプラインの重要なステップである。
ジャーナリストや人間のファクトチェッカーにとって重要な問題だが、いまだに過小評価されている問題である。
我々は、多くのソーシャルメディアプラットフォームから5つのインド語と英語で収集された7Kの現実世界のクレームからなる、新しいデータセットX-CLAIMを作成します。
論文 参考訳(メタデータ) (2023-10-27T15:28:12Z) - Unsupervised Sentiment Analysis of Plastic Surgery Social Media Posts [91.3755431537592]
ソーシャルメディアプラットフォームにまたがる膨大なユーザー投稿は、主に人工知能(AI)のユースケースに使われていない。
自然言語処理(NLP)は、コーパス(corpora)として知られるドキュメントの体系を利用して、人間のような言語理解でコンピュータを訓練するAIのサブフィールドである。
本研究は, 教師なし解析の応用により, コンピュータがプラスティック手術に対する否定的, 肯定的, 中立的なユーザ感情を予測できることを示した。
論文 参考訳(メタデータ) (2023-07-05T20:16:20Z) - Transformer-based Model for Word Level Language Identification in
Code-mixed Kannada-English Texts [55.41644538483948]
コードミキシングしたカンナダ英語テキストにおける単語レベル言語識別のためのトランスフォーマーベースモデルを提案する。
The proposed model on the CoLI-Kenglish dataset achieves a weighted F1-score of 0.84 and a macro F1-score of 0.61。
論文 参考訳(メタデータ) (2022-11-26T02:39:19Z) - A Massively Multilingual Analysis of Cross-linguality in Shared
Embedding Space [61.18554842370824]
言語間モデルでは、多くの異なる言語に対する表現は同じ空間に存在している。
我々は,bitext検索性能の形式で,言語間アライメントのタスクベース尺度を計算した。
我々はこれらのアライメント指標の潜在的な予測因子として言語的、準言語的、および訓練関連の特徴について検討する。
論文 参考訳(メタデータ) (2021-09-13T21:05:37Z) - How True is GPT-2? An Empirical Analysis of Intersectional Occupational
Biases [50.591267188664666]
下流のアプリケーションは、自然言語モデルに含まれるバイアスを継承するリスクがある。
一般的な生成言語モデルであるGPT-2の作業バイアスを分析した。
特定の仕事について、GPT-2は米国におけるジェンダーと民族の社会的偏見を反映しており、場合によってはジェンダー・パリティの傾向を反映している。
論文 参考訳(メタデータ) (2021-02-08T11:10:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。