論文の概要: AtlasNLP: A Country-Aware Atlas of Dataset Representation in NLP
- arxiv url: http://arxiv.org/abs/2608.30107v1
- Date: Mon, 31 Aug 2026 00:48:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.180484
- Title: AtlasNLP: A Country-Aware Atlas of Dataset Representation in NLP
- Title(参考訳): AtlasNLP: NLPにおけるデータセット表現の国別アトラス
- Authors: Joan Nwatu, Tsedeniya Solomon Amare, Longju Bai, Bontu Fufa Balcha, Zayd Bashir, Angana Borah, Zara Burzo, Yubin Choi, Naihao Deng, Samika Gupta, Michel Faloughi, Claude Kwizera, Ziqiao Ma, Cynthia Yacel Fuertes Panizo, Ellie Seehorn, Hui Shen, Jiayi Tang, Zesen Zhao, Boyuan Zheng, Rada Mihalcea,
- Abstract要約: AtlasNLPは、正規化されたNLPタスクカテゴリ全体で13,000以上のNLPデータセットレコードの国別アトラスである。
AtlasNLPには、人為的な参照セットであるAtlasNLP-Goldと、ACLから派生した大規模コレクションであるAtlasNLP-Coreが含まれている。
- 参考スコア(独自算出の注目度): 37.53777462173074
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding which countries are represented in NLP datasets is essential for identifying gaps, targeting data collection, measuring progress, and informing AI policy. However, geographic metadata is very rarely available, and country-level representation is often hidden behind broad language-level claims. We introduce AtlasNLP, a country-aware atlas of over 13,000 NLP dataset records across normalized NLP task categories, tracking both the populations represented and where datasets are produced. AtlasNLP includes AtlasNLP-Gold, a human-curated reference set, and AtlasNLP-Core, an ACL-derived large-scale collection. Using this resource, we show that (1) dataset coverage is highly uneven across countries and tasks; (2) dataset production and representation are geographically asymmetric; and (3) language coverage does not imply geographic representation. These findings reveal blind spots in current dataset documentation practices and motivate more explicit geographic metadata for country-aware NLP evaluation.
- Abstract(参考訳): NLPデータセットでどの国が表現されているかを理解することは、ギャップを特定し、データ収集をターゲットとし、進捗を測定し、AIポリシーを伝えるために不可欠である。
しかし、地理的メタデータは非常に稀であり、国レベルの表現は広い言語レベルのクレームの背後に隠されていることが多い。
我々は、正規化されたNLPタスクカテゴリにまたがる13,000以上のNLPデータセットの記録を国が認識するアトラスであるAtlasNLPを紹介し、表現された人口とデータセットの生成場所の両方を追跡する。
AtlasNLPには、人為的な参照セットであるAtlasNLP-Goldと、ACL由来の大規模コレクションであるAtlasNLP-Coreが含まれている。
この資源を用いて,(1) データセットのカバレッジは国やタスク間で非常に不均一であること,(2) データセットの生成と表現は地理的に非対称であること,(3) 言語カバレッジは地理的表現を含まないこと,などが示される。
これらの結果から,現在のデータセットドキュメンテーションの盲点を明らかにし,国別NLP評価のためのより明確な地理的メタデータを動機付けている。
関連論文リスト
- NordFKB: a fine-grained benchmark dataset for geospatial AI in Norway [36.2419347658476]
ノルウェーの地理空間AIのための詳細なベンチマークデータセットであるNorFKBを提示する。
データセットには36のセマンティッククラスのための詳細なアノテーションと組み合わせた高解像度の正光度が含まれている。
NordFKBは、マッピング、土地管理、空間計画におけるAIメソッドの進歩のための堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2025-12-10T18:47:25Z) - SciNLP: A Domain-Specific Benchmark for Full-Text Scientific Entity and Relation Extraction in NLP [3.806421007129287]
SciNLPは、自然言語処理(NLP)ドメインにおけるフルテキストエンティティと関係抽出のためのベンチマークである。
データセットは、手動で注釈付きフルテキストNLP出版物60からなり、7,072のエンティティと1,826の関係をカバーしている。
論文 参考訳(メタデータ) (2025-09-09T14:41:40Z) - Natural Language Processing for Dialects of a Language: A Survey [56.93337350526933]
最先端自然言語処理(NLP)モデルは、大規模なトレーニングコーパスでトレーニングされ、評価データセットで最上位のパフォーマンスを報告します。
この調査は、これらのデータセットの重要な属性である言語の方言を掘り下げる。
方言データセットにおけるNLPモデルの性能劣化と言語技術のエクイティへのその影響を動機として,我々はデータセットやアプローチの観点から,方言に対するNLPの過去の研究を調査した。
論文 参考訳(メタデータ) (2024-01-11T03:04:38Z) - Navya3DSeg -- Navya 3D Semantic Segmentation Dataset & split generation
for autonomous vehicles [63.20765930558542]
3Dセマンティックデータは、障害物検出やエゴ-車両の局所化といった中核的な認識タスクに有用である。
そこで我々は,大規模生産段階の運用領域に対応する多様なラベル空間を持つ新しいデータセットであるNavala 3D(Navya3DSeg)を提案する。
ラベルのない23のラベル付きシーケンスと25の補足シーケンスが含まれており、ポイントクラウド上の自己教師付きおよび半教師付きセマンティックセマンティックセグメンテーションベンチマークを探索するために設計された。
論文 参考訳(メタデータ) (2023-02-16T13:41:19Z) - Dataset Geography: Mapping Language Data to Language Users [17.30955185832338]
本研究では,NLPデータセットが言語話者の期待するニーズにどの程度一致しているかを定量化することを目的として,NLPデータセットの地理的代表性について検討する。
その際、エンティティ認識とリンクシステムを使用し、言語間の一貫性について重要な観察を行う。
最後に,観測された分布データセットを説明するための地理的・経済的要因について検討する。
論文 参考訳(メタデータ) (2021-12-07T05:13:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。