論文の概要: AtlasNLP: A Country-Aware Atlas of Dataset Representation in NLP
- arxiv url: http://arxiv.org/abs/2608.30107v2
- Date: Tue, 08 Sep 2026 20:29:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 15:10:00.748353
- Title: AtlasNLP: A Country-Aware Atlas of Dataset Representation in NLP
- Title(参考訳): AtlasNLP: NLPにおけるデータセット表現の国別アトラス
- Abstract要約: AtlasNLPは、正規化されたNLPタスクカテゴリ全体で13,000以上のNLPデータセットレコードの国別アトラスである。
AtlasNLPには、人為的な参照セットであるAtlasNLP-Goldと、ACLから派生した大規模コレクションであるAtlasNLP-Coreが含まれている。
- 参考スコア(独自算出の注目度): 37.53777462173074
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding which countries are represented in NLP datasets is essential for identifying gaps, targeting data collection, measuring progress, and informing AI policy. However, geographic metadata is very rarely available, and country-level representation is often hidden behind broad language-level claims. We introduce AtlasNLP, a country-aware atlas of over 13,000 NLP dataset records across normalized NLP task categories, tracking both the populations represented and where datasets are produced. AtlasNLP includes AtlasNLP-Gold, a human-curated reference set, and AtlasNLP-Core, an ACL-derived large-scale collection. Using this resource, we show that (1) dataset coverage is highly uneven across countries and tasks; (2) dataset production and representation are geographically asymmetric; and (3) language coverage does not imply geographic representation. These findings reveal blind spots in current dataset documentation practices and motivate more explicit geographic metadata for country-aware NLP evaluation.
- Abstract(参考訳): NLPデータセットでどの国が表現されているかを理解することは、ギャップを特定し、データ収集をターゲットとし、進捗を測定し、AIポリシーを伝えるために不可欠である。
しかし、地理的メタデータは非常に稀であり、国レベルの表現は広い言語レベルのクレームの背後に隠されていることが多い。
我々は、正規化されたNLPタスクカテゴリにまたがる13,000以上のNLPデータセットの記録を国が認識するアトラスであるAtlasNLPを紹介し、表現された人口とデータセットの生成場所の両方を追跡する。
AtlasNLPには、人為的な参照セットであるAtlasNLP-Goldと、ACL由来の大規模コレクションであるAtlasNLP-Coreが含まれている。
この資源を用いて,(1) データセットのカバレッジは国やタスク間で非常に不均一であること,(2) データセットの生成と表現は地理的に非対称であること,(3) 言語カバレッジは地理的表現を含まないこと,などが示される。
これらの結果から,現在のデータセットドキュメンテーションの盲点を明らかにし,国別NLP評価のためのより明確な地理的メタデータを動機付けている。
関連論文リスト
- DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping [49.402442592047855]
現在のLarge Language Models (LLMs) は通常、多元的値アライメントのために粗い粒度の国家ラベルに依存している。
この制限を解消するには、国家ラベルから多次元の人口統計制約に移行する必要があると我々は主張する。
DVMap(DVMap)は,微細な多元値アライメントのためのフレームワークである。
論文 参考訳(メタデータ) (2026-05-14T06:06:43Z) - The Chronicles of RiDiC: Generating Datasets with Controlled Popularity Distribution for Long-form Factuality Evaluation [56.22548620937169]
RiDiCデータセットには、さまざまな人気層にまたがる3つのドメイン(川、自然災害、自動車モデル)から3,000のエンティティが含まれている。
各エンティティには、地理的な場所、英語と中国語の名前、関連する英語と中国語のウィキペディアコンテンツが付属している。
そして、これらをサードパーティのファクトリティーチェッカーを用いて評価し、データセットのエンティティがフロンティアモデルでさえ幻覚を引き起こすことを示した。
論文 参考訳(メタデータ) (2026-03-11T01:02:55Z) - NordFKB: a fine-grained benchmark dataset for geospatial AI in Norway [36.2419347658476]
ノルウェーの地理空間AIのための詳細なベンチマークデータセットであるNorFKBを提示する。
データセットには36のセマンティッククラスのための詳細なアノテーションと組み合わせた高解像度の正光度が含まれている。
NordFKBは、マッピング、土地管理、空間計画におけるAIメソッドの進歩のための堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2025-12-10T18:47:25Z) - SciNLP: A Domain-Specific Benchmark for Full-Text Scientific Entity and Relation Extraction in NLP [3.806421007129287]
SciNLPは、自然言語処理(NLP)ドメインにおけるフルテキストエンティティと関係抽出のためのベンチマークである。
データセットは、手動で注釈付きフルテキストNLP出版物60からなり、7,072のエンティティと1,826の関係をカバーしている。
論文 参考訳(メタデータ) (2025-09-09T14:41:40Z) - Designing NLP Systems That Adapt to Diverse Worldviews [4.915541242112533]
既存のNLPデータセットは、ラベルを集約したり、不一致をフィルタリングすることで、これを曖昧にすることが多い、と私たちは主張する。
我々は、アノテータの人口統計、値、ラベルの正当化をキャプチャするデータセットを構築するという、パースペクティブなアプローチを提案する。
論文 参考訳(メタデータ) (2024-05-18T06:48:09Z) - Natural Language Processing for Dialects of a Language: A Survey [56.93337350526933]
最先端自然言語処理(NLP)モデルは、大規模なトレーニングコーパスでトレーニングされ、評価データセットで最上位のパフォーマンスを報告します。
この調査は、これらのデータセットの重要な属性である言語の方言を掘り下げる。
方言データセットにおけるNLPモデルの性能劣化と言語技術のエクイティへのその影響を動機として,我々はデータセットやアプローチの観点から,方言に対するNLPの過去の研究を調査した。
論文 参考訳(メタデータ) (2024-01-11T03:04:38Z) - infoVerse: A Universal Framework for Dataset Characterization with
Multidimensional Meta-information [68.76707843019886]
infoVerseは、データセットの特徴付けのための普遍的なフレームワークである。
infoVerseは、様々なモデル駆動メタ情報を統合することで、データセットの多次元特性をキャプチャする。
実世界の3つのアプリケーション(データプルーニング、アクティブラーニング、データアノテーション)において、infoVerse空間で選択されたサンプルは、強いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2023-05-30T18:12:48Z) - Navya3DSeg -- Navya 3D Semantic Segmentation Dataset & split generation
for autonomous vehicles [63.20765930558542]
3Dセマンティックデータは、障害物検出やエゴ-車両の局所化といった中核的な認識タスクに有用である。
そこで我々は,大規模生産段階の運用領域に対応する多様なラベル空間を持つ新しいデータセットであるNavala 3D(Navya3DSeg)を提案する。
ラベルのない23のラベル付きシーケンスと25の補足シーケンスが含まれており、ポイントクラウド上の自己教師付きおよび半教師付きセマンティックセマンティックセグメンテーションベンチマークを探索するために設計された。
論文 参考訳(メタデータ) (2023-02-16T13:41:19Z) - Dataset Geography: Mapping Language Data to Language Users [17.30955185832338]
本研究では,NLPデータセットが言語話者の期待するニーズにどの程度一致しているかを定量化することを目的として,NLPデータセットの地理的代表性について検討する。
その際、エンティティ認識とリンクシステムを使用し、言語間の一貫性について重要な観察を行う。
最後に,観測された分布データセットを説明するための地理的・経済的要因について検討する。
論文 参考訳(メタデータ) (2021-12-07T05:13:50Z) - Training Dynamic based data filtering may not work for NLP datasets [0.0]
NLPデータセットにおける誤り例を識別するために,AUM(Area Under the Margin)測定値の適用性を検討した。
我々は,NLPデータセットのAUM測定値を用いて誤ラベル付きサンプルをフィルタリングできることを発見したが,同時に,かなりの数の正確なラベル付きポイントを除去した。
論文 参考訳(メタデータ) (2021-09-19T18:50:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。