論文の概要: BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources
- arxiv url: http://arxiv.org/abs/2604.18423v1
- Date: Mon, 20 Apr 2026 15:41:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.976815
- Title: BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources
- Title(参考訳): BhashaSutra:インドのNLPデータセット、コーパス、リソースのタスク中心統合調査
- Authors: Raghvendra Kumar, Devankar Raj, Sriparna Saha,
- Abstract要約: 我々は、200以上のデータセット、50以上のベンチマーク、100以上のモデル、ツール、テキスト、スピーチ、マルチモーダル、文化的根拠のあるタスクを含む、インドのNLPリソースに関する最初の統一的な調査を提示する。
我々は、言語現象、ドメイン、モダリティによって資源を整理し、アノテーション、評価、モデルデザインのトレンドを分析し、データ空間、不均一な言語カバレッジ、スクリプトの多様性、限られた文化的・ドメインの一般化といった永続的な課題を特定する。
- 参考スコア(独自算出の注目度): 13.574373781253305
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: India's linguistic landscape, spanning 22 scheduled languages and hundreds of marginalized dialects, has driven rapid growth in NLP datasets, benchmarks, and pretrained models. However, no dedicated survey consolidates resources developed specifically for Indian languages. Existing reviews either focus on a few high-resource languages or subsume Indian languages within broader multilingual settings, limiting coverage of low-resource and culturally diverse varieties. To address this gap, we present the first unified survey of Indian NLP resources, covering 200+ datasets, 50+ benchmarks, and 100+ models, tools, and systems across text, speech, multimodal, and culturally grounded tasks. We organize resources by linguistic phenomena, domains, and modalities; analyze trends in annotation, evaluation, and model design; and identify persistent challenges such as data sparsity, uneven language coverage, script diversity, and limited cultural and domain generalization. This survey offers a consolidated foundation for equitable, culturally grounded, and scalable NLP research in the Indian linguistic ecosystem.
- Abstract(参考訳): インドの言語景観は22の計画言語と数百の方言にまたがっており、NLPデータセット、ベンチマーク、事前訓練されたモデルが急速に成長している。
しかし、インド語に特化した資源を集約する調査は行われていない。
既存のレビューでは、より広範囲な多言語設定において、いくつかの高リソース言語やサブサブスム・インディアン言語に焦点を当てており、低リソースと文化的に多様な種類のカバーを制限している。
このギャップに対処するため、200以上のデータセット、50以上のベンチマーク、100以上のモデル、ツール、およびテキスト、スピーチ、マルチモーダル、文化的根拠のあるタスクをカバーした、インドのNLPリソースに関する最初の統一的な調査を提示する。
我々は、言語現象、ドメイン、モダリティによって資源を整理し、アノテーション、評価、モデルデザインのトレンドを分析し、データ空間、不均一な言語カバレッジ、スクリプトの多様性、限られた文化的・ドメインの一般化といった永続的な課題を特定する。
この調査は、インドの言語生態系における平等で文化的基盤があり、スケーラブルなNLP研究のための統合された基盤を提供する。
関連論文リスト
- The role of synthetic data in Multilingual, Multi-cultural AI systems: Lessons from Indic Languages [18.087937520281965]
インドの13言語にまたがる950万のデータポイントからなる大規模合成命令追従データセットであるUpdeshを紹介した。
自動メトリクスと人的アノテーションの両方を10k評価に取り入れた総合的な評価は、生成されたデータが高品質であることを示している。
Updeshでトレーニングされたモデルは、生成タスクにおいて一貫して大きな利益を達成し、多重選択スタイルのNLUタスクにおいて競争力を維持する。
論文 参考訳(メタデータ) (2025-09-25T15:13:00Z) - DRISHTIKON: A Multimodal Multilingual Benchmark for Testing Language Models' Understanding on Indian Culture [14.681676046750342]
DRISHTIKON(DRISHTIKON)は、インド文化を中心としたマルチモーダルおよび多言語ベンチマークである。
このデータセットは、祭り、服装、料理、芸術形式、歴史遺産を含む豊かな文化的テーマを捉えている。
我々は、オープンソースの小型・大規模モデル、プロプライエタリシステム、推論特化VLM、インデックスにフォーカスしたモデルなど、幅広い視覚言語モデル(VLM)を評価する。
論文 参考訳(メタデータ) (2025-09-23T17:40:43Z) - IndicMMLU-Pro: Benchmarking Indic Large Language Models on Multi-Task Language Understanding [2.062076715606512]
インド亜大陸の15億人以上の人々によって知られており、Indic言語は自然言語処理(NLP)の研究に固有の課題と機会を提示している。
IndicMMLU-Proは、Indic言語全体にわたる大規模言語モデル(LLM)を評価するために設計されたベンチマークである。
論文 参考訳(メタデータ) (2025-01-27T03:19:03Z) - Decoding the Diversity: A Review of the Indic AI Research Landscape [0.7864304771129751]
インド、パキスタン、バングラデシュ、スリランカ、ネパール、ブータンなどインド亜大陸で話されている言語である。
本稿では,Indic言語における大規模言語モデル(LLM)研究の方向性について概観する。
論文 参考訳(メタデータ) (2024-06-13T19:55:20Z) - Natural Language Processing for Dialects of a Language: A Survey [56.93337350526933]
最先端自然言語処理(NLP)モデルは、大規模なトレーニングコーパスでトレーニングされ、評価データセットで最上位のパフォーマンスを報告します。
この調査は、これらのデータセットの重要な属性である言語の方言を掘り下げる。
方言データセットにおけるNLPモデルの性能劣化と言語技術のエクイティへのその影響を動機として,我々はデータセットやアプローチの観点から,方言に対するNLPの過去の研究を調査した。
論文 参考訳(メタデータ) (2024-01-11T03:04:38Z) - NusaWrites: Constructing High-Quality Corpora for Underrepresented and
Extremely Low-Resource Languages [54.808217147579036]
インドネシアの地方言語について事例研究を行う。
データセット構築におけるオンラインスクラップ,人文翻訳,および母語話者による段落作成の有効性を比較した。
本研究は,母語話者による段落作成によって生成されたデータセットが,語彙的多様性と文化的内容の点で優れた品質を示すことを示す。
論文 参考訳(メタデータ) (2023-09-19T14:42:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。