論文の概要: AgriGov: A Structured Multilingual Dataset Curation for Indian Government Schemes for Farmers
- arxiv url: http://arxiv.org/abs/2606.08272v1
- Date: Sat, 06 Jun 2026 17:37:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.009441
- Title: AgriGov: A Structured Multilingual Dataset Curation for Indian Government Schemes for Farmers
- Title(参考訳): AgriGov: 農家のためのインド政府スキームのための構造化多言語データセットキュレーション
- Authors: Mohsina Bilal, Gopakumar G,
- Abstract要約: AgriGov(アグリゴフ)は、農業政策や農夫の福祉計画のための多言語資源の不足に対処するために設計された、トリリンガル(英語-ヒンディー語-マラティー語)データセットである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AgriGov is a curated, trilingual (English-Hindi-Marathi) dataset designed to address the scarcity of domain-grounded multilingual resources for agricultural policies and farmer welfare schemes. Initially, we collected and structured data from 50 government schemes sourced from trusted portals using automated scraping techniques, organizing it into predefined semantic fields (e.g., title, eligibility, application process, documents, exclusions). Translations were performed using a pipeline combining Google Translate API, MarianMT, and human post-editing, resulting in a domain-specific Hindi-Marathi dataset comprising approximately 2100 source segments. To enhance coverage, we augmented this dataset with sentences from the Samanantar corpus, leading to approximately 8,000 sentence-aligned Hindi-Marathi parallel pairs. The dataset now offers robust resources for fine-tuning machine translation models in this domain. AgriGov is designed for applications in domain-adaptive machine translation, question answering, information retrieval, and summarization systems. Its key contribution is a schema-driven, human-corrected multilingual alignment pipeline that ensures domain fidelity, provides provenance, and supports reproducible experiments, enabling retrieval-augmented applications for farmer-facing tools.
- Abstract(参考訳): AgriGov(アグリゴフ)は、農業政策や農夫の福祉計画のための多言語資源の不足に対処するために設計された、トリリンガル(英語-ヒンディー語-マラティー語)データセットである。
最初は、自動化されたスクレーピング技術を使用して、信頼されたポータルからソースされた50の政府のスキームからデータを収集、構造化し、事前に定義されたセマンティックフィールド(タイトル、適性、アプリケーションプロセス、ドキュメント、除外など)に整理しました。
Google Translate API、MarianMT、および人間の後編集を組み合わせたパイプラインを使用して翻訳が行われ、ドメイン固有のHindi-Marathiデータセットが約2100のソースセグメントで構成された。
このデータセットをサマナンタルコーパスからの文で拡張し,約8,000の文列のHindi-Marathi並列ペアを生成する。
このデータセットは、このドメインで微細チューニングされたマシン翻訳モデルのための堅牢なリソースを提供する。
AgriGovはドメイン適応型機械翻訳、質問応答、情報検索、要約システムに応用するために設計されている。
その主な貢献は、スキーマ駆動でヒューマン修正された多言語アライメントパイプラインで、ドメインの忠実性を確保し、証明を提供し、再現可能な実験をサポートし、ファーマー対応ツールの検索強化アプリケーションを可能にする。
関連論文リスト
- GhanaNLP Parallel Corpora: Comprehensive Multilingual Resources for Low-Resource Ghanaian Languages [0.11275693054719732]
ガーナのイニシアチブは、Twi、Fante、Ewe、Ga、Kusaal言語向けに41,513のパラレル文ペアを開発し、キュレートした。
これらのコーパスは、機械翻訳、音声技術、言語保存を含む研究、教育、商業的応用を支援するように設計されている。
論文 参考訳(メタデータ) (2026-03-14T06:49:05Z) - AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence [13.233457989297358]
AgriGPT-Omniは、音声、視覚、テキストを統一されたフレームワークに統合する農業用オムニフレームワークである。
農業用テキストやイメージをトレーニングデータに変換する,スケーラブルなデータ合成・収集パイプラインを構築した。
本研究は,テキスト・ナレッジ・インジェクション,プログレッシブ・マルチモーダルアライメント,GRPOに基づく強化学習という3段階のパラダイムを用いて,最初の農業用オムニモデルを訓練する。
論文 参考訳(メタデータ) (2025-12-11T13:24:40Z) - Leveraging Synthetic Data for Question Answering with Multilingual LLMs in the Agricultural Domain [1.0144032120138065]
本研究は,インドの農業特化資料から多言語(ヒンディー語,パンジャービ語)の合成データセットを生成する。
人為的データセットの評価は、事実性、関連性、農業コンセンサスにおいて著しく改善されている。
論文 参考訳(メタデータ) (2025-07-22T19:25:10Z) - IndicRAGSuite: Large-Scale Datasets and a Benchmark for Indian Language RAG Systems [17.88837706307504]
IndicMSMarcoは13のインドの言語における検索品質と応答生成を評価するための多言語ベンチマークである。
我々は、最先端のLLMを用いて、19のインドの言語ウィキペディアから派生した大規模な(質問、回答、関連する)データセットを構築した。
論文 参考訳(メタデータ) (2025-06-02T12:55:51Z) - Instruction Tuning on Public Government and Cultural Data for Low-Resource Language: a Case Study in Kazakh [57.002807772016524]
カザフスタンの主要な制度的・文化的知識をカバーする大規模な(10,600サンプル)命令追従データセットを導入,オープンソース化する。
データセット構築のためのオープンウェイトモデルとクローズドウェイトモデルを比較し,GPT-4oをバックボーンとして選択する。
データセット上の微調整Qwen、Falcon、Gemmaは、複数の選択タスクと生成タスクの両方において、一貫したパフォーマンス改善をもたらします。
論文 参考訳(メタデータ) (2025-02-19T11:44:27Z) - Open the Data! Chuvash Datasets [50.59120569845975]
Chuvash言語用の包括的データセットを4つ紹介する。
これらのデータセットには、モノリンガルデータセット、ロシア語による並列データセット、英語による並列データセット、オーディオデータセットが含まれる。
論文 参考訳(メタデータ) (2024-05-31T07:51:19Z) - MegaWika: Millions of reports and their sources across 50 diverse
languages [74.3909725023673]
MegaWikaは、50の言語で1300万のWikipedia記事と、7100万の参考資料で構成されている。
我々は、このデータセットを無数のアプリケーションに処理し、非英語の記事を言語間アプリケーションに翻訳する。
MegaWikaは、文レベルのレポート生成のための最大のリソースであり、マルチランガルである唯一のレポート生成データセットである。
論文 参考訳(メタデータ) (2023-07-13T20:04:02Z) - A Survey on Low-Resource Neural Machine Translation [106.51056217748388]
我々は、関連する作品を、使用した補助データに基づいて3つのカテゴリに分類する。
私たちの調査は、研究者がこの分野をよりよく理解し、より良いアルゴリズムを設計するきっかけになることを期待しています。
論文 参考訳(メタデータ) (2021-07-09T06:26:38Z) - FDMT: A Benchmark Dataset for Fine-grained Domain Adaptation in Machine
Translation [53.87731008029645]
機械翻訳(FDMT)における実世界のきめ細かいドメイン適応タスクを提案する。
FDMTデータセットは、自動運転車、AI教育、リアルタイムネットワーク、スマートフォンの4つのサブドメインで構成されている。
この新しい設定で定量的な実験と深い分析を行い、きめ細かいドメイン適応タスクをベンチマークします。
論文 参考訳(メタデータ) (2020-12-31T17:15:09Z) - Facebook AI's WMT20 News Translation Task Submission [69.92594751788403]
本稿では、Facebook AIによるWMT20共有ニュース翻訳タスクの提出について述べる。
資源設定の低さに着目し,タミル語-英語とイヌクティトゥット語-英語の2つの言語ペアに参加する。
我々は、利用可能なデータをすべて活用し、ターゲットのニュースドメインにシステムを適用するという、2つの主要な戦略を用いて、低リソース問題にアプローチする。
論文 参考訳(メタデータ) (2020-11-16T21:49:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。