論文の概要: From Lexicon to AI: A Structured-Data Pipeline for Specialized Conversational Systems in Low-Resource Languages
- arxiv url: http://arxiv.org/abs/2606.26112v1
- Date: Thu, 21 May 2026 03:16:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-28 23:46:52.329944
- Title: From Lexicon to AI: A Structured-Data Pipeline for Specialized Conversational Systems in Low-Resource Languages
- Title(参考訳): LexiconからAIへ:低リソース言語における特別な会話システムのための構造化データパイプライン
- Authors: Siddhant Hitesh Mantri, Dhara Gorasiya, Malhar Kulkarni, Pushpak Bhattacharya,
- Abstract要約: 低リソース言語は、AI開発において重要な課題に直面している。
本稿では,構造化言語資源を専門的なAIシステムに変換するための体系的手法を提案する。
専門家による語彙データベースが,会話型AI開発に有効な基盤となることを示す。
- 参考スコア(独自算出の注目度): 0.04666493857924356
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Low-resource languages face a critical challenge in AI development: creating specialized conversational systems without access to massive training corpora. We present a systematic methodology for transforming structured linguistic resources into specialized AI systems, demonstrating that expert-curated lexical databases can serve as effective foundations for conversational AI development. Our approach converts Hindi WordNet into 1.25 million diverse instruction-response pairs, fine-tunes a 12B-parameter language model using resource-efficient LoRA with 4-bit quantization. Evaluation through a Hindi language learning chatbot demonstrates that structured-knowledge-based systems achieve superior pedagogical effectiveness (91.0 vs. 79.4-83.6 for general-purpose models) while maintaining competitive semantic performance and exceptional consistency. The complete pipeline demonstrates a proof-of-concept methodology using Hindi for developing specialized AI systems for any languages with WordNet resources. This work addresses the critical gap in AI accessibility for low-resource languages, offering a practical alternative to corpus-intensive approaches and potentially enabling specialized AI development for the hundreds of languages with existing WordNet resources.
- Abstract(参考訳): 低リソース言語は、AI開発において重要な課題に直面している。
本稿では,構造化言語資源を専門的なAIシステムに変換するための体系的手法を提案する。
提案手法は,Hindi WordNetを125万の多様な命令応答ペアに変換し,リソース効率の高いLoRAと4ビット量子化を用いた12Bパラメータ言語モデルを微調整する。
ヒンディー語学習チャットボットによる評価は、構造化知識ベースのシステムは、競争力のあるセマンティックパフォーマンスと例外的な一貫性を維持しつつ、優れた教育効果(汎用モデルでは91.0対79.4-83.6)を達成することを示した。
完全なパイプラインは、WordNetリソースを持つ任意の言語のための特別なAIシステムを開発するために、Hindiを使用した概念実証手法を実証している。
この研究は、低リソース言語に対するAIアクセシビリティの重大なギャップに対処し、コーパス集約アプローチの実践的な代替を提供し、既存のWordNetリソースを持つ数百の言語に対して、特別なAI開発を可能にする可能性がある。
関連論文リスト
- Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages [76.14451035425229]
大規模自動音声認識システムであるOmnilingual ASRを紹介する。
自己教師付き事前学習を7Bパラメータに拡張し、堅牢な音声表現を学習する。
ASRが提供しなかった500以上の言語を含む1,600以上の言語にカバー範囲を広げている。
論文 参考訳(メタデータ) (2025-11-12T19:48:09Z) - Building A Unified AI-centric Language System: analysis, framework and future work [0.0]
本稿では,AI中心の統一言語システムの設計について考察する。
多様な自然言語入力を合理化されたAIフレンドリーな言語に翻訳するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-06T20:32:57Z) - Automatic Speech Recognition for Sanskrit with Transfer Learning [0.0]
我々は,OpenAIのWhisperモデルに伝達学習機構を適用し,サンスクリットの音声認識モデルを開発した。
本研究では,サンスクリット学習におけるアクセシビリティ向上と技術支援の道を開くことを目的として,本モデルのオンライン・デモを公開し,その性能評価を行った。
論文 参考訳(メタデータ) (2025-01-17T08:20:32Z) - Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling [50.62091603179394]
最も先進的なASRモデルの1つであるWhisperは99の言語を効果的に扱う。
しかし、ウィスパーは未確認の言語と戦っているが、それらは事前訓練には含まれていない。
本研究では,これらの関係を利用して未知言語上でのASR性能を向上させる手法を提案する。
論文 参考訳(メタデータ) (2024-12-21T04:05:43Z) - Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection [49.27067541740956]
音声感情認識(SER)は、人間とコンピュータの自然な相互作用が可能な汎用AIエージェントを開発する上で重要な要素である。
英語や中国語以外の言語でラベル付きデータが不足しているため、堅牢な多言語SERシステムの構築は依然として困難である。
本稿では,低SERリソース言語におけるSERの性能向上のための手法を提案する。
論文 参考訳(メタデータ) (2024-09-17T08:36:45Z) - SUTRA: Scalable Multilingual Language Model Architecture [5.771289785515227]
我々は50以上の言語でテキストの理解、推論、生成が可能な多言語大言語モデルアーキテクチャSUTRAを紹介する。
広範な評価により、SUTRA は GPT-3.5 や Llama2 といった既存のモデルを 20-30% 上回って、主要なMultitask Language Understanding (MMLU) ベンチマークを上回ります。
以上の結果から,SUTRAは多言語モデル機能において重要なギャップを埋めるだけでなく,AIアプリケーションにおける運用効率とスケーラビリティの新たなベンチマークを確立することが示唆された。
論文 参考訳(メタデータ) (2024-05-07T20:11:44Z) - DIALIGHT: Lightweight Multilingual Development and Evaluation of
Task-Oriented Dialogue Systems with Large Language Models [76.79929883963275]
DIALIGHTは多言語タスク指向対話(ToD)システムの開発と評価のためのツールキットである。
ローカル発話レベルとグローバル対話レベルの両方において、人間のきめ細かい評価のためのセキュアでユーザフレンドリーなWebインターフェースを備えている。
評価の結果, PLMの微調整により精度とコヒーレンスが向上する一方, LLMベースのシステムは多様で類似した応答を生成するのに優れていた。
論文 参考訳(メタデータ) (2024-01-04T11:27:48Z) - Reinforced Iterative Knowledge Distillation for Cross-Lingual Named
Entity Recognition [54.92161571089808]
言語間NERは、知識をリッチリソース言語から低リソース言語に転送する。
既存の言語間NERメソッドは、ターゲット言語でリッチなラベル付けされていないデータをうまく利用しない。
半教師付き学習と強化学習のアイデアに基づく新しいアプローチを開発する。
論文 参考訳(メタデータ) (2021-06-01T05:46:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。