論文の概要: Rethinking Indic AI from a Lens of Cultural Heritage Preservation
- arxiv url: http://arxiv.org/abs/2607.06544v1
- Date: Tue, 07 Jul 2026 17:51:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.614664
- Title: Rethinking Indic AI from a Lens of Cultural Heritage Preservation
- Title(参考訳): 文化遺産保存のレンズからIndic AIを再考する
- Abstract要約: AIは「二重刃の剣」と見なされるが、一方では人口の多い人々へのアクセスと包摂を可能にし、他方では世界観を均質化し、表現不足の言語や世界観を排除できる。
本稿では,インド言語学の広範な特徴と,それらが文化的実践や世界観と密接に結びつく方法に対処することによって,この問題の特徴付けを試みる。
次に、Indic Foundationモデルの役割の増大について論じ、これらのモデルが長年のリソースと表現ギャップにどのように対処するかを分析する。
- 参考スコア(独自算出の注目度): 4.93881710663323
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Artificial Intelligence (AI) makes inroads into different parts of the Indian subcontinent, there is significant interest in studying how AI impacts the linguistic and cultural foundations of this civilization. AI is seen as a ''double-edged sword'' where on the one hand, it can enable access and inclusion for a large population, on the other, it can homogenize worldviews and exclude underrepresented languages and worldviews. In this paper, we try to characterize this problem by addressing the extensive characteristic nature of Indian linguistics and the way they closely connect to cultural practices and worldview. We then perform a longitudinal survey of how Natural Language Processing (NLP) techniques have evolved in this space, tracing the historical development of Indic NLP, covering key milestones, methodological shifts, and resource creation efforts. In addition, the paper also examines the structural and sociolinguistic characteristics of Indian languages, such as rich morphology, complex scripts and grammar rules, diglossia, and large dialectal variation, and explains how these create unique challenges for building AI foundation models. We then discuss the growing role of Indic foundation models and analyze how these models address these long-standing resource and representation gaps. Finally, we propose a research direction called 'Culture Sensing', which re-imagines AI based on hermeneutic reasoning. Culture Sensing aims to address open problems such as ensuring equitable performance across low-resource languages and producing outputs that are culturally meaningful. By bringing together past work, current techniques, and emerging trends, this paper outlines research directions that can guide the next phase of Indic NLP and contribute to the development of more robust and inclusive Indic foundation models.
- Abstract(参考訳): 人工知能(AI)がインド亜大陸の様々な部分に進出するにつれ、AIがこの文明の言語的・文化的基盤にどのように影響するかを研究することに大きな関心が寄せられている。
AIは「二重刃の剣」と見なされるが、一方では人口の多い人々へのアクセスと包摂を可能にし、他方では世界観を均質化し、表現不足の言語や世界観を排除できる。
本稿では,インド言語学の広範な特徴と,それらが文化的実践や世界観と密接に結びつく方法に対処することによって,この問題の特徴付けを試みる。
次に、この分野での自然言語処理(NLP)技術がどのように発展してきたのかを縦断調査し、Indic NLPの歴史的発展を辿り、重要なマイルストーン、方法論的変化、資源創出の取り組みをカバーした。
さらに,インドの言語の構造的・社会言語学的特徴,例えばリッチ・モルフォロジー,複雑なスクリプトや文法規則,地質学,大弁証法などを考察し,これらがAI基盤モデル構築にどのようにユニークな課題を生み出しているかを説明する。
次に、Indic Foundationモデルの役割の増大について論じ、これらのモデルが長年のリソースと表現ギャップにどのように対処するかを分析する。
最後に,Hermeneutic reasoningに基づいてAIを再想像する「Culture Sensing」という研究方向を提案する。
Culture Sensingは、低リソース言語間での公平なパフォーマンスの確保や、文化的に意味のあるアウトプットなど、オープンな問題に対処することを目的としている。
本報告では,過去の研究,現在の技術,新たな動向をまとめて,Indic NLPの次の段階を導く研究の方向性を概説し,より堅牢で包括的なIndic Foundationモデルの開発に寄与する。
関連論文リスト
- From Data Scarcity to Data Care: Reimagining Language Technologies for Serbian and other Low-Resource Languages [0.0]
本研究では、AI時代の低資源言語のための言語技術開発を形作る構造的、歴史的、社会技術的要因について検討する。
これは、現代の問題によって強化されたセルビアのテキスト遺産の歴史的破壊に根ざした課題を辿るものである。
これらの課題に対処するため、この研究は、CARE原則に基づくフレームワークであるData Careを提案する。
論文 参考訳(メタデータ) (2025-12-11T13:29:25Z) - Bridging Gaps in Natural Language Processing for Yorùbá: A Systematic Review of a Decade of Progress and Prospects [0.6554326244334868]
このレビューでは、注釈付きコーパスの不足、事前訓練された言語モデルの可用性の制限、音節複雑性やダイアクリティカル依存といった言語的課題を重要な障害として取り上げている。
この結果から,多言語・モノリンガル資源の増大が明らかとなった。ただし,この分野は,コードスイッチングやデジタル利用のための言語放棄といった社会文化的要因に制約されている。
論文 参考訳(メタデータ) (2025-02-24T17:41:48Z) - Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities Research [32.14802247608518]
低リソース言語は、文化進化と知的多様性を具現化した、人類の歴史の貴重なリポジトリとして機能する。
その重要性にもかかわらず、これらの言語はデータ不足や技術的な制限など、重要な課題に直面している。
大規模言語モデル(LLM)の最近の進歩は、これらの課題に対処するための変革的な機会を提供する。
論文 参考訳(メタデータ) (2024-11-30T00:10:56Z) - LIMBA: An Open-Source Framework for the Preservation and Valorization of Low-Resource Languages using Generative Models [62.47865866398233]
この白書は低リソース言語のための言語ツールを生成するためのフレームワークを提案する。
このような言語に対するインテリジェントな応用を妨げるデータ不足に対処することにより、言語多様性の促進に寄与する。
論文 参考訳(メタデータ) (2024-11-20T16:59:41Z) - Neurosymbolic Graph Enrichment for Grounded World Models [47.92947508449361]
複雑な問題に対処するために, LLM の反応性を向上し, 活用するための新しいアプローチを提案する。
我々は,大規模言語モデルの強みと構造的意味表現を組み合わせた,多モーダルで知識を付加した意味の形式表現を作成する。
非構造化言語モデルと形式的意味構造とのギャップを埋めることで、自然言語理解と推論における複雑な問題に対処するための新たな道を開く。
論文 参考訳(メタデータ) (2024-11-19T17:23:55Z) - Harnessing the Power of Artificial Intelligence to Vitalize Endangered Indigenous Languages: Technologies and Experiences [31.62071644137294]
我々は、世界の言語の多様性の低下と、AIとNLPに固有の倫理的課題をもたらすインディジェネラル言語について論じる。
Indigenous Language のための高品質な機械学習トランスレータの開発に励む成果を報告する。
私たちは2023年と2024年にブラジルの先住民コミュニティで実施したプロジェクトで構築したプロトタイプを紹介します。
論文 参考訳(メタデータ) (2024-07-17T14:46:37Z) - The Ghanaian NLP Landscape: A First Look [9.17372840572907]
特にガーナ語は絶滅が記録され、いくつかは危険にさらされている。
本研究は、ガーナ語に焦点をあてた自然言語処理(NLP)研究の包括的調査のパイオニアである。
論文 参考訳(メタデータ) (2024-05-10T21:39:09Z) - Massively Multi-Cultural Knowledge Acquisition & LM Benchmarking [48.21982147529661]
本稿では,多文化知識獲得のための新しいアプローチを提案する。
本手法は,文化トピックに関するウィキペディア文書からリンクページの広範囲なネットワークへ戦略的にナビゲートする。
私たちの仕事は、AIにおける文化的格差のギャップを深く理解し、橋渡しするための重要なステップです。
論文 参考訳(メタデータ) (2024-02-14T18:16:54Z) - Language Models: A Guide for the Perplexed [51.88841610098437]
このチュートリアルは、言語モデルを学ぶ人と、興味を持ち、もっと学びたいと思う人とのギャップを狭めることを目的としています。
実験を通して学ぶことができる質問に焦点を当てた科学的視点を提供する。
言語モデルは、現在、その開発に繋がる研究の文脈に置かれています。
論文 参考訳(メタデータ) (2023-11-29T01:19:02Z) - Foundational Models Defining a New Era in Vision: A Survey and Outlook [151.49434496615427]
視覚シーンの構成的性質を観察し、推論する視覚システムは、我々の世界を理解するのに不可欠である。
モデルは、このようなモダリティと大規模なトレーニングデータとのギャップを埋めることを学び、コンテキスト推論、一般化、テスト時の迅速な機能を容易にした。
このようなモデルの出力は、例えば、バウンディングボックスを設けて特定のオブジェクトをセグメント化したり、画像や映像シーンについて質問したり、言語命令でロボットの動作を操作することで対話的な対話を行うなど、リトレーニングすることなく、人為的なプロンプトによって変更することができる。
論文 参考訳(メタデータ) (2023-07-25T17:59:18Z) - An Inclusive Notion of Text [69.36678873492373]
テキストの概念の明確さは再現可能で一般化可能なNLPにとって不可欠である,と我々は主張する。
言語的および非言語的要素の2層分類を導入し,NLPモデリングに使用することができる。
論文 参考訳(メタデータ) (2022-11-10T14:26:43Z) - Positioning yourself in the maze of Neural Text Generation: A
Task-Agnostic Survey [54.34370423151014]
本稿では, ストーリーテリング, 要約, 翻訳など, 世代ごとのタスクインパクトをリレーする手法の構成要素について検討する。
本稿では,学習パラダイム,事前学習,モデリングアプローチ,復号化,各分野における重要な課題について,命令的手法の抽象化を提案する。
論文 参考訳(メタデータ) (2020-10-14T17:54:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。