論文の概要: Padārtha: Ontology-Grounded Fine-Grained NER Benchmark for Classical Sanskrit
- arxiv url: http://arxiv.org/abs/2608.29324v1
- Date: Sat, 29 Aug 2026 15:09:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.924507
- Title: Padārtha: Ontology-Grounded Fine-Grained NER Benchmark for Classical Sanskrit
- Title(参考訳): Padārtha: 古典サンスクリットのためのオントロジーグラウンドファイングラインドNERベンチマーク
- Abstract要約: 私たちは、サンスクリットの最初のNERベンチマークである textitPadrtha を導入したテキスト自体の伝統にスキーマを置きました。
我々はサンスクリットの伝統的なアーキテクチャに対する生成的NERの最初の体系的ベンチマークを示す。
- 参考スコア(独自算出の注目度): 3.530070214705127
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Annotation schemas are not neutral. When applied to classical literature, tag sets developed for modern journalistic texts impose source-culture definitions on texts they were never designed to describe. We instead ground a schema in the tradition of the text itself introducing \textit{Padārtha}, the first ontology-grounded fine-grained Named Entity Recognition (NER) benchmark for Sanskrit, built on the \textit{Mahābhārata} epic. Our tag set derives from \textit{Nyāya-Vaiśesika}, a classical Indian ontological system, yielding 18 fine-grained categories organized under 10 ontological nodes and mapped onto five standard coarse tags, ensuring interoperability with existing benchmarks. Expert annotators label over 12.6K entries from a scholarly index of named entities, linked to corresponding mentions in the \textit{Mahānāma} corpus, producing fine-grained annotations for 108,335 entity mentions across 73,632 verses, along with a 5,000-verse expert-verified test set sampled to stress rare mentions. We present the first systematic benchmarking of generative NER against traditional architectures for Sanskrit, finding that fine-tuned generative models perform comparably to task-specific systems. However, all systems show a sharp decline from coarse to fine granularity and struggle with out-of-entity mentions unseen during training. The limitation is not due to data scarcity alone, as fine-tuned models recall unseen entities far worse than seen ones and tend to default to the majority sense under lexical ambiguity.
- Abstract(参考訳): アノテーションスキーマは中立的ではありません。
古典文学に適用すると、現代のジャーナリズムのテキスト用に開発されたタグセットは、記述されていないテキストにソースカルチャーの定義を課した。
代わりに、我々は、サンスクリットにおける最初のオントロジーでグラニュアルな名前付きエンティティ認識 (NER) ベンチマークである \textit{Padārtha} を導入したテキスト自体の伝統にスキーマを基礎にしています。
私たちのタグセットは、古典インドのオントロジシステムであるtextit{Nyāya-Vaisesika} から派生したもので、10のオントロジノードの下に組織され、5つの標準の粗いタグにマッピングされ、既存のベンチマークとの相互運用性が保証される。
専門家アノテーションは、名前付きエンティティの学術指標から12.6K以上のエントリをラベル付けし、希少な言及を強調するためにサンプルされた5000の専門家検証テストセットとともに、73,632節にわたる108,335個のエンティティの詳細なアノテーションを生成する。
本研究では,サンスクリットの伝統的なアーキテクチャに対する生成的NERの最初の体系的ベンチマークを行い,タスク固有のシステムに対して微調整された生成モデルが相容れないことを発見した。
しかし、全てのシステムは粗い粒度から細かい粒度への急激な減少を示しており、トレーニング中に不明瞭な点が指摘されている。
この制限は、データ不足によるものではなく、微調整されたモデルでは、目に見えないエンティティを目に見えないものよりもはるかに悪く思い出し、語彙的曖昧さの下では、大半がデフォルトになる傾向にある。
関連論文リスト
- PaSta: Noisy Node Classification with Partial Label Learning [58.43127707101144]
本稿では,既存の手法の限界を克服するために,新しいラベルベースの自己学習フレームワークを提案する。
PaStaは、様々なノイズ設定下での分類性能の平均1.1%の改善を実現している。
論文 参考訳(メタデータ) (2026-08-26T04:40:23Z) - Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation [0.0]
102,942文からなる高品質な銀標準サンスクリットNERデータセットであるNaamahを紹介する。
本稿では,DBpediaからのエンティティ抽出と24Bパラメータハイブリッド推論モデルの生成機能を組み合わせた手法を提案する。
論文 参考訳(メタデータ) (2026-04-29T09:12:57Z) - SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali [0.0]
SiPaKosa は Sinhala と Pali doctrinal の総括コーパスで、約 786K 文と 9.25M ワードからなる。
コーパスは、Google Document AIを歴史写本に使用して、高品質なOCRによって作成された。
10の事前学習モデルを用いて言語モデルの性能を評価し, コーパス上でのパープレキシティスコアは1.09から189.67である。
論文 参考訳(メタデータ) (2026-03-31T03:36:46Z) - Pragya: An AI-Based Semantic Recommendation System for Sanskrit Subhasitas [0.0]
本稿では,サブハシタスのセマンティックレコメンデーションのための検索拡張型生成フレームワークであるPragyaを紹介する。
我々は、モチベーション、友情、思いやりといったテーマタグを付した200節のデータセットをキュレートする。
文埋め込み(IndicBERT)を用いて、システムはユーザクエリに関連するトップkの単語を検索する。
得られた結果は生成モデルに渡され、翻訳、翻訳、文脈説明が生成される。
論文 参考訳(メタデータ) (2026-01-10T16:13:25Z) - Mahānāma: A Unique Testbed for Literary Entity Discovery and Linking [5.247057581790816]
Mah=an=amaは、サンスクリットでエンドツーエンドのエンティティディスカバリとリンクのための最初の大規模データセットである。
データセットは、5.5Kのユニークなエンティティにマッピングされた109K以上の名前付きエンティティを含む。
Mah=an=amaの複雑な物語構造は、広範囲な名前のバリエーションや曖昧さと相まって、解決システムに重大な課題をもたらす。
論文 参考訳(メタデータ) (2025-09-24T07:42:39Z) - Using n-aksaras to model Sanskrit and Sanskrit-adjacent texts [0.0]
本稿では,n-aksaras あるいは aksaras の連続配列を用いて,n-gram のサンスクリットテキストをトークン化する手法を提案する。
このモデルはサンスクリットに隣接したテキスト(例えば、サンスクリットのテキストに関するタミル語注釈など)でも使用できる。
論文 参考訳(メタデータ) (2023-01-30T15:17:06Z) - CCPrefix: Counterfactual Contrastive Prefix-Tuning for Many-Class
Classification [57.62886091828512]
多クラス分類のための新しいプレフィックスチューニング手法であるCCPrefixを提案する。
基本的に、ラベル空間における実数対から派生したインスタンス依存の軟式接頭辞は、多クラス分類における言語動詞化を補完するために利用される。
論文 参考訳(メタデータ) (2022-11-11T03:45:59Z) - Entity Disambiguation with Entity Definitions [50.01142092276296]
ローカルモデルはEntity Disambiguation (ED)で最近驚くべきパフォーマンスを達成した
それまでの研究は、各候補者のテキスト表現として、ウィキペディアのタイトルのみを使うことに限られていた。
本稿では、この制限に対処し、より表現力のあるテキスト表現がそれを緩和できる範囲について検討する。
提案する6つのベンチマークのうち2つに新たな技術の現状を報告し,未知のパターンに対する一般化能力を強く改善する。
論文 参考訳(メタデータ) (2022-10-11T17:46:28Z) - Knowledge-Rich Self-Supervised Entity Linking [58.838404666183656]
Knowledge-RIch Self-Supervision(KRISSBERT$)は400万のUMLSエンティティのためのユニバーサルエンティティリンカーである。
提案手法はゼロショット法と少数ショット法を仮定し,利用可能であればエンティティ記述やゴールドレファレンスラベルを簡単に組み込むことができる。
ラベル付き情報を一切使わずに400万のUMLSエンティティのためのユニバーサルエンティティリンカである$tt KRISSBERT$を生成する。
論文 参考訳(メタデータ) (2021-12-15T05:05:12Z) - TopicNet: Semantic Graph-Guided Topic Discovery [51.71374479354178]
既存の階層的なトピックモデルでは、教師なしの方法でテキストコーパスから意味論的意味のあるトピックを抽出することができる。
TopicNetを階層的なトピックモデルとして導入し、学習に影響を与えるための帰納的バイアスとして、事前構造知識を注入する。
論文 参考訳(メタデータ) (2021-10-27T09:07:14Z) - UCPhrase: Unsupervised Context-aware Quality Phrase Tagging [63.86606855524567]
UCPhraseは、教師なしの文脈対応のフレーズタグである。
我々は,一貫した単語列から,高品質なフレーズを銀のラベルとして表現する。
我々の設計は、最先端の事前訓練、教師なし、遠隔管理の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-05-28T19:44:24Z) - A Token-level Reference-free Hallucination Detection Benchmark for
Free-form Text Generation [50.55448707570669]
本稿ではトークンレベルの参照なし幻覚検出タスクとHaDesというアノテーション付きデータセットを提案する。
このデータセットを作成するために、まず英語のウィキペディアから抽出された大量のテキストセグメントを摂り込み、それからクラウドソースアノテーションで検証する。
論文 参考訳(メタデータ) (2021-04-18T04:09:48Z) - Infusing Finetuning with Semantic Dependencies [62.37697048781823]
シンタックスとは異なり、セマンティクスは今日の事前訓練モデルによって表面化されないことを示す。
次に、畳み込みグラフエンコーダを使用して、タスク固有の微調整にセマンティック解析を明示的に組み込む。
論文 参考訳(メタデータ) (2020-12-10T01:27:24Z) - Evaluating Neural Morphological Taggers for Sanskrit [23.87775187927048]
Sanskrit上での4つの標準シーケンスラベリングモデルの有効性を評価する。
いくつかのニューラルモデルは、他のモデルよりも優れているが、これらのモデルすべてに対するエラーの一般的な原因の1つは、同期性である。
論文 参考訳(メタデータ) (2020-05-21T20:36:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。