論文の概要: A Word-Level Digital Reader of the Prasthanatrayi with Sankara's Bhasya: Corpus, Method, and an Open, Offline Reading Aid for the Advaita Vedanta Canon
- arxiv url: http://arxiv.org/abs/2607.07282v1
- Date: Wed, 08 Jul 2026 11:19:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.360072
- Title: A Word-Level Digital Reader of the Prasthanatrayi with Sankara's Bhasya: Corpus, Method, and an Open, Offline Reading Aid for the Advaita Vedanta Canon
- Title(参考訳): A Word-Level Digital Reader of the Prasthanatrayi with Sankara's Bhasya: Corpus, Method, and an Open, Offline Reading Aid for the Advaita Vedanta Canon
- Authors: Tamal Maharaj,
- Abstract要約: 我々は、サンカラのbhasyaとともに、プラサナトライ全体のオープンで完全にオフラインで単語レベルのデジタルリーダーを提示する。
ルートテキスト(mula)とコメンタリーの両方の単語はクリック可能であり、その分割(padaccheda)、形態解析、光沢を与えるポップアップに解決する。
この資料は13の注釈単位(2,971節、経典、散文節)と95,587の異なる注釈面の国際辞書を網羅している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Prasthanatrayi -- the ten principal Upanisads, the Brahmasutra, and the Bhagavadgita, with Sankara's commentaries (bhasya) -- is the foundational corpus of Advaita Vedanta. Continuous euphonic combination (sandhi), long compounds (samasa), and dense scholastic prose make it hard to read at the word level: where one word ends, and what each word means grammatically, are both obscured. We present an open, fully offline, word-level digital reader of the entire Prasthanatrayi with Sankara's bhasya. Every word -- of both the root text (mula) and the commentary -- is clickable and resolves to a pop-up giving its split (padaccheda), morphological analysis, and gloss. Because every word carries a lemma, the reader also acts as a concordance: a search on a dictionary headword retrieves all of that word's inflected and sandhi-hidden occurrences, and its occurrences inside compounds, across both layers. The resource covers thirteen commentarial units (2,971 verses, sutras, and prose sections; 36,881 analysed word-occurrences of root text) and a global dictionary of 95,587 distinct commentarial surface forms. We describe the corpus, the hybrid pipeline -- a rule-based sandhi splitter over an inflected-form lexicon and attested-corpus look-ups, with LLM-assisted analysis under an adversarial two-pass verification protocol -- and a durable human-review loop whose corrections survive every regeneration. An intrinsic evaluation against independent Sanskrit resources finds high-confidence analyses agree with an authoritative inflectional lexicon on over 99% of attested forms, and a band-blind adjudication confirms that quality degrades predictably across confidence bands, with errors concentrated in the low-confidence tier the review loop targets. The reader is a single self-contained HTML file needing no server or network, offered as a freely redistributable teaching and reading aid.
- Abstract(参考訳): プラサナトライ(Prasthanatrayi)は、アパニサド人10人、ブラマシュトラ人、バガヴァドギタ人(Bhagavadgita)で、サンカラの注釈書(bhasya)は、アディヴァタ・ヴェダンタ(Advaita Vedanta)の基礎的なコーパスである。
連続的な音素結合(サンディ)、長い化合物(サマサ)、密集したスコラ散文は、単語レベルでは読みづらい。
我々は、サンカラのbhasyaとともに、プラサナトライ全体のオープンで完全にオフラインで単語レベルのデジタルリーダーを提示する。
ルートテキスト(mula)とコメンタリーの両方の単語はクリック可能であり、その分割(padaccheda)、形態解析、光沢を与えるポップアップに解決する。
辞書の見出しで検索すると、その単語の屈折やサンディーの隠れた出来事と、両方の層にまたがる化合物の中で起こる出来事がすべて検索される。
この資料は、13の注釈単位(2,971節、経典、散文)、36,881の語源分析、95,587の別個の注釈表の国際辞書を網羅している。
我々は、コーパス、ハイブリッドパイプライン、すなわち、屈折型レキシコンと証明されたコーパスルックアップ上のルールベースのサンドヒスプリッター、および、逆2パス認証プロトコルの下でのLCM支援分析、および修正が再生毎に生き残る耐久性のある人間レビューループについて説明する。
独立系サンスクリット資源に対する本質的な評価では、認証された形式の99%以上において、信頼度の高い反射レキシコンと高い信頼度解析が一致し、また、バンド盲検定により、信頼性帯域間で品質が予測的に低下し、レビューループがターゲットとする低信頼度層に誤差が集中していることを確認する。
リーダーは、サーバやネットワークを必要としない単一の自己完結HTMLファイルであり、自由に再配布可能な教育と読書支援を提供する。
関連論文リスト
- Darshana Graph: A Parallel Commentary Corpus for Comparative Indian Philosophy, with Stylometric and Exploratory Graph Analyses [0.0]
ダルシャナグラフ (Darshana Graph) は、ヒンドゥー教、仏教、ジャイナ教の哲学的伝統にまたがる125,000以上のテキスト記録のコーパスである。
その独特な貢献は、約8,500のヒンドゥー教とジャイナ教の記録の、構造的に独特な部分であり、同じ根本詩や経典が18の歴史的コメンテーターの間で並んだものである。
論文 参考訳(メタデータ) (2026-06-16T17:49:15Z) - Learning the Cue or Learning the Word? Analyzing Generalization in Metaphor Detection for Verbs [54.86138668387175]
我々は、多くの最先端システムの共有バックボーンであるRoBERTaを用いてメタファ検出を解析し、英語の動詞に着目した。
本稿では,選択された目標レムマのすべてのインスタンスを微調整から厳格に除外する,制御された語彙ホールドアウト設定を導入し,これらのヘルドアウトレムマの露光レムマに対する予測を比較した。
モデルはExpposed lemmasで最高のパフォーマンスを発揮するが、Held-out lemmasでは堅牢なパフォーマンスを維持している。
論文 参考訳(メタデータ) (2026-04-15T10:48:09Z) - An Evaluation of Sindhi Word Embedding in Semantic Analogies and Downstream Tasks [2.3624125155742064]
我々は,複数のWebリソースから6100万以上の単語をクロールする新しい単語埋め込み型コーパスを提案する。
クロールデータから不要なテキストをフィルタリングするための前処理パイプラインを設計する。
クリーニングされた語彙は、最先端の連続バグ・オブ・ワード、スキップグラム、GloVeワード埋め込みアルゴリズムに供給される。
論文 参考訳(メタデータ) (2024-08-28T11:36:29Z) - Quantifying the redundancy between prosody and text [67.07817268372743]
我々は大きな言語モデルを用いて、韻律と単語自体の間にどれだけの情報が冗長であるかを推定する。
単語が持つ情報と韻律情報の間には,複数の韻律的特徴にまたがる高い冗長性が存在する。
それでも、韻律的特徴はテキストから完全には予測できないことが観察され、韻律は単語の上下に情報を運ぶことが示唆された。
論文 参考訳(メタデータ) (2023-11-28T21:15:24Z) - Unsupervised extraction of local and global keywords from a single text [0.0]
テキストからキーワードを抽出する非教師付きコーパス非依存手法を提案する。
それは、単語の空間分布と、単語のランダムな置換に対するこの分布の応答に基づいている。
論文 参考訳(メタデータ) (2023-07-26T07:36:25Z) - Fine-Grained Opinion Summarization with Minimal Supervision [48.43506393052212]
FineSumは、複数のドキュメントから意見を抽出することでターゲットをプロファイルすることを目的としている。
FineSumは、生のコーパスから意見語句を自動的に識別し、異なる側面と感情に分類し、各アスペクト/感覚の下に複数のきめ細かい意見クラスタを構築する。
ベンチマークの自動評価と定量的人的評価の両方が,本手法の有効性を検証した。
論文 参考訳(メタデータ) (2021-10-17T15:16:34Z) - FRAKE: Fusional Real-time Automatic Keyword Extraction [1.332091725929965]
キーワード抽出は、テキストの主要な概念を最もよく表す単語やフレーズを識別する。
グラフ中心性特徴とテキスト特徴の2つのモデルを組み合わせたアプローチを採用している。
論文 参考訳(メタデータ) (2021-04-10T18:30:17Z) - Improving Machine Reading Comprehension with Contextualized Commonsense
Knowledge [62.46091695615262]
我々は、機械読解の理解を改善するために、常識知識を抽出することを目指している。
構造化知識を文脈内に配置することで,関係を暗黙的に表現することを提案する。
我々は,教師の学習パラダイムを用いて,複数種類の文脈的知識を学生機械読取機に注入する。
論文 参考訳(メタデータ) (2020-09-12T17:20:01Z) - On Vocabulary Reliance in Scene Text Recognition [79.21737876442253]
ボキャブラリ内の単語を持つ画像に対して、手法は良好に機能するが、ボキャブラリ外の単語を持つ画像にはあまり一般化しない。
私たちはこの現象を「語彙依存」と呼んでいる。
本研究では,2家族のモデルが協調的に学習できるようにするための,シンプルで効果的な相互学習戦略を提案する。
論文 参考訳(メタデータ) (2020-05-08T11:16:58Z) - Word Sense Disambiguation for 158 Languages using Word Embeddings Only [80.79437083582643]
文脈における単語感覚の曖昧さは人間にとって容易であるが、自動的アプローチでは大きな課題である。
本稿では,学習前の標準単語埋め込みモデルを入力として,完全に学習した単語認識のインベントリを誘導する手法を提案する。
この手法を用いて、158の言語に対して、事前訓練されたfastText単語の埋め込みに基づいて、センスインベントリのコレクションを誘導する。
論文 参考訳(メタデータ) (2020-03-14T14:50:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。