論文の概要: Padamitra: Grounded Glossary Generation for Classical Sanskrit
- arxiv url: http://arxiv.org/abs/2608.25038v2
- Date: Tue, 01 Sep 2026 04:35:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.48101
- Title: Padamitra: Grounded Glossary Generation for Classical Sanskrit
- Title(参考訳): パダミトラ:古典的なサンスクリットのためのグラウンドド・グローサリー・ジェネレーション
- Abstract要約: 我々は,意味論的意味を持つサンスクリット句を復元し,スロカ翻訳ペアから翻訳された意味を生成するために,モデルを必要とする構造的タスクであるグラウンドド・グローサリー生成を導入する。
我々はValmiki RamayanaとSrimad Bhagavatamから31,316個のSloka-translation-glossary trissのベンチマークを構築し,2つの指標を組み合わせた。
- 参考スコア(独自算出の注目度): 4.290597454095622
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We introduce grounded glossary generation, a structured task requiring models to recover semantically meaningful Sanskrit phrases and produce translation-grounded meanings from a sloka-translation pair, formalizing the traditional patha commentary practice as an evaluable NLP objective. We construct a benchmark of 31,316 sloka-translation-glossary triples from the Valmiki Ramayana and Srimad Bhagavatam, paired with two metrics: Jaccard for phrase recovery and Meaning Faithfulness for semantic consistency. Across zero-shot, few-shot, and instruction fine-tuned variants of Gemma-3n-E4B, Gemma-3-12B, Phi-4, and Qwen3.5-9B, instruction fine-tuning substantially outperforms prompting, while explicit segmentation yields gains. Error analysis identifies over-segmentation of sandhi and samasa compounds as the dominant failure mode, pointing to morphological modeling as the key bottleneck for faithful Sanskrit lexical decomposition.
- Abstract(参考訳): 本研究では,意味的意味を持つサンスクリット句を復元し,スロカ翻訳ペアから翻訳された意味を生成させる構造的タスクであるグラウンドド・グローサリー生成を導入し,従来のパスタ解説の実践を評価可能なNLPの目的として定式化する。
我々はValmiki RamayanaとSrimad Bhagavatamから31,316個のSloka-translation-glossary trissaryのベンチマークを構築した。
ゼロショット、少数ショット、命令細調整されたGemma-3n-E4B、Gemma-3-12B、Phi-4、Qwen3.5-9Bの範囲で、命令細調整の精度は大幅に向上し、明示的なセグメンテーションは利得を得る。
エラー解析では,サンスクリットの語彙分解において,モルフォロジーモデルが重要なボトルネックとなることを示し,サンジー化合物とサマサ化合物の過偏化を支配的障害モードとみなしている。
関連論文リスト
- VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP [3.9663884829149523]
VIVIDは,ベトナムにおける文化的基盤の具体的言語理解を評価するための最初の体系的ベンチマークである。
VinaVIDは1,636個のイディオムと5つの意味的特徴を付加した証明を含む。
本分析は,リテラル過剰解釈,語彙的ギャップ,実用的平坦化などの系統的障害を明らかにする。
論文 参考訳(メタデータ) (2026-08-04T04:13:26Z) - ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation [0.8287206589886881]
本稿では,言語に依存しないパイプラインであるADAGEを紹介した。
アラビア語、アムハラ語、日本語のベンチマークを構築してADAGEを検証する。
私たちは、一貫した文化的推論のギャップを見つけます。英語でうまく機能するモデルは、3つのネイティブベンチマークでかなり苦労しています。
論文 参考訳(メタデータ) (2026-07-25T05:58:00Z) - When Words Don't Mean What They Say: Figurative Understanding in Bengali Idioms [1.5840067220859924]
大規模言語モデル(LLM)にとって、図形言語理解は依然として重要な課題である。
我々は,10,361個のベンガルイディオムからなる大規模かつ文化的基盤を持つ新しいイディオムデータセットを導入する。
各イディオムは、包括的な19フィールドスキーマの下で注釈付けされ、熟考専門家の合意プロセスを通じて確立され、洗練される。
図形的意味を推定する作業において,30の最先端の多言語言語と命令調整型LLMを評価した。
論文 参考訳(メタデータ) (2026-02-13T13:26:11Z) - Assessing and Improving Punctuation Robustness in English-Marathi Machine Translation [41.84500687049023]
句読解は、文章言語における意味的・構造的あいまいさの解消に重要な役割を果たしている。
英語とマラソン機械翻訳における句読点の堅牢性を評価するための最初の診断ベンチマークであるVirmを紹介する。
信頼性向上のための2つの主要な戦略として,パイプラインベースの復元翻訳手法と,句読影データを直接微調整する手法について検討した。
論文 参考訳(メタデータ) (2025-12-28T06:34:49Z) - HeQ: a Large and Diverse Hebrew Reading Comprehension Benchmark [54.73504952691398]
我々は,抽出質問としてヘブライ語機械読解データセットの提供に着手した。
ヘブライ語の形態学的に豊かな性質はこの努力に挑戦している。
我々は,新しいガイドラインのセット,制御されたクラウドソーシングプロトコル,評価基準の改訂を考案した。
論文 参考訳(メタデータ) (2025-08-03T15:53:01Z) - SlangDIT: Benchmarking LLMs in Interpretative Slang Translation [89.48208612476068]
本稿では,スラング翻訳タスク(SlangDIT)を紹介する。
言語間スラング検出、言語間スラング説明、現在のコンテキスト内のスラング翻訳の3つのサブタスクで構成されている。
まず、文にスラングが含まれているかどうかを識別し、スラングが多義的かどうかを判断し、その意味を解析する。
論文 参考訳(メタデータ) (2025-05-20T10:37:34Z) - Crossing the Threshold: Idiomatic Machine Translation through Retrieval
Augmentation and Loss Weighting [66.02718577386426]
慣用的な翻訳と関連する問題を簡易に評価する。
我々は,変圧器をベースとした機械翻訳モデルが慣用的な翻訳に対して正しくデフォルトとなる点を明らかにするための合成実験を行った。
自然慣用句の翻訳を改善するために, 単純かつ効果的な2つの手法を導入する。
論文 参考訳(メタデータ) (2023-10-10T23:47:25Z) - Pairwise Supervised Contrastive Learning of Sentence Representations [20.822509446824125]
PairSupConは、セマンティックエンターメントと矛盾理解を高レベルのカテゴリ概念エンコーディングにブリッジすることを目的としている。
異なる粒度の文意味論の理解に関わる様々な下流タスクで評価する。
論文 参考訳(メタデータ) (2021-09-12T04:12:16Z) - Avoiding Inference Heuristics in Few-shot Prompt-based Finetuning [57.4036085386653]
文ペア分類タスクのプロンプトベースモデルでは,語彙重なりに基づく推論の一般的な落とし穴が依然として残っていることを示す。
そこで,プレトレーニングウェイトを保存する正規化を加えることは,この破壊的な微調整の傾向を緩和するのに有効であることを示す。
論文 参考訳(メタデータ) (2021-09-09T10:10:29Z) - Understanding by Understanding Not: Modeling Negation in Language Models [81.21351681735973]
否定は自然言語の中核構造である。
本稿では,否定された総称文に基づく不一致目的を用いて,言語モデリング目標の強化を提案する。
否定されたLAMAデータセットの平均top1エラー率を4%に削減します。
論文 参考訳(メタデータ) (2021-05-07T21:58:35Z) - On the Sentence Embeddings from Pre-trained Language Models [78.45172445684126]
本稿では,BERT埋め込みにおける意味情報が完全に活用されていないことを論じる。
BERTは常に文の非滑らかな異方性意味空間を誘導し,その意味的類似性を損なう。
本稿では,非教師対象で学習した正規化フローにより,異方性文の埋め込み分布を滑らかで等方性ガウス分布に変換することを提案する。
論文 参考訳(メタデータ) (2020-11-02T13:14:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。