論文の概要: Contextual Embedding Evidence for Main--Light Verb Distinctions in Urdu
- arxiv url: http://arxiv.org/abs/2608.23645v1
- Date: Mon, 24 Aug 2026 09:08:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.464192
- Title: Contextual Embedding Evidence for Main--Light Verb Distinctions in Urdu
- Title(参考訳): ウルドゥー語における主明動詞識別のための文脈埋め込み証拠
- Abstract要約: 主と軽の用法は、21の動詞比較において有意な表現的分離を示す。
メイン・レムマとライト・セントロイドは、ミスマッチしたメイン・ライト・レムマ・ペアよりも一貫して近い。
- 参考スコア(独自算出の注目度): 3.1798318618973362
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Urdu light verbs contribute schematic event-structural meaning while remaining lexically related to corresponding main verbs. This study tests representational predictions derived from Butt's analysis using contextual embeddings from UrduBERT, DunbaaBERT, and multilingual BERT across 1,126 naturally occurring sentences containing seven Urdu verbs. Main and light uses show significant representational separation in all 21 verb--model comparisons. At the same time, same-lemma main and light centroids are consistently closer than mismatched main--light lemma pairs, supporting continued lexical relatedness. In a seven-way prediction task restricted to light uses, verb identity remains recoverable after the target is masked, with UrduBERT achieving 0.866 accuracy and 0.852 macro-F1. UrduBERT also retains 0.782 accuracy under a preceding-form-disjoint evaluation, indicating generalization beyond repeated local verb combinations. These findings provide computational evidence consistent with Butt's account that Urdu light verbs differ systematically from their main uses while retaining lemma-specific and verb-specific representational structure.
- Abstract(参考訳): ウルドゥー軽動詞は、対応する主動詞と語彙的に関連し続けながら、図形的な事象構造的意味に寄与する。
本研究では、7つのウルドゥー動詞を含む1,126の自然発生文に対して,UrduBERT,DunbaaBERT,多言語BERTの文脈埋め込みを用いて,Buttの分析から得られた表現予測を検証した。
主と軽の用法は、21の動詞比較において有意な表現的分離を示す。
同時に、同じ補題の主と軽セントロイドは、ミスマッチした主と軽の補題のペアよりも一貫して近づき、連続した語彙的関連性をサポートする。
光利用に制限された7方向予測タスクでは、ターゲットがマスクされた後も動詞の同一性は回復可能であり、UrduBERTは0.866の精度と0.852のマクロF1を達成する。
また、UrduBERTは0.782の精度を維持しており、繰り返し局所動詞の組み合わせを超えて一般化されていることを示している。
これらの発見は、ルドゥの軽動詞が主用途と体系的に異なる一方で、レムマ固有の表現構造と動詞固有の表現構造を維持しているというブットの証言と一致した計算的証拠を提供する。
関連論文リスト
- Learning the Cue or Learning the Word? Analyzing Generalization in Metaphor Detection for Verbs [54.86138668387175]
我々は、多くの最先端システムの共有バックボーンであるRoBERTaを用いてメタファ検出を解析し、英語の動詞に着目した。
本稿では,選択された目標レムマのすべてのインスタンスを微調整から厳格に除外する,制御された語彙ホールドアウト設定を導入し,これらのヘルドアウトレムマの露光レムマに対する予測を比較した。
モデルはExpposed lemmasで最高のパフォーマンスを発揮するが、Held-out lemmasでは堅牢なパフォーマンスを維持している。
論文 参考訳(メタデータ) (2026-04-15T10:48:09Z) - Rule-Based Approaches to Atomic Sentence Extraction [1.167405291587978]
原子文抽出は、情報検索、質問応答、自動推論システムの性能を向上させる。
従来の作業では、"split-and-rephrase"タスクが形式化され、評価基準が確立され、機械学習アプローチによる抽出精度が向上した。
本研究では, 相対節, 副詞節, 調整パターン, 受動的構成を含む複雑な文構造が, ルールベース抽出の性能に与える影響を解析した。
論文 参考訳(メタデータ) (2026-01-01T23:19:51Z) - Distinguishing Repetition Disfluency from Morphological Reduplication in Bangla ASR Transcripts: A Novel Corpus and Benchmarking Analysis [0.0]
ノイズの多いASR転写におけるこれらの2つの現象を明瞭に区別するために,手動で注釈を付した2万列バングラコーパスを紹介した。
我々は、この新しいリソースを、最先端の多言語大言語モデル(LLM)とタスク固有のエンコーダモデルの微調整という2つのパラダイムを用いてベンチマークする。
論文 参考訳(メタデータ) (2025-11-17T09:06:01Z) - Simple Linguistic Inferences of Large Language Models (LLMs): Blind Spots and Blinds [59.71218039095155]
我々は,ほとんどの人間が自明に感じる単純な推論タスクにおいて,言語理解能力を評価する。
我々は, (i) 文法的に特定された含意, (ii) 不確実性のある明らかな副詞を持つ前提, (iii) 単調性含意を目標とする。
モデルはこれらの評価セットに対して中程度から低い性能を示す。
論文 参考訳(メタデータ) (2023-05-24T06:41:09Z) - Natural Language Decompositions of Implicit Content Enable Better Text Representations [52.992875653864076]
本稿では,暗黙的に伝達されたコンテンツを明示的に考慮したテキスト分析手法を提案する。
我々は大きな言語モデルを用いて、観察されたテキストと推論的に関係する命題の集合を生成する。
本研究は,NLPにおいて,文字のみではなく,観察された言語の背景にある意味をモデル化することが重要であることを示唆する。
論文 参考訳(メタデータ) (2023-05-23T23:45:20Z) - Universality and diversity in word patterns [0.0]
本稿では,11言語を対象とした語彙統計関係の分析を行う。
言語が単語関係を表現するために利用する多種多様な方法が、ユニークなパターン分布を生み出していることがわかった。
論文 参考訳(メタデータ) (2022-08-23T20:03:27Z) - On the Sentence Embeddings from Pre-trained Language Models [78.45172445684126]
本稿では,BERT埋め込みにおける意味情報が完全に活用されていないことを論じる。
BERTは常に文の非滑らかな異方性意味空間を誘導し,その意味的類似性を損なう。
本稿では,非教師対象で学習した正規化フローにより,異方性文の埋め込み分布を滑らかで等方性ガウス分布に変換することを提案する。
論文 参考訳(メタデータ) (2020-11-02T13:14:57Z) - Syntactic Structure Distillation Pretraining For Bidirectional Encoders [49.483357228441434]
本稿では,BERTプレトレーニングに構文バイアスを注入するための知識蒸留手法を提案する。
我々は,構文的 LM から単語の周辺分布を抽出する。
本研究は,大量のデータを利用する表現学習者においても,構文バイアスの利点を示すものである。
論文 参考訳(メタデータ) (2020-05-27T16:44:01Z) - BURT: BERT-inspired Universal Representation from Twin Structure [89.82415322763475]
BURT (BERT inspired Universal Representation from Twin Structure) は任意の粒度の入力シーケンスに対して普遍的で固定サイズの表現を生成することができる。
提案するBURTは,Siameseネットワークを採用し,自然言語推論データセットから文レベル表現を学習し,パラフレーズ化データセットから単語/フレーズレベル表現を学習する。
我々は,STSタスク,SemEval2013 Task 5(a) など,テキスト類似性タスクの粒度によってBURTを評価する。
論文 参考訳(メタデータ) (2020-04-29T04:01:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。