論文の概要: Curation of a Palaeohispanic Dataset for Machine Learning
- arxiv url: http://arxiv.org/abs/2604.13070v1
- Date: Fri, 20 Mar 2026 11:34:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.656854
- Title: Curation of a Palaeohispanic Dataset for Machine Learning
- Title(参考訳): 機械学習のためのパラオヒスパニックデータセットのキュレーション
- Authors: Gonzalo Martínez-Fernández, Jose F Quesada, Agustín Riscos-Núñez, Francisco José Salguero-Lamillar,
- Abstract要約: パラオヒスパニック語は紀元前3世紀にローマ人が到着する前にイベリア半島で話されていた言語である。
グメス・モレノ(Gmez Moreno)は、イベリア語のレバント文字を解読した。
- 参考スコア(独自算出の注目度): 0.3149883354098941
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Palaeohispanic languages are those spoken in the Iberian Peninsula before the arrival of the Romans in the 3rd Century B.C. Their study was really put on motion after Gómez Moreno deciphered the Iberian Levantine script, one of the several semi-sillabaries used by these languages. Still, the Palaeohispanic languages have varying degrees of decipherment, and none is fully known to this day. Most of the studies have been performed from a purely linguistic point of view, and a computational approach may benefit this research area greatly. However, the resources are limited and presented in an unsuitable format for techniques such as Machine Learning. Therefore, a structured dataset is constructed, which will hopefully allow more progress in the field.
- Abstract(参考訳): パラオヒスパニック語は紀元前3世紀にローマ人が到着する前にイベリア半島で話されていた言語である。
しかし、パラオヒスパニック諸語は解読の度合いが異なり、今日まで完全には知られていない。
研究の多くは純粋に言語学的観点から行われており、計算的アプローチはこの研究領域に多大な恩恵をもたらす可能性がある。
しかし、リソースは制限され、機械学習のようなテクニックには適さないフォーマットで提示される。
したがって、構造化データセットが構築され、フィールドのさらなる進歩が期待できる。
関連論文リスト
- PILA: A Historical-Linguistic Dataset of Proto-Italic and Latin [11.820097994590672]
原イタリア語からラテン語のデータセットを導入し、原イタリア語とラテン語の約3,000の形式からなる。
従来の計算歴史的言語学の課題の2つに基づいて,PILAのベースライン結果を示す。
PILAの他の歴史的言語学的データセットの強化能力を示す。
論文 参考訳(メタデータ) (2024-04-25T05:33:47Z) - Curated Datasets and Neural Models for Machine Translation of Informal Registers between Mayan and Spanish Vernaculars [2.2061683015812026]
我々はグアテマラとメキシコ南部で話されているいくつかのマヤ語言語でコーパスを開発し、キュレートし、公開する。
データセットは、その地域の支配的な言語であるスペイン語と平行している。
我々は、可能な限り多くのリソースとマヤ語で訓練されたニューラルマシン翻訳モデルを提示し、データセットでのみ評価する。
論文 参考訳(メタデータ) (2024-04-11T12:09:47Z) - Conversations in Galician: a Large Language Model for an
Underrepresented Language [2.433983268807517]
本稿では,ガリシア語に対する自然言語処理(NLP)を強化するために設計された2つの新しい資源を紹介する。
52,000の指示と実演を含むアルパカデータセットのガリシア適応について述べる。
データセットユーティリティのデモとして、元々モデルでサポートされていない言語であるGalicianで、LLaMA-7Bの理解と応答を微調整した。
論文 参考訳(メタデータ) (2023-11-07T08:52:28Z) - Quantifying the Dialect Gap and its Correlates Across Languages [69.18461982439031]
この研究は、明らかな相違を明らかにし、マインドフルなデータ収集を通じてそれらに対処する可能性のある経路を特定することによって、方言NLPの分野を強化する基盤となる。
論文 参考訳(メタデータ) (2023-10-23T17:42:01Z) - NusaWrites: Constructing High-Quality Corpora for Underrepresented and
Extremely Low-Resource Languages [54.808217147579036]
インドネシアの地方言語について事例研究を行う。
データセット構築におけるオンラインスクラップ,人文翻訳,および母語話者による段落作成の有効性を比較した。
本研究は,母語話者による段落作成によって生成されたデータセットが,語彙的多様性と文化的内容の点で優れた品質を示すことを示す。
論文 参考訳(メタデータ) (2023-09-19T14:42:33Z) - Neural Machine Translation for the Indigenous Languages of the Americas:
An Introduction [102.13536517783837]
アメリカ大陸のほとんどの言語は、もしあるならば、並列データと単言語データしか持たない。
これらの言語におけるNLPコミュニティの関心が高まった結果、最近の進歩、発見、オープンな質問について論じる。
論文 参考訳(メタデータ) (2023-06-11T23:27:47Z) - Romanization-based Large-scale Adaptation of Multilingual Language
Models [124.57923286144515]
大規模多言語事前学習言語モデル (mPLMs) は,NLPにおける多言語間移動のデファクトステートとなっている。
我々は、mPLMをローマン化および非ロマン化した14の低リソース言語コーパスに適用するためのデータとパラメータ効率の戦略を多数検討し、比較した。
以上の結果から, UROMAN をベースとしたトランスリテラルは,多くの言語で高い性能を達成できることがわかった。
論文 参考訳(メタデータ) (2023-04-18T09:58:34Z) - A large scale lexical and semantic analysis of Spanish language
variations in Twitter [2.3511629321667096]
この写本は、世界中の26のスペイン語を話す国間での語彙的・意味的な関係について広く分析している。
我々は、Twitterのジオタグ付き公開ストリームの4年間を分析し、さまざまな国のスペイン語語彙を広範囲に調査した。
論文 参考訳(メタデータ) (2021-10-12T16:21:03Z) - Bambara Language Dataset for Sentiment Analysis [0.0]
アフリカでは、様々な言語や方言が存在するが、それらはいまだに不足しており、分析研究や研究目的のために完全に活用されていない。
本稿では,感性分析専用のバンバラ方言データセットについて紹介する。
論文 参考訳(メタデータ) (2021-08-05T11:07:18Z) - XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning [68.57658225995966]
XCOPA (Cross-lingual Choice of Plausible Alternatives) は11言語における因果コモンセンス推論のための多言語データセットである。
提案手法は,翻訳に基づく転送と比較して,現在の手法の性能が低下していることを明らかにする。
論文 参考訳(メタデータ) (2020-05-01T12:22:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。