論文の概要: Language Models for Portuguese: A Systematic Mapping Study
- arxiv url: http://arxiv.org/abs/2608.18138v1
- Date: Mon, 03 Aug 2026 20:51:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-23 14:54:39.989763
- Title: Language Models for Portuguese: A Systematic Mapping Study
- Title(参考訳): ポルトガル語の言語モデル:システマティックマッピング研究
- Authors: Jhessica Silva, Carlos Caetano, Helena Maia, Breno Bernard Nicolau de França, Sandra Avila, Helio Pedrini,
- Abstract要約: 本調査はポルトガル語で開発された言語モデルの体系的マッピング研究である。
ベースモデル、アーキテクチャ、計算リソース、データセットのトレーニング、ライセンス、コード可用性、データ、モデルウェイトなど、さまざまな側面によって特徴付けられる46のモデルをマップします。
- 参考スコア(独自算出の注目度): 2.7113853682037767
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: In recent years, the rapid development of language models has transformed the field of Natural Language Processing through a wide range of applications. However, the development of language models has not progressed uniformly across all languages. In the case of the Portuguese language, there has recently been a growing effort by academia and companies to develop language models and create data resources for Portuguese. These efforts have resulted in the rise of an increasingly diverse ecosystem of language models for Portuguese. However, information on these models remains dispersed in scientific publications, technical reports, model repositories, and project documentation. This survey presents a systematic mapping study of language models developed for Portuguese, providing a comprehensive overview of the current state of the field. We map a total of 46 models, characterizing them by various aspects, including base model, architecture, computational resources, training datasets, licensing, code availability, data, and model weights. Furthermore, we analyzed the evolution and relationships among these models through a phylogenetic perspective, identified current research gaps and opportunities, and discussed future directions for the development of language models for Portuguese.
- Abstract(参考訳): 近年,言語モデルの急速な発展は,自然言語処理の分野を幅広い応用を通じて変化させてきた。
しかし、言語モデルの開発はすべての言語で一様に進んでいない。
ポルトガル語の場合、最近、学界や企業が言語モデルを開発し、ポルトガル語のためのデータリソースを作成するための努力が増えている。
これらの努力により、ポルトガル語のための多様な言語モデルのエコシステムが台頭した。
しかし、これらのモデルに関する情報は、科学出版物、技術報告、モデルリポジトリ、プロジェクトドキュメントに分散している。
本調査では,ポルトガル語で開発された言語モデルの体系的マッピングを行い,その分野の現状を概観する。
ベースモデル、アーキテクチャ、計算リソース、データセットのトレーニング、ライセンス、コード可用性、データ、モデルウェイトなど、さまざまな側面によって特徴付けられる46のモデルをマップします。
さらに、これらのモデル間の進化と関係を系統学的観点から分析し、現在の研究ギャップと機会を特定し、ポルトガル語の言語モデル開発に向けた今後の方向性について議論した。
関連論文リスト
- On The Landscape of Spoken Language Models: A Comprehensive Survey [144.11278973534203]
音声言語モデル(SLM)は、普遍的な音声処理システムとして機能する。
この領域での作業は非常に多様であり、様々な用語と評価設定がある。
論文 参考訳(メタデータ) (2025-04-11T13:40:53Z) - Tradutor: Building a Variety Specific Translation Model [3.976102757693942]
ポルトガル語に特化された最初のオープンソース翻訳モデルを紹介します。
私たちの最良のモデルは、既存のポルトガル語のオープンソース翻訳システムを超えています。
データセット、モデル、コードを公開することにより、さらなる研究を支援し、奨励することを目指しています。
論文 参考訳(メタデータ) (2025-02-20T09:20:59Z) - PORTULAN ExtraGLUE Datasets and Models: Kick-starting a Benchmark for the Neural Processing of Portuguese [1.2779732438508473]
我々は、一連の言語処理タスクのためのデータセットのコレクションと、これらの下流タスクに関する微調整されたニューラルネットワークモデルのコレクションにコントリビュートする。
もともと英語で開発された文献の主流ベンチマークと合わせると、データセットは英語から機械翻訳され、最先端の翻訳エンジンが組み込まれていた。
その結果得られた PortULAN ExtraGLUE ベンチマークは、今後の研究で改善が追求されるポルトガルの研究の基盤となっている。
論文 参考訳(メタデータ) (2024-04-08T09:22:41Z) - Gl\'orIA - A Generative and Open Large Language Model for Portuguese [4.782288068552145]
ポルトガルの堅牢なデコーダLLMであるGl'orIAを紹介する。
Gl'orIAを事前訓練するために,様々なソースから35億個のトークンからなる包括的PT-PTテキストコーパスを組み立てた。
Gl'orIAは、言語モデリングにおいて、既存のオープンPTデコーダモデルよりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2024-02-20T12:36:40Z) - Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research [139.69207791947738]
ドルマ (Dolma) は、ウェブコンテンツ、科学論文、コード、パブリックドメインの書籍、ソーシャルメディア、百科事典の素材を多用した3トリルの英語コーパスである。
我々はDolmaの設計原則、その構築の詳細、内容の要約を含む、Dolmaを文書化します。
我々は、重要なデータキュレーションの実践について学んだことを共有するために、Dolmaの中間状態の分析と実験結果を示す。
論文 参考訳(メタデータ) (2024-01-31T20:29:50Z) - Conversations in Galician: a Large Language Model for an
Underrepresented Language [2.433983268807517]
本稿では,ガリシア語に対する自然言語処理(NLP)を強化するために設計された2つの新しい資源を紹介する。
52,000の指示と実演を含むアルパカデータセットのガリシア適応について述べる。
データセットユーティリティのデモとして、元々モデルでサポートされていない言語であるGalicianで、LLaMA-7Bの理解と応答を微調整した。
論文 参考訳(メタデータ) (2023-11-07T08:52:28Z) - Multi-lingual Evaluation of Code Generation Models [82.7357812992118]
本稿では,MBXPとMultilingual HumanEval,MathQA-Xという,評価コード生成モデルに関する新しいベンチマークを提案する。
これらのデータセットは10以上のプログラミング言語をカバーする。
コード生成モデルの性能を多言語で評価することができる。
論文 参考訳(メタデータ) (2022-10-26T17:17:06Z) - Building Machine Translation Systems for the Next Thousand Languages [102.24310122155073]
1500以上の言語を対象としたクリーンでWebマイニングされたデータセットの構築、低サービス言語のための実践的なMTモデルの開発、これらの言語に対する評価指標の限界の検証という3つの研究領域における結果について述べる。
我々の研究は、現在調査中の言語のためのMTシステムの構築に取り組んでいる実践者にとって有用な洞察を提供し、データスパース設定における多言語モデルの弱点を補完する研究の方向性を強調したいと考えています。
論文 参考訳(メタデータ) (2022-05-09T00:24:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。