論文の概要: Fine PT-PT Web: A High-Quality 41 Billion Tokens Data Collection of the European Portuguese Web
- arxiv url: http://arxiv.org/abs/2609.07699v2
- Date: Wed, 09 Sep 2026 09:54:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.467105
- Title: Fine PT-PT Web: A High-Quality 41 Billion Tokens Data Collection of the European Portuguese Web
- Title(参考訳): 素晴らしいPT-PT Web:欧州のポルトガル語Webのデータ収集
- Authors: Gonçalo Vinagre, Rui Pedro Guerra, Pedro Gomes, Miguel Moura Ramos, Duarte Miguel Alves, Afonso Simplício, Diogo Tavares, David Semedo, Daniel Gomes, João Magalhães,
- Abstract要約: ヨーロッパポルトガル語 (PT-PT) のような地域言語変種に対する Web コーパスの計算は、方言の重複によって非常にボトルネックになっている。
本稿では、Arquivo.ptから411TBの生データにまたがる、生産可能なPT-PTコーパスをポルトガルのWebからキュレートする効率的なパイプラインを提案する。
- 参考スコア(独自算出の注目度): 5.590778585275515
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Curating Web corpora for regional language variants like European Portuguese (PT-PT) is heavily bottlenecked by dialectal overlap (mainly with PT-BR) and data processing scale. This paper presents an efficient pipeline to curate a production-ready PT-PT corpus from the Portuguese Web, spanning 411 TB of raw data from Arquivo.pt. We introduce a novel post-scraping block that removes boilerplate and line duplicates prior to filtering. This early-stage intervention increases final document yield by 19.04% by rescuing valid text that standard heuristic filters prematurely discard. Integrated with rigorous language identification, weighted fuzzy deduplication, and neural quality classification, our pipeline offers a scalable framework and a clean, representative corpus optimized for LLM pre-training.
- Abstract(参考訳): 欧州ポルトガル語(PT-PT)のような地域言語変種に対するWebコーパスの計算は、方言の重複(主にPT-BR)とデータ処理のスケールによって大きくボトルネックになっている。
本稿では、Arquivo.ptから411TBの生データにまたがる、生産可能なPT-PTコーパスをポルトガルのWebからキュレートする効率的なパイプラインを提案する。
フィルタに先立ってボイラープレートとライン重複を除去する新しいポストスクレイピングブロックを導入する。
この早期段階の介入は、標準ヒューリスティックフィルタが早期に破棄される有効なテキストを回収することで、最終文書の収率を19.04%向上させる。
厳密な言語識別、重み付けされたファジィ重複、ニューラルネットワークの品質分類と統合されたパイプラインは、スケーラブルなフレームワークと、LLM事前学習に最適化されたクリーンで代表的なコーパスを提供する。
関連論文リスト
- UPRPRC: Unified Pipeline for Reproducing Parallel Resources -- Corpus from the United Nations [12.597061194393847]
我々は,人間が翻訳した非AI生成コンテンツからなる,最大規模の並列コーパスを構築した。
得られたコーパスには7億1300万以上の英トークンが含まれており、これは以前の作業の規模を2倍にしている。
私たちのコードとコーパスはMITライセンスでアクセスできます。
論文 参考訳(メタデータ) (2025-09-19T09:21:13Z) - FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language [48.79534869177174]
我々は、FineWebをベースにした、新しいトレーニング済みデータセットキュレーションパイプラインを導入する。
我々のパイプラインは、以前のデータセットよりもパフォーマンスの高いモデルを生成する非英語コーパスを作成するために使用できることを示す。
パイプラインを約100のCommon Crawlスナップショットを使用して1000以上の言語に拡張し、新たに20テラバイト(50億ドキュメント)のマルチリンガルデータセットであるFinWeb2を生成しました。
論文 参考訳(メタデータ) (2025-06-26T01:01:47Z) - Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models [92.85086256871027]
我々は,低品質な文書を学習に役立てるために, guIded Rewrite で Web をリサイクルする REWIRE を提案する。
混在するテキストの約82%が、そうでなければ破棄されるであろう、低品質なドキュメントを変換することによるものであることを実証しています。
論文 参考訳(メタデータ) (2025-06-05T07:12:12Z) - LexMatcher: Dictionary-centric Data Collection for LLM-based Machine Translation [67.24113079928668]
本稿では、バイリンガル辞書に見られる感覚のカバレッジによって駆動されるデータキュレーション手法であるLexMatcherを提案する。
我々の手法は、WMT2022テストセットの確立されたベースラインよりも優れています。
論文 参考訳(メタデータ) (2024-06-03T15:30:36Z) - esCorpius: A Massive Spanish Crawling Corpus [2.262838186547612]
esCorpiusはスペインのクロールコーパスで、Common Crawlデータの約1Pbから得られた。
スペイン語で最も広範なコーパスであり、ウェブテキストの内容の抽出、浄化、重複の程度である。
論文 参考訳(メタデータ) (2022-06-30T09:29:18Z) - Non-Parametric Domain Adaptation for End-to-End Speech Translation [72.37869362559212]
E2E-ST(End-to-End Speech Translation)は、エラー伝播の低減、レイテンシの低減、パラメータの削減などにより注目されている。
本稿では,E2E-STシステムのドメイン適応を実現するために,ドメイン固有のテキスト翻訳コーパスを活用する新しい非パラメトリック手法を提案する。
論文 参考訳(メタデータ) (2022-05-23T11:41:02Z) - Documenting the English Colossal Clean Crawled Corpus [28.008953329187648]
この作業は、Common Crawlの単一のスナップショットにフィルターのセットを適用することによって作成されたデータセットであるColossal Clean Crawled Corpus(C4; Raffel et al., 2020)の最初のドキュメントを提供します。
まず、テキストがどこから来ていつ書き込まれたかの分布を含む、データのハイレベルな要約から始めます。
次に、最も頻繁なテキストソースを含む、このデータの突出した部分に関するより詳細な分析を行う。
論文 参考訳(メタデータ) (2021-04-18T07:42:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。