CoolFace
Datasetpublic

eduagarcia/CrawlPT_dedup

CrawlPT (deduplicated) CrawlPT is a generic Portuguese corpus extracted from various web pages. This version is deduplicated using MinHash algorithm and Locality Sensitive Hashing, following the approach of Lee et al. (2022). The raw version is also available here. Dataset Details Dataset is composed by three corpora: brWaC, C100-PT, OSCAR-2301. brWaC: a web corpus for Brazilian Portuguese from 120,000 different websites. C100-PT: Portuguese subset from CC-100.… See the full description on the dataset page: https://huggingface.co/datasets/eduagarcia/CrawlPT_dedup.

sourceHugging Faceupdated 3y agoView on Hugging Face
8likes2.9kdownloads
settings

This repository belongs to eduagarcia on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

nameCrawlPT_dedup
visibilitypublic
licencenot set
gatedno
ownereduagarcia
Account settings
eduagarcia/CrawlPT_dedup · CoolFace