CoolFace
Datasetpublic

strak2005/corpus-ptbr-v1

🇧🇷 Corpus PT-BR v1 Um corpus em Português Brasileiro voltado para pré-treinamento e fine-tuning de LLMs. Combina dados reais curados com uma camada sintética construída para ampliar a diversidade estilística, lexical e discursiva em português. 🔄 Visão Geral do Pipeline 📊 Estatísticas Métrica Valor Total de documentos 8,399,857 Total de palavras ~4.84B Tokens estimados ~6.29B Tamanho (Parquet) ~17.9 GB Idioma Português… See the full description on the dataset page: https://huggingface.co/datasets/strak2005/corpus-ptbr-v1.

sourceHugging Faceodc-byupdated 4mo agoView on Hugging Face
0likes80downloads

strak2005/corpus-ptbr-v1 · main · files are served by the source, never re-hosted here