CoolFace
Datasetpublic

bratao/corpus-ptbr-v1

🇧🇷 Corpus PT-BR v1 Um corpus em Português Brasileiro voltado para pré-treinamento e fine-tuning de LLMs. Combina dados reais curados com uma camada sintética construída para ampliar a diversidade estilística, lexical e discursiva em português. 🔄 Visão Geral do Pipeline 📊 Estatísticas Métrica Valor Total de documentos 8,399,857 Total de palavras ~4.84B Tokens estimados ~6.29B Tamanho (Parquet) ~17.9 GB Idioma Português… See the full description on the dataset page: https://huggingface.co/datasets/bratao/corpus-ptbr-v1.

sourceHugging Faceodc-byupdated 5mo agoView on Hugging Face
0likes181downloads
1 commits on main
bbcb8e35mo ago

Duplicate from Madras1/corpus-ptbr-v1

bratao, Madras1