CoolFace
Datasetpublic

Comunidade-Synapse-BR/wikipedia-pt-60M

📚 Wikipedia PT 60M Wikipedia PT 60M é um corpus em português desenvolvido pela Comunidade Synapse BR para o pré-treinamento e treinamento contínuo de modelos de linguagem (LLMs). O dataset foi organizado para fornecer uma grande quantidade de texto em português, sendo adequado para pesquisas em Processamento de Linguagem Natural (NLP), treinamento de modelos generativos e experimentos envolvendo Modelagem de Linguagem Causal (Causal Language Modeling). 📖 Visão… See the full description on the dataset page: https://huggingface.co/datasets/Comunidade-Synapse-BR/wikipedia-pt-60M.

sourceHugging Facecc-by-sa-4.0updated 2mo agoView on Hugging Face
3likes89downloads
discussions and pull requests

Conversations for this repository live on Hugging Face.

CoolFace shows imported repositories read-only. Posting into someone else’s repository from here would need an authorised integration and the account holder’s consent, so the link goes to the source instead.

Open discussions on Hugging Face
Comunidade-Synapse-BR/wikipedia-pt-60M · CoolFace