Comunidade-Synapse-BR/wikipedia-pt-60M
📚 Wikipedia PT 60M Wikipedia PT 60M é um corpus em português desenvolvido pela Comunidade Synapse BR para o pré-treinamento e treinamento contÃnuo de modelos de linguagem (LLMs). O dataset foi organizado para fornecer uma grande quantidade de texto em português, sendo adequado para pesquisas em Processamento de Linguagem Natural (NLP), treinamento de modelos generativos e experimentos envolvendo Modelagem de Linguagem Causal (Causal Language Modeling). 📖 Visão… See the full description on the dataset page: https://huggingface.co/datasets/Comunidade-Synapse-BR/wikipedia-pt-60M.
Conversations for this repository live on Hugging Face.
CoolFace shows imported repositories read-only. Posting into someone else’s repository from here would need an authorised integration and the account holder’s consent, so the link goes to the source instead.
Open discussions on Hugging Face