CoolFace
Datasetpublic

Comunidade-Synapse-BR/wikipedia-pt-60M

📚 Wikipedia PT 60M Wikipedia PT 60M é um corpus em português desenvolvido pela Comunidade Synapse BR para o pré-treinamento e treinamento contínuo de modelos de linguagem (LLMs). O dataset foi organizado para fornecer uma grande quantidade de texto em português, sendo adequado para pesquisas em Processamento de Linguagem Natural (NLP), treinamento de modelos generativos e experimentos envolvendo Modelagem de Linguagem Causal (Causal Language Modeling). 📖 Visão… See the full description on the dataset page: https://huggingface.co/datasets/Comunidade-Synapse-BR/wikipedia-pt-60M.

sourceHugging Facecc-by-sa-4.0updated 2mo agoView on Hugging Face
3likes91downloads
Dataset Card

📚 Wikipedia PT 60M

Wikipedia PT 60M é um corpus em português desenvolvido pela Comunidade Synapse BR para o pré-treinamento e treinamento contínuo de modelos de linguagem (LLMs).

O dataset foi organizado para fornecer uma grande quantidade de texto em portuguĂŞs, sendo adequado para pesquisas em Processamento de Linguagem Natural (NLP), treinamento de modelos generativos e experimentos envolvendo Modelagem de Linguagem Causal (Causal Language Modeling).


đź“– VisĂŁo Geral

Este corpus foi preparado para aplicações que exigem grandes volumes de texto em português.

Entre os principais casos de uso estĂŁo:

  • —🤖 PrĂ©-treinamento de modelos GPT
  • —🔄 Continual Pretraining
  • —📝 Geração de texto
  • —📚 Modelagem de Linguagem Causal
  • —🔬 Pesquisa em NLP
  • —🎓 Projetos acadĂŞmicos
  • —🧠 Desenvolvimento de modelos de linguagem

📊 Características

PropriedadeValor
IdiomaPortuguĂŞs
FonteWikipédia
FormatoTexto
Campo principaltext
AplicaçãoPré-treinamento de LLMs

đź“‚ Formato dos Dados

Cada registro possui um Ăşnico campo contendo um trecho de texto.

Exemplo:

json
{
  "text": "A Wikipédia é uma enciclopédia livre..."
}

O dataset pode ser carregado diretamente utilizando a biblioteca datasets da Hugging Face.


đź’ˇ Casos de Uso

Este dataset pode ser utilizado para:

  • —PrĂ©-treinamento de modelos GPT
  • —Continual Pretraining
  • —Fine-tuning de LLMs
  • —Pesquisa em NLP
  • —Estudos linguĂ­sticos
  • —Benchmarking
  • —Tokenização
  • —Desenvolvimento de modelos em portuguĂŞs

⚠️ Considerações

Por ser baseado na Wikipédia, o corpus herda suas características naturais, incluindo:

  • —Linguagem predominantemente enciclopĂ©dica
  • —Cobertura variada de assuntos
  • —PossĂ­veis inconsistĂŞncias entre artigos
  • —ConteĂşdo atualizado conforme a WikipĂ©dia evolui

Dependendo da aplicação, recomenda-se combinar este corpus com outras fontes textuais para aumentar a diversidade dos dados de treinamento.


📜 Licença

Este dataset é distribuído sob a licença cc-by-sa-4.0.

Verifique também as condições de uso do conteúdo original da Wikipédia antes de utilizá-lo em aplicações específicas.


🤝 Sobre a Comunidade Synapse BR

A Comunidade Synapse BR Ă© uma iniciativa brasileira dedicada ao desenvolvimento de modelos de inteligĂŞncia artificial, datasets e ferramentas de cĂłdigo aberto.

Nossa missão é tornar a inteligência artificial mais acessível por meio de soluções abertas, eficientes e de alta qualidade, fortalecendo o ecossistema brasileiro de IA.

Contribuições, sugestões e relatos de problemas são sempre bem-vindos.