CoolFace
Datasetpublic

Comunidade-Synapse-BR/dataset-3m-ptbr-original

Dataset 3M PT-BR Original Um grande conjunto de dados em português brasileiro para pesquisa e desenvolvimento de modelos de Processamento de Linguagem Natural (NLP). Características 🇧🇷 Idioma: Português (PT-BR) 📄 Mais de 3,3 milhões de exemplos de treinamento ✅ Conjunto de validação incluído 📊 Metadados de categoria, tamanho do texto e confiança Estrutura Coluna Descrição id Identificador único text Texto em português category… See the full description on the dataset page: https://huggingface.co/datasets/Comunidade-Synapse-BR/dataset-3m-ptbr-original.

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes40downloads
Dataset Card

Dataset 3M PT-BR Original

Um grande conjunto de dados em português brasileiro para pesquisa e desenvolvimento de modelos de Processamento de Linguagem Natural (NLP).

Características

  • —🇧🇷 Idioma: Português (PT-BR)
  • —📄 Mais de 3,3 milhões de exemplos de treinamento
  • —✅ Conjunto de validação incluído
  • —📊 Metadados de categoria, tamanho do texto e confiança

Estrutura

ColunaDescrição
idIdentificador único
textTexto em português
categoryCategoria do exemplo
length_typeClassificação do tamanho do texto
confidence_scorePontuação de confiança

Estatísticas

  • —Treino: 3.374.280 exemplos
  • —Validação: 374.920 exemplos
  • —Total: 3.749.200 exemplos

Possíveis usos

  • —Treinamento de LLMs
  • —Fine-tuning
  • —Classificação de texto
  • —Pesquisa em NLP
  • —Pré-treinamento de modelos

Licença

Apache License 2.0