Comunidade-Synapse-BR/dataset-3m-ptbr-original
Dataset 3M PT-BR Original Um grande conjunto de dados em português brasileiro para pesquisa e desenvolvimento de modelos de Processamento de Linguagem Natural (NLP). Características 🇧🇷 Idioma: Português (PT-BR) 📄 Mais de 3,3 milhões de exemplos de treinamento ✅ Conjunto de validação incluído 📊 Metadados de categoria, tamanho do texto e confiança Estrutura Coluna Descrição id Identificador único text Texto em português category… See the full description on the dataset page: https://huggingface.co/datasets/Comunidade-Synapse-BR/dataset-3m-ptbr-original.
Dataset 3M PT-BR Original
Um grande conjunto de dados em português brasileiro para pesquisa e desenvolvimento de modelos de Processamento de Linguagem Natural (NLP).
Características
- 🇧🇷 Idioma: Português (PT-BR)
- 📄 Mais de 3,3 milhões de exemplos de treinamento
- ✅ Conjunto de validação incluído
- 📊 Metadados de categoria, tamanho do texto e confiança
Estrutura
Estatísticas
- Treino: 3.374.280 exemplos
- Validação: 374.920 exemplos
- Total: 3.749.200 exemplos
Possíveis usos
- Treinamento de LLMs
- Fine-tuning
- Classificação de texto
- Pesquisa em NLP
- Pré-treinamento de modelos
Licença
Apache License 2.0
