celsowm/srp-gpt2-ptbr-corpus
SRP GPT-2 PT-BR Corpus Corpus público em Parquet para treino autoregressivo de modelos de linguagem em português. Fontes Este dataset é uma composição de textos públicos/republicáveis, com atribuição às fontes originais: Project Gutenberg, acessado via Gutendex API: https://www.gutenberg.org/ e https://gutendex.com/ FineWeb2 da Hugging Face, filtrado para português/pt-BR: https://huggingface.co/datasets/HuggingFaceFW/fineweb-2 Licenciamento e… See the full description on the dataset page: https://huggingface.co/datasets/celsowm/srp-gpt2-ptbr-corpus.
SRP GPT-2 PT-BR Corpus
Corpus público em Parquet para treino autoregressivo de modelos de linguagem em português.
Fontes
Este dataset é uma composição de textos públicos/republicáveis, com atribuição às fontes originais:
- Project Gutenberg, acessado via Gutendex API: https://www.gutenberg.org/ e https://gutendex.com/
- FineWeb2 da Hugging Face, filtrado para português/pt-BR: https://huggingface.co/datasets/HuggingFaceFW/fineweb-2
Licenciamento e atribuição
- FineWeb2 é disponibilizado sob licença ODC-By 1.0 e requer atribuição.
- Textos do Project Gutenberg geralmente são obras em domínio público nos EUA, mas cada arquivo pode conter termos do Project Gutenberg; consulte a fonte original quando redistribuir fora deste dataset.
- Este dataset mantém atribuição às fontes acima e deve ser usado respeitando os termos das fontes originais.
Colunas
id: identificador estável do documentotext: texto UTF-8 do documentosource: rótulo interno da composição do corpussplit:trainouvalidation
Tamanho
- train documents: 49,610
- validation documents: 1,032
Uso
from datasets import load_dataset
ds = load_dataset("celsowm/srp-gpt2-ptbr-corpus")
print(ds["train"][0]["text"][:200])