CoolFace
Datasetpublic

celsowm/srp-gpt2-ptbr-corpus

SRP GPT-2 PT-BR Corpus Corpus público em Parquet para treino autoregressivo de modelos de linguagem em português. Fontes Este dataset é uma composição de textos públicos/republicáveis, com atribuição às fontes originais: Project Gutenberg, acessado via Gutendex API: https://www.gutenberg.org/ e https://gutendex.com/ FineWeb2 da Hugging Face, filtrado para português/pt-BR: https://huggingface.co/datasets/HuggingFaceFW/fineweb-2 Licenciamento e… See the full description on the dataset page: https://huggingface.co/datasets/celsowm/srp-gpt2-ptbr-corpus.

sourceHugging Faceodc-byupdated 5mo agoView on Hugging Face
0likes19downloads
Dataset Card

SRP GPT-2 PT-BR Corpus

Corpus público em Parquet para treino autoregressivo de modelos de linguagem em português.

Fontes

Este dataset é uma composição de textos públicos/republicáveis, com atribuição às fontes originais:

  • Project Gutenberg, acessado via Gutendex API: https://www.gutenberg.org/ e https://gutendex.com/
  • FineWeb2 da Hugging Face, filtrado para português/pt-BR: https://huggingface.co/datasets/HuggingFaceFW/fineweb-2

Licenciamento e atribuição

  • FineWeb2 é disponibilizado sob licença ODC-By 1.0 e requer atribuição.
  • Textos do Project Gutenberg geralmente são obras em domínio público nos EUA, mas cada arquivo pode conter termos do Project Gutenberg; consulte a fonte original quando redistribuir fora deste dataset.
  • Este dataset mantém atribuição às fontes acima e deve ser usado respeitando os termos das fontes originais.

Colunas

  • id: identificador estável do documento
  • text: texto UTF-8 do documento
  • source: rótulo interno da composição do corpus
  • split: train ou validation

Tamanho

  • train documents: 49,610
  • validation documents: 1,032

Uso

python
from datasets import load_dataset

ds = load_dataset("celsowm/srp-gpt2-ptbr-corpus")
print(ds["train"][0]["text"][:200])