CoolFace
Datasetpublic

jinilson/Brasil

🇧🇷 Brasil — Textos Literários Brasileiros Dataset de textos em português brasileiro para pré-treinamento e fine-tuning de modelos de linguagem. O corpus é composto por obras literárias clássicas brasileiras em domínio público, com foco na riqueza linguística e cultural do Brasil. 📚 Conteúdo atual Obra Autor Ano Palavras (aprox.) Obra A Autor Brasileiro 1 1880 ~80.000 Obra B Autor Brasileiro 2 1902 ~65.000 Obra C Autor Brasileiro 3 1925 ~90.000… See the full description on the dataset page: https://huggingface.co/datasets/jinilson/Brasil.

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes30downloads
Dataset Card

🇧🇷 Brasil — Textos Literários Brasileiros

Dataset de textos em português brasileiro para pré-treinamento e fine-tuning de modelos de linguagem. O corpus é composto por obras literárias clássicas brasileiras em domínio público, com foco na riqueza linguística e cultural do Brasil.

📚 Conteúdo atual

ObraAutorAnoPalavras (aprox.)
Obra AAutor Brasileiro 11880~80.000
Obra BAutor Brasileiro 21902~65.000
Obra CAutor Brasileiro 31925~90.000
📌 Mais obras serão adicionadas progressivamente.

đź“‚ Estrutura dos arquivos

Brasil/
├── data/
│   ├── obra_a_pretrain_hf.jsonl
│   ├── obra_b_pretrain_hf.jsonl
│   └── obra_c_pretrain_hf.jsonl
├── metadata.json
└── README.md

Cada linha do .jsonl segue o formato padrĂŁo para treinamento de linguagem:

json
{"text": "Era uma vez, nas margens do rio grande, um homem que carregava consigo o peso do sertĂŁo..."}

🚀 Como usar

python
from datasets import load_dataset

ds = load_dataset("jinilson/Brasil")
print(ds["train"][0])

Para treinamento causal (GPT-style):

python
from datasets import load_dataset
from transformers import AutoTokenizer

ds = load_dataset("jinilson/Brasil")
tokenizer = AutoTokenizer.from_pretrained("seu-modelo-base")

def tokenize(example):
    return tokenizer(example["text"], truncation=True, max_length=512)

tokenized = ds.map(tokenize, batched=True)

🎯 Casos de uso

  • —✅ PrĂ©-treinamento de modelos de linguagem em portuguĂŞs
  • —✅ Continual pre-training — continuar treinando modelos já existentes com dados PT-BR
  • —✅ Fine-tuning para geração de texto literário em portuguĂŞs
  • —✅ Embeddings e modelos de representação semântica
  • —✅ Benchmarking de modelos em portuguĂŞs clássico e moderno

📊 Estatísticas

MétricaValor
Total de obras3
Total de palavras~235.000
IdiomaPortuguĂŞs Brasileiro (pt-BR)
Período históricoSéculo XIX – XX
FormatoJSONL (uma entrada por linha)

🔤 Características linguísticas

  • —PortuguĂŞs brasileiro em diferentes registros histĂłricos
  • —Vocabulário rico e variado da literatura clássica
  • —Obras em domĂ­nio pĂşblico — sem restrições de uso
  • —Texto limpo, sem ruĂ­do de OCR

📜 Licença e direitos

Todas as obras incluídas neste dataset são de domínio público no Brasil e internacionalmente. O dataset em si é disponibilizado sob licença Apache 2.0.

Fonte dos textos: Project Gutenberg

🤝 Contribuições

Quer adicionar mais obras brasileiras? Abra uma issue ou pull request!

Sugestões de obras para incluir:

  • —Dom Casmurro — Machado de Assis
  • —MemĂłrias PĂłstumas de Brás Cubas — Machado de Assis
  • —O Cortiço — AluĂ­sio Azevedo
  • —Iracema — JosĂ© de Alencar
  • —Os Sertões — Euclides da Cunha

✍️ Citação

bibtex
@dataset{jinilson_brasil_2026,
  author    = {jinilson},
  title     = {Brasil — Textos Literários Brasileiros},
  year      = {2026},
  publisher = {Hugging Face},
  url       = {https://huggingface.co/datasets/jinilson/Brasil}
}