jinilson/Brasil
🇧🇷 Brasil — Textos Literários Brasileiros Dataset de textos em portuguĂŞs brasileiro para prĂ©-treinamento e fine-tuning de modelos de linguagem. O corpus Ă© composto por obras literárias clássicas brasileiras em domĂnio pĂşblico, com foco na riqueza linguĂstica e cultural do Brasil. 📚 ConteĂşdo atual Obra Autor Ano Palavras (aprox.) Obra A Autor Brasileiro 1 1880 ~80.000 Obra B Autor Brasileiro 2 1902 ~65.000 Obra C Autor Brasileiro 3 1925 ~90.000… See the full description on the dataset page: https://huggingface.co/datasets/jinilson/Brasil.
🇧🇷 Brasil — Textos Literários Brasileiros
Dataset de textos em portuguĂŞs brasileiro para prĂ©-treinamento e fine-tuning de modelos de linguagem. O corpus Ă© composto por obras literárias clássicas brasileiras em domĂnio pĂşblico, com foco na riqueza linguĂstica e cultural do Brasil.
📚 Conteúdo atual
📌 Mais obras serão adicionadas progressivamente.
đź“‚ Estrutura dos arquivos
Brasil/
├── data/
│ ├── obra_a_pretrain_hf.jsonl
│ ├── obra_b_pretrain_hf.jsonl
│ └── obra_c_pretrain_hf.jsonl
├── metadata.json
└── README.mdCada linha do .jsonl segue o formato padrão para treinamento de linguagem:
{"text": "Era uma vez, nas margens do rio grande, um homem que carregava consigo o peso do sertão..."}🚀 Como usar
from datasets import load_dataset
ds = load_dataset("jinilson/Brasil")
print(ds["train"][0])Para treinamento causal (GPT-style):
from datasets import load_dataset
from transformers import AutoTokenizer
ds = load_dataset("jinilson/Brasil")
tokenizer = AutoTokenizer.from_pretrained("seu-modelo-base")
def tokenize(example):
return tokenizer(example["text"], truncation=True, max_length=512)
tokenized = ds.map(tokenize, batched=True)🎯 Casos de uso
- ✅ Pré-treinamento de modelos de linguagem em português
- ✅ Continual pre-training — continuar treinando modelos já existentes com dados PT-BR
- ✅ Fine-tuning para geração de texto literário em português
- ✅ Embeddings e modelos de representação semântica
- ✅ Benchmarking de modelos em português clássico e moderno
📊 EstatĂsticas
🔤 CaracterĂsticas linguĂsticas
- PortuguĂŞs brasileiro em diferentes registros histĂłricos
- Vocabulário rico e variado da literatura clássica
- Obras em domĂnio pĂşblico — sem restrições de uso
- Texto limpo, sem ruĂdo de OCR
📜 Licença e direitos
Todas as obras incluĂdas neste dataset sĂŁo de domĂnio pĂşblico no Brasil e internacionalmente. O dataset em si Ă© disponibilizado sob licença Apache 2.0.
Fonte dos textos: Project Gutenberg
🤝 Contribuições
Quer adicionar mais obras brasileiras? Abra uma issue ou pull request!
Sugestões de obras para incluir:
- Dom Casmurro — Machado de Assis
- Memórias Póstumas de Brás Cubas — Machado de Assis
- O Cortiço — AluĂsio Azevedo
- Iracema — José de Alencar
- Os Sertões — Euclides da Cunha
✍️ Citação
@dataset{jinilson_brasil_2026,
author = {jinilson},
title = {Brasil — Textos Literários Brasileiros},
year = {2026},
publisher = {Hugging Face},
url = {https://huggingface.co/datasets/jinilson/Brasil}
}