guell00/Astra-Orbis-5.2K-PT-BR
Astra 5.2K PT-BR Extra High Dataset conversacional em português brasileiro, curado para instruction tuning, SFT e treinamento de modelos com foco em respostas detalhadas, raciocínio, explicações passo a passo e comportamento de assistente. Contém 3 milhões de tolkens no total do dataset. O corpus contém conversas no formato chat, exemplos de programação, tarefas analíticas, perguntas educacionais, resolução de problemas, matemática, escrita, tradução, produtividade e respostas… See the full description on the dataset page: https://huggingface.co/datasets/guell00/Astra-Orbis-5.2K-PT-BR.
Astra 5.2K PT-BR Extra High
Dataset conversacional em português brasileiro, curado para instruction tuning, SFT e treinamento de modelos com foco em respostas detalhadas, raciocínio, explicações passo a passo e comportamento de assistente. Contém 3 milhões de tolkens no total do dataset.
O corpus contém conversas no formato chat, exemplos de programação, tarefas analíticas, perguntas educacionais, resolução de problemas, matemática, escrita, tradução, produtividade e respostas com traços explícitos de raciocínio preservados em blocos <think>...</think> quando presentes no dado original.
O dataset foi normalizado em um formato padrão de mensagens e filtrado para corrigir problemas de estrutura, remover registros inválidos e reduzir duplicações, preservando o comportamento original das respostas do assistente.
Principais Características
- 5.238 conversas/registros válidos
- Formato multi-turn compatível com chat templates modernos
- Conteúdo em PT-BR
- Blocos
<think>...</think>preservados - Alta diversidade de tarefas e domínios
- Respostas curtas, médias e longas
- Adequado para SFT, fine-tuning instrucional e experimentos de raciocínio
- Compatível com frameworks modernos de fine-tuning
- Arquivo em formato JSONL, com um objeto por linha
Formato dos Dados
Cada linha do arquivo é um único objeto JSON:
{
"messages": [
{
"role": "system",
"content": "Você é um assistente útil."
},
{
"role": "user",
"content": "Explique como transformers funcionam."
},
{
"role": "assistant",
"content": "<think>Preciso explicar primeiro o mecanismo de atenção...</think>\nTransformers são arquiteturas de redes neurais..."
}
]
}Usos Recomendados
Este dataset é adequado para:
- Supervised Fine-Tuning, ou SFT
- Treinamento instrucional em português brasileiro
- Modelos de raciocínio
- Assistentes conversacionais
- Geração de respostas longas
- Experimentos com Chain-of-Thought
- Destilação de modelos
- Alinhamento de comportamento conversacional
- Desenvolvimento de chatbots em PT-BR
Exemplo de Uso
from datasets import load_dataset
dataset = load_dataset(
"SEU_USUARIO/Astra-5.2K-PTBR-Extra-High",
split="train"
)
sample = dataset[0]
print(sample["messages"])Citação
@misc{astra_5_2k_ptbr_extra_high,
author = {guell00},
title = {Astra 5.2K PT-BR Extra High},
year = {2026},
howpublished = {\url{https://huggingface.co/datasets/guell00/Astra-5.2K-PTBR-Extra-High}},
note = {Dataset conversacional em português brasileiro para supervised fine-tuning, instruction tuning e treinamento de modelos com foco em raciocínio.}
}:::
