CoolFace
Datasetpublic

guell00/Astra-Orbis-5.2K-PT-BR

Astra 5.2K PT-BR Extra High Dataset conversacional em português brasileiro, curado para instruction tuning, SFT e treinamento de modelos com foco em respostas detalhadas, raciocínio, explicações passo a passo e comportamento de assistente. Contém 3 milhões de tolkens no total do dataset. O corpus contém conversas no formato chat, exemplos de programação, tarefas analíticas, perguntas educacionais, resolução de problemas, matemática, escrita, tradução, produtividade e respostas… See the full description on the dataset page: https://huggingface.co/datasets/guell00/Astra-Orbis-5.2K-PT-BR.

sourceHugging Faceupdated 3mo agoView on Hugging Face
1likes49downloads
Dataset Card

Astra 5.2K PT-BR Extra High

Dataset conversacional em português brasileiro, curado para instruction tuning, SFT e treinamento de modelos com foco em respostas detalhadas, raciocínio, explicações passo a passo e comportamento de assistente. Contém 3 milhões de tolkens no total do dataset.

O corpus contém conversas no formato chat, exemplos de programação, tarefas analíticas, perguntas educacionais, resolução de problemas, matemática, escrita, tradução, produtividade e respostas com traços explícitos de raciocínio preservados em blocos <think>...</think> quando presentes no dado original.

O dataset foi normalizado em um formato padrão de mensagens e filtrado para corrigir problemas de estrutura, remover registros inválidos e reduzir duplicações, preservando o comportamento original das respostas do assistente.

Principais Características

  • —5.238 conversas/registros válidos
  • —Formato multi-turn compatível com chat templates modernos
  • —Conteúdo em PT-BR
  • —Blocos <think>...</think> preservados
  • —Alta diversidade de tarefas e domínios
  • —Respostas curtas, médias e longas
  • —Adequado para SFT, fine-tuning instrucional e experimentos de raciocínio
  • —Compatível com frameworks modernos de fine-tuning
  • —Arquivo em formato JSONL, com um objeto por linha

Formato dos Dados

Cada linha do arquivo é um único objeto JSON:

json
{
  "messages": [
    {
      "role": "system",
      "content": "Você é um assistente útil."
    },
    {
      "role": "user",
      "content": "Explique como transformers funcionam."
    },
    {
      "role": "assistant",
      "content": "<think>Preciso explicar primeiro o mecanismo de atenção...</think>\nTransformers são arquiteturas de redes neurais..."
    }
  ]
}

Usos Recomendados

Este dataset é adequado para:

  • —Supervised Fine-Tuning, ou SFT
  • —Treinamento instrucional em português brasileiro
  • —Modelos de raciocínio
  • —Assistentes conversacionais
  • —Geração de respostas longas
  • —Experimentos com Chain-of-Thought
  • —Destilação de modelos
  • —Alinhamento de comportamento conversacional
  • —Desenvolvimento de chatbots em PT-BR

Exemplo de Uso

python
from datasets import load_dataset

dataset = load_dataset(
    "SEU_USUARIO/Astra-5.2K-PTBR-Extra-High",
    split="train"
)

sample = dataset[0]
print(sample["messages"])

Citação

bibtex
@misc{astra_5_2k_ptbr_extra_high,
  author       = {guell00},
  title        = {Astra 5.2K PT-BR Extra High},
  year         = {2026},
  howpublished = {\url{https://huggingface.co/datasets/guell00/Astra-5.2K-PTBR-Extra-High}},
  note         = {Dataset conversacional em português brasileiro para supervised fine-tuning, instruction tuning e treinamento de modelos com foco em raciocínio.}
}

:::