UFGCEMIGONA/perguntas_sft_nrs
Perguntas e Respostas SFT sobre Normas Regulamentadoras (NRs) Dataset de pares pergunta-resposta em português (pt-BR) para supervised fine-tuning (SFT) de modelos de linguagem no domínio de Segurança e Saúde no Trabalho (SST), com foco nas Normas Regulamentadoras (NRs) brasileiras e em material complementar de procedimentos internos de SESMT. Conteúdo do dataset Cada exemplo é um par pergunta/resposta gerado a partir de um trecho (chunk) de uma NR ou de um… See the full description on the dataset page: https://huggingface.co/datasets/UFGCEMIGONA/perguntas_sft_nrs.
Perguntas e Respostas SFT sobre Normas Regulamentadoras (NRs)
Dataset de pares pergunta-resposta em português (pt-BR) para supervised fine-tuning (SFT) de modelos de linguagem no domínio de Segurança e Saúde no Trabalho (SST), com foco nas Normas Regulamentadoras (NRs) brasileiras e em material complementar de procedimentos internos de SESMT.
Conteúdo do dataset
Cada exemplo é um par pergunta/resposta gerado a partir de um trecho (chunk) de uma NR ou de um manual/procedimento interno, com uma justificativa extrativa do texto-fonte e uma nota de groundedness (o quanto a resposta está fielmente apoiada no trecho de origem).
Campos
Splits
Divisão feita de forma aleatória (seed fixa = 42), sem estratificação, a partir do arquivo sft_data.parquet (4995 exemplos no total).
Distribuição por norma (top 10)
O dataset cobre ao todo 31 NRs distintas (a lista completa pode ser inspecionada na coluna norma).
Distribuição por persona
Distribuição por fonte
Qualidade (groundedness)
A coluna pontuacao_groundedness mede o quanto a resposta_esperada está apoiada fielmente no trecho de origem (0 a 10, atribuída por um LLM-judge). Todos os exemplos do dataset foram filtrados para manter apenas pares com alto grau de fidelidade:
- média: 9,98
- mediana: 10
- mínimo: 7
Pipeline de geração
- Coleta/parse dos textos das NRs e de manuais.
- Chunking dos documentos em trechos menores.
- Geração de pares pergunta-resposta por persona a partir de cada trecho, via LLM.
- Filtragem de pares inválidos/duplicados/de baixa qualidade.
- Avaliação de groundedness por LLM-judge e seleção apenas dos pares aceitos.
- Split aleatório 90/10 em treino/teste para uso em fine-tuning.
Uso
from datasets import load_dataset
ds = load_dataset("UFGCEMIGONA/perguntas_sft_nrs")
print(ds)
print(ds["train"][0])