CoolFace
Datasetpublic

UFGCEMIGONA/perguntas_sft_nrs

Perguntas e Respostas SFT sobre Normas Regulamentadoras (NRs) Dataset de pares pergunta-resposta em português (pt-BR) para supervised fine-tuning (SFT) de modelos de linguagem no domínio de Segurança e Saúde no Trabalho (SST), com foco nas Normas Regulamentadoras (NRs) brasileiras e em material complementar de procedimentos internos de SESMT. Conteúdo do dataset Cada exemplo é um par pergunta/resposta gerado a partir de um trecho (chunk) de uma NR ou de um… See the full description on the dataset page: https://huggingface.co/datasets/UFGCEMIGONA/perguntas_sft_nrs.

sourceHugging Faceupdated 23d agoView on Hugging Face
0likes61downloads
Dataset Card

Perguntas e Respostas SFT sobre Normas Regulamentadoras (NRs)

Dataset de pares pergunta-resposta em português (pt-BR) para supervised fine-tuning (SFT) de modelos de linguagem no domínio de Segurança e Saúde no Trabalho (SST), com foco nas Normas Regulamentadoras (NRs) brasileiras e em material complementar de procedimentos internos de SESMT.

Conteúdo do dataset

Cada exemplo é um par pergunta/resposta gerado a partir de um trecho (chunk) de uma NR ou de um manual/procedimento interno, com uma justificativa extrativa do texto-fonte e uma nota de groundedness (o quanto a resposta está fielmente apoiada no trecho de origem).

Campos

CampoDescrição
chunk_idIdentificador do trecho (chunk) de origem do texto-fonte
normaNorma Regulamentadora de referência (ex.: NR-12, NR-35)
tituloTítulo da norma
item_raizItem/seção raiz da norma da qual o trecho foi extraído
fonteOrigem do trecho: norma (texto oficial da NR) ou manual (procedimento/instrução interna de SESMT)
personaPerfil simulado para quem a pergunta foi gerada: trabalhador_em_atividade_de_risco, tecnico_de_seguranca_do_trabalho ou engenheiro_de_seguranca_do_trabalho_sesmt
tipoCategoria da pergunta: Factual, Factual e Direta, Cenário/Aplicação, Raciocínio/Condicional, Responsabilidade ou Urgência/Coloquial
perguntaPergunta gerada
resposta_esperadaResposta de referência para a pergunta
justificativa_extrativaTrecho do texto-fonte que fundamenta a resposta
item_normaReferência ao(s) item(ns) específico(s) da norma citados na resposta
idxÍndice sequencial do par dentro do trecho de origem
pontuacao_groundednessNota de 0 a 10 atribuída por um avaliador (LLM-judge) para o grau de fidelidade da resposta ao texto-fonte
raciocinio_groundednessJustificativa textual da nota de groundedness

Splits

SplitNº de exemplosProporção
train449590%
test50010%

Divisão feita de forma aleatória (seed fixa = 42), sem estratificação, a partir do arquivo sft_data.parquet (4995 exemplos no total).

Distribuição por norma (top 10)

NormaExemplos
NR-12719
NR-15567
NR-22523
NR-36401
NR-28395
NR-31303
NR-10268
NR-37247
NR-35181
NR-34173

O dataset cobre ao todo 31 NRs distintas (a lista completa pode ser inspecionada na coluna norma).

Distribuição por persona

PersonaExemplos
trabalhador_em_atividade_de_risco1798
tecnico_de_seguranca_do_trabalho1753
engenheiro_de_seguranca_do_trabalho_sesmt1444

Distribuição por fonte

FonteExemplos
norma3349
manual1646

Qualidade (groundedness)

A coluna pontuacao_groundedness mede o quanto a resposta_esperada está apoiada fielmente no trecho de origem (0 a 10, atribuída por um LLM-judge). Todos os exemplos do dataset foram filtrados para manter apenas pares com alto grau de fidelidade:

  • —média: 9,98
  • —mediana: 10
  • —mínimo: 7

Pipeline de geração

  1. 1.Coleta/parse dos textos das NRs e de manuais.
  2. 2.Chunking dos documentos em trechos menores.
  3. 3.Geração de pares pergunta-resposta por persona a partir de cada trecho, via LLM.
  4. 4.Filtragem de pares inválidos/duplicados/de baixa qualidade.
  5. 5.Avaliação de groundedness por LLM-judge e seleção apenas dos pares aceitos.
  6. 6.Split aleatório 90/10 em treino/teste para uso em fine-tuning.

Uso

python
from datasets import load_dataset

ds = load_dataset("UFGCEMIGONA/perguntas_sft_nrs")
print(ds)
print(ds["train"][0])