CoolFace
Datasetpublic

juliadollis/tessera-extraidollm-gpt-5-mini-corrigido

tessera-extraidollm-gpt-5-mini-corrigido Questões de múltipla escolha de direito brasileiro (Exame de Ordem, edições 38 a 45), com o texto da norma aplicável extraído do comentário oficial e verificado caractere a caractere contra ele. É a versão corrigida de tessera-extraidollm-gpt-5-mini, e é a que deve ser usada. O dado bruto de origem está em tessera. Números questões 614 com norma extraída 508 (82.7%) com a norma da alternativa correta 372… See the full description on the dataset page: https://huggingface.co/datasets/juliadollis/tessera-extraidollm-gpt-5-mini-corrigido.

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
0likes15downloads
Dataset Card

tessera-extraidollm-gpt-5-mini-corrigido

Questões de múltipla escolha de direito brasileiro (Exame de Ordem, edições 38 a 45), com o texto da norma aplicável extraído do comentário oficial e verificado caractere a caractere contra ele.

É a versão corrigida de `tessera-extraidollm-gpt-5-mini`, e é a que deve ser usada. O dado bruto de origem está em `tessera`.

Números

questões614
com norma extraída508 (82.7%)
com a norma da alternativa correta372 (60.6%)
sem nenhum problema no diagnóstico508 (82.7%)
corrigidas em relação à versão anterior4
gerações interrompidas1

Divisão: dev (exames 38-43) e teste (44-45). O split de teste abre uma vez só, no fim.

O que a correção fez

A verificação da versão anterior acusava 14 blocos costurados. Abrindo um a um, 10 eram defeito do medidor: a normalização colapsava espaço em vez de removê-lo, e o comentário quebra linha no meio de palavras (far-se-\não). Esses não foram tocados — a verificação é que foi arrumada.

Os 4 restantes foram corrigidos por índice, recortando do comentário: o bloco é repartido nos maiores pedaços contíguos que existem lá, e o texto sai do comentário, não da saída do modelo. Por construção, não há caractere inventado. Nenhum modelo foi chamado nesta etapa.

Colunas

colunatipoo que é
idstrexame-questao, ex. 38-38
exame / questaoint / stra prova e o número
splitstrdev ou teste
enunciadostro enunciado
alternativasstr (JSON)[{"letra":"A","texto":"..."}, ...] — sempre as quatro
respostastro gabarito
comentariostro comentário oficial inteiro
comentario_por_letrastr (JSON)o comentário separado por alternativa
comentario_geralstro item "Geral" do comentário
`lei`stro texto das normas transcritas, corrigido. null se não houver
`lei_da_resposta`stros trechos localizados no comentário da alternativa correta
lei_a … lei_d, lei_geralstro mesmo, por alternativa e para o item "Geral"
lei_brutastro que o modelo devolveu, antes da correção
correcaostro que foi feito nesta linha. Vazio = não foi tocada
lei_ok / problemasbool / str (JSON)passou nas checagens / quais falharam
alerta_parafraseboolheurística: algum trecho começa como relato do comentarista
motivo_parada / truncadastr / boolfinish_reason da API e se a geração foi interrompida
tem_jurisprudencia / so_jurisprudenciaboolpelo prefixo JURISPRUDENCIA:

Garantias

Verificado no arquivo gravado, em 100% das linhas:

  • —todo trecho é substring literal do comentário da sua própria questão
  • —nenhum trecho abaixo de 25 caracteres
  • —`lei_da_resposta` é sempre idêntica à coluna da letra do gabarito
  • —614 linhas — nenhuma excluída, nem as que têm problema

Não verificado: se o rótulo da lei (CC, art. 822) está certo, e se a extração deixou passar alguma norma. A verificação prova que o devolvido estava lá; não prova que o não-devolvido não estava.

Transcrição não é paráfrase

O comentário frequentemente explica a norma sem transcrevê-la — O art. 447, § 1º, III, do CPC prevê que menores de 16 anos são impedidos de depor. Isso passa em qualquer checagem de substring, mas é resumo escrito por quem já sabia a resposta. A extração recusa esses casos, e por isso há questões com lei vazia cujo comentário cita artigo. alerta_parafrase marca, por heurística, o que passou parecendo relato.

Reprodução

notebooks-mini/extrair-gpt-5-mini.ipynb (extração) e notebooks-mini/corrigir.ipynb (esta etapa). As respostas cruas do modelo estão versionadas em data/mini/cache/. O registro completo do pipeline está em docs/TESSERA.md.