rhd008/gemma-enem-dataset
ENEM Essay Evaluation Dataset (FineTome format) Dataset conversacional para fine-tuning de modelos de linguagem como corretores de redações do ENEM. Origem Transformado a partir do kamel-usp/aes_enem_dataset (6 subsets: JBCS2025, PROPOR2024, gradesThousand, sourceAOnly, sourceAWithGraders, sourceB). Formato Cada registro segue o formato mlabonne/FineTome-100k: { "conversations": [ {"from": "human", "value": "<prompt do sistema + tema +… See the full description on the dataset page: https://huggingface.co/datasets/rhd008/gemma-enem-dataset.
ENEM Essay Evaluation Dataset (FineTome format)
Dataset conversacional para fine-tuning de modelos de linguagem como corretores de redações do ENEM.
Origem
Transformado a partir do kamel-usp/aes_enem_dataset (6 subsets: JBCS2025, PROPOR2024, gradesThousand, sourceAOnly, sourceAWithGraders, sourceB).
Formato
Cada registro segue o formato mlabonne/FineTome-100k:
{
"conversations": [
{"from": "human", "value": "<prompt do sistema + tema + redação>"},
{"from": "gpt", "value": "<notas nas 5 competências + nota total + feedback>"}
],
"source": "kamel-usp/aes_enem_dataset/<subset>",
"score": 3.0
}Competências MEC avaliadas
Campo score
Nota total normalizada: total / 200.0 (escala 0.0-5.0).
Splits
Os splits originais do kamel-usp/aesenemdataset foram preservados (train, validation, test).
Uso
from datasets import load_dataset
ds = load_dataset("rhd008/gemma-enem-dataset")
print(ds["train"][0])Licença
MIT (mesma licença do dataset original).
