CoolFace
Datasetpublic

rhd008/gemma-enem-dataset

ENEM Essay Evaluation Dataset (FineTome format) Dataset conversacional para fine-tuning de modelos de linguagem como corretores de redações do ENEM. Origem Transformado a partir do kamel-usp/aes_enem_dataset (6 subsets: JBCS2025, PROPOR2024, gradesThousand, sourceAOnly, sourceAWithGraders, sourceB). Formato Cada registro segue o formato mlabonne/FineTome-100k: { "conversations": [ {"from": "human", "value": "<prompt do sistema + tema +… See the full description on the dataset page: https://huggingface.co/datasets/rhd008/gemma-enem-dataset.

sourceHugging Facemitupdated 4mo agoView on Hugging Face
0likes20downloads
Dataset Card

ENEM Essay Evaluation Dataset (FineTome format)

Dataset conversacional para fine-tuning de modelos de linguagem como corretores de redações do ENEM.

Origem

Transformado a partir do kamel-usp/aes_enem_dataset (6 subsets: JBCS2025, PROPOR2024, gradesThousand, sourceAOnly, sourceAWithGraders, sourceB).

Formato

Cada registro segue o formato mlabonne/FineTome-100k:

json
{
  "conversations": [
    {"from": "human", "value": "<prompt do sistema + tema + redação>"},
    {"from": "gpt", "value": "<notas nas 5 competências + nota total + feedback>"}
  ],
  "source": "kamel-usp/aes_enem_dataset/<subset>",
  "score": 3.0
}

Competências MEC avaliadas

#CompetênciaEscala
1Domínio da norma culta da língua portuguesa0-200
2Compreensão da proposta de redação0-200
3Seleção e organização dos argumentos0-200
4Coesão e coerência textual0-200
5Proposta de intervenção0-200
TotalSoma das 5 competências0-1000

Campo score

Nota total normalizada: total / 200.0 (escala 0.0-5.0).

Splits

Os splits originais do kamel-usp/aesenemdataset foram preservados (train, validation, test).

Uso

python
from datasets import load_dataset

ds = load_dataset("rhd008/gemma-enem-dataset")
print(ds["train"][0])

Licença

MIT (mesma licença do dataset original).