juliadollis/energy-mcq-harder-lighteval-rag-easy
energy-mcq-harder-lighteval-rag-easy Avaliação do pipeline de RAG da Cemig pelo LightEval, através de um endpoint compatível com OpenAI. O RAG é avaliado como se fosse um modelo: mesmo runner, mesmas tasks e mesmas métricas usadas nos modelos puros. Como ler Uma linha por (experimento, modelo, task, métrica). A coluna model_name é o nome do experimento — decoder-only é a baseline sem recuperação, e rag-<encoder>[-<reranker>] identifica a combinação usada.… See the full description on the dataset page: https://huggingface.co/datasets/juliadollis/energy-mcq-harder-lighteval-rag-easy.
energy-mcq-harder-lighteval-rag-easy
Avaliação do pipeline de RAG da Cemig pelo LightEval, através de um endpoint compatível com OpenAI. O RAG é avaliado como se fosse um modelo: mesmo runner, mesmas tasks e mesmas métricas usadas nos modelos puros.
Como ler
Uma linha por (experimento, modelo, task, métrica). A coluna model_name é o nome do experimento — decoder-only é a baseline sem recuperação, e rag-<encoder>[-<reranker>] identifica a combinação usada.
Parâmetros
Experimentos neste dataset: matriz-easy-h100n2-vllm Métricas: answer_extraction
Resultados (answer_extraction)
Atenção sobre em / pm
em/pm nao mede este modelo: o gold e ' D' e ele responde '(D)', entao os parenteses quebram exact e prefix match e um acerto vira erro. Por isso a metrica e answer_extraction.
Detalhes por amostra
A pasta details/ traz o parquet do LightEval com pergunta, prompt exato enviado, resposta do modelo e o que foi extraído — dá para auditar qualquer resposta específica.
