CoolFace
Datasetpublic

juliadollis/energy-mcq-harder-lighteval-rag

energy-mcq-harder-lighteval-rag Avaliação do pipeline de RAG da Cemig pelo LightEval, através de um endpoint compatível com OpenAI. O RAG é avaliado como se fosse um modelo: mesmo runner, mesmas tasks e mesmas métricas usadas nos modelos puros. Como ler Uma linha por (experimento, modelo, task, métrica). A coluna model_name é o nome do experimento — decoder-only é a baseline sem recuperação, e rag-<encoder>[-<reranker>] identifica a combinação usada.… See the full description on the dataset page: https://huggingface.co/datasets/juliadollis/energy-mcq-harder-lighteval-rag.

sourceHugging Faceupdated 1mo agoView on Hugging Face
0likes29downloads
Dataset Card

energy-mcq-harder-lighteval-rag

Avaliação do pipeline de RAG da Cemig pelo LightEval, através de um endpoint compatível com OpenAI. O RAG é avaliado como se fosse um modelo: mesmo runner, mesmas tasks e mesmas métricas usadas nos modelos puros.

Como ler

Uma linha por (experimento, modelo, task, métrica). A coluna model_name é o nome do experimento — decoder-only é a baseline sem recuperação, e rag-<encoder>[-<reranker>] identifica a combinação usada.

Parâmetros

parâmetrovalor
llmcemig-nlp-releases/energy-gpt-regulatorio-v2
encodercemig-nlp-releases/multilingual-e5-large-ft-v2
reranker—
retriever_k5
rag_query_modetask
context_positionbefore_question
llm_backendvllm
torch_dtypebfloat16
nodgx-H100-02 (jobs SLURM 30157/30158)
datasetcemig-ceia/benchmark-energy-mcq-harder
subsethard
amostras645
alternativas7
acaso0.1429
metricaanswer_extraction (letra entre delimitadores)
generation_size512
runnerpaulovsantanas/light-benchmark @ branch energy-mcq-harder-/-energy-mcq-/-EngDistribuicao
endpointjuliadollis/rag-cemig-endpoint @ feat/openai-endpoint

Experimentos neste dataset: rag-lighteval-hard-extraction Métricas: answer_extraction

Resultados (answer_extraction)

experimentoacurácia
energy-gpt-v2-rag-e5large-ft-v277.83%
energy-gpt-v2-norag38.60%

Atenção sobre em / pm

em/pm nao mede este modelo: o gold e ' D' e ele responde '(D)', entao os parenteses quebram exact e prefix match e um acerto vira erro. Use answer_extraction.

Detalhes por amostra

A pasta details/ traz o parquet do LightEval com pergunta, prompt exato enviado, resposta do modelo e o que foi extraído — dá para auditar qualquer resposta específica.