CoolFace
Datasetpublic

juliadollis/energy-mcq-harder-lighteval-rag-easy

energy-mcq-harder-lighteval-rag-easy Avaliação do pipeline de RAG da Cemig pelo LightEval, através de um endpoint compatível com OpenAI. O RAG é avaliado como se fosse um modelo: mesmo runner, mesmas tasks e mesmas métricas usadas nos modelos puros. Como ler Uma linha por (experimento, modelo, task, métrica). A coluna model_name é o nome do experimento — decoder-only é a baseline sem recuperação, e rag-<encoder>[-<reranker>] identifica a combinação usada.… See the full description on the dataset page: https://huggingface.co/datasets/juliadollis/energy-mcq-harder-lighteval-rag-easy.

sourceHugging Faceupdated 1mo agoView on Hugging Face
0likes75downloads
Dataset Card

energy-mcq-harder-lighteval-rag-easy

Avaliação do pipeline de RAG da Cemig pelo LightEval, através de um endpoint compatível com OpenAI. O RAG é avaliado como se fosse um modelo: mesmo runner, mesmas tasks e mesmas métricas usadas nos modelos puros.

Como ler

Uma linha por (experimento, modelo, task, métrica). A coluna model_name é o nome do experimento — decoder-only é a baseline sem recuperação, e rag-<encoder>[-<reranker>] identifica a combinação usada.

Parâmetros

parâmetrovalor
llmcemig-nlp-releases/energy-gpt-regulatorio-v2
llm_backendvllm
torch_dtypebfloat16
encodersmultilingual-e5-small-ft, multilingual-e5-large-ft-v2, qwen3-embedding-0.6B-ft, qwen3-embedding-0.6B-ft-v2
rerankersbge-reranker-v2-m3-ft, bge-reranker-v2-m3-ft-v2
retriever_k5
rerank_fetch_k5
reranker_k5
reranker_threshold0.1
empty_ctx_fallbackTrue
rag_query_modetask (enunciado + alternativas)
context_positionbefore_question
metricaanswer_extraction (letra entre delimitadores)
generation_size512
datasetcemig-ceia/benchmark-energy-mcq-harder
alternativas7
nodgx-H100-02
runnerpaulovsantanas/light-benchmark @ branch energy-mcq-harder-/-energy-mcq-/-EngDistribuicao
endpointjuliadollis/rag-cemig-endpoint @ feat/openai-endpoint
subseteasy
amostras644
acaso0.1429
jobs_slurm30179 (hard), 30180 (easy)

Experimentos neste dataset: matriz-easy-h100n2-vllm Métricas: answer_extraction

Resultados (answer_extraction)

experimentoacurácia
rag-e5-large-ft-v295.50%
rag-qwen3-ft95.03%
rag-qwen3-ft-v295.03%
rag-e5-large-ft-v2-bge-ft94.88%
rag-qwen3-ft-bge-ft-v294.57%
rag-qwen3-ft-v2-bge-ft-v294.57%
rag-qwen3-ft-bge-ft94.10%
rag-qwen3-ft-v2-bge-ft94.10%
rag-e5-small-ft93.63%
rag-e5-small-ft-bge-ft93.32%
rag-e5-large-ft-v2-bge-ft-v293.32%
rag-e5-small-ft-bge-ft-v293.17%
decoder-only81.37%

Atenção sobre em / pm

em/pm nao mede este modelo: o gold e ' D' e ele responde '(D)', entao os parenteses quebram exact e prefix match e um acerto vira erro. Por isso a metrica e answer_extraction.

Detalhes por amostra

A pasta details/ traz o parquet do LightEval com pergunta, prompt exato enviado, resposta do modelo e o que foi extraído — dá para auditar qualquer resposta específica.