CoolFace
Datasetpublic

juliadollis/energy-mcq-harder-lighteval-rag-hard

energy-mcq-harder-lighteval-rag-hard Avaliação do pipeline de RAG da Cemig pelo LightEval, através de um endpoint compatível com OpenAI. O RAG é avaliado como se fosse um modelo: mesmo runner, mesmas tasks e mesmas métricas usadas nos modelos puros. Como ler Uma linha por (experimento, modelo, task, métrica). A coluna model_name é o nome do experimento — decoder-only é a baseline sem recuperação, e rag-<encoder>[-<reranker>] identifica a combinação usada.… See the full description on the dataset page: https://huggingface.co/datasets/juliadollis/energy-mcq-harder-lighteval-rag-hard.

sourceHugging Faceupdated 1mo agoView on Hugging Face
0likes18downloads
Dataset Card

energy-mcq-harder-lighteval-rag-hard

Avaliação do pipeline de RAG da Cemig pelo LightEval, através de um endpoint compatível com OpenAI. O RAG é avaliado como se fosse um modelo: mesmo runner, mesmas tasks e mesmas métricas usadas nos modelos puros.

Como ler

Uma linha por (experimento, modelo, task, métrica). A coluna model_name é o nome do experimento — decoder-only é a baseline sem recuperação, e rag-<encoder>[-<reranker>] identifica a combinação usada.

Parâmetros

parâmetrovalor
llmcemig-nlp-releases/energy-gpt-regulatorio-v2
llm_backendvllm
torch_dtypebfloat16
encodersmultilingual-e5-small-ft, multilingual-e5-large-ft-v2, qwen3-embedding-0.6B-ft, qwen3-embedding-0.6B-ft-v2
rerankersbge-reranker-v2-m3-ft, bge-reranker-v2-m3-ft-v2
retriever_k5
rerank_fetch_k5
reranker_k5
reranker_threshold0.1
empty_ctx_fallbackTrue
rag_query_modetask (enunciado + alternativas)
context_positionbefore_question
metricaanswer_extraction (letra entre delimitadores)
generation_size512
datasetcemig-ceia/benchmark-energy-mcq-harder
alternativas7
nodgx-H100-02
runnerpaulovsantanas/light-benchmark @ branch energy-mcq-harder-/-energy-mcq-/-EngDistribuicao
endpointjuliadollis/rag-cemig-endpoint @ feat/openai-endpoint
subsethard
amostras645
acaso0.1429
jobs_slurm30179 (hard), 30180 (easy)

Experimentos neste dataset: matriz-hard-h100n2-vllm Métricas: answer_extraction

Resultados (answer_extraction)

experimentoacurácia
rag-qwen3-ft79.07%
rag-qwen3-ft-bge-ft78.91%
rag-qwen3-ft-v2-bge-ft78.91%
rag-qwen3-ft-v278.76%
rag-e5-small-ft-bge-ft78.14%
rag-e5-large-ft-v2-bge-ft77.83%
rag-e5-large-ft-v277.67%
rag-e5-small-ft76.59%
rag-e5-large-ft-v2-bge-ft-v275.81%
rag-qwen3-ft-bge-ft-v275.81%
rag-qwen3-ft-v2-bge-ft-v275.66%
rag-e5-small-ft-bge-ft-v274.57%
decoder-only38.45%

Atenção sobre em / pm

em/pm nao mede este modelo: o gold e ' D' e ele responde '(D)', entao os parenteses quebram exact e prefix match e um acerto vira erro. Por isso a metrica e answer_extraction.

Detalhes por amostra

A pasta details/ traz o parquet do LightEval com pergunta, prompt exato enviado, resposta do modelo e o que foi extraído — dá para auditar qualquer resposta específica.