phi4 mini
Phi-4-mini-reasoning-secalignPhi-4-Mini-customerservice-Human-evaluator_2_dataPhi-4-mini-instruct-generationsphi-4-mini-instruct-ultrafeedbackPhi-4-mini-customerservice-context-summarization-llm-judge-data
customer-service-context-summarization-evaluation-data
Phi-4-mini-customerservice-context-summarization-llm-judge-data
Dataset updated with context summarization evaluation columns.
This README refresh triggers Hugging Face metadata re-index.
local-code-arena-mbpp-phi4-mini
Local Code Arena Telemetry: MBPP Benchmark on Phi-4 Mini
This repository hosts the raw evaluation metrics, execution telemetry logs, and structural syntax outputs captured from running the Mostly Basic Python Problems (MBPP) benchmark against Microsoft's Phi-4 Mini (3.8B) model.
This run establishes a vital cross-vendor reference point, documenting how high-density synthetic reasoning filtration scales relative to dedicated code-only specialists on local consumer hardware.… See the full description on the dataset page: https://huggingface.co/datasets/ShahzebKhoso/local-code-arena-mbpp-phi4-mini.
