happylife365/code-quality-large
Code Quality Large Dataset A large-scale Python code quality dataset with 17,855 samples from diverse sources. Dataset Statistics Metric Value Total Samples 17,855 Quality Score Range 75 - 100 Average Score 98.6 Quality Distribution Tier Count Percentage Excellent (95-100) 16,192 90.7% Good (85-94) 1,558 8.7% Acceptable (75-84) 105 0.6% Poor (<75) 0 0.0% Splits Split Samples Description… See the full description on the dataset page: https://huggingface.co/datasets/happylife365/code-quality-large.
Code Quality Large Dataset
A large-scale Python code quality dataset with 17,855 samples from diverse sources.
Dataset Statistics
Quality Distribution
Splits
Sources
10 diverse sources including GitHub code, instruction datasets, and benchmarks.
Usage
from datasets import load_dataset
# Load all data
dataset = load_dataset("happylife365/code-quality-large", data_files="all.jsonl")
# Load high quality only
hq = load_dataset("happylife365/code-quality-large", data_files="high_quality.jsonl")Fields
Each sample contains: code, source, qualityscore, qualitytier, and 37 quality metrics.
