CoolFace
Datasetpublic

happylife365/code-quality-large

Code Quality Large Dataset A large-scale Python code quality dataset with 17,855 samples from diverse sources. Dataset Statistics Metric Value Total Samples 17,855 Quality Score Range 75 - 100 Average Score 98.6 Quality Distribution Tier Count Percentage Excellent (95-100) 16,192 90.7% Good (85-94) 1,558 8.7% Acceptable (75-84) 105 0.6% Poor (<75) 0 0.0% Splits Split Samples Description… See the full description on the dataset page: https://huggingface.co/datasets/happylife365/code-quality-large.

sourceHugging Faceupdated 8mo agoView on Hugging Face
0likes7downloads
Dataset Card

Code Quality Large Dataset

A large-scale Python code quality dataset with 17,855 samples from diverse sources.

Dataset Statistics

MetricValue
Total Samples17,855
Quality Score Range75 - 100
Average Score98.6

Quality Distribution

TierCountPercentage
Excellent (95-100)16,19290.7%
Good (85-94)1,5588.7%
Acceptable (75-84)1050.6%
Poor (<75)00.0%

Splits

SplitSamplesDescription
all.jsonl17,855All samples
high_quality.jsonl17,750Score >= 85
premium.jsonl16,192Score >= 95
poor_quality.jsonl0Score < 75

Sources

10 diverse sources including GitHub code, instruction datasets, and benchmarks.

Usage

python
from datasets import load_dataset

# Load all data
dataset = load_dataset("happylife365/code-quality-large", data_files="all.jsonl")

# Load high quality only
hq = load_dataset("happylife365/code-quality-large", data_files="high_quality.jsonl")

Fields

Each sample contains: code, source, qualityscore, qualitytier, and 37 quality metrics.