AdityaaXD/Credit-Score-Classification
๐ณ Credit Score Classification Dataset A comprehensive dataset for predicting customer credit scores into three categories: Good, Standard, and Poor. Dataset Description This dataset contains customer financial information and behavioral patterns used for credit score classification. It includes various features related to credit history, payment behavior, and financial metrics. Dataset Summary Property Value Total Samples ~100,000+โฆ See the full description on the dataset page: https://huggingface.co/datasets/AdityaaXD/Credit-Score-Classification.
๐ณ Credit Score Classification Dataset
A comprehensive dataset for predicting customer credit scores into three categories: Good, Standard, and Poor.
Dataset Description
This dataset contains customer financial information and behavioral patterns used for credit score classification. It includes various features related to credit history, payment behavior, and financial metrics.
Dataset Summary
Dataset Structure
Data Files
Features
Numerical Features (17)
Categorical Features (5)
Target Variable
Dataset Statistics
Class Distribution
Feature Statistics (Approximate)
Usage
Loading with Pandas
import pandas as pd
# Load training data
train_df = pd.read_csv('train.csv')
print(f"Training samples: {len(train_df)}")
print(f"Features: {train_df.columns.tolist()}")
# Load test data
test_df = pd.read_csv('test.csv')
print(f"Test samples: {len(test_df)}")Basic Exploration
# Check class distribution
print(train_df['Credit_Score'].value_counts())
# Check for missing values
print(train_df.isnull().sum())
# Statistical summary
print(train_df.describe())Data Preprocessing
The following preprocessing steps are recommended:
- Handle Missing Values: Some columns may contain missing or placeholder values
- Clean Categorical Data: Handle special characters in categorical columns
- Feature Scaling: Apply StandardScaler to numerical features
- Encoding: Use OneHotEncoder for categorical features, LabelEncoder for target
Example Preprocessing
from sklearn.preprocessing import StandardScaler, LabelEncoder, OneHotEncoder
import pandas as pd
# Numerical columns
numerical_cols = ['Age', 'Annual_Income', 'Monthly_Inhand_Salary',
'Num_Bank_Accounts', 'Num_Credit_Card', 'Interest_Rate',
'Num_of_Loan', 'Delay_from_due_date', 'Num_of_Delayed_Payment',
'Changed_Credit_Limit', 'Num_Credit_Inquiries', 'Outstanding_Debt',
'Credit_Utilization_Ratio', 'Credit_History_Age_Months',
'Total_EMI_per_month', 'Amount_invested_monthly', 'Monthly_Balance']
# Categorical columns
categorical_cols = ['Month', 'Occupation', 'Credit_Mix',
'Payment_of_Min_Amount', 'Payment_Behaviour']
# Scale numerical features
scaler = StandardScaler()
X_numerical = scaler.fit_transform(train_df[numerical_cols])
# Encode target
label_encoder = LabelEncoder()
y = label_encoder.fit_transform(train_df['Credit_Score'])Considerations for Using the Data
Data Quality Issues
- Some columns may contain placeholder values (e.g.,
_,________,!@9#%8) - Credit history age may need conversion from text format
- Some numerical columns may have outliers
Ethical Considerations
โ ๏ธ Important: When using this data for credit scoring models:
- Be aware of potential biases in the data
- Ensure compliance with local financial regulations
- Credit decisions should not be based solely on automated predictions
- Provide transparency and explanations for credit decisions
Recommended Cleaning Steps
# Example: Handle placeholder values
placeholders = ['_', '________', '!@9#%8', 'NM']
for col in categorical_cols:
train_df[col] = train_df[col].replace(placeholders, 'Unknown')Related Models
- Model: AdityaaXD/credit-score-classifier
- GitHub: Credit-Score-Classification
Citation
@dataset{credit-score-dataset,
author = {Aditya},
title = {Credit Score Classification Dataset},
year = {2026},
publisher = {Hugging Face},
url = {https://huggingface.co/datasets/AdityaaXD/credit-score-dataset}
}Contact
- Hugging Face: @AdityaaXD
- GitHub: @ADITYA-tp01
