CoolFace
Datasetpublic

samgohan/Tabular_Imbalanced_Regression

Tabular Imbalanced Regression Datasets Repository Summary This repository provides a collection of 81 tabular datasets curated for research on tabular imbalanced regression problems. They were obtained from the various studies carried out on the subject (source and papers listed below).Its objective is to centralize datasets commonly used in the literature, serving as a solid reference point for future work. Additional datasets can be contributed or requested —… See the full description on the dataset page: https://huggingface.co/datasets/samgohan/Tabular_Imbalanced_Regression.

sourceHugging Facecc-by-4.0updated 1y agoView on Hugging Face
1likes142downloads
Dataset Card

Tabular Imbalanced Regression Datasets

Repository Summary

This repository provides a collection of 81 tabular datasets curated for research on tabular imbalanced regression problems. They were obtained from the various studies carried out on the subject (source and papers listed below). Its objective is to centralize datasets commonly used in the literature, serving as a solid reference point for future work.

Additional datasets can be contributed or requested — feel free to open an issue or pull request.

Citation

If you use dataset from this repository in your research, please cite our paper: Samuel Stocksieker, Denys Pommeret. A Comprehensive Survey on Imbalanced Regression: Definitions, Solutions, and Future Directions. 2025. ⟨hal-05213741⟩ https://hal.science/hal-05213741

Dataset Structure

This collection is intended for training, evaluating, and benchmarking models in imbalanced regression tasks. All datasets have been preprocessed to consistently place the target variable as the first column. A detailed summary of the 81 datasets is available in the table below. A second table lists the datasets used by each referenced paper in the survey. This metadata enables standardized comparisons and better understanding of dataset difficulty and imbalance characteristics.

Python Utilities

This repository includes Python code to compute imbalance coefficient based on the target distribution. The script imbalance_coefficient.py provides the function imb_coef() for both continuous and discrete targets.

You can explore our Python implementation and a usage notebook in the imbalance_coefficient/ subfolder:

  • imbalance_metric.py: Python function to compute the imbalance ratio.
  • Demo Notebook: notebook demonstration.

Dataset Overview

For each dataset, the following metadata is provided:

  • n_obs: Number of observations
  • p_var: Total number of features
  • p_num: Number of numerical features
  • p_cat: Number of categorical features
  • Type: Type of target variable (continuous, integer, etc.)
  • Skew: Skewness of the target distribution
  • Imb. Coef.: Imbalance coefficient as defined in Section \ref{imbCoef}
  • mIR: Mean Imbalanced Ratio, as introduced by Wibbeke et al., 2025
  • Miss.: Proportion of missing values
  • Used: Number of times the dataset has been used in published papers
datasetn_obsp_variablesp_numericp_categoricaltarget_typetarget_skewnessImb_coefmIRmissing_rateUsed
abalone417711110int641.1154.23345.730.032
boston50614140float641.136.0218.310.030
accel173223230float640.7751.58292.140.023
availPwr18021697int641.955.97348.260.023
cpusm819213130int64-3.4263.69358.70.023
a71981293float643.7270.01456.380.022
bank8fm4499990float641.0844.18252.740.022
a11981293float641.4646.56242.440.020
airfoild1503660float64-0.4231.86189.280.018
fuelCons1764382612float641.1452.08303.60.018
maxTorque1802332013int641.6355.67331.580.018
a21981293float642.4161.29365.260.016
a31981293float642.4762.7391.330.016
a41981293float645.9677.89624.820.015
a61981293float643.1467.32453.930.015
heat740012120float641.6356.2365.290.014
a51981293float642.3359.89335.470.013
machineCpu209770int643.8668.46487.10.013
mortgage104916160float641.0333.32198.80.013
servo167532float641.7754.11305.160.012
treasury104916160float641.3343.97242.90.011
deltaAilerons7129660float64-0.1543.91258.890.010
forestFires51713130float6412.8190.151824.050.010
fremotor1prem0304a_sev51949311714int64170.3398.6457674.84.3410
dataset_Facebook50019181int649.6884.841234.70.069
debutanizer2394880float641.7148.21291.810.09
strikes625770int646.478.86837.80.09
student-mat395331617int640.2424.1157.340.09
ailerons1375041410float64-1.3557.42363.560.08
wine_quality649712120float640.1960.26515.630.08
autoPrice205261610int641.7948.82266.970.07
elevators1659919190int640.1544.14248.20.07
baseball33717170int641.1642.7244.450.06
californiaHousing20640990int640.9831.160.06
triazines18661610float64-1.3437.29217.240.06
analcatdata_apnea345012120float645.082.68859.260.05
cpuAct819222220int64-3.4263.69358.70.05
diabetes43330float64-0.2329.83196.250.05
house8H22784981int643.7569.980.05
kinematics8fh8192990float64-0.445.58256.790.05
laser993550int641.1942.06245.050.05
musicorigin10591181180float643.2166.67486.740.05
pollen3848550float64-0.1342.93245.290.05
space_ga3107770float64-1.0271.07496.470.05
wages5341147float641.6956.78329.520.05
ele-1495330float641.5149.24275.720.04
ele-21056550float641.4444.31261.910.04
quake2178440float641.350.91286.970.04
sulfur10081660float642.573.58738.320.04
NO2Emissions500880float64-0.5544.96266.890.03
wankara160910100float640.0217.64135.470.03
energy1973528280int643.3974.6990.580.02
superconductivity2126382820float640.8646.97301.530.02
AmesHousing2930823943int641.7458.786.551
AutoBi1340880float6425.6994.244290.812.851
avocado1824913103float640.5845.34250.350.01
cocomo_numeric6057570float642.6160.26321.340.01
College77719172int64-0.1137.58213.180.01
communitiesCrime19941271270float641.5242.98246.40.01
concreteStrength1030990float640.4225.74166.680.01
delta_ailerons7129660float640.2968.04580.680.01
delta_elv9517770float640.1638.24215.00.01
electrical1000014131float64-0.03.66105.70.01
hour1737917161int641.2847.0273.610.01
house2278417170float643.7569.980.01
housing1460813843int641.8858.356.621
Housing_25451367int641.2143.520.01
insurance1338743float641.5149.56276.450.01
kddcoil131619190float641.4545.75243.230.01
lungcancer_shedden44225250float640.9440.87216.060.01
meta52866660float6414.6592.531880.280.01
pdgfr793213210float64-0.6425.99171.820.01
pendigits1099217170int640.0310.25110.630.01
PricingGame10002120146float647.489.528627.910.01
puma32h819233330float64-0.024.6107.380.01
qsaraquatictoxicity546990float640.3238.27223.420.01
red_wine159912120int640.2252.19392.510.01
sensory57612120float64-0.0437.04219.660.01
SynchronousMachine557550float640.08.22113.580.01
telematics_syn-03202110000051438float6422.796.3428783.350.01
yacht_hydrodynamics308770float641.7552.68289.730.01

The table below summarizes the papers analyzed in the survey. For each work, it includes the name of the proposed algorithm (if any), the programming language used (R or Python), the repository link (when available), and the list of datasets used.

PaperAlgorithmRepoR vs pythonRepo linkDataset6Dataset7Dataset8Dataset9Dataset10Dataset11Dataset12Dataset13Dataset14Dataset15Dataset16Dataset17Dataset18Dataset19Dataset20Dataset21Dataset22Dataset23Dataset24Dataset25Dataset26Dataset27Dataset28Dataset29Dataset30Dataset31Dataset32Dataset33Dataset34Dataset35Dataset36Dataset37Dataset38Dataset39Dataset40Dataset41Dataset42Dataset43Dataset44Dataset45Dataset46Dataset47
Predicting Outliersservotriazinesa1a2a3a4a5a6a7machinecpuchinaBostononekmcw.dragco2.emissionaccelavailpwrbank8FMdeltaaileronsibmcpuSmdeltaelvcalhousingaddfried
Rule-Based Prediction of Rare Extreme Valuesservotriazinesa1a2a3a4a5a6a7machinecpuchinasard0sard2sard3sard4sard5sard0.newsard1.newBostononekmcw.dragco2.emissionaccelavailpwr
Predicting Rare Extreme Valuesa1a2a3a4a5a6a7Bostonmachinecpubank8FMdeltaaileronsibmAbalonecpuSmservocw.dragco2.emissionavailpwrchinaadd
Utility-Based RegressionInternationalBusinessMachines
Utility-based Performance Measures for Regression
Precision and Recall for RegressionInternationalBusinessMachinesCoca.ColaBoeingGeneral_Motors
Utility-based RegressionNO2miscellaneous_domainsHarmfulaBlooms
An extended tuning method for cost-sensitive regression and forecastingNA
SMOTE for RegressionSmoteRRhttps://www.dcc.fc.up.pt/~ltorgo/EPIA2013/a1a2a3a4a5a6a7AbaloneAcceldAileravailPwrbank8FMcpuSmdeltaelvfuelConsbostonmaxtorqueq
Imbalanced learning: foundations, algorithms, and applicationsNA
Resampling strategies for regressionover- ; under- ; SmoteRResampling strategies for regressionhttp://www.dcc.fc.up.pt/~ltorgo/ExpertSystems + https://www.dcc.fc.up.pt/~ltorgo/Regression/DataSets.html + http://www.erudit.de/erudit/a1a2a3a4a5a6a7AbaloneAcceldAileravailPwrbank8FMcpuSmdeltaelvfuelConsbostonmaxtorqueqHeat
Learning from imbalanced data: open challenges and future directionsNA
UBL: an R Package for Utility-Based LearningBaggingRegress ; EvalRegressMetrics ; GaussNoiseRegress ; RandOverRegress ; RandUnderRegress ; SMOGNRegress ; SmoteRegress ; WERCSRegressR
A Survey of Predictive Modeling on Imbalanced Domainshttps://archive.ics.uci.edu/ml/datasets/HepatitisHepatitis
Learning from imbalanced data for predicting the number of software defectsAntCamelJeditSynapseXalanLog4j
Learning Through Utility Optimization in Regression TasksMU ; NMURhttps://lib.stat.cmu.edu/datasets/ + https://github.com/paobranco/UtilityOptimizationRegressionservoa6AbalonemachineCpua3a4a1a7bostona2a5fuelConsavailPwrbank8FMAccelairfoildLNO2Emissions
Evaluation of Ensemble Methods in Imbalanced Regression TasksNARhttps://github.com/nunompmoniz/Ensembles_LIDTA2017a3a6a4a7Abalonea1bostona5availPwra2cpuSmheatfuelConsmaxtorqueqdeltaelvbank8FMdAilerAccelConcrStrairfoild
SMOGN: a Pre-processing Approach for Imbalanced RegressionSMOGNRhttps://github.com/paobranco/SMOGN-LIDTA17servoa6AbalonemachineCpua3a4a1a7bostona2a5fuelConsavailPwrcpuSmmaxtorqueqbank8FMdAilerConcrStrAccelairfoild
Exploring Resampling with Neighborhood Bias on Imbalanced Regression ProblemsUnder-sampling with neighborhood bias ; Over-sampling with neighborhood biasRhttps://github.com/paobranco/NeighborhoodBiasResamplingRegressionservoa6Abalonemachinecpua3a4a1a7bostona2fuelConsavailPwrcpuSmmaxtorqueqbank8FMConcrStrAccelairfoild
SMOTEBoost for Regression: Improving the Prediction of Extreme ValuesSMOTEBoostRhttps://github.com/nunompmoniz/DSAA2018airportdiabetesa1a7autoPricebaseballelecLen1bostonforestFireswagesstrikeslaserconcrstrmortgagetreasuryelecLen2musicoriginavailpwrmaxtorqueqcommunitiesCrimedebutenizerspacepollenabalonewinedeltaaileronsheatbank32cpuActkinematics32fhpumaRobot
Pre-processing approaches for imbalanced distributions in regressionWERCSRhttps://github.com/paobranco/Pre-processingApproachesImbalanceRegression + https://paobranco.github.io/DataSets-IR/a6Abalonea3a4a1a7bostona2fuelConsheatavailPwrcpuSmmaxtorqueqbank8FMAccel
REBAGG: REsampled BAGGing for Imbalanced RegressionREBAGGRhttps://github.com/paobranco/REBAGGservoa6Abalonemachinecpua3a4a1a7bostona2a5fuelConsavailPwrcpuSmmaxtorqueqdAilerbank8FMConcrStrAccelairfoild
SMOTE for Learning from Imbalanced Data: Progress and Challenges, Marking the 15-year AnniversaryNA
Utility-based Predictive Analyticsservoa6Abalonea3a4a1a7bostona2a5fuelConsbank8FMAccelairfoildmachinecpuavailPwrcpuSmmaxtorqueqdAilerConcrStr
Learning from Imbalanced Data SetsNA
A Study on the Impact of Data Characteristics in Imbalanced Regression Tasks
Biased Resampling Strategies for Imbalanced Spatio-Temporal ForecastingSpecifichttps://github.com/mrfoliveira/STResampling-DSAA2019/tree/master/inst/extdataMESAAir_PollutionNCDCAir_ClimateTCERURALairBaseBeijingUrbanAir
Imbalanced regression and extreme value predictionSERARhttps://github.com/nunompmoniz/IRon/tree/master/data + https://lib.stat.cmu.edu/datasets/diabetestriazinesa7elecLen1bostonforestFiresstrikesmortgagetreasurymusicoriginairfoildaccelfuelconsavailpwrmaxtorqueqdebutenizerspace.gapollenabalonewinedeltaaileronsheatcpuActkinematics8fhkinematics32fhpumaRobotdeltaElevationsulfur1sulfur2aileronselevatorscalHousinghouse8hhouse16h
Improving enzyme optimum temperature prediction with resampling strategies and ensemble learningRO ; RU ; SMOTER ; GN, ; WERCS ; REBAGG ; metrics: F1Spythonhttps://github.com/jafetgado/resreg/blob/master/resreg/resreg.py + https://github.com/jafetgado/tomerdesign/Brenda
Density‑based weighting for imbalanced regressionDenseWeightPythonhttps://github.com/SteiMi/denseweight + https://github.com/SteiMi/density-based-weighting-for-imbalanced-regression/tree/main/exp3/data + https://github.com/paobranco/SMOGN-LIDTA17a1a2a3a4a5a6a7AbaloneaccelAirfoildAvailPwrBank8FMBostonConcrStrcpuSmdAilerFuelConsMachineCpumaxtorqueqServo
A novel cost-sensitive algorithm and new evaluation strategies for regression in imbalanced domainsMatlabhttps://github.com/lsadouk/imbalanced_regressionAbaloneAccelHeatcpuSmbank8FMParkinsondAilerH101NorthD7I5SouthD7I5NorthD7I210WestD7
Sampling To Improve Predictions For Underrepresented Observations In Imbalanced Datapenicillin_production
Chebyshev approaches for imbalanced data streams regression modelsSpecifichttps://github.com/ehaminian/imbalancedDataStream/tree/master/stream1puma32hhcpusmelevatorsbikeenergycalhousinggasemissionmvfriedpolutioncar_pricequeryGPU3d
DistSMOGN: Distributed SMOGN for Imbalanced Regression ProblemsDistSMOGNpythonhttps://github.com/ndao1104/distributed-resamplingBostonAbaloneBank8FMheatcpuSMenergysuperconductivity
Geometric SMOTE for regressionhttps://paobranco.github.io/DataSets-IR/ + https://sci2s.ugr.es/keel/datasets.phpanacaltbank8FMbaseballbostoncompactivconcrstrcpuSmele.1ele.2forestFiresfriedmanlasermachineCPUmortgagequakestocktreasurywankara
Model Optimization in Imbalanced RegressionSERARhttps://github.com/anibalsilva1/IRModelOptimizationdiabetestriazinesa7autoPriceelecLen1bostonforestFireswagesstrikesmortgagetreasurymusicoriginairfoildaccelfuelconsavailpwrmaxtorqueqdebutenizerspace.gapollenabalonewinedeltaaileronsheatcpuActkinematics8fhkinematics32fhpumaRobotdeltaElevationsulfuraileronselevatorscalHousinghouse8hhouse16honlineNewsPopRegr
A boosting resampling method for regression based on a conditional variational autoencoderhttps://archive.ics.uci.edu/ + https://www.dcc.fc.up.pt/~ltorgo/DataMiningWithR/F1F2AbaloneBostondAilerIndoorairquality
Robustness Evaluation of Regression Tasks with Skewed Domain PreferencesMailactivitya1a7pricesalarylengthnorwayhousevalueareawagesstrikesoutputstrengthyc30cdratev100soundpressureaccelfuelpowertorqueviolentcrimesrichterylnydensitygermanybeijing
A Survey of Learning with Imbalanced Data, Representation Learning and SEP ForecastingNA
ASER: Adapted squared error relevance for rare cases prediction in imbalanced regressionhttps://github.com/yingk1213/ASERdiabetesa7autoPriceelecLen1bostonforestFireswagesstrikesmortgagetreasurymusicoriginairfoildaccelfuelconsavailpwrmaxtorqueqdebutenizerspace.gapollenabalonewinedeltaaileronsheatcpuActkinematics8fhpumaRobotdeltaElevationsulfuraileronselevatorscalHousinghouse8h
Imbalanced Mixed Linear RegressionSpecificNA
Semi-Supervised Graph Imbalanced RegressionSpecificNA
A broad review on class imbalance learning techniquesNAWisconsinPimaYeast_1Vehicle_2Vehicle_1SegmentYeast_3Page_blocksYeast_2vs4Ecoli_0234vs5Yeast_0359vs78Yeast_0256vs3789Ecoli_046vs5Ecoli_01vs235Yeast_05679vs4VowelEcoli_067vs5Led7digit_02456789vs1Ecoli_01vs5Ecoli_0147vs56Ecoli_0146vs5Glass_4Ecoli_4Yeast_1458Vs7Glass_5Yeast_2Vs8Yeast_4Yeast_1289Vs7Yeast_5Ecoli_0137vs26Yeast_6Abalone
A Review of Machine Learning Techniques in Imbalanced Data and Future TrendsNA
Enhancing soft computing techniques to actively address imbalanced regression problemsThe selected datasets come from ‘‘Irvine Machine Learning Repository’’ (UCI) (Dua & Graff, 2017), ‘‘Knowledge Extraction based on Evolutionary Learning’’ (KEEL) (Triguero et al., 2017), ‘‘Dataset Collections of Weka’’ (WEKA) (Witten et al., 2016), ‘‘Delve Datasets’’ (DELVE) (Akujuobi & Zhang, 2017), ‘‘Luis Torgo Repository’’ (LTR) (Torgo, 2023) and from ‘‘Journal of Statistics Education Data Archive’’ (JSE) (JSE, 2023). These repositories are high quality, certified and supported by many other studies.AbaloneAirfoildAnacaltBaseballbostonconcrstrmachinecpuElectrical_LengthElectrical_MaintenanceFacebook_Measuresforestfireslaser.generatedMortgageAutoPriceQuakeServoStrikesTreasuryTriazinesYacht_HydrodynamicsAddAileronsBank32Bank8Computer_activityCaliforniaCpusmdeltaaileronsDeltaelvhouse16hhouse8hpuma32hh
Imbalanced regression using regressor‑classifier ensemblesFederated Ensemble Learning using Classificationpythonhttps://github.com/oghenejokpeme/EFERUC + https://data.mendeley.com/datasets/mpvwnhv4vb/2BrancoGene_expressionOpenMLQSARYeast
Multi-output Regression for Imbalanced Data StreamSpecificNA
tian2023unbalancedNAAbaloneAirfoildER_activity
Adapting a deep convolutional RNN model with imbalanced regression loss for improved spatio-temporal forecasting of extreme wind speed events in the short to medium rangespecificpythonhttps://github.com/dscheepens/Deep-RNN-for-extreme-wind-speed-prediction
Spatial-SMOTE for handling imbalance in spatial regression tasks❌ accessiblehttps://www.kaggle.com/datasets/camnugent/california-housing-prices + https://www.kaggle.com/datasets/thedevastator/airbnb-prices-in-european-citiescaliforniaAirBnB_prices
ImbalancedLearningRegression - A Python Package to Tackle the Imbalanced Regression ProblemRO ; RU; SMOTE ; GN; CNN; ENN ; ADASYN ; TOMEKpythonhttps://github.com/paobranco/ImbalancedLearningRegression/tree/masterCollegeSF_SalariesSummaryofWeatheravocadodiabetic_datacalHousinginsurancered_wineweatherHistory
Data Augmentation for Imbalanced RegressionSpecifichttp://www2.math.uconn.edu/~valdez/data.htmltelematics
Imbalance in Regression DatasetsNA
Oversampling Techniques for Imbalanced Data in RegressionNAANACALTbank8FMbaseballbostoncompactivconcrstrcpuSmele.1ele.2forestFiresfriedmanlasermachineCPUmortgagequakestocktreasurywankara
Resampling strategies for imbalanced regression: a survey and empirical analysisSMOTE ; RO ; RU ; GN ; SMOGN ; WERCS ; Metric: F1S + SERApythonhttps://github.com/JusciAvelino/imbalancedRegression/tree/main/wineanacaltmetacocomo.numericAbalonea3forestFiresa1a7bostonpdgfrsensorya2kdd.coil.1triazinesairfoildtreasurymortgagedebutenizerfuelConsheatcaliforniaAvailPwrcompactivcpuSmmaxtorqueqlungcancer.sheddenspace.gaConcrStrAccel
A survey on imbalanced learning: latest research, applications and future directionsNA
Research on Imbalanced Data Regression Based on ConfrontationNAAirfoildAbaloneYacht.Hydrodynamicsconcrstr
A novel gradient boosting approach for imbalanced regressionIMr-GBpythonhttps://github.com/vengozhang/IMr-GBa1AbaloneAccelavailPwrbank8FMbostonConcrStrcpuSmfuelConsmaxtorqueq
Affine combination-based over-sampling for imbalanced regressionhttps://github.com/lzz185/ACOSheatairfoildavailpwrele.2lasermaxtorqueqmortgagependigitsqsar.aquatic.toxicityquakesulfuryacht.hydrodynamicscalHousinga7baseball
Rare event prediction in imbalanced regression with adaptive weighted support vector regressionhttp://www.ics.uci.edu/ mlearn/ + https://sci2s.ugr.es/keel/datasets.php + https://github.com/nunompmoniz/Irona1wagesqsar.aquatic.toxicitystrikesgrisonqsar.fish.toxicitylaserairfoildwineaccelfuelconsavailpwrabalonewinewinekinematics8fhsulfurhouse8hhouse16hcalHousingonlineNewsPopRegrmvfried
Sparse feature selection and rare value prediction in imbalanced regressionhttps://github.com/guanying24/SerEnetdiabetesAutoPriceelecLen1strikesmortgagetreasurymusicOriginspace.gapollenabalonedeltaaileronsheatkinematics8fhkinematics32fhdeltaElevationaileronselevatorsOnlineNewsPopRegr
WSMOTER: a novel approach for imbalanced regressionWSMOTERpythonhttps://drive.google.com/drive/folders/1h6Q5sKB5bnqk0Kh01sH1uc6LTp4KSPbba1a2a3a4a5a6a7AbaloneaccelAileronsAirfoildAutoPriceavailpwrBank8FMBostonCaliforniaCompactivconcrstrcpuActcpuSmdeltaaileronsDeltaelvele.1elevatorsForestFiresfuelconsHeatHouseKinematics32fhMachineCpumaxtorqueqMortgagepuma32hhServoTreasuryWankara
Generalized Oversampling for Learning from Imbalanced datasets and Associated Theory: Application in RegressionGOLIATHRhttp:localNO2BostoncpuSmbank8fmabalone
Data Augmentation with Variational Autoencoder for Imbalanced DatasetDAVIDpythonhttps://github.com/sstocksieker/DAVID/bank8FMabalonebostonNO2
Boarding for ISS: Imbalanced Self-Supervised: Discovery of a Scaled Autoencoder for Mixed Tabular DatasetsSpecificNA
A Selective Under-Sampling (SUS) Method For Imbalanced RegressionNAAbaloneAccela1a2a3a4a5a6a7availPwrbank8FMbostoncpuSmfuelConsheatmaxtorqueq
Error Distribution Smoothing: Advancing Low-Dimensional Imbalanced RegressionEDSpythonhttps://a❌ymous.4open.science/r/Error-Distribution-Smoothing-762F/README.mdquadcopter dynamicsCartpole
KNNOR-Reg: A python package for oversampling in imbalanced regressionKNNOR-Reg: A python package for oversampling in imbalanced regressionpythonhttps://github.com/ashhadulislam/augmentdatalibregsource/blob/main/README.mdmortgage
Uncertainty quantification driven machine learning for improving model accuracy in imbalanced regression tasksUQDIRpythonhttps://github.com/tubadolar/uqdir/tree/main/datasetsaccelabalonebank8fmbostoncpusmaileronselevatorsearthquakeCaliforniadelta
Quantification of Data ImbalanceImb_quantipythonhttps://github.com/OFFIS-ROC/imbaquEnergy.efficiencyforestfiresOptical.interconnection.networkconcrstrServoCombined.cycle.power.plantGrid.stabilitysuperconductivitySynchronous.machineAuction.verificationAirfoildConcrete.slump.testtraffic.behaviourYacht.hydrodynamicsFish.toxicityWave.energy.perth.49Aquatic.toxicitySteel.industryComputer.hardwareAbaloneAge.predictionParkinsonWinequality.whiteFacebook.metricsAileronsAnacaltAutopricebank32bank8baseballbostonCaliforniadeltaaileronsDeltaelvele.1ele.2house16hLaser.generatedmortgagepuma32hhStrikesTreasury
An Investigation of Imbalanced Regression Loss Functions with Neural Network ModelsScaled-Weighted losspythonhttps://drive.google.com/drive/folders/1zOHx_BwZL45RnTWCMt3VNZ6bgMugLNQkSimpleOceanData_Assimilation

Sources

These datasets have been collected from public repositories such as UCI, Kaggle, and various GitHub pages associated with prior research on imbalanced regression. Below is a list of the main source repositories used to compile this collection:

  • https://archive.ics.uci.edu
  • https://www.kaggle.com
  • https://sci2s.ugr.es/keel/datasets.php
  • https://www.dcc.fc.up.pt/~ltorgo/EPIA2013/
  • https://www.dcc.fc.up.pt/~ltorgo/Regression/DataSets.html
  • https://lib.stat.cmu.edu/datasets/
  • https://github.com/paobranco/UtilityOptimizationRegression
  • https://github.com/nunompmoniz/Ensembles_LIDTA2017
  • https://github.com/paobranco/SMOGN-LIDTA17
  • https://github.com/paobranco/NeighborhoodBiasResamplingRegression
  • https://github.com/nunompmoniz/DSAA2018
  • https://github.com/paobranco/Pre-processingApproachesImbalanceRegression
  • https://paobranco.github.io/DataSets-IR/
  • https://github.com/paobranco/REBAGG
  • https://github.com/mrfoliveira/STResampling-DSAA2019/tree/master/inst/extdata
  • https://github.com/nunompmoniz/IRon/tree/master/data
  • https://github.com/SteiMi/denseweight
  • https://github.com/SteiMi/density-based-weighting-for-imbalanced-regression/tree/main/exp3/data
  • https://github.com/lsadouk/imbalanced_regression
  • https://github.com/ndao1104/distributed-resampling
  • https://paobranco.github.io/DataSets-IR/
  • https://github.com/anibalsilva1/IRModelOptimization
  • https://github.com/yingk1213/ASER
  • https://data.mendeley.com/datasets/mpvwnhv4vb/2
  • https://github.com/paobranco/ImbalancedLearningRegression/tree/master
  • http://www2.math.uconn.edu/~valdez/data.html
  • https://github.com/JusciAvelino/imbalancedRegression/tree/main/
  • https://github.com/vengozhang/IMr-GB
  • https://github.com/lzz185/ACOS
  • https://github.com/guanying24/SerEnet
  • https://drive.google.com/drive/folders/1h6Q5sKB5bnqk0Kh01sH1uc6LTp4KSPbb
  • https://github.com/sstocksieker/DAVID/
  • https://github.com/tubadolar/uqdir/tree/main/datasets

license: cc-by-4.0 ---