Team Ai
Datasetpublic

samgohan/Tabular_Imbalanced_Regression

Tabular Imbalanced Regression Datasets Repository Summary This repository provides a collection of 81 tabular datasets curated for research on tabular imbalanced regression problems. They were obtained from the various studies carried out on the subject (source and papers listed below).Its objective is to centralize datasets commonly used in the literature, serving as a solid reference point for future work. Additional datasets can be contributed or requested —… See the full description on the dataset page: https://huggingface.co/datasets/samgohan/Tabular_Imbalanced_Regression.

sourceHugging Facecc-by-4.0updated 1y agoView on Hugging Face
1likes113downloads
Dataset Card

Tabular Imbalanced Regression Datasets

Repository Summary

This repository provides a collection of 81 tabular datasets curated for research on tabular imbalanced regression problems. They were obtained from the various studies carried out on the subject (source and papers listed below). Its objective is to centralize datasets commonly used in the literature, serving as a solid reference point for future work.

Additional datasets can be contributed or requested — feel free to open an issue or pull request.

Citation

If you use dataset from this repository in your research, please cite our paper: Samuel Stocksieker, Denys Pommeret. A Comprehensive Survey on Imbalanced Regression: Definitions, Solutions, and Future Directions. 2025. ⟨hal-05213741⟩ https://hal.science/hal-05213741

Dataset Structure

This collection is intended for training, evaluating, and benchmarking models in imbalanced regression tasks. All datasets have been preprocessed to consistently place the target variable as the first column. A detailed summary of the 81 datasets is available in the table below. A second table lists the datasets used by each referenced paper in the survey. This metadata enables standardized comparisons and better understanding of dataset difficulty and imbalance characteristics.

Python Utilities

This repository includes Python code to compute imbalance coefficient based on the target distribution. The script imbalance_coefficient.py provides the function imb_coef() for both continuous and discrete targets.

You can explore our Python implementation and a usage notebook in the imbalance_coefficient/ subfolder:

  • —imbalance_metric.py: Python function to compute the imbalance ratio.
  • —Demo Notebook: notebook demonstration.

Dataset Overview

For each dataset, the following metadata is provided:

  • —n_obs: Number of observations
  • —p_var: Total number of features
  • —p_num: Number of numerical features
  • —p_cat: Number of categorical features
  • —Type: Type of target variable (continuous, integer, etc.)
  • —Skew: Skewness of the target distribution
  • —Imb. Coef.: Imbalance coefficient as defined in Section \ref{imbCoef}
  • —mIR: Mean Imbalanced Ratio, as introduced by Wibbeke et al., 2025
  • —Miss.: Proportion of missing values
  • —Used: Number of times the dataset has been used in published papers
datasetn_obsp_variablesp_numericp_categoricaltarget_typetarget_skewnessImb_coefmIRmissing_rateUsed
abalone417711110int641.1154.23345.730.032
boston50614140float641.136.0218.310.030
accel173223230float640.7751.58292.140.023
availPwr18021697int641.955.97348.260.023
cpusm819213130int64-3.4263.69358.70.023
a71981293float643.7270.01456.380.022
bank8fm4499990float641.0844.18252.740.022
a11981293float641.4646.56242.440.020
airfoild1503660float64-0.4231.86189.280.018
fuelCons1764382612float641.1452.08303.60.018
maxTorque1802332013int641.6355.67331.580.018
a21981293float642.4161.29365.260.016
a31981293float642.4762.7391.330.016
a41981293float645.9677.89624.820.015
a61981293float643.1467.32453.930.015
heat740012120float641.6356.2365.290.014
a51981293float642.3359.89335.470.013
machineCpu209770int643.8668.46487.10.013
mortgage104916160float641.0333.32198.80.013
servo167532float641.7754.11305.160.012
treasury104916160float641.3343.97242.90.011
deltaAilerons7129660float64-0.1543.91258.890.010
forestFires51713130float6412.8190.151824.050.010
fremotor1prem0304a_sev51949311714int64170.3398.6457674.84.3410
dataset_Facebook50019181int649.6884.841234.70.069
debutanizer2394880float641.7148.21291.810.09
strikes625770int646.478.86837.80.09
student-mat395331617int640.2424.1157.340.09
ailerons1375041410float64-1.3557.42363.560.08
wine_quality649712120float640.1960.26515.630.08
autoPrice205261610int641.7948.82266.970.07
elevators1659919190int640.1544.14248.20.07
baseball33717170int641.1642.7244.450.06
californiaHousing20640990int640.9831.160.06
triazines18661610float64-1.3437.29217.240.06
analcatdata_apnea345012120float645.082.68859.260.05
cpuAct819222220int64-3.4263.69358.70.05
diabetes43330float64-0.2329.83196.250.05
house8H22784981int643.7569.980.05
kinematics8fh8192990float64-0.445.58256.790.05
laser993550int641.1942.06245.050.05
musicorigin10591181180float643.2166.67486.740.05
pollen3848550float64-0.1342.93245.290.05
space_ga3107770float64-1.0271.07496.470.05
wages5341147float641.6956.78329.520.05
ele-1495330float641.5149.24275.720.04
ele-21056550float641.4444.31261.910.04
quake2178440float641.350.91286.970.04
sulfur10081660float642.573.58738.320.04
NO2Emissions500880float64-0.5544.96266.890.03
wankara160910100float640.0217.64135.470.03
energy1973528280int643.3974.6990.580.02
superconductivity2126382820float640.8646.97301.530.02
AmesHousing2930823943int641.7458.786.551
AutoBi1340880float6425.6994.244290.812.851
avocado1824913103float640.5845.34250.350.01
cocomo_numeric6057570float642.6160.26321.340.01
College77719172int64-0.1137.58213.180.01
communitiesCrime19941271270float641.5242.98246.40.01
concreteStrength1030990float640.4225.74166.680.01
delta_ailerons7129660float640.2968.04580.680.01
delta_elv9517770float640.1638.24215.00.01
electrical1000014131float64-0.03.66105.70.01
hour1737917161int641.2847.0273.610.01
house2278417170float643.7569.980.01
housing1460813843int641.8858.356.621
Housing_25451367int641.2143.520.01
insurance1338743float641.5149.56276.450.01
kddcoil131619190float641.4545.75243.230.01
lungcancer_shedden44225250float640.9440.87216.060.01
meta52866660float6414.6592.531880.280.01
pdgfr793213210float64-0.6425.99171.820.01
pendigits1099217170int640.0310.25110.630.01
PricingGame10002120146float647.489.528627.910.01
puma32h819233330float64-0.024.6107.380.01
qsaraquatictoxicity546990float640.3238.27223.420.01
red_wine159912120int640.2252.19392.510.01
sensory57612120float64-0.0437.04219.660.01
SynchronousMachine557550float640.08.22113.580.01
telematics_syn-03202110000051438float6422.796.3428783.350.01
yacht_hydrodynamics308770float641.7552.68289.730.01

The table below summarizes the papers analyzed in the survey. For each work, it includes the name of the proposed algorithm (if any), the programming language used (R or Python), the repository link (when available), and the list of datasets used.

PaperAlgorithmRepoR vs pythonRepo linkDataset6Dataset7Dataset8Dataset9Dataset10Dataset11Dataset12Dataset13Dataset14Dataset15Dataset16Dataset17Dataset18Dataset19Dataset20Dataset21Dataset22Dataset23Dataset24Dataset25Dataset26Dataset27Dataset28Dataset29Dataset30Dataset31Dataset32Dataset33Dataset34Dataset35Dataset36Dataset37Dataset38Dataset39Dataset40Dataset41Dataset42Dataset43Dataset44Dataset45Dataset46Dataset47
Predicting Outliers❌❌servotriazinesa1a2a3a4a5a6a7machinecpuchinaBostononekmcw.dragco2.emissionaccelavailpwrbank8FMdeltaaileronsibmcpuSmdeltaelvcalhousingaddfried
Rule-Based Prediction of Rare Extreme Values❌❌servotriazinesa1a2a3a4a5a6a7machinecpuchinasard0sard2sard3sard4sard5sard0.newsard1.newBostononekmcw.dragco2.emissionaccelavailpwr
Predicting Rare Extreme Values❌❌a1a2a3a4a5a6a7Bostonmachinecpubank8FMdeltaaileronsibmAbalonecpuSmservocw.dragco2.emissionavailpwrchinaadd
Utility-Based Regression❌❌InternationalBusinessMachines
Utility-based Performance Measures for Regression❌❌
Precision and Recall for Regression❌❌InternationalBusinessMachinesCoca.ColaBoeingGeneral_Motors
Utility-based Regression❌✅NO2miscellaneous_domainsHarmfulaBlooms
An extended tuning method for cost-sensitive regression and forecasting❌NA
SMOTE for RegressionSmoteR✅Rhttps://www.dcc.fc.up.pt/~ltorgo/EPIA2013/a1a2a3a4a5a6a7AbaloneAcceldAileravailPwrbank8FMcpuSmdeltaelvfuelConsbostonmaxtorqueq
Imbalanced learning: foundations, algorithms, and applicationsNA
Resampling strategies for regressionover- ; under- ; SmoteR✅Resampling strategies for regressionhttp://www.dcc.fc.up.pt/~ltorgo/ExpertSystems + https://www.dcc.fc.up.pt/~ltorgo/Regression/DataSets.html + http://www.erudit.de/erudit/a1a2a3a4a5a6a7AbaloneAcceldAileravailPwrbank8FMcpuSmdeltaelvfuelConsbostonmaxtorqueqHeat
Learning from imbalanced data: open challenges and future directions❌NA
UBL: an R Package for Utility-Based LearningBaggingRegress ; EvalRegressMetrics ; GaussNoiseRegress ; RandOverRegress ; RandUnderRegress ; SMOGNRegress ; SmoteRegress ; WERCSRegress✅R❌
A Survey of Predictive Modeling on Imbalanced Domains❌https://archive.ics.uci.edu/ml/datasets/HepatitisHepatitis
Learning from imbalanced data for predicting the number of software defects❌❌AntCamelJeditSynapseXalanLog4j
Learning Through Utility Optimization in Regression TasksMU ; NMU✅Rhttps://lib.stat.cmu.edu/datasets/ + https://github.com/paobranco/UtilityOptimizationRegressionservoa6AbalonemachineCpua3a4a1a7bostona2a5fuelConsavailPwrbank8FMAccelairfoildLNO2Emissions
Evaluation of Ensemble Methods in Imbalanced Regression TasksNA✅Rhttps://github.com/nunompmoniz/Ensembles_LIDTA2017a3a6a4a7Abalonea1bostona5availPwra2cpuSmheatfuelConsmaxtorqueqdeltaelvbank8FMdAilerAccelConcrStrairfoild
SMOGN: a Pre-processing Approach for Imbalanced RegressionSMOGN✅Rhttps://github.com/paobranco/SMOGN-LIDTA17servoa6AbalonemachineCpua3a4a1a7bostona2a5fuelConsavailPwrcpuSmmaxtorqueqbank8FMdAilerConcrStrAccelairfoild
Exploring Resampling with Neighborhood Bias on Imbalanced Regression ProblemsUnder-sampling with neighborhood bias ; Over-sampling with neighborhood bias✅Rhttps://github.com/paobranco/NeighborhoodBiasResamplingRegressionservoa6Abalonemachinecpua3a4a1a7bostona2fuelConsavailPwrcpuSmmaxtorqueqbank8FMConcrStrAccelairfoild
SMOTEBoost for Regression: Improving the Prediction of Extreme ValuesSMOTEBoost✅Rhttps://github.com/nunompmoniz/DSAA2018airportdiabetesa1a7autoPricebaseballelecLen1bostonforestFireswagesstrikeslaserconcrstrmortgagetreasuryelecLen2musicoriginavailpwrmaxtorqueqcommunitiesCrimedebutenizerspacepollenabalonewinedeltaaileronsheatbank32cpuActkinematics32fhpumaRobot
Pre-processing approaches for imbalanced distributions in regressionWERCS✅Rhttps://github.com/paobranco/Pre-processingApproachesImbalanceRegression + https://paobranco.github.io/DataSets-IR/a6Abalonea3a4a1a7bostona2fuelConsheatavailPwrcpuSmmaxtorqueqbank8FMAccel
REBAGG: REsampled BAGGing for Imbalanced RegressionREBAGG✅Rhttps://github.com/paobranco/REBAGGservoa6Abalonemachinecpua3a4a1a7bostona2a5fuelConsavailPwrcpuSmmaxtorqueqdAilerbank8FMConcrStrAccelairfoild
SMOTE for Learning from Imbalanced Data: Progress and Challenges, Marking the 15-year Anniversary❌NA
Utility-based Predictive Analytics❌servoa6Abalonea3a4a1a7bostona2a5fuelConsbank8FMAccelairfoildmachinecpuavailPwrcpuSmmaxtorqueqdAilerConcrStr
Learning from Imbalanced Data Sets❌NA
A Study on the Impact of Data Characteristics in Imbalanced Regression Tasks❌❌
Biased Resampling Strategies for Imbalanced Spatio-Temporal ForecastingSpecifichttps://github.com/mrfoliveira/STResampling-DSAA2019/tree/master/inst/extdataMESAAir_PollutionNCDCAir_ClimateTCERURALairBaseBeijingUrbanAir
Imbalanced regression and extreme value predictionSERA✅Rhttps://github.com/nunompmoniz/IRon/tree/master/data + https://lib.stat.cmu.edu/datasets/diabetestriazinesa7elecLen1bostonforestFiresstrikesmortgagetreasurymusicoriginairfoildaccelfuelconsavailpwrmaxtorqueqdebutenizerspace.gapollenabalonewinedeltaaileronsheatcpuActkinematics8fhkinematics32fhpumaRobotdeltaElevationsulfur1sulfur2aileronselevatorscalHousinghouse8hhouse16h
Improving enzyme optimum temperature prediction with resampling strategies and ensemble learningRO ; RU ; SMOTER ; GN, ; WERCS ; REBAGG ; metrics: F1S✅pythonhttps://github.com/jafetgado/resreg/blob/master/resreg/resreg.py + https://github.com/jafetgado/tomerdesign/Brenda
Density‑based weighting for imbalanced regressionDenseWeight✅Pythonhttps://github.com/SteiMi/denseweight + https://github.com/SteiMi/density-based-weighting-for-imbalanced-regression/tree/main/exp3/data + https://github.com/paobranco/SMOGN-LIDTA17a1a2a3a4a5a6a7AbaloneaccelAirfoildAvailPwrBank8FMBostonConcrStrcpuSmdAilerFuelConsMachineCpumaxtorqueqServo
A novel cost-sensitive algorithm and new evaluation strategies for regression in imbalanced domains✅Matlabhttps://github.com/lsadouk/imbalanced_regressionAbaloneAccelHeatcpuSmbank8FMParkinsondAilerH101NorthD7I5SouthD7I5NorthD7I210WestD7
Sampling To Improve Predictions For Underrepresented Observations In Imbalanced Data❌❌penicillin_production
Chebyshev approaches for imbalanced data streams regression modelsSpecifichttps://github.com/ehaminian/imbalancedDataStream/tree/master/stream1puma32hhcpusmelevatorsbikeenergycalhousinggasemissionmvfriedpolutioncar_pricequeryGPU3d
DistSMOGN: Distributed SMOGN for Imbalanced Regression ProblemsDistSMOGN✅pythonhttps://github.com/ndao1104/distributed-resamplingBostonAbaloneBank8FMheatcpuSMenergysuperconductivity
Geometric SMOTE for regression❌https://paobranco.github.io/DataSets-IR/ + https://sci2s.ugr.es/keel/datasets.phpanacaltbank8FMbaseballbostoncompactivconcrstrcpuSmele.1ele.2forestFiresfriedmanlasermachineCPUmortgagequakestocktreasurywankara
Model Optimization in Imbalanced RegressionSERA✅Rhttps://github.com/anibalsilva1/IRModelOptimizationdiabetestriazinesa7autoPriceelecLen1bostonforestFireswagesstrikesmortgagetreasurymusicoriginairfoildaccelfuelconsavailpwrmaxtorqueqdebutenizerspace.gapollenabalonewinedeltaaileronsheatcpuActkinematics8fhkinematics32fhpumaRobotdeltaElevationsulfuraileronselevatorscalHousinghouse8hhouse16honlineNewsPopRegr
A boosting resampling method for regression based on a conditional variational autoencoder❌https://archive.ics.uci.edu/ + https://www.dcc.fc.up.pt/~ltorgo/DataMiningWithR/F1F2AbaloneBostondAilerIndoorairquality
Robustness Evaluation of Regression Tasks with Skewed Domain Preferences❌❌Mailactivitya1a7pricesalarylengthnorwayhousevalueareawagesstrikesoutputstrengthyc30cdratev100soundpressureaccelfuelpowertorqueviolentcrimesrichterylnydensitygermanybeijing
A Survey of Learning with Imbalanced Data, Representation Learning and SEP Forecasting❌NA
ASER: Adapted squared error relevance for rare cases prediction in imbalanced regression❌https://github.com/yingk1213/ASERdiabetesa7autoPriceelecLen1bostonforestFireswagesstrikesmortgagetreasurymusicoriginairfoildaccelfuelconsavailpwrmaxtorqueqdebutenizerspace.gapollenabalonewinedeltaaileronsheatcpuActkinematics8fhpumaRobotdeltaElevationsulfuraileronselevatorscalHousinghouse8h
Imbalanced Mixed Linear RegressionSpecificNA
Semi-Supervised Graph Imbalanced RegressionSpecificNA
A broad review on class imbalance learning techniques❌NAWisconsinPimaYeast_1Vehicle_2Vehicle_1SegmentYeast_3Page_blocksYeast_2vs4Ecoli_0234vs5Yeast_0359vs78Yeast_0256vs3789Ecoli_046vs5Ecoli_01vs235Yeast_05679vs4VowelEcoli_067vs5Led7digit_02456789vs1Ecoli_01vs5Ecoli_0147vs56Ecoli_0146vs5Glass_4Ecoli_4Yeast_1458Vs7Glass_5Yeast_2Vs8Yeast_4Yeast_1289Vs7Yeast_5Ecoli_0137vs26Yeast_6Abalone
A Review of Machine Learning Techniques in Imbalanced Data and Future Trends❌NA
Enhancing soft computing techniques to actively address imbalanced regression problems❌The selected datasets come from ‘‘Irvine Machine Learning Repository’’ (UCI) (Dua & Graff, 2017), ‘‘Knowledge Extraction based on Evolutionary Learning’’ (KEEL) (Triguero et al., 2017), ‘‘Dataset Collections of Weka’’ (WEKA) (Witten et al., 2016), ‘‘Delve Datasets’’ (DELVE) (Akujuobi & Zhang, 2017), ‘‘Luis Torgo Repository’’ (LTR) (Torgo, 2023) and from ‘‘Journal of Statistics Education Data Archive’’ (JSE) (JSE, 2023). These repositories are high quality, certified and supported by many other studies.AbaloneAirfoildAnacaltBaseballbostonconcrstrmachinecpuElectrical_LengthElectrical_MaintenanceFacebook_Measuresforestfireslaser.generatedMortgageAutoPriceQuakeServoStrikesTreasuryTriazinesYacht_HydrodynamicsAddAileronsBank32Bank8Computer_activityCaliforniaCpusmdeltaaileronsDeltaelvhouse16hhouse8hpuma32hh
Imbalanced regression using regressor‑classifier ensemblesFederated Ensemble Learning using Classification✅pythonhttps://github.com/oghenejokpeme/EFERUC + https://data.mendeley.com/datasets/mpvwnhv4vb/2BrancoGene_expressionOpenMLQSARYeast
Multi-output Regression for Imbalanced Data StreamSpecificNA
tian2023unbalanced❌NAAbaloneAirfoildER_activity
Adapting a deep convolutional RNN model with imbalanced regression loss for improved spatio-temporal forecasting of extreme wind speed events in the short to medium rangespecificpythonhttps://github.com/dscheepens/Deep-RNN-for-extreme-wind-speed-prediction
Spatial-SMOTE for handling imbalance in spatial regression tasks❌ accessiblehttps://www.kaggle.com/datasets/camnugent/california-housing-prices + https://www.kaggle.com/datasets/thedevastator/airbnb-prices-in-european-citiescaliforniaAirBnB_prices
ImbalancedLearningRegression - A Python Package to Tackle the Imbalanced Regression ProblemRO ; RU; SMOTE ; GN; CNN; ENN ; ADASYN ; TOMEK✅pythonhttps://github.com/paobranco/ImbalancedLearningRegression/tree/masterCollegeSF_SalariesSummaryofWeatheravocadodiabetic_datacalHousinginsurancered_wineweatherHistory
Data Augmentation for Imbalanced RegressionSpecifichttp://www2.math.uconn.edu/~valdez/data.htmltelematics
Imbalance in Regression Datasets❌NA
Oversampling Techniques for Imbalanced Data in Regression❌NAANACALTbank8FMbaseballbostoncompactivconcrstrcpuSmele.1ele.2forestFiresfriedmanlasermachineCPUmortgagequakestocktreasurywankara
Resampling strategies for imbalanced regression: a survey and empirical analysisSMOTE ; RO ; RU ; GN ; SMOGN ; WERCS ; Metric: F1S + SERA✅pythonhttps://github.com/JusciAvelino/imbalancedRegression/tree/main/wineanacaltmetacocomo.numericAbalonea3forestFiresa1a7bostonpdgfrsensorya2kdd.coil.1triazinesairfoildtreasurymortgagedebutenizerfuelConsheatcaliforniaAvailPwrcompactivcpuSmmaxtorqueqlungcancer.sheddenspace.gaConcrStrAccel
A survey on imbalanced learning: latest research, applications and future directions❌NA
Research on Imbalanced Data Regression Based on Confrontation❌NAAirfoildAbaloneYacht.Hydrodynamicsconcrstr
A novel gradient boosting approach for imbalanced regressionIMr-GB✅pythonhttps://github.com/vengozhang/IMr-GBa1AbaloneAccelavailPwrbank8FMbostonConcrStrcpuSmfuelConsmaxtorqueq
Affine combination-based over-sampling for imbalanced regression❌https://github.com/lzz185/ACOSheatairfoildavailpwrele.2lasermaxtorqueqmortgagependigitsqsar.aquatic.toxicityquakesulfuryacht.hydrodynamicscalHousinga7baseball
Rare event prediction in imbalanced regression with adaptive weighted support vector regression❌http://www.ics.uci.edu/ mlearn/ + https://sci2s.ugr.es/keel/datasets.php + https://github.com/nunompmoniz/Irona1wagesqsar.aquatic.toxicitystrikesgrisonqsar.fish.toxicitylaserairfoildwineaccelfuelconsavailpwrabalonewinewinekinematics8fhsulfurhouse8hhouse16hcalHousingonlineNewsPopRegrmvfried
Sparse feature selection and rare value prediction in imbalanced regression❌https://github.com/guanying24/SerEnetdiabetesAutoPriceelecLen1strikesmortgagetreasurymusicOriginspace.gapollenabalonedeltaaileronsheatkinematics8fhkinematics32fhdeltaElevationaileronselevatorsOnlineNewsPopRegr
WSMOTER: a novel approach for imbalanced regressionWSMOTER✅pythonhttps://drive.google.com/drive/folders/1h6Q5sKB5bnqk0Kh01sH1uc6LTp4KSPbba1a2a3a4a5a6a7AbaloneaccelAileronsAirfoildAutoPriceavailpwrBank8FMBostonCaliforniaCompactivconcrstrcpuActcpuSmdeltaaileronsDeltaelvele.1elevatorsForestFiresfuelconsHeatHouseKinematics32fhMachineCpumaxtorqueqMortgagepuma32hhServoTreasuryWankara
Generalized Oversampling for Learning from Imbalanced datasets and Associated Theory: Application in RegressionGOLIATH✅Rhttp:localNO2BostoncpuSmbank8fmabalone
Data Augmentation with Variational Autoencoder for Imbalanced DatasetDAVID✅pythonhttps://github.com/sstocksieker/DAVID/bank8FMabalonebostonNO2
Boarding for ISS: Imbalanced Self-Supervised: Discovery of a Scaled Autoencoder for Mixed Tabular DatasetsSpecificNA
A Selective Under-Sampling (SUS) Method For Imbalanced Regression❌NAAbaloneAccela1a2a3a4a5a6a7availPwrbank8FMbostoncpuSmfuelConsheatmaxtorqueq
Error Distribution Smoothing: Advancing Low-Dimensional Imbalanced RegressionEDS✅pythonhttps://a❌ymous.4open.science/r/Error-Distribution-Smoothing-762F/README.mdquadcopter dynamicsCartpole
KNNOR-Reg: A python package for oversampling in imbalanced regressionKNNOR-Reg: A python package for oversampling in imbalanced regression✅pythonhttps://github.com/ashhadulislam/augmentdatalibregsource/blob/main/README.mdmortgage
Uncertainty quantification driven machine learning for improving model accuracy in imbalanced regression tasksUQDIR✅pythonhttps://github.com/tubadolar/uqdir/tree/main/datasetsaccelabalonebank8fmbostoncpusmaileronselevatorsearthquakeCaliforniadelta
Quantification of Data ImbalanceImb_quanti✅pythonhttps://github.com/OFFIS-ROC/imbaquEnergy.efficiencyforestfiresOptical.interconnection.networkconcrstrServoCombined.cycle.power.plantGrid.stabilitysuperconductivitySynchronous.machineAuction.verificationAirfoildConcrete.slump.testtraffic.behaviourYacht.hydrodynamicsFish.toxicityWave.energy.perth.49Aquatic.toxicitySteel.industryComputer.hardwareAbaloneAge.predictionParkinsonWinequality.whiteFacebook.metricsAileronsAnacaltAutopricebank32bank8baseballbostonCaliforniadeltaaileronsDeltaelvele.1ele.2house16hLaser.generatedmortgagepuma32hhStrikesTreasury
An Investigation of Imbalanced Regression Loss Functions with Neural Network ModelsScaled-Weighted loss✅pythonhttps://drive.google.com/drive/folders/1zOHx_BwZL45RnTWCMt3VNZ6bgMugLNQkSimpleOceanData_Assimilation

Sources

These datasets have been collected from public repositories such as UCI, Kaggle, and various GitHub pages associated with prior research on imbalanced regression. Below is a list of the main source repositories used to compile this collection:

  • —https://archive.ics.uci.edu
  • —https://www.kaggle.com
  • —https://sci2s.ugr.es/keel/datasets.php
  • —https://www.dcc.fc.up.pt/~ltorgo/EPIA2013/
  • —https://www.dcc.fc.up.pt/~ltorgo/Regression/DataSets.html
  • —https://lib.stat.cmu.edu/datasets/
  • —https://github.com/paobranco/UtilityOptimizationRegression
  • —https://github.com/nunompmoniz/Ensembles_LIDTA2017
  • —https://github.com/paobranco/SMOGN-LIDTA17
  • —https://github.com/paobranco/NeighborhoodBiasResamplingRegression
  • —https://github.com/nunompmoniz/DSAA2018
  • —https://github.com/paobranco/Pre-processingApproachesImbalanceRegression
  • —https://paobranco.github.io/DataSets-IR/
  • —https://github.com/paobranco/REBAGG
  • —https://github.com/mrfoliveira/STResampling-DSAA2019/tree/master/inst/extdata
  • —https://github.com/nunompmoniz/IRon/tree/master/data
  • —https://github.com/SteiMi/denseweight
  • —https://github.com/SteiMi/density-based-weighting-for-imbalanced-regression/tree/main/exp3/data
  • —https://github.com/lsadouk/imbalanced_regression
  • —https://github.com/ndao1104/distributed-resampling
  • —https://paobranco.github.io/DataSets-IR/
  • —https://github.com/anibalsilva1/IRModelOptimization
  • —https://github.com/yingk1213/ASER
  • —https://data.mendeley.com/datasets/mpvwnhv4vb/2
  • —https://github.com/paobranco/ImbalancedLearningRegression/tree/master
  • —http://www2.math.uconn.edu/~valdez/data.html
  • —https://github.com/JusciAvelino/imbalancedRegression/tree/main/
  • —https://github.com/vengozhang/IMr-GB
  • —https://github.com/lzz185/ACOS
  • —https://github.com/guanying24/SerEnet
  • —https://drive.google.com/drive/folders/1h6Q5sKB5bnqk0Kh01sH1uc6LTp4KSPbb
  • —https://github.com/sstocksieker/DAVID/
  • —https://github.com/tubadolar/uqdir/tree/main/datasets

license: cc-by-4.0 ---