Team Ai
Modelpublic

srvmishra832/github_issues-dataset-distilbert-base-uncased

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
0likes22downloads
Model Card

github_issues-dataset-distilbert-base-uncased

This model is a fine-tuned version of distilbert-base-uncased on a GitHub issues dataset. It achieves the following results on the evaluation set:

  • —Loss: 0.1495
  • —Accuracy: 0.9580
  • —F1: 0.6067
  • —Precision: 0.7297
  • —Recall: 0.5192

Model description

distilbert-base-uncased

Intended uses & limitations

Multi Label Classification on GitHub repository issues.

Training and evaluation data

GitHub issues dataset taken from GitHub issues.

Split the dataset into 80-20 train-test splits. Filtered out the pull requests and issues with no labels.

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • —learning_rate: 2e-05
  • —trainbatchsize: 2
  • —evalbatchsize: 2
  • —seed: 42
  • —optimizer: Use OptimizerNames.ADAMWTORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizerargs=No additional optimizer arguments
  • —lrschedulertype: linear
  • —num_epochs: 5

Training results

Training LossEpochStepValidation LossAccuracyF1PrecisionRecall
0.39621.01140.25130.92080.340.35420.3269
0.20082.02280.18470.94360.41980.58620.3269
0.16333.03420.16080.95440.55810.70590.4615
0.14684.04560.15190.95800.60670.72970.5192
0.13855.05700.14950.95800.60670.72970.5192

Framework versions

  • —Transformers 4.49.0
  • —Pytorch 2.6.0+cu124
  • —Datasets 3.4.1
  • —Tokenizers 0.21.1