Team Ai
Modelpublic

thangcd/thread-intelligence-classifier

sourceHugging Faceupdated 4mo agoView on Hugging Face
0likes16downloads
trainer_state.json205 linesDownload Raw Back to checkpoint-1017
1{2  "best_global_step": 678,3  "best_metric": 0.9908637873754153,4  "best_model_checkpoint": "./classifier_model_refined/checkpoint-678",5  "epoch": 3.0,6  "eval_steps": 500,7  "global_step": 1017,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 0.14749262536873156,14      "grad_norm": 2.5459585189819336,15      "learning_rate": 1.903638151425762e-06,16      "loss": 0.09093725204467773,17      "step": 5018    },19    {20      "epoch": 0.2949852507374631,21      "grad_norm": 0.011955893598496914,22      "learning_rate": 1.8053097345132743e-06,23      "loss": 0.10499533653259277,24      "step": 10025    },26    {27      "epoch": 0.4424778761061947,28      "grad_norm": 0.4081194996833801,29      "learning_rate": 1.7069813176007865e-06,30      "loss": 0.09049854278564454,31      "step": 15032    },33    {34      "epoch": 0.5899705014749262,35      "grad_norm": 7.041113376617432,36      "learning_rate": 1.608652900688299e-06,37      "loss": 0.07993946075439454,38      "step": 20039    },40    {41      "epoch": 0.7374631268436578,42      "grad_norm": 43.293846130371094,43      "learning_rate": 1.5103244837758112e-06,44      "loss": 0.05462934970855713,45      "step": 25046    },47    {48      "epoch": 0.8849557522123894,49      "grad_norm": 0.4207114577293396,50      "learning_rate": 1.4119960668633234e-06,51      "loss": 0.059678683280944826,52      "step": 30053    },54    {55      "epoch": 1.0,56      "eval_accuracy": 0.9900332225913622,57      "eval_f1_macro": 0.9923847199375366,58      "eval_loss": 0.08367534726858139,59      "eval_runtime": 2.9099,60      "eval_samples_per_second": 413.754,61      "eval_steps_per_second": 13.059,62      "step": 33963    },64    {65      "epoch": 1.0324483775811208,66      "grad_norm": 5.123465538024902,67      "learning_rate": 1.3136676499508356e-06,68      "loss": 0.05710693359375,69      "step": 35070    },71    {72      "epoch": 1.1799410029498525,73      "grad_norm": 7.183027267456055,74      "learning_rate": 1.215339233038348e-06,75      "loss": 0.06182104110717773,76      "step": 40077    },78    {79      "epoch": 1.3274336283185841,80      "grad_norm": 0.10848981887102127,81      "learning_rate": 1.1170108161258603e-06,82      "loss": 0.06060198307037354,83      "step": 45084    },85    {86      "epoch": 1.4749262536873156,87      "grad_norm": 0.09567607939243317,88      "learning_rate": 1.0186823992133726e-06,89      "loss": 0.06725824356079102,90      "step": 50091    },92    {93      "epoch": 1.6224188790560472,94      "grad_norm": 4.66201639175415,95      "learning_rate": 9.203539823008849e-07,96      "loss": 0.07334633827209473,97      "step": 55098    },99    {100      "epoch": 1.7699115044247788,101      "grad_norm": 0.17738792300224304,102      "learning_rate": 8.220255653883972e-07,103      "loss": 0.05149734020233154,104      "step": 600105    },106    {107      "epoch": 1.9174041297935103,108      "grad_norm": 0.7206429839134216,109      "learning_rate": 7.236971484759095e-07,110      "loss": 0.0479090166091919,111      "step": 650112    },113    {114      "epoch": 2.0,115      "eval_accuracy": 0.9908637873754153,116      "eval_f1_macro": 0.9934718048955895,117      "eval_loss": 0.07654637098312378,118      "eval_runtime": 2.9002,119      "eval_samples_per_second": 415.144,120      "eval_steps_per_second": 13.103,121      "step": 678122    },123    {124      "epoch": 2.0648967551622417,125      "grad_norm": 0.30022454261779785,126      "learning_rate": 6.253687315634218e-07,127      "loss": 0.06578935623168945,128      "step": 700129    },130    {131      "epoch": 2.2123893805309733,132      "grad_norm": 0.03679751232266426,133      "learning_rate": 5.270403146509341e-07,134      "loss": 0.033387229442596436,135      "step": 750136    },137    {138      "epoch": 2.359882005899705,139      "grad_norm": 0.12588904798030853,140      "learning_rate": 4.287118977384464e-07,141      "loss": 0.0704490613937378,142      "step": 800143    },144    {145      "epoch": 2.5073746312684366,146      "grad_norm": 0.21027934551239014,147      "learning_rate": 3.3038348082595866e-07,148      "loss": 0.04873675346374512,149      "step": 850150    },151    {152      "epoch": 2.6548672566371683,153      "grad_norm": 41.093448638916016,154      "learning_rate": 2.32055063913471e-07,155      "loss": 0.056772613525390626,156      "step": 900157    },158    {159      "epoch": 2.8023598820058995,160      "grad_norm": 28.944047927856445,161      "learning_rate": 1.3372664700098328e-07,162      "loss": 0.03798616647720337,163      "step": 950164    },165    {166      "epoch": 2.949852507374631,167      "grad_norm": 0.2888835668563843,168      "learning_rate": 3.539823008849557e-08,169      "loss": 0.044747047424316407,170      "step": 1000171    },172    {173      "epoch": 3.0,174      "eval_accuracy": 0.9908637873754153,175      "eval_f1_macro": 0.9934718048955895,176      "eval_loss": 0.0788116306066513,177      "eval_runtime": 2.9073,178      "eval_samples_per_second": 414.135,179      "eval_steps_per_second": 13.071,180      "step": 1017181    }182  ],183  "logging_steps": 50,184  "max_steps": 1017,185  "num_input_tokens_seen": 0,186  "num_train_epochs": 3,187  "save_steps": 500,188  "stateful_callbacks": {189    "TrainerControl": {190      "args": {191        "should_epoch_stop": false,192        "should_evaluate": false,193        "should_log": false,194        "should_save": true,195        "should_training_stop": true196      },197      "attributes": {}198    }199  },200  "total_flos": 1076376257335296.0,201  "train_batch_size": 32,202  "trial_name": null,203  "trial_params": null204}205