Team Ai
Modelpublic

ILoveBuns/adaption_python_mental_execution_trac

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
0likes3downloads
trainer_state.json222 linesDownload Raw Back to root
1{2  "best_global_step": null,3  "best_metric": null,4  "best_model_checkpoint": null,5  "epoch": 1.0,6  "eval_steps": 4,7  "global_step": 21,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 0.047619047619047616,14      "grad_norm": 0.9568968415260315,15      "learning_rate": 0.0,16      "loss": 2.302734375,17      "step": 118    },19    {20      "epoch": 0.09523809523809523,21      "grad_norm": 0.6604674458503723,22      "learning_rate": 3.3333333333333335e-05,23      "loss": 1.83203125,24      "step": 225    },26    {27      "epoch": 0.14285714285714285,28      "grad_norm": 0.8862142562866211,29      "learning_rate": 6.666666666666667e-05,30      "loss": 2.1923828125,31      "step": 332    },33    {34      "epoch": 0.19047619047619047,35      "grad_norm": 0.9301884174346924,36      "learning_rate": 0.0001,37      "loss": 2.099609375,38      "step": 439    },40    {41      "epoch": 0.23809523809523808,42      "grad_norm": 0.6462522149085999,43      "learning_rate": 9.931634888554937e-05,44      "loss": 1.5146484375,45      "step": 546    },47    {48      "epoch": 0.23809523809523808,49      "eval_loss": 1.7890625,50      "eval_runtime": 5.5258,51      "eval_samples_per_second": 0.362,52      "eval_steps_per_second": 0.181,53      "step": 554    },55    {56      "epoch": 0.2857142857142857,57      "grad_norm": 0.7940283417701721,58      "learning_rate": 9.728616793536588e-05,59      "loss": 1.609375,60      "step": 661    },62    {63      "epoch": 0.3333333333333333,64      "grad_norm": 0.9866992235183716,65      "learning_rate": 9.397114317029975e-05,66      "loss": 1.708984375,67      "step": 768    },69    {70      "epoch": 0.38095238095238093,71      "grad_norm": 0.9356194734573364,72      "learning_rate": 8.947199994035401e-05,73      "loss": 1.62109375,74      "step": 875    },76    {77      "epoch": 0.42857142857142855,78      "grad_norm": 1.2427157163619995,79      "learning_rate": 8.392544243589427e-05,80      "loss": 1.72607421875,81      "step": 982    },83    {84      "epoch": 0.42857142857142855,85      "eval_loss": 1.50390625,86      "eval_runtime": 6.1677,87      "eval_samples_per_second": 0.324,88      "eval_steps_per_second": 0.162,89      "step": 990    },91    {92      "epoch": 0.47619047619047616,93      "grad_norm": 0.9093706607818604,94      "learning_rate": 7.75e-05,95      "loss": 1.31787109375,96      "step": 1097    },98    {99      "epoch": 0.5238095238095238,100      "grad_norm": 1.172244668006897,101      "learning_rate": 7.03909064496551e-05,102      "loss": 1.61328125,103      "step": 11104    },105    {106      "epoch": 0.5714285714285714,107      "grad_norm": 1.040825605392456,108      "learning_rate": 6.281416799501188e-05,109      "loss": 1.18115234375,110      "step": 12111    },112    {113      "epoch": 0.6190476190476191,114      "grad_norm": 1.2616082429885864,115      "learning_rate": 5.500000000000001e-05,116      "loss": 1.44921875,117      "step": 13118    },119    {120      "epoch": 0.6190476190476191,121      "eval_loss": 1.244140625,122      "eval_runtime": 5.5436,123      "eval_samples_per_second": 0.361,124      "eval_steps_per_second": 0.18,125      "step": 13126    },127    {128      "epoch": 0.6666666666666666,129      "grad_norm": 1.064231514930725,130      "learning_rate": 4.718583200498814e-05,131      "loss": 1.27685546875,132      "step": 14133    },134    {135      "epoch": 0.7142857142857143,136      "grad_norm": 1.1865931749343872,137      "learning_rate": 3.960909355034491e-05,138      "loss": 1.431640625,139      "step": 15140    },141    {142      "epoch": 0.7619047619047619,143      "grad_norm": 1.041445016860962,144      "learning_rate": 3.250000000000001e-05,145      "loss": 1.1904296875,146      "step": 16147    },148    {149      "epoch": 0.8095238095238095,150      "grad_norm": 1.1407253742218018,151      "learning_rate": 2.6074557564105727e-05,152      "loss": 1.21337890625,153      "step": 17154    },155    {156      "epoch": 0.8095238095238095,157      "eval_loss": 1.103515625,158      "eval_runtime": 5.5514,159      "eval_samples_per_second": 0.36,160      "eval_steps_per_second": 0.18,161      "step": 17162    },163    {164      "epoch": 0.8571428571428571,165      "grad_norm": 1.076326608657837,166      "learning_rate": 2.0528000059645997e-05,167      "loss": 1.212890625,168      "step": 18169    },170    {171      "epoch": 0.9047619047619048,172      "grad_norm": 1.2264506816864014,173      "learning_rate": 1.602885682970026e-05,174      "loss": 1.15478515625,175      "step": 19176    },177    {178      "epoch": 0.9523809523809523,179      "grad_norm": 0.922339916229248,180      "learning_rate": 1.2713832064634126e-05,181      "loss": 1.0078125,182      "step": 20183    },184    {185      "epoch": 1.0,186      "grad_norm": 1.0451383590698242,187      "learning_rate": 1.0683651114450641e-05,188      "loss": 1.181640625,189      "step": 21190    },191    {192      "epoch": 1.0,193      "eval_loss": 1.048828125,194      "eval_runtime": 5.5585,195      "eval_samples_per_second": 0.36,196      "eval_steps_per_second": 0.18,197      "step": 21198    }199  ],200  "logging_steps": 1.0,201  "max_steps": 21,202  "num_input_tokens_seen": 0,203  "num_train_epochs": 1,204  "save_steps": 0,205  "stateful_callbacks": {206    "TrainerControl": {207      "args": {208        "should_epoch_stop": false,209        "should_evaluate": false,210        "should_log": false,211        "should_save": true,212        "should_training_stop": true213      },214      "attributes": {}215    }216  },217  "total_flos": 1.0171502697560146e+18,218  "train_batch_size": 1,219  "trial_name": null,220  "trial_params": null221}222