Team Ai
Modelpublic

LocalLite/python-code-completion-ministral-8B

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes
trainer_state.json645 linesDownload Raw Back to checkpoint-500
1{2  "best_global_step": 150,3  "best_metric": 0.5928216576576233,4  "best_model_checkpoint": "./python-code-completion-ministral-8B/checkpoint-100",5  "epoch": 3.9098039215686273,6  "eval_steps": 50,7  "global_step": 500,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "entropy": 1.5072221472859382,14      "epoch": 0.0784313725490196,15      "grad_norm": 0.355531245470047,16      "learning_rate": 6e-05,17      "loss": 1.7279,18      "mean_token_accuracy": 0.6269892059266567,19      "num_tokens": 22720.0,20      "step": 1021    },22    {23      "entropy": 1.156855022162199,24      "epoch": 0.1568627450980392,25      "grad_norm": 0.4324820339679718,26      "learning_rate": 9.998321768134102e-05,27      "loss": 1.027,28      "mean_token_accuracy": 0.7633639872074127,29      "num_tokens": 46930.0,30      "step": 2031    },32    {33      "entropy": 0.724648866429925,34      "epoch": 0.23529411764705882,35      "grad_norm": 0.28367722034454346,36      "learning_rate": 9.979454595377594e-05,37      "loss": 0.7082,38      "mean_token_accuracy": 0.8542310416698455,39      "num_tokens": 73605.0,40      "step": 3041    },42    {43      "entropy": 0.6228405788540841,44      "epoch": 0.3137254901960784,45      "grad_norm": 0.2075912207365036,46      "learning_rate": 9.93970185956522e-05,47      "loss": 0.653,48      "mean_token_accuracy": 0.8736839070916176,49      "num_tokens": 98799.0,50      "step": 4051    },52    {53      "entropy": 0.5743573283776641,54      "epoch": 0.39215686274509803,55      "grad_norm": 0.21785929799079895,56      "learning_rate": 9.879230297486034e-05,57      "loss": 0.6108,58      "mean_token_accuracy": 0.8821258693933487,59      "num_tokens": 121501.0,60      "step": 5061    },62    {63      "epoch": 0.39215686274509803,64      "eval_entropy": 0.6596304257710774,65      "eval_loss": 0.6177071332931519,66      "eval_mean_token_accuracy": 0.8652889298068153,67      "eval_num_tokens": 121501.0,68      "eval_runtime": 15.4707,69      "eval_samples_per_second": 5.817,70      "eval_steps_per_second": 5.817,71      "step": 5072    },73    {74      "entropy": 0.6043186411261559,75      "epoch": 0.47058823529411764,76      "grad_norm": 0.31095993518829346,77      "learning_rate": 9.798293547886748e-05,78      "loss": 0.645,79      "mean_token_accuracy": 0.8754804000258446,80      "num_tokens": 145419.0,81      "step": 6082    },83    {84      "entropy": 0.6452899970114231,85      "epoch": 0.5490196078431373,86      "grad_norm": 0.3375164866447449,87      "learning_rate": 9.697231087622691e-05,88      "loss": 0.6634,89      "mean_token_accuracy": 0.8640451654791832,90      "num_tokens": 169873.0,91      "step": 7092    },93    {94      "entropy": 0.6401195958256721,95      "epoch": 0.6274509803921569,96      "grad_norm": 0.21431401371955872,97      "learning_rate": 9.576466807773899e-05,98      "loss": 0.6615,99      "mean_token_accuracy": 0.8669946551322937,100      "num_tokens": 194305.0,101      "step": 80102    },103    {104      "entropy": 0.5998968390747905,105      "epoch": 0.7058823529411765,106      "grad_norm": 0.22246505320072174,107      "learning_rate": 9.436507235698612e-05,108      "loss": 0.6405,109      "mean_token_accuracy": 0.877622701227665,110      "num_tokens": 217799.0,111      "step": 90112    },113    {114      "entropy": 0.5195517055690289,115      "epoch": 0.7843137254901961,116      "grad_norm": 0.22644591331481934,117      "learning_rate": 9.277939410481507e-05,118      "loss": 0.574,119      "mean_token_accuracy": 0.8936989307403564,120      "num_tokens": 241897.0,121      "step": 100122    },123    {124      "epoch": 0.7843137254901961,125      "eval_entropy": 0.607519467257791,126      "eval_loss": 0.5936470627784729,127      "eval_mean_token_accuracy": 0.8691287775834401,128      "eval_num_tokens": 241897.0,129      "eval_runtime": 15.5316,130      "eval_samples_per_second": 5.795,131      "eval_steps_per_second": 5.795,132      "step": 100133    },134    {135      "entropy": 0.598377226293087,136      "epoch": 0.8627450980392157,137      "grad_norm": 0.19417309761047363,138      "learning_rate": 9.101428420687759e-05,139      "loss": 0.6663,140      "mean_token_accuracy": 0.8794096082448959,141      "num_tokens": 266761.0,142      "step": 110143    },144    {145      "entropy": 0.5745990440249443,146      "epoch": 0.9411764705882353,147      "grad_norm": 0.30245068669319153,148      "learning_rate": 8.907714614750473e-05,149      "loss": 0.605,150      "mean_token_accuracy": 0.8777685552835465,151      "num_tokens": 291812.0,152      "step": 120153    },154    {155      "entropy": 0.563015444890449,156      "epoch": 1.0156862745098039,157      "grad_norm": 0.24953527748584747,158      "learning_rate": 8.697610495692054e-05,159      "loss": 0.5665,160      "mean_token_accuracy": 0.8813700503424594,161      "num_tokens": 314476.0,162      "step": 130163    },164    {165      "entropy": 0.53117360714823,166      "epoch": 1.0941176470588236,167      "grad_norm": 0.24786317348480225,168      "learning_rate": 8.471997313204181e-05,169      "loss": 0.5683,170      "mean_token_accuracy": 0.8960023656487465,171      "num_tokens": 335438.0,172      "step": 140173    },174    {175      "entropy": 0.48921620547771455,176      "epoch": 1.1725490196078432,177      "grad_norm": 0.33822259306907654,178      "learning_rate": 8.231821367380335e-05,179      "loss": 0.5322,180      "mean_token_accuracy": 0.8975507125258446,181      "num_tokens": 361329.0,182      "step": 150183    },184    {185      "epoch": 1.1725490196078432,186      "eval_entropy": 0.5694952074852254,187      "eval_loss": 0.5928216576576233,188      "eval_mean_token_accuracy": 0.8691950864262051,189      "eval_num_tokens": 361329.0,190      "eval_runtime": 15.4486,191      "eval_samples_per_second": 5.826,192      "eval_steps_per_second": 5.826,193      "step": 150194    },195    {196      "entropy": 0.5561734782531857,197      "epoch": 1.2509803921568627,198      "grad_norm": 0.27892613410949707,199      "learning_rate": 7.978090039604341e-05,200      "loss": 0.5711,201      "mean_token_accuracy": 0.8858156308531762,202      "num_tokens": 387834.0,203      "step": 160204    },205    {206      "entropy": 0.48290685191750526,207      "epoch": 1.3294117647058823,208      "grad_norm": 0.2847723662853241,209      "learning_rate": 7.711867567242768e-05,210      "loss": 0.5477,211      "mean_token_accuracy": 0.8980041235685349,212      "num_tokens": 412449.0,213      "step": 170214    },215    {216      "entropy": 0.4553432559594512,217      "epoch": 1.4078431372549018,218      "grad_norm": 0.35990357398986816,219      "learning_rate": 7.434270579863548e-05,220      "loss": 0.4953,221      "mean_token_accuracy": 0.9054195120930671,222      "num_tokens": 434822.0,223      "step": 180224    },225    {226      "entropy": 0.4999146230518818,227      "epoch": 1.4862745098039216,228      "grad_norm": 0.23805052042007446,229      "learning_rate": 7.146463415703531e-05,230      "loss": 0.5029,231      "mean_token_accuracy": 0.8930570259690285,232      "num_tokens": 461303.0,233      "step": 190234    },235    {236      "entropy": 0.49880330096930264,237      "epoch": 1.5647058823529412,238      "grad_norm": 0.2987266480922699,239      "learning_rate": 6.84965323802926e-05,240      "loss": 0.5443,241      "mean_token_accuracy": 0.8915592297911644,242      "num_tokens": 487363.0,243      "step": 200244    },245    {246      "epoch": 1.5647058823529412,247      "eval_entropy": 0.5494673619667689,248      "eval_loss": 0.5963289737701416,249      "eval_mean_token_accuracy": 0.8694895923137664,250      "eval_num_tokens": 487363.0,251      "eval_runtime": 15.5114,252      "eval_samples_per_second": 5.802,253      "eval_steps_per_second": 5.802,254      "step": 200255    },256    {257      "entropy": 0.49026294946670534,258      "epoch": 1.6431372549019607,259      "grad_norm": 0.2591567039489746,260      "learning_rate": 6.545084971874738e-05,261      "loss": 0.5028,262      "mean_token_accuracy": 0.8963919445872307,263      "num_tokens": 512437.0,264      "step": 210265    },266    {267      "entropy": 0.5070990648120641,268      "epoch": 1.7215686274509805,269      "grad_norm": 0.3534194231033325,270      "learning_rate": 6.23403608239317e-05,271      "loss": 0.5434,272      "mean_token_accuracy": 0.8927687123417855,273      "num_tokens": 534856.0,274      "step": 220275    },276    {277      "entropy": 0.5167016156017781,278      "epoch": 1.8,279      "grad_norm": 0.26480528712272644,280      "learning_rate": 5.9178112167241805e-05,281      "loss": 0.5265,282      "mean_token_accuracy": 0.8922785848379136,283      "num_tokens": 560263.0,284      "step": 230285    },286    {287      "entropy": 0.4376767996698618,288      "epoch": 1.8784313725490196,289      "grad_norm": 0.2970808148384094,290      "learning_rate": 5.597736731850295e-05,291      "loss": 0.4587,292      "mean_token_accuracy": 0.9108576759696007,293      "num_tokens": 582717.0,294      "step": 240295    },296    {297      "entropy": 0.5208950355648995,298      "epoch": 1.9568627450980394,299      "grad_norm": 0.27791768312454224,300      "learning_rate": 5.2751551313948246e-05,301      "loss": 0.5336,302      "mean_token_accuracy": 0.8880411878228187,303      "num_tokens": 608651.0,304      "step": 250305    },306    {307      "epoch": 1.9568627450980394,308      "eval_entropy": 0.5718106091022491,309      "eval_loss": 0.5953241586685181,310      "eval_mean_token_accuracy": 0.8688194268279605,311      "eval_num_tokens": 608651.0,312      "eval_runtime": 15.4979,313      "eval_samples_per_second": 5.807,314      "eval_steps_per_second": 5.807,315      "step": 250316    },317    {318      "entropy": 0.45974215472999375,319      "epoch": 2.0313725490196077,320      "grad_norm": 0.32541951537132263,321      "learning_rate": 4.9514194346951144e-05,322      "loss": 0.4736,323      "mean_token_accuracy": 0.9053617276643452,324      "num_tokens": 629040.0,325      "step": 260326    },327    {328      "entropy": 0.4414994928985834,329      "epoch": 2.1098039215686275,330      "grad_norm": 0.372414231300354,331      "learning_rate": 4.627887501769231e-05,332      "loss": 0.4428,333      "mean_token_accuracy": 0.9085879683494568,334      "num_tokens": 654385.0,335      "step": 270336    },337    {338      "entropy": 0.3868284210562706,339      "epoch": 2.1882352941176473,340      "grad_norm": 0.27554434537887573,341      "learning_rate": 4.305916337979168e-05,342      "loss": 0.4041,343      "mean_token_accuracy": 0.9162766322493553,344      "num_tokens": 677869.0,345      "step": 280346    },347    {348      "entropy": 0.48472463674843314,349      "epoch": 2.2666666666666666,350      "grad_norm": 0.3065558969974518,351      "learning_rate": 3.9868564022787505e-05,352      "loss": 0.4702,353      "mean_token_accuracy": 0.9028230115771294,354      "num_tokens": 705954.0,355      "step": 290356    },357    {358      "entropy": 0.35362908374518154,359      "epoch": 2.3450980392156864,360      "grad_norm": 0.42765629291534424,361      "learning_rate": 3.672045942919474e-05,362      "loss": 0.3858,363      "mean_token_accuracy": 0.9247043713927269,364      "num_tokens": 729855.0,365      "step": 300366    },367    {368      "epoch": 2.3450980392156864,369      "eval_entropy": 0.4895121798747116,370      "eval_loss": 0.633377194404602,371      "eval_mean_token_accuracy": 0.8656294153796302,372      "eval_num_tokens": 729855.0,373      "eval_runtime": 15.4754,374      "eval_samples_per_second": 5.816,375      "eval_steps_per_second": 5.816,376      "step": 300377    },378    {379      "entropy": 0.3393667917698622,380      "epoch": 2.4235294117647057,381      "grad_norm": 0.3438664972782135,382      "learning_rate": 3.362805384372267e-05,383      "loss": 0.3374,384      "mean_token_accuracy": 0.9306267336010933,385      "num_tokens": 750942.0,386      "step": 310387    },388    {389      "entropy": 0.3776489123702049,390      "epoch": 2.5019607843137255,391      "grad_norm": 0.3191138207912445,392      "learning_rate": 3.0604317890083676e-05,393      "loss": 0.3675,394      "mean_token_accuracy": 0.9214938268065452,395      "num_tokens": 774956.0,396      "step": 320397    },398    {399      "entropy": 0.39363621212542055,400      "epoch": 2.5803921568627453,401      "grad_norm": 0.4947509169578552,402      "learning_rate": 2.7661934167689884e-05,403      "loss": 0.4188,404      "mean_token_accuracy": 0.916774469614029,405      "num_tokens": 800996.0,406      "step": 330407    },408    {409      "entropy": 0.3987773071974516,410      "epoch": 2.6588235294117646,411      "grad_norm": 0.4273108243942261,412      "learning_rate": 2.481324405642369e-05,413      "loss": 0.4063,414      "mean_token_accuracy": 0.9157314419746398,415      "num_tokens": 826362.0,416      "step": 340417    },418    {419      "entropy": 0.4490684296935797,420      "epoch": 2.7372549019607844,421      "grad_norm": 0.47922441363334656,422      "learning_rate": 2.207019595260154e-05,423      "loss": 0.4576,424      "mean_token_accuracy": 0.9035186737775802,425      "num_tokens": 853427.0,426      "step": 350427    },428    {429      "epoch": 2.7372549019607844,430      "eval_entropy": 0.5091634632812606,431      "eval_loss": 0.6345335245132446,432      "eval_mean_token_accuracy": 0.8654518723487854,433      "eval_num_tokens": 853427.0,434      "eval_runtime": 15.4411,435      "eval_samples_per_second": 5.829,436      "eval_steps_per_second": 5.829,437      "step": 350438    },439    {440      "entropy": 0.3651732888072729,441      "epoch": 2.8156862745098037,442      "grad_norm": 0.4229300618171692,443      "learning_rate": 1.9444295153247487e-05,444      "loss": 0.3517,445      "mean_token_accuracy": 0.9295069724321365,446      "num_tokens": 876031.0,447      "step": 360448    },449    {450      "entropy": 0.37069291807711124,451      "epoch": 2.8941176470588235,452      "grad_norm": 0.383728951215744,453      "learning_rate": 1.694655559887914e-05,454      "loss": 0.3875,455      "mean_token_accuracy": 0.9240497961640358,456      "num_tokens": 898756.0,457      "step": 370458    },459    {460      "entropy": 0.3721807461231947,461      "epoch": 2.9725490196078432,462      "grad_norm": 0.40181341767311096,463      "learning_rate": 1.4587453677213348e-05,464      "loss": 0.3983,465      "mean_token_accuracy": 0.9216682553291321,466      "num_tokens": 921618.0,467      "step": 380468    },469    {470      "entropy": 0.4022895936903201,471      "epoch": 3.0470588235294116,472      "grad_norm": 0.32404816150665283,473      "learning_rate": 1.2376884281555484e-05,474      "loss": 0.3566,475      "mean_token_accuracy": 0.9227047578284615,476      "num_tokens": 948594.0,477      "step": 390478    },479    {480      "entropy": 0.3646719891577959,481      "epoch": 3.1254901960784314,482      "grad_norm": 0.3212927281856537,483      "learning_rate": 1.0324119308178166e-05,484      "loss": 0.3489,485      "mean_token_accuracy": 0.9308759719133377,486      "num_tokens": 972074.0,487      "step": 400488    },489    {490      "epoch": 3.1254901960784314,491      "eval_entropy": 0.47637585144903927,492      "eval_loss": 0.661882758140564,493      "eval_mean_token_accuracy": 0.8632458435164557,494      "eval_num_tokens": 972074.0,495      "eval_runtime": 15.4948,496      "eval_samples_per_second": 5.808,497      "eval_steps_per_second": 5.808,498      "step": 400499    },500    {501      "entropy": 0.30484746433794496,502      "epoch": 3.203921568627451,503      "grad_norm": 0.3374861776828766,504      "learning_rate": 8.437768766765974e-06,505      "loss": 0.3161,506      "mean_token_accuracy": 0.9372083112597466,507      "num_tokens": 994846.0,508      "step": 410509    },510    {511      "entropy": 0.35498267617076634,512      "epoch": 3.2823529411764705,513      "grad_norm": 0.36716318130493164,514      "learning_rate": 6.725744667042777e-06,515      "loss": 0.3387,516      "mean_token_accuracy": 0.9290374144911766,517      "num_tokens": 1019726.0,518      "step": 420519    },520    {521      "entropy": 0.3321664972230792,522      "epoch": 3.3607843137254902,523      "grad_norm": 0.4375359117984772,524      "learning_rate": 5.195227833053274e-06,525      "loss": 0.323,526      "mean_token_accuracy": 0.9353578373789787,527      "num_tokens": 1044999.0,528      "step": 430529    },530    {531      "entropy": 0.33164924252778294,532      "epoch": 3.43921568627451,533      "grad_norm": 0.48313814401626587,534      "learning_rate": 3.852637784291424e-06,535      "loss": 0.346,536      "mean_token_accuracy": 0.9326006546616554,537      "num_tokens": 1068850.0,538      "step": 440539    },540    {541      "entropy": 0.29590620547533036,542      "epoch": 3.5176470588235293,543      "grad_norm": 0.5358214378356934,544      "learning_rate": 2.703605810004772e-06,545      "loss": 0.2704,546      "mean_token_accuracy": 0.9426496475934982,547      "num_tokens": 1092853.0,548      "step": 450549    },550    {551      "epoch": 3.5176470588235293,552      "eval_entropy": 0.46879171944326825,553      "eval_loss": 0.6711850762367249,554      "eval_mean_token_accuracy": 0.8622583528359731,555      "eval_num_tokens": 1092853.0,556      "eval_runtime": 15.462,557      "eval_samples_per_second": 5.821,558      "eval_steps_per_second": 5.821,559      "step": 450560    },561    {562      "entropy": 0.3179448990151286,563      "epoch": 3.596078431372549,564      "grad_norm": 0.4179091155529022,565      "learning_rate": 1.7529513496103323e-06,566      "loss": 0.3118,567      "mean_token_accuracy": 0.9393924847245216,568      "num_tokens": 1115370.0,569      "step": 460570    },571    {572      "entropy": 0.31651122458279135,573      "epoch": 3.674509803921569,574      "grad_norm": 0.4960501492023468,575      "learning_rate": 1.004661778290783e-06,576      "loss": 0.3162,577      "mean_token_accuracy": 0.9382667735219001,578      "num_tokens": 1137241.0,579      "step": 470580    },581    {582      "entropy": 0.3232851158827543,583      "epoch": 3.7529411764705882,584      "grad_norm": 0.39605653285980225,585      "learning_rate": 4.6187568255726124e-07,586      "loss": 0.3284,587      "mean_token_accuracy": 0.9355289787054062,588      "num_tokens": 1162001.0,589      "step": 480590    },591    {592      "entropy": 0.3265875181183219,593      "epoch": 3.831372549019608,594      "grad_norm": 0.6258050799369812,595      "learning_rate": 1.268696959267679e-07,596      "loss": 0.3199,597      "mean_token_accuracy": 0.9376031413674355,598      "num_tokens": 1186075.0,599      "step": 490600    },601    {602      "entropy": 0.36884093452245,603      "epoch": 3.9098039215686273,604      "grad_norm": 0.44404006004333496,605      "learning_rate": 1.0489499300603278e-09,606      "loss": 0.3421,607      "mean_token_accuracy": 0.9266003414988517,608      "num_tokens": 1213302.0,609      "step": 500610    },611    {612      "epoch": 3.9098039215686273,613      "eval_entropy": 0.47118989841805564,614      "eval_loss": 0.6726338863372803,615      "eval_mean_token_accuracy": 0.8621971819135877,616      "eval_num_tokens": 1213302.0,617      "eval_runtime": 15.5109,618      "eval_samples_per_second": 5.802,619      "eval_steps_per_second": 5.802,620      "step": 500621    }622  ],623  "logging_steps": 10,624  "max_steps": 500,625  "num_input_tokens_seen": 0,626  "num_train_epochs": 4,627  "save_steps": 100,628  "stateful_callbacks": {629    "TrainerControl": {630      "args": {631        "should_epoch_stop": false,632        "should_evaluate": false,633        "should_log": false,634        "should_save": true,635        "should_training_stop": true636      },637      "attributes": {}638    }639  },640  "total_flos": 5.574534419069338e+16,641  "train_batch_size": 1,642  "trial_name": null,643  "trial_params": null644}645