Team Ai
Modelpublic

LocalLite/python-code-refactoring-ministral-8B

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes
trainer_state.json523 linesDownload Raw Back to checkpoint-400
1{2  "best_global_step": 400,3  "best_metric": 0.2452806532382965,4  "best_model_checkpoint": "./python-code-refactoring-ministral-8B/checkpoint-400",5  "epoch": 1.88,6  "eval_steps": 50,7  "global_step": 400,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "entropy": 1.2112591058015822,14      "epoch": 0.047058823529411764,15      "grad_norm": 0.6328933835029602,16      "learning_rate": 7.500000000000001e-06,17      "loss": 1.7004,18      "mean_token_accuracy": 0.6649438560009002,19      "num_tokens": 16836.0,20      "step": 1021    },22    {23      "entropy": 1.2078000918030738,24      "epoch": 0.09411764705882353,25      "grad_norm": 0.5308480858802795,26      "learning_rate": 9.991971098713136e-06,27      "loss": 1.5909,28      "mean_token_accuracy": 0.6793556809425354,29      "num_tokens": 33851.0,30      "step": 2031    },32    {33      "entropy": 1.193270905315876,34      "epoch": 0.1411764705882353,35      "grad_norm": 0.5148553252220154,36      "learning_rate": 9.952707929045018e-06,37      "loss": 1.3732,38      "mean_token_accuracy": 0.7048414140939713,39      "num_tokens": 51118.0,40      "step": 3041    },42    {43      "entropy": 1.1802570581436158,44      "epoch": 0.18823529411764706,45      "grad_norm": 0.5968846082687378,46      "learning_rate": 9.88099273969759e-06,47      "loss": 1.1662,48      "mean_token_accuracy": 0.728707967698574,49      "num_tokens": 67851.0,50      "step": 4051    },52    {53      "entropy": 0.8819854319095611,54      "epoch": 0.23529411764705882,55      "grad_norm": 0.5468736290931702,56      "learning_rate": 9.777295435775165e-06,57      "loss": 0.8373,58      "mean_token_accuracy": 0.815536054968834,59      "num_tokens": 84988.0,60      "step": 5061    },62    {63      "epoch": 0.23529411764705882,64      "eval_entropy": 0.7242053945859274,65      "eval_loss": 0.6968294978141785,66      "eval_mean_token_accuracy": 0.8591729084650676,67      "eval_num_tokens": 84988.0,68      "eval_runtime": 18.242,69      "eval_samples_per_second": 8.223,70      "eval_steps_per_second": 8.223,71      "step": 5072    },73    {74      "entropy": 0.593521349132061,75      "epoch": 0.2823529411764706,76      "grad_norm": 0.3674946427345276,77      "learning_rate": 9.64229548131959e-06,78      "loss": 0.5825,79      "mean_token_accuracy": 0.8873148798942566,80      "num_tokens": 102092.0,81      "step": 6082    },83    {84      "entropy": 0.45081270560622216,85      "epoch": 0.32941176470588235,86      "grad_norm": 0.40957480669021606,87      "learning_rate": 9.476877447204308e-06,88      "loss": 0.4838,89      "mean_token_accuracy": 0.9021970316767692,90      "num_tokens": 118935.0,91      "step": 7092    },93    {94      "entropy": 0.36085937917232513,95      "epoch": 0.3764705882352941,96      "grad_norm": 0.39999279379844666,97      "learning_rate": 9.282125215090694e-06,98      "loss": 0.3868,99      "mean_token_accuracy": 0.919852776825428,100      "num_tokens": 135700.0,101      "step": 80102    },103    {104      "entropy": 0.3600465551018715,105      "epoch": 0.4235294117647059,106      "grad_norm": 0.24208979308605194,107      "learning_rate": 9.059314875424553e-06,108      "loss": 0.3347,109      "mean_token_accuracy": 0.9249877437949181,110      "num_tokens": 152723.0,111      "step": 90112    },113    {114      "entropy": 0.3371710181236267,115      "epoch": 0.47058823529411764,116      "grad_norm": 0.24354608356952667,117      "learning_rate": 8.809906366007832e-06,118      "loss": 0.3068,119      "mean_token_accuracy": 0.9299718767404557,120      "num_tokens": 169857.0,121      "step": 100122    },123    {124      "epoch": 0.47058823529411764,125      "eval_entropy": 0.3274345314502716,126      "eval_loss": 0.3101823031902313,127      "eval_mean_token_accuracy": 0.9297333884239197,128      "eval_num_tokens": 169857.0,129      "eval_runtime": 18.3304,130      "eval_samples_per_second": 8.183,131      "eval_steps_per_second": 8.183,132      "step": 100133    },134    {135      "entropy": 0.3301278352737427,136      "epoch": 0.5176470588235295,137      "grad_norm": 0.24222862720489502,138      "learning_rate": 8.535533905932739e-06,139      "loss": 0.297,140      "mean_token_accuracy": 0.9317866399884224,141      "num_tokens": 186799.0,142      "step": 110143    },144    {145      "entropy": 0.3344870314002037,146      "epoch": 0.5647058823529412,147      "grad_norm": 0.24282677471637726,148      "learning_rate": 8.237995287558801e-06,149      "loss": 0.2942,150      "mean_token_accuracy": 0.9307269603013992,151      "num_tokens": 203775.0,152      "step": 120153    },154    {155      "entropy": 0.32817855961620807,156      "epoch": 0.611764705882353,157      "grad_norm": 0.20758755505084991,158      "learning_rate": 7.919240096695877e-06,159      "loss": 0.2832,160      "mean_token_accuracy": 0.9334745943546295,161      "num_tokens": 220919.0,162      "step": 130163    },164    {165      "entropy": 0.2978081665933132,166      "epoch": 0.6588235294117647,167      "grad_norm": 0.25893646478652954,168      "learning_rate": 7.58135693817893e-06,169      "loss": 0.2731,170      "mean_token_accuracy": 0.9333468064665794,171      "num_tokens": 238215.0,172      "step": 140173    },174    {175      "entropy": 0.28119575753808024,176      "epoch": 0.7058823529411765,177      "grad_norm": 0.26739779114723206,178      "learning_rate": 7.226559750537462e-06,179      "loss": 0.2673,180      "mean_token_accuracy": 0.9358425229787827,181      "num_tokens": 254625.0,182      "step": 150183    },184    {185      "epoch": 0.7058823529411765,186      "eval_entropy": 0.2825607425967852,187      "eval_loss": 0.27234065532684326,188      "eval_mean_token_accuracy": 0.9340071042378744,189      "eval_num_tokens": 254625.0,190      "eval_runtime": 18.2949,191      "eval_samples_per_second": 8.199,192      "eval_steps_per_second": 8.199,193      "step": 150194    },195    {196      "entropy": 0.28226450830698013,197      "epoch": 0.7529411764705882,198      "grad_norm": 0.27276191115379333,199      "learning_rate": 6.857173299431084e-06,200      "loss": 0.2697,201      "mean_token_accuracy": 0.9357088133692741,202      "num_tokens": 271437.0,203      "step": 160204    },205    {206      "entropy": 0.2687517054378986,207      "epoch": 0.8,208      "grad_norm": 0.2764045000076294,209      "learning_rate": 6.475617944903693e-06,210      "loss": 0.2438,211      "mean_token_accuracy": 0.9380499675869942,212      "num_tokens": 288419.0,213      "step": 170214    },215    {216      "entropy": 0.2816390782594681,217      "epoch": 0.8470588235294118,218      "grad_norm": 0.23346015810966492,219      "learning_rate": 6.084393782267039e-06,220      "loss": 0.2607,221      "mean_token_accuracy": 0.9347616925835609,222      "num_tokens": 305535.0,223      "step": 180224    },225    {226      "entropy": 0.2635271079838276,227      "epoch": 0.8941176470588236,228      "grad_norm": 0.2241382598876953,229      "learning_rate": 5.686064260528577e-06,230      "loss": 0.2437,231      "mean_token_accuracy": 0.9385963633656502,232      "num_tokens": 322499.0,233      "step": 190234    },235    {236      "entropy": 0.2634481403976679,237      "epoch": 0.9411764705882353,238      "grad_norm": 0.25238925218582153,239      "learning_rate": 5.283239385701882e-06,240      "loss": 0.2478,241      "mean_token_accuracy": 0.9358779728412628,242      "num_tokens": 340031.0,243      "step": 200244    },245    {246      "epoch": 0.9411764705882353,247      "eval_entropy": 0.2671808664004008,248      "eval_loss": 0.25436246395111084,249      "eval_mean_token_accuracy": 0.9354545970757803,250      "eval_num_tokens": 340031.0,251      "eval_runtime": 18.3601,252      "eval_samples_per_second": 8.17,253      "eval_steps_per_second": 8.17,254      "step": 200255    },256    {257      "entropy": 0.27091246508061884,258      "epoch": 0.9882352941176471,259      "grad_norm": 0.2224678099155426,260      "learning_rate": 4.8785586190579355e-06,261      "loss": 0.2495,262      "mean_token_accuracy": 0.9346240475773812,263      "num_tokens": 356961.0,264      "step": 210265    },266    {267      "entropy": 0.27871040882248627,268      "epoch": 1.0329411764705883,269      "grad_norm": 0.24531640112400055,270      "learning_rate": 4.474673582374381e-06,271      "loss": 0.2539,272      "mean_token_accuracy": 0.9362887332313939,273      "num_tokens": 372730.0,274      "step": 220275    },276    {277      "entropy": 0.256845248490572,278      "epoch": 1.08,279      "grad_norm": 0.21706384420394897,280      "learning_rate": 4.074230683504541e-06,281      "loss": 0.2392,282      "mean_token_accuracy": 0.9392171293497086,283      "num_tokens": 389960.0,284      "step": 230285    },286    {287      "entropy": 0.2579733207821846,288      "epoch": 1.1270588235294117,289      "grad_norm": 0.19243040680885315,290      "learning_rate": 3.679853776110035e-06,291      "loss": 0.2459,292      "mean_token_accuracy": 0.9344916313886642,293      "num_tokens": 406947.0,294      "step": 240295    },296    {297      "entropy": 0.26577013581991193,298      "epoch": 1.1741176470588235,299      "grad_norm": 0.2271624207496643,300      "learning_rate": 3.2941269671770193e-06,301      "loss": 0.2552,302      "mean_token_accuracy": 0.9344739750027656,303      "num_tokens": 423908.0,304      "step": 250305    },306    {307      "epoch": 1.1741176470588235,308      "eval_entropy": 0.2570107207695643,309      "eval_loss": 0.2488705962896347,310      "eval_mean_token_accuracy": 0.9355408449967703,311      "eval_num_tokens": 423908.0,312      "eval_runtime": 18.344,313      "eval_samples_per_second": 8.177,314      "eval_steps_per_second": 8.177,315      "step": 250316    },317    {318      "entropy": 0.2559947054833174,319      "epoch": 1.2211764705882353,320      "grad_norm": 0.24396584928035736,321      "learning_rate": 2.9195776849677037e-06,322      "loss": 0.2448,323      "mean_token_accuracy": 0.9389567241072655,324      "num_tokens": 440658.0,325      "step": 260326    },327    {328      "entropy": 0.2555523537099361,329      "epoch": 1.2682352941176471,330      "grad_norm": 0.21874727308750153,331      "learning_rate": 2.5586601183523485e-06,332      "loss": 0.2428,333      "mean_token_accuracy": 0.9377847194671631,334      "num_tokens": 457473.0,335      "step": 270336    },337    {338      "entropy": 0.2418661404401064,339      "epoch": 1.315294117647059,340      "grad_norm": 0.2622573971748352,341      "learning_rate": 2.213739136033533e-06,342      "loss": 0.2251,343      "mean_token_accuracy": 0.9425412893295289,344      "num_tokens": 474051.0,345      "step": 280346    },347    {348      "entropy": 0.2569988567382097,349      "epoch": 1.3623529411764705,350      "grad_norm": 0.21504490077495575,351      "learning_rate": 1.8870747910300064e-06,352      "loss": 0.2421,353      "mean_token_accuracy": 0.9356839284300804,354      "num_tokens": 491292.0,355      "step": 290356    },357    {358      "entropy": 0.25272532626986505,359      "epoch": 1.4094117647058824,360      "grad_norm": 0.3225324749946594,361      "learning_rate": 1.5808075119526323e-06,362      "loss": 0.2415,363      "mean_token_accuracy": 0.9385002166032791,364      "num_tokens": 508173.0,365      "step": 300366    },367    {368      "epoch": 1.4094117647058824,369      "eval_entropy": 0.2538743743300438,370      "eval_loss": 0.24622248113155365,371      "eval_mean_token_accuracy": 0.936361878712972,372      "eval_num_tokens": 508173.0,373      "eval_runtime": 18.3721,374      "eval_samples_per_second": 8.165,375      "eval_steps_per_second": 8.165,376      "step": 300377    },378    {379      "entropy": 0.2525585234165192,380      "epoch": 1.4564705882352942,381      "grad_norm": 0.2269955575466156,382      "learning_rate": 1.2969440781048015e-06,383      "loss": 0.2353,384      "mean_token_accuracy": 0.9391644984483719,385      "num_tokens": 525115.0,386      "step": 310387    },388    {389      "entropy": 0.24930565245449543,390      "epoch": 1.5035294117647058,391      "grad_norm": 0.2441737949848175,392      "learning_rate": 1.0373444703037644e-06,393      "loss": 0.2333,394      "mean_token_accuracy": 0.9403112232685089,395      "num_tokens": 541969.0,396      "step": 320397    },398    {399      "entropy": 0.2371720265597105,400      "epoch": 1.5505882352941176,401      "grad_norm": 0.26385828852653503,402      "learning_rate": 8.037096835812885e-07,403      "loss": 0.2195,404      "mean_token_accuracy": 0.9421997696161271,405      "num_tokens": 558705.0,406      "step": 330407    },408    {409      "entropy": 0.2542194213718176,410      "epoch": 1.5976470588235294,411      "grad_norm": 0.2517501711845398,412      "learning_rate": 5.97570581619446e-07,413      "loss": 0.2382,414      "mean_token_accuracy": 0.9359523132443428,415      "num_tokens": 575605.0,416      "step": 340417    },418    {419      "entropy": 0.2532818391919136,420      "epoch": 1.644705882352941,421      "grad_norm": 0.23593880236148834,422      "learning_rate": 4.2027786595149555e-07,423      "loss": 0.2327,424      "mean_token_accuracy": 0.9397944405674934,425      "num_tokens": 592558.0,426      "step": 350427    },428    {429      "epoch": 1.644705882352941,430      "eval_entropy": 0.25020226001739504,431      "eval_loss": 0.2454231232404709,432      "eval_mean_token_accuracy": 0.9366115434964498,433      "eval_num_tokens": 592558.0,434      "eval_runtime": 18.3239,435      "eval_samples_per_second": 8.186,436      "eval_steps_per_second": 8.186,437      "step": 350438    },439    {440      "entropy": 0.25380014926195144,441      "epoch": 1.691764705882353,442      "grad_norm": 0.2268085479736328,443      "learning_rate": 2.7299322565344956e-07,444      "loss": 0.235,445      "mean_token_accuracy": 0.9367626756429672,446      "num_tokens": 609468.0,447      "step": 360448    },449    {450      "entropy": 0.24986149594187737,451      "epoch": 1.7388235294117647,452      "grad_norm": 0.23303046822547913,453      "learning_rate": 1.5668172551691174e-07,454      "loss": 0.2422,455      "mean_token_accuracy": 0.9362318605184555,456      "num_tokens": 626324.0,457      "step": 370458    },459    {460      "entropy": 0.2423665601760149,461      "epoch": 1.7858823529411765,462      "grad_norm": 0.23102161288261414,463      "learning_rate": 7.210548257874927e-08,464      "loss": 0.2218,465      "mean_token_accuracy": 0.9416185393929482,466      "num_tokens": 643181.0,467      "step": 380468    },469    {470      "entropy": 0.24225412756204606,471      "epoch": 1.8329411764705883,472      "grad_norm": 0.20650127530097961,473      "learning_rate": 1.981867244139124e-08,474      "loss": 0.2307,475      "mean_token_accuracy": 0.9393002942204476,476      "num_tokens": 660451.0,477      "step": 390478    },479    {480      "entropy": 0.24758095815777778,481      "epoch": 1.88,482      "grad_norm": 0.21503891050815582,483      "learning_rate": 1.6389810421846286e-10,484      "loss": 0.2379,485      "mean_token_accuracy": 0.9382512927055359,486      "num_tokens": 677476.0,487      "step": 400488    },489    {490      "epoch": 1.88,491      "eval_entropy": 0.24997014413277308,492      "eval_loss": 0.2452806532382965,493      "eval_mean_token_accuracy": 0.9366318229834238,494      "eval_num_tokens": 677476.0,495      "eval_runtime": 18.3789,496      "eval_samples_per_second": 8.162,497      "eval_steps_per_second": 8.162,498      "step": 400499    }500  ],501  "logging_steps": 10,502  "max_steps": 400,503  "num_input_tokens_seen": 0,504  "num_train_epochs": 2,505  "save_steps": 100,506  "stateful_callbacks": {507    "TrainerControl": {508      "args": {509        "should_epoch_stop": false,510        "should_evaluate": false,511        "should_log": false,512        "should_save": true,513        "should_training_stop": true514      },515      "attributes": {}516    }517  },518  "total_flos": 3.112673744948429e+16,519  "train_batch_size": 1,520  "trial_name": null,521  "trial_params": null522}523