LocalLite/python-code-refactoring-ministral-8B
0
1{2 "best_global_step": 200,3 "best_metric": 0.25436246395111084,4 "best_model_checkpoint": "./python-code-refactoring-ministral-8B/checkpoint-200",5 "epoch": 0.9411764705882353,6 "eval_steps": 50,7 "global_step": 200,8 "is_hyper_param_search": false,9 "is_local_process_zero": true,10 "is_world_process_zero": true,11 "log_history": [12 {13 "entropy": 1.2112591058015822,14 "epoch": 0.047058823529411764,15 "grad_norm": 0.6328933835029602,16 "learning_rate": 7.500000000000001e-06,17 "loss": 1.7004,18 "mean_token_accuracy": 0.6649438560009002,19 "num_tokens": 16836.0,20 "step": 1021 },22 {23 "entropy": 1.2078000918030738,24 "epoch": 0.09411764705882353,25 "grad_norm": 0.5308480858802795,26 "learning_rate": 9.991971098713136e-06,27 "loss": 1.5909,28 "mean_token_accuracy": 0.6793556809425354,29 "num_tokens": 33851.0,30 "step": 2031 },32 {33 "entropy": 1.193270905315876,34 "epoch": 0.1411764705882353,35 "grad_norm": 0.5148553252220154,36 "learning_rate": 9.952707929045018e-06,37 "loss": 1.3732,38 "mean_token_accuracy": 0.7048414140939713,39 "num_tokens": 51118.0,40 "step": 3041 },42 {43 "entropy": 1.1802570581436158,44 "epoch": 0.18823529411764706,45 "grad_norm": 0.5968846082687378,46 "learning_rate": 9.88099273969759e-06,47 "loss": 1.1662,48 "mean_token_accuracy": 0.728707967698574,49 "num_tokens": 67851.0,50 "step": 4051 },52 {53 "entropy": 0.8819854319095611,54 "epoch": 0.23529411764705882,55 "grad_norm": 0.5468736290931702,56 "learning_rate": 9.777295435775165e-06,57 "loss": 0.8373,58 "mean_token_accuracy": 0.815536054968834,59 "num_tokens": 84988.0,60 "step": 5061 },62 {63 "epoch": 0.23529411764705882,64 "eval_entropy": 0.7242053945859274,65 "eval_loss": 0.6968294978141785,66 "eval_mean_token_accuracy": 0.8591729084650676,67 "eval_num_tokens": 84988.0,68 "eval_runtime": 18.242,69 "eval_samples_per_second": 8.223,70 "eval_steps_per_second": 8.223,71 "step": 5072 },73 {74 "entropy": 0.593521349132061,75 "epoch": 0.2823529411764706,76 "grad_norm": 0.3674946427345276,77 "learning_rate": 9.64229548131959e-06,78 "loss": 0.5825,79 "mean_token_accuracy": 0.8873148798942566,80 "num_tokens": 102092.0,81 "step": 6082 },83 {84 "entropy": 0.45081270560622216,85 "epoch": 0.32941176470588235,86 "grad_norm": 0.40957480669021606,87 "learning_rate": 9.476877447204308e-06,88 "loss": 0.4838,89 "mean_token_accuracy": 0.9021970316767692,90 "num_tokens": 118935.0,91 "step": 7092 },93 {94 "entropy": 0.36085937917232513,95 "epoch": 0.3764705882352941,96 "grad_norm": 0.39999279379844666,97 "learning_rate": 9.282125215090694e-06,98 "loss": 0.3868,99 "mean_token_accuracy": 0.919852776825428,100 "num_tokens": 135700.0,101 "step": 80102 },103 {104 "entropy": 0.3600465551018715,105 "epoch": 0.4235294117647059,106 "grad_norm": 0.24208979308605194,107 "learning_rate": 9.059314875424553e-06,108 "loss": 0.3347,109 "mean_token_accuracy": 0.9249877437949181,110 "num_tokens": 152723.0,111 "step": 90112 },113 {114 "entropy": 0.3371710181236267,115 "epoch": 0.47058823529411764,116 "grad_norm": 0.24354608356952667,117 "learning_rate": 8.809906366007832e-06,118 "loss": 0.3068,119 "mean_token_accuracy": 0.9299718767404557,120 "num_tokens": 169857.0,121 "step": 100122 },123 {124 "epoch": 0.47058823529411764,125 "eval_entropy": 0.3274345314502716,126 "eval_loss": 0.3101823031902313,127 "eval_mean_token_accuracy": 0.9297333884239197,128 "eval_num_tokens": 169857.0,129 "eval_runtime": 18.3304,130 "eval_samples_per_second": 8.183,131 "eval_steps_per_second": 8.183,132 "step": 100133 },134 {135 "entropy": 0.3301278352737427,136 "epoch": 0.5176470588235295,137 "grad_norm": 0.24222862720489502,138 "learning_rate": 8.535533905932739e-06,139 "loss": 0.297,140 "mean_token_accuracy": 0.9317866399884224,141 "num_tokens": 186799.0,142 "step": 110143 },144 {145 "entropy": 0.3344870314002037,146 "epoch": 0.5647058823529412,147 "grad_norm": 0.24282677471637726,148 "learning_rate": 8.237995287558801e-06,149 "loss": 0.2942,150 "mean_token_accuracy": 0.9307269603013992,151 "num_tokens": 203775.0,152 "step": 120153 },154 {155 "entropy": 0.32817855961620807,156 "epoch": 0.611764705882353,157 "grad_norm": 0.20758755505084991,158 "learning_rate": 7.919240096695877e-06,159 "loss": 0.2832,160 "mean_token_accuracy": 0.9334745943546295,161 "num_tokens": 220919.0,162 "step": 130163 },164 {165 "entropy": 0.2978081665933132,166 "epoch": 0.6588235294117647,167 "grad_norm": 0.25893646478652954,168 "learning_rate": 7.58135693817893e-06,169 "loss": 0.2731,170 "mean_token_accuracy": 0.9333468064665794,171 "num_tokens": 238215.0,172 "step": 140173 },174 {175 "entropy": 0.28119575753808024,176 "epoch": 0.7058823529411765,177 "grad_norm": 0.26739779114723206,178 "learning_rate": 7.226559750537462e-06,179 "loss": 0.2673,180 "mean_token_accuracy": 0.9358425229787827,181 "num_tokens": 254625.0,182 "step": 150183 },184 {185 "epoch": 0.7058823529411765,186 "eval_entropy": 0.2825607425967852,187 "eval_loss": 0.27234065532684326,188 "eval_mean_token_accuracy": 0.9340071042378744,189 "eval_num_tokens": 254625.0,190 "eval_runtime": 18.2949,191 "eval_samples_per_second": 8.199,192 "eval_steps_per_second": 8.199,193 "step": 150194 },195 {196 "entropy": 0.28226450830698013,197 "epoch": 0.7529411764705882,198 "grad_norm": 0.27276191115379333,199 "learning_rate": 6.857173299431084e-06,200 "loss": 0.2697,201 "mean_token_accuracy": 0.9357088133692741,202 "num_tokens": 271437.0,203 "step": 160204 },205 {206 "entropy": 0.2687517054378986,207 "epoch": 0.8,208 "grad_norm": 0.2764045000076294,209 "learning_rate": 6.475617944903693e-06,210 "loss": 0.2438,211 "mean_token_accuracy": 0.9380499675869942,212 "num_tokens": 288419.0,213 "step": 170214 },215 {216 "entropy": 0.2816390782594681,217 "epoch": 0.8470588235294118,218 "grad_norm": 0.23346015810966492,219 "learning_rate": 6.084393782267039e-06,220 "loss": 0.2607,221 "mean_token_accuracy": 0.9347616925835609,222 "num_tokens": 305535.0,223 "step": 180224 },225 {226 "entropy": 0.2635271079838276,227 "epoch": 0.8941176470588236,228 "grad_norm": 0.2241382598876953,229 "learning_rate": 5.686064260528577e-06,230 "loss": 0.2437,231 "mean_token_accuracy": 0.9385963633656502,232 "num_tokens": 322499.0,233 "step": 190234 },235 {236 "entropy": 0.2634481403976679,237 "epoch": 0.9411764705882353,238 "grad_norm": 0.25238925218582153,239 "learning_rate": 5.283239385701882e-06,240 "loss": 0.2478,241 "mean_token_accuracy": 0.9358779728412628,242 "num_tokens": 340031.0,243 "step": 200244 },245 {246 "epoch": 0.9411764705882353,247 "eval_entropy": 0.2671808664004008,248 "eval_loss": 0.25436246395111084,249 "eval_mean_token_accuracy": 0.9354545970757803,250 "eval_num_tokens": 340031.0,251 "eval_runtime": 18.3601,252 "eval_samples_per_second": 8.17,253 "eval_steps_per_second": 8.17,254 "step": 200255 }256 ],257 "logging_steps": 10,258 "max_steps": 400,259 "num_input_tokens_seen": 0,260 "num_train_epochs": 2,261 "save_steps": 100,262 "stateful_callbacks": {263 "TrainerControl": {264 "args": {265 "should_epoch_stop": false,266 "should_evaluate": false,267 "should_log": false,268 "should_save": true,269 "should_training_stop": false270 },271 "attributes": {}272 }273 },274 "total_flos": 1.5622775805616128e+16,275 "train_batch_size": 1,276 "trial_name": null,277 "trial_params": null278}279 