Reshcode/java-coder-llama8B
03
1{2 "best_metric": null,3 "best_model_checkpoint": null,4 "epoch": 0.5600672080649678,5 "eval_steps": 500,6 "global_step": 500,7 "is_hyper_param_search": false,8 "is_local_process_zero": true,9 "is_world_process_zero": true,10 "log_history": [11 {12 "epoch": 0.11201344161299356,13 "grad_norm": 24.437002182006836,14 "learning_rate": 0.000425,15 "loss": 11.2945,16 "step": 10017 },18 {19 "epoch": 0.22402688322598713,20 "grad_norm": 2.8428707122802734,21 "learning_rate": 0.0004859240052689831,22 "loss": 9.0685,23 "step": 20024 },25 {26 "epoch": 0.33604032483898066,27 "grad_norm": 2.8141651153564453,28 "learning_rate": 0.0004356534373254316,29 "loss": 8.5419,30 "step": 30031 },32 {33 "epoch": 0.44805376645197426,34 "grad_norm": 447.9421691894531,35 "learning_rate": 0.00035655248499579206,36 "loss": 8.8585,37 "step": 40038 },39 {40 "epoch": 0.5600672080649678,41 "grad_norm": 3.154489278793335,42 "learning_rate": 0.00026090484684133404,43 "loss": 8.9436,44 "step": 50045 },46 {47 "epoch": 0.5600672080649678,48 "eval_loss": 23.479717254638672,49 "eval_runtime": 52.8168,50 "eval_samples_per_second": 1.893,51 "eval_steps_per_second": 0.947,52 "step": 50053 }54 ],55 "logging_steps": 100,56 "max_steps": 892,57 "num_input_tokens_seen": 0,58 "num_train_epochs": 1,59 "save_steps": 500,60 "stateful_callbacks": {61 "TrainerControl": {62 "args": {63 "should_epoch_stop": false,64 "should_evaluate": false,65 "should_log": false,66 "should_save": true,67 "should_training_stop": false68 },69 "attributes": {}70 }71 },72 "total_flos": 9.2249505398784e+16,73 "train_batch_size": 2,74 "trial_name": null,75 "trial_params": null76}77 