Team Ai
Modelpublic

immortalPi/stack_exc_binary_base_lm_head

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes14downloads
trainer_state.json140 linesDownload Raw Back to root
1{2  "best_global_step": 100,3  "best_metric": 0.268216073513031,4  "best_model_checkpoint": "/content/models/gemma_qlora_lmh/checkpoint-100",5  "epoch": 1.9607843137254903,6  "eval_steps": 20,7  "global_step": 100,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "entropy": 2.652500593662262,14      "epoch": 0.39215686274509803,15      "grad_norm": 28.916894912719727,16      "learning_rate": 8.137254901960784e-06,17      "loss": 0.68,18      "mean_token_accuracy": 0.71015625,19      "num_tokens": 48092.0,20      "step": 2021    },22    {23      "epoch": 0.39215686274509803,24      "eval_entropy": 2.5002221510960507,25      "eval_loss": 0.31822389364242554,26      "eval_mean_token_accuracy": 0.8417832163664011,27      "eval_num_tokens": 48092.0,28      "eval_runtime": 2.4841,29      "eval_samples_per_second": 81.719,30      "eval_steps_per_second": 5.233,31      "step": 2032    },33    {34      "entropy": 2.523895502090454,35      "epoch": 0.7843137254901961,36      "grad_norm": 2.8356525897979736,37      "learning_rate": 6.176470588235295e-06,38      "loss": 0.3528,39      "mean_token_accuracy": 0.79765625,40      "num_tokens": 98284.0,41      "step": 4042    },43    {44      "epoch": 0.7843137254901961,45      "eval_entropy": 2.480310696821946,46      "eval_loss": 0.3085189759731293,47      "eval_mean_token_accuracy": 0.831075173157912,48      "eval_num_tokens": 98284.0,49      "eval_runtime": 2.4982,50      "eval_samples_per_second": 81.258,51      "eval_steps_per_second": 5.204,52      "step": 4053    },54    {55      "entropy": 2.519091600179672,56      "epoch": 1.1764705882352942,57      "grad_norm": 8.396736145019531,58      "learning_rate": 4.215686274509805e-06,59      "loss": 0.2831,60      "mean_token_accuracy": 0.8506696432828903,61      "num_tokens": 147466.0,62      "step": 6063    },64    {65      "epoch": 1.1764705882352942,66      "eval_entropy": 2.4424293774824877,67      "eval_loss": 0.2718758285045624,68      "eval_mean_token_accuracy": 0.8610139855971704,69      "eval_num_tokens": 147466.0,70      "eval_runtime": 2.5004,71      "eval_samples_per_second": 81.187,72      "eval_steps_per_second": 5.199,73      "step": 6074    },75    {76      "entropy": 2.479978394508362,77      "epoch": 1.5686274509803921,78      "grad_norm": 9.535552978515625,79      "learning_rate": 2.254901960784314e-06,80      "loss": 0.2497,81      "mean_token_accuracy": 0.8796875,82      "num_tokens": 197917.0,83      "step": 8084    },85    {86      "epoch": 1.5686274509803921,87      "eval_entropy": 2.43264233149015,88      "eval_loss": 0.2887224853038788,89      "eval_mean_token_accuracy": 0.8634178317510165,90      "eval_num_tokens": 197917.0,91      "eval_runtime": 2.5098,92      "eval_samples_per_second": 80.883,93      "eval_steps_per_second": 5.18,94      "step": 8095    },96    {97      "entropy": 2.4772088170051574,98      "epoch": 1.9607843137254903,99      "grad_norm": 3.218280076980591,100      "learning_rate": 2.9411764705882356e-07,101      "loss": 0.2359,102      "mean_token_accuracy": 0.89140625,103      "num_tokens": 247245.0,104      "step": 100105    },106    {107      "epoch": 1.9607843137254903,108      "eval_entropy": 2.4411074198209324,109      "eval_loss": 0.268216073513031,110      "eval_mean_token_accuracy": 0.8658216779048626,111      "eval_num_tokens": 247245.0,112      "eval_runtime": 2.5076,113      "eval_samples_per_second": 80.953,114      "eval_steps_per_second": 5.184,115      "step": 100116    }117  ],118  "logging_steps": 20,119  "max_steps": 102,120  "num_input_tokens_seen": 0,121  "num_train_epochs": 2,122  "save_steps": 20,123  "stateful_callbacks": {124    "TrainerControl": {125      "args": {126        "should_epoch_stop": false,127        "should_evaluate": false,128        "should_log": false,129        "should_save": true,130        "should_training_stop": false131      },132      "attributes": {}133    }134  },135  "total_flos": 6148418735678976.0,136  "train_batch_size": 16,137  "trial_name": null,138  "trial_params": null139}140