hf-tiny-model-private/tiny-random-EncoderDecoderModel-bert-bert
014
1{2 "_commit_hash": null,3 "_name_or_path": "tiny_models/encoder-decoder/EncoderDecoderModel-bert-bert",4 "architectures": [5 "EncoderDecoderModel"6 ],7 "decoder": {8 "_name_or_path": "/tmp/tmp7gigxcld/decoder/BertLMHeadModel",9 "add_cross_attention": true,10 "architectures": [11 "BertLMHeadModel"12 ],13 "attention_probs_dropout_prob": 0.1,14 "bad_words_ids": null,15 "begin_suppress_tokens": null,16 "bos_token_id": null,17 "chunk_size_feed_forward": 0,18 "classifier_dropout": null,19 "cross_attention_hidden_size": null,20 "decoder_start_token_id": null,21 "diversity_penalty": 0.0,22 "do_sample": false,23 "early_stopping": false,24 "encoder_no_repeat_ngram_size": 0,25 "eos_token_id": null,26 "exponential_decay_length_penalty": null,27 "finetuning_task": null,28 "forced_bos_token_id": null,29 "forced_eos_token_id": null,30 "hidden_act": "gelu",31 "hidden_dropout_prob": 0.1,32 "hidden_size": 32,33 "id2label": {34 "0": "LABEL_0",35 "1": "LABEL_1"36 },37 "initializer_range": 0.02,38 "intermediate_size": 37,39 "is_decoder": true,40 "is_encoder_decoder": false,41 "label2id": {42 "LABEL_0": 0,43 "LABEL_1": 144 },45 "layer_norm_eps": 1e-12,46 "length_penalty": 1.0,47 "max_length": 20,48 "max_position_embeddings": 512,49 "min_length": 0,50 "model_type": "bert",51 "no_repeat_ngram_size": 0,52 "num_attention_heads": 4,53 "num_beam_groups": 1,54 "num_beams": 1,55 "num_hidden_layers": 5,56 "num_return_sequences": 1,57 "output_attentions": false,58 "output_hidden_states": false,59 "output_scores": false,60 "pad_token_id": 0,61 "position_embedding_type": "absolute",62 "prefix": null,63 "problem_type": null,64 "pruned_heads": {},65 "remove_invalid_values": false,66 "repetition_penalty": 1.0,67 "return_dict": true,68 "return_dict_in_generate": false,69 "sep_token_id": null,70 "suppress_tokens": null,71 "task_specific_params": null,72 "temperature": 1.0,73 "tf_legacy_loss": false,74 "tie_encoder_decoder": false,75 "tie_word_embeddings": true,76 "tokenizer_class": null,77 "top_k": 50,78 "top_p": 1.0,79 "torch_dtype": "float32",80 "torchscript": false,81 "transformers_version": "4.28.0.dev0",82 "type_vocab_size": 16,83 "typical_p": 1.0,84 "use_bfloat16": false,85 "use_cache": true,86 "vocab_size": 112487 },88 "encoder": {89 "_name_or_path": "/tmp/tmp7gigxcld/encoder/BertModel",90 "add_cross_attention": false,91 "architectures": [92 "BertModel"93 ],94 "attention_probs_dropout_prob": 0.1,95 "bad_words_ids": null,96 "begin_suppress_tokens": null,97 "bos_token_id": null,98 "chunk_size_feed_forward": 0,99 "classifier_dropout": null,100 "cross_attention_hidden_size": null,101 "decoder_start_token_id": null,102 "diversity_penalty": 0.0,103 "do_sample": false,104 "early_stopping": false,105 "encoder_no_repeat_ngram_size": 0,106 "eos_token_id": null,107 "exponential_decay_length_penalty": null,108 "finetuning_task": null,109 "forced_bos_token_id": null,110 "forced_eos_token_id": null,111 "hidden_act": "gelu",112 "hidden_dropout_prob": 0.1,113 "hidden_size": 32,114 "id2label": {115 "0": "LABEL_0",116 "1": "LABEL_1"117 },118 "initializer_range": 0.02,119 "intermediate_size": 37,120 "is_decoder": false,121 "is_encoder_decoder": false,122 "label2id": {123 "LABEL_0": 0,124 "LABEL_1": 1125 },126 "layer_norm_eps": 1e-12,127 "length_penalty": 1.0,128 "max_length": 20,129 "max_position_embeddings": 512,130 "min_length": 0,131 "model_type": "bert",132 "no_repeat_ngram_size": 0,133 "num_attention_heads": 4,134 "num_beam_groups": 1,135 "num_beams": 1,136 "num_hidden_layers": 5,137 "num_return_sequences": 1,138 "output_attentions": false,139 "output_hidden_states": false,140 "output_scores": false,141 "pad_token_id": 0,142 "position_embedding_type": "absolute",143 "prefix": null,144 "problem_type": null,145 "pruned_heads": {},146 "remove_invalid_values": false,147 "repetition_penalty": 1.0,148 "return_dict": true,149 "return_dict_in_generate": false,150 "sep_token_id": null,151 "suppress_tokens": null,152 "task_specific_params": null,153 "temperature": 1.0,154 "tf_legacy_loss": false,155 "tie_encoder_decoder": false,156 "tie_word_embeddings": true,157 "tokenizer_class": null,158 "top_k": 50,159 "top_p": 1.0,160 "torch_dtype": "float32",161 "torchscript": false,162 "transformers_version": "4.28.0.dev0",163 "type_vocab_size": 16,164 "typical_p": 1.0,165 "use_bfloat16": false,166 "use_cache": true,167 "vocab_size": 1124168 },169 "is_encoder_decoder": true,170 "model_type": "encoder-decoder",171 "torch_dtype": "float32",172 "transformers_version": null173}174 