aieng-lab/bert-large-cased_comment-type-java
020
1{2 "_name_or_path": "bert-large-cased",3 "architectures": [4 "BertForSequenceClassification"5 ],6 "attention_probs_dropout_prob": 0.1,7 "classifier_dropout": null,8 "directionality": "bidi",9 "gradient_checkpointing": false,10 "hidden_act": "gelu",11 "hidden_dropout_prob": 0.1,12 "hidden_size": 1024,13 "id2label": {14 "0": "LABEL_0",15 "1": "LABEL_1",16 "2": "LABEL_2",17 "3": "LABEL_3",18 "4": "LABEL_4",19 "5": "LABEL_5",20 "6": "LABEL_6"21 },22 "initializer_range": 0.02,23 "intermediate_size": 4096,24 "label2id": {25 "LABEL_0": 0,26 "LABEL_1": 1,27 "LABEL_2": 2,28 "LABEL_3": 3,29 "LABEL_4": 4,30 "LABEL_5": 5,31 "LABEL_6": 632 },33 "layer_norm_eps": 1e-12,34 "max_position_embeddings": 512,35 "model_type": "bert",36 "num_attention_heads": 16,37 "num_hidden_layers": 24,38 "pad_token_id": 0,39 "pooler_fc_size": 768,40 "pooler_num_attention_heads": 12,41 "pooler_num_fc_layers": 3,42 "pooler_size_per_head": 128,43 "pooler_type": "first_token_transform",44 "position_embedding_type": "absolute",45 "problem_type": "multi_label_classification",46 "torch_dtype": "bfloat16",47 "transformers_version": "4.48.3",48 "type_vocab_size": 2,49 "use_cache": true,50 "vocab_size": 2899651}52 