Team Ai
Modelpublic

LARK-Lab/CodeScaler-8B

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes4.3kdownloads
config.json76 linesDownload Raw Back to root
1{2  "architectures": [3    "Qwen3ForSequenceClassification"4  ],5  "attention_bias": false,6  "attention_dropout": 0.0,7  "bos_token_id": 151643,8  "dtype": "bfloat16",9  "eos_token_id": 151645,10  "head_dim": 128,11  "hidden_act": "silu",12  "hidden_size": 4096,13  "id2label": {14    "0": "LABEL_0"15  },16  "initializer_range": 0.02,17  "intermediate_size": 12288,18  "label2id": {19    "LABEL_0": 020  },21  "layer_types": [22    "full_attention",23    "full_attention",24    "full_attention",25    "full_attention",26    "full_attention",27    "full_attention",28    "full_attention",29    "full_attention",30    "full_attention",31    "full_attention",32    "full_attention",33    "full_attention",34    "full_attention",35    "full_attention",36    "full_attention",37    "full_attention",38    "full_attention",39    "full_attention",40    "full_attention",41    "full_attention",42    "full_attention",43    "full_attention",44    "full_attention",45    "full_attention",46    "full_attention",47    "full_attention",48    "full_attention",49    "full_attention",50    "full_attention",51    "full_attention",52    "full_attention",53    "full_attention",54    "full_attention",55    "full_attention",56    "full_attention",57    "full_attention"58  ],59  "max_position_embeddings": 40960,60  "max_window_layers": 36,61  "model_type": "qwen3",62  "num_attention_heads": 32,63  "num_hidden_layers": 36,64  "num_key_value_heads": 8,65  "pad_token_id": 151654,66  "rms_norm_eps": 1e-06,67  "rope_scaling": null,68  "rope_theta": 1000000,69  "sliding_window": null,70  "tie_word_embeddings": false,71  "transformers_version": "4.57.1",72  "use_cache": false,73  "use_sliding_window": false,74  "vocab_size": 15193675}76