ApolloRaines commited on
Commit
07f31ad
·
verified ·
1 Parent(s): 676c670

Upload config.json with huggingface_hub

Browse files
Files changed (1) hide show
  1. config.json +248 -0
config.json ADDED
@@ -0,0 +1,248 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3_5ForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "attn_output_gate": true,
8
+ "bos_token_id": 248044,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 248044,
11
+ "full_attention_interval": 4,
12
+ "head_dim": 256,
13
+ "hidden_act": "silu",
14
+ "hidden_size": 5120,
15
+ "initializer_range": 0.02,
16
+ "intermediate_size": 17408,
17
+ "layer_types": [
18
+ "linear_attention",
19
+ "linear_attention",
20
+ "linear_attention",
21
+ "full_attention",
22
+ "linear_attention",
23
+ "linear_attention",
24
+ "linear_attention",
25
+ "full_attention",
26
+ "linear_attention",
27
+ "linear_attention",
28
+ "linear_attention",
29
+ "full_attention",
30
+ "linear_attention",
31
+ "linear_attention",
32
+ "linear_attention",
33
+ "full_attention",
34
+ "linear_attention",
35
+ "linear_attention",
36
+ "linear_attention",
37
+ "full_attention",
38
+ "linear_attention",
39
+ "linear_attention",
40
+ "linear_attention",
41
+ "full_attention",
42
+ "linear_attention",
43
+ "linear_attention",
44
+ "linear_attention",
45
+ "full_attention",
46
+ "linear_attention",
47
+ "linear_attention",
48
+ "linear_attention",
49
+ "full_attention",
50
+ "linear_attention",
51
+ "linear_attention",
52
+ "linear_attention",
53
+ "full_attention",
54
+ "linear_attention",
55
+ "linear_attention",
56
+ "linear_attention",
57
+ "full_attention",
58
+ "linear_attention",
59
+ "linear_attention",
60
+ "linear_attention",
61
+ "full_attention",
62
+ "linear_attention",
63
+ "linear_attention",
64
+ "linear_attention",
65
+ "full_attention",
66
+ "linear_attention",
67
+ "linear_attention",
68
+ "linear_attention",
69
+ "full_attention",
70
+ "linear_attention",
71
+ "linear_attention",
72
+ "linear_attention",
73
+ "full_attention",
74
+ "linear_attention",
75
+ "linear_attention",
76
+ "linear_attention",
77
+ "full_attention",
78
+ "linear_attention",
79
+ "linear_attention",
80
+ "linear_attention",
81
+ "full_attention"
82
+ ],
83
+ "linear_conv_kernel_dim": 4,
84
+ "linear_key_head_dim": 128,
85
+ "linear_num_key_heads": 16,
86
+ "linear_num_value_heads": 48,
87
+ "linear_value_head_dim": 128,
88
+ "mamba_ssm_dtype": "float32",
89
+ "max_position_embeddings": 262144,
90
+ "model_type": "qwen3_5_text",
91
+ "mtp_num_hidden_layers": 1,
92
+ "mtp_use_dedicated_embeddings": false,
93
+ "num_attention_heads": 24,
94
+ "num_hidden_layers": 64,
95
+ "num_key_value_heads": 4,
96
+ "output_gate_type": "swish",
97
+ "pad_token_id": null,
98
+ "partial_rotary_factor": 0.25,
99
+ "quantization_config": {
100
+ "config_groups": {
101
+ "group_0": {
102
+ "format": "pack-quantized",
103
+ "input_activations": null,
104
+ "output_activations": null,
105
+ "targets": [
106
+ "Linear"
107
+ ],
108
+ "weights": {
109
+ "actorder": "static",
110
+ "block_structure": null,
111
+ "dynamic": false,
112
+ "group_size": 128,
113
+ "num_bits": 4,
114
+ "observer": "memoryless_minmax",
115
+ "observer_kwargs": {},
116
+ "scale_dtype": null,
117
+ "strategy": "group",
118
+ "symmetric": true,
119
+ "type": "int",
120
+ "zp_dtype": null
121
+ }
122
+ }
123
+ },
124
+ "format": "pack-quantized",
125
+ "global_compression_ratio": null,
126
+ "ignore": [
127
+ "model.language_model.layers.0.linear_attn",
128
+ "model.language_model.layers.0.linear_attn.norm",
129
+ "model.language_model.layers.1.linear_attn",
130
+ "model.language_model.layers.1.linear_attn.norm",
131
+ "model.language_model.layers.2.linear_attn",
132
+ "model.language_model.layers.2.linear_attn.norm",
133
+ "model.language_model.layers.4.linear_attn",
134
+ "model.language_model.layers.4.linear_attn.norm",
135
+ "model.language_model.layers.5.linear_attn",
136
+ "model.language_model.layers.5.linear_attn.norm",
137
+ "model.language_model.layers.6.linear_attn",
138
+ "model.language_model.layers.6.linear_attn.norm",
139
+ "model.language_model.layers.8.linear_attn",
140
+ "model.language_model.layers.8.linear_attn.norm",
141
+ "model.language_model.layers.9.linear_attn",
142
+ "model.language_model.layers.9.linear_attn.norm",
143
+ "model.language_model.layers.10.linear_attn",
144
+ "model.language_model.layers.10.linear_attn.norm",
145
+ "model.language_model.layers.12.linear_attn",
146
+ "model.language_model.layers.12.linear_attn.norm",
147
+ "model.language_model.layers.13.linear_attn",
148
+ "model.language_model.layers.13.linear_attn.norm",
149
+ "model.language_model.layers.14.linear_attn",
150
+ "model.language_model.layers.14.linear_attn.norm",
151
+ "model.language_model.layers.16.linear_attn",
152
+ "model.language_model.layers.16.linear_attn.norm",
153
+ "model.language_model.layers.17.linear_attn",
154
+ "model.language_model.layers.17.linear_attn.norm",
155
+ "model.language_model.layers.18.linear_attn",
156
+ "model.language_model.layers.18.linear_attn.norm",
157
+ "model.language_model.layers.20.linear_attn",
158
+ "model.language_model.layers.20.linear_attn.norm",
159
+ "model.language_model.layers.21.linear_attn",
160
+ "model.language_model.layers.21.linear_attn.norm",
161
+ "model.language_model.layers.22.linear_attn",
162
+ "model.language_model.layers.22.linear_attn.norm",
163
+ "model.language_model.layers.24.linear_attn",
164
+ "model.language_model.layers.24.linear_attn.norm",
165
+ "model.language_model.layers.25.linear_attn",
166
+ "model.language_model.layers.25.linear_attn.norm",
167
+ "model.language_model.layers.26.linear_attn",
168
+ "model.language_model.layers.26.linear_attn.norm",
169
+ "model.language_model.layers.28.linear_attn",
170
+ "model.language_model.layers.28.linear_attn.norm",
171
+ "model.language_model.layers.29.linear_attn",
172
+ "model.language_model.layers.29.linear_attn.norm",
173
+ "model.language_model.layers.30.linear_attn",
174
+ "model.language_model.layers.30.linear_attn.norm",
175
+ "model.language_model.layers.32.linear_attn",
176
+ "model.language_model.layers.32.linear_attn.norm",
177
+ "model.language_model.layers.33.linear_attn",
178
+ "model.language_model.layers.33.linear_attn.norm",
179
+ "model.language_model.layers.34.linear_attn",
180
+ "model.language_model.layers.34.linear_attn.norm",
181
+ "model.language_model.layers.36.linear_attn",
182
+ "model.language_model.layers.36.linear_attn.norm",
183
+ "model.language_model.layers.37.linear_attn",
184
+ "model.language_model.layers.37.linear_attn.norm",
185
+ "model.language_model.layers.38.linear_attn",
186
+ "model.language_model.layers.38.linear_attn.norm",
187
+ "model.language_model.layers.40.linear_attn",
188
+ "model.language_model.layers.40.linear_attn.norm",
189
+ "model.language_model.layers.41.linear_attn",
190
+ "model.language_model.layers.41.linear_attn.norm",
191
+ "model.language_model.layers.42.linear_attn",
192
+ "model.language_model.layers.42.linear_attn.norm",
193
+ "model.language_model.layers.44.linear_attn",
194
+ "model.language_model.layers.44.linear_attn.norm",
195
+ "model.language_model.layers.45.linear_attn",
196
+ "model.language_model.layers.45.linear_attn.norm",
197
+ "model.language_model.layers.46.linear_attn",
198
+ "model.language_model.layers.46.linear_attn.norm",
199
+ "model.language_model.layers.48.linear_attn",
200
+ "model.language_model.layers.48.linear_attn.norm",
201
+ "model.language_model.layers.49.linear_attn",
202
+ "model.language_model.layers.49.linear_attn.norm",
203
+ "model.language_model.layers.50.linear_attn",
204
+ "model.language_model.layers.50.linear_attn.norm",
205
+ "model.language_model.layers.52.linear_attn",
206
+ "model.language_model.layers.52.linear_attn.norm",
207
+ "model.language_model.layers.53.linear_attn",
208
+ "model.language_model.layers.53.linear_attn.norm",
209
+ "model.language_model.layers.54.linear_attn",
210
+ "model.language_model.layers.54.linear_attn.norm",
211
+ "model.language_model.layers.56.linear_attn",
212
+ "model.language_model.layers.56.linear_attn.norm",
213
+ "model.language_model.layers.57.linear_attn",
214
+ "model.language_model.layers.57.linear_attn.norm",
215
+ "model.language_model.layers.58.linear_attn",
216
+ "model.language_model.layers.58.linear_attn.norm",
217
+ "model.language_model.layers.60.linear_attn",
218
+ "model.language_model.layers.60.linear_attn.norm",
219
+ "model.language_model.layers.61.linear_attn",
220
+ "model.language_model.layers.61.linear_attn.norm",
221
+ "model.language_model.layers.62.linear_attn",
222
+ "model.language_model.layers.62.linear_attn.norm",
223
+ "lm_head"
224
+ ],
225
+ "kv_cache_scheme": null,
226
+ "quant_method": "compressed-tensors",
227
+ "quantization_status": "compressed",
228
+ "sparsity_config": {},
229
+ "transform_config": {},
230
+ "version": "0.18.0"
231
+ },
232
+ "rms_norm_eps": 1e-06,
233
+ "rope_parameters": {
234
+ "mrope_interleaved": true,
235
+ "mrope_section": [
236
+ 11,
237
+ 11,
238
+ 10
239
+ ],
240
+ "partial_rotary_factor": 0.25,
241
+ "rope_theta": 10000000,
242
+ "rope_type": "default"
243
+ },
244
+ "tie_word_embeddings": false,
245
+ "transformers_version": "5.14.1",
246
+ "use_cache": true,
247
+ "vocab_size": 248320
248
+ }