ReactiveAI/Beta-Code
Reactive AI / Beta Code Code-based pre-training corpus for RxT-Beta models, created from public & open datasets. Includes code in different programming languages. Subsets are divided into short (< ~1024 tokens) and long (> ~1024 tokens) categories. Original dataset It's created from codeparrot datasets: Python subsets from codeparrot/codeparrot-clean other subsets from codeparrot/github-code-clean
0340
1---2dataset_info:3- config_name: C4 features:5 - name: text6 dtype: string7 splits:8 - name: train9 num_bytes: 77702568610 num_examples: 35000011 download_size: 33435851912 dataset_size: 77702568613- config_name: C#14 features:15 - name: text16 dtype: string17 splits:18 - name: train19 num_bytes: 54823827320 num_examples: 30000021 download_size: 19984662922 dataset_size: 54823827323- config_name: C#-long24 features:25 - name: text26 dtype: string27 splits:28 - name: train29 num_bytes: 206454684230 num_examples: 9606831 download_size: 53046778232 dataset_size: 206454684233- config_name: C++34 features:35 - name: text36 dtype: string37 splits:38 - name: train39 num_bytes: 66070581540 num_examples: 26377241 download_size: 27238217242 dataset_size: 66070581543- config_name: C++-long44 features:45 - name: text46 dtype: string47 splits:48 - name: train49 num_bytes: 486326109850 num_examples: 17279951 download_size: 159979489052 dataset_size: 486326109853- config_name: HTML54 features:55 - name: text56 dtype: string57 splits:58 - name: train59 num_bytes: 54684431160 num_examples: 23071661 download_size: 21076939662 dataset_size: 54684431163- config_name: HTML-long64 features:65 - name: text66 dtype: string67 splits:68 - name: train69 num_bytes: 366561122170 num_examples: 17061771 download_size: 93116365772 dataset_size: 366561122173- config_name: Java74 features:75 - name: text76 dtype: string77 splits:78 - name: train79 num_bytes: 72036013280 num_examples: 32430881 download_size: 26971404482 dataset_size: 72036013283- config_name: Java-long84 features:85 - name: text86 dtype: string87 splits:88 - name: train89 num_bytes: 171453198890 num_examples: 9428391 download_size: 50514324592 dataset_size: 171453198893- config_name: PHP94 features:95 - name: text96 dtype: string97 splits:98 - name: train99 num_bytes: 588157773100 num_examples: 302251101 download_size: 246271459102 dataset_size: 588157773103- config_name: js104 features:105 - name: text106 dtype: string107 splits:108 - name: train109 num_bytes: 815930270110 num_examples: 500000111 download_size: 360395405112 dataset_size: 815930270113- config_name: js-long114 features:115 - name: text116 dtype: string117 splits:118 - name: train119 num_bytes: 398167356120 num_examples: 41492121 download_size: 145648694122 dataset_size: 398167356123- config_name: md124 features:125 - name: text126 dtype: string127 splits:128 - name: train129 num_bytes: 481042012130 num_examples: 400000131 download_size: 271179932132 dataset_size: 481042012133- config_name: md-long134 features:135 - name: text136 dtype: string137 splits:138 - name: train139 num_bytes: 1392553381140 num_examples: 100000141 download_size: 618487776142 dataset_size: 1392553381143- config_name: py144 features:145 - name: text146 dtype: string147 splits:148 - name: train149 num_bytes: 5780780483150 num_examples: 2000000151 download_size: 2522248734152 dataset_size: 5780780483153- config_name: py-long154 features:155 - name: text156 dtype: string157 splits:158 - name: train159 num_bytes: 4825290455160 num_examples: 500000161 download_size: 1825128953162 dataset_size: 4825290455163- config_name: ts164 features:165 - name: text166 dtype: string167 splits:168 - name: train169 num_bytes: 356095260170 num_examples: 237992171 download_size: 148690703172 dataset_size: 356095260173- config_name: ts-long174 features:175 - name: text176 dtype: string177 splits:178 - name: train179 num_bytes: 3698485815180 num_examples: 62200181 download_size: 931446724182 dataset_size: 3698485815183configs:184- config_name: C185 data_files:186 - split: train187 path: C/train-*188- config_name: C#189 data_files:190 - split: train191 path: C#/train-*192- config_name: C#-long193 data_files:194 - split: train195 path: C#-long/train-*196- config_name: C++197 data_files:198 - split: train199 path: C++/train-*200- config_name: C++-long201 data_files:202 - split: train203 path: C++-long/train-*204- config_name: HTML205 data_files:206 - split: train207 path: HTML/train-*208- config_name: HTML-long209 data_files:210 - split: train211 path: HTML-long/train-*212- config_name: Java213 data_files:214 - split: train215 path: Java/train-*216- config_name: Java-long217 data_files:218 - split: train219 path: Java-long/train-*220- config_name: PHP221 data_files:222 - split: train223 path: PHP/train-*224- config_name: js225 data_files:226 - split: train227 path: js/train-*228- config_name: js-long229 data_files:230 - split: train231 path: js-long/train-*232- config_name: md233 data_files:234 - split: train235 path: md/train-*236- config_name: md-long237 data_files:238 - split: train239 path: md-long/train-*240- config_name: py241 data_files:242 - split: train243 path: py/train-*244- config_name: py-long245 data_files:246 - split: train247 path: py-long/train-*248- config_name: ts249 data_files:250 - split: train251 path: ts/train-*252- config_name: ts-long253 data_files:254 - split: train255 path: ts-long/train-*256license: apache-2.0257task_categories:258- text-generation259language:260- en261---262 263# Reactive AI / Beta Code264Code-based pre-training corpus for RxT-Beta models, created from public & open datasets. Includes code in different programming languages.265Subsets are divided into short (< ~1024 tokens) and long (> ~1024 tokens) categories.266 267## Original dataset268It's created from [codeparrot](https://huggingface.co/codeparrot) datasets:269- Python subsets from [codeparrot/codeparrot-clean]([codeparrot/codeparrot-clean](https://huggingface.co/datasets/codeparrot/codeparrot-clean))270- other subsets from [codeparrot/github-code-clean](https://huggingface.co/datasets/codeparrot/github-code-clean)271 272 