Team Ai
Datasetpublic

ReactiveAI/Beta-Code

Reactive AI / Beta Code Code-based pre-training corpus for RxT-Beta models, created from public & open datasets. Includes code in different programming languages. Subsets are divided into short (< ~1024 tokens) and long (> ~1024 tokens) categories. Original dataset It's created from codeparrot datasets: Python subsets from codeparrot/codeparrot-clean other subsets from codeparrot/github-code-clean

sourceHugging Faceapache-2.0updated 10mo agoView on Hugging Face
0likes340downloads
README.md272 linesDownload Raw Back to root
1---2dataset_info:3- config_name: C4  features:5  - name: text6    dtype: string7  splits:8  - name: train9    num_bytes: 77702568610    num_examples: 35000011  download_size: 33435851912  dataset_size: 77702568613- config_name: C#14  features:15  - name: text16    dtype: string17  splits:18  - name: train19    num_bytes: 54823827320    num_examples: 30000021  download_size: 19984662922  dataset_size: 54823827323- config_name: C#-long24  features:25  - name: text26    dtype: string27  splits:28  - name: train29    num_bytes: 206454684230    num_examples: 9606831  download_size: 53046778232  dataset_size: 206454684233- config_name: C++34  features:35  - name: text36    dtype: string37  splits:38  - name: train39    num_bytes: 66070581540    num_examples: 26377241  download_size: 27238217242  dataset_size: 66070581543- config_name: C++-long44  features:45  - name: text46    dtype: string47  splits:48  - name: train49    num_bytes: 486326109850    num_examples: 17279951  download_size: 159979489052  dataset_size: 486326109853- config_name: HTML54  features:55  - name: text56    dtype: string57  splits:58  - name: train59    num_bytes: 54684431160    num_examples: 23071661  download_size: 21076939662  dataset_size: 54684431163- config_name: HTML-long64  features:65  - name: text66    dtype: string67  splits:68  - name: train69    num_bytes: 366561122170    num_examples: 17061771  download_size: 93116365772  dataset_size: 366561122173- config_name: Java74  features:75  - name: text76    dtype: string77  splits:78  - name: train79    num_bytes: 72036013280    num_examples: 32430881  download_size: 26971404482  dataset_size: 72036013283- config_name: Java-long84  features:85  - name: text86    dtype: string87  splits:88  - name: train89    num_bytes: 171453198890    num_examples: 9428391  download_size: 50514324592  dataset_size: 171453198893- config_name: PHP94  features:95  - name: text96    dtype: string97  splits:98  - name: train99    num_bytes: 588157773100    num_examples: 302251101  download_size: 246271459102  dataset_size: 588157773103- config_name: js104  features:105  - name: text106    dtype: string107  splits:108  - name: train109    num_bytes: 815930270110    num_examples: 500000111  download_size: 360395405112  dataset_size: 815930270113- config_name: js-long114  features:115  - name: text116    dtype: string117  splits:118  - name: train119    num_bytes: 398167356120    num_examples: 41492121  download_size: 145648694122  dataset_size: 398167356123- config_name: md124  features:125  - name: text126    dtype: string127  splits:128  - name: train129    num_bytes: 481042012130    num_examples: 400000131  download_size: 271179932132  dataset_size: 481042012133- config_name: md-long134  features:135  - name: text136    dtype: string137  splits:138  - name: train139    num_bytes: 1392553381140    num_examples: 100000141  download_size: 618487776142  dataset_size: 1392553381143- config_name: py144  features:145  - name: text146    dtype: string147  splits:148  - name: train149    num_bytes: 5780780483150    num_examples: 2000000151  download_size: 2522248734152  dataset_size: 5780780483153- config_name: py-long154  features:155  - name: text156    dtype: string157  splits:158  - name: train159    num_bytes: 4825290455160    num_examples: 500000161  download_size: 1825128953162  dataset_size: 4825290455163- config_name: ts164  features:165  - name: text166    dtype: string167  splits:168  - name: train169    num_bytes: 356095260170    num_examples: 237992171  download_size: 148690703172  dataset_size: 356095260173- config_name: ts-long174  features:175  - name: text176    dtype: string177  splits:178  - name: train179    num_bytes: 3698485815180    num_examples: 62200181  download_size: 931446724182  dataset_size: 3698485815183configs:184- config_name: C185  data_files:186  - split: train187    path: C/train-*188- config_name: C#189  data_files:190  - split: train191    path: C#/train-*192- config_name: C#-long193  data_files:194  - split: train195    path: C#-long/train-*196- config_name: C++197  data_files:198  - split: train199    path: C++/train-*200- config_name: C++-long201  data_files:202  - split: train203    path: C++-long/train-*204- config_name: HTML205  data_files:206  - split: train207    path: HTML/train-*208- config_name: HTML-long209  data_files:210  - split: train211    path: HTML-long/train-*212- config_name: Java213  data_files:214  - split: train215    path: Java/train-*216- config_name: Java-long217  data_files:218  - split: train219    path: Java-long/train-*220- config_name: PHP221  data_files:222  - split: train223    path: PHP/train-*224- config_name: js225  data_files:226  - split: train227    path: js/train-*228- config_name: js-long229  data_files:230  - split: train231    path: js-long/train-*232- config_name: md233  data_files:234  - split: train235    path: md/train-*236- config_name: md-long237  data_files:238  - split: train239    path: md-long/train-*240- config_name: py241  data_files:242  - split: train243    path: py/train-*244- config_name: py-long245  data_files:246  - split: train247    path: py-long/train-*248- config_name: ts249  data_files:250  - split: train251    path: ts/train-*252- config_name: ts-long253  data_files:254  - split: train255    path: ts-long/train-*256license: apache-2.0257task_categories:258- text-generation259language:260- en261---262 263# Reactive AI / Beta Code264Code-based pre-training corpus for RxT-Beta models, created from public & open datasets. Includes code in different programming languages.265Subsets are divided into short (< ~1024 tokens) and long (> ~1024 tokens) categories.266 267## Original dataset268It's created from [codeparrot](https://huggingface.co/codeparrot) datasets:269- Python subsets from [codeparrot/codeparrot-clean]([codeparrot/codeparrot-clean](https://huggingface.co/datasets/codeparrot/codeparrot-clean))270- other subsets from [codeparrot/github-code-clean](https://huggingface.co/datasets/codeparrot/github-code-clean)271 272