skymizer/common_starcoder
Common Starcoder dataset This dataset is generated from bigcode/starcoderdata. Total GPT2 Tokens: 4,649,163,171 Generation Process We filtered the original dataset with common language: C, Cpp, Java, Python and JSON. We removed some columns for mixing up with other dataset: "id", "max_stars_repo_path", "max_stars_repo_name" After removing the irrelevant fields, we shuffle the dataset with random seed=42. We filtered the data on "max_stars_count" > 300 and shuffle… See the full description on the dataset page: https://huggingface.co/datasets/skymizer/common_starcoder.
1266
../
train-00000-of-00022.parquetdownload
train-00001-of-00022.parquetdownload
train-00002-of-00022.parquetdownload
train-00003-of-00022.parquetdownload
train-00004-of-00022.parquetdownload
train-00005-of-00022.parquetdownload
train-00006-of-00022.parquetdownload
train-00007-of-00022.parquetdownload
train-00008-of-00022.parquetdownload
train-00009-of-00022.parquetdownload
train-00010-of-00022.parquetdownload
train-00011-of-00022.parquetdownload
train-00012-of-00022.parquetdownload
train-00013-of-00022.parquetdownload
train-00014-of-00022.parquetdownload
train-00015-of-00022.parquetdownload
train-00016-of-00022.parquetdownload
train-00017-of-00022.parquetdownload
train-00018-of-00022.parquetdownload
train-00019-of-00022.parquetdownload
train-00020-of-00022.parquetdownload
train-00021-of-00022.parquetdownload
