LocalResearchGroup/split-avelina-python-edu
0491
1---2dataset_info:3- config_name: 100k4 features:5 - name: blob_id6 dtype: string7 - name: repo_name8 dtype: string9 - name: path10 dtype: string11 - name: length_bytes12 dtype: int6413 - name: score14 dtype: float6415 - name: int_score16 dtype: int6417 - name: text18 dtype: string19 splits:20 - name: train21 num_bytes: 158215278.8148436822 num_examples: 9000023 - name: test24 num_bytes: 17579475.4238715225 num_examples: 1000026 download_size: 8280287727 dataset_size: 175794754.238715228- config_name: 10k29 features:30 - name: blob_id31 dtype: string32 - name: repo_name33 dtype: string34 - name: path35 dtype: string36 - name: length_bytes37 dtype: int6438 - name: score39 dtype: float6440 - name: int_score41 dtype: int6442 - name: text43 dtype: string44 splits:45 - name: train46 num_bytes: 15821527.88148436747 num_examples: 900048 - name: test49 num_bytes: 1757947.54238715250 num_examples: 100051 download_size: 851951452 dataset_size: 17579475.42387151753- config_name: 1M54 features:55 - name: blob_id56 dtype: string57 - name: repo_name58 dtype: string59 - name: path60 dtype: string61 - name: length_bytes62 dtype: int6463 - name: score64 dtype: float6465 - name: int_score66 dtype: int6467 - name: text68 dtype: string69 splits:70 - name: train71 num_bytes: 1582152788.148436872 num_examples: 90000073 - name: test74 num_bytes: 175794754.238715275 num_examples: 10000076 download_size: 82634757377 dataset_size: 1757947542.38715278- config_name: 1k79 features:80 - name: blob_id81 dtype: string82 - name: repo_name83 dtype: string84 - name: path85 dtype: string86 - name: length_bytes87 dtype: int6488 - name: score89 dtype: float6490 - name: int_score91 dtype: int6492 - name: text93 dtype: string94 splits:95 - name: train96 num_bytes: 1582152.788148436797 num_examples: 90098 - name: test99 num_bytes: 175794.7542387152100 num_examples: 100101 download_size: 830939102 dataset_size: 1757947.5423871519103- config_name: full104 features:105 - name: blob_id106 dtype: string107 - name: repo_name108 dtype: string109 - name: path110 dtype: string111 - name: length_bytes112 dtype: int64113 - name: score114 dtype: float64115 - name: int_score116 dtype: int64117 - name: text118 dtype: string119 splits:120 - name: train121 num_bytes: 12148475802.315737122 num_examples: 6910602123 - name: test124 num_bytes: 1349831230.6842628125 num_examples: 767845126 download_size: 6343241345127 dataset_size: 13498307033.0128configs:129- config_name: 100k130 data_files:131 - split: train132 path: 100k/train-*133 - split: test134 path: 100k/test-*135- config_name: 10k136 data_files:137 - split: train138 path: 10k/train-*139 - split: test140 path: 10k/test-*141- config_name: 1M142 data_files:143 - split: train144 path: 1M/train-*145 - split: test146 path: 1M/test-*147- config_name: 1k148 data_files:149 - split: train150 path: 1k/train-*151 - split: test152 path: 1k/test-*153- config_name: full154 data_files:155 - split: train156 path: full/train-*157 - split: test158 path: full/test-*159---160 