Team Ai
Datasetpublic

LocalResearchGroup/split-avelina-python-edu

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes491downloads
README.md160 linesDownload Raw Back to root
1---2dataset_info:3- config_name: 100k4  features:5  - name: blob_id6    dtype: string7  - name: repo_name8    dtype: string9  - name: path10    dtype: string11  - name: length_bytes12    dtype: int6413  - name: score14    dtype: float6415  - name: int_score16    dtype: int6417  - name: text18    dtype: string19  splits:20  - name: train21    num_bytes: 158215278.8148436822    num_examples: 9000023  - name: test24    num_bytes: 17579475.4238715225    num_examples: 1000026  download_size: 8280287727  dataset_size: 175794754.238715228- config_name: 10k29  features:30  - name: blob_id31    dtype: string32  - name: repo_name33    dtype: string34  - name: path35    dtype: string36  - name: length_bytes37    dtype: int6438  - name: score39    dtype: float6440  - name: int_score41    dtype: int6442  - name: text43    dtype: string44  splits:45  - name: train46    num_bytes: 15821527.88148436747    num_examples: 900048  - name: test49    num_bytes: 1757947.54238715250    num_examples: 100051  download_size: 851951452  dataset_size: 17579475.42387151753- config_name: 1M54  features:55  - name: blob_id56    dtype: string57  - name: repo_name58    dtype: string59  - name: path60    dtype: string61  - name: length_bytes62    dtype: int6463  - name: score64    dtype: float6465  - name: int_score66    dtype: int6467  - name: text68    dtype: string69  splits:70  - name: train71    num_bytes: 1582152788.148436872    num_examples: 90000073  - name: test74    num_bytes: 175794754.238715275    num_examples: 10000076  download_size: 82634757377  dataset_size: 1757947542.38715278- config_name: 1k79  features:80  - name: blob_id81    dtype: string82  - name: repo_name83    dtype: string84  - name: path85    dtype: string86  - name: length_bytes87    dtype: int6488  - name: score89    dtype: float6490  - name: int_score91    dtype: int6492  - name: text93    dtype: string94  splits:95  - name: train96    num_bytes: 1582152.788148436797    num_examples: 90098  - name: test99    num_bytes: 175794.7542387152100    num_examples: 100101  download_size: 830939102  dataset_size: 1757947.5423871519103- config_name: full104  features:105  - name: blob_id106    dtype: string107  - name: repo_name108    dtype: string109  - name: path110    dtype: string111  - name: length_bytes112    dtype: int64113  - name: score114    dtype: float64115  - name: int_score116    dtype: int64117  - name: text118    dtype: string119  splits:120  - name: train121    num_bytes: 12148475802.315737122    num_examples: 6910602123  - name: test124    num_bytes: 1349831230.6842628125    num_examples: 767845126  download_size: 6343241345127  dataset_size: 13498307033.0128configs:129- config_name: 100k130  data_files:131  - split: train132    path: 100k/train-*133  - split: test134    path: 100k/test-*135- config_name: 10k136  data_files:137  - split: train138    path: 10k/train-*139  - split: test140    path: 10k/test-*141- config_name: 1M142  data_files:143  - split: train144    path: 1M/train-*145  - split: test146    path: 1M/test-*147- config_name: 1k148  data_files:149  - split: train150    path: 1k/train-*151  - split: test152    path: 1k/test-*153- config_name: full154  data_files:155  - split: train156    path: full/train-*157  - split: test158    path: full/test-*159---160