Team Ai
Datasetpublic

kenhktsui/github-code-permissive-sample

Sampling from codeparrot/github-code under more permissive license ['mit', 'apache-2.0', 'bsd-3-clause', 'bsd-2-clause', 'cc0-1.0'].It is intended to be used for training code language classifier.

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes669downloads
README.md37 linesDownload Raw Back to root
1---2dataset_info:3  features:4  - name: code5    dtype: string6  - name: repo_name7    dtype: string8  - name: path9    dtype: string10  - name: language11    dtype: string12  - name: license13    dtype: string14  - name: size15    dtype: int6416  splits:17  - name: train18    num_bytes: 1851472370819    num_examples: 256915620  - name: test21    num_bytes: 465458378522    num_examples: 64227223  download_size: 752758096524  dataset_size: 2316930749325configs:26- config_name: default27  data_files:28  - split: train29    path: data/train-*30  - split: test31    path: data/test-*32task_categories:33- text-classification34---35 36Sampling from [codeparrot/github-code](https://huggingface.co/datasets/codeparrot/github-code) under more permissive license ['mit', 'apache-2.0', 'bsd-3-clause', 'bsd-2-clause', 'cc0-1.0'].  37It is intended to be used for training code language classifier.