Team Ai
Datasetpublic

malteklaes/cpp-code-code_search_net-style

C++ Dataset documentation source: https://huggingface.co/docs/datasets/main/en/repository_structure Supported Tasks and Leaderboards language-modeling: The dataset can be used to train a model for modelling programming languages, which consists in building language models for programming languages. Language C++ programming language Dataset Structure Data Instances A data point consists of a function code along… See the full description on the dataset page: https://huggingface.co/datasets/malteklaes/cpp-code-code_search_net-style.

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
1likes196downloads
README.md103 linesDownload Raw Back to cpp_dataset
1---2license: apache-2.03task_categories:4- text-generation5- fill-mask6language:7- code8size_categories:9- 1K<n<10K10dataset_info:11- config_name: cpp12  features:13  - name: func_code_string14    dtype: string15  splits:16  - name: train17    num_bytes: 018    num_examples: 5000019  - name: test20    num_bytes: 021    num_examples: 1000022  - name: validation23    num_bytes: 024    num_examples: 1000025  download_size: 026  dataset_size: 027- config_name: cpp28  features:29  - name: func_code_string30    dtype: string31  splits:32  - name: train33    num_bytes: 142927253534    num_examples: 45445135  - name: test36    num_bytes: 8237724637    num_examples: 2690938  - name: validation39    num_bytes: 4235831540    num_examples: 1532841  download_size: 106056915342  dataset_size: 155400809643configs:44- config_name: default45  data_files:46  - split: train47    path: "cpp_dataset/train/train.jsonl"48  - split: test49    path: "cpp_dataset/test/test.jsonl"50  - split: validation51    path: "cpp_dataset/validation/validation.jsonl" 52---53 54# C++ Dataset55> documentation source: https://huggingface.co/docs/datasets/main/en/repository_structure56 57 58 59### Supported Tasks and Leaderboards60 61- `language-modeling`: The dataset can be used to train a model for modelling programming languages, which consists in building language models for programming languages.62 63### Language64 65- C++ **programming** language66 67  68 69 70## Dataset Structure71 72### Data Instances73 74A data point consists of a function code along with its documentation. Each data point also contains meta data on the function, such as the repository it was extracted from.75```76{77  'id': '0',78  'func_code_string': 'organisation/repository'79}80```81 82### Data Fields83 84- `id`: Arbitrary number85- `func_code_string`: actual code line (each line is a whole C++ program)86 87### Data Splits88 89Three splits are available as `.jsonl`:90- train (50000 lines)91- test (10000 lines)92- valid (10000 lines)93 94### Citation Information95 96- based on this dataset source: https://huggingface.co/datasets/nguyentruong-ins/codeforces_cpp_cleaned/tree/main/data97- based on format and idea: https://huggingface.co/datasets/code_search_net98- expanded by99@article{husain2019codesearchnet,100  title={C++ Dataset},101  author={Klaes, Malte},102  year={2024}103}