Team Ai
Datasetpublic

bigcode/programming-languages-keywords

Dataset Card for "programming-languages-keywords" Structured version of https://github.com/e3b0c442/keywords Generated using: r = requests.get("https://raw.githubusercontent.com/e3b0c442/keywords/main/README.md") keywords = r.text.split("### ")[1:] keywords = [i for i in keywords if not i.startswith("Sources")] keywords = {i.split("\n")[0]:[j for j in re.findall("[a-zA-Z]*", i.split("\n",1)[1]) if j] for i in keywords} keywords =… See the full description on the dataset page: https://huggingface.co/datasets/bigcode/programming-languages-keywords.

sourceHugging Faceupdated 4y agoView on Hugging Face
7likes34downloads
README.md29 linesDownload Raw Back to root
1---2dataset_info:3  features:4  - name: language5    dtype: string6  - name: keywords7    sequence: string8  splits:9  - name: train10    num_bytes: 2030711    num_examples: 3612  download_size: 883813  dataset_size: 2030714---15# Dataset Card for "programming-languages-keywords"16 17Structured version of https://github.com/e3b0c442/keywords18 19Generated using:20```python21r = requests.get("https://raw.githubusercontent.com/e3b0c442/keywords/main/README.md")22keywords = r.text.split("### ")[1:]23keywords = [i for i in keywords if not i.startswith("Sources")]24keywords = {i.split("\n")[0]:[j for j in re.findall("[a-zA-Z]*", i.split("\n",1)[1]) if j] for i in keywords}25keywords = pd.DataFrame(pd.Series(keywords)).reset_index().rename(columns={"index":"language", 0:"keywords"})26keywords['language'] = keywords['language'].str.split("\) ").str[0]27keywords['keywords'] = keywords['keywords'].apply(lambda x: sorted(list(set(x))))28ds = Dataset.from_pandas(keywords)29```