bigcode/programming-languages-keywords
Dataset Card for "programming-languages-keywords" Structured version of https://github.com/e3b0c442/keywords Generated using: r = requests.get("https://raw.githubusercontent.com/e3b0c442/keywords/main/README.md") keywords = r.text.split("### ")[1:] keywords = [i for i in keywords if not i.startswith("Sources")] keywords = {i.split("\n")[0]:[j for j in re.findall("[a-zA-Z]*", i.split("\n",1)[1]) if j] for i in keywords} keywords =… See the full description on the dataset page: https://huggingface.co/datasets/bigcode/programming-languages-keywords.
734
1---2dataset_info:3 features:4 - name: language5 dtype: string6 - name: keywords7 sequence: string8 splits:9 - name: train10 num_bytes: 2030711 num_examples: 3612 download_size: 883813 dataset_size: 2030714---15# Dataset Card for "programming-languages-keywords"16 17Structured version of https://github.com/e3b0c442/keywords18 19Generated using:20```python21r = requests.get("https://raw.githubusercontent.com/e3b0c442/keywords/main/README.md")22keywords = r.text.split("### ")[1:]23keywords = [i for i in keywords if not i.startswith("Sources")]24keywords = {i.split("\n")[0]:[j for j in re.findall("[a-zA-Z]*", i.split("\n",1)[1]) if j] for i in keywords}25keywords = pd.DataFrame(pd.Series(keywords)).reset_index().rename(columns={"index":"language", 0:"keywords"})26keywords['language'] = keywords['language'].str.split("\) ").str[0]27keywords['keywords'] = keywords['keywords'].apply(lambda x: sorted(list(set(x))))28ds = Dataset.from_pandas(keywords)29```