ammarnasr/the-stack-ruby-clean
Dataset 1: TheStack - Ruby - Cleaned Description: This dataset is drawn from TheStack Corpus, an open-source code dataset with over 3TB of GitHub data covering 48 programming languages. We selected a small portion of this dataset to optimize smaller language models for Ruby, a popular statically typed language. Target Language: Ruby Dataset Size: Training: 900,000 files Validation: 50,000 files Test: 50,000 files Preprocessing: Selected Ruby as the target language due to its… See the full description on the dataset page: https://huggingface.co/datasets/ammarnasr/the-stack-ruby-clean.
Update README.md
Upload README.md with huggingface_hub
Upload data/valid-00000-of-00001-86b1aa339b65e6a9.parquet with huggingface_hub
Upload data/test-00000-of-00001-08659c5ce03d731f.parquet with huggingface_hub
Upload data/train-00006-of-00007-0b58959a1764b08a.parquet with huggingface_hub
Upload data/train-00005-of-00007-fc86d8c6ebb8f409.parquet with huggingface_hub
Upload data/train-00004-of-00007-07c748069725a121.parquet with huggingface_hub
Upload data/train-00003-of-00007-2579d9197e6f0b0f.parquet with huggingface_hub
Upload data/train-00002-of-00007-012eaf9c1f650752.parquet with huggingface_hub
Upload data/train-00001-of-00007-2c9a956ef9ffb823.parquet with huggingface_hub
Upload data/train-00000-of-00007-85068f18229d7ef2.parquet with huggingface_hub
initial commit
