Team Ai
Datasetpublic

MultilingualUnigramLM/LangMap-TheStack-cpp-100M

LangMap-TheStack-cpp-100M Code finetuning dataset for cpp streamed from bigcode/the-stack. Tokens collected: 100,000,000 (target: 100,000,000) Tokenizer: allenai/OLMo-3-1025-7B Schema: {"text": [...]} (sanitised source code)

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes223downloads
README.md16 linesDownload Raw Back to root
1---2configs:3- config_name: default4  data_files:5    - split: train6      path: data/train-*.parquet7---8 9# LangMap-TheStack-cpp-100M10 11Code finetuning dataset for **cpp** streamed from [bigcode/the-stack](https://huggingface.co/datasets/bigcode/the-stack).12 13- **Tokens collected**: 100,000,000 (target: 100,000,000)14- **Tokenizer**: `allenai/OLMo-3-1025-7B`15- **Schema**: `{"text": [...]}` (sanitised source code)16