Team Ai
Datasetpublic

MultilingualUnigramLM/LangMap-TheStack-cpp-100M

LangMap-TheStack-cpp-100M Code finetuning dataset for cpp streamed from bigcode/the-stack. Tokens collected: 100,000,000 (target: 100,000,000) Tokenizer: allenai/OLMo-3-1025-7B Schema: {"text": [...]} (sanitised source code)

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes237downloads
6 commits on main
f9c3fef6mo ago

Fix data path: data/cpp-*.parquet -> data/train-*.parquet

suchirsalhan
76d44e46mo ago

Add README for cpp code dataset

suchirsalhan
bdbd1606mo ago

Upload dataset

suchirsalhan
be7b3596mo ago

Add README for cpp code dataset

suchirsalhan
a63bcb56mo ago

Upload dataset

suchirsalhan
0b8d0916mo ago

initial commit

suchirsalhan