bigcode/the-stack-smol-xl
Dataset Description A small subset of the-stack dataset, with 87 programming languages, each has 10,000 random samples from the original dataset. Languages The dataset contains 87 programming languages: 'ada', 'agda', 'alloy', 'antlr', 'applescript', 'assembly', 'augeas', 'awk', 'batchfile', 'bison', 'bluespec', 'c', 'c++', 'c-sharp', 'clojure', 'cmake', 'coffeescript', 'common-lisp', 'css', 'cuda', 'dart', 'dockerfile', 'elixir', 'elm', 'emacs-lisp','erlang'… See the full description on the dataset page: https://huggingface.co/datasets/bigcode/the-stack-smol-xl.
Create README.md
add data/zig
add data/yacc
add data/xslt
add data/visual-basic
add data/vhdl
add data/verilog
add data/typescript
add data/thrift
add data/tex
add data/tcsh
add data/tcl
add data/systemverilog
add data/stata
add data/standard-ml
add data/stan
add data/sql
add data/sparql
add data/solidity
add data/smalltalk
add data/shell
add data/scheme
add data/scala
add data/sas
add data/rust
add data/ruby
add data/rmarkdown
add data/restructuredtext
add data/racket
add data/r
add data/python
add data/protocol-buffer
add data/prolog
add data/powershell
add data/php
add data/perl
add data/pascal
add data/ocaml
add data/matlab
add data/mathematica
add data/markdown
add data/maple
add data/makefile
add data/lua
add data/literate-haskell
add data/literate-coffeescript
add data/literate-agda
add data/lean
add data/kotlin
add data/julia
