Team Ai
Datasetpublic

hasankursun/github-code-2025-language-split

📜 Source Data & Attribution This dataset is a processed derivative of nick007x/github-code-2025. Origination The original data was aggregated by nick007x from public GitHub repositories. We have retained the original content, file paths, and metadata while restructuring the format for easier consumption by language-specific models. Processing Steps To create this dataset, we performed the following processing on the source data: Language… See the full description on the dataset page: https://huggingface.co/datasets/hasankursun/github-code-2025-language-split.

sourceHugging Faceotherupdated 10mo agoView on Hugging Face
13likes8.2kdownloads
README.md264 linesDownload Raw Back to root
1---2source_datasets:3  - nick007x/github-code-20254license:5  - other6configs:7  - config_name: assembly8    data_files:9      - split: train10        path: Assembly/*.parquet11  - config_name: batch12    data_files:13      - split: train14        path: Batch/*.parquet15  - config_name: c16    data_files:17      - split: train18        path: C/*.parquet19  - config_name: csharp20    data_files:21      - split: train22        path: C#/*.parquet23  - config_name: cpp24    data_files:25      - split: train26        path: C++/*.parquet27  - config_name: css28    data_files:29      - split: train30        path: CSS/*.parquet31  - config_name: clojure32    data_files:33      - split: train34        path: Clojure/*.parquet35  - config_name: crystal36    data_files:37      - split: train38        path: Crystal/*.parquet39  - config_name: dart40    data_files:41      - split: train42        path: Dart/*.parquet43  - config_name: dockerfile44    data_files:45      - split: train46        path: Dockerfile/*.parquet47  - config_name: elixir48    data_files:49      - split: train50        path: Elixir/*.parquet51  - config_name: erlang52    data_files:53      - split: train54        path: Erlang/*.parquet55  - config_name: fsharp56    data_files:57      - split: train58        path: F#/*.parquet59  - config_name: go60    data_files:61      - split: train62        path: Go/*.parquet63  - config_name: gradle64    data_files:65      - split: train66        path: Gradle/*.parquet67  - config_name: groovy68    data_files:69      - split: train70        path: Groovy/*.parquet71  - config_name: html72    data_files:73      - split: train74        path: HTML/*.parquet75  - config_name: haskell76    data_files:77      - split: train78        path: Haskell/*.parquet79  - config_name: json80    data_files:81      - split: train82        path: JSON/*.parquet83  - config_name: java84    data_files:85      - split: train86        path: Java/*.parquet87  - config_name: javascript88    data_files:89      - split: train90        path: JavaScript/*.parquet91  - config_name: julia92    data_files:93      - split: train94        path: Julia/*.parquet95  - config_name: kotlin96    data_files:97      - split: train98        path: Kotlin/*.parquet99  - config_name: lua100    data_files:101      - split: train102        path: Lua/*.parquet103  - config_name: makefile104    data_files:105      - split: train106        path: Makefile/*.parquet107  - config_name: markdown108    data_files:109      - split: train110        path: Markdown/*.parquet111  - config_name: nim112    data_files:113      - split: train114        path: Nim/*.parquet115  - config_name: ocaml116    data_files:117      - split: train118        path: OCaml/*.parquet119  - config_name: objective_c120    data_files:121      - split: train122        path: Objective-C/*.parquet123  - config_name: objective_cpp124    data_files:125      - split: train126        path: Objective-C++/*.parquet127  - config_name: php128    data_files:129      - split: train130        path: PHP/*.parquet131  - config_name: perl132    data_files:133      - split: train134        path: Perl/*.parquet135  - config_name: powershell136    data_files:137      - split: train138        path: PowerShell/*.parquet139  - config_name: python140    data_files:141      - split: train142        path: Python/*.parquet143  - config_name: r144    data_files:145      - split: train146        path: R/*.parquet147  - config_name: ruby148    data_files:149      - split: train150        path: Ruby/*.parquet151  - config_name: rust152    data_files:153      - split: train154        path: Rust/*.parquet155  - config_name: sql156    data_files:157      - split: train158        path: SQL/*.parquet159  - config_name: scala160    data_files:161      - split: train162        path: Scala/*.parquet163  - config_name: shell164    data_files:165      - split: train166        path: Shell/*.parquet167  - config_name: solidity168    data_files:169      - split: train170        path: Solidity/*.parquet171  - config_name: svelte172    data_files:173      - split: train174        path: Svelte/*.parquet175  - config_name: swift176    data_files:177      - split: train178        path: Swift/*.parquet179  - config_name: systemverilog180    data_files:181      - split: train182        path: SystemVerilog/*.parquet183  - config_name: toml184    data_files:185      - split: train186        path: TOML/*.parquet187  - config_name: text188    data_files:189      - split: train190        path: Text/*.parquet191  - config_name: typescript192    data_files:193      - split: train194        path: TypeScript/*.parquet195  - config_name: unknown196    data_files:197      - split: train198        path: Unknown/*.parquet199  - config_name: vhdl200    data_files:201      - split: train202        path: VHDL/*.parquet203  - config_name: verilog204    data_files:205      - split: train206        path: Verilog/*.parquet207  - config_name: visual_basic208    data_files:209      - split: train210        path: Visual Basic/*.parquet211  - config_name: vue212    data_files:213      - split: train214        path: Vue/*.parquet215  - config_name: xml216    data_files:217      - split: train218        path: XML/*.parquet219  - config_name: yaml220    data_files:221      - split: train222        path: YAML/*.parquet223  - config_name: zig224    data_files:225      - split: train226        path: Zig/*.parquet227---228 229## 📜 Source Data & Attribution230 231This dataset is a processed derivative of **[nick007x/github-code-2025](https://huggingface.co/datasets/nick007x/github-code-2025)**.232 233### Origination234 235The original data was aggregated by **nick007x** from public GitHub repositories. We have retained the original content, file paths, and metadata while restructuring the format for easier consumption by language-specific models.236 237### Processing Steps238 239To create this dataset, we performed the following processing on the source data:240 2411.  **Language Identification:** We mapped file extensions (e.g., `.py`, `.rs`, `.ts`) to their respective programming languages using a comprehensive extension map.2422.  **Splitting:** The dataset was sharded and split into separate sub-directories/categories by programming language to allow for targeted loading (e.g., loading only Python or Rust data).2433.  **Filtering:** Binary files and ambiguous extensions were categorized as "Unknown" or removed to ensure text-based model compatibility.244 245### Licensing Information246 247The data contained in this dataset belongs to the original authors of the code repositories on GitHub.248 249  * **Source Aggregation:** The aggregation was provided by `nick007x/github-code-2025`.250  * **Individual Code Files:** Each file typically retains the license of its original repository (MIT, Apache 2.0, BSD, etc.). Users of this dataset are responsible for adhering to the license terms of the individual code files contained within.251 252### Citation253 254If you use this dataset, please cite the original source:255 256```bibtex257@misc{github-code-2025,258  author = {nick007x},259  title = {GitHub Code 2025 Dataset},260  year = {2025},261  publisher = {Hugging Face},262  howpublished = {\url{https://huggingface.co/datasets/nick007x/github-code-2025}}263}264```
hasankursun/github-code-2025-language-split · Team Ai