Team Ai
Datasetpublic

TozAI/TR-coding-data

TR Coding Data (v0.2) English | Türkçe Documents / Doküman: 28 Tokens / Token: 317,427 (Qwen/Qwen3-0.6B tokenizer) from datasets import load_dataset ds = load_dataset("TozAI/TR-coding-data", split="train") English Raw-text documents that explain programming in Turkish with embedded code, intended for pretraining / mid-training of language models. Each row is one self-contained document (tutorial, project walkthrough, debugging session, ...). How it… See the full description on the dataset page: https://huggingface.co/datasets/TozAI/TR-coding-data.

sourceHugging Facemitupdated 13d agoView on Hugging Face
1likes120downloads
10 commits on main
498601513d ago

README: English/Türkçe dataset card

Ahmetemiiii2
8f02dcb13d ago

v0.2: 28 doküman, ~317K token, temiz şema ve metadata

Ahmetemiiii2
114fef019d ago

Rename merged_dataset.txt to data/merged_dataset.txt

Ahmetemiiii2
6ab769f19d ago

Rename dataset.parquet to data/dataset.parquet

Ahmetemiiii2
cf1afa819d ago

Delete data

Ahmetemiiii2
f94636519d ago

Create data

Ahmetemiiii2
ab91b7d20d ago

Create README.md

Ahmetemiiii2
01735dd20d ago

Upload dataset.parquet

Ahmetemiiii2
b47fc5d20d ago

v0.1

Ahmetemiiii2
0ab405220d ago

initial commit

Ahmetemiiii2