Team Ai
Datasetpublic

TozAI/TR-coding-data

TR Coding Data (v0.2) English | Türkçe Documents / Doküman: 28 Tokens / Token: 317,427 (Qwen/Qwen3-0.6B tokenizer) from datasets import load_dataset ds = load_dataset("TozAI/TR-coding-data", split="train") English Raw-text documents that explain programming in Turkish with embedded code, intended for pretraining / mid-training of language models. Each row is one self-contained document (tutorial, project walkthrough, debugging session, ...). How it… See the full description on the dataset page: https://huggingface.co/datasets/TozAI/TR-coding-data.

sourceHugging Facemitupdated 13d agoView on Hugging Face
1likes120downloads
Dataset Card

TR Coding Data (v0.2)

[English](#english) | [Türkçe](#türkçe)

  • —Documents / Doküman: 28
  • —Tokens / Token: 317,427 (Qwen/Qwen3-0.6B tokenizer)
python
from datasets import load_dataset

ds = load_dataset("TozAI/TR-coding-data", split="train")

English

Raw-text documents that explain programming in Turkish with embedded code, intended for pretraining / mid-training of language models. Each row is one self-contained document (tutorial, project walkthrough, debugging session, ...).

How it was made

Documents were generated with the help of AI models (Qwen, GLM, Claude, ChatGPT, Gemini), then manually reviewed and edited (chat artifacts such as greetings and citation markers were removed). Not every code sample has been executed and verified; please run your own checks before relying on them.

Changelog

  • —v0.2: One document per row (fixes the broken CSV-derived parquet in v0.1); added metadata columns (id, konu, ana_dil, diller, token_count, ...); removed chat artifacts (greetings, filler openers, search citation markers); added new documents (~80K → ~318K tokens).
  • —v0.1: Initial release (~80K tokens). Available via revision="v0.1".

Türkçe

Türkçe anlatımlı, kod içeren ham metin dokümanları. Dil modellerinin pretraining / mid-training aşaması için hazırlanmıştır. Her satır kendi başına bir dokümandır (rehber, proje anlatımı, hata ayıklama vb.).

Nasıl üretildi

Dokümanlar yapay zeka modelleri (Qwen, GLM, Claude, ChatGPT, Gemini) yardımıyla üretilmiş, ardından elle gözden geçirilip düzenlenmiştir (sohbet ifadeleri ve araç artıkları temizlenmiştir). Kodların tamamı çalıştırılarak doğrulanmamıştır; kullanmadan önce kendi kontrollerinizi yapmanız önerilir.

Sürüm notları

  • —v0.2: Her doküman tek satır (v0.1'deki CSV kaynaklı bozuk parquet düzeltildi); id, konu, ana_dil, diller, token_count gibi metadata kolonları eklendi; sohbet artıkları (hitaplar, "Tamam/Harika" açılışları, arama atıfları) temizlendi; yeni dokümanlar eklendi (~80K → ~318K token).
  • —v0.1: İlk sürüm (~80K token). revision="v0.1" ile erişilebilir.

Columns / Kolonlar

ColumnDescriptionAçıklama
idDocument IDDoküman kimliği
konuTopicKonu
ana_dilDominant programming languageBaskın programlama dili
dillerAll languages in the documentDokümanda geçen tüm diller
etiketlerFree-form tagsSerbest etiketler
langNatural language (FineWeb-2 code)Doğal dil (FineWeb-2 kodu)
token_countToken countToken sayısı
karakterCharacter countKarakter sayısı
kod_oraniShare of text inside code blocksKod bloklarının metne oranı
textRaw textHam metin

Language distribution / Dil dağılımı

Token-weighted, by dominant language / Token ağırlıklı, ana dile göre.

Language / DilShare / Pay
python25.2%
html20.8%
rust19.1%
java17.3%
cpp10.8%
css2.8%
javascript1.3%
typescript0.9%
bash0.9%
go0.9%