JustACluelessKidAtSchool/tiny-slm-pretraining-corpus
๐ Ultra High-Quality Tiny SLM Pre-Training Corpus (<100GB) A state-of-the-art, balanced 7-domain pre-training dataset engineered specifically for Small Language Models (Tiny SLMs: 50M โ 2B parameters) such as SmolLM2, SmolLM3, MobileLLM, Llama 3.2 1B, and custom architectures. 100% compatible with Unsloth Studio, Unsloth AI, Hugging Face datasets, and PyTorch DataLoaders. ๐ Dataset Statistics Total Documents: 20,066,075 Train: 19,663,898 Validation: 402,177โฆ See the full description on the dataset page: https://huggingface.co/datasets/JustACluelessKidAtSchool/tiny-slm-pretraining-corpus.
๐ Ultra High-Quality Tiny SLM Pre-Training Corpus (<100GB)
A state-of-the-art, balanced 7-domain pre-training dataset engineered specifically for Small Language Models (Tiny SLMs: 50M โ 2B parameters) such as SmolLM2, SmolLM3, MobileLLM, Llama 3.2 1B, and custom architectures.
100% compatible with Unsloth Studio, Unsloth AI, Hugging Face `datasets`, and PyTorch DataLoaders.
๐ Dataset Statistics
- Total Documents: 20,066,075
- Train: 19,663,898
- Validation: 402,177
- Total Tokens: ~23.87 Billion tokens
- Train Tokens: ~23.40B
- Validation Tokens: ~0.47B
- Format: Zstandard Compressed Parquet
๐ฌ 7-Domain Pre-Training Mixture
๐ฆฅ Quickstart: Unsloth Studio & Hugging Face
1. Load with Hugging Face Datasets
from datasets import load_dataset
# Load Train Split
train_dataset = load_dataset("JustACluelessKidAtSchool/tiny-slm-pretraining-corpus", split="train")
# Load Validation Split
val_dataset = load_dataset("JustACluelessKidAtSchool/tiny-slm-pretraining-corpus", split="validation")2. Pre-Train with Unsloth in 1 Command
from unsloth import FastLanguageModel
from datasets import load_dataset
from transformers import TrainingArguments
from trl import SFTTrainer
# Load Tiny Model (e.g. SmolLM2-135M or Llama-3.2-1B)
model, tokenizer = FastLanguageModel.from_pretrained(
model_name="HuggingFaceTB/SmolLM2-135M",
max_seq_length=2048,
load_in_4bit=False,
)
# Load Dataset from Hub
dataset = load_dataset("JustACluelessKidAtSchool/tiny-slm-pretraining-corpus", split="train")
# Train with Unsloth
trainer = SFTTrainer(
model=model,
tokenizer=tokenizer,
train_dataset=dataset,
dataset_text_field="text",
max_seq_length=2048,
args=TrainingArguments(
output_dir="./tiny_slm_output",
per_device_train_batch_size=4,
gradient_accumulation_steps=8,
max_steps=5000,
learning_rate=5e-4,
fp16=True,
optim="adamw_8bit",
),
)
trainer.train()3. In Unsloth Studio GUI
- Set Dataset to:
JustACluelessKidAtSchool/tiny-slm-pretraining-corpus - Text Column:
text
