continue
Datasets
All datasets matching “continue”ourmethod_128batchsize_continue_continue_checkpointscontinue-training-datacontinue_vs_terminate_Qwen3-1.7B_DAPO-Math-en_BATCHcontinue-pretrained-v1
Continue Pretrained v1
Continual-pretraining (CPT) mixture shards for Vietnamese LLM training.
Splits
Split
Description
Rows (approx)
Est. tokens
stage_1
Warmup / general mix (VI-heavy + EN replay)
56,419,797
~52.2B
Schema
id, text, source, subset
stage, stage_name, mix_source, language, epoch, quality_pred
Load
from datasets import load_dataset
ds = load_dataset("brownyeyez/continue-pretrained-v1", split="stage_1")
continue_vs_terminate_neg_Qwen3-1.7B_DAPO-Math-en_BATCHHEC3R-ckpt-yawfix_continue
