Team Ai
Datasetpublic

Minuri/sinhala-test-set-50k

Sinhala Test Set - 50K Sentences A held-out Sinhala test set of 50,000 sentences drawn from the Minuri/diverse_sinhala_dataset corpus. Used for perplexity evaluation of three continually pretrained LLaMA 3.2 1B variants (Models A, B, C) as part of a diversity-driven Sinhala language model adaptation study. Dataset Description This test set was held out strictly from all three pretraining corpora (A, B, C) to enable unbiased perplexity measurement. It covers… See the full description on the dataset page: https://huggingface.co/datasets/Minuri/sinhala-test-set-50k.

sourceHugging Facecc-by-sa-4.0updated 6mo agoView on Hugging Face
0likes49downloads
Dataset Card

Sinhala Test Set - 50K Sentences

A held-out Sinhala test set of 50,000 sentences drawn from the Minuri/diverse_sinhala_dataset corpus. Used for perplexity evaluation of three continually pretrained LLaMA 3.2 1B variants (Models A, B, C) as part of a diversity-driven Sinhala language model adaptation study.

Dataset Description

This test set was held out strictly from all three pretraining corpora (A, B, C) to enable unbiased perplexity measurement. It covers multiple domains as classified by a fine-tuned XLM-RoBERTa domain classifier (94% macro-F1).

Perplexity Results (on this test set)

ModelCorpusPerplexity
Model ANews-only14.68
Model BRandom10.86
Model CDiversity-optimised10.50 ✅

Source Datasets (via parent corpus)

SourceDescription
culturaxCulturaX multilingual web corpus (Sinhala subset)
madladMADLAD-400 multilingual dataset (Sinhala subset)
nsinaNSina Sinhala news corpus
wikipediaSinhala Wikipedia dump

Dataset Structure

ColumnTypeDescription
orig_indexintOriginal index in the parent corpus
sentencestringSinhala sentence text
sourcestringSource dataset identifier
predicted_domainstringDomain label predicted by XLM-RoBERTa classifier
confidencefloatClassifier confidence score

Splits

SplitRows
train50,000

Format

Available in both JSONL and CSV formats.

Intended Uses

  • —Perplexity evaluation of Sinhala language models
  • —Held-out benchmark for continual pretraining experiments

Related Repositories

RepoDescription
Minuri/diverse_sinhala_datasetFull 12.38M sentence parent corpus
Minuri/sinhala-validation-set-10kValidation set (10K sentences)
Minuri/sinhala-corpus-a-news-1mCorpus A - news-only (1M)
Minuri/sinhala-corpus-b-random-1mCorpus B - random (1M)
Minuri/sinhala-corpus-c-diverse-1mCorpus C - diversity-optimised (1M)

Sources & Licenses

This dataset contains sentences derived from the following source datasets. Users must comply with the license terms of each:

SourceLicense
MADLAD-400ODC-BY
CulturaXmC4 + OSCAR licenses
wikimedia/wikipediaCC BY-SA 3.0 + GFDL
sinhala-nlp/NSINACC BY-SA 4.0

This dataset is released under CC BY-SA 4.0 in compliance with the ShareAlike terms of Wikipedia and NSINA.