STT
Datasets
All datasets matching “STT”STT_MODEL
Multilingual STT Dataset
Audio and transcript pairs for 50 languages. Each language is a Dataset Viewer configuration with train, validation, and test splits.
Language configurations
amharic: Amharic
arabic_msa: Arabic MSA
assamese: Assamese
bengali: Bengali
czech: Czech
dutch: Dutch
egyptian_arabic: Egyptian Arabic
english: English
farsi_persian: Farsi - Persian
filipino_tagalog: Filipino - Tagalog
french: French
german: German
greek: Greek
gujarati: Gujarati… See the full description on the dataset page: https://huggingface.co/datasets/RidheshBhati/STT_MODEL.spanish-slang-stt-data
Spanish Regional Speech-to-Text Dataset
A multilingual Spanish speech recognition dataset covering 4 regional dialects for fine-tuning Whisper and other ASR models.
Dataset Description
This dataset contains ~39,000 audio samples with transcriptions across 4 Spanish-speaking regions:
Region
Samples
Description
Mexico
17,725
Mexican Spanish including CIEMPIESS corpus
Spain
11,360
Castilian Spanish from TEDx and Common Voice
Argentina
5,839
Rioplatense Spanish… See the full description on the dataset page: https://huggingface.co/datasets/shraavb/spanish-slang-stt-data.STT_ABMalaysian-STT-Whisper
Malaysian STT Whisper format
Heavy postprocessing and post-translation to improve pseudolabeled Whisper Large V3. Also include word level timestamp.
Postprocessing
Check repetitive trigrams.
Verify Voice Activity using Silero-VAD.
Verify scores using Force Alignment.
Post-translation
We use mesolitica/nanot5-base-malaysian-translation-v2.1.
Dataset involved
Malaysian context v2
Singaporean context
Indonesian context
Mandarin audio
Tamil audio… See the full description on the dataset page: https://huggingface.co/datasets/mesolitica/Malaysian-STT-Whisper.ramanv-stt-filteredhi-stt-preprocessed-webdataset
