semi-supervised
wav2vec2-xls-r-300m-Korean-children-pronunciation-jamo-based-semi-supervised_V2Semi-Supervised_Learning_n_Pseudo-Labelingsemi-supervised-classification-simclrincremental-semi-supervised-training-500k-upsampledincremental-semi-supervised-training-1mln-downsampledwhisper-tiny-mn-semi-supervisedsemi-supervised-hatebertcodet5-small-semi-supervised-cs175
common_voice_16_1_semisupervisedp2-etf-graph-laplacian-semisupervised-resultssemisupervised-audiobook
Pseudolabel Youtube Malay audiobooks using Whisper Large V3
Notebooks at https://github.com/mesolitica/malaysian-dataset/tree/master/speech-to-text-semisupervised/youtube-audiobook
Split based on 10 seconds utterances using WebRTC VAD.
how-to
Download files,
wget https://huggingface.co/datasets/mesolitica/semisupervised-audiobook/resolve/main/bukan-kerana-aku-5secs-noisy.tar.gz
wget… See the full description on the dataset page: https://huggingface.co/datasets/mesolitica/semisupervised-audiobook.semisupervised-abstractive-summarization-ms-newsSemi_supervised_datasetSemi_Supervised_Natural_FoSSIL
