Team Ai
Datasetpublic

Ultralordb0d/librispeech_whisper_tiny_en

LibriSpeech + whisper-tiny.en hypotheses Пари «гіпотеза ASR — правильна транскрипція» для досліджень пост-ASR корекції. Аудіо і транскрипції: LibriSpeech через openslr/librispeech_asr (CC BY 4.0). Аудіо не включено. ASR: openai/whisper-tiny.en, greedy decoding, fp16. Підвибірки train: train_clean_100: усі, train_clean_360: 50000, train_other_500: 30000 (shuffle seed=42). Колонка Опис transcription оригінальний текст LibriSpeech prediction сирий вихід Whisper… See the full description on the dataset page: https://huggingface.co/datasets/Ultralordb0d/librispeech_whisper_tiny_en.

sourceHugging Facecc-by-4.0updated 11d agoView on Hugging Face
0likes68downloads
Dataset Card

LibriSpeech + whisper-tiny.en hypotheses

Пари «гіпотеза ASR — правильна транскрипція» для досліджень пост-ASR корекції.

  • —Аудіо і транскрипції: LibriSpeech через openslr/librispeech_asr (CC BY 4.0). Аудіо не включено.
  • —ASR: openai/whisper-tiny.en, greedy decoding, fp16.
  • —Підвибірки train: trainclean100: усі, trainclean360: 50000, trainother500: 30000 (shuffle seed=42).
КолонкаОпис
transcriptionоригінальний текст LibriSpeech
predictionсирий вихід Whisper
*_cleanнижній регістр, без пунктуації
*_normWhisper EnglishTextNormalizer (стандарт для WER на LibriSpeech)
wer_normWER окремого запису за *_norm
durationтривалість запису, с