Team Ai
Datasetpublic

D4nt3/esb-datasets-earnings22-validation-tiny-filtered

A filtered (<=30s duration) slice (512 samples) of the Earnings22 dataset. def add_duration(sample): y, sr = sample['audio']["array"], sample['audio']["sampling_rate"] sample['duration_ms']=librosa.get_duration(y=y, sr=sr) * 1000 return sample tedlium = load_dataset("esb/datasets", "earnings22", split='validation', trust_remote_code=True) # compute duration to filter tedlium = tedlium.map(add_duration) tedlium = tedlium.select(range(512)) # Whisper max supported duration tedlium… See the full description on the dataset page: https://huggingface.co/datasets/D4nt3/esb-datasets-earnings22-validation-tiny-filtered.

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes9.9kdownloads
Dataset Card

A filtered (<=30s duration) slice (512 samples) of the Earnings22 dataset.

python
def add_duration(sample):
    y, sr = sample['audio']["array"], sample['audio']["sampling_rate"]
    sample['duration_ms']=librosa.get_duration(y=y, sr=sr) * 1000
    return sample

tedlium = load_dataset("esb/datasets", "earnings22", split='validation', trust_remote_code=True)
# compute duration to filter
tedlium = tedlium.map(add_duration)
tedlium = tedlium.select(range(512))

# Whisper max supported duration
tedlium = tedlium.filter(lambda example: example['duration_ms'] < 30000)