Team Ai
Datasetpublic

suleiman2003/afri-temp-data4

AfricanVoices Hausa -- Train Split Hausa speech dataset from AfricanVoices.io. Usage from datasets import load_dataset ds = load_dataset("suleiman2003/afri-temp-data4", split="train") print(ds[0]) # {'audio': Audio(...), 'transcript': '...', 'gender': '...', ...} Structure Each batch is in its own subdirectory under train/: train/ batch_1/ *.flac + metadata.csv batch_2/ *.flac + metadata.csv ... Audio files are FLAC format. Metadata… See the full description on the dataset page: https://huggingface.co/datasets/suleiman2003/afri-temp-data4.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes842downloads
Dataset Card

AfricanVoices Hausa -- Train Split

Hausa speech dataset from AfricanVoices.io.

Usage

python
from datasets import load_dataset
ds = load_dataset("suleiman2003/afri-temp-data4", split="train")
print(ds[0])
# {'audio': Audio(...), 'transcript': '...', 'gender': '...', ...}

Structure

Each batch is in its own subdirectory under train/:

train/
  batch_1/
    *.flac + metadata.csv
  batch_2/
    *.flac + metadata.csv
  ...

Audio files are FLAC format. Metadata includes: transcript, speakerid, gender, agegroup, education, duration, language, snr, domain.