Team Ai
Datasetpublic

Infatoshi/youtube_technical_v0

youtube_technical_v0 Canonical Phonon ASR dataset. Audio is embedded in Parquet as a Hugging Face-compatible audio struct with bytes and path. Hidden eval rows must not be used for training or synthetic prompt generation. Hub Dataset id: Infatoshi/youtube_technical_v0 (public) Companion labels/manifests/attribution: Infatoshi/phonon-youtube-technical Rows: see summary.json (~118k) Audio is embedded in Parquet (audio struct: bytes, path) Split… See the full description on the dataset page: https://huggingface.co/datasets/Infatoshi/youtube_technical_v0.

sourceHugging Faceupdated 3mo agoView on Hugging Face
1likes411downloads
Dataset Card

youtubetechnicalv0

Canonical Phonon ASR dataset. Audio is embedded in Parquet as a Hugging Face-compatible audio struct with bytes and path.

Hidden eval rows must not be used for training or synthetic prompt generation.

Hub

  • —Dataset id: Infatoshi/youtube_technical_v0 (public)
  • —Companion labels/manifests/attribution: Infatoshi/phonon-youtube-technical
  • —Rows: see summary.json (~118k)
  • —Audio is embedded in Parquet (audio struct: bytes, path)
  • —Split yt_technical_hidden_v0 is a holdout: do not train on it
bash
hf download Infatoshi/youtube_technical_v0 --repo-type dataset \
  --local-dir /home/infatoshi/phonon/datasets/datasets/youtube_technical_v0