Team Ai
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01ivkond /synthetic-speech-diarization-ru synthetic-speech-diarization-ru Synthetic speech diarization dataset in Parquet format. Dataset Details Number of tracks: 2000 Sampling rate: 16000 Hz Audio format: Embedded in Parquet files (Audio feature compatible) Storage: Parquet format for efficient loading Dataset Structure The dataset contains audio tracks with speaker diarization annotations, stored directly in Parquet format. Features audio: Audio waveform (Audio feature with array and… See the full description on the dataset page: https://huggingface.co/datasets/ivkond/synthetic-speech-diarization-ru.tabularautomatic-speech-recognition1K<n<10K0 likes238 downloads10mo agoHugging Face02smam /bengali-diarization-synthetic-v3audion<1K0 likes217 downloads8mo agoHugging Face03mesolitica /Speaker-Diarization-Instructions Speaker-Diarization-Instructions Convert diarization dataset from https://huggingface.co/diarizers-community into speech instructions dataset and chunk max to 30 seconds because most of speech encoder use for LLM come from Whisper Encoder. We highly recommend to not include AMI test set from both AMI-IHM and AMI-SDM in training set to prevent contamination. This dataset supposely to become a speech diarization benchmark. how to prepare the dataset huggingface-cli… See the full description on the dataset page: https://huggingface.co/datasets/mesolitica/Speaker-Diarization-Instructions.audio100K<n<1M0 likes142 downloads1y agoHugging Face04tnd-ai /speaker-diarization-rawgatedaudio10K<n<100K0 likes104 downloads21d agoHugging Face05diarizers-community /synthetic-speaker-diarization-dataset-fa-3000audioaudio-classification1K<n<10K3 likes98 downloads1y agoHugging Face06Rangasuthan /tamil-english-podcast-diarization Tamil-English Code-Mixed Podcast Diarization Dataset Dataset Summary This dataset contains long-form Tamil-English code-mixed podcast recordings annotated for speaker diarization research. The recordings consist of natural conversational speech with multiple speakers and realistic acoustic conditions, making the dataset suitable for evaluating diarization pipelines in real-world scenarios. The dataset is intended to support research in: Speaker diarization Code-mixed… See the full description on the dataset page: https://huggingface.co/datasets/Rangasuthan/tamil-english-podcast-diarization.audioautomatic-speech-recognitionn<1K1 likes98 downloads8mo agoHugging Face07Beijuka /luganda_callhome_diarization_dataset_MHDPaudion<1K0 likes88 downloads7mo agoHugging Face08tezuesh /diarization_datasetaudion<1K0 likes87 downloads2y agoHugging Face09Venkatesh4342 /pyannote-hindi-diarizationaudio1K<n<10K1 likes85 downloads2y agoHugging Face10atiyehghm /shemo_diarization_datasetaudio1K<n<10K1 likes81 downloads3mo agoHugging Face11niobures /synthetic-speech-diarization-ru synthetic-speech-diarization-ru Synthetic speech diarization dataset in Parquet format. Dataset Details Number of tracks: 2000 Sampling rate: 16000 Hz Audio format: Embedded in Parquet files (Audio feature compatible) Storage: Parquet format for efficient loading Dataset Structure The dataset contains audio tracks with speaker diarization annotations, stored directly in Parquet format. Features audio: Audio waveform (Audio feature with array and… See the full description on the dataset page: https://huggingface.co/datasets/niobures/synthetic-speech-diarization-ru.tabularautomatic-speech-recognition1K<n<10K0 likes59 downloads5mo agoHugging Face12Beijuka /callhome-eng-diarizationaudion<1K0 likes56 downloads1y agoHugging Face13diarizers-community /synthetic-speaker-diarization-datasetaudio1K<n<10K2 likes50 downloads2y agoHugging Face14shreyaskal3 /synthetic-speaker-diarization-dataset-hindiaudion<1K0 likes43 downloads2y agoHugging Face15TomRoma /ENNI_speaker_diarizationaudio10K<n<100K0 likes35 downloads1y agoHugging Face16kamilakesbi /ami_for_diarizationlmtextn<1K0 likes29 downloads2y agoHugging Face17palli23 /Spjallromur-AB-Diarization-test Dataset Card — Spjallrómur AB Diarization Test Set Dataset Description Spjallrómur AB Diarization Test Set is a curated test set for speaker diarization evaluation on conversational Icelandic speech. It is derived from the Spjallrómur 26.03 corpus by merging the two separate recording channels (A and B) into single mixed-audio files, producing a realistic diarization benchmark with known ground-truth speaker turns. The test set was compiled as part of the Almannarómur… See the full description on the dataset page: https://huggingface.co/datasets/palli23/Spjallromur-AB-Diarization-test.audion<1K0 likes27 downloads5mo agoHugging Face18diarizers-community /ami_for_diarizationlmtextn<1K0 likes26 downloads2y agoHugging Face19syvai /danish-diarization-bench Danish Diarization Benchmark (Synthetic) — v2 A 3996-row synthetic speaker-diarization benchmark in Danish, built by mixing single-speaker utterances from syvai/danish-asr-unified into multi-speaker recordings. What changed in v2 (2026-05-18) Per-segment text — each entry in segments now carries its text field directly. The redundant parallel texts column has been removed. Old consumers that joined segments[i] with texts[i] should switch to segments[i]["text"]. Silent… See the full description on the dataset page: https://huggingface.co/datasets/syvai/danish-diarization-bench.tabularautomatic-speech-recognition1K<n<10K1 likes25 downloads5mo agoHugging Face20Samyak29 /synthetic-speaker-diarization-dataset-hindi-largeaudion<1K1 likes24 downloads2y agoHugging Face21woodygan /CATS-ami-speaker-diarization-audioaudio1K<n<10K0 likes22 downloads2y agoHugging Face22uncleMehrzad /synthetic-speaker-diarization-dataset-fasynthetic dataset generated from persian common voice. audion<1K1 likes22 downloads1y agoHugging Face23sussorg /diarization-ONS-ground-truthaudio1K<n<10K0 likes22 downloads1y agoHugging Face24Mohaddz /sada-diarization-previewgated SADA 2022 Arabic Diarization Training-ready speaker-attributed ASR windows derived from SADA 2022. The source recordings are mirrored at khaledalganem/sada2022. Splits train: 36,004 windows, 202.064 hours, 4,062 recordings validation: 853 windows, 4.774 hours, 88 recordings test: 901 windows, 5.006 hours, 111 recordings Total: 37,758 windows and 211.844 hours. The official SADA train, validation, and test partitions are preserved. Windows are 8–28 seconds… See the full description on the dataset page: https://huggingface.co/datasets/Mohaddz/sada-diarization-preview.audioautomatic-speech-recognition10K<n<100K0 likes22 downloads2mo agoHugging Face25Khanh17 /training-diarizationaudio1K<n<10K0 likes20 downloads2mo agoHugging Face26dembrane /synthetic-speaker-diarization-dataset-nlaudion<1K0 likes18 downloads1y agoHugging Face27Cybrpgs /mac-m4pro-fresh-diarization-demucs-20260902gated gdrive-sbpn-fresh-diarization-demucs-mac-m4pro-20260902 This dataset combines six independently aligned source archives. Each row embeds its selected MP3 in the audio Parquet column. SBPN-derived word timestamps are observational and do not control chunk edges or the Demucs vote. Accepted hard-word verbalizations are projected back to the original written forms; pronunciation_alignment_dictionary_json records the winning spoken form. Non-music tags are preserved using the… See the full description on the dataset page: https://huggingface.co/datasets/Cybrpgs/mac-m4pro-fresh-diarization-demucs-20260902.audioautomatic-speech-recognition1K<n<10K0 likes18 downloads1mo agoHugging Face28maheshbabu9199 /synthetic-speaker-diarization-datasetaudion<1K0 likes17 downloads2y agoHugging Face29whitneyten /synthetic-speaker-diarization-dataset-idaudion<1K0 likes17 downloads2y agoHugging Face30smam /bengali-diarization-synthetic-v4gated Bengali Speaker Diarization Synthetic Dataset V4 Synthetic Bengali speaker diarization dataset with natural overlapping speech patterns using timeline-based random chunk placement. Dataset Overview Property Value Total Samples 600 Speaker Categories 1-30 speakers per sample Samples per Category 20 Duration per Sample ~30 minutes Total Duration ~300 hours Sample Rate 16000 Hz Format WAV (audio) + RTTM (labels) + JSON (metadata)… See the full description on the dataset page: https://huggingface.co/datasets/smam/bengali-diarization-synthetic-v4.audioaudio-classificationn<1K0 likes17 downloads8mo agoHugging Face

Listings come live from the Hugging Face Hub API. Team Ai does not host these files.