Team Ai
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01ivkond /synthetic-speech-diarization-ru synthetic-speech-diarization-ru Synthetic speech diarization dataset in Parquet format. Dataset Details Number of tracks: 2000 Sampling rate: 16000 Hz Audio format: Embedded in Parquet files (Audio feature compatible) Storage: Parquet format for efficient loading Dataset Structure The dataset contains audio tracks with speaker diarization annotations, stored directly in Parquet format. Features audio: Audio waveform (Audio feature with array and… See the full description on the dataset page: https://huggingface.co/datasets/ivkond/synthetic-speech-diarization-ru.tabularautomatic-speech-recognition1K<n<10K0 likes238 downloads10mo agoHugging Face02smam /bengali-diarization-synthetic-v3audion<1K0 likes217 downloads8mo agoHugging Face03mesolitica /Speaker-Diarization-Instructions Speaker-Diarization-Instructions Convert diarization dataset from https://huggingface.co/diarizers-community into speech instructions dataset and chunk max to 30 seconds because most of speech encoder use for LLM come from Whisper Encoder. We highly recommend to not include AMI test set from both AMI-IHM and AMI-SDM in training set to prevent contamination. This dataset supposely to become a speech diarization benchmark. how to prepare the dataset huggingface-cli… See the full description on the dataset page: https://huggingface.co/datasets/mesolitica/Speaker-Diarization-Instructions.audio100K<n<1M0 likes142 downloads1y agoHugging Face04fcanercan /diarization-sound-filesaudio1K<n<10K0 likes131 downloads2mo agoHugging Face05noty7gian /synthetic-multilingual-speaker-diarization Synthetic Multilingual Speaker Diarization Dataset This dataset contains synthetic multilingual speaker diarization data with Hindi, English, and Punjabi audio samples. Dataset Structure ├── audio/ # WAV audio files (16kHz) - 3417 files ├── all_samples_combined.csv # Complete dataset annotations (with silence) └── all_visible_combined.csv # Visible dataset annotations (without silence) Statistics Total samples: 3417 audio… See the full description on the dataset page: https://huggingface.co/datasets/noty7gian/synthetic-multilingual-speaker-diarization.audioautomatic-speech-recognition1K<n<10K0 likes109 downloads1y agoHugging Face06tnd-ai /speaker-diarization-rawgatedaudio10K<n<100K0 likes104 downloads22d agoHugging Face07diarizers-community /synthetic-speaker-diarization-dataset-fa-3000audioaudio-classification1K<n<10K3 likes98 downloads1y agoHugging Face08Rangasuthan /tamil-english-podcast-diarization Tamil-English Code-Mixed Podcast Diarization Dataset Dataset Summary This dataset contains long-form Tamil-English code-mixed podcast recordings annotated for speaker diarization research. The recordings consist of natural conversational speech with multiple speakers and realistic acoustic conditions, making the dataset suitable for evaluating diarization pipelines in real-world scenarios. The dataset is intended to support research in: Speaker diarization Code-mixed… See the full description on the dataset page: https://huggingface.co/datasets/Rangasuthan/tamil-english-podcast-diarization.audioautomatic-speech-recognitionn<1K1 likes98 downloads8mo agoHugging Face09Beijuka /luganda_callhome_diarization_dataset_MHDPaudion<1K0 likes88 downloads7mo agoHugging Face10tezuesh /diarization_datasetaudion<1K0 likes87 downloads2y agoHugging Face11Venkatesh4342 /pyannote-hindi-diarizationaudio1K<n<10K1 likes85 downloads2y agoHugging Face12atiyehghm /shemo_diarization_datasetaudio1K<n<10K1 likes81 downloads3mo agoHugging Face13DimQ1 /sortformer-diarization-test-set Sortformer Diarization Test Set 100 real speech samples extracted from LibriSpeech test-clean for speaker diarization testing and benchmarking with NVIDIA Sortformer 4spk-v2 ONNX models. Usage with Sortformer ONNX from huggingface_hub import snapshot_download import soundfile as sf # Download the test set dataset_path = snapshot_download("DimQ1/sortformer-diarization-test-set") # Load audio audio, sr = sf.read(f"{dataset_path}/audio/ls_real_000.wav")… See the full description on the dataset page: https://huggingface.co/datasets/DimQ1/sortformer-diarization-test-set.audioaudio-classificationn<1K0 likes65 downloads3mo agoHugging Face14niobures /synthetic-speech-diarization-ru synthetic-speech-diarization-ru Synthetic speech diarization dataset in Parquet format. Dataset Details Number of tracks: 2000 Sampling rate: 16000 Hz Audio format: Embedded in Parquet files (Audio feature compatible) Storage: Parquet format for efficient loading Dataset Structure The dataset contains audio tracks with speaker diarization annotations, stored directly in Parquet format. Features audio: Audio waveform (Audio feature with array and… See the full description on the dataset page: https://huggingface.co/datasets/niobures/synthetic-speech-diarization-ru.tabularautomatic-speech-recognition1K<n<10K0 likes59 downloads5mo agoHugging Face15Beijuka /callhome-eng-diarizationaudion<1K0 likes56 downloads1y agoHugging Face16diarizers-community /synthetic-speaker-diarization-datasetaudio1K<n<10K2 likes50 downloads2y agoHugging Face17upb-nlp /echo-synthetic-diarization Echo (Synthetic Set for Diarization) This dataset is a synthetic dataset generated for evaluation of speaker diarization models. It contains approximately two hours of speech data, each file 60 seconds long, with and without overlap, with 2--5 speakers per file. This dataset has been built using Echo. audiovoice-activity-detectionn<1K0 likes48 downloads10mo agoHugging Face18shreyaskal3 /synthetic-speaker-diarization-dataset-hindiaudion<1K0 likes43 downloads2y agoHugging Face19okadahiroaki /voicevox-diarization-ja VOICEVOX合成 多話者日本語音声(話者分離検証用データセット) Qwen3-ASR の話者分離ファインチューニング検証、特に embedding層+projectorのみの学習で話者分離が学べるか を確かめるために作成した、正解ラベルが厳密な合成データです。 作り方 gemma(gemma-4-31B-it)で話題別のモノローグ日本語テキストを生成 文単位に分割し、各文境界で確率0.3で話者を切替(2〜3話者) 各文を割当てた VOICEVOX 話者で音声合成し連結 → 合成由来なので、各文の [開始秒, 終了秒] と話者が完全に既知(人手や別ASRに依存しない厳密ラベル)。 規模 698クリップ、各 約2分、opus (24kbps) / 16kHz 相当 mono 2話者 約88% / 3話者 約12% 話者は各クリップ内の登場順に spk_0, spk_1, spk_2 と採番 列 (data.jsonl) 列 内容… See the full description on the dataset page: https://huggingface.co/datasets/okadahiroaki/voicevox-diarization-ja.audioautomatic-speech-recognitionn<1K0 likes43 downloads3mo agoHugging Face20TomRoma /ENNI_speaker_diarizationaudio10K<n<100K0 likes35 downloads1y agoHugging Face21HadronNOOB /synthetic-diarization-italian-augmentedaudion<1K0 likes34 downloads9mo agoHugging Face22bitwisemind /Bengali_Speaker_Diarization_Datasetaudion<1K0 likes29 downloads8mo agoHugging Face23palli23 /Spjallromur-AB-Diarization-test Dataset Card — Spjallrómur AB Diarization Test Set Dataset Description Spjallrómur AB Diarization Test Set is a curated test set for speaker diarization evaluation on conversational Icelandic speech. It is derived from the Spjallrómur 26.03 corpus by merging the two separate recording channels (A and B) into single mixed-audio files, producing a realistic diarization benchmark with known ground-truth speaker turns. The test set was compiled as part of the Almannarómur… See the full description on the dataset page: https://huggingface.co/datasets/palli23/Spjallromur-AB-Diarization-test.audion<1K0 likes27 downloads5mo agoHugging Face24Samyak29 /synthetic-speaker-diarization-dataset-hindi-largeaudion<1K1 likes24 downloads2y agoHugging Face25alexandreacff /librispeech-synthetic-speaker-diarization-datasetaudio1K<n<10K0 likes23 downloads1y agoHugging Face26woodygan /CATS-ami-speaker-diarization-audioaudio1K<n<10K0 likes22 downloads2y agoHugging Face27uncleMehrzad /synthetic-speaker-diarization-dataset-fasynthetic dataset generated from persian common voice. audion<1K1 likes22 downloads1y agoHugging Face28sussorg /diarization-ONS-ground-truthaudio1K<n<10K0 likes22 downloads1y agoHugging Face29Mohaddz /sada-diarization-previewgated SADA 2022 Arabic Diarization Training-ready speaker-attributed ASR windows derived from SADA 2022. The source recordings are mirrored at khaledalganem/sada2022. Splits train: 36,004 windows, 202.064 hours, 4,062 recordings validation: 853 windows, 4.774 hours, 88 recordings test: 901 windows, 5.006 hours, 111 recordings Total: 37,758 windows and 211.844 hours. The official SADA train, validation, and test partitions are preserved. Windows are 8–28 seconds… See the full description on the dataset page: https://huggingface.co/datasets/Mohaddz/sada-diarization-preview.audioautomatic-speech-recognition10K<n<100K0 likes22 downloads2mo agoHugging Face30Khanh17 /training-diarizationaudio1K<n<10K0 likes20 downloads2mo agoHugging Face

Listings come live from the Hugging Face Hub API. Team Ai does not host these files.