Team Ai
Datasetpublic

opedromartins/ASR-datasets-ptbr

📚 Datasets de Áudio em Português (PT-BR) Este repositório reúne diversos corpora públicos de fala em português do Brasil, combinados em um único dataset para facilitar treinamentos e pesquisas em ASR (Automatic Speech Recognition). O objetivo é fornecer um recurso amplo, padronizado e de fácil acesso para a comunidade. 📂 Datasets Integrados A tabela abaixo lista todos os datasets incluídos, com suas informações: Dataset Config Name TOTAL train test… See the full description on the dataset page: https://huggingface.co/datasets/opedromartins/ASR-datasets-ptbr.

sourceHugging Faceupdated 1y agoView on Hugging Face
13likes2.3kdownloads
Dataset Card

📚 Datasets de Áudio em Português (PT-BR)

Este repositório reúne diversos corpora públicos de fala em português do Brasil, combinados em um único dataset para facilitar treinamentos e pesquisas em ASR (Automatic Speech Recognition). O objetivo é fornecer um recurso amplo, padronizado e de fácil acesso para a comunidade.


📂 Datasets Integrados

A tabela abaixo lista todos os datasets incluídos, com suas informações:

DatasetConfig Name**TOTAL**traintestvalidationSpeakerFonte
Todos os Datasets-15774.98 h15650.38 h79.75 h44.85 h--
YODAS-Granaryyodas-granary13423.68 h13423.68 h--❌Fonte
YouTube-Commons-Granaryyoutube-commons-granary806.54 h806.54 h--❌Fonte
CORAA MuPecoraa-mupe365.04 h319.90 h32.90 h12.25 h✅Fonte
CORAA v1.1coraa-v1.1290.53 h273.38 h11.24 h5.91 h❌Fonte
CORAA NURC-SPcoraa-nurc-sp239.23 h224.40 h10.23 h4.60 h❌Fonte
MLSmls168.35 h160.96 h3.74 h3.64 h✅Fonte
TEDxtedx155.91 h152.55 h1.82 h1.54 h✅Fonte
CETUCcetuc144.66 h144.66 h--✅Fonte
CMLcml85.36 h78.09 h3.68 h3.59 h✅Fonte
Common Voice 22common-voice-2251.32 h26.38 h12.90 h12.04 h✅Fonte
Fleursfleurs14.71 h10.18 h3.24 h1.29 h❌Fonte
TTS Portuguese Corpustts-portuguese-corpus10.48 h10.48 h--❌Fonte
Constituição Federalconstituicao-federal8.97 h8.97 h--❌Fonte
Sidneysidney7.28 h7.28 h--✅Fonte
Código de Defesa do Consumidorcodigo-de-defesa-do-consumidor1.42 h1.42 h--❌Fonte
LapsBMlapsbm0.90 h0.90 h--✅Fonte
VoxForgevoxforge0.62 h0.62 h--✅Fonte

🗂️ Estrutura do Dataset

O dataset está organizado em configs, onde cada config corresponde a um dataset ou corpora específico. Dentro de cada config, os dados estão divididos nos splits:

  • —train
  • —test
  • —validation

⚠️ Importante: Apenas os splits originais dos datasets foram mantidos, nem todos os datasets possuem splits de test e validation.

Cada amostra contém os seguintes campos:

  • —audio_filename: nome original do arquivo
  • —speaker: identificador do falante, presente apenas quando a informação está disponível no dataset original
  • —audio: conteúdo do áudio
  • —transcription: transcrição do áudio
  • —duration: duração em segundos

🚀 Como Utilizar

O dataset pode ser carregado pelo 🤗 Hugging Face Datasets:

Listar todas as configurações disponíveis

python
from datasets import get_dataset_config_names

configs = get_dataset_config_names("opedromartins/ASR-datasets-ptbr")
print(configs)

Carregar uma configuração específica

python
from datasets import load_dataset

# Exemplo: carregar todos os splits do CORAA v1.1
ds = load_dataset("opedromartins/ASR-datasets-ptbr", name="coraa-v1.1")

# Apenas o split de treino
ds_train = load_dataset("opedromartins/ASR-datasets-ptbr", name="coraa-v1.1", split="train")

Uso em modo streaming

python
from datasets import load_dataset

ds_stream = load_dataset(
    "opedromartins/ASR-datasets-ptbr",
    name="coraa-v1.1",
    split="train",
    streaming=True
)
print(next(iter(ds_stream)))

⚖️ Licenciamento

Cada dataset mantém sua licença original. É responsabilidade do usuário verificar e respeitar os termos de uso de cada corpus. Consulte os links das fontes listadas na tabela para mais detalhes.