opedromartins/ASR-datasets-ptbr
📚 Datasets de Áudio em Português (PT-BR) Este repositório reúne diversos corpora públicos de fala em português do Brasil, combinados em um único dataset para facilitar treinamentos e pesquisas em ASR (Automatic Speech Recognition). O objetivo é fornecer um recurso amplo, padronizado e de fácil acesso para a comunidade. 📂 Datasets Integrados A tabela abaixo lista todos os datasets incluídos, com suas informações: Dataset Config Name TOTAL train test… See the full description on the dataset page: https://huggingface.co/datasets/opedromartins/ASR-datasets-ptbr.
📚 Datasets de Áudio em Português (PT-BR)
Este repositório reúne diversos corpora públicos de fala em português do Brasil, combinados em um único dataset para facilitar treinamentos e pesquisas em ASR (Automatic Speech Recognition). O objetivo é fornecer um recurso amplo, padronizado e de fácil acesso para a comunidade.
📂 Datasets Integrados
A tabela abaixo lista todos os datasets incluídos, com suas informações:
🗂️ Estrutura do Dataset
O dataset está organizado em configs, onde cada config corresponde a um dataset ou corpora específico. Dentro de cada config, os dados estão divididos nos splits:
traintestvalidation
⚠️ Importante: Apenas os splits originais dos datasets foram mantidos, nem todos os datasets possuem splits de test e validation.
Cada amostra contém os seguintes campos:
audio_filename: nome original do arquivospeaker: identificador do falante, presente apenas quando a informação está disponível no dataset originalaudio: conteúdo do áudiotranscription: transcrição do áudioduration: duração em segundos
🚀 Como Utilizar
O dataset pode ser carregado pelo 🤗 Hugging Face Datasets:
Listar todas as configurações disponíveis
from datasets import get_dataset_config_names
configs = get_dataset_config_names("opedromartins/ASR-datasets-ptbr")
print(configs)Carregar uma configuração específica
from datasets import load_dataset
# Exemplo: carregar todos os splits do CORAA v1.1
ds = load_dataset("opedromartins/ASR-datasets-ptbr", name="coraa-v1.1")
# Apenas o split de treino
ds_train = load_dataset("opedromartins/ASR-datasets-ptbr", name="coraa-v1.1", split="train")Uso em modo streaming
from datasets import load_dataset
ds_stream = load_dataset(
"opedromartins/ASR-datasets-ptbr",
name="coraa-v1.1",
split="train",
streaming=True
)
print(next(iter(ds_stream)))⚖️ Licenciamento
Cada dataset mantém sua licença original. É responsabilidade do usuário verificar e respeitar os termos de uso de cada corpus. Consulte os links das fontes listadas na tabela para mais detalhes.
