Team Ai
Datasetpublicgated

panlr/teochew_wild

Teochew-Wild:首个正字标注的野外潮州话数据集 中文 | English 本数据集(Teochew-Wild)是从网络上发音清晰、噪声较少的音视频内容中获取的,原始音视频的数据来源为:民生新闻、潮汕讲古、地方电视节目、故事书、抖音自媒体口播等,我借鉴了Emilla提出的数据集自动处理流水线,对原始数据进行归一化、降噪和剪切(部分自动剪切效果差的使用手工修正); Teochew-Wild总共包括20个发音标准、念错率低的潮汕母语说话人、共12500条音频片段,包含潮州市区、汕头市区、澄海、榕江音、潮安南部等多个区域的口音,语料内容覆盖书面用语与口头用语,并同时提供正字和拼音标注,是首个公开可用、标注准确率高的潮州话数据集,主要面向语音识别和语音合成任务。 文件说明 (File Structure Explanation) ├── annotation/ # 标注相关文件夹 │ ├── label_for_qwen_asr/ #… See the full description on the dataset page: https://huggingface.co/datasets/panlr/teochew_wild.

sourceHugging Facecc-by-4.0updated 2d agoView on Hugging Face
50likes285downloads
Dataset Card

No card is published for this repository, or it could not be fetched from Hugging Face right now.