标题
  • 标题
  • 作者
  • 关键词

THUYG-20:免费的维吾尔语语音数据库

2017-02-15分类号:TN912.34;TP311.13

【作者】艾斯卡尔·肉孜  殷实  张之勇  王东  艾斯卡尔·艾木都拉  郑方  
【部门】清华大学计算机科学与技术系清华信息科学技术国家实验室信息技术研究院  新疆大学信息科学与工程学院  
【摘要】语音数据资源是语音识别研究的基础。当前国内只有为数不多的开放的语音数据库供研究者免费使用,特别是在维吾尔语等少数民族语音识别方面,数据资源更为贫乏。该文发布一个完全免费的维吾尔语连续语音数据库,该数据库包括约20h的训练数据和1h的测试数据,同时介绍了构建维吾尔语语音识别系统所需要的音素集、词表、文本数据等相关资源,以及用于构建基线系统的脚本。给出了该基线系统在纯净测试数据和噪声测试数据上的识别性能。该数据库为维吾尔语语音识别研究提供了可以借鉴的标准数据库。
【关键词】语音识别  维吾尔语  语料库  深度神经网络(DNN)
【基金】国家自然科学基金项目(61271389,61371136);; 国家“九七三”重点基础研究发展计划(2013CB329302)
【所属期刊栏目】清华大学学报(自然科学版)
文献传递