爱数智慧发布中文普通话真·萌童声TTS开源数据集
11月20日,爱数智慧发布中文普通话真·萌童声语音合成(tts)开源数据集。该数据集由真童声录制,为中文童声语音合成数据集子集,时长为15分钟,文本主要为日常用语。据了解,数据集全集包含2235句话,时长超2小时。这也是该童声第一次用于tts录制。
随着智能终端市场的扩张,人机交互逐渐成为与智能世界对话的入口。在人机互动过程中,语音合成(tts)的自然度和表现力是用户最能直观感受到的部分。用户使用智能设备的频率增加,对合成语音的期望值也不断提高。
tts数据是影响语音合成效果的重要因素。由于tts数据的采集和标注要求严格,因而成品数据集较少。从采集环节来看,录音需要在专业的录音棚中进行,并严格控制噪声水平,才能最大限度还原发音人声音。录音过程中还需要有专业的录音师和监听人在场,便于及时矫正录音过程中的错误。从标注环节来看,tts数据标注分为4个层级,包括发音校对、韵律层级、音素边界切分和分词词性。为了充分保留发音人的语义表达和发音习惯,标注准确率要求一般在99%左右。
智能设备使用者“低龄化”趋势明显,从而带动了童声数据的需求。受制于儿童识字水平和配合情况,市面上童声tts数据库数量较少,且多为成年人模仿。童声tts语料库呈现出明显的供需不平衡。
本次爱数智慧发布的tts童声开源数据集采集环境为符合nc-20标准的录音间并根据儿童发音习惯对数据进行转写和全链条标注。考虑到句内停顿和句间停顿对听感的影响,在音素边界切分环节,标注人员除了对声韵母边界进行切分外,还对句中静音段和句首尾进行精准切分。
发音人是影响tts数据质量的重要因素。该数据集的发音人为4岁小朋友妞妞。2019年初,发音韵律好的妞妞在上百位4-6岁小朋友中脱颖而出。因为发音韵律好能为用户带来更好的听感。
在与爱数智慧工作人员接触中,我们了解到妞妞性格活泼开朗,喜欢看冰雪奇缘和小马宝莉。在录制休息期间,想要看动画片时,就会黏着工作人员撒娇。录制工作已经结束很久,工作人员在提起妞妞时,言语间还是充满着浓浓的不舍与赞赏。这份由衷的赞赏,也让我们对这个真·萌童声充满期待!
为智能世界提供充足的数据生产力是这家公司创立的初衷。我们也期待爱数智慧用更多高质量的数据解锁更多应用场景,服务更广域的客户。