语音技术 1990年代至今

语音合成与古诗文朗读

从机械音到拟人声,语音合成让古词'开口说话'。朗读、听读、跟读,语音技术正在改变诵读这一最古老的语文学习方式。

1 语音合成技术简史

让机器说话,是人工智能最早的研究课题之一。早期的语音合成采用'参数合成'方法:通过分析人的发音机理,用滤波器模拟声带与声道,生成声音。这种声音清晰但机械感很强,语调平直,像电子设备的提示音。

第二代技术是'波形拼接':预先录制大量真人语音片段,合成时按需挑选、拼接起来。这样得到的语音自然度大幅提升,但拼接处容易生硬,且需要庞大的录音库,难以覆盖所有语句。第三代是'统计参数合成',用概率模型生成声学参数,音质平滑但仍有'电子味'。

真正的突破来自神经网络。基于深度学习的语音合成(如 Tacotron、WaveNet 及其后续模型),可以直接从文本生成接近真人的语音,语调自然、停顿得当,还能模仿不同的音色、情绪与语速。今天手机里的语音助手、有声书、导航播报、无障碍朗读,背后大多是这类技术。

2 机器如何读准多音字与古诗

汉语语音合成最棘手的问题是'多音字'。'行'可以读 xíng(行走)也可以读 háng(银行);'长'可以读 cháng(长短)也可以读 zhǎng(成长);'乐'有 lè、yuè 之别。机器必须结合上下文判断读音,这就需要文本分析与语言模型的支持。在古诗文中,难度更大:'远上寒山石径斜'的'斜','乡音无改鬓毛衰'的'衰',在传统诵读中都有特定的读音,若按现代普通话读,会失去原有的押韵效果。

除了读音,还有'韵律'问题。诗歌有平仄、押韵、对仗与固定的节奏(如五言诗的'二二三'停顿、七言诗的'二二三'或'四三'停顿),词有词牌规定的句式与韵位。优秀的朗读要读出这种节奏,在关键处停顿、在韵脚处延长、在情感转折处变化语调。机器要做到这一点,不仅需要语言学知识,还需要对诗歌内容的理解。

为此,研究者建立了带标注的朗读语料库,把停顿、重音、语调等信息标注出来,训练模型学习'如何把一首诗读得像诗'。今天一些朗读应用已经能够区分五言与七言、识别对仗与韵脚,给出相对得体的朗读节奏。

3 朗读、听读与跟读

诵读是中国语文教育最古老的方法。古人读书讲究'口而诵,心而惟',通过出声朗读来体会音韵之美、加深记忆。今天,语音技术为诵读提供了新的可能:任何一段文字都可以即时转为语音,任何一首诗都可以反复聆听,任何一篇文章都可以选择不同语速与音色来读。

'听读'把阅读变成了听觉活动,适合在通勤、运动、家务等不便看屏幕的场景中使用,也为视障读者、低龄儿童与阅读困难者打开了方便之门。'跟读'则更进一步:语音识别技术可以采集学习者的朗读,判断字音是否准确、节奏是否得当、停顿是否合理,并给出反馈。这种'人机对读'的练习方式,弥补了课堂上一对一纠音时间不足的缺憾。

在对外汉语教学中,语音技术尤其有价值。外国学习者最难掌握的是声调与语调,通过跟读评分、声调对比、逐字纠正,可以更直观地看到自己的问题。技术把抽象的'语感'变成了可量化、可反馈的指标。

4 语音技术的边界

机器可以读得准确、清晰,却很难读得有'味道'。一首诗的情感层次——李白的豪迈、杜甫的沉郁、李商隐的隐晦——需要通过语速的微调、气息的控制、音色的变化来传达,这些恰恰是最难建模的部分。技术可以做到'不难听',但要达到名家朗读的水平,还有很长的路。

方言与古音是另一重边界。汉语方言丰富,粤语、闽南语、吴语中保留了大量中古音的信息,用方言诵读古诗,往往比普通话更接近原音。但语音技术对方言的覆盖远不如普通话,资源稀缺、识别困难。至于上古音、中古音的'构拟读音',学界尚在研究,机器更无从谈起。

技术的价值在于辅助而非替代。它可以提供标准的示范、便捷的练习与即时的反馈,但诵读最终是一种身体经验与情感活动。听机器的声音,是为了更好地听见自己读书的声音——那才是语文学习中不可替代的部分。

相关推荐

喜欢「语音合成与古诗文朗读」的人,大多也喜欢 论语·见贤思齐与任重道远