语音识别技术概述
作者:刘钰 马艳丽 董蓓蓓 论文联盟
编辑
摘要:本文简要介绍了语音识别技术理论基础及分类方式,所采用的关键技术以及所面临
的困难与挑战,最后讨论了语音识别技术的 发展 前景和应用
关键词:语音识别;特征提取;模式匹配;模型训
Abstract:This text briefly introduces the theoretical basis of the speech-
identification technology,its mode of classification,the adopted key technique
and the difficulties and challenges it have to ,the developing
prospect ion and application of the speech-identification technology are
discussed in the last part
Keywords:Speech identification;Character Pick-up;Mode matching;Model trainin
一、语音识别技术的理论基
语音识别技术:是让机器通过识别和理解过程把语音信号转变为相应的文本或命令的高级
技术。语音识别以语音为研究对象,它是语音信号处理的一个重要研究方向,是模式识别
的一个分支,涉及到生 理学 、心理学、语言学、 计算 机 科学 以及信号处理等诸多领
域,甚至还涉及到人的体态语言(如人在说话时的表情、手势等行为动作可帮助对方理
解),其最终目标是实现人与机器进行 自然 语言通信
不同的语音识别系统,虽然具体实现细节有所不同,但所采用的基本技术相似,一个典型
语音识别系统主要包括特征提取技术、模式匹配准则及模型训练技术三个方面。此外,还
涉及到语音识别单元的选取
(一) 语音识别单元的选
选择识别单元是语音识别研究的第一步。语音识别单元有单词(句)、音节和音素三种,
具体选择哪一种,由具体的研究任务决定
单词(句)单元广泛应用于中小词汇语音识别系统,但不适合大词汇系统,原因在于模型
库太庞大,训练模型任务繁重,模型匹配算法复杂,难以满足实时性要求
音节单元多见于汉语语音识别,主要因为汉语是单音节结构的语言,而 英语 是多音节,
并且汉语虽然有大约 1300个音节,但若不考虑声调,约有 408个无调音节,数量相对较
少。因此,对于中、大词汇量汉语语音识别系统来说,以音节为识别单元基本是可行的
音素单元以前多见于英语语音识别的研究中,但目前中、大词汇量汉语语音识别系统也在
越来越多地采用。原因在于汉语音节仅由声母(包括零声母有 22个)和韵母(共有 28
个)构成,且声韵母声学特性相差很大。实际应用中常把声母依后续韵母的不同而构成细
化声母,这样虽然增加了模型数目,但提高了易混淆音节的区分能力。由于协同发音的影
响,音素单元不稳定,所以如何获得稳定的音素单元,还有待研究
(二) 特征参数提取技
语音信号中含有丰富的信息,但如何从中提取出对语音识别有用的信息呢?特征提取就是
完成这项工作,它对语音信号进行分析处理,去除对语音识别无关紧要的冗余信息,获得
影响语音识别的重要信息。对于非特定人语音识别来讲,希望特征参数尽可能多的反映语
义信息,尽量减少说话人的个人信息(对特定人语音识别来讲,则相反)。从信息论角度
讲,这是信息压缩的过程
线性预测(LP)分析技术是目前应用广泛的特征参数提取技术,许多成功的应用系统都采
用基于 LP技术提取的倒谱参数。但线性预测模型是纯数学模型,没有考虑人类听觉系统
对语音的处理特点
Mel参数和基于感知线性预测(PLP)分析提取的感知线性预测倒谱,在一定程度上模拟了
人耳对语音的处理特点,应用了人耳听觉感知方面的一些研究成果。实验证明,采用这种
技术,语音识别系统的性能有一定提高
也有研究者尝试把小波分析技术应用于特征提取,但目前性能难以与上述技术相比,有待
进一步研究
(三)模式匹配及模型训练技
模型训练是指按照一定的准则,从大量已知模式中获取表征该模式本质特征的模型参数,
而模式匹配则是根据一定准则,使未知模式与模型库中的某一个模型获得最佳匹配
语音识别所应用的模式匹配和模型训练技术主要有动态时间归正技术(DTW)、隐马尔可
夫模型(HMM)和人工神经元 网络 (ANN)
DTW是较早的一种模式匹配和模型训练技术,它应用动态规划方法成功解决了语音信号特
征参数序列比较时时长不等的难题,在孤立词语音识别中获得了良好性能。但因其不适合
连续语音大词汇量语音识别系统,目前已被 HMM模型和 ANN替代
HMM模型是语音信号时变特征的有参表示法。它由相互关联的两个随机过程共同描述信号
的统计特性,其中一个是隐蔽的(不可观测的)具有有限状态的 Markor链,另一个是与
Markor链的每一状态相关联的观察矢量的随机过程(可观测的)。隐蔽 Markor链的特征
要靠可观测到的信号特征揭示。这样,语音等时变信号某一段的特征就由对应状态观察符
号的随机过程描述,而信号随时间的变化由隐蔽 Markor链的转移概率描述。模型参数包
括 HMM拓扑结构、状态转移概率及描述观察符号统计特性的一组随机函数。按照随机函数
的特点,HMM模型可分为离散隐马尔可夫模型(采用离散概率密度函数,简称 DHMM)和连
续隐马尔可夫模型(采用连续概率密度函数,简称 CHMM)以及半连续隐马尔可夫模型
(SCHMM,集 DHMM和 CHMM特点)。一般来讲,在训练数据足够的,CHMM优于 DHMM和
SCHMM。HMM模型的训练和识别都已研究出有效的算法,并不断被完善,以增强 HMM模型的
鲁棒性
二、语音识别的困难与对
目前,语音识别方面的困难主要表现在:论文联盟 编辑
(一)语音识别系统的适应性差,主要体现在对环境依赖性强,即在某种环境下采集到的
语音训练系统只能在这种环境下应用,否则系统性能将急剧下降;另外一个问题是对用户
的错误输入不能正确响应,使用不方便
(二)高噪声环境下语音识别进展困难,因为此时人的发音变化很大,像声音变高,语速
变慢,音调及共振峰变化等等,这就是所谓 Lombard效应,必须寻找新的信号分析处理方
法
(三)语言学、生 理学 、心理学方面的研究成果已有不少,但如何把这些知识量化、建
模并用于语音识别,还需研究。而语言模型、语法及词法模型在中、大词汇量连续语音识
别中是非常重要的
(四)我们对人类的听觉理解、知识积累和学习机制以及大脑神经系统的控制机理等分面
的认识还很不清楚;其次,把这方面的现有成果用于语音识别,还有一个艰难的过程
(五)语音识别系统从实验室演示系统到商品的转化过程中还有许多具体问题需要解决,
识别速度、拒识问题以及关键词(句)检测技术等等技术细节要解决
三、语音识别技术的前景和应
语音识别技术 发展 到今天,特别是中小词汇量非特定人语音识别系统识别精度已经大于
98%,对特定人语音识别系统的识别精度就更高。这些技术已经能够满足通常应用的要
求。由于大规模集成电路技术的发展,这些复杂的语音识别系统也已经完全可以制成专用
芯片,大量生产。在西方 经济 发达国家,大量的语音识别产品已经进入市场和服务领
域。一些用户交机、电话机、手机已经包含了语音识别拨号功能,还有语音记事本、语音
智能玩具等产品也包括语音识别与语音合成功能。人们可以通过电话网络用语音识别口语
对话系统查询有关的机票、 旅游 、银行信息,并且取得很好的结果
语音识别是一门交叉学科,语音识别正逐步成为信息技术中人机接口的关键技术,语音识
别技术与语音合成技术结合使人们能够甩掉键盘,通过语音命令进行操作。语音技术的应
用已经成为一个具有竞争性的新兴高技术产业
参考 文献
[1]科大讯飞语音识别技术专栏. 语音识别产业的新发展. 企业 专栏.通讯世界,:
(总 l12期
[2]任天平,门茂深.语音识别技术应用的进展.科技广场.河南科技,:19-2
[3]俞铁城.科大讯飞语音识别技术专栏.语音识别的发展现状.企业专栏.通讯世界,
(总 122期
[4]陈尚勤等.近代语音识别.西安: 电子 科技大学出版社,199
[5]王炳锡等.实用语音识别基础.Practical Fundamentals of Speech Recognition.北
京:国防 工业 出版社,200
[6](美)L.罗宾纳.语音识别基本原理.北京:清华大学出版社,199