说话人识别
李梦超
3
月
20
日
1.
基本原理
说话人识别系统框图
分为训练阶段和识别阶段
在训练阶段,系统对说话人的每段语音进行训练,得到每个说话人的模型参量的参考集。
在识别阶段,系统对待识别说话人语音处理,得到其模型参量,然后与训练时候得到的参考集加以比较,并根据一定的相似性准则进行判断。
2.
预处理
采样量化
预加重,通过一个一阶高通滤波器来作预加重以凸显高频部分,其传递函数为:
,一般
a
的取值
左右。
分帧,一般取
256
点为一帧(
32ms
)帧与帧之间重叠
128
个点,这样来避免帧与帧之间的特性变化过于剧烈。
加窗,针对每帧乘以汉明窗以消除帧两端的不连续性,避免分析时受到前后帧的影响。
让每帧通过低通滤波器,可以去除异常高起的噪声。
3.
特征提取
特征提取方法一般有:
线性预测系数(
LPC
)
LPC
倒谱系数(
LPCC
)
线谱对参数(
LSP
)
共振峰率(前三个共振峰)
短时谱
Mel
频率倒谱系数(
MFCC
)
感知线性预测(
PLP
)
线性预测系数(
LPC
)
可以将语音信号
x(n)
看作由一个输入序列
u(n)
激励一个全极点的系统
H(z)
而产生的输出。
模型化为:
系统的传递函数为: (
AR
模型)
定义
p
阶线性测器
F(z):
预测值
:
由于
AR
模型是在最小均方意义上对数据的拟
合,线性预测器
F(z)
一定是一个最佳预测器。
此时,预测器的预测误差短时总能量最小。
预测器的误差
e(n):
定义短时预测均方误差为:
要使
En
最小,必须让
{
ai
}
满足 :
若定义 可得:
可以得到
p
元一次方程组,可以解得
{
ai
}
。
LPC
参数是反映语音信号特征的良好参数。
现在主要对
LPC
的计算方法有:
·Levinson-Durbin
算法
·
协方差法
倒谱系数(
LPCC
)
LPCC
是一个比较重要的特征参数,它能够比
较彻底地去除语音产生过程中的激励信息,
能较好的描述语音信号的共振峰特性。
用 做反傅里叶变换求出
LPC
倒谱系数。
在实际计算中,
LPCC
不是直接计算得到的,
是有
LPC
求得的。
LPCC
系数
c(n)
与
LPC
系数
ai
的递推关系为:
频率倒谱系数(
MFCC
)
Mel
频率表达了一种常用的从语音频率到“感
知频率”的对应关系,
MFCC ( Mel
频标倒谱
系数
)
参数是将人耳的听觉感知特性和语音的
产生的机理相结合,是目前大多数语音识别
中广泛使用的特征参数。
MFCC
和线性频率转换关系如下所示:
MFCC
参数提取流程图如下:
(1)
语音信号经过预加重、加窗分帧处理后变
为短时信号,将时域信号做离散傅里叶变换。
( 2)
求出频谱平方,即能量谱,并通过
Mel
频
率滤波器组滤波处理,得到一组系数 ,
通过对数能量的处理得到对数频谱。
(3)
将上述对数频谱经过离散余弦变换
( DCT)
得到
N
个
Mel
频率倒谱系数。
MFCC
系数为:
4.
说话人识别模型
目前说话人识别技术主流方法大致有:
1
)基于模版模型的方法;
2
)基于概率模型的方法;
3
)基于人工神经网络(
ANN
)的方法;
4
)基于支持向量(
SVM
)的方法。
基于模版模型的方法包括动态时间规正法(
DTW
)和矢量量化法(
VQ
)。
基于概率模型的方法包括隐马尔可夫模型(
HMM
)和高斯混合模型(
GMM
)。
高斯混合模型(
GMM
)
GMM
可以对任意的语音特征分布进行精确的描述,具有快速训练算法,良好的识别性能,被认为是当前较好的说话人识别模型
GMM
是
M
个高斯概率密度的加权和,说话人特征分布并非严格服从某一个特征分布,但是任何分布都可以由高斯分布的加权和来逼近。
高斯混合概率模型表示为:
其中
x
是语音
K
维的特征向量, 是加权系数,
并且: 。
是具有均值矢量 和协方差
矩阵 的高斯概率密度函数。
所以
GMM
的参数是由加权系数,均值矢量,
协方差矩阵来表示成的:
的训练
对于一个长度为
T
的训练语音特征
,
它的
GMM
似然概率表示为:
用
EM
算法来估计
GMM
的参数。
式
1
式
2
式
3
式
4
式
5
这是新估计的
GMM
参数。
EM
算法流程图:
的识别
在识别阶段,假设测试语音特征 ,
识别结果为第
n
个人的后验概率
:
识别结果由最大后验概率给出:
一般情况下,每个人说话的先验概率设为相
等
,
此外,对于每个说话人,
P(X)
都相等。
为了简化计算,采用对数似然函数:
判决结果为: