-1-
中国科技论文在线
基于多分辨率分析的特征波形分解与重构
算法
王晶,那兴宇,谢湘,匡镜明
(北京理工大学信息与电子学院,北京 100081)
摘要:基于多分辨分析的思想,用双正交小波滤波器组对波形内插编码中提取的特征波进行
多级分解和重构。二维特征波表面被分解为一系列时间分辨率递减的波平面,可以利用人耳
对缓变和快变成分的感知重要性不同对各层的特征波形幅度谱进行不同精度的量化,相对于
传统的低通滤波波形分解过程能够更好地对特征波序列进行多尺度的描述,有利于增强编码
效果。借助基于时域设计的最小相位滤波器对特征波平面进行多级分解与重构,解决了用小
波变换方法产生较大延迟的问题,有利于实时编码。
关键词:波形内插;特征波形分解;多分辨率分析;小波变换
中图分类号: 文献标识码:A
Characteristic waveform decomposition and reconstruction
algorithm based on multi resolution analysis
Wang Jing, Na Xingyu, Xie Xiang, Kuang Jingming
(School of Information and Electronics, Beijing Institute of Technology, Beijing 100081, China)
Abstract: A characteristic waveform (CWs) decomposition and reconstruction algorithm using
biorthogonal wavelet filters based on multi resolution analysis theory is presented. The characteristic
waveform surface is decomposed into a series of reduced time resolution surfaces. This multi-scale
characteristic leads to more efficient quantization by exploiting each surface’s perceptual importance
and inherent transmission rate requirements. The multi-scale analysis of the CWs can improve the
coding effect compared with the classical waveform interpolation coder. Further, using the minimum
phase filter based on the time domain design instead of the wavelet filters can solve the long delay
problem and benefits to the real-time application.
Key words: waveform interpolation; characteristic waveform decomposition; multi resolution analysis;
wavelet transform
0 引 言
特征波形内插(CWI,characteristic waveform interpolation)0 是低速率语音编码领域一
种很有潜力的算法,在 2kbit/s~4kbit/s 码率上性能表现良好。它将语音信号表示为渐变的二
维特征波平面,以一定的波形提取速率获得特征波序列(CWs,characteristic waveforms),
将 CWs 分解为慢渐变波(SEW,slowly evolving waveform)和快渐变波(REW,rapidly
evolving waveform),分别表示语音信号中的准周期成分和噪声成分,并根据人耳对 2 种渐
变波形不同的感性特点分别进行量化编码,增强了编码效率。波形分解过程大多采用线性相
位 FIR 滤波的方式,由于简单的一层滤波分解过程及滤波器的非理想性,对分解后的 SEW
和 REW 进行下采样量化可能使合成语音产生过多的 REW(引起噪声)或者过多的 SEW(引
起嗡嗡声)0。由此,引入多分辨率分析(MRA,multi resolution analysis)的思想对二维特
征波表面进行多级分解,形成不同的时频分辨率空间,更符合人耳感知特性,有利于量化编
码。
首先对基于小波变换的多分辨率分析理论0进行了研究,用 B 样条小波函数得到的双正
基金项目:国家自然科学基金(61001188);高等学校博士学科点专项科研基金(20101101110020)
作者简介:王晶(1980- ),女,讲师,主要研究方向:语音信号处理,
-2-
中国科技论文在线
交小波滤波器组对特征波序列进行 3 级小波分解及重构。特征波表面在波形演变域被分为不
等宽的子带,每个子带的特征波序列具有不同的采样率,频域的量化精度亦不同,由此构建
的基于小波变换的特征波形分解与重构算法可以得到较好的语音质量,且适合于语音存储和
分级编码应用。借助于基于时域设计的低延迟 FIR 滤波器组解决了双正交小波滤波器带来较
大系统延迟的问题,如此可以实时应用基于多分辨分析的特征波分解与重构算法。
1 小波变换特征波形分解
基于小波变换的波形分解
传统的 CWI 编码器00对输入的窄带语音通过线性预测 LP 分析得到预测残差,特征波形
CWs 从残差信号中根据内插的基音周期进行提取,提取速率为 400Hz(对于 20ms 帧,即为
每帧 8 个特征波形)。时域的特征波形可以用频域的离散傅里叶级数 DTFS 表示为
[ ]⎣ ⎦ π2)(0,)sin()()cos()(),(
2/)(
1
≤⋅≤+= ∑
=
φφφφ
nP
k
kk knBknAns , (1)
其中{Ak}和{Bk}为 DTFS 系数;P(n)为每点的基音周期(即 CW 长度)。可对每个提取的特征
波进行相位对齐和功率归一化后进行波形分解。
基于小波变换的波形分解的过程即对随时间变化的每维 DTFS 系数 Ak(n)和 Bk(n)进行离
散小波变换,从多分辨率分析的角度讲,就是用分析小波对应的滤波器组进行逐级的高低通
滤波和下采样,从而得到不同分辨率下的小波变换系数。小波分解的细节部分,相当于 CWs
中的快变成分,时间分辨率高,频率分辨率低;而粗略部分(慢变成分)则相反,同时符合
人耳对语音信号的听觉感知特性。因提取的 CWs 不等长(各提取点基音周期不同
1, 2, ..., ( ) / 2k P n= ⎢ ⎥⎣ ⎦ ),所以在进行小波波形分解前首先对每个参与运算的 CW 进行维数调
整。将 DTFS 系数转化为幅度和相位,并分别对 CWs 的幅度谱和相位谱进行多级小波分解,
这样可以减少各层间的相位干扰,且编码端可以不传输相位信息。
小波滤波器组
为了获得线性相位滤波和对二维特征波表面的无失真分解与重构,采用由 B 样条函数
推导出的双正交小波滤波器组0。定义 H0(z)和 H1(z)为分析滤波器组,G0(z)和 G1(z)为合成滤
波器组,则 H0(z)和 G0(z) 对应多分辨率分析中的尺度函数,产生低通滤波效应;H1(z) 和 G1(z)
对应小波函数,产生高通滤波效应,滤波器皆为线性相位 FIR 滤波器。为了防止混叠,分析
与合成滤波器有如下关系:
)()(),()( 0110 zHzGzHzG −−=−= 。 (2)
双正交 B 样条小波滤波器有不同的阶数组合,相应于不同消失矩的小波,折中考虑小
波分析的效果及系统延迟,采用有效长度为 8 的低通分解滤波器和有效长度为 4 的高通分解
滤波器。如此,一级分析合成滤波器在获得较准确谱特征的同时也引入了 7 个样点的系统延
迟(对应 CWI 算法中 7 个特征波提取点)。分析滤波器组的传输函数为:
5432
1
7654
321
0
)(
)(
−−−−
−−−−
−−−
+−+−=
+−−+
+−−=
zzzzzH
zzzz
zzzzH
。 (3)
鉴于 CWs 的提取速率设置为 400 Hz,即二维特征波表面的初始演变带宽为 200 Hz,每
-3-
中国科技论文在线
级分解后带宽降为一半,所以系统最大可分级数为 3 级,用分析滤波器组依次对每级的低通
部分进行分解。CWs 的 3 级小波分解框图如图 1 所示,图中 highpass 表示高通滤波结果,
lowpass 表示低通滤波结果,highpass1、highpass2、highpass3 和 lowpass3 依次形成了相应的
多分辨率空间。每级分解得到的 CWs 以相应的更新速率对幅度谱进行量化编码传输。随着
分解级数的增加,highpass、highpass2、highpass3 和 lowpass3 的 CWs 更新速率依次为 200、
100、50 和 50 Hz。相位信息可以不传输,对幅度与相位的逐层分别分解与重构过程使得各
级的相位信息能够以固定或随机的形式在最后一级加入。幅度谱的量化随着级数的增加(更
新速率的降低)精度也增加,各层分解的幅度谱根据人耳感知重要性用不同比特的变维矢量
量化,幅度谱的感知重要性及量化精度的关系为 lowpass3>highpass3> highpass2> highpass1,
量化码本分层训练获得,且实验发现 highpass1 对感知影响不大,速率要求低的场合可以不
传输。
H0(z) 2 H0(z) 2 H0(z) 2
H1(z) 2
H1(z) 2
H1(z) 2
CWs幅度谱 lowpass3
highpass3
highpass2
highpass1
各层幅
度谱量
化编码
传输
图 1 CWs 的小波分析多级分解框图
Fig. 1 Multistage waveform decomposition of CWs
2 小波变换特征波形重构
特征波形重构过程即是用相应合成滤波器组对各级多分辨率空间进行逐级上采样和高
低通滤波,本文采用幅度和相位逐层分别重构的方式,独立恢复各层对应的原始信号空间信
息,尽量减少各层间的影响,相位信息则在最后一级加入。重构系统如图 2 所示,其中 L
为滤波器对的样点延迟。为了保持各级信号的同步,先分解的高通部分信号(外层)需要进
行相应的延迟与后分解得到各层信号(内层)同步,且层数越多延迟越大。
G0(z) `2 G0(z) `2 G0(z)
`2
G1(z) `2 G0(z) `2 G0(z)
`2
`2
G1(z)
z-L
z-3L
幅
度
谱
G1(z) `2 `2 G0(z)
lowpass3
highpass3
highpass2
highpass1
随 机
相 位
if g< 固 定相 位
if g>
图 2 CWs 的小波分析多级重构框图
Fig. 2 Multistage waveform reconstruction of CWs
各层的单独重建可以对每层相位调整而不影响其他层,对于最内层 lowpass3 一路可以
采用固定的相位模型,而细节部分的 highpass1、highpass2 和 highpass3 则采用随机相位。实
验发现,对于低通 lowpass3 部分,类似于传统 CWI 分解中慢变波成分,当语音帧表现出强
快变特性时(例如清音帧),其重构过程不宜采用固定相位模型。用基音预测增益 g 来判断
lowpass3 的重构相位形式,若第 3 级的 g<,则 lowpass3 重建幅度谱与随机相位结合恢复
DTFS 系数。基音预测增益 g 的计算如式(4)所示,其中,s 为输入语音帧,Lf为帧长,T 为
相应的预测基音周期。
-4-
中国科技论文在线
1
0
1 1
2 2
0 0
( ) ( )
min ,
( ) ( )
f
f f
L T
i
L T L T
j k
g
s i s i T
s j s k T
− −
=
− − − −
= =
=
+
+
⎧ ⎫⎪ ⎪⎪ ⎪⎨ ⎬⎪ ⎪⎪ ⎪⎩ ⎭
∑
∑ ∑
。 (4)
3 系统延迟问题的解决
采用双正交小波滤波器进行特征波形分解与重构,理论上具有较好的线性相位和完全重
建特性,对于信号分解及重建过程不产生失真影响,但明显的缺点是系统延迟较大,且随着
分解级数的增加而加大。滤波器组产生的总系统延迟为 (2N-1)L,这里 N 为分解与重构的级
数。本文小波分解及重构过程 N=3,L=7,由波形分解与重构过程引起的系统总延迟为 49
个样点,对应特征波提取过程即产生 49 个提取点延迟,对于 400 Hz 的波形提取速率则为
ms 时间延迟。延迟的多级分解和重构 CWI 编码器并不适于实时编码传输的应用,一
个降低延迟的可能办法就是对内层设计新的低延迟滤波器,且尽量不引入较大的相位失真。
与双正交小波分析的算法相比,可产生相当的编码质量。
Nayebi 等采用一种基于时域的完全重建 FIR 滤波器的设计方法[4-5],由最小相位开始的
滤波器设计低延迟的多带 FIR 滤波器组,使得系统延迟能够独立于分析与合成滤波器长度,
当多带滤波器组的抽取因子为 R 时,最小延迟为 R-1。采用 8 抽头延迟为 1 的二带滤波器组
替代小波分析滤波器组,分解用到的低通和高通滤波器 H0(z)和 H1(z)的滤波器系数如表 1 所
示。
表 1 基于时域设计的 8 抽头延迟为 1 的二带滤波器系数
Table 1 Two-band filter coefficients of delay 1 with 8 taps based on temporary design
n 0 1 2 3 4 5 6 7
H0
H1
通过防混叠的关系式(2)可得到相应的合成滤波器组 G0(z) 和 G1(z)的滤波器系数:
0 1 1 0( ) ( 1) ( ) ( ) ( 1) ( )
n ng n h n g n h n− −= − = − −, 。 (5)
分析与合成低通滤波器 H0(z) 和 G0(z)的频率响应和群延迟如图 3 和图 4 所示。
图 3 低延迟 8 抽头的低通 FIR 滤波器幅度响应
Fig. 3 Magnitude respond of a low delay low-pass FIR filter with 8 taps
-5-
中国科技论文在线
0
-14
-12
-10
-8
-6
-4
-2
0
2
归一化频率
群
延
迟
(样
点
)
图 4 低延迟 8 抽头的低通 FIR 滤波器群延迟
Fig. 4 Group delay of a low delay low-pass FIR filter with 8 taps
低延迟 FIR 滤波器冲击响应具有最小相位模式,但不具有线性相位,在通带内群延迟曲
线波动不大,减少了对系统的相位失真。此外,降低延迟会使阻带的衰减变慢,对滤波效果
会有一定的影响。为了保持分析与合成滤波系统的总增益为 1,实际使用时需要在滤波器系
数前乘上增益因子 2 。经过三级分解与重构后,由波形分解与重构过程引起的系统总延迟
降低为 7 个波形提取样点,即 ms,有利于实时应用。
4 性能比较
实验系统设计
波形内插编码器输入窄带语音分析帧长为 20 ms,波形提取速率为 400 Hz(即每帧提取
8 个特征波形),LP 系数转化为线谱频率 LSF 参数用 20 bit 的一阶预测分裂矢量量化;基音
周期用 7 bit 标量量化;功率因子降采样到每帧 2 个,分别用 4 bit 的对数域差分标量量化。
原始的基于 1 次低通滤波波形分解的方法中,每帧 4 个 REW 采用 VDVQ 的方法分别用 3
比特矢量量化;每帧 2 个 SEW 采用变维分裂矢量量化,幅度谱分裂为 3 个频带:0~1 kHz、
1~2 kHz 和 2~4 kHz,分别用 8、3、3 比特量化;在清音或清浊过渡段,SEW 的固定相位谱
可能会造成合成语音过强的周期性,根据慢渐变波和快渐变波的功率比 Re=ESEW/EREW来决
定 SEW 的相位谱采用随机相位或是固定相位。当 Re< 时认为噪声分量占主导作用而采用
随机相位,形成 kbit/s 的 CWI 算法,音质要远好于 FS1016 的 kbit/s CELP 编码器。
当采用基于小波变换的特征波形分解和重构算法时,对 CWs 的幅度谱进行三级分解。
第 3 级分解得到的 lowpass3 对应每帧 1 个特征波形,用类似 SEW 的量化方法进行 14 bit 的
变维分裂矢量量化;highpass3 对应每帧 1 个特征波形用 10 bit 的 VDVQ 方法量化;第 2 级
分解的 highpass2 对应每帧 2 个特征波形,分别用 6 bit 的 VDVQ 方法量化;第 1 级分解得
到的 highpass1 忽略不传输,相位信息不传输而在解码端由固定或随机相位代替,形成的基
于多分辨率分析的小波波形内插算法码率为 kbit/s,主观听音上音质要好于原始的基于一
级低通滤波方法的 CWI 编码效果。
实验结果
本文利用 perceptual evaluation of speech quality(PESQ)[7]对窄带语音的感知客观测试
方法得到 mean opinion score(MOS)结果,给出语音质量的客观比较。评测用的 16 句窄带
语音样本(4 女 4 男发声)取自于 NTT-AT 标准汉语语音库,PESQ 以类似于整段语音平均
感知信噪比的结果给出对应的近似主观 MOS 值,MOS 越大表明语音质量越好。本文设置
-6-
中国科技论文在线
PESQ 的参考语音样本为未经量化的波形内插编码器输出语音,失真语音样本设置为参数经
编码量化后的输出语音,得到的 MOS 值平均结果如表 2 所示。
表2 语音质量PESQ_MOS对比结果
Table 2 Comparison result of speech quality PESQ_MOS test
原始 kbit/s CWI 基于小波分析的
kbit/s CWI
采用低延迟滤波的
多分辨分析CWI
女声发音语句MOS
男生发音语句MOS
所有语句MOS
可以看出,本文基于小波变换的特征波形分解与重构算法重新设计的波形内插编码器,
对各层得到的幅度谱根据感知重要性进行量化编码,与传统的基于低通滤波波形分解的特征
波形内插编码器相比,在码率相同的情况下,能够获得更好的语音质量。实验发现,当码率
进一步下降到 3 kbit/s 左右也能获得可接受的合成音质。在不考虑实时应用的情况下,这种
基于小波变换的波形内插编码器非常适合于高质量低压缩比的语音存储场合以及可分级编
码的应用。此外,用最小相位 FIR 滤波器构成的分析合成滤波器组对特征波序列进行多分辨
率的分解与重构对合成语音质量影响较小,参数量化后的合成音质相对使用双正交小波滤波
器时的失真在听觉上可允许,实时应用场合下可考虑用低延时 FIR 滤波器替代小波滤波器。
5 结论
对 CWI 编码中的特征波序列采用多分辨分析的思想进行分解与重构,相对于传统的低
通滤波波形分解方法更有利于描述二维特征平面,可获得更好的编码质量。在基于小波变换
的波形分解和重构算法中,采用 B 样条的双正交小波滤波器组可以获得线性相位和无失真
重构特性,编码端得到的各层幅度谱具有不同的时间分辨率和频率分辨率,对幅度谱的量化
精度由内层到外层逐步降低,解码端采用对幅度谱和相位谱进行逐层分别重构的方法,可以
不传输相位信息,而用固定或随机相位替代。鉴于小波变换方法存在较大系统延迟的问题,
用基于时域方法设计的最小相位 FIR 滤波器对特征波形进行多分辨率分析,在对编码质量产
生较小影响的同时能使系统总延迟大大降低,能够实时应用多分辨分析的波形分解方法。进
一步设计了基于多分辨率分析的可分级的特征波形内插编码算法,使波形内插编码器具有可
分级的变速率编码效果。
[参考文献](References)
[1] Kleijin W B, Haagen J. Waveform interpolation for coding and synthesis [M]. Kleijin W B, Paliwal K K,
Speech coding and synthesis. Amsterdam, Elsevier, 1995.
[2] Eddie L T C. Waveform interpolation speech coder at 4kbit/s [D]. Montreal: McGill University, 1998.
[3] 杨福生.小波变换的工程分析与应用[M]. 北京:中国科学出版社, 1999.
Yang Fusheng. Wavelet transform and application of engineering analysis [M]. Beijing: Science Press, 1999. (in
Chinese)
[4] Nayebi K, Barnwell T P, Smith M J T. Time domain filter bank analysis: a new theory [J]. IEEE Trans Sig Proc,
1992, 40(6): 1412-1429.
[5] Nayebi K, Barnwell T P, Smith M J T. Low delay fir filter banks: design and evaluation [J]. IEEE Trans Sig
Proc, 1994, 42(1): 24-31.
[6] Chong N R, Burnett I S, Chicharo J F. A new waveform interpolation coding scheme based on pitch
synchronous wavelet transform decomposition [J]. IEEE Trans Sig Proc, 2000, 8(3): 345-348.
[7] ITU-T . —2001. Perceptual evaluation of speech quality (PESQ): an objective method for end-to-end
speech quality assessment of narrow-band telephone networks and speech codecs [S]. 2001.