- 1 -
中国科技论文在线
一种互信息文本特征选择算法的改进
彭君睿1,徐蔚然2**
作者简介:彭君睿(1990-),男,硕士研究生,文本分类,信息检索
通信联系人:徐蔚然(1975-),男,副教授,信息检索
(1. 北京邮电大学自动化学院;
2. 北京邮电大学模式识别实验室) 5
摘要:文本分类问题中,特征选择是其中很重要的一个环节,互信息方法用于文本特征选择
中的效果相比其他文本特征选择方法并不是很好,主要原因在与其偏向罕见词以及负相关上
不合理,为了提升分类效果,这里对负相关问题进行改进,并从统计可靠性角度出发提出一
种可靠性度量来对偏向罕见词问题加以改进,实验比较了改进后的互信息方法和原始互信息10
方法的效果,并实验了可靠性度量应用于信息增益方法后的效果,实验证明改进方法相比原
始方法有一定的效果提升。
关键词:文本分类;特征选择;互信息;统计可靠性;
中图分类号:
15
one improvement of Mutual Information in feature selection
pengjunrui1, xuweiran2
(1. Automation school,Beijing University of Posts and Telecommunications;
2. Pattern Recognition and Intelligence System Laboratory,Beijing University of Posts and
Telecommunications) 20
Abstract: Feature selection is an important part of text categorization, in order to improve the
effectiveness and performance of classification, this paper proposed a new approach to improve the
Mutual Information based on its shortcomings of inappropriate treatment to negative mutual
information and its heavy reliance on low_frequency reliability is also cosidered. By
comparing the new algorithm and the traditional algorithm,experiments show that new algorithm has 25
better results in text classification and Statistical reliability is effective both in Mutual Information and
Infomartion Gain.
Key words: Text Classification;feature selection;mutual information; Statistical reliability;
0 引言 30
随着计算机和信息技术的飞速发展,我们已经来到了一个信息爆炸的时代,在享受丰富
信息带来的好处的同时,我们也面临着如何方便快捷的从海量信息中寻找自己所需信息这一
难题。近些年来努力解决这些问题的信息检索技术和数据挖掘技术也因此越发受到人们的重
视并得到了飞速的发展。文本分类是信息检索领域和文本挖掘领域的一项核心技术[1],在近35
几十年里同样得到了快速发展。
从原始的人工进行文本分类到现在的基于统计方法和机器学习的自动文本分类,文本分
类技术也逐步走向成熟。K 近邻分类器、决策树分类器、贝叶斯分类器、SVM 等的提出使
得分类的精度日益提升,同时自动文本分类也达到了成熟可用的阶段[2]。
文本特征选择是文本分类过程中的一个重要环节[3],由于当前的文本分类系统中,常常40
采用 VSM 向量空间模型来进行文本表示[4],因此文本表示的特征空间维度非常高,从而降
低了文本分类的效率和精度。文本特征选择算法的目的就是降低特征维度,去除冗余特征,
保留区分性特征,从而提升分类效果。常见的文本特征选择算法有信息增益(IG)、开方校
- 2 -
中国科技论文在线
验(CHI)、互信息(MI)、文档频率(DF)等,其中信息增益和开方校验方法一般效果
较好,文档频率方法次之,互信息的方法一般效果较差[5]。本文主要针对互信息方法的负45
相关缺陷[6]做了改进,并从统计可靠性出发做了进一步的改进,实验证明改进后的互信息
算法比原始互信息算法有一定提升效果,同时发现统计可靠性改进对其他特征选择算法也有
一定效果。
1 互信息特征选择算法
特征选择算法的目的是挑选出比较有区分性对分类任务比较有用的特征,从而降低特征50
维度并提升分类效果。互信息特征选择算法就是考量特征项和类别之间的互信息,认为互信
息越大的话,特征与类别的共现概率也就越大,因此可以根据互信息来挑选出对分类比较有
益的特征。特征 t 与类别 c 的互信息公式如下[5]:
( ) ( )( ) ( )i
i
cptp
ctp
×
∧= logct,MI i (1)
其中 ( )ictp ∧ 为特征项 t 出现在类 ic 中的概率,P(t)为 t 出现的概率, ( )icp 为类别 ic 出55
现的概率。
如果有 m 个类别,那么特征项 t 和 m 个类别分别有 m 个互信息,一般常用的方法是求
平均互信息,平均互信息的计算公式如下[5]:
( ) ( ) ( )( ) ( )∑= ×
∧=
m
i i
i
cptp
ctp
1
i logcptMI (2)
2 互信息特征选择算法的缺点及改进 60
使用互信息方法时计算得到的互信息值的大小能够直接反应该特征与类别直接的相
关性大小,但是互信息公式还有如下两个缺点:
由于互信息计算时没有考虑词频信息,导致最后结果偏向罕见词,而罕见词的可靠性不
高,其中的一部分甚至是噪音,因此降低了互相息方法的效果。
计算互信息时会出现负数,由公式可知,当特征项 t 与类别 c 不相关时,互信息为 0,65
但是当特征项 t 与类别 c 负相关也就是当 t 仅在 c 类别下很少出现时,互信息计算出的值是
负值。按照此计算公式也就是认为负相关反而降低了分类效果。而实际却不是这样,一个仅
出现在少数类别的特征对分类来说其实比较具有区分性。因此需要对互信息公式在此处的缺
陷进行修改。
此外互信息方法仅考虑了特征项与该类别之间的分布关系,没有考虑特征项在类别间的70
分布,而特征项在类别间的分布对分类效果时有影响。
针对上面的不足,对互信息方法进行如下修改:由于 ( )( ) ( )i
i
cptp
ctp
×
∧log 在 ( )ictp ∧ 比较
小而 ( )tp 比较大时,取负值,而且随着 ( )ictp ∧ 的变小以及 ( )tp 的变大而变小。这与实际
不符,当 ( )tp 较大而且 ( )ictp ∧ 较小时,该特征 t 对分类是有区分性的,而且随着 ( )ictp ∧
的变小以及 ( )tp 的变大,特征 t 的区分性更大。因此我们可以对该式取绝对值[6],这样就比75
较合理。此外考虑到互信息公式没有考虑特征项与类别间分布的问题,可以再添加一个考虑
特征项在类别间分布的系数[7],最终改进的公式如下:
- 3 -
中国科技论文在线
( ) ( )( ) ( )
( )
( )ttf
,tf
logct,MI i
i
i
i ct
cptp
ctp
×
∧= (3)
其中 ( )ict,tf 是特征 t 在 ic 中的出现次数, ( )ttf 是特征 t 出现的总次数, ( )( )ttf
,tf ict 考虑
了特征 t 在类别间的分布信息,同时在一定程度上起到削弱了特征 t 较少出现在类别 ic 中时80
带来的互信息的作用,因为我们一般认为特征 t 在类别 ic 中出现次数很多相比出现次数很少
带来的信息量会更多一些。
3 统计可靠性度量
由于文本分类系统大多数是基于统计原理建立的,而统计方法必然会带来一个问题,那
就是统计数据是否可靠。尤其是罕见词,它们的词频较低,数据的可靠性更是值得怀疑,一85
般认为低频词带来信息不如高频词其中一部分原因就是低频词的数据可靠性不高,其中部分
低频词甚至可能是噪音数据。这里提出一种统计可靠性的度量 RS,通过考察对该特征加入
一个随机扰动后对该特征分布的影响状况来衡量特征的统计可靠性。计算公式如下:
( ) ( ) ( )∑
=
−=
m
i
ii tHtPtH
1
RS (4)
( ) )|(lg)|(
1
tCPtCPtH i
m
i
i∑
=
−= (5) 90
其中 H(t)是特征 t 在 m 个类别下概率分布的信息熵[8], ( )itH 是特征 t 在类别 ic 下添加
一次随机扰动带来的出现后在 m 个类别下的概率分布的信息熵。 ( )itP 是特征 t 在 ic 类别下
的概率分布。
计算出来的 RS 值评估了加入一个随机扰动后对原始分布造成的影响,假如 RS 值比较
小,就可以认为该特征对于噪音不是很敏感,所以该特征的数据应该比较可靠。假如 RS 值95
较大,则可以认为该特征对于噪音比较敏感,说明该特征的数据不是很可靠,在进行特征选
择时应该降低该特征的权值。
在应用于特征选择方法改进时,采用的方法就是对原始特征选择方法计算出的值如互信
息特征选择方法时就是对计算出的互信息值减去 RSlg 作为最终进行选择时采用的权值。
100
4 实验及分析
实验设置
为了实验证明改进方法的效果,选择在分类常用的 NEWSGROUP 数据集上进行实验,
比较了特征子集维度大小为原始特征集维度大小不同比例下的结果。实验随机均匀抽取 70%105
的文档作为训练集,将剩下的 30%数据集作为测试集。文本表示采用的是 VSM 向量空间模
型,特征权重采用的是 tf-idf 权重。分类器采用的是线性 SVM 分类器,通过台湾林智仁教
授的 LibLinear 工具包实现[9]。因为在文本这类高特征维度且少量训练样本的场合下,线性
SVM 分类器效果比较好[10]。
实验采用的评价标准为常见的准确率、召回率、以及两者的综合考虑 F1 值。由于110
- 4 -
中国科技论文在线
是多类别问题,这里采用了宏平均的结果。计算公式如下[11]:
宏平均准确率
m
MacroP 1 类别数目
类别文本总数目
数目类别被正确分类的文本∑
==
m
i i
i
C
C
(6)
宏平均召回率
m
MacroR 1 类别数目
类别的文本总数目被分类器判为
数目类别被正确分类的文本∑
==
m
i i
i
C
C
(7)
宏平均F1值
MacroRMacrop
MacroRacroP
+
××= 2M1MacroF (8) 115
实验结果及分析
实验比较了特征子集维度大小为原始特征集维度大小不同比例下的结果。实验结果
图如下:
76
78
80
82
84
86
10% 30% 50% 70% 90% 100%
MI_change_RS
MI_change
MI
IG_RS
IG
特征子集维数占比
准
确
率
%
120
图 1 改进前后准确率对比
- 5 -
中国科技论文在线
76
78
80
82
84
86
10% 30% 50% 70% 90% 100%
MI_change_RS
MI_change
MI
IG_RS
IG
特征子集维数占比
召
回
率
%
图 2 改进前后召回率对比 125
76
78
80
82
84
86
10% 30% 50% 70% 90% 100%
MI_change_RS
MI_change
MI
IG_RS
IG
特征子集维数占比
F1
值
%
图 3 改进前后 F1 值对比
由于 MI 方法在 10%特征子集维度的情况下的结果仅在 42%左右,相比其他方法差距过130
大,出于方便图表显示的考虑没有显示出来。
从以上三图我们可以看出改进后的特征选择方法相比原始的方法无论在准确率、召回率
还是 F1 值都有一定的提升效果。这说明对特征提取算法的改进是有效果的。上图中
MI_change 是针对互信息方法不足的改进,从图中 MI_change 和 MI 的对比可以明显看出它
有效的提高了互信息方法的效果。而 MI_change_RS 和 IG_RS 分别是 MI_change 以及信息135
增益方法从统计可靠性上的改进结果,从图中可以看出统计可靠性改进在特征子集维度越低
时的效果越明显,这说明统计可靠性改进有效的改善了特征项的排名,去除了一些排名靠前
但实际对分类效果并不好的特征,使得在特征子集维度较低的情况下也能够获得较好的分类
效果。此外从图中可看成统计可靠性改进在不同的特征选择方法上都有效果,这说明这一改
进是比较通用的。 140
综上所述,从实验可看出本文针对互信息特征选择算法的改进是有效的,此外从统计可
- 6 -
中国科技论文在线
靠性角度出发的改进对于不同的特征选择算法均有一定改善效果。
5 结论
特征选择是文本分类过程中的一个重要环节,本文在分析互信息特征选择算法的不足
上,对互信息算法进行了改进,并从统计可靠性角度出发提出一种度量来对不同特征选择算145
法加以改进,实验证明两种改进都取得了一定的效果提升。
[参考文献] (References)
[1] Su J S, Zhang B F, Xu X. Advances in machine learning based text categorization[J]. Ruan Jian Xue
Bao(Journal of Software), 2006, 17(9): 1848-1859.
[2] 蒲筱哥. 自动文本分类方法研究述评[J]. 情报科学, 2008, 26(3): 469-475. 150
[3] 张海龙, 王莲芝. 自动文本分类特征选择方法研究 [J]. 计算机工程与设计, 2006, 27(20): 3838-3841.
[4] 苏金树, 张博锋, 徐昕. 基于机器学习的文本分类技术研究进展 [J]. 软件学报, 2006, 17(9): 1848-1859.
[5] 徐燕, 李锦涛, 王斌, 等. 基于区分类别能力的高性能特征选择方法 [J]. 软件学报, 2008, 19(1): 82-89.
[6] 卢新国, 林亚平, 陈治平. 一种改进的互信息特征选取预处理算法[J]. 湖南大学学报: 自然科学版, 2005,
32(1): 104-107. 155
[7] 熊忠阳, 蒋健, 张玉芳. 新的 CDF 文本分类特征提取方法 [J]. 计算机应用, 2009, 9(7): 1755-1757.
[8] 田宝玉, 周炯磐, 吴伟陵. 工程信息论[M]. 北京:北京邮电大学出版社, 2004.
[9] Fan R E, Chang K W, Hsieh C J, et al. LIBLINEAR: A library for large linear classification[J]. The Journal of
Machine Learning Research, 2008, 9: 1871-1874.
[10] Hsu C W, Chang C C, Lin C J. A practical guide to support vector classification[J]. 2003. 160
[11] 奉国和. 文本分类性能评价研究[J]. 情报杂志, 2011, 30(8): 66-70