- 1 -
互联网产品结构化信息抽取技术
季成晖,王小捷,袁彩霞**
(北京邮电大学智能科学与技术中心,北京,100876)
5 摘要:随着电子商务和垂直搜索引擎的发展,产品结构化信息抽取成为数据挖掘、信息检索、
自然语言处理的一个研究热点。本文以服装饰品领域的产品命名实体识别为例,分析了产品
领域结构化信息抽取的难点和特点,采用了一种基于条件随机场的主动学习方法,实现了从
中文网页文本中抽取产品实体。以一个团购电子商务平台中的数据实例为实验数据,该方法
获得整体 F1 值为 ,其中品牌、颜色、材质 F1 值分别为 、、。实验表明,10
该方法在达到较高性能的同时,能有效减少数据标注的代价。
关键词:自然语言处理;信息抽取;产品命名实体识别;条件随机场;主动学习
中图分类号:TP18
Structured Information Extraction for Web Product 15
Ji Chenghui, Wang Xiaojie, Yuan Caixia
(Center for Intelligence Science and Technology, Beijing University of Posts and
Telecommunications, Beijing, 100876)
Abstract: With the development of e-commerce and vertical search engine, structured information
extraction for online products becomes a research focus in data mining, information retrieval and 20
natural language processing. This paper, as an example in named product entity recognition in
clothing, we analyzed the difficulties and characteristics of information extraction, adopted an
active learning method based on conditional random fields, and we implemented the process of
product entity extraction from Chinese webpages. With the use of data from a group buying
e-commerce platform for the experiment, this method obtained the overall F1 value , 25
including brand, color, material F1 value, , and , respectively. The experiment shows
that this method has achieved higher performance; meanwhile, it has effectively reduced the cost
of data labeling.
Key words: Natrual Language Processing; information extraction; product named entity
recognition; conditional random fields; active learning 30
0 引言
电子商务技术的发展,催生了许多网络购物及团购平台,在方便用户和商家交易的同时,
也给产品的检索、管理、存储带来了很大的挑战。以网购平台为例,买家需要搜索特定的产
品,或通过比较来自不同电子商务平台的产品数据,货比三家,做出购买决策;卖家需要根35
据用户的交易及购买行为,实现精准的产品推荐和广告投放。产品信息结构化通过提取与产
品相关的属性及属性值,将蕴含于非结构文本中的产品信息精细化、条目化,存储在数据库
中,通过对数据库的查询实现“精准”搜索的目的。因此,如何从大量的文本信息中,提取
出产品的结构化信息,近年来受到越来越多的关注。同时,精确的产品结构化信息抽取,在
信息检索、机器翻译、数据挖掘、自动文摘等领域发挥着重要作用。 40
1 产品及产品属性值抽取难点
与一般的信息抽取任务相比,产品属性及属性值抽取,具有以下困难:
(1) 由于不同产品具有不同的属性,不同商家对同一个产品提供的描述信息在内容和格
- 2 -
式上存在着很大差别,使得难以发现产品属性及属性值抽取的通用规则。因此,一般的基于
模板的抽取方法,不再适用于大量电子商务网站中的产品信息结构化抽取。 45
(2) 产品命名实体中更加多样化的内部类别歧义、以及同常规命名实体之间的类别歧义
给产品命名实体识别带来了更严峻的技术挑战。例如:
品牌词可能充当品牌实体、材质实体、普通词;
英文单词可能是一个普通词,可能是英文品牌,也可能是产品款式、材质实体的构
成部分; 50
数字串可以是尺寸、材质的组成部分,也可以是时间或者数量表达式。
(3) 产品数据中有效内容较少且不规范。
网络产品数据缺乏常规的语法信息如淘宝、凡客等服装饰品数据,可能存在大量的关于
邮寄说明、商家诚信说明等与产品实体无关的信息。
(4) 用于模型训练的有标记数据少,人工标注大量的产品数据的结构化属性非常耗时耗55
力,这使得一般的基于有监督学习的算法很难适用。
目前国内外命名实体识别研究工作主要集中在新闻领域文本中人名(PER)、地名
(LOC)、机构名(ORG)、时间(TIME)、数量(NUM)表达式五种常规命名实体的识
别[1]。然而,对于产品信息抽取任务来说,仅仅靠常规命名实体识别不能有效地抽取文本中
的关键信息,产品命名实体识别研究势在必行。 60
针对以上难点,本文提出一种基于主动学习条件随机场的命名实体识别技术,实现产品
信息的结构化抽取,在互联网中文产品服装饰品类数据上的实验结果表明,该方法获得整体
F1 值为 ,其中品牌、颜色、材质 F1 值分别为 、、。与相同性能的有监督
条件随机场模型相比,使得样本标注的工作量减少了 41%
2 相关研究 65
互联网的中文产品结构化信息抽取一般可分为基于规则的方法[2] [3] [4] 和基于统计的方
法[5] [6] [7] [8] 。互联网产品如团购网站的数据在内容和格式上非常自由,基于规则的模型只
能应用于具有相同或相似模板的网页,网页结构的细微变化都可能影响到信息抽取的准确
性,同时,规则的建立过程费时费力,且规则不易移植,代价高;基于统计的模型一般采用
序列标注的方式,将属性及属性值的抽取转化为序列学习任务,它的健壮性和灵活性都比基70
于规则的方法好,但是需要大规模的语料进行训练。有标数据规模较少时,此类模型性能都
比较差。具有代表性的机器学习方法有隐马尔可夫模型(HMM),最大熵模型(ME),条件随
机场模型(CRF)等。CRF 已被证实在处理序列标注任务时,有较好的性能。目前主流的结构
化信息抽取方法以统计学习为主,趋于各种方法的融合[9] [10] 。
针对有监督模型缺乏有标语料的问题,本文采用 CRF 和主动学习(AL)方法,极大程75
度上降低了对有标语料的依赖。
3 基于主动学习条件随机场的命名实体识别
条件随机场
CRF 又称马尔可夫随机域[11],是一种用于标注和切分序列数据的条件概率模型,也是
一种无向图模型,借鉴了 HMM 和最大熵模型的许多优秀特性,这些优秀的特性使得该模型80
非常适合解决序列标注问题。最简单最常用的 CRF 图结构是一阶链式结构,即线性链结构,
CRF 的图描述如图 1 所示。
- 3 -
中国科技论文在线
1
1
1
( | ) exp , , ,
n
k k t t
t kx
P y x f y y x t
Z
(1)
其中,观察序列 1 2, ,..., nx x x x , 标 注 序 列85
1 2, ,..., ny y y y 。在式(1)中, ty 代表 t 位置
的标签,状态特征函数与 ty 、整个观察序列有关,转移特
征函数与 t-1 位置的标签、整个观察序列有关。 kf 即代表状
态特征函数,也代表转移特征函数。 k 是第 k 个特征的权
重,Z 是一个规一化因子。 90
图 1 线性结构 CRF 图模型
主动学习
主动学习[12]是一种迭代地从未标注样本中选择最富含有效信息的样本交由人工标注的
机器学习技术。其训练过程开始于少量的有标数据,然后根据特定的选择策略,从大量无标
样本池中选择最具有信息含量的样本,进行人工标注,新的标注样本放回到原始有标记训练95
集中,如此迭代直到满足一定的准则结束。
本文采用的选择策略为信息密度策略[13],具体公式如式(2)、(3)所示:
( , )
1
1
( ) ( ) ( , )
LUID SE u sim x x
u
x x sim x x e
U
(2)
( ) ( | ; ) log ( | ; )SE
y
x P y x P y x (3)
其中 ( )SE x 为模型输出的序列熵,用来衡量当前实例 x的信息量。y为输入序列 x的任意100
一个可能的标注序列。 ( )SE x 越高说明该实例的不确定性越高,对学习系统而言具有越多
的信息。
1
1
( , )
U u
u
sim x x
U
代表当前实例 x 与所有无标数据 ux 的平均距离。其中 sim
函数是夹角余弦函数, 默认为 。 ( , )
Lsim x xe 代表当前实例 x 与有标样本 Lx 的相似度。
信息密度策略不仅考虑了模型本身输出的置信度,同时还考虑了样本在有标和无标样本上的
分布。如图 2 所示,其中○代表无标样本,△、□代表有标样本,虚线代表划分样本的超105
平面。如果只是单一地考虑置信度,则会选择 A 点,然而 B 点更靠近无标样本,比 A 点更
具有代表性。同时,由于 B 点和有标数据 D 点距离较近,所以 C 点更具有代表性。这正符
合的信息密度策略的选择标准。
- 4 -
中国科技论文在线
图 2 样本选择策略分析 110
采用有监督学习方法来做命名实体识别都需要依靠大量的有标数据,然而对语料的人工
标注是非常消耗时间和精力的,所以在命名实体识别中本文采用主动学习方法来减少语料的
标注且能达到相同的性能。
产品属性识别系统描述 115
在我们选择 CRF 模型作为产品属性抽取的学习器,结合主动学习策略的产品属性抽取
系统流程如图 3 所示。最初随机选择一定量的语料进行人工标注,成为 CRF 模型的初始训
练语料。为了增加训练语料,我们通过信息密度策略在大量的无标样本中选择新样本,人工
标注后加入到训练集中,采样和标注过程一直迭代直到满足某种条件停止。
120
图 3 命名实体识别系统流程图
- 5 -
中国科技论文在线
4 实验及结果分析
实验数据及评价指标
实验数据来自于诺基亚北京研究院‘无限购享’系统( 后台125
数据库,该系统抓取了各大团购电子商务网站的产品信息,具体例子如图 4 所示。
图
130
135
图 4 产品描述信息实例
从以上数据库中得到‘服装饰品’类数据 22,628 条,该大类分为 9 大子类,包括:服
饰配件、户外运动、男装、女装、时尚饰品、箱包、鞋靴、珠宝首饰、其它。其中从每个子140
类里随机选取 200 条数据。总计 1800 条。
本文对品牌、材质、尺寸、款式等识别结果的评测, 采用了自然语言处理中使用最广泛
的三个评测指标:准确率(precision)、召回率(recall) 和 F1-值(F-measure)。
产品属性确定
为 了 抽 取 更 能 反 映 产 品 重 要 信 息 和 用 户 重 点 关 注 的 属 性 , 首 先 在145
(
问卷中的产品属性来自两方面:①从数据库统计得到的属性;②参与调查的人凭自己的喜好
增加①中未包含的属性。参与调查的人员主要是学生,最后得到每个子类问卷份数 45 份,
问卷结果表明:品牌、款式、尺寸、颜色、材质,这五类属性是用户最关心的,占的比例为
所有属性比例的 %。因此,我们选用这 5 个属性作为待抽取的信息。采用 BIO 序列化150
方式,将 5 个属性以外的其它字串标注为 O,这样标注集共包含 2*5+1=11 个标记。
将从后台数据库里得到的1800条产品数据随机平分为10份,每份中每个子类条数相同。
首先通过正则表达式对所有的服装饰品类数据抽取出领域词典(品牌 2148 条,材质 2856
条,款式 304 条,尺寸 5223 条,颜色 2086 条),然后基于这些领域词典对数据进行最长精
确匹配,得到初步的有标数据,最后对这初步标注的 10 份数据进行人工修正,得到 CRF 的155
初始训练数据,该数据包含品牌总个数 2100 个,材质总个数 4000 个,尺寸总个数 3750 个,
颜色总个数 3000 个,款式总个数 5350 个,Other 总个数 167000 个,句子总个数 8691 个。
实验设置与结果分析
实验采用的是开源代码 CRF++ 版本(),CRF 模型中对不同
今日团购:2012 春夏爆款韩版 OL 休闲百搭显瘦蝴蝶结哈伦裤一条!采用舒适的莫
代尔面料,超级显瘦的剪裁,宽腰头设计,修身的裤型,百搭的颜色,极强的弹力。
仅 66 元即享原价 198 元不变形不缩水不易皱,彰显 OL 时尚气质范超显瘦修身,打
造属于你的气质时尚之美!注意哟~买两条还会赠送水钻皇冠头饰+性感蕾丝短裤一
条!全国包邮(新疆、西藏、港澳台等偏远地区除外)
时尚又健康的哈伦裤:高跟鞋,运动鞋,休闲鞋,靴子,长款 T 恤,短 T 恤,打底
衫,雪纺衫,羽绒服等等,如何搭配都能显露你小腿完美的曲线,同时也能展现你
非同寻常的气质之美!英伦风强烈席卷的时刻,不要再迷恋牛仔裤啦!穿上我们的
哈伦裤搭以衬衫,或配上马甲、西装,简约充满干练,这就是品味的体现。宽松的
舒适感与时尚感并重,又更加人性化,十分适合上班穿着。宽腰头的设计,将上衣
扎进裤腰,更是让你穿出仕女的味道!将强烈的视觉反差进行到底!
- 6 -
中国科技论文在线
实体采用的是同样的特征模版,采用的特征如下: 160
一、 字四阶依赖特征,由于产品品牌、款式、材质等领域性太强,多为词典外词,分
词的效果不佳,所以本文采用的 token 是基于单字的。
二、 数字特征,如尺寸里的 宽* 高*,其中 ,, 即为数
字。
三、 程度词特征,如材质中的 70%棉,其中的 70%即为程度词。 165
实验一:完全基于 CRF模型的命名实体识别
对这 10 份有标数据进行 10 倍交叉验证,得到的平均结果如图 5 所示。
图 5 基于 CRF 的命名实体识别
由于属性类别内部歧义较多,尤其是材质和款式,人工标注的一致率为 90%。如“蕾丝170
内裤”中的“蕾丝”被不同的标注者标注为了材质和款式,导致材质和款式两个属性的抽取
性能偏低。
实验二:基于主动学习条件随机场的命名实体识别
先把数据等分成 10 份(每份 180 个产品描述),9 份做训练和 1 份做测试,从 9 份数
据中随机选取 200 条句子,进行人工标注后作为主动学习的初始有标语料,训练 CRF 模型,175
每次从 9 份数据中剩下的数据里选择信息密度最大的 200 条进行人工打标,然后加入到原始
有标语料中。如此迭代直到性能接近完全有监督的 CRF 模型时停止。10 倍交叉验证时,采
用另外一份产品描述信息做测试数据,再从剩余的 9 份中选取不同的 200 条句子做初始训练
语料。10 倍交叉验证实验结果如图 6 所示
180
图 6 基于主动学习条件随机场的命名实体识别平均迭代效果图
- 7 -
中国科技论文在线
每次以句子而不以整条产品信息为样本最小选取单位。原因有二:
1、产品信息中含有大量的关于邮寄说明、商家诚信说明等与产品属性无关的信息,这
些信息的序列标注结果都是 Other,导致信息密度小,即对于产品属性的抽取贡献的意义不大
甚至起负作用。 185
2、以句子为单位就存在很多重复的句子,这些句子也可以避免重复的被选出。大大减
少了人工标注的工作量。
由图 6 可以明显看出,在迭代到 23 次左右识别效果就很难提提升,基本已到达完全基
于 CRF 的性能(39 次时),因此在达到相同性能的前提下,基于主动学习的方法能节省
(39-23)/39=41%的语料,极大程度上降低了对有标语料的依赖。 190
5 结论
本文分析了产品领域结构化信息抽取的难点和特点,提出一种基于主动学习条件随机
场的命名实体识别技术,实现产品信息的结构化抽取。在互联网中文产品服装饰品类数据上
的实验结果表明,该方法获得整体F1值为,其中品牌、颜色、材质F1值分别为、、
。该方法在达到较高性能的同时,能有效减少数据标注的代价。此方法学习过程与领域195
无关,只需要少量的人工标记,即可以移植到其它领域,实现对任意领域快速的结构化信息
抽取。目前系统的识别性能仅限于小规模的语料,仍需大量的后续工作和深入的研究,如包
括进一步修改标注规范, 增强训练语料的标注一致性, 以及将研究应用于其它领域,或与其
它应用系统如垂直搜索、推荐系统相结合。
200
[参考文献] (References)
[1] Chen, . Zhang, and H. Isahara, Chinese Named Entity Recognition with Conditional Random Fields, In
Proceedings of Fifth SIGHAN Workshop on Chinese Language Processing, Sydney, July 2006, pp. 118-121.
[2] 郝爱峰. 网页结构化信息抽取技术方法研究[J]. 山西电子技术, 2008, 04: 76-77.
[3] 胡 亮,袁 芳,齐芸芸.农业垂直搜索引擎信息抽取的研究[J].计算机工程与设计, 2009, 30(5): 1115-1118, 205
1134.
[4] 任仲晨,薛永生.基于页面标签的 Web 结构化数据抽取[J].计算机科学, 2007, 34(10): 133-136.
[5] 刘云中,林亚平,陈治平. 基于隐马尔可夫模型的文本信息抽取[J]. 系统仿真学报, 2004, 03: 147-150.
[6] O. Bender, F. Och, and H. Ney, Maximum entropy models for named entity recognition, Proceedings of
CoNLL-2003, 2003, pp. 148-151. 210
[7] Xiaohua Liu, Shaodian Zhang, Furu Wei, Ming Zhou: Recognizing Named Entities in Tweets. ACL
2011:359-367.
[8] 向晓雯. 基于条件随机场的中文命名实体识别[D]. 厦门大学, 2006.
[9] 林亚平,刘云中,周顺先等.基于最大熵的隐马尔可夫模型文本信息抽取[J].电子学报,2005(02)
[10] Duangmanee Putthividhya, Junling Hu: Bootstrapped Named Entity Recognition for Product Attribute 215
Extraction. EMNLP 2011:1557-1567.
[11] Lafferty J,McCallumA,Perdra F.Conditional random fields:Probabilistic models for segmenting and labeling
sequence data[A].In: Proc.ICML 2001[C],NewYork: ACM, 2001.
[12] B. Settles, "Active Learning Literature Survey, In Proceedings of the Conference on Empirical Methods in
Natural Language Processing (EMNLP), 2009. 220
[13] Lin Yao, ChengjieSun ,CRF-based Active learning for Chinese Named Entity Recognition,In Proceedings
of the 2009 IEEE international conference on Systems, Man and Cybernetics (2009), pp. 1557-1561.