中 文 信 息 学 报
第20卷 第 1期 JOURNALOF CHINESE INFORMATION PROCESSING
文章编号:1003-0077(2006)01-0059-08
基于双层级联文本分类的简历信息抽取
于 琨1 ,管 刚2 ,周 明2 ,王煦法1 ,蔡庆生1
(1.中国科学技术大学计算机科学技术系 ,安徽合肥 230027;2.微软亚洲研究院 ,北京 100080)
摘要:本文提出了一种基于双层级联文本分类的方法 ,用于简历信息的自动抽取。本方法将简历文本分
解为文本块和文本串 ,并将简历中包含的信息分解为概要信息与详细信息。首先对简历文本中的文本块进行
切分与分类 ,抽取出概要信息 , 然后选择可能包含详细信息的文本块 , 将其切分为文本串 , 再通过对文本串的
分类抽取出详细信息。对 1200 份中文简历的实验结果表明 ,本方法适用于简历信息的自动抽取和管理。
关键词:计算机应用;中文信息处理;信息抽取;文本分类;简历管理
中图分类号:TP391 文献标识码:A
Resume Information Extraction Based on Cascaded Double-layer Classification
YU Kun1 , GUAN Gang2 , ZHOU Ming2 ,WANG Xu-fa1 , CAI Qing-sheng1
( Computer Science and Technology USTC Hefei , Anhui 230027 ,China;
Research Asia , Beijing 100080 , China)
Abstract:This paper presents an approach based on cascaded double-layer text classification for resume information extrac-
approach first divides a resume into block and it divides the target information into general informa-
tion and detailed first extracts general information by block segmentation and it selects
those blocks that may contain predefined detailed information with a fuzzy last , it segments these blocks into
strings and labels the strings with detailed information experimental results on 1200 Chinese resumes show that
our approach is suitable for the information extraction and management of resumes.
Key words:computer application;Chinese information processing;information extraction;text classification;resume man-
agement
1 引言
为了帮助大型公司有效地管理格式自由的简历 ,提高招聘效率 ,本文研究利用信息抽取方
法 ,从不同格式的简历中抽取出招聘者感兴趣的信息并进行格式化存储 ,以便实现简历的自动
归档和管理 。简历信息抽取的目的是从多种书写格式及文件类型的求职简历中抽取出姓名 、
学历等信息并存入数据库中 ,要求具有较高的精确率与召回率。并且 ,由于描述个人情况的信
息(简称为个人详细信息 ,例如姓名)为招聘者提供了与求职者联系的方式 ,因此要求具有更高
的精确率与召回率。
在目前存在的信息抽取方法中 ,基于规则学习的方法[ 1] 的精确率较高 ,但是受限于信息的
常用表达方式 ,召回率较低;基于HMM的方法[ 2 , 3] 利用自然语言的上下文关系抽取信息 ,难以
59
收稿日期:2004-09-21 定稿日期:2005-09-28
作者简介:于琨(1978—),女 , 博士研究生 ,主要研究方向为信息抽取 ,文本分类.
正确抽取出现次序相互独立的信息;而文本分类方法[ 4 , 5] 利用信息之间的独立假设 ,使用分类
算法抽取信息 ,不仅信息抽取的精确率与召回率较高 ,而且可以完善地处理出现次序相互独立
信息的抽取问题 。因此本文采用文本分类方法进行简历信息抽取。然而 ,因为简历中常常存
在描述推荐人情况的信息 ,这类信息与个人详细信息的特征完全一致 ,所以如果针对全部简历
抽取个人详细信息 ,很难过滤掉这些噪声信息 ,从而降低个人详细信息的精确率 。为了解决这
个问题 ,本文提出一种基于双层级联文本分类的信息抽取方法。本方法首先将简历文本分解
为文本块和文本串 ,其中文本块指以自然段为单位的一段或多段简历文本 ,文本串指文本块中
以标点符号或连续空格分隔的文本单元 ,然后将简历中包含的信息分解为概要信息与详细信
息 ,其中概要信息指对求职者某方面情况的总体描述 ,如教育背景 ,详细信息指特定类别的概
要信息中表示具体事件的信息 ,如教育背景中的毕业院校。在信息抽取过程中 ,本方法首先通
过对文本块的切分与分类抽取出概要信息;然后选择可能包含待抽取详细信息的文本块 ,并将
其切分为文本串;最后通过对文本串的分类 ,抽取出概要信息中的详细信息 。对 1200份中文
简历的实验结果表明 ,本方法适用于简历信息的自动抽取和管理 。
2 简历特征分析
通常招聘者需要了解这样几个方面的信息:姓名 、性别 、研究经历 、教育背景等。我们首先
以一份中文简历(图 1)为例 ,分析简历的特征 。
图 1 中文简历样本及抽取出的信息
1.一份简历可以按照内容划分为若干类信息 ,如个人情况 、教育背景等 ,这些信息可能在
位置上彼此独立 ,或彼此交叉 ,但一般一个自然段仅表示一类信息。此外 ,在部分信息(如个人
情况)中又存在细分的具体信息(如姓名等),一般一类或多类具体信息位于一个自然段中 。
2.描述个人情况的具体信息一般位于简历的首部 ,但也会位于简历的其他位置。
3.在大部分信息前面 ,存在标题用以表示其内容的主题 。标题一般较短 ,如教育背景 、电
子邮件等 。但是部分具体信息前面也可以没有标题 ,如通信地址和邮政编码。
4.同类别信息的标题名称呈多样化 ,如研究经历和项目经历表示同类的信息。
5.简历中存在噪声信息 ,这些信息与描述求职者个人情况的信息(简称为个人详细信息)
的特征完全一致 。如推荐人姓名 、联系方式等 。并且这些噪声信息一般位于简历的尾部 。
60
特征 1表明 ,简历的内容具有嵌套特征 ,即在根据不同内容划分的信息中常常包含细分的
具体信息;此外 ,特征 3 、4表明简历的结构具有标题特征 ,即大部分信息前具有标题表示其类
别 ,并且这些标题一般较短;特征 5表明简历中存在噪声信息 ,这些信息与个人详细信息的特
征完全一致;而特征 2表明个人详细信息与噪声信息一般在位置上不相连。
图 2 简历文本的双层结构
简历的标题特征表明可以将信息标题看
作信息边界 ,然后通过分类确定信息标题的位
置 ,从而实现信息抽取。但是 ,简历中存在的
噪声信息会导致个人详细信息精确率下降。
并且 ,如果仅利用噪声信息的位置特征对其进
行过滤 ,有可能过滤掉位于简历尾部的其他类
别的信息 。 和 [ 6] 及刘少辉
等人[ 7]对多层分类的研究表明 ,如果利用类间层次关系将各个类别组织成树状结构 ,对同层次
内的文本进行分类 ,可以缩小分类集合 ,从而提高分类精确率 。受其启发 ,本方法利用多层分
类过滤噪声信息(图 2)。
本文共定义 7类概要信息 ,并针对“个人情况”概要信息定义 11类个人详细信息(表 1)。
表 1 目标信息定义
信息类别
概要信息 个人情况 , 教育背景 ,研究经历 , 获奖情况 ,社会实践 , 兴趣爱好 ,计算机技能
个人详细信息 姓名,性别,出生日期,联系地址,邮政编码 ,固定电话 ,手机 ,电子邮件 ,户口 ,婚姻状况,居住地
3 信息抽取模型
问题描述及工作流程
信息抽取指从原始文本中抽取预定义的信息并进行结构化存储的过程[ 8] 。使用文本分类
实现信息抽取 ,则将问题转变为把原始文本看作若干有逻辑意义的文本单元组成的集合 ,给每
一个文本单元赋予一个信息类别 。即给定文本 T ,求得一个在某种切分 T=t 1 , t 2 , … , tn 上的
类别序列L*=l1 , l2 , …, ln ,其中 ti 被赋予类别 l i(1≤i≤n),使得概率 P(L T)最大 ,即
L
* =arg m
L
axP(L |T) (1)
如果假设切分后文本 ti 的所属类别彼此独立 ,则公式(1)可分解为
L
* =arg m
L
ax∏n
i =1
P(li |t i) (2)
其中 ,P(li ti)指给切分后的文本 ti 赋予类别 li 的概率 ,可以通过对 ti 进行分类时分类算法
生成的概率获得 。这里要解决两个问题:文本单元的切分和文本单元的分类。
图 3 基于双层级联文本分类的简历信息抽取流程
人们通常使用单层文本分类实现信息
抽取:即首先针对全部文本进行文本单元
切分 ,然后在各种可能的切分中寻求最优
类别序列 L* ,最后根据 L*确定的切分和
最优类别标记抽取出预定义的信息。为了
过滤简历中的噪声信息 ,提高信息抽取精
确率 ,本文使用双层级联文本分类(图 3)实
61
现简历信息抽取 。具体实现步骤如下:
步骤一(概要信息抽取):假设各类概要信息标题(共 M— block 类)相互独立 。首先将简历
文本切分成文本块 ,切分结果表示为 T— block = t — block1 , t— block 2 , … , t — blockn ,并使用特征
向量表示 t — blocki ;其次 ,针对切分 T —block 求得最优类别序列L— block *=l —block 1 , l— block2 ,
…, l — blockn ,其中 t — blocki 被赋予类别 l — blocki(l— blocki ∈{lj lj 表示第 j类概要信息的标题 ,
或非概要信息标题 ,1≤j≤M— block}),使得
L— block
* =arg max
L— block ∏
n
i=1
P(l— blocki |t — blocki) (3)
最后 ,根据切分 T — block 与类别序列L— block *确定各类概要信息的边界 ,实现概要信息抽取。
步骤二(文本块选择):根据预先定义的详细信息抽取目标 ,选择若干可能包含详细信息的
文本块作为详细信息抽取的原始文本 ,并将这些文本块总称为 B 。
步骤三(详细信息抽取):假设各类详细信息(共M— data 类)相互独立 。首先将 B 切分为
文本串 ,切分结果表示为 T — data=t — data1 , t — data2 , …, t — datan ,并使用特征向量表示 t — da-
tai ;其次 ,针对切分 T— data 求得最优类别序列L — data *=l— data1 , l — data2 , …, l — datan ,其中
t— datai 被赋予类别 l— datai(l — data i ∈{lj lj 表示第 j类详细信息 ,或非详细信息 1≤j≤M —
data}),使得
L — data* =arg max
L — data ∏
n
i=1
P(l— datai |t — data i) (4)
最后 ,根据切分 T — data 与类别序列L— data*确定各文本串的类别 ,从而抽取出详细信息 。
概要信息抽取
图4给出了实现概要信息抽取的最优类别序列选择算法 。如果根据公式(3),采用枚举的
方法在所有可能的切分序列与类别序列的组合中寻找最优类别序列 ,则会导致指数规模的算
法 ,显然不可取 。因此 ,本方法利用求职者一般在一个自然段中叙述一类概要信息的特点 ,首
先根据自然段分隔标志对简历进行文本块粗切分 ,然后针对粗切分后的文本块进行多类分类 ,
并在此基础上使用启发式规则过滤掉不可能作为概要信息边界的文本块 ,最后针对剩余的文
本块使用贪心算法寻找 L — block* ,其中 λ— block 是多类别分类的阈值 。
由于作为概要信息边界的概要信息标题一般较短 ,难以准确反映信息内容 ,因此本方法在
进行概要信息标题分类时增加了文本上下文特征 ,以提高概要信息标题分类的准确性。
详细信息抽取
图5是实现详细信息抽取的最优类别序列选择算法。该算法同样先进行文本串粗切分 ,
然后针对粗切分后的文本串进行多类分类 ,并在此结果上寻求最优类别序列。
简历的特征表明 ,同一自然段中可能包含一类或多类详细信息。这些信息通常以 Tab标
志或连续空格分隔。因此 ,本方法在详细信息抽取时 ,同时根据自然段分隔标志 、自然段中的
Tab 标志和 3个以上的连续空格实现文本串的粗切分 。然后 ,本方法定义两个类别集合:L —
Info={li l i 为第 i 类详细信息 ,或非详细信息}和 L— Title={li li 为第 i 类详细信息标题 ,或
非详细信息标题},并针对切分后的文本串分别在这两个类别集合上求得类别序列 l— Info1 , l —
Info2 , …, l— Infon 和 l — Title1 , l — Title2 , …, l — Titlen 。最后 ,使用贪心算法寻找 L — data* ,其中
λ— Info和λ— Title 分别为针对上述两个类别集合进行多类别分类时的阈值 。
由于不是所有的个人详细信息都具有明显的文本表示其类别(例如图 1),因此在详细信
62
息抽取中 ,如果仅使用词语作为特征表示文本进行分类可能导致信息抽取错误 ,使得如何恰当
地选取特征成为详细信息抽取中的主要困难 。为了解决这个问题 ,本方法在词语特征的基础
上增加了命名实体特征 ,以提高词语较为分散的类别的分类准确性。
图 4 概要信息抽取中的最优类别序列选择算法
图 5 详细信息抽取中的最优类别序列选择算法
文本块选择
文本块选择指选择若干可能包含详细信息的文本块作为详细信息抽取的原始文本。分析
表明 ,在文本块分类过程中常常出现把非概要信息标题的文本块错分为标题的错误 ,从而缩小
概要信息所在文本块的范围。为了解决该问题 ,本方法使用模糊选择策略 ,即不仅选择可能包
含详细信息的概要信息所在的文本块 ,还选择位于其前后的文本块 。对简历信息的特征分析
表明 ,包含噪声信息的文本块一般不会与包含个人详细信息的文本块在位置上相连 。因此 ,该
63
模糊选择策略可以在过滤噪声信息的前提下适当放宽详细信息抽取范围 ,从而部分抵消文本
块分类错误对文本块选择的影响。
特征选取
本方法共选取了四类特征:文本中词语 、文本上下文中词语 、文本中命名实体和文本上下
文中命名实体。各类特征说明如下:
文本中词语 w:指在待分类文本中出现的词语 ,采用词语的 TF *IDF [ 9] 作为特征权值 。
TF 指词语w在文本中出现的次数 , IDF(w)Log2 NNw(N 指训练实例总数 , Nw 指包含词w 的正
例个数)。
文本上下文中词语 cw:指在待分类文本后面的文字中出现的词语 ,也选择词语的 TF *
IDF
[ 9] 作为特征权值 ,并使用变量 l 表示上下文长度 ,即待分类文本后的文字个数。
文本中命名实体 ne:指在待分类文本中是否出现机构名称等命名实体 ,为 0-1特征 。此
处定义人名 、日期 、地名 、机构名 、电话 、数字 、时期 、电子邮件等 8类实体特征 。
文本上下文中命名实体 cne:指在本文本后长度为 l的文字中是否出现机构名称等命名实
体。该特征为 0-1特征 ,也定义人名 、日期等 8类实体特征 。
4 实验结果与讨论
实验数据
我们采用 1200份中文求职简历作为实验数据 ,对本方法进行了两组实验。首先针对基于
单层文本分类与基于双层级联文本分类的信息抽取进行测试 ,从而讨论基于双层级联文本分
类的信息抽取方法能否提高个人详细信息的精确率。其次针对不同文本块选择策略下的个人
详细信息抽取进行测试 ,从而讨论模糊选择策略是否可以提高个人详细信息召回率。两组实
验均按照 4:1:1的比例分配训练数据 、测试数据与分类器参数优化数据 ,并进行 6层交叉测试
(6-fold cross-validation)。
由于本方法使用词语及命名实体表示的特征向量表示文本块及文本串 ,所以分类问题具
有特征向量维数高(约等于汉语词典的词条总数)的特点 。因此本实验选择 SVM[ 10] 作为简历
信息抽取的分类方法 ,并使用 SVMlight作为分类工具[ 11] 。此外 ,本实验使用文献[ 12] 中的中文
分词系统进行中文文本预处理 ,并利用其命名实体识别结果作为实体特征的选择依据 ,还根据
经验值定义了上下文长度(这里仅取待分类文本之后的文字个数)l=40。
测试指标及评价方法
实验采用精确率和召回率作为基本测试指标 ,使用宏平均(Macro-average)[ 13] 定义平均精
确率和平均召回率(N 为类别总数 , Precisioni 为第 i类的精确率 , Recalli 为第 i类的召回率):
平均精确率=∑
N
i=1Precisioni
N
(5), 平均召回率=∑
N
i=1Recalli
N
(6)
学者们通常使用精确匹配标准[ 4 , 5] 判断抽取出的信息是否准确 。然而 ,中文简历中经常存
在不同语言的多种编码方式 ,导致简历文本中容易出现无法识别的特殊字符 。为了避免特殊
字符造成的匹配错误 ,本实验采用交迭标准[ 14] :在概要信息抽取中 ,若抽取出的概要信息与标
准答案存在 90%以上的交集认为两者相等;在个人详细信息抽取中 ,若抽取出的信息与标准
答案存在 90%以上的交集 ,并且抽取出的信息与标准答案的不相交部分低于标准答案的
10%,认为两者相等 。
64
实验结果与讨论
基于单层文本分类与基于双层级联文本分类的信息抽取实验结果
表2是基于单层文本分类与基于双层级联文本分类的信息抽取实验结果。该结果表明本
方法在概要信息和个人详细信息抽取中均获得了 80%以上的平均精确率与 71%以上的平均
召回率 ,可以满足简历信息抽取的要求 。
此外 ,与基于单层文本分类的信息抽取方法相比 ,本方法将个人详细信息抽取的平均精确
率提高了 %,并且将平均召回率提高了 %。分析结果(表3)表明 ,由于本方法通过文
本块选择限制个人详细信息抽取范围 , 实现了噪声信息过滤 , 不仅将多抽错误减少了
%,还将少抽错误减少了 %,因此提高了个人详细信息的精确率与召回率 。
然而 ,实验结果表明还有部分个人详细信息的平均精确率或平均召回率较低 ,例如联系地
址的平均精确率为 %,户口所在地的平均召回率为 %。错误分析表明 ,产生这类
问题的原因为这些类别的信息不仅不包含特定的词语 ,而且也不包含特定的命名实体 ,使得采
用词语与命名实体作为特征难以准确识别其所属类别 。但是 ,这类信息往往具有特定的表达
方式 ,可以使用有限自动机等方法自动识别。因此 ,我们将在今后的工作中通过加入有限自动
机等补充方法来提高这类详细信息的信息抽取精确率与召回率 。
表 2 信息抽取实验结果
概要信息 个人说细信息
平均确率(%) 平均召回率 平均精确率(%) 平均召回率(%)
双层级联文本分类 (+) (+)
单层文本分类
表 3 个人详细信息抽取错误统计
多抽错误数 少抽错误数 错误总数
双层级联文本分类 133(%) 165(%) 298(%)
单层文本分类 278 185 463
(注多抽错误:信息抽取结果中存在噪声信息 , 与标准答案不相交部分超过标准答案的 10%;少抽错误:信息
抽取结果不完全 ,与标准答案相交部分低于标准答案的 90%)
不同文本块选择策略下个人详细信息抽取实验结果
表 4 不同文本块选择策略下个人详细信息抽取实验结果
文本块选择策略 平均精确率(%) 平均召回率(%)
模糊选择策略 () (+)
精确选择策略
我们还针对不同的文本块选择策略
进行了测试。其中 ,精确选择策略指仅
选择可能包含详细信息的概要信息所在
的文本块 。测试结果(表 4)表明 ,模糊
选择策略可以将个人详细信息抽取的召回率提高 %,而平均精确率仅降低 %。并
且 ,由于模糊选择策略在确定个人详细信息抽取的原始文本时不受位置限制 ,因此可以成功地
针对各种书写格式的简历实现个人详细信息抽取 。
5 相关工作
目前很少有公开发表的简历信息抽取研究结果 ,而简历属于半结构化文本 ,因此本文针对
用于半结构化文本的信息抽取方法与本方法的异同进行分析。
Rapier系统[ 1] 使用词及词性特征 ,利用归纳逻辑设计 ,从具体到一般地学习抽取规则 。与
这类方法相比 ,本方法将信息抽取问题转化为文本分类问题 ,并且在文本分类过程中仅使用词
语及命名实体特征 ,不需要对原始文本进行词性标注等预处理。 等人[ 2] 和-
65
nakis等人[ 3] 利用词语的概率统计特征 ,分别使用单层 HMM 或双层 HMM 抽取信息 。与之相
比 ,本方法首先将信息分解为概要信息和详细信息两层 ,然后利用求职简历书写格式自由的特
点 ,使用文本分类实现信息抽取。 等人[ 4] 和 等人[ 5] 也利用文本分类抽取信
息 ,并且在分类过程中选取词 、词性 、拼写规则及领域知识作为文本特征 ,但是所有目标信息类
别位于相同层次 。与之相比 ,本方法针对不同层次上的信息类别分别进行文本分类 。此外 ,本
方法在分类过程中不使用词性特征及常用表达方式等知识 。
6 结论
简历信息抽取要求具有较高的精确率与召回率 ,尤其针对个人详细信息抽取提出了更高
的要求 。简历的半结构化特征使得可以使用文本分类来实现信息抽取 ,但其中存在与个人详
细信息特征一致的噪声信息 ,会导致个人详细信息精确率降低。本文利用简历的嵌套特征 ,将
简历中的信息分解为概要信息和详细信息两层 ,在此基础上提出了一种基于双层级联文本分
类的信息抽取方法。该方法首先对简历进行文本块切分与文本块分类 ,确定概要信息 ,然后选
择多个可能包含个人详细信息的文本块 ,针对这些文本块继续利用文本分类实现个人详细信
息抽取 ,从而有效过滤原始文本中的噪声信息 ,提高个人详细信息的精确率 。
在今后的工作中 ,我们将针对不同结构的简历使用不同规则实现文本切分 ,从而提高文本
切分的准确性 ,并且使用有限状态自动机等方法提高部分个人详细信息类别的抽取精确率。
参 考 文 献:
[ 1] Learning Techniques for Natural Language Information Extraction [ D] . Texas , 1998.
[ 2] , Extraction with HMM Structures Learned by Stochastic Optimization [ A] .Pro-
ceedings of the Seventeenth National Conference on Artificial Intelligence [ C] .Texas:2000 , 584-589.
[ 3] , , Hidden Markov Models for Information Extraction [ A] .IJCAI-03
[ C] .Mexico , 2003.
[ 4] , -level Boundary Classification for Information Extraction [ A] .ECML-2004[ C] .2004.
[ 5] , Information Extraction Network [ A] .IJCAI-03 [ C] .Acapulco , .
[ 6] , classifying documents using very few words [ A] .Proceedings of the Fourteenth
International Conference on Machine Learning(ICML' 97)[ C] .1997 , 170-178.
[ 7] 刘少辉 , 董明楷 , 张海俊 ,等.一种基于向量空间模型的多层次文本分类方法[ J] .中文信息学报.2002 ,
16(3):8-14.
[ 8] , Extraction [ J] . , 1996 , 39(1):80-91.
[ 9] categorization with support vector machines:Learning with many relevant features [ A] .Proceedings
of the European Conference on Machine Learning [ C] .Germany:Springer Verlag , 1998 , 137-142.
[ 10] Tutorial on Support Vector Machine for Pattern Recognition [ M] .Kluwer Academic Publishers , 1998.
[ 11] large-Scale SVM Learning in Kernel Methods-Support Vector Learning
[ M] .MIT-Press , 1999.
[ 12] , , Source-Channel Models for Chinese Word Segmentation [ A] .ACL-2003
[ C] .Japan , 2003 , 272-279.
[ 13] Learning in Automated Text Categorization [ J] .ACM Computing Surveys , 2002 , 34(1):
1-47.
[ 14] et al..A Critical Survey of the Methodology for IE Evaluation [ A] .Proceedings of the 4th International
Conference on Language Resources and Evaluation [ C] .Portugal , 2004.
66