˖ڍመڙጲ
多刻面的新闻事件可视化模型及研究
郭晓菲,李涓子,唐杰,张鹏,杨瑞兵
清华大学计算机科学与技术系,北京 100084
摘要:进入互联网时代,新闻的发布量呈爆炸式增长,人们的新闻阅读方式也随之改变。在对
文本可视化相关技术进行研究的基础上,结合新闻事件本身特点和用户的信息需求,提出了多
刻面新闻可视化模型。模型分为文本分析层、可视化呈现层、用户交互层,结合实体主题模
型、时序关联分析、关键词抽取等技术,设计并实现了模型的各个模块。以“2014年全国两
会”及“乌克兰持续动荡”等新闻专题文本集为实验数据,实现了多刻面的新闻事件可视化展
示,验证了模型的有效性及实用性。
关键词:计算机软件与理论,多刻面,可视化模型,新闻事件
中图分类号: TP311
Multi-facet Visualization Model of News Event
GUO Xiaofei, LI Juanzi, TANG Jie, ZHANG Peng, YANG Ruibing
Department of Computer Science and Technology, Tsinghua University, Beijing 100084
Abstract: With the arrival of Internet era, the number of news increases explosively, which
also changes the way people read. As studying the related techniques of visualization, it
de�nes the concept of multi facet news event visualization model, which combine the
characteristic of news event with the information need of users. This model contains three
main components: Text Analysing Layer, Visualization Layer and User Interface Layer.
Finally, the paper visualizes CPPCC of 2014 and Ukraines Turmoil as datasets to test
e�ectiveness and practicability of the model.
Key words: Computer Software and Technology, Multi-facet, Visualization Model, News
Event
0 引言
中国互联网络信息中心《2013年中国网民搜索行为研究报告》显示,新闻搜索在电脑和手
机上都位居第一,新闻仍然是网民最常搜索内容[1]。网络新闻信息传输具有速度快、时效性
强、新闻量大等特点。针对一个感兴趣的新闻事件,网络新闻用户需要耗费大量的时间和精力
去阅读,了解新闻要素及其之间的关系;用户也很难从独立的某一篇报道,去获知整个新闻事
件的起因、发生、发展过程。文本可视化技术应运而生,以其简单性、便捷性、美观性,逐渐
成为用户理解庞大新闻文本内容的有效手段之一。
基金项目: 博士点基金(20110002110013),自然科学基金重点项目(61035004)
作者简介: 郭晓菲(1988-),女,硕士研究生,主要研究方向:新闻挖掘与文本可视化。通信作者:李涓子(1964-),女,教
授,主要研究方向:知识工程、语义网、语义网服务、数据挖掘与模式识别,E-mail: lijuanzi@。
- 1 -
˖ڍመڙጲ
新闻文本可视化技术作为文本可视化技术中的一个重要的发展方向,呈现了多元化
的发展趋势。目前,主流的新闻文本可视化形式有标签云、网络图、文本地图及叠式图。
Wordle1[2]是标签云形式的代表,主要技术是将关键词按一定顺序和规律排列,也被广泛的应
用与报纸、杂志等新闻媒体中。Prase Net[3] 通过展示命名实体在文本中的多种关系,将信息
以网络的形式呈现出来。Event Registry2 应用新闻信息与地图结合的方式显示新闻事件的发
生,直观的展示了新闻的地理信息要素。News Event Insight[4] 应用主题驱动的框架设计显示
新闻事件。Timeline[5]、ThemeRiver[6]、Meme-tracking[7]和TIARA[8]模型主要通过对文本主
题的时序分析,应用叠式图的方式,展示文档内容随时间的变化趋势。
然而以上的新闻可视化研究中,对于新闻事件本身特点和用户的信息需求分析不完整,且
信息数据的展现形式较少,缺少多维度、全方面的新闻事件分析与展示。为解决这一问题,本
文提出了面向新闻事件可视化模型设计,考虑到新闻的基本要素特征、新闻主题及其时间演化
性,把新闻事件从不同的粒度、多种刻面进行抽象融合之后,以各种不同形式呈现给用户。
1 相关定义及模型框架
模型定义
在本章节将给出新闻事件抽取的相关定义及模型主要框架。
定义1. 新新新闻闻闻事事事件件件(((Event)))是与某一特定的事情报道相关的文档集,经常包含时间、实体等
信息,例如“美国总统选举”。对于任一事件e存在文档集De,其形式化表达方式如下:
D(e) = f(di; ti)ji = 1 : : : ndg,
其中,di是事件e在时间ti的新闻报道,即每一篇文档di 是一个词的集合,形式化为:
di = fwj jj = 1 : : : nw; wj 2 V g,
其中,V是词典。
定义2. 主主主题题题(((Topic)))在新闻事件中,新闻主题作为一种新闻导航阅读的形式,汇聚了新闻
事件中反映相同或相近主旨思想、内容的新闻文档。为丰富新闻主题的内容,从而使新闻用户
看到主题就可以对新闻主题文档有一个整体、全面、清晰的认识,主题z被形式化为三元信息
组z = (�; ENz;KPz)。其中,�是主题z的时间窗口,ENz, KPz分别代表了主题z中的实体和
关键词信息。热热热门门门主主主题题题(((Hot Topic)))在新闻事件中,定义主题列表中热门的、活跃的主题为
热门主题。给定主题列表=(e) = fZiji = 1 : : : ntg,其中Zi 是Di 在时间�i的所有主题,通过热
门主题选择算法,可以求解出集合中的门话题列表,表示为=(e) = fZhi ji = 1 : : : ntg。
1
2
- 2 -
˖ڍመڙጲ
定义3. 主主主题题题关关关联联联关关关系系系(((Relationship)))本文在研究新闻事件及相关主题时,着重研究了主题
之间的时序关联关系。主题之间存在的关系主要包含主题的产生、消亡、延续三种。假设zi,
zj是两个不同时间的主题,其关联关系可表示为<zizj,其中,zi 的时间窗口为�i, zj 的时间窗
口为邻接的下一个时间窗口,即�i+1(e)。具体的关联关系计算方法将在后续章节中给出。
通过以上定义,我们可以抽象出此次新闻事件可视化模型的主要工作是求解映射函数�,
即给定新闻事件e的本文集D (e),分析出其中的热门主题=(e)及主题间的关联关系<(e),函数形
式化为:
� : D (e) ! ( =(e) ; <(e) )
其中,=(e)和<(e)分别表示为事件e的主题集合、主题之间关系集合。
模型框架
多刻面的新闻可视化模型的框架模型如图1所示,由文本分析层、可视化呈现层及用户交
互层[9]三部分构成。
图 1: 多刻面的新闻可视化模型框架图
文本分析层是可视化模型的基本模块,是从原始数据生成中间主题数据的过程。文本分析
的主要过程分为三个阶段:数据预处理阶段,通过对原始数据采集、清洗、预处理,做实验数
据的准备;时序主题分析阶段,通过对新闻时间文本的实体主题模型分析,将新闻事件中具有
相同或相似内容的新闻文档合并,组织在一起;主题关联分析阶段,在生成实体主题之后,引
入热门主题选择算法,筛选出重要的主题并对主题之间的关联关系进行分析。
- 3 -
˖ڍመڙጲ
可视化呈现层是可视化模型的过渡模块,是从中间数据生成可视化数据接口的过程。可视
化呈现层对新闻事件的要素进行了详细抽取,包括主题关键词及词组抽取工具,新闻实体(人
物、地点、组织机构)抽取工具等,提供了可视化呈现的数据接口及工具。
用户交互层是可视化模型的交互模块,是从数据接口到可视化展示的过程。用户交互层提
供了可视化信息展示,用户可以通过对模型的可视化操作,阅览关心的主题及内容。
2 模型分析与实现
在本章节主要按照模型框架的流程,详细介绍模型中各个函数的求解过程。
实体主题模型
在数据预处理之后,原始数据被划分成按时间片分割的文档集,即D (e) = f(Di; �i)ji =
1 : : : ntg,其中Di表示为时间�i的文档集。与之前大部分研究文本可视化的工作不同,本文应
用实体主题模型去建立主题与实体之间的关系[10] 3,来更好的追踪新闻主题和实体。对于
每一个时间窗口,可以得到一个主题列表=(e) = fZiji = 1 : : : ntg,其中Zi 是Di 在时间�i的所
有主题。具体说来,对于Zi中的每一个主题z, 通过实体主题模型计算后都可以得到一个三元
组(�; �;ENz),其中�是关于文档主题分布p(zjd)的矩阵,�是关于主题词语分布p(wjz)的矩阵,
同时ENz 是所有跟主题z相关的实体集合。
时序关联分析
不同于一般的文本流数据,新闻事件的主题含有更强的主题时序关系。换言之,新闻主题
会随着时间的流动不断的产生和消亡。这是一个动态流动、变换着的过程。为了更加切合新闻
文本的特点,本文实现了两种计算主题关联关系的算法。
算法1 热门主题选择 一个热门的话题应该具备如下特征:易于用户理解,一目了然理解话
题主旨;能够很好地涵盖话题内容,阐述话题含义;能够明确的区分其它话题。考虑到这些因
素,本文提供了热门主题选择的算法。基于实体主题模型的结果,选取文档主题矩阵�作为依
据,我们给出了求解热门话题的假设——一个热门的话题相对于其他的话题应该有更高的概率
分布,并且一篇文档可能涉及到多个热门话题4。由此,我们可以将事件中的话题列表更新为
热门话题列表=(e) = fZhi ji = 1 : : : ntg,算法的详细过程如算法1所示。
算法2 时序关联关系分析 在实体主题模型分析之后,一个主题是由一个词向量构成。
这里我们通过贝叶斯方法来帮助计算主题之间的关联关系。给定主题-词语分布矩阵�,一
个主题zi;j被表示为zi;j =< wij;1; wij;2 : : : ; wij;m >,其含义为在时间�i热门话题集合Zhi中的
第j个主题。同样的,另一个主题被表示为zi;j =< wij;1; wij;2 : : : ; wij;m >。在给定两个主
题zi;j与zi+1;k之后,它们之间的关联关系算法如算法2所示。
最后得到关联关系分析的公式为:
3我们将参数设置为K = 20, � =
= 50
K
, �1 = �2 = 0:1。
4这里我们设置N = 10,即在每个时间窗口中选择10个热门话题
- 4 -
˖ڍመڙጲ
Algorithm 1 热门主题选择算法.
Require: 文档-主题分布矩阵�, timespan � , 热门主题个数N,
Ensure: 热门主题列表Zh.
1: for di = 1 : : : n do
2: Zi = max
N
fp(zj jdi)g, 其中,zj是Z�中的一个主题,并且p(zj jdi) 是文档-主题分布矩阵,
3: end for
4: Zh = max
N
S
nd
fZig.
5: return hot topic list Th.
Algorithm 2 关联关系分析算法
Require: 主题词语分布矩阵�, zi;j , zi+1;k,
Ensure: 主题之间的关联关系<(zi;j ; zi+1;k).
1: <(zi;j ; zi+1;k) = 0:0,
2: for 每一个词wi in zi+1;k do
3: 计算p(w(i+1)k;ljzi;j),
4: <(zi;j ; zi+1;k)+ = p(w(i+1)k;ljzi;j),
5: end for
6: return <(zi;j ; zi+1;k).
<(zi+1;k; zi;j) =
l=nX
l=1
p(w(i+1)k;ljzi;j) (1)
其中,p(w(i+1)k;ljzi;j) 代表主题zi+1;k中的词语与主题Ti;j中的有多相似,具体计算方法如下:
p(w(i+1)k;ljzi;j) =
(
p(w(i+1)k;ljz(i+1);k); w 2 zi;j ;
0; w =2 zi;j :
(2)
关键信息抽取
为了更好地让用户理解热门主题=(e) = fZhi ji = 1 : : : ntg的含义,针对新闻的5W1H要素,
本模型提供了关键词及实体抽取算法。通常表征一个词语的重要程度的特征是词频,更复杂的
特征有Tf-Idf,PMI等。本模型基于Tf-Idf方法,提出了更多的抽取关键信息的特征,从而使关
键词结果更具语义信息,如表1所示。
从词的词频、词性、出现位置及形态四方面考虑,为每个词设置了八个特征值,通过特征
拟合,各特征的计算公式如下所示:
score(w) = (w:tf)t1(1 +
X
fi2F
w:fi � tfi) ln termSum
t2
w:ctf t3
(3)
- 5 -
˖ڍመڙጲ
表 1: 关键词特征统计表
特征 定义
词频 w在新闻中的词频。
文档集词频 w在文档集中的总词频。
总词频 termSum 文本集中所有一元/二元/三元文法字的词频总和。
标题位置 w是否在标题中出现。
段落位置 w是否在第一段中出现。
词性 词性。
引用 表示w是否被引号、书名号等括起来。值0表"否",值1表"是"。
形态 根据词的长度设置的特征值,表示该词所包括的信息量。
其中,F = inTitle, quo, inFirst, sign 是一组特征值; tfi 是它们的权重;t1, t2和t35分别
为of w:tf , termSum 和w:ctf的权重。
数据接口
本文定义了标准数据接口来表示主题,作为链接数据分析层与可视化显示层的标准化格
式。一个主题z 是被定义成一个三元组(�; ENz;KPz), 即表示主题的关键信息、实体信息和时
间信息。此外,一个主题还包括与之相联系的时序关联关系信息,如图2所示,图中线上的数
字代表数目,方框代表详细信息。
图 2: 标准主题数据接口示意图
3 可视化实验
文本集选择与收集
本文以新浪专题新闻网站6为数据来源,对热门新闻事件进行可视化分析。对于国内的新
闻事件,选取“2014年全国两会”作为研究对象,从2014年01月24日至2014年03月02日,采集
5我们设置t1 = 0:99, t2 = t3 = 2:3, �1 = �2 = 0:1.
6
- 6 -
˖ڍመڙጲ
新闻共1938条。对于国外的新闻事件,选取“乌克兰证据动荡”进行事件分析,从2014年03月03日
至2014年04月26日,共采集1357条。这两个新闻事件的文本集就是本次实验的数据集,详见
表2。
表 2: 实验数据集统计表
事件名称 新闻条目 起始时间 终止时间 持续时间
2014年全国两会 1938 2014-01-24 2014-03-02 37
乌克兰政局动荡 1357 2014-03-03 2014-04-26 54
实验结果分析
基于多刻面的新闻事件可视化模型主要是研究如何结合信息的多个刻面,帮助用户从更深
层次理解新闻事件的发展,发现其中的规律。本文在研究多刻面的新闻事件可视化模型时,从
全局的角度上讲,应用叠式图展示新闻事件随时间变化的整体趋势;从单个的主题角度来分
析,应用事件时序图对单一的主题进行详细的分析。两个实验数据集的实验结果分别展示在:
两会7 乌克兰8两个公开源中,本次实验分析主要以“2014年全国两会”新闻事件为例。
事件叠式图
主题叠式图是非常流行的可视化形式,如图3所示。在本文的可视化模型实现中,首页先
加入了叠式图来展示事件的时间趋势。在叠式图中,每层代表新闻事件的一个主题,以不同
颜色加以区分,从左到右的呈现主题的变化。从两会的叠式图中,我们可以发现,事件的主
题在2014年2月15日至20日左右大幅的锐减,可以证明在这段期间,或是新闻的报道力度不够,
或是新闻的主题比较集中;而在2014年2月24日左右主题又开始呈大幅增长的趋势,自此很多
主题都产生出来或者新闻的报道力度达到了高峰。
事件时序图
时间(When)作为新闻5W1H中的重要特征,是衡量新闻事件发展的一维重要坐标。其
中,话题、命名实体(人物、组织机构、地点)随时间变化而变化的关联关系可以被描述为新
闻随时间变化的一种趋势。这种趋势的度量可以有效的展现新闻事件的全方位知识,如图4所
示。
可视化展示分为五个部分,分别是实体展示图、趋势统计图、实体分布图、主题展示图。
实体展示图是由四幅子图构成,分别展示了新闻报道的趋势统计图,人物、组织机构及地点分
布图。趋势统计图新闻事件在时间上报道的数量统计分析。实体分布图主要利用了实体主体模
型中的结果统计而生成。主题展示图主要展示主题的详细信息,包括主题的标签(代表主题的
关键词),主题关键词(话题热词)及主题的代表新闻。通过主题展示图,用户很容易理解主
7 new/examples/timeline/
8
- 7 -
˖ڍመڙጲ
图 3: 两会专题可视化分析叠式图
图 4: 两会专题可视化分析时序图
题的内容,把握新闻的热点。主题时序图从全局的状态下展示了新闻事件的主题在时间轴上的
分布。前后主题链接主要方便用户交互来实现前后主题的切换。
表3是人工报道及自动化分析得到的热门话题对比表。其中,左边一列是通过央视网官方
- 8 -
˖ڍመڙጲ
报道的群众感兴趣的热门话题9,中间一列是可视化模型自动分析出来的话题,右边是自动化
分析出的话题时间。
表 3: 热门话题对比表
媒体报道话题 可视化分析话题 时间
—— 会议审议 2014-01-24
—— 两会访谈 2014-02-01
中国外交的全面开拓之年 国际关系 2014-02-16
破解医患矛盾是重点 医患关系 2014-02-22
延迟退休如何安排 养老工作 2014-02-23
—— 恐怖事件 2014-02-24
如何防范冤假错案 人大立法 2014-02-24
—— 经济增长 2014-02-24
—— 能源生态 2014-02-25
如何处理“小产权房” 房地产 2014-02-25
如何治理雾霾 污染治理 2014-02-25
—— 重要精神 2014-02-28
—— 民营企业 2014-02-28
期待“制度反腐”有进展 反腐 2014-02-28
—— 航空航天 2014-03-02
—— 公务员调薪 2014-03-02
确保“舌尖上的安全” 转基因问题 2014-03-02
—— 学生就业 2014-03-02
—— 产业调整 2014-03-02
“单独二孩”带来的纠结 计划生育 2014-03-02
—— 代表提案 2014-03-03
儿童权益保障仍需推进 —— ——
劳动教养制度废止之后 —— ——
政绩考核方式改革 —— ——
网络安全的现实紧迫性 —— ——
行政审批改革如何深化 —— ——
由对比表可以得出,央视网共人工报道了2014两会的热门话题14个,可视化模型自动分析
热门话题有21个,其中包含了央视人工报道话题9个,覆盖央视报道话题数的%,额外话
题12个,覆盖自动报道总数的%。而央视人工话题的比例仅为%和%。
9
- 9 -
˖ڍመڙጲ
4 结论
本文结合新闻六要素的特点,引入新闻主题,并对新闻主题进行时序分析建模,设计了主
题、命名实体、关联关系的可视化模型对新闻事件进行描述。这种新闻的组织方式从多层次、
多角度、多刻面对新闻事件自动分析报道,符合阅读者的聚焦和发散的思维过程。在未来的新
闻事件库建模方向上,为海量新闻可视化的研究领域,提供了有效的可视化方法。
参考文献(References)
[1] 中国互联网络信息中心. 第33次中国互联网络发展状况统计报告[OL]. . http:
//
[2] Fernanda B. Vi�egas, Martin Wattenberg, Jonathan Feinberg. Participatory Visualization
with Wordle[J]. IEEE Transactions on Visualization and Computer Graphics, 2009, volume
15: 1137-1144.
[3] Frank van Ham, Martin Wattenberg, Fernanda B Vi�egas. Mapping Text with Phrase
Nets[J]. IEEE Transactions on Visualization and Computer Graphics, 2009, volume 15:
1169-1176.
[4] Juanzi Li, Jun Li, Jie Tang. A Flexible Topic-driven Framework for News Exploration[A].
John F. Elder IV, Fran�coise Fogelman-Souli�e, Peter A. Flach, et al. Proceedings of the
15th ACM SIGKDD international conference on Knowledge discovery and data mining[C].
New York: ACM. 2009. 338-341.
[5] Rui Yan, Xiaojun Wan, Mirella Lapata, et al. Visualizing timelines: evolutionary summa-
rization via iterative reinforcement between text and image streams[A]. Xue-wen Chen,
Guy Lebanon, Haixun Wang, et al. Proceedings of the 21st ACM international conference
on Information and knowledge management[C]. New York: ACM. 2012. 275{284.
[6] Susan Havre, Elizabeth Hetzler, Paul Whitney, et al. Themeriver: Visualizing thematic
changes in large document collections[J]. IEEE Transactions on Visualization and Com-
puter Graphics, 2002, volume 8: 9{20.
[7] Jure Leskovec, Lars Backstrom, and Jon M. Kleinberg. Meme-tracking and the dynamics
of the news cycle[A]. John F. Elder IV, Fran�coise Fogelman-Souli�e, Peter A. Flach, et al.
Proceedings of the 15th ACM SIGKDD international conference on Knowledge discovery
and data mining[C]. New York: ACM. 2009. 497{506.
[8] Furu Wei, Shixia Liu, Yangqiu Song, et al. TIARA: a visual exploratory text analytic
system[A]. Bharat Rao, Balaji Krishnapuram, Andrew Tomkins, et al. Proceedings of the
- 10 -
˖ڍመڙጲ
16th ACM SIGKDD International Conference on Knowledge Discovery and Data Min-
ing[C]. New York: ACM. 2010. 153-162.
[9] 唐家渝,刘知远,孙茂松. 文本可视化研究综述[J]. 计算机辅助设计与图形学学报, 2013,
volume 25: 273-285.
[10] David Newman, Chaitanya Chemudugunta, Padhraic Smyth. Statistical entity-topic mod-
els[A]. Tina Eliassi-Rad, Lyle H. Ungar, Mark Craven, et al. Proceedings of the Twelfth
ACM SIGKDD International Conference on Knowledge Discovery and Data Mining[C].
New York: ACM. 2006. 680{686.
- 11 -