一种基于引力模型的链接分析算法
1
张利国 , 张宪超
大连理工大学软件学院, 辽宁 大连 (116621)
摘 要:链接分析在 Web 信息检索领域起着重要的作用。HITS 算法是一种经典的链接分析
算法。本文分析了 HITS 算法存在的问题,并在其基础上提出了一种基于引力模型的 Web 链
接分析算法——G-HITS(Gravitation-Based HITS)。G-HITS 将网页模型化为质点;将网
页间的链接关系模型化为网页之间的作用力,它反映了网页对网页的支持与认可。因此给出
了链接分析的物理解释。实验结果表明,G-HITS算法对于原始HITS算法的TKC(Tightly-Knit
Community Effect)现象有更高的健壮性,且提高了原始 HITS 算法查询结果的权威性网页
的质量以及收敛速度。
关键词:链接分析,引力模型,内容相似度,TKC 现象
1 引言
Web是一个由复杂超文本所组成的巨大的信息源,而且以每天超过700万页面的速度[1,2]
在不断的增长,针对这样一个不断变化的信息源,如何发现和利用 Web 中的有用信息变得
具有挑战性。现有的搜索引擎技术还远远不能让用户满意
[1-3]
。这是因为 Web 信息是自组织
的和半结构化的,经典的信息检索和数据库技术很难得到有效的应用
[2,4]
。超链接是 Web 特
有的组成部分,是联系 Web 上数据资源的纽带。链接分析是提高 Web 信息检索质量的最重
要的途径
[5,6]
。
链接分析具有代表性的算法是Brin和Page(1998)的PageRank[7]算法以及Kleinberg(1999)
的 HITS (Hyperlink-Induced Topic Search)算法 [8],它们已分别成功地应用于 Google 和
IBM 的 CLEVER 搜索引擎。大部分的链接分析算法[7-10]都是基于 Markov 模型的随机游走过
程(Random Walk),即用户随机选择跳向某个新网页或跟随链接到某个网页。基于链接分析
的 HITS 算法对一些查询主题可以得到较好的结果,但是由于其不考虑网页的文本内容,在
实际应用中存在着 TKC 现象[9](Tightly-Knit Community Effect)等问题。IBM Almaden 研
究中心的 Clever[11]工程组在赋予网页集对应的链接矩阵初值时结合了链接的锚文本
(anchor),使得不同的链接具有不同的权值。Bharat [12]等人提出了对链接加权的方法,他
们认为一个站内的很多网页或者一个网页对另一个网站内的网页所产生的贡献应该是一样
的,他同时将相似度结合到链接分析中,以克服 HITS 算法的互相增强的问题。
和 提出的 SALSA[9]算法考虑了用户回退浏览网页的情况,保留了 PageRank 的随机
游走和 HITS 的 Authority 和 Hub 的思想,但未采用 Authority 和 Hub 网页之间的互相加强关
系,并且提出了两条 Markov 链,即 Authority 链和 Hub 链,对于 TKC 现象[9],SALSA 算法
有更高的健壮性。以上这些以及其它一些对 HITS 算法的改进[10, 13, 14]仍然存在着一些问题。
1
基金项目:国家自然科学基金资助项目(面上项目 60673066)。
1
因为 web 间的关系是复杂的,单纯的链接分析是不够的,而且 web 本身的内容、结构等因
素会影响网页的权威性。
本文在 HITS 算法的基础上提出了一种基于引力模型的链接分析算法——G-HITS
(Gravitation-Based HITS)。G-HITS 将网页模型化为质点、并将网页与网页的链接关系模
型化为相互作用力。这种作用力反映了网页对网页的支持与认可,它与两个网页的质量的乘
积成正比,和两个网页间距离的平方成反比。网页的质量可以用网页的链入、链出数量来反
映,网页间的距离可以用查询和网页的内容相似度来反映,即若查询与网页的相似度越大则
网页间的距离越近,且若网页间的质量乘积越大,则相应的网页间的作用力就越强。从而使
得网页链接子图的邻接矩阵对应的元素用网页之间的作用力来表示。实验结果表明,G-HITS
算法提高了原始 HITS 算法查询结果的权威性网页的质量以及收敛速度,并且有效地减少了
原始 HITS 算法的 TKC 现象等问题。
文章结构组织如下,第 2 部分回顾了 HITS 算法并分析了其存在的问题,第 3 部分详细
阐述了本文提出的 G-HITS(Gravitation-Based HITS)算法理论模型,第 4 部分通过实验将
G-HITS 算法和原始 HITS 算法做了比较和分析,第 5 部分是概括总结及展望。
2 HITS 算法模型
Kleinberg[8]提出了一种衡量网页重要程度的 HITS(Hyperlink-Induced Topic Search)算法,
他认为网页的重要程度是与所查询的主题相关的。在 HITS 算法模型中,Kleinberg 提出了权
威性网页(authority)的概念,即互联网上一个广义的主题包含有大量显著的权威性网页,
这些权威性网页从链接结构的角度来看应该是被大量的超链接所指向的,也可以说是被大量
的网页作者所认可的。在一般情况下,这些权威性网页之间并不存在相互的链接,但是它们
通常被一些不知名的网页所共同指向。这些网页被称为中心性网页(hub),它们指向多个
主题相关的权威性网页。因此,网页之间的链接结构可以描述为一种依赖关系:一个好的中
心性网页(hub)应该指向很多好的权威性网页(authority),一个好的权威性网页(authority)
应该被很多好的中心性网页(hub)所指向。同时,Kleinberg 还将每个网页赋予两个度量值,
即中心度(hub weight)和权威度(authority weight),中心度为中心性网页所指向的所有权
威性网页的权威度之和,而权威度为指向权威性网页的所有中心性网页的的中心度之和。它
们之间有互相增强的作用。
HITS 算法主要包含两个过程:
(1)网页链接子图的生成:首先将查询主题通过搜索引擎进行检索,从返回的结果集
中选取前 t 个网页构成 root 集合 R
,然后向 R
集合中加入 R
被引用和引用 R
的网页,将 R
集合扩展为 base 集合 S
,以 S
中的网页为顶点集 V,网页间的超链接为有向边,构成边集
E,形成了网页链接子图,用 G(V,E)表示。
(2)计算网页的中心度(hub weight)和权威度(authority weight):初始化网页链接
子图 G 中各网页节点的 hub/authority 权重为 1,然后进行 I/O 操作,迭代计算至算法收敛,
2
以获取各网页节点的中心度、权威度,每次迭代计算后要进行规范化处理,具体公式如下:
I 操作:
( )
(1)i j
j B i
a h
O 操作:
( )
(2)i j
j F i
h a
迭代过程用矩阵表示为:
(3)Ta W h
(4)h W a
其中 W 为网页链接子图 G(V,E)的邻接矩阵。最后,h, a 收敛为 TWW 和 TW W 的主特征向量 *h 、
*a , *ih 、
*
ia 即为网页 i 的中心度(hub weight)和权威度(authority weight)。
HITS 算法由于没有考虑文本内容,所有在实际中存在着一些问题,主要如下:
(1)互相增强[9,12]的问题。一个站点 A 上的很多网页可能指向另一个站点 B 上的某个
网页,这就导致站点 A 上网页的 hub 值和站点 B 上的网页的 authority 值的增加。相反的情
况也如此。
(2)TKC(Tightly-Knit Community Effect)[9]现象及主题漂移[12] (topic drift)的问题。由
于 hub 和 authority 的互相增强的作用,使得算法迭代容易收敛于紧密链接的网页,导致 TKC
现象的发生,如果 TKC 中的网页是与主题不相关的话题,这时就产生了主题漂移。
3 G-HITS(Gravitation-Based HITS)算法模型
为了解决HITS算法在实际中存在的一些问题,本文提出了一种基于引力模型的G-HITS
(Gravitation-Based HITS)算法模型。G-HITS 算法思想如下:
(1)仍然采用 HITS 算法的权威性网页(authority)、中心性网页(hub)以及网页的
中心度(hub weight)、权威度(authority weight)的概念。
(2)引入万有引力的思想,即自然界中任何两个质点都以一定的力互相吸引着,这种
力与各质点的质量的乘积成正比,与它们之间距离的平方成反比。G-HITS 算法将 Web 中相
互链接的网页抽象成质点,并将网页的质量分为 hub 质量和 authority 质量,它们分别反映
了网页的 hub 属性和 authority 属性。网页间通过链接关系,形成了相互作用力,这种作用
力反映了网页对网页的支持与认可,它与两个网页的质量的乘积成正比,和两个网页间距离
的平方成反比。网页的质量可以用网页的链入、链出数量来反映,而网页间的距离可以用查
询和网页的内容相似度来反映,即若查询与网页的相似度越大则网页间的距离越近,且若网
页间的质量乘积越大,则相应的网页间的作用力就越强。
(3)间接地对链接做了评价。根据上面第(2)点,如果链接不同,则网页间的作用力不
同,当然链接的重要性不同。如网页 k 同时链向网页 i、j,则若查询主题 q 与网页 i 的相似
度比网页 j 的相似度高,则网页 k 到网页 i 的距离比到网页 j 的距离近;同时若网页 i 的
authority 质量比 j 的 authority 质量大,则有链接 ,k iLink 比 ,k jLink 重要。
G-HITS 模型定义
3
定义 1 网页的 hub 质量和 authority 质量
网页 i 的质量分为 hub 质量 ihM 和 authority 质量 iaM ,且 ihM 、 iaM 为网页 i 的链出和链
入数量的函数,用函数表示如下:
(| ( ) |) (| ( ) |) (5)ihM f F i f B i
(| ( ) |) (| ( ) |) (6)iaM f B i f F i
1 (7)
、 为质量因子,一般地, 为 , 为 。其中 ( )B i 为网页 i 的链入集合,
( )F i 为网页 i 的链出集合。
G-HITS 算法认为网页 i 链出去的网页越多,其 hub 质量越大,而链向一个网页 i 的网
页越多,其 authority 质量越大;且网页 i 的 hub 质量 ihM 随 | ( ) |F i 的增大呈缓慢增长趋势,如
一个网页 i 有 n 或 n+1 个链出网页,其中 n 的值很大,如图 1 所示,即 | ( ) |F i n 或 | ( ) | 1F i n
这两种情况下其 ihM 的值基本相同,波动不大;同理 i 的 authority 质量 iaM 随 | ( ) |B i 的增大也
呈缓慢增长趋势。当且仅当 | ( ) | 0B i 、| ( ) | 0F i 时,网页 i 的 hub 质量 ihM 和 authority 质量 iaM
都为 0,即网页 i 既不具有 hub 属性也不具有 authority 属性,因为它在网络中表现为一个孤
立点,和其它网页之间没有链接关系。
定义 2 网页与网页间的距离
设查询 q 在 Query 平面上,网页 i、j 在 Web-page 平面上,如图 2 所示,则网页 i 和 j
之间的距离 ,i jr 可以由查询 q 和网页 i、j 间的距离来间接反映,而查询 q 和网页 i、j 的距离
图 2. 查询和网页之间的关系在空间中的表示
图 1. 当 n 值很大时且网页 i 的链入、链出数目为 n 或 n+1 时,
i 的 hub 质量、authority 质量基本不变
4
又可以用查询 q 和网页 i、j 的内容相似度 ,q is 、 ,q js 来表示,物理意义为若查询 q 和网页 i、
j 的内容相似度越高,则网页 i、j 之间的距离越近。用函数表示如下:
, , ,( , ) (8)i j q i q jr f s s
其中关于查询主题 q 和网页 jd 的相似度 ( , )jSimilarity q d
[15]
的计算如下:
, ,q
1
2 2
, ,
1 1
( , ) (9)
t
i j i
i
j t t
i j i q
i i
w w
Similarity q d
w w
其中:
, ,i j i j iw tf idf ;
, ,i q i q iw tf idf ;
,i jtf =词 i 在网页 jd 中出现的频率;
,i qtf =词 i 在查询 q 中出现的频率;
iidf =词 i 在整个互联网中反比文档频数的估计。
定义 3 网页与网页间的作用力
若网页 i 链向网页 j,则存在 i 到 j 的作用力 ijP ,它和网页 i 的 hub 质量 ihM 以及网页 j
的 authority 质量 jaM 的乘积成正比,和 i、j 之间的距离的平方成反比,如图 3 所示,用函数
可以表示为:
,( , , ) , ( , ) (10)
0 , ( , )
ih ja i j
ij
f M M r if i j E
P
if i j E
其中 E 为网页链接子图 G(V,E)的边的集合。
网页中心度(hub weight)和权威度(authority weight)的计算
G-HITS 算法仍然采用随机游走模型,且认为冲浪者在网络上随机地去浏览网页,以概
率 去浏览一个新的网页,而以概率 1- 在 t 时刻,随机地选择一个当前网页的链出页面去
浏览;在 t+1 时刻,随机地回退到当前网页的一个链入页面去浏览。因此 G-HITS 算法计算
网页中心度(hub weight)和权威度(authority weight)用矩阵形式表示如下:
图 3. 两个网页间的作用力关系
5
( 1) ( )1 (1 ) (11)t T tra P h
( 1) ( 1)1 (1 ) (12)t tch P a
其中 P 为网页链接子图中网页间作用力所对应的邻接矩阵。向量 1
中的元素全为 1, rP 是将
P 矩阵的每一行规范化,使得
1
1
n
ij
j
P
, cP 是将 P 矩阵的每一列规范化,使得
1
1
n
ij
i
P
。最后,
h, a 收敛为 Tc rP P 和 Tr cP P 的主特征向量 *h 、 *a , *ih 、 *ia 即为网页 i 的中心度(hub weight)和
权威度(authority weight)。计算网页中心度和权威度的具体迭代算法如下:
算法 1:G-HITS 算法计算网页的中心度(hub weight)和权威度(authority weight)
输入:base 集的链接子图 G(V,E)
输出:h, a
Iteration (G)
F(i) 为 i 的链出网页的集合
B(i) 为 i 的链入网页的集合
ijP 为 i 到 j 的作用力
1. 使 z = [1,1,...,1]T
2. 初始化向量 h 和 a, 使 h= z , a = z
3. 11 (1 )
| ( )|( )
h a Pji ijB jj F i
(13)
4. 11 (1 )
| ( )|( )
a h Pj jii F jj B i
(14)
5. 正规化向量 h 和 a
6. 使得 /i ih h h , /i ia a a
7. 重复 3,4,5,6 过程,直到收敛为止
Return h, a
此迭代算法整体的时间复杂度为
2( )O N ,和 HITS 算法的迭代过程的时间复杂度相同。
4 实验与性能评价
实验过程及参数设置
我们选取了 6 个常用的主题[8] [9] [16]作为查询集,分别为:abortion、jaguar、geometry、
genetic、bicycling、java。每个主题通过文本搜索引擎选取前 200 个 URL 作为 root set R
,
然后将 root set 按照原始 HITS[8]算法进行扩展为初始 base set S
,即对于 R
中的每一个页
面 k,将 k 所指向的所有页面加入到 S
,然后将前 50 个指向 k 的页面加入到 S
。
为了减少不相关网页对于寻找权威性网页的干扰,我们在获取 base set S
后,进行 URL
过滤,规则如下:
(1)过滤站内的链接[8] [9],因为这些站内的链接有的是起导航作用的,有的是广告等
6
链接,它们并不带表链接者的意图。
(2)根据每个主题与网页的相似度的分布情况,给每个主题赋予一个相似度阈值 ,q iMins ,
如表 1 所示,过滤掉相似度值低于相似度阈值 ,q iMins 的网页,形成新的 base set B 。
过滤 URL 后,各个主题所得的 base set B
的大小、 B
的网页链接数(Links)如表 2 所示。
根据 G-HITS 算法理论,实验中我们选取网页 i 的 hub 质量 ihM 和 authority 质量 jaM 模型公式
分别为 | ( ) |F i 和 | ( ) |B i 的对数函数:
ln(| ( ) | 1) ln(| ( ) | 1) (15)ihM F i B i
ln(| ( ) | 1) ln(| ( ) | 1) (16)iaM B i F i
质量因子 =, = 。
选取网页 i 和网页 j 间的距离 ,i jr 模型公式为:
2 2
, , ,1/ (17)i j q i q jr s s
网页 i 和 j 之间的作用力 ijP 模型公式为:
2
,
, ( , )
(18)
0 , ( , )
ih ja
i jij
M M
G if i j E
rP
if i j E
其中,G 为常量因子,一般地,G=1。E 为网页链接子图的边的集合。
最后设置各个主题的收敛阈值为 -06, =,然后根据第 3 节中的 G-HITS 算法理论进
行迭代求解 h 和 a, 直至收敛为 *h 和 *a , *ih 、 *ia 即为网页 i 的 hub 和 authority 值。
实验性能分析与结果评价
算法效率及收敛性分析
在 G-HITS 算法中增加了网页 i 与网页 j 间的相互作用力的计算,增加了算法的开销,
但是实验结果表明,算法是收敛的,且收敛的很快,从迭代次数来看,优于 HITS 算法。从
图 4 可以看出除了“bicycling”查询主题外,G-HITS 算法的迭代次数都比 HITS 算法少,
尤其是 abortion 主题,HITS 算法用了 66 次才收敛,而 G-HITS 算法只用了 13 次就收敛了,
表 2.各个主题对应的详细信息
Queries abortion jaguar geometry genetic bicycling java
B
size 1546 1097 2185 2117 1892 2851
Links 1018 1011 2190 2024 4327 9290
表 1. 各个主题对应的相似度阈值
Queries abortion jaguar geometry genetic bicycling java
,q iMins -06 -07 -07 -07 -07 -06
7
从而在较短的时间内筛选出权威(authority)网页,abortion 的权威网页如附录 1 所示。
查询结果的权威性(authority)评价
P@10(Precision at 10)评价标准度量了对于一个查询主题,系统对于该主题返回的前
10 个结果的准确率。它采取二元化的判断方式,即相关网页为 1,不相关网页为 0。
本文采用类似于 P@10 的评价标准,即将每个主题中的权威性(authority)网页评价为
1,非权威性(non-authority)网页评价为 0。我们找 10 个志愿者来做评价,然后将各个查
询的 P@10 汇总后取平均值,如图 5 所示,G-HITS 算法找出的权威网页的精度比原始 HITS
算法普遍要高,如附录 1 所示,对于 abortion 查询主题,网站
HITS 算法的 Top8、Top7 上升到了 G-HITS 算法的 Top4、Top3,
提升了权威性(authority)网页的排名,而且 G-HITS 将权威性网站 Top6 以及关于 abortion
法律方面的话题 Top7 加入进来,从而提高了 Top1-Top10 查询主题结果的权威性与多样性。
查询结果的 TKC 现象分析
观察附录 2 中 jaguar 主题的 HITS 算法的迭代结果 Top1-Top10,TKC(Tightly-Knit
Community Effect)现象[9]比较严重,其中 Top6-Top10 都是 Top8 网站的站内 URL,这是
HITS 算法互相增强[8,9,12] (Mutual Reinforcement)效应所导致;而 G-HITS 算法的网页除了
Top4、Top5 在一个站内以外,其余的 URL 都分布于不同的网站,且 Top3、Top4、Top10
的用户调查所得的权威性(authority)都比较高。HITS 算法对于 Genetic 等主题也有类似的
TKC 现象。从而可见 G-HITS 算法可以有效地减少 TKC 现象的发生。
5 总结
本文提出了一种基于引力模型的链接分析算法――G-HITS(Gravitation-Based HITS),
图 5. G-HITS 和 HITS 算法的 P@10 权威网页精度的对照图
图 4. G-HITS 和 HITS 算法的迭代次数对照图
8
它是基于 HITS 算法的改进。G-HITS 算法仍然采用了 HITS 算法的权威性网页(authority)、
中心性网页(hub)以及网页的中心度(hub weight)、权威度(authority weight)的概念,
并且将网页抽象成质点,将网页的质量分为 hub 质量和 authority 质量,它们分别反映了网
页的 hub 属性和 authority 属性。网页间通过链接关系,形成了相互作用力,这种作用力反
映了网页对网页的支持与认可,它与两个网页的质量的乘积成正比,和两个网页间距离的
平方成反比。网页的质量可以用网页的链入、链出数量来反映,而网页间的距离可以用查
询和网页间的内容相似度来反映,即若查询与网页的相似度越大则网页间的距离越近,且
若网页间的质量乘积越大,则相应的网页间的作用力就越强。实验结果表明,G-HITS 算法
是收敛的,且收敛速度比 HITS 算法更快,而且它可以有效地减少 HITS 算法的 TKC 现象
等问题,并且提高了 HITS 算法的查询精度以及权威性网页的质量。今后研究的问题在于更
加精确化网页间链接关系的作用力模型及其数学表示,从而揭示网页间链接关系的数学规
律。
参考文献
1 MENG Tao, YAN Hong-fei, LI Xiao-ming. An Evaluation Model on Information Coverage of Search
Engines [J]. Chinese Journal of Electronics, 2003,31(8):1168-1172
2 Wang XY, Zhou AY. Linkage analysis for the World Wide Web and its application: A survey [J]. Journal
of Software, 2003,14(10):1768~1780
3 Lawrence S, Giles CL. Accessibility of information on the Web [J]. Nature, 1998, 400:107-109
4 Lawrence S, Giles CL. Searching the World Wide Web [J]. Science, 1998, 280:98-100
5 Kleinberg J and Lawrence S. The structure of the Web [J]. Science, 2001,294: 1849-1850
6 ZHANG Ling and MA Fan-Yuan. Accelerated Ranking: A New Method to Improve Web Structure Mining
Quality [J]. JOURNAL OF COMPUTER RESEARCH AND DEVELOPMENT, 2004, 41(1):98-103
7 Brin S, Page L. The anatomy of a large-scale hypertextual Web search engine[C]. In: Proceeding of the 7th
International World Wide Web Conference, Brisbane, 1998, 107-117
8 Kleinberg J. Authoritive sources in a hyperlinked environment [J]. Journal of the ACM,
1999,46(5):604-632
9 Lempel R, Moran S. The stochastic approach for link-structure analysis (SALSA) and the TKC effect[C].
In: Proceeding 9th International World Wide Web Conference, Amsterdam, Netherlands. 2000,387-401
10 A. Y. Ng, A. X. Zheng, and M. I. Jordan. Stable algorithms for link analysis. Proc. 24th International
Conference on Research and Development in Information Retrieval (SIGIR), 2001
11 Chakrabarti S et al. Mining the Web’s link structure. Computer [J]. 1999,32(8):60–67
12 Bharat K, Henzinger M. Improved algorithms for topic distillation in a hyperlinked environment. In:
Voorhees E, et al., eds. Proceedings of the 21st ACM-SIGIR International Conference on Research and
Development in Information Retrieval. Melbourne: ACM Press, 1998,104~111
13 D. Cohn and H. Chang. Learning to probabilistically identify authoritative documents. Proc 17th
International Conference on Machine Learning,2000
14 Borodin A, Roberts GO, Rosenthal JS et al. Finding authorities and hubs from link structures on the World
Wide Web[C]. In: Proceeding 10th International WWW conference, Hong Kong, 2001, 415-429.
15 Gerard Salton and Chris Buckley. Term-weighting approaches in automatic text retrieval [J]. Information
Processing and Management, 1998,24(5),513-23
16 Allan Borodin et al. Link Analysis Ranking Algorithms Theory and Experiments [J].ACM Transactions on
9
Internet Technologies subject to revisions,2004
A Link Analysis Algorithm Based on Gravitation Model
ZHANG Li-Guo, ZHANG Xian-Chao
School of Software, Dalian University of Technology, Dalian (116621)
Abstract
Link Analysis plays an important role in Web Information Retrieval (IR) field. HITS algorithm is one of the
classical link analysis algorithms. This paper analyzes the problems of the HITS Algorithm, and propose
G-HITS(Gravitation-Based Model HITS)algorithm, which condenses useful information associate to a web as
its “mass”, and reflects relationship between two web pages as “attractive force”inspired by Newton’s theory of
gravitation, thus giving a physical interpretation for link analysis. Experimental results show some advantages
over HITS algorithm: First, the G-HITS algorithm is more resistant to the TKC effect. Second, the results get
higher quality authorities for the same queries. Finally, it improves the convergence rate of the iteration.
Key words: Link Analysis, Gravitation Model, Similarity, TKC Effect
10
附录 1. 查询主题为”abortion”的 HITS 和 G-HITS 算法的前 10 个权威(authority)网页的结果
Top10 HITS: Authority pages Title/Summary
1
Unplanned Pregnancy and Abortion
Information …
2 The goal of SBA is to end abortion in USA
3 Achieving peace in the abortion war
4
Maps of percentage of Pregnancies Aborted
Worldwide
5
Our mission is to ensure safe, accessible abortion
care …
6 Nation Right To Life
7 Abortion Clinics, Providers
8
Abortion Facts - Information on abortion you
can use
9 Providing … after abortion
10
Resources for Pregnant Women and Their
Babies
Top10 G-HITS: Authority pages Title/Summary
1
Unplanned Pregnancy and Abortion
Information …
2
Our mission is to ensure safe, accessible abortion
care …
3 Abortion Clinics, Providers
4
Abortion Facts - Information on abortion you
can use
5
ml Abortion and Ethics
6
Abortion Clinics and Medical Abortion
Providers
7 Abortion Law Homepage
8 National Network of Abortion Funds
9 Almanac of Policy Issues
10 Nation Right To Life
附录 2. 查询主题为”jaguar”的 HITS 和 G-HITS 算法的前 10 个权威(authority)网页的结果
Top10 HITS: Authority pages Title/Summary
1 Jaguar US Overview
2
sp?marketid=1&langid=8 Jaguar XKR
3
/ Register with
4 Jaguar US Home
5
aspx?_special=true SACRAMENTO JAGUAR-SAAB-LOTUS
6 Madison Jaguar contract us
7 Madison Jaguar map
8 Madison Jaguar Home
9 Madison Jaguar
10 Madison Jaguar
11
Top10 G-HITS: Authority pages Title/Summary
1
Post-It Note Jaguar
2
ml Motor trend community
3 Jaguar Enthusiasts' Club
4 The Jaguar lovers' web
5 Jag-lovers Screen Show Information
6
Jaguar covered in stickie notes
7 O'brien Auto Group offering Jaguar …
8
6588 Sticky Post-It Note Jaguar
9
About travel and exotic cars: Jaguar S-Type
decorated
10
ml Jaguar of Tacoma …
作者简介:张利国,男,1984 年生,硕士研究生,主要研究方向为数据挖掘、Web 信息检
索等。张宪超,男,1971 年生,博士,副教授。主要研究方向为算法设计与分析、组合优化、
数据挖掘与 Web 挖掘等。
12