- 1 -
基于Web的搜索引擎综述
马安香 孙猛
东北大学信息科学与工程学院,沈阳(110004)
摘 要: 近年来,随着互联网用户数量的增加,网上的信息迅速膨胀,在纷繁复杂的网络
信息中要找到用户关心的信息极为困难。在这种背景下搜索引擎诞生并迅速发展。本文致力
于说明基于 Web的搜索引擎的当前发展现状,简述了搜索引擎的分类和工作机制,重点分析
了搜索引擎的检索技术及页面排序方法。最后简单介绍了搜索引擎的性能评价。
关键词:搜索引擎 信息检索 排序算法
1 引 言
互联网上庞大的数据量给用户的信息查询带来的极大的困难,鉴于此,搜索引擎应运而
生。搜索引擎的主要功能是迅速从互联网上浩如烟海的信息中筛选出符合用户需求的信息,
起到了网络导航的作用。据统计,网络上 90%的用户是通过搜索引擎来获得所需信息的。
按照信息搜集方法和工作方式的不同,可将搜索引擎系统分为三大类:
1) 目录式搜索引擎:以人工方式进行主体归纳和分类,由人工形成信息摘要,并将信
息归类于事先确定的分类目录中。信息大多面向网站,提供目录浏览服务和直接检索服务,
用户可将查询限定在某一目录范围下进行。该类搜索引擎因为加入了人的智能,所以信息准
确、导航质量高,缺点是需要人工介入、信息不全面、信息更新不及时。这类搜索引擎的代
表是: Yahoo、Magellan等。
2) 机器人搜索引擎:是面向网页的全文检索服务。由一个称为蜘蛛(Spider)的机器
人程序以深度优先(或广度优先)策略自动地在 Internet中搜集信息,将搜集到的信息存入
数据库并由索引器为其建立索引,由检索器根据用户的查询请求检索索引库,将相对应的查
询结果返回给用户。该类搜索引擎的优点是不需人工干预、信息量大、更新及时,缺点是返
回信息过多,有很多无关信息,用户必须从结果中进行筛选。这类搜索引擎的代表是
Altavista 、Northern Light、Excite、Google等。
3) 元搜索引擎:元搜索引擎不对 Web进行遍历分析,也没有自己的数据,而是将用户
的查询请求同时向多个搜索引擎递交,然后将各搜索引擎返回的结果进行合并、去重,重新
排序等统一处理后,返回给用户。这类搜索引擎的优点是能够在短时间内提供相对全面和准
确的信息,缺点是不能够充分使用所使用搜索引擎的功能,用户需要做更多的筛选。这类索
引擎的代表是 MetaCrawler、InfoMarket等。
2 搜索引擎的结构和工作机制
目前,互联网上绝大多数搜索引擎的结构和工作机制相似,一般包括搜索器,索引器和
检索器三个部分。搜索引擎系统的结构如图 1所示:
- 2 -
I n t e r n e t
索 引 数 据 库
R o b o t
索 引 器
检 索 器
用 户 用 户
返 回 结 果查 询 请 求
图 1 搜索引擎的结构图
搜索引擎的工作机制:采用高效的蜘蛛程序(Robot),从指定 url开始顺着网页上的超
链接,采用某种策略(深度优先算法,广度优先算法或启发式循环算法)对整个 Internet进
行遍历,将网页信息抓取到本地数据库。然后使用索引器对数据库中的重要信息单元,如标
题,关键字及摘要等或者全文进行索引,以供查询导航。最后,检索器将用户通过浏览器提
交的查询请求与索引数据库中的信息以某种检索技术(全文索引检索技术,以模型为基础的
检索技术或概念检索等检索技术)进行匹配,再将检索结果按某种排序方法返回给用户。
3 搜索引擎的检索技术
本节首先介绍了两种传统的检索技术,全文检索技术和基于模型的检索技术。互联网上
的信息每天都在以指数级数增长,传统检索技术的简单匹配策略往往返回大量无用信息,鉴
于此,一些智能检索技术成为现在的研究热点,例如基于概念的检索技术,相关度反馈技术
等,旨在将人工智能,自然语言处理等技术运用到信息检索当中,使检索更加智能化,知识
化,本节将详细介绍这几种智能检索技术,最后介绍一些新兴的检索技术 P2P 检索,多媒
体检索技术等。
全文检索技术
全文检索是指以文档的全部文本信息作为检索对象的一种信息检索技术,全文检索引擎
的数据库中保存的是互联网上各网站的每一个网页全部内容。例如,Google 就支持全文检
索的核心技术是文档的索引,即如何将原文档中所有基本元素的出现信息以适当的形式记录
到索引库中。在中文文档中,基本元素可以是字,词或词组,因此可以将全文检索分为基于
字索引的检索和基于词索引的检索两大类。
- 3 -
全文检索的优势信息量大,响应速度快,但由于它的工作原理是将用户提交的关键词同
数据库中的信息进行匹配,所以导致了它的缺陷—返回的信息量大,而用户关心的信息只是
其中的一小部分。同时它还存在着一些潜在的问题,一个是用户很难精确地用关键词来表示
他要检索的内容,导致了检索困难;另一个是同义词和多义词问题,例如用户想要查询“计
算机“,尽管“计算机“和“电脑“,“微机”是同一种东西,但却查不到含有“电脑”的
网页 ]1[ 。
基于模型的检索技术
集合论模型 布尔逻辑模型是最典型的一种集合论模型。标准的布尔逻辑模型是二元
逻辑。所检索的文档要么与用户提交的关键词相关,要么无关,也正是由于只有相关与无关
这两个值,所以无法对结果进行相关性的排序。
布尔模型实现简单,检索速度快,但由于布尔模型是二元逻辑,匹配策略简单,会导致
漏检。
代数模型 代数模型是用检索项的向量空间来表示用户的检索要求和数据库文档信
息。依向量空间的相似性来对结果进行排序。假设用户查询请求 q 用矢量
来表示(其中 t 代表词条,w 表示相
对应的词条 t对描述该文档特征来讲重要程度的权重),用 d来表示文档矢量 )(dV ,用两个向
量的夹角余弦来表示文档的相似度,余弦值与相似度成正比,查询结果可按相似度递减的顺
序排列。计算公式为:
代数模型可以产生有效的检索效果,并能够进行检索结果分类,为用户提供相对准确的
信息。
概率模型 概率模型比布尔模型,代数模型有所改进的是考虑了词条之间的统计概率
]2[ 。考虑词条 t出现的文档是不是与查询有关的方法是:根据 Bayes定理,可以推导出词条
t的权重:
其中 R表示与用户查询相关的文档数, tR 表示在 R中出现词条 t的文档数,N表示文
档数, tf 表示在 N个文档中出现词条 t的文档数。如果 tw >0,表明词条 t出现的文档与用户
查询相关;如果 tw <0,表明词条 t出现的文档与用户查询无关。
在实际应用当中,往往是将上述的检索模型混合在一起,以达到最佳的检索效果。
基于语义的概念检索技术
基于语义的概念检索是把信息检索与人工智能技术,自然语言处理技术相结合的检索,
是一种相对智能化,知识化的检索技术。概念检索技术利用了词条在概念上的相关性,从词
所表达的概念意义层次上来认识和处理用户的检索请求,而不局限于查询请求的表面内容,
- 4 -
例如我们在查找“旅行社”时,还会找到“旅馆”,“宾馆”等词条的结果。基于语义的概
念检索包括两方面的内容:实现语义同义扩展检索和相关概念检索 [ ]3 。同义扩展能够提高检
索的查全率,相关概念检索能够加强系统与人的交互能力,使其更加智能化。因此,概念检
索技术可以检索出那些并不显示地包含用户指定的词条,但是却包含其相同或相近词条的文
档。一些搜索引擎,例如 Excite就是总体目标依赖概念进行搜索的搜索引擎。
可以看出,基于语义的概念检索立足于对原文信息进行语义层次上的分析和处理,提取
各种概念信息,并由此形成一个知识库。而知识库本身就是一个概念的语义空间网络,因此
首先要利用人工智能,自然语言处理技术构造语义网络。检索系统可利用语义网络对网页进
行语义标注,形成索引库。同时利用语义网络,对用户的查询请求进行语义分析,之后同索
引库进行匹配,进而实现深层次的概念检索。
相关度反馈检索技术
相关度反馈技术的原理:通过对用户提交的查询请求不断地进行修正以提高系统的查准
率。如图 2所使示:
图 2 相关度反馈 ]4[
相关度反馈检索技术的工作原理如下:检索器首先将用户提交的查询请求所对应的查询
结果返回给用户;然后用户对查询结果中文档的相关度进行评估,并反馈给系统;最后系统
根据用户的反馈对查询请求进行修正。重复此过程,直到用户得到满意的结果为止。
相关度反馈检索技术可以大大提高系统的查准率,但它的缺陷也很明显——需要大量的
用户参与。
P2P检索技术
传统检索是以服务器为中心,检索必须以服务器作为中介来进行,即用户向服务器发出
查询请求,由服务器将检索结果按一定的排序方法返回给用户。这种方式必然会导致一些问
题:如果服务器信息更新周期长,将会产生过时的信息;服务器收集的信息类型有限等等的
问题,而P2P检索技术的运用为互联网的信息搜索提供了全新的解决之道。P2P是Pear to Pear
的意思,可将其翻译为“端对端”,“点对点”或者“对等”。它是一种用于不同 PC用户
之间,不经过中介设备直接交换数据或服务的技术,允许网络用户交换文件。P2P能使用户
深度搜索文档,强调以用户为中心,且无需通过服务器,也可以不受信息文档格式和宿主设
备的限制,来进行文件数据的交换。因此,P2P检索能够共享所有用户硬盘上的文件,目录
乃至硬盘,实现了对互联网的全方位,深层次的搜索。目前采用 P2P 技术的搜索引擎有
- 5 -
Widesource ]5[ , Pandango ]6[ 等。
P2P检索还存在一些问题有待于进一步解决,首先是信息收集和传递的问题,由于 P2P
检索系统不再使用服务器作为中介,而是使用联网方式,由于用户的联网时间可能会有所不
同,因此给信息收集和传递带来了一定的困难。其次还有个人信息的安全和隐私问题。
多媒体检索技术
互联网上的信息不再是单纯的文本信息,越来越多的文本,图像,声音和视频的混合
体——多媒体信息出现,使得多媒体信息检索技术成为信息检索研究的热点。以位串形式存
储的数字化多媒体信息,与数据描述之间缺乏对应关系,因此需要特殊的检索处理技术。即
多媒体信息检索技术的关键是图像,声频和视频检索技术,而图像,声频和视频的检索也是
以其自身的形式与内容特征描述为基础。基于内容的多媒体信息检索技术的含义是根据媒体
和媒体对象的内容及上下文关系在多媒体数据库重进行检索的一种检索技术。由此可见,多
媒体检索技术涉及图像处理,模式识别,计算机视觉等多领域的知识。
综上,可以看出传统的检索技术匹配模式单一,只是机械地进行关键词匹配,这种方式
已经很难满足用户的需求了。现在,搜索引擎的检索技术正朝着更加智能化,知识化的方向
发展,将检索提高到知识层面来,从而设计出高效率的搜索引擎。
4 搜索引擎的排序方法
搜索引擎的排序方法直接影响着搜索引擎的检索效果,如果搜索引擎能够按照检索结
果的相关度大小进行排序,将节省用户在结果集中筛选自己所需信息的时间,从而提高检
索效率。目前常用的排序方法有:词频位置加权排序算法,PageRank算法,自动分类法等。
词频位置加权排序算法
词频位置加权排序算法是一种从关键词出现次数和位置考虑进行排序的方法。该方法的
排序标准是:按照用户提交的查询关键词与网页的相关度大小进行倒序排列。而在该方法中
相关度是由关键词出现次数和位置这两个因素来决定的,因而将这两个因素加权,可得出相
关度的值。由此可见,词频位置加权排序算法的原理是用户提交查询关键词,搜索引擎按照
检索词在不同网页的相关度排序。
以词频和位置来计算相关度的方法比较客观,而且简单,易实现。但这种方法受网页内
容的质量所影响,例如如果网页设计者在设计网页时,有意提高某些词在网页中出现的次数,
进而提高其在检索结果中的排名,这种现象就会影响词频位置加权排序算法的准确性。
PageRank算法
PageRank算法是 Google推出的一种链接分析算法。它的原理是:是通过网页被链接的
数量和质量来确定搜索结果的排序权重,在关键词文本匹配的基础上,利用Web超链结构,
对一个网页与其它网页的连接关系进行分析,即检验一个网页被其它网页链接的次数,指向
它的网页越多并且质量越高,说明该网页越重要,进而 PageRank值就越大,从而确定该网
页在检索结果中的排列顺序。PageRank算法如下:
- 6 -
))(/)()(/)(()1()( 11 TnCTnPRTCTPRddAPR +++−= L
其中 T nTT LL21 , 是指向页面 A的网页,参数 d为值在 0与 1之间的衰退因子,Google
通常将其设为 ,C(T i )是网页 T i中链接的个数。
显然,PageRank 方法注重网页内容的质量,因为只有质量好的网页才会被其它网页所
链接。因此 PageRank方法提高了检索结果排序的准确性,能够把最相关的网页提供给用户。
自动分类方法
自动分类就是计算机系统代替人工对文档进行分类,一般包括自动聚类和自动归类 ]7[ 。
自动聚类指的是由计算机系统按照文档的特征,将相近,相同特征的对象聚合在一起的过程。
自动归类是计算机系统按照一定的分类标准,将文档对象划归到不同类目的过程。搜索引擎
将检索结果按照分类显示,用户可通过浏览类别,选择相关的检索结果,从而节省用户的判
断时间,提高检索效率。网页的自动分类可以实现网页标引和检索的分类主题一体化。
以上介绍了几种主要的排序方法,还有 Direct Hit算法(即点击率方法,以网页的点击率
高低决定排序),付费排名方法等也被一些搜索引擎所采用。搜索引擎的排序技术将会朝着
两个方向发展:语义相关性和排序个性化。前者需要完善的自然语言处理技术,后者需要记
录庞大访问者信息和复杂的计算。
5 搜索引擎的性能评价
衡量搜索引擎的常用的几个性能指标如下:
¾ 查全率:是检索出的相关文档数和文档库中所有的相关文档数的比率(由于搜索引
擎系统无法搜集到所有的WEB网页,所以查全率很难定量计算)
¾ 查准率:是检索出的相关文档数与检索出的文档总数的比率
¾ 响应时间:从用户提交查询请求至服务器返回查询结果所需的时间
¾ 重复率:检索结果中内容重复的结果数占全部检索结果数的比例(可以取前 n 个结
果进行估算)
¾ 死链接率:检索结果中死链接的结果数占全部检索结果数的比例
6 结束语
以上对搜索引擎的工作原理,检索技术及排序方法等相关知识做了较详细的阐述。可以
看出,为满足用户对高质量的,准确的信息资源的检索需求,如何优化搜索引擎的性能已经
成为研究热点,有些搜索引擎采用分布式体系结构来提高系统规模,使用基于智能代理技术
进行信息过滤和个性化服务。总之,搜索引擎正综合人工智能,计算机网络,分布式处理和
自然语言处理技术等多领域知识,朝着更加智能化的方向发展。
参考文献
[1] 刘俊平,李书振,张志毅,智能搜索引擎实例分析,计算机应用 2003
- 7 -
[2] Gudivada V N, Raghavan V V. Grosky W I. Information Retrieval On The World Wide Web.
IEEE Internet :58-68
[3] 李蕾,王楠,钟义信. 基于语义网络的概念检索研究与实现. 情报学报 。
[4] 王继成,萧嵘,孙正兴等,Web信息检索研究进展,计算机研究与发展
[5]
[6] http://
[7] 曹树金,杨涛. 自动分类在搜索引擎性能优化中的应用. 情报科学
A Survey of Web-based Search Engine
Ma Anxiang and Sun Meng
Info and science college of northeastern university shenyang(110004)
Abstract: Recently, with the growth of users on the internet, the information is flooding everywhere. It
becomes more and more difficult to get what we want from all kinks of information. Based on this
phenomenon, search engines are introduced and develop rapidly. This article introduces the
classification and operation mechanism, stresses on retrieval techniques and ranking algorithms, in the
end the evaluation of performance is presented.
Keywords: search engine, information retrieval , ranking algorithms
作者简介:马安香,女,1979 年生,硕士研究生,主要研究方向为信息集成。孙猛,男,
1976年生,硕士研究生,主要研究方向为信息集成。