第卷期计算机学报34 2Vol.年月01CHINESJOURALFMPTeb深度万维现状清华大北京摘要已成上十源是热前有多主集在发接口以及果层面而对这个超出所涵盖百倍宝贵人们还缺乏足够了解认识一些问例如具体规模;各布何没能给明确回答针况采挖掘进行别并将其按不同划提两客观量作相介绍站首页来实验当拥半属商业比较地反我使时复杂简单约占却少论醒今后加强词号/犇犗犐犚犲狊犪狉犮犺狅狀狋犘犛狌犳犆犻犠犫狆YKZ犿犱犜犾犵狔犝狏犅犼犃rfxwvqz’犓狑收稿日:本课题得到国家自然科基金重点项目“支持中文研究的础设施建和应用方法与关键技术”6W()资助刘玉奎,男生硕士向为数据库分类周立柱895maiuyk7@stnghdc教授博导师领域信息系统、字图馆于搜索表示等范举结构化网络查询扩展处理Dp书
期刘玉奎库都构引言界学许1 定成容中文万维网的飞速发展,使得其在全球[]所占比重越来大内部涵盖信息也丰富然而对于包含深度人们.涉目前却缺乏足够认识一些基本问题例如:面方()具体规模有多;2不同领域上分布何等还没明确概念项只获为了能现状进行客观才开入统计以搜索擎爬取到数据础通般形式过利用挖掘类技术献者采3自动别并按划或我工作主要两个将转化二情可达算法综合更特征效地解决该国外已经录站功割提出它CompletanIvisbW种层次实验证较手标好性知这是第注高扩差称研究当总量及各未公况回答79和存困惑交结果表60填写返查询接口半属商业且依建混淆矩阵简单复杂约假设限但集由值指导造身策略无应函MDdfr蕴藏着海需聚今后加强签价格图像4下几介绍首先相试准率%关整处理流程针预操、型页抽Hu详细初步析做括最望优调很英少讲庞
算机学报年询的分类策略和基于非查供户找内部种样.是指,通过填写深度万维网表单并提交属同国家站等利用返回结果对进行而条集则不依:据其自身一些特征方法()位核心问题词选择如何面临另个需要频繁访字符编码简2所在服务器会造成大量络带宽浪费存优点比较高效空即签但4合信息抽取技术任控件包含各具有更可扩展性由上中文数规模庞07处理将相当耗时工作因此本采动识别多力型3 节首先整体流程使参名称值源介绍接着以该总为础我们86标准化这步获得了后应般形式出做好备来1容能够现状客观调搜狗全定义意给图示Γ四元组〈〉Σ=犐犆犛犚;说又预滤掉冗余三犖犜犔主最析实里输入统计下框、隐藏按钮拉索引擎抓到某思想链地址尽页倒排及Action
期刘玉奎库状研究6单所在网站的址具体实现非查询.对于任意给定,通过上面义可以表示策略处理涉及Γ为如下多元组形式〈〉利因=犖犜犔犆犛犚图其中类特征指是内文本此讨论围之2“到达城市”等;各控件了获得我们(输入框)数量步方①向链接地点击酷讯搜索后首先NekoHTML②树着提供DOAPI返回结果页包含未口标出从整离剩余部遍历目统完另Frm性括这valunti深度万维模型范例 功能和权重去除头有不同将转化采用/或按隔hps[1]空间来进行描述并做划线斜号问切观察发许3驼峰命名应每大写母割滤掉…代?犉犲犪狋狌狉ωURwc45狀犻g个一二&d8由字符成犿犠犵犺fxy+词该属某_S两说相似公计算:·γ犾它犮狊值、分别英节构造基础规最抽取合据挖掘种法经常混杂自动识工作也起需效程介绍bj主要EC
报年征规范化对于抽取出来的各类特,本文通过结合利相析.①②用和完成中包发括IKAnalyzerSowB6含英进行处理首先最长编号与图例3匹配将其分离开接着登陆注册、投票邮件词并删除掉常(如:提交评论翻从5我们是等)同时记录下个单现频率供看控签内容都后续需要;全部转为小写字带困难母去重复应根一样每统计经这步程实了深度万维网所不型模多元组形式向量该值面自动识别打基础4 数据庞大而何有效地说功研究项工作节主依赖集介绍表判身关系断否属问题描述1链解决在上浏览页候人会遇到比验它以Fm明综情也称查况询口非目标就找那些由某给③期待定只两种可证策树J8能因此二挖掘算法方虽然达很高准确但费力采价使[]召回正Msu较好扩展性当新加入果折叉0被广泛机器学习具适即份轮流办/htpcdgik2b均W
期刘玉奎等:库现状研究其中的份做训练集,剩余测试最后将算法上性能了比较如91次结果均值作为终验证(代化;0.NumericalBsdTxt本节使用实数据来源于表组合多OEF我们通过手工方式从选取个单进行标注)可以看出基84包括图所示各类不同非深度万维网具有高准确率而3和一定量召回综特征文识别仅更且 对型在种分5情况许由场景下都、ConjvRVILW[]几乎达到整体%J便择正M好全部稳因此自动模并统计6得知拥构建7处理2规参名称查询接口总
统计结果显示,当前中文万维网上共有多法 60深度查询接口与献[]年初的性将.142个相比增加了近倍在其特征简单组起器7CNI①报告提出从到国评价耦无9站总数长拥达很好析发5更快速这说明迅大量冗余因此过程许都开始合利用据库技术择重仍为户供方便对内关信息受启找依容划针训练得分类下完成体规模后以处理基里使确础本进一步各领域率召回采FM布行节首先介绍我们构建识别折交叉证级目录该着实验最存较是表面典型但之间少和层次来不同没标准于外已经些应如期待、解决BrightPlaneompvsbW等问题可看fuSxcEGd还见似现低%②通参考概左右YZR所根高3J编号名称购物算机互联教育科学人艺商业济社会化新闻媒8医疗健康游戏由差原娱乐休闲运动详细包含子且需要手工注式选取整集条试图第展状况:/寻种效策略而wDy能够地并
期刘玉奎:库状研究选择算法,将最能表征深度万维网所属类别的特是指包含括保留下来而那些冗余过滤掉站则.犆犛基于分54 上一步实验结果得知中文链里没考虑化大量存在造成了性不理想说现形因此通对数据集利用同进行个控件我们重新展开很领域关联多种样如互信息(MutalIn)、低损降formiLwseDy和频率差训练构RdcvFq等本采目前被广泛使PBC[1]档增益卡方检高3相应比较;后各都有某给V定程改善简单组合首先置似除外其它门槛值认正Zλ以整体好直返J8图示传7S#作终输2从可看出与效达到接近准确但更0%NH召回却另面h这式即也无地解决问题提取拥层次策略仍受析献启发6依内容割并为器获该模型设计证明具础标注页两部主要
中的多万文深度维网进行分类处理通过60.对实验结果析,我们稍微约布和其包含简单查询接口复杂比少差9例了统计1研究 本在却由各领域数量如表所示4特策略适:()不同模式识别问题名占/%商业与经济328明确哪购物;社会化5算机互联7娱乐休闲探测受教育灵时新闻媒体医疗健康字段何人艺术综待游戏科学运动论从可以看出最主要集两个将近抓全基础而者总这CNI预、年月份报告国几民应用络完成级目务交易大幅增加趋势相吻合越来录上信息使得家更状概括客观回答关注于自己营销搭建站存疑宣传推广活获规据部内都方便户找知能些有效地整起是无初庞库也容解取长倍产生巨帮助作称末指只一输入拥着高框利针属性速说展则后台开始显供选择或填写此快功并面隐藏海且搜索引擎很似值到较言思考需构但为提精准绝[]涌象发现当前事许企
期玉奎等现也开始将自己搬上万维网另一方面,我们还对中文.K深度简单查询接口和复杂的比例进行了统计结果表明所占重相当各约这说在50%Q前人追求同时准确而许多研究都主要集T需今后注从能够背蕴含海量信息有效利用E由于本采基分类模型策略因此未来不断增长具良好通—性扩展可以该系历年状况跟踪析其发趋势但算法率目达到很工作关应改善提高参考献[]1LiuWeMngXaoFYAsrvyfDpxbdtChJlm27():3948刘伟孟小峰卫数据成综述机学报ZIPGSc/zwOB6赵朋崔志岭仲华国规、H布构微NkqU林玲周立柱库式识R别清大V犔犐犝犢狌犓犻犣犎犗犺犉犃犖犑
计算机学报年37 犅犪犮犽犵狉狅狌狀犱,WithedvlopmnfIraDb.Tcs’uygMwkzSBPL60xHF:()q1;C2