信息组织 (讲义) 安徽大学管理学院
目录 目录..................................................................................................................................................0 第1章 信息组织概述...................................................................................................................3 信息的概念、特征、分类与作用....................................................................................3 信息组织的发展、概念与条件.........................................................................................6 信息组织的内容、原则和特点.........................................................................................8 信息组织的原理和理论基础...........................................................................................11 信息组织的目的和作用...................................................................................................14 第2章 信息组织方法...................................................................................................................16 信息组织方法概述...........................................................................................................16 主题组织法.......................................................................................................................17 分类组织法.......................................................................................................................27 其它信息组织法..............................................................................................................36 第3章 信息组织技术(一)............................................................................................................38 文摘..................................................................................................................................38 综述..................................................................................................................................44 目录..................................................................................................................................47 索引.................................................................................................................................50 第4章 信息组织技术(二)............................................................................................................58 信息编码与代码..............................................................................................................58 数据库.............................................................................................................................63 数据仓库.........................................................................................................................70 超文本.............................................................................................................................72 虚拟现实.........................................................................................................................77 自动分词与自动标引......................................................................................................79 第5章 多媒体信息组织的素材准备...........................................................................................82 多媒体概述......................................................................................................................82 多媒体素材处理..............................................................................................................84 图形与图像的概念是什么?常见绘图软件如何操作?.....................................................91 第6章 多媒体信息组织...............................................................................................................92 多媒体著作工具..............................................................................................................92 多媒体教学软件...............................................................................................................95 多媒体电子出版物..........................................................................................................99 第7章 网络信息组织理论.........................................................................................................104 网络信息组织概述........................................................................................................104 网络信息组织评价指标体系........................................................................................109 信息组织方法在网络信息组织中的应用与发展.........................................................111 网络信息的类型及其组织.............................................................................................115 网络信息组织与发布.....................................................................................................117 第8章 网络信息组织工具.......................................................................................................130 1
网络信息组织工具软件................................................................................................130 网络信息组织语言工具................................................................................................133 第9章 信息组织与知识组织、知识经济.................................................................................151 信息组织与知识组织....................................................................................................151 信息组织与知识经济....................................................................................................156 2
第1章 信息组织概述 信息的概念、特征、分类与作用 信息的概念 信息广泛存在于自然界和人类生活的各个领域。每种事物都是信息的发出者和接收者,信息是维系世界万事万物的纽带,所以,现代社会将其与物质、能量并列,认为它们是构成世界、促进社会发展的三大要素。 信息一词在我国使用由来已久,最早见于《三国志》, 此后,历代文献多有“信息”一词出现,其最基本含义是是指消息、音讯。“信息”作为科学的概念的提出,是19世纪初的事情。随着第三次浪潮《大趋势——改变我们生活几十个方面》,《信息时代的大趋势》等阐述信息社会的一些代表性著作在全球的广泛传播,人们对信息的关注和热情超过了以前任何时候,信息这一概念被广泛使用,如企业信息、政府信息、市场信息、价格信息、信息咨询、信息经济人、信息经理(CIO)、信息管理、信息开发等。但信息是什么,对此回答千差万别,目前已有一百多种之多,根据乌家培教授的观点,可以有以下五种类型: (1) 从信息是什么来定义 如维纳在1928年写的《控制论——动物与机器中的通信与控制问题》中提出:信息既不是物质,也不是能量,信息就是信息。这个定义说明信息是区别于物质、能量的另一构成世界的重要因素。 (2) 从产生信息的客观对象来定义 “信息是在观察或研究过程中获得的数据,新闻和知识”(《韦氏词典》),“信息就是音讯、消息”(《辞海》)。这些定义说明客观世界是“形”,而信息就是反映它的“影”。 (3) 从接收信息的认识主体来定义 申农在1948年写的《通信的数学理论》中,提出一个系统所接收的“信息是能够用来消除不确定性的东西”,与此相类似,“信息就是收信者事先所不知的报导”(《辞海》),由此引申的还有:“信息是系统有序程度的度量”,“信息是人们对外界事物的某种了解和知识,它能减少人们决策时的不确定性”等等。这类定义说明认识主体由于得到信息而增进了对客观对象的了解。 (4) 从传输中信息所依附的载体来定义 如:人们常把信息当作信号、数据、资料、性质、消息、新闻、知识等的总称,是客观对象对认识主体的作用或认识主体对客观对象的反映,通过传输的信息来表现,而信息常常内含于各种信号及其组合之中,信号包括语言、文字、电波等,而数据、资料等实际上就是复合信号。这种定义说明信息作为内容有它外在的表现形式。 (5) 从信息的发送、传输、接收的统一客观及和主体之间相互作用来定义 信息作为一个科学概念加工使用,最早出现于通信领域。本世纪20年代,H·奈克斯特和L·哈特莱开始研究通信系统的传输效率问题,H·奈克斯特提出,电信号的传输率与信道频带宽度之间存在着比例关系,早期的信息论从通信理论的角度认为信息是信源、信道、信宿之间的联系中生成的东西。维纳在《人有人的用处》一书中也认为“信息这个名称的内容,就是我们与外界进行调节并使我们的调节为外界所了解时而与外界交换来的东西”。艾什比在《控制论导论》一书中则从观察者的分辨能力来确定集合的属性时指出“信息就是变 3
异度”,从而被后人引申为“信息就是差异”(朗格《信息理论》)。这类定义说明信息作为作用与反作用的过程存在于事物反映特性的相互联系之中。 综合各个领域的研究成果,对信息可以从狭义层次和广义层次进行定义:按狭义理解,信息是一种消息、信号、数据或资料;按广义理解,也就是哲学层次上理解,信息是物质的一种属性,是物质存在的方式和运动规律与特点的表现形式。这种界定高度抽象地概括了信息的本质。整个自然界和人类社会的各种现象:差别、变迁、运动、异化、发展、传递、衍生、裂变、化合、分解、光合、融解、凝固、升华、繁殖、发育、生长、沉淀、冲积、风蚀、日蚀、进化、协调、共鸣、伴生、中和、衰变、对流、盈亏等所有的一切一切都会产生信息,而信息本身又是不断运动的,因此,信息是无处不在,无时不在的。如果将两者结合起来,具体到信息的社会控制及应用领域,信息还可做如下定义:信息是可以被人类感官感知、大脑加工、并以各种方式存在和传播的一切自然和社会现象的关系与属性,它是构成知识、情报的原料,是一种特殊形式的资源。 从本质上说,信息是物质与意识的中介,它既不超物质,也不超精神,但又不能归结为物质或精神,它既不等同于物质又不等同于精神,但又兼备物质和精神的某些特性。 信息的分类 信息有不同的类型,对纷繁复杂的信息进行归类,有助于我们更深刻地认识信息,利用信息。国外学术界比较有代表性的分类方法主要有以下五种: (1)按信息内容分 按信息内容,将信息划分为社会信息和非社会信息。社会信息是指反映人类社会一切事物的存在和运动变化状态的客观描述,非社会信息是指反映自然界一切事物的存在和运动变化状态的信息。 (2)按获取方式区分 从人们直接经验中即从亲身实践中获得的信息是直接信息,多指事实和现象;间接信息是从人们间接经验中即利用他人的实践和认识成果获得的信息,它主要包含在文献、资料、数据等之中的信息。 (3)按存在方式区分 储存在人们大脑即体内载体中的信息和以符号形式存在即寄存于体外载体中的信息分别称为内在信息和外化信息,也可称为个人信息和社会信息。 (4)按传播范围区分 信息按传播范围区分可分为公开信息和非公开信息。公开信息指不限制传递和使用范围的信息,既包括大众媒介所传播的信息,也包括各种组织传播的信息;非公开信息指传递和利用范围较小的内部信息。在一定地条件下,他们可以相互转化。 (5)按加工程度区分 按信息处理加工的程度,我们可以把信息分为零次信息,一次信息,二次信息和三次信息。零次信息即未经加工的零散的不系统的信息;一次信息即根据零次信息创造而成的初加工信息;二次信息则是在一次信息基础上加工整理而形成的引导和使用一次信息的信息,是信息组织的结果;三次信息是根据二次信息提供的途径获取并使用一次信息,结合其它零次信息,分析综合形成的高层次有序信息。 除上述划分方法外,还有其它的分类方法。如按信息自身所具有的特性为标准,将信息分为动态信息和静态信息。按认识论的标准,将信息分为潜在信息、先验信息和实得信息。还可按组织有序性分为系统化信息和非系统化信息,按反映面分为宏观信息和微观信息、中观信息。 4
信息的特征 正确认识信息的特征,是信息组织活动的基础,也是整个信息工作的基础。目前,学者对信息特征的表述差异都比较大,但基本的一些特征包含以下几个方面: (1)客观性与普遍性 信息是事物变化和状态的客观反映,不仅其实质内容具有客观性,而且一旦形成其本身也具有客观实在性。 信息是万事万物存在方式和运动状态的表征,因而只要有物质和精神的地方都会有信息,因而信息具有普遍性。 (2)表征性和可识别性 表征性是信息最基本的特征之一,信息能够表征事物属性、内在联系和含义,同时联系又是可识别的,即可以为人类感官或仪器感知、接受和识别。可识别性的另一含义是可计量性,由于信息的可识别性,而可识别的信息又能表征事物属性以及事物之间的联系和变化规律,因而人们才能够认识世界、改造世界。 (3)可存储性和传递性 信息不仅可以被存储而且可以被传递。信息存储的载体非常多,如纸张,磁介质,光甚至物体本身,如样品、石头都有可能视为存储介质。信息只有通过一定的物质载体传递给人才能被接收和利用。 (4) 信息的价值性和共享性 信息是一种资源,具有使用价值,能够满足人们的需求,有人预测,未来世界国家之间的竞争优势在于信息资源的拥有量。信息的共享性,也就是非排斥性,在一定时间、空间里,在一定的程度和范围内可以共享,尤其在网络化的今天,信息的共享性得到更加充分的认证,如位于某台主机上的信息可以为全世界用户所共享。 (5) 信息的不确定性和不完全性 由于认识的局限性,人们所获得的信息只是对某种事物的不完全确定的反映,其反映的内容也是不完全的。由于这些特点,人们需要深入揭示、科学处理、全面分析信息,才能最终找到事物的本质属性和内在联系。 (6) 信息的时效性 信息具有时效性,是指随着时间的推移,信息会逐渐失去其应有的价值。时效性的大小与信息的类型密切相关,如某条商业信息,若超过一定的时间界限可能会毫无价值;但一些自然科学的经典理论可能在很长一段时间都能被人们认可,一些珍贵的古文物、历史遗迹、手迹也可能随时间推移更有利用价值。 (7) 信息的可处理性 信息可以通过一定的方法和技术进行加工处理,即从无序变为有序,从冗杂变为精练,从分散变为集中。信息的可处理性也可称为可组织性,经过加工处理的信息可能会再生出新的信息,如元素周期的发现即是如此。由于信息可处理性的存在,人们才能去开发信息,利用信息。 以上是信息的主要特征,信息还有更多的特征,如有机性和差异性、中立性和可转换性等等。 信息的作用 信息的功能使信息属性得以体现,信息的基本功能在于维持和强化世界的有序 性,信息的社会功能则表现为维持社会的生存,促进人类文明的进化和人自身的发展。 5
也有学者从个体、团体、社会三个层次考察信息的功能,还有学者从信息与管理、决策、控制、组织等方面加以考察,概括起来,信息的功能主要体现在: (1) 信息是万事万物有序性的依据 缺少信息的世界是混乱的世界,无机体与有机体都是通过信息的交流来维持它们之间的协调的有序形态。人类社会更是如此,信息规定了人与人之间的法则,即信息为社会立法。 (2) 信息是人类认识世界和改造世界的中介 人类是通过感官或仪器捕捉事物发出的各种信息来认识世界的,没有信息的事物是不可能的。因而事物都是可以被认识的。只是由于认识的时间和空间局限性,在一定时间段上和一定范围内会有一些事物没有被认识和改造。这就需要我们去挖掘潜在信息,从而使我们对事物的认识更为深刻。 (3) 信息是维持社会生存与发展的动因 维纳认为,信息是人类社会的“粘合剂”,人类社会之所以称之为社会,乃是人与人之间存在信息交流,因而知识得以积累,文明得以延续,社会得以不断向前发展。 (4) 信息是管理的基础 管理活动的全过程实际上是信息的收集、分析、传递的过程。管理者不断监控管理客体的运动状态,及时收集反馈信息,并不断地调整,保证目标的实现。信息能有效地避免决策的不确定性。信息是智慧的源泉。 信息组织的发展、概念与条件 信息组织的发展简史 作为信息活动的重要组成部分,信息组织是与人类社会同时产生并同步发展的。“结绳记事”是我们祖先将在社会实践中获得的信息组织起来并存贮在绳子上,来记录氏族活动的。而当时人们已可以将自然现象组织起来并以八种图形加以描述,人们凭借这些组织过的信息推演千变万化自然现象的内在规律,从而为社会活动和农业生产提供决策服务。在夏商时代,为了利用数以千计的甲骨文,出现了简单的标示著录法及排列法。比较成体系,有一定规模和影响力的是公元前6年汉代二刘编制的《七略》,是为了方便经学传播及读书人对“天下文献”的利用,在整理、编写、提高的基础上编撰了《别录》、《七略》。此后,历代都有编制。 我国古代使用最久的是四分法,即将所有文献分为经、史、子、集。魏晋南北朝、唐宋元明皆有官修书目、史志目录、佛经目录等,清代《四库全书总目》更创历史之最。可见信息组织活动已从个人的、零碎的发展到国家和社会的,其程度和影响力也不断扩大。 西方国家信息组织活动同样具有悠久的历史,最早可以追溯到公元前6世纪亚述王朝的巴尼拔图书馆,该馆将文献目录分为人间、天上两类。公元前250年左右,亚历山大图书馆就把目录分成史诗、抒情诗、历史、哲学等部分。古希腊和古罗马采用了与手稿内容相适应的分类大纲。如亚里士多德将人类的知识分为理论知识、实践哲学,创造哲学四部分。中世纪教会统治时期,学校教授《七艺》即将学科分为文法、修辞、辩论术、算术、几何、物理和天文。15世纪末,大学图书馆将图书按哲学、医学、法学和神学进行归类,而被称为“西欧书目之父”的格斯纳和著名英国大哲学家弗兰西斯·培根(Francis Bacon)对西欧的图书分类产生了直接影响。 第一部现代意义上的文献分类法,是1876年美国图书馆学家杜威编制出版的十进 6
分类体系,随着《杜威十进分类法》的使用和不断修订,一批有影响力的分类法相继产生。至今,这些分类法还在各自领域发挥巨大的信息组织的作用。 字顺法的发展最早可以可以追溯到我国古代类书的编制和西方13、14世纪的圣经语词索引,这些检索工具基本上具备了主题法的主要要素。 现代主题法原则的确立,是以1876年克特的《字典式目录条例》为标志的,《美国图书馆协会标题表》、《美国国会图书馆标题表》正是在该理论的影响下发展起来的。1933年印度图书馆学家阮冈纳赞《冒号分类法》的发表标志了现代文献分类、主题法的一个重大突破,建立了分面理论直接影响了后来的主题语言的发展。 现代,由于信息技术的飞速发展,利用计算机进行信息组织和检索越来越普遍,自然语言开始兴起,传统信息组织方法相互交叉和渗透,一批适用于网络信息资源组织和检索的方法和技术开始形成。 综上所述,古代无论中国还是西方国家,信息组织都是对图书进行分类和组织,其主要原因与当时信息载体形式单一、数量较少有关。但到了19世纪以后,由于资本主义获得极大的发展,工业革命的兴起,至20世纪,科技迅猛发展,导致信息量急骤增加,这时社会对信息组织活动也提出了更高和更迫切的要求,信息组织因此获得了前所未有的发展。 信息组织的概念 信息组织活动之所以得以进行,在于:(1)信息是可以加工处理的,或说是具有可塑性;(2)信息所反映的客观世界是协调有序的,如地质的变迁、宇宙的演化、生物的进化、物质的化合和分解、社会的发展等都具有显著的规律性和有序性。 那么什么是有序性呢?序是事物的一种结构形式,指事物及其组成诸要素之间相互联系以及这种联系在时空结构中的表现。如时间序列中的先后、空间结构中的排列组合、立体结构、结构层次等。当事物组成要素具有某种约束性或在时间序列、空间结构上呈现某种规律时,我们就说这种事物是有序的。有序无序是就一定参照系而言的,一部分信息按这一参考系进行了整序,则就这一参考系来说这批信息是有序的;若没按另一参考系整序,则就另一参考系说这批信息是无序的,因而有序性不是绝对的,是根据使用者的不同要求来决定的。如一些信息经一定加密处理后,其它人便难以识别,因此,参照系的选择对信息组织活动有重要的影响。 虽然事物都呈现出某种有序性,但这种有序性并不是自然体现出来的,或不是我们所需要的,这就必须经过人脑对信息进行加工处理才为人们所认识,因此,不论外界的客观事物其发展变化是简单的还是复杂的,其所反映的信息都呈现出某种程度的无序状态。这些信息需要人脑加工整理,按一定的方式或规律排列起来,以便运用归纳、分析、判断、推理等思维手段,找出事物运动的内在规律,这种加工、整理、排序的活动就是信息组织。 所谓信息组织,就是人们根据信息本身特点,运用各种工具和方法,依据一定的标准,对其进行加工整理,排列与组合,使之有序化、系统化、规律化、高级化,增强信息对象的表现效能和运用效能,以满足人们信息需求的过程和活动。如图书分类、视频编辑和特技等。信息组织的结果是方便了信息的存储、传播、检索和使用等。信息组织的范围不仅仅局限于传统的文献资源,而且包括与信息组织相关的一切要素,如信息资源、信息设备、信息人员、信息法规和制度、信息机构等可以被序化和整理的对象。 信息组织从客观上包括两个部分:信源组织和信道组织。信源组织是根据某种规律或结构对信息进行序化处理,信道组织则是为了有效利用存储空间和提高传递效率而对信息实施重组;按信息组织的难易程度可分为简单信息组织和复杂信息组织,简单信息组织是对信息的简单排序;而复杂信息组织是对信息进行深入揭示,融合人类逻辑思维的组织活动。前者 7
如按音序排姓名,后者如文摘综述等。如按其它标准,还可对信息组织作进一步分类。 信息组织是信息管理的重要环节和基本工作,是信息资源开发利用的主要手段,是信息传播的前期准备。因此,信息组织对信息的有序化整理可以在一定程度上解决信息分布普泛性和信息效用个体性之间的信息利用的矛盾,从而达到甄别信息、精化信息、重组信息的作用。 同时,信息组织是一个序化的过程,这个过程通常可以分两个阶段,即序化阶段和优化阶段。信息的序化是按照一定的方法将无序的信息组织成有序信息的过程,它又包含两层意思:一是把没有必然内在联系的信息,为了利用和管理上的方便而加以组织;二是把本质上具有必然内在联系的信息,按照其自身的客观逻辑结构加以组织;前者融入了更多的主观因素,后者则依据更多的客观因素。信息的优化是在序化的基础上,针对某种目的,依照结构功能优化的原理对信息进行再序化的过程,它是信息序化的继续和升华。在实际操作过程中,信息的序化和优化没有绝对的界限,它们是辩证的统一体。 信息组织的条件 信息组织是一项学术性、服务性、技术性较强的工作,因而信息组织必须具备信息、人员、设备以及软要素四个方面的条件。信息是组织的对象、材料,是信息组织的基础,没有信息,就没有信息组织活动;人员是信息组织的主体,是关键,从事信息组织的人员必须是具有信息意识,掌握一定信息技术并具有较强的思维能力的专业人员,具有较高素质的专业人员是保证信息组织工作质量的关键;设备是信息组织的工具,先进的技术、设备,尤其是高新技术设备,如计算机技术,能加速了信息的分析、处理及批量生产,缩短信息加工周期,为用户开辟了利用信息的便捷途径。软要素主要包括信息组织活动中的制度和管理因素,它是保证信息组织活动有条不紊进行的重要保障。在大规模信息组织活动中,管理制度往往是成败的关键。 信息组织的内容、原则和特点 信息组织的内容 1. 信息的筛选和鉴别 经过收集的信息是没有经过加工的原始信息,其中难免有不需要的,或是伪劣虚假信息。这就需要对收集来的信息进行筛选和鉴别。“清源”方可正本。 2. 信息的分类和排序 信息的分类是根据选定的分类表,对杂乱无章的原始信息进行分门别类;信息的排序是指在信息分类的基础上,按照一定规律将信息前后排列成序。经过信息的分类排序,可以将混乱无序的信息组织成有条理、有序的信息体系。 3. 信息的著录和标引 信息的著录是指按照一定的标准和格式,对原始信息的外表特征(名称、来源、加工者等)和物质特征(载体形式等)加以描述并记录下来的活动;信息的标引是指在著录后的信息载体上按一定规律加注标识符号的活动。原始信息经过著录和标引,就正式成为二次信息。 4. 信息的编目和组织 信息的编目和组织是指按照一定的规则将著录和标引结果另外编制成简明的目录,提供 8
给信息需求者作为查找信息的工具的活动。 5. 信息的分析和研究 信息的分析和研究是指对初步整理的信息进行计算、分析、比较研究,以便创造出更为系统、更能揭示信息本质内容的活动。通过分析和研究,使信息更具有使用价值和实践指导意义。 信息组织的原则 信息组织原则是保证信息组织工作顺利进行的指导方针,它是信息组织作用充分发挥的条件。 1.客观性原则 在信息组织活动中,对信息的外在特征和内容特征进行描述和揭示必须客观而准确,要根据信息本身所反映的各种特征加以科学地反映和序化,形成相应的信息组织成果。即信息描述和揭示的数据来源必须是客观存在的信息本身。同时,客观性原则也为我们具体进行信息组织工作提出了相应的要求,在信息组织中,我们不能损害信息本身的本来效用,不歪曲也不肢解信息本身,更不能人为地添加一些不准确的思想和观点,要完整地、全面地、精确地反映信息的本来面目。在信息组织中,客观性原则体现在对信息网罗度和专指度的把握上。网罗度反映了主题分析中对信息中论述的主题范围和数量的表征程度,即信息本身是多主题还是单主题,信息包容了哪些主题;专指度则反映了主题标引中对信息中各个主题的内容和方面的展示程度,即各个主题是单因素主题还是多因素主题,各主题具体包容哪些主题因素。无论是网罗度还是专指度的分析和标引都必须建立在对信息本身客观地了解和判断的基础上。 另外,信息组织的客观性原则还要求不断跟踪信息源的发展变化和信息组织技术的发展变化,使信息组织与条件变化和环境变化保持客观一致性。如多媒体信息组织和网络信息组织就不能照搬传统的信息组织方法,而应有所创新和发展。 如果我们将信息组织的对象扩展到人类的精神世界中,则一切信息都可以归为信息组织,这是广义上理解信息组织的。如广告制作、科技论文的撰写、艺术作品的创作等,它们同样运用了信息组织的方法和思想。在本书最后一章知识组织中另有论述。 2.标准性原则 为了加强信息的国内国际交流,便于信息的存储、检索和利用,实现信息的最大程度的共享,信息组织需要按照一定的标准进行。如度量衡制单位、著录及其格式、标识符号的设计式样、信息的压缩算法、信息的分类和主题等都要满足标准化的要求。否则,信息的流通范围就会受到影响,其使用价值也会大大降低。 标准性原则并不是绝对的,这与信息流通的范围有关,要实现信息的国际间交流与共享则需按国际标准进行;如果仅在国内共享与交流,可按国家标准进行;如果是个人自己的信息组织活动,也可按自己认为方便的自定标准进行。 标准一旦选取,往往并不惟一,同时使用多个标准进行信息组织比较常见,如姓名按笔顺排,而年龄则可按大小排。 3.系统性原则 信息组织活动涉及的范围和事物十分复杂,信息组织活动是人的一种精神产出,没有系统性的信息组织工作是不可能实现其整体目标的。为实现信息组织的系统性,必须把握几个关系: l 信息组织部门、活动与其他部门和活动的关系 各个进行信息组织的机构和个人不仅要立足于自己的实际情况,而且要考虑其他信息组织活动的机构和个人,要有分工和协作的意识,每一个信息组织活动的环节、要素都是整个 9
信息组织活动过程的一部分。因此注意信息机构内部的各个部门之间的协作关系,特别要注意与从事信息搜集和信息传播的两类部门以及进行机构日常管理的行政部门的关系,从而在信息机构良好运行环境下保证“信息搜集—信息组织—信息传播”一条龙工作流程的顺利进行。 信息组织工作本身也具有各个环节,保持各个环节的正常联系有助于信息组织工作本身能一环紧扣一环,其中特别要注意信息描述的基础地位,它是信息揭示,信息分析和信息存储和信息检索、信息利用的必要准备。 l 不同信息处理方法之间的关系。 在信息组织时,尽可能采用统一而规范的处理方法。这是实现信息产品广泛共享的前提,是信息产品得以实现经济效益得基础,也是保证信息工作的后续环节顺利完成的必要条件。 l 信息组织微观与宏观的关系 信息组织分为国家信息组织和个体信息组织,如每一个图书馆的目录数据库的建设是个体信息组织,但由国家图书馆出面组织的全国联机编目则是属于国家信息组织活动。在当前,正确统一宏观和微观的信息组织活动是发挥信息组织的整体优势和培植国家信息优势、增强国家信息竞争力的关键之一。 4.目的性原则 信息组织具有鲜明的目的性,即满足用户的信息需求,一切信息工作的出发点和归宿都是用户的信息需求,这是市场经济的本质要求,因而信息组织必须充分围绕用户的信息需求开展工作,必须充分注意信息机构的目标市场的需求状态及其变化特征。信息组织在一般情况下并不直接与用户联系,处于一般信息管理流程的中间位置,但信息管理的一切环节都必须以“用户第一”为宗旨,信息传播和信息利用的效果如何在很大程度上是由信息组织水平所决定的。同时,从现代信息管理发展来看,信息组织和信息传播具有趋于融合的发展态势。因此,信息组织工作也必须积极开展用户研究,充分了解用户需求,使信息组织成果能够极大方便用户选择和利用。为此我们不断改良和创新信息组织方法,以不断提高信息组织的水平。信息组织的目的性原则同时要求我们,为了实现信息组织的目标,我们必须注重信息组织工作的计划性和长期性以及与信息机构本身性质、特色和能力的适应性。 5.准确性原则 准确性是信息价值的灵魂。不准确的信息不仅不能产生效益,反而有可能导致重大损失。信息的准确性原则体现在两个方面,一是信息组织的结果与信息相一致,不能出现偏离;二是信息经过组织后应该基本是正确的、科学的,因而信息组织工作中的筛选、判别意义重大。要保持准确性原则的实施,必须要有一套科学、严格、且行之有效的组织程序和管理制度,同时要从培养信息组织人员的专业素质和正确的信息观、用户观入手,使信息组织的每一环节都能很好地履行自己的职能。 6.现代化原则 信息组织的现代化原则主要体现在信息组织技术手段的现代化。信息组织的技术手段现代化改变了原有的手工方式,不仅极大地提高了工作效率,而且极大地提高了工作质量,不仅与信息管理发展大趋势相协调,而且能更好地满足用户的多样化的信息需求。信息组织技术手段的现代化集中体现为计算机及通信技术的使用,如多媒体技术能将多种媒体集中处理,极大地增强了信息的表现力。互联网技术的发展,使网页的信息组织成为企业信息工作的非常重要的一个环节,并呈逐渐增强的趋势。还有信息的自动标引、自动分类、自动文摘都对传统的信息组织工作产生了根本性的变革。 信息组织的特点 信息组织作为一种信息控制活动,它包含了信息的描述、信息的揭示、信息的分析,从 10
广义上还包括信息的存储,它与信息的采集、传播、检索、利用密切相关,是整个信息工作的一个环节、一个侧面。从这些联系上我们认为信息组织具有如下特征: 1.信息组织的理论性与实践性的统一 信息组织是一种实践性很强的信息活动,但在信息组织过程中需用到诸如逻辑学、语言学、系统学、管理学等学科理论知识。 2.信息组织的独立性与依附性的统一 信息组织是信息管理工作的一环,具有相对独立性,但它离不开信息的采集、存储、传播、检索和利用等过程,完全独立的信息组织活动是没有意义的。 3.信息组织的信息量的不变性和可变性的统一 信息组织的要求之一是保持信息量的前后一致,但这只是相对的,经过组织的信息由于改变了原来的存在状态,不仅会更有利用价值,还会由于新的排列和顺序能将蕴涵的潜在信息传达给使用者,因而从某种意义上讲信息量发生了改变 4.信息组织还具有渗透性 信息组织的渗透性指信息组织存在于各种信息存储、传播和检索的活动之中,有时甚至是密不可分的。如对信息传播过程中的信道组织,对纸型载体上的文字和图案的组织,对多种媒体在光盘介质上的组织等就体现了这种渗透性。 信息组织的原理和理论基础 信息组织的原理 信息组织是一种普遍的社会活动,是一切事物有条不紊地进行的前提,自然界的信息也有信息组织活动,但这种信息组织是自发的,如生态的平衡,宇宙的演化。我们所说的信息组织活动主要是指由人参与的属于社会活动的信息组织。 从本质上讲,信息组织是基于事物属性的一种序化方法。事物具有多少种属性,就可能形成了多少种序化方法,正所谓“人以群分,物以类聚”,这个群和类就是事物的属性。但信息组织与事物组织既有区别又有联系。信息组织是对事物运动状态和方式,或者说是对事物属性的组织;事物组织则是对具体的物质和事物的组织,是在不同层面上进行的,或者说它包含着信息组织过程,而信息组织的最终目的则是为事物组织服务的。信息组织是内核,事物组织则是结果。 据古希腊哲学家亚里士多德的分析,事物一般都具有十种属性,即本质(substance)、关系(relation)、作用(operation)、过程(process)、状态(state)、空间(space)、时间(time)、位置(position),这些属性都可作为信息组织的依据,即,信息组织的过程就是按照事物属性之间的同一性、包容性、交叉性和排斥性等关系对信息实施序化的过程,这些关系是万事万物的普遍联系的不同体现,所以信息组织最本质的依据是事物的属性和联系,属性是事物个体所具有的,强调的是个性;而联系强调的是事物之间的共性。 事物的多种属性又可归纳为形式、内容和效用三种类型,因此所有的信息组织可归为语法信息组织、语义信息组织和语用信息组织三大类型,以及它们之间的不同组合。从广义上看,信息采集阶段的信息组织主要是一种语用信息组织,是根据用户信息需求组织信息的过程;信息组织阶段的信息组织属综合型信息组织,既包括形式组织,也包括内容和效用的组织;信息检索和开发阶段的信息组织则属于优化型语用信息组织,是根据具体的用户信息需求组织和提供信息的过程。信息组织是一种理论,也是一种思维。作为一种理论,它是信息组织活动的方法论,作为一种思维,它贯穿于信息管理的全过程。 11
目前信息组织活动主要以语法和语义信息组织为主,语用信息组织做得还远远不够,要促进我国信息服务业的实质性增长,加大语用信息组织至关重要。由于信息技术的局限性,目前的信息组织工作的自动化水平还为达到语用信息组织阶段,所以语用信息组织工作主要以人的智力活动为主。 信息组织的理论基础 信息组织必须以现代信息技术为手段,同时吸收一切相关思想和理论的最新成果,并将这些最新成果运用于具体的活动中去。信息组织具有丰富而坚实的理论基础,构成了信息组织的科学方法论。在形成信息组织的科学方法中的众多学科中,有哲学、数学、系统论、信息论、控制论、耗费结构论、协同论、突变论、计算机科学、语言学、逻辑学等学科,其中最具有直接作用的是计算机科学、语言学、逻辑学、信息论、系统论等学科。 在信息组织的层面,语言是最基本的信息组织工具。人们一般将事物属性抽象为字、词或概念,然后再用字、词或概念的序化来表征和组织信息。从这个意义上说,语言学是信息组织最重要的理论基础。信息组织的另一理论基础是逻辑学,信息组织本身是思维的一种表现形式,概念是思维的元素,逻辑则是思维的规则。信息组织也是一个系统化的过程,其最终目的是将无序的零散的信息层次化、结构化,形成一种有序的体系或系统,因此,系统科学也是信息组织的重要理论基础。其它如计算机理论对信息组织工作的影响也很大,自然语言的理解是未来信息组织工作自动化的关键。 1. 语言学 语言是人类社会最重要的交流工具和思维工具。人类的一切信息交流都是以语言为基础的,人们不仅通过自然语言和人工语言进行信息交流,而且以图像、手势、身体、击鼓、鸣号、烽火、甚至眼神等体态语言和隐示语言传递信息。而后两种语言也是具有语言含义或建立在语言含义基础上,如击鼓进军、鸣金收兵是事先规定好的,也就是事先赋予它们以语言的含义,否则一个体态语言和隐示语言就不能为人所了解。如有些人就不懂哑语,有些人也不懂“眉目传情”。因此,信息活动与语言不可割舍,成为人类社会重要支柱的各种各样的信息都具有语义性或准语义性。当然,这里的语言和文字也是有密切的联系。文字和其它外化语言在社会信息交流活动中扮演了极其重要的角色。 信息组织作为社会信息交流活动中重要环节,自然而然与语言具有千丝万缕的联系。信息组织中大量存在的语言问题成为语言学在信息组织中广泛应用的需求基础和适用背景。如现代人们所研究的各种自动信息组织,如自动文摘、自动分类,关键的问题都是语言,不能是依据词频统计的方法还是基于自然语言的方法都离不开对语言的透彻理解。 信息组织中的语言问题重要性在于: (1)信息组织的对象都是用语言描述的各种各样的具有语义性和准语义性的信息。没有语言就不可能有对事物的准确认识。 (2)信息描述和信息揭示中需要运用大量的语言工具。对语言的理解和掌握是人类区别于动物的一个根本标志,某些动物虽然也能说人话,有时似乎也能“理解”人类语言,但这不是真正意义上的,它们对人类语言的使用仅仅是动物高级条件反射。只有人才能准确识别、记忆和领会语言。人对事物的认识几乎都要转化语言,只可意会不可言传的事物不能为其他人所了解。 我们在信息组织工作中对信息外在特征和内容特征的辨识、记录和表征都要借助于信息组织语言。信息组织语言又被称为信息语言、检索语言、信息存贮与检索语言、文献语言、文献工作语言、信息工作语言、索引语言、标引语言、标引符号、标识系统、信息检索语言等。信息组织把信息的外在特征和内容特征从概念平面转换到语词平面再到标记平面,信息检索则把信息用户的需求同样以概念平面转换到语词平面再到标记平面。当两种标记达到一 12
定程度的相关性则认为二者匹配,信息即被检索出来。所以,信息组织与信息检索关系密切,信息组织是信息检索的基础,信息检索和利用是信息组织的目的。 (3)在信息组织的现代技术手段的使用上,信息的编码、算法语言、程序语言、机器语言运用和自然语言理解和处理都充分体现了语言的重要作用。 如上所述,信息组织语言通常有两种形式:一是自然语言形式,二是人工语言。体态语言和隐示语言往往不做为信息组织的语言,不过随着信息技术的发展,基于内容的信息图形、图象、声音的组织处理会有较大的发展,体态和隐示语言在信息组织中也将发挥越来越大的作用。无论是哪一种形式的信息组织语言,都是在自然语言的基础上慢慢形成的。各种人工语言也同自然语言一样,也具有一定的语法规则,并且都建立在自然语言的基础上,如我们使用的主题语言完全建立在自然语言基础上。因此,信息组织语言的构造的应用必须充分利用一般语言的基本原理和方法,结合信息组织的具体情况,不断提高信息组织的语言的编制质量。这就是为什么说信息组织工作,语言是基础。 2. 逻辑学 如前所述,信息组织是一种智力活动,离不开人的逻辑思维,所以信息组织自然包含相应的逻辑学问题。实践证明,逻辑思维越强的信息组织者其信息组织工作也越好。 事实上,信息组织是对信息对象的各个元素(按内部特征和外部特征划分),经过从事物到概念再到语言的层层递进的分析之后,运用科学思维使之序化的一个复杂的过程。逻辑学是一种科学的认识和思维方法,逻辑学在信息组织中的应用主要体现概念逻辑方法和抽象思维方法两个方面。其中概念逻辑方法主要应用于信息描述和揭示中,概念是事物本质属性的概括,其内涵是它所指事物的本质属性的总和。概念与概念之间的关系非常复杂,可分为相容关系(如同一关系、属种关系、交叉关系等)和不相容关系(如并列关系、矛盾关系、对立关系等)。概念逻辑方法的根本目的就是要揭示事物的本质属性及各种事物之间的区别和联系,信息组织中对信息内容的描述和揭示主要运用了概念逻辑方法。众所周知,信息组织就是将所组织的信息对象从概念平面转换到语词平面再到转换到标记平面,即用语词标记和符号标记来表达概念。所以要正确地表达概念就要利用概念逻辑方法分析和认识各种概念及其相互关系,建立“一个概念只用一个标识表达,一个标记只表达一个概念”的一一对应关系,这是信息组织工作的根本要求。在信息揭示中体系分类法和叙词法是两种概念逻辑方法应用的典型。 抽象思维方法主要应用于信息分析研究之中,在信息分析中,信息的组织活动主要是建立在抽象思维方法即逻辑推理方法的基础上,它主要有演绎推理和归纳推理两种形式。在具体信息分析中广泛运用了分类与比较法、分析与综合法、原因和结果法等逻辑分析和推理方法,形成了一系列信息分析的专门方法。在企业竞争情报工作中,建立在逻辑推理方法基础上的信息分析与预测法有着关键性的作用。 3. 系统论 根据《韦氏大词典》,系统是“有组织的或彼此组织化的整体;结合着的整体所形成的各种概念和原理的综合;由有规则的相互作用、相互依存的形成组成的诸要素的集合”。所以系统是相互作用、相互联系的诸要素的综合体。系统论是信息组织的直接依据和方法指导。 一个系统都由物质、能量和信息三大要素组成,各个要素之间是相互依存的,系统的结构和功能建立在这三大要素的转换、运动、联系和依存之上。其中,信息流在系统中起支配作用。一切系统都由一定程度的控制、反馈和调节的功能。信息组织作为一种信息系统同样具有这些功能,为此要运用信息方法、反馈方法、功能模拟法和系统法等信息科学的方法来指导信息组织活动。在信息组织活动中运用这些方法时就是要注意几个原则,即信息的整体性原则、信息的层次性原则、信息的目的性原则、信息的动态性原则、信息的综合优化原则等。 13
信息组织的目的和作用 信息组织的基本目的和作用是序化信息,杂乱无序的信息不能帮助人们去认识事物的本质属性,而有序化的信息由于它更显式地反映出了事物的本质的联系,因而更有利于人们去认识和改造客观世界,实际上,信息组织的目的和作用还体现在以下方面: (1)有利于信息的存贮 序化的信息能更有效地利用存贮空间,从而更有利于信息的检索和传播。 (2)有利于信息的检索 没有经过序化的信息要想实现快速高效地检索几乎是不可能的,信息素材越多时,混乱度也越大,当这种混乱度达到一定程度后,检索几乎无法进行。信息组织在手工检索阶段必不可少,在计算机信息检索阶段更显重要,数据库都需按查检字段建立单个或复合索引、复合索引以提高检索的速度。网络信息中,这种表现更加突出,互联网上浩如烟海的信息仅凭浏览式检索难以快速检索到需要的信息,通过建立指引库、按分类或主题归类信息可以大大方便查找。事实证明,这种努力对提高用户网络信息检索的效率和质量有关键的意义。 (3)有利于信息的传播 信息需要交流,经过交流的信息不仅不会减少,还可能使信息得到进一步的丰富。信的交流实质上是信息传播的一种方式,或者说是信息传播结果。序化的信息有利于信息的传播,科学家证明,按一定规律排列的信息更易于人们理解和记忆,因而传播的效应会更大。例如,报上的广告经过分类处理后,由于查找方便,读者接触到它的可能性明显增加。 (4)有利于信息开发和利用 只有经过序化的信息才可能称之为资源。对信息资源的开发和利用已成为当今的热点,对信息资源的消费在消费者的消费结构中呈渐强的趋势。据日本总理府1991年的公布的调查年报上提供的数据,日本全国每户年用于信息的开支约为19万日元,其中各种信息媒介的支出分别为报纸31,676日元,图书杂志19,807日元,CD磁带2,991日元,电影剧场娱乐门票时11,048日元,联机费用13,253日元,共计78,085日元。 信息资源的开发就是不断地发掘信息及其相关要素的经济功能,及时将其转化为现实的信息资源并努力开拓其在国民经济和社会发展中日益广阔的用途;信息资源的利用,就是信息资源利用部门根据信息资源开发部门所开发的信息资源的情况,结合经济运行状况及其存在的问题,制定出科学合理的信息资源分配利用方案,使现实的信息资源发挥作用和产生效益的过程。 显然,混乱的信息不能称为资源,更不可能开发和利用,所以,信息组织是信息资源开发和利用的前提环节。 (5)有利于社会的信息化 信息化是信息活动(包括信息的生产、传播和利用等)的规模相对扩大及其在国民经济和社会发展中的作用相对增强的过程。信息的生产,传播,利用都离不开信息组织,而且信息组织也是信息活动的形式之一,它的发展壮大也会扩大信息活动、信息产业在国民经济中的地位和作用。 习 题 信息的概念、特征是什么?它的分类与作用是什么? 试述信息社会中信息有哪些作用? 信息组织的概念是什么? 信息组织的应遵循哪些原则?有何特点? 信息组织的基本原理是什么? 14
试述信息组织中语言的作用. 15
第2章 信息组织方法 信息组织方法概述 信息组织是对信息进行整序,实质是序列化、规侓化、系统性。这种整序包括三个层次:一是对信息内容全部保留,不改变信息素材的排列顺序。二是对信息内容去粗存精、去伪存真,然后再按某种规侓或标准予以序化。三是不仅抽取被组织的信息对象的部分或全部信息,还添加一些位于其他载体上的信息,如综述,国际贸易中的来样加工。通常我们认为信息组织活动进包括上述一、二层次。第三层次从本质上讲也是一种信息组织活动,我们称之为广义的信息组织活动或说是扩大的、高级的组织活动。 凡是能将信息按一定的规律进行有序排列的方法,都称信息的组织方法。对于信息的组织方法类型目前仍没有统一的划分方法。其中比较有代表性的有四种: 1. 按信息组织对象的范围区别分为信息宏观组织方法和信息微观的组织方法 信息宏观组织方法是运用综合、归纳、统计的方法,把所研究的对象作为一个整体来研究,考察的是整体的特性。信息的微观组织方法是运用分析的方法,把观察研究的复杂对象层层分解成许多简单的个体,从这些确定的相对稳定的微小单元的各种特征及它们的相互关系中去把握研究对象的规律。信息的微观组织方法按属性特征又可分为外部特征组织法和内部特征组织法。具体归纳如下: l 信息的宏观组织方法: 布拉德福定律、齐夫定律、洛特卡定律、引用规律;综述、年鉴、手册等 l 信息的微观组织方法: 外部特征:引用法、索引法、目录法 内容特征:分类法、主题法、文摘法 显然,该种划分方法涉及的范围比较广泛,几乎一切对文献进行加工处理的方法都囊括其内。 2. 根据信息的形式、内容、效用三个层次所对应的信息组织的三个层次,即语法信息组织、语义信息组织和语用信息,将信息组织方法同样划分为如下三个层次 l 语法信息组织方法: 字顺法、代码法、地序法、时序法、其它如颜色、重量、品质、形状等 l 语义信息组织方法 : 元素结构法、逻辑组织法、分类组织法、主题法(标题法、单元词法、叙词法、关键词法) l 语用信息组织方法: 权值组织法、概率组织法、特色组织法、重要性递减组织法 3. 按信息组织的内容,信息组织方法可分为四类 这四类方法是信息描述方法、信息揭示方法、信息分析方法和信息存贮方法。这种划分基本是按信息的流程来划分的。从广义上理解,信息存贮亦属于信息组织范畴,因此信息存贮的方法也可视为信息组织方法。 4. 根据信息组织方法的应用情况,其大致可以分为二类 16
一是人的思维领域中使用的组织方法;二是信息生产、存贮、传播领域中使用的组织方法。它们分别又由如下方法构成: l 思维方法:分析、综合、比较、抽象、概括、类比、判断、推理 l 实用方法:分类组织法、主题组织法、字顺组织法、时空组织法、随机组织法 以上四中划分方法从一定意义上说都有合理性。实际上,信息组织方法可以分为三大类。一类是思维方法,它是一种普遍方法,不仅信息组织活动受其指导和控制,其它如科学研究活动也受其指导和作用。第二类是信息领域的理论方法。如布拉德福定律、齐夫定律、罗特卡定律等。第三类,信息组织的具体方法,包括语法、语义、语用三个层次的信息组织方法,这类方法是构成信息组织方法的主体,反映了事物的不同特征属性。主题法和分类法是信息组织的两个主要方法,所以人们对其研究和使用也最多。其它方法都是属于从属地位。不过文摘、综述、数据库等不宜归属于方法而应属于信息组织的技术,本书的第3、第4章将对它们进行详细介绍。 当然方法的划分只是为了研究的方便,在信息组织的实际活动中,通常都是若干种方法一起使用的,甚至连被称为信息组织两大方法的主题法和分类法也逐渐融合而产生了分类主题一体化的倾向。 主题组织法 主题组织法含义 主题组织法是按照信息对象等所反映的主题特征的异同,用接近自然语言的这些语词能表达宽泛程度各异的概念语词和语词符号标识这些特征,通过参照系统等方法揭示概念词间关系,并将概念语词、语词符号按音、形顺序排列来组织信息,以便提供一种易用的面向具体事实、概念的检索途径的信息组织方法。它是信息组织两大方法之一,在现代信息组织活动中占有十分突出的地位。 主题组织法的关键是主题分析。主题是信息所表达的中心问题。按信息所表达的中心问题数量的多少,主题可分为单主题和多主题两种类型。单主题只含有一个中心问题,即只有一个主题;多主题指含有两个以上的中心问题,即有两个以上主题。因此,对多主题进行分析时,可将其分成若干个单主题,然后以每个单主题为一个分析单元,分析其结构。 主题组织法主要适应用于各种信息检索系统的记录单元的组织,如检索工具,数据仓库等。主题组织法包括单元词法、标题词法、关键词法、叙词法。每一种组织法都有它的优缺点,主题组织法的质量要通过组织好的信息集合的检索效能来评价,而运用主题法组织成的信息检索系统的检索效能主要与词汇控制方式和具体的排序规则有关。 主题表是主题组织法的运用结果,主题表习惯上也称为主题法,它与我们所说的主题组织法是不同的概念。 主题语言 1.主题、主题词、主题表 主题指信息对象所表达或反映的主要内容、问题或事物。如果所表达或反映的主题唯一,则属简单主题;若表达或反映的主题不唯一,则称为复杂主题。 主题词是用于描述、存贮、检索信息主题的受控词汇,是主题表中能表达一定意义的最基本词汇单元。主题词是以众多的事物概念为基础的,它是事物本质属性的概括,是一个类 17
称概念。主题词的选用主要依据三方面,即出现频率、标引频率、查找频率。具体来讲是应具有实际检索意义,主题词分为单元词、标题词、关键词和叙词,标题词是先组式语言,即在主题标引前,其概念已组配好;单元词和叙词是后组式的语言,即只在正式标引式才将概念加以组配,显然它的适用能力比先组式语言强;而关键词是不受控制的语词,是一种接近自然语言的一种主题语言。主题词具有概念性、控制性、组配性、语义性、动态性等特征。 将主题词按一定方式、规则组织成的词汇表称为主题词表,其建立的目的是通过确定概念词的关系来组织主题词以作为标引、组织和检索信息的依据。主题词表的功能是连接信息记录与实体所使用的自然语言和检索系统所使用的规范语言。主题词表按主题词的类型可划分为标题词表、单元词表和叙词表,由于关键词是一种接近自然语言的一种非受控的主题语言,所以没有关键词表。按主题检索标识的不同组配程序,分为先组式主题表和后组式主题表。二者的含义差别体现在主题词表在标引前是否已经组配好。 2.主题语言要素 主题语言的要素,包括以下四个方面: ① 语词标识:标识有两类即号码标识和语词表示,语词表示是采用自然语言中的但经过控制的名词术语,作为描述文献主题的标识。 ② 字顺系统:汉字字顺系统主要有音序和形序。 ③ 参照系统:是主题词表显示主题词语义关系的语义词网络。 ④ 主题检索工具:是根据主题语言原理编制的各种主题检索工具,主要是主题目录、主题索引、计算机中的主题词倒排档等。 标题词、单元词、关键词和叙词 1.标题词 标题词(Subject Heading)是指经过规范化和标准化处理的简略表达信息对象论及或涉及的事物即主题的语词,是完全受控的一种主题标识,通常是比较定型的事物的名称。标题语言,是主题语言系统中最早的一种,它以选自自然语言中经过控制的语词术语作为标识,从语词控制角度看,它是一种先组式的。 标题语言基本构成要素是主标题、副标题和说明语。 例: Books (主) ——Reviews(Indirect) (副) Here are entered collections of review, works on the technique of writing review are entered under the heading Book reviewing 见《美国国会图书馆标题表》第九版 标题词词汇控制包括词量控制、词性控制、词形控制、词义控制、词间关系控制和专指度控制等,其中是词形控制和词间关系控制是最重要的控制。 对于标题词的选择最基本的是应具有检索意义,还应有适宜的专指度和较强的通用性。 标题词表是将标题词按字顺方式进行排列而成的有序集合,它由编制说明、主表和副表组成,它是信息标引、组织和检索的依据。 标题的语义参照是标题法揭示标题之间的语义关系的一种重要手段。主有单纯参照、相关参照和一般参照。单纯参照是反映同义关系的参照,一般用“见(see)”、“见自(see from)”来显示等同关系。相关参照是指两个具有等级或者相关关系而又是正式使用的标题词之间的参照,用“参见(see also)”、“参见自(see also from)”来显示。一般参照是一种概括性的举例性参照。 例: 18
电脑 (非正式标题词) 见 电子计算机 见(正式标题词) 电子计算机 (正式标题词) 见自 电脑 见自(非正式标题词) 海洋学 (上位标题词) 参见 海洋地质学 参见(下位标题词) 海洋气象学 (下位标题词) 海洋地质学 (下位标题词) 参见自 海洋学 参见自(上位标题词) 关税法 (相关标题词) 参见 关税 参见 (相关标题词) 海关法 (相关标题词) 海关法 (相关标题词) 参见 关税法 参见 (相关标题词) 标题的类型有:单级标题、带说明语的单级标题、多级标题、倒置标题、带限定词的标题、混合标题词系统。如超音速飞机——飞机,超音速。标题词选取时应考虑标题词的检索意义、专指度、通用性和准确性等。 作为一种传统的的主题法,标题词表的特点有:1)采用列举式词表,2)定组式标题结构,3)操作简便。标题表的编制法是:1)设计标题表并制定规则,2)收集词汇,3)对词汇规范化处理,4)试标引,5)正式成表。目前广泛使用的标题表是《美国国会图书馆标题表》 2.单元词 单元词(uniterm)又称元词,它是从文献中抽取出来并经过控制处理的、能表达文献主题最小、最基本的在概念上不能再分解的的,并能独立地描述文献所论及或涉及的事物——主题的词汇单位。元词是在文献数量剧增、文献主题日益复杂的情况下发展起来的。元词语言开创了新型检索语言——后组式主题语言,在组织检索语言发展史上占有非常重要的地位。一般认为使用单元词组配检索的最早可以追溯到30年带末英国巴顿提出的比孔卡,比较系统地建立起单元词法理论 和体系地是1951年陶伯的单元词卡系统。 单元词可以是一个单纯词,如“山”、“水”、“氧”、“玻璃”、“逻辑”、“火车”、“资料”、“马克思”、“乌鲁木齐”等,也可以是一个合成词,如“文字”、“图书馆”、“车床”、“隔音”、“公路”等。这些词的特点是在概念上不能再进行进一步的分解,因为进一步的分解将不能表达原来的概念,从而失去检索意义。单元词法就是用规范化了的单元词来表示文献主题的方法。单元词是构成标题的部件,它们本身绝大部分不是符合“直接精确地表达文献主题”这一基本的要求的“标题词”,只有用单元词的相互组合或组配才能构成一个个专指的“标题”,以便精确地表达文献的主题或进行检索。因而,单元词法的构成原理就是组配,即任何完整的、复杂的概念都可以分解成更为一般的单元的概念,或反过来说,任何复杂的概念都可由单元词的组合(配)而成。该法灵活性高,能提供多途径检索,现已演变为叙词法。值得注意的是在实际使用过程中,单元词法使用的单元词并非都是任意的,实际上它只选用经过规范化处理够的单元词来表示文献的主题。 组配就是从主题词表(但组配也适用于分类组织法)中选取若干个主题词,按照一定的概念组合关系和符号,把他们有机地结合起来,以表达更为专指的主题。组配时主要使用比号组配法和比孔组配法两种方法。 单元词 复杂概念 隔音+纸 隔音纸 隔音+板 隔音板 19
隔音+塑料+板 塑料隔音板 表单元词的组配 例如,005号文献的主题是“飞机发发动机的设计”,可以提取出3个单元词概念:“飞机”、“发动机”、“设计”。因此需要制作3张单元词卡片,并把005号登记在第六个纵栏中。在查找有关“飞机发动机的设计”方面的信息时,首先要分析出该课题的主题中的单元词——飞机、发动机和设计,然后从检索系统中查找出含有“飞机”、“发动机”、“ 设计”的三张卡片,最后对这三张卡片进行目视对比查找(从第一栏开始直到最后一栏)。比对后发现只有“0001”、“0002”和“0005”三个号码同时出现在三张卡片上。因此含有这三张号码的文献中就包含了所需要的信息。 飞机 0010 0001 0002 0005 0026 0007 0009 0091 0092 0035 0056 0017 0319 0182 0095 0076 0529 0312 0126 发动机 0020 0001 0002 0003 0005 0027 0030 0041 0012 0055 0037 0080 0052 0095 0105 设计 0110 0001 0002 0005 0026 0007 0191 0192 0085 0056 0047 0202 0195 0086 0322 0226 单元词法的主要特点是:标题是组配构成的,而且是“后组式的”,即在编表和标引时事先不把检索标识组配成为固定的标题形式来表达文献的主题,而是到检索时才临时选用单元词并将它们组配起来进行检索。因此,对先组式语言而言,就是要从文献的实际主题出发,在编表和标引阶段即进行组配。但对后组式语言而言,主要是从检索课题的实际需要出发,其作用主要体现在检索阶段。 具体地说,单元词法的主要特点是: 1) 摆脱了标题法中每个标题只能选择一种标题形式作为正式标题的局限性,也就是可以同时使用多个单元词对同一份文献从不同的侧面分别进行标引; 2) 单元词之间不存在次序问题。但是这有可能会产生误检,例如在查找“学校图书馆”时,由于使用“图书馆”和“学校”这两个单元词进行组配,结果可能会把“图书馆学校”和“学校图书馆”的额外内线都检索出来。 3) 组成“标题“的每一个单元词都是排检词,都可以作为检索入口,因而与标题法相比,单元词的检索途径较多。 4) 利用对单元词的增加或减少,可以进行扩检或缩检。 5) 标引深度较高。单元词是一个标识(一个单元词)一张卡片,单元词的数量都有一定的限制。每张单元词卡片一般可以记录200个文献号码,而且还可以继续使用第2、3张卡片。如果采用比孔卡片,则可以记录更多的文献号码,因而可以大大提高文献的标引深度。例如,美国杜邦公司的几个检索系统,有许多文献标引了400多个单元词。 20
6) 有利于向计算机检索方向发展。 单元词法最初不编制词表,因而对词义的控制和词义的规范都不作要求,但是后来也编制了词表并使用语义参照系统。 3.关键词 关键词是指在文献的标题、摘要或正文中出现的、对表达文献主题内容具有实质意义、能作为检索入口的、具有关键性描述作用的词汇。它是文献量迅猛增长、信息组织难度加大和信息传播速度加快的必然产物。关键词选取简单,语词基本不作控制。标引检索不需词表,因而特别适合于在信息量猛增现实情况下的信息组织和信息检索的需要。而且,关键词在关键词系统中彼此独立,对概念之间的关系不予显示。因而为按关键词进行信息组织提供了极大的便利,随着计算机在信息组织活动中应用的范围的扩大和应用力度的加强,关键词在信息组织、信息揭示和信息检索中必将发挥越来越大的作用。目前,完全自然语言处理技术还有待提高,关键词作为一种近似的自然语言,能够在人工语言和自然语言中间起到沟通桥梁的作用。 关键词法地创始人是美国情报学家H·P·卢恩(Luhn),关键词索引技术可以追溯到中世纪西方的《圣经索引》以及我国古代的类书,随着计算机在信息处理中被广泛应用,卢恩设计的机编关键词索引以及他提出的KWIC也获得了广泛使用。 关键词法原理的应用,常有三种形式,即题外关键词索引、题内关键词索引和单纯关键词索引。 单纯关键词索引是将从文献的正文、摘要和题目中抽出的关键词按照字顺轮流领头进行排列、没有上下文修饰的一种索引。每一组关键词后著录文献号码,组成一个款目。 其索引款目格式是: 关键词1 关键词2 ……………… 关键词n 地址 表 索引款目格式 比如对“计算机在神经生物学与行为学中的应用”(文献号为0007),可以分析出三个关键词:计算机、神经生物、行为学,对它们进行轮排:“计算机、神经生物、行为学 0007”、“神经生物、计算机、行为学 0007”、“行为学、计算机、神经生物 0007”,将上述三个款目按照汉语拼音字母顺序分别排在“J”、“S”、“X”等字顺里。检索时无论从哪个关键词入手都可以查找到这一文献。 题内部关键词索引(Keyword in context index,KWIC)又称为上下文关键词索引,就是把关键词保留在文献的题目之内,关键词的上下文和词序都不变。在编制索引款目时将每一个关键词按照字顺轮流做检索标目,排在版面的固定位置,并用黑体字表示作为标目的关键词,其上下文(即前后文)均随之移动位置。其主要特点是在列出关键词时,保留了题目中的非关键词,而且词序不变。这样关键词与非关键词组成了一条短语,即一条上下文,因而便于明确关键词在题目中的含义。这种形式特别便于用计算机来编排处理。 其索引款目构成形式是: 关键词 篇名 文献地址 表 KWIC索引款目格式 例: 联机计算机在核反应堆中的应用 0001 计算机与信息系统引论 0002 以计算机为基础的信息系统导论 0003 21
计算机在神经生物和行为学中的应用 0004 图书馆与计算机 0005 教育与计算机 0006 题外关键词索引(Keyword out of context index,KWOC),也称上下文索引,是单纯关键词索引的一种变体,是针对KWIC索引提出的改进形式。其编制原理与单纯关键词索引基本相同。不同的地方是把文献中抽出的一组关键词同时放在题目、号码上面,轮流领头进行排列,或者是单个关键词轮流放在题目、号码前面。在这种索引款目下,不仅著录文献号,还要著录文献的题目,以便读者选择文献时参考。 其索引款目构成形式是: 上文 关键词 下文 地址 表 KWOC索引款目格式 例: 计算机、神经生物、行为学 “计算机在神经生物学与行为学中的应用”0007 神经生物、计算机、行为学 “计算机在神经生物学与行为学中的应用”0007 行为学、计算机、神经生物 “计算机在神经生物学与行为学中的应用”0007 或者是: 计算机 “计算机在神经生物学与行为学中的应用”0007 神经生物 “计算机在神经生物学与行为学中的应用”0007 行为学 “计算机在神经生物学与行为学中的应用”0007 上述三个关键词分别排在索引的不同的位置,可以从三个不同途径分别反映同一主题的文献。 除了以上三种外,还有双重关键词索引(double KWIC index)、词对式关键词索引(Paired keyword index)等。 单元词的选取主要考虑词的结构,重在拆词。单元词的组配基本上属于单纯的字面组配,误检率较大。字面组配只考虑词的字面形式而不考虑内容含义,把概念简单地看成是词的任意叠加,因而组配经常会导致望文生义或不知所云,以至检索时无所适从,这是元词法的最大缺陷。如: 1 脑+肿瘤 脑肿瘤 2 河北+梆子 河北梆子 3 香蕉+苹果 香蕉苹果 4 牛+蛙 牛蛙 5 田+鸡 田鸡 6 熊猫+电视机 熊猫电视机 7 长城+计算机 长城计算机 8 金鱼+洗衣机 金鱼洗衣机 9 白鳍豚+啤酒 白鳍豚啤酒 22
表字面组配 4.叙词 为了避免单元词法的上述缺陷,人们又研制了一种新的信息组织方法——叙词法。叙词(descriptor,Subject terms),它是经过词汇控制后,在信息组织中用来显示文献主题,在检索中用来构造提问式的一种检索词汇。它是以受控的自然语言为语词基础,以字顺和分类系统为词汇显示的基本手段, 以语词的概念组配而不是字面组配为重要特征的一种标引和检索文献的理论方法,又称其为描述词、叙述词,在国内也叫主题词。叙词法就是以叙词作为标识符号,标引和检索文献信息的一种检索方法。叙词法采用的主要是概念组配——概念的分析与综合(拆义),它把完整的一个主题内容从概念上分解为若干个分概念,然后再从词表中选用能够确切地表示这些分概念的词或词组加以组配,以形成更为专指的概念。叙词法严格遵守概念组配原理,不简单地拆词。 叙词法形成于50年代末,是在吸收元词法、标题法及分面组配式分类法的优点的基础上发展起来的。1959年美国杜邦公司编制了第一部叙词表,其后,随着计算机的应用,叙词表的编制迅速发展,叙词语言成为受控信息组织和检索的主要语言。到目前为止,国内外叙词表的数量不下千种,我国叙词表也已超过130多种。 叙词语言因其功能优良,六十年代以来发展迅速,被称为当代信息组织检索语言的主流, 实际上,字面组配与概念组配有时候相同,有时候则不同。例如在上表“1”中“脑”与“肿瘤”组配可以产生“脑肿瘤”,检索时无论是从“脑”、“肿瘤”入手还是从“脑肿瘤”入手,都不会出现漏检或误检。但在“2”中,如果按照字面组配原理仅仅从字面使用“河北”一词进行检索,则查找范围太大,检索困难,会浪费许多时间。如果考虑概念组配原理,从含义方面考虑使用“河北地方戏”可能更符合族性检索要求。至于“3”情况就完全不同了。按照字面组配原理,“香蕉”和“苹果”的组合是“香蕉苹果”,但是如果在标引香蕉苹果方面的信息时用“香蕉”和“苹果”进行组配标引时,则在用香蕉这个词进行检索时就会产生误检,因为香蕉苹果不是苹果中的一种。而按单纯字面组配检索时,又可能会把兼论香蕉和苹果的文献查出来,但却找不到论及香蕉苹果的文献。若按照概念组配原理,“香蕉苹果”应该用“香蕉味食品”或“香蕉味水果”与“苹果”这两个词进行组配表达,就更加符合逻辑。此时,将不会出现误检。对于词表中没有的概念,可以使用概念组配的方式来进行检索。例如“农用钢挖泥船”就可以用“农用船”、“钢船”和“挖泥船”三个概念进行组配。 1 脑+肿瘤 脑肿瘤 2 河北+梆子 河北梆子? 3 河北地方戏+梆子 河北梆子 4 无为+板鸭 无为板鸭? 5 无为特产+板鸭 无为板鸭 6 金鱼+洗衣机 金鱼洗衣机? 7 金鱼牌电器+洗衣机 金鱼洗衣机? 8 白鳍豚+啤酒 白鳍豚啤酒? 9 白猫+洗衣粉 白猫+洗衣粉? 10 白猫+洗衣粉 白猫牌商品+洗衣粉? 11 香蕉+苹果 香蕉苹果? 12 香蕉味食品+苹果 香蕉苹果 表概念组配 叙词法的主要特点是:1)直接以规范化了的自然语言——叙词作为标识符号,直观性强;2)直接从论述和研究的具体对象和问题出发进行选词,并采用叙词组配来描述主题,专指性强;3)叙词法能随时加以增设修改,适应性强;4)对叙词主要采用字顺排列方式,查找迅速;5)主要采用后组式概念组配方法,灵活性强;6)对同一主题的文献,可以作多维检索(多途径检索);7)叙词表中编制和建立了叙词语义关系的网络结构(叙词字顺索引的参照系统,叙词范畴分类系统、叙词等级系统,叙词词族图等),加强了叙词法的学科系 23
统性和族性检索作用。 组配时需要注意这几个问题: 1) 要尽量使用词表中给出的主题词,只有词表中单个主题词不能够表达主题,才进行组配; 2) 要防止单纯字面组配,组配必须是概念组配; 3) 要防止多标识组配,必须选用与所表达的主题关系最密切、最邻近的主题词进行组配。多标识组配是指一个主题具有多种组配标识,但是一个主题只能选择一组组配标识进行标引,否则容易造成误检。例如,如叙词表同时收录了“A.飞机”、“B.飞机设计”、“C.飞机结构”、“D.结构设计”、“E.设计”这六个主题词,则在标引“飞机结构设计时”就有6种可能的选择:“A-B-C”、“A-BC”、“AB-C”、“AC-B”、“AB-BC”、“AC-BC”、“AC-AB”。根据上述规定应该选用“飞机结构(AB)”和“飞机设计(AC)”这两个关系最密切、最邻近的主题词进行组配。 4) 要防止越级组配,也就是在标引时不能以粗(大概念——泛指词)代细(小概念——泛指词)或以细代粗。比如,在词表中有“美国”、“政策”、“对华政策”、“对外政策”几个主题词时,只能用“美国”与“对华政策”组配成“对华政策-美国”来标引“美国对华政策”。 5) 要防止虚假组配。 6) 要防止二义性组配。二义性组配是指组配标识(即一组组配的标题词)其组配的结果可以同时表示几个不同意义的主题,但是叙词法的要求是组配只能表达和描述一个概念。出现这种情况时,可以考虑采用上位主题词或近义主题词,增补新的专指性主题词,赋予组配的主题词某种职能符号,对手检的组配标题可以按照自然语言顺序组配而不交换主标题与副标题的位置,如“信息-管理”不要交换成为“管理-信息”。 叙词法也使用参照系统 来显示概念之间的相互联系,其方法与标题法中的基本相似。 叙词表参照系统所用的符号主要有: 语义关系 中文名称中文拼音 英文 简称文 原 文 缩写 缩写英 等同关系叙词 用 Y USE Use 非叙词 代 D UF Used for combination 上位叙词 属 S BT Broad term 等级关系 下位叙词 分 F NT Narrow term 族首词 族 Z TT Top term 相关关系 相关叙词 参 C RT Related term 表 叙词表参照系统符号 例: 《汉语主题词表》主表叙词款目的著录格式(片段)。 Gongzi jijinlun 工资基金论05DC Wage fund theory S庸俗分配论 Z政治经济学 Gongzi laodong 工资劳动05TA Wage labour Y雇佣劳动 Gongzi laodongzhe 工资劳动者03BA 24
Wage labour;Wage-earner D雇佣劳动者 F店员 工人 S劳动者 Gongzilu 工资率05TA Rate of wages Gongzi shuiping 工资水平05TA Wage level C平均工资 Gongzixing jintie 工资性津贴05TB Wage-equivalent subsidy S工资 Gongzi xingshi 工资形式05TA Wage form Y工资 常见的叙词表如国内有:《航空科技资料主题表》、《国防科学技术主题词典》、《国防科学技术叙词表》、《汉语主题词表》、《中国分类主题词表》、《教育分面叙词表》。另外还有:《ASTIA叙词表》、《工程与科学叙词表》(TEST)、《医学标题表》(MeSH)、《美国国家航空航天局叙词表》、《科学技术用语叙词表》(JICST)。 主题标引 1.标引概述 标引是对信息的内容进行分析,并运用一定的语言和方法,根据信息内容的学科属性等特征给予标识(如主题词,分类号),并因此作为信息组织、存贮和检索依据的过程。 1)标引的种类 标引可分为分类标引(分类法)和主题标引(主题法)两大类。以分类符号作为描述信息的检索标识的一类标引称为分类标引;以语词符号作为描述信息的检索表示的一类标引称为主题标引。从另一角度,标引还可以分为受控标引和自由标引。在标引过程中所使用的检索标识若必须按检索词典及相应的标引规则来规范,则这类标引为受控标引,如叙词法,否则成为自由标引,如关键词法。另外,按是否有机器介入分人工标引、半自动标引和自动标引;按标引的深度分为浅标引和深标引;按标引的信息类型分为概括标引和分析标引。从标引的效果分为过度标引、过粗标引和适度标引;从标引的用词又可分为上层标引、靠词标引和增词标引。 2)标引的过程 一般而言,标引分为三大步。 (1)主题分析 主题有时候是一个单词或词组,有时候是一个句子。在进行主题分析时,一定要把握语法关系,找出核心主题,其他的词都是进行限定、修饰和细分说明。从句子来看,在进行主题分析时,首先要抓住句子的基本成分,因为它一般能表达句子的核心主题。 25
(2) 标引 标引工作包括主题概念转换或归类,即根据主题分析结果给信息对象以分类标识或主题标识。给以分类标识的过程称为归类,即按照主题内容的学科属性归入分类法中最适当的类目。给以主题标识就是把自然语言提炼的主题,转换成叙词表中的正式叙词所表达的主题。在标引时标引人员要特别注意概念的综合分析以免造成标引误差,降低检索效率。 (3) 标引结果记录 标引结果记录就是在规定的载体上,按照一定的格式,对分类或主题标引的结果和标引中所处理的一些重要问题记录在载体之上,并进行试标引,标引结果达到一定标准后可以形成分类表或主题表,以作为信息组织和检索的依据。 3)标引工具 在进行信息标引时,必须依据一定的标引工具。如果是主题标引,就必须有一部主题表作为标引工具;如果是分类标引,则必须有一部分类表作为标引工具。相应的,依据主题表建立起来的是主题检索系统,是主题目录、主题索引之类的检索工具。依据分类表建立的是分类检索系统,是分类目录、分类索引之类的检索工具。在实践中,二者常结合使用。 主题标引工具主要有标题表和叙词表。分类标引工具就其应用范围大致可以分为三种类型。一是用于各种信息记录的分类标引工具,一般称为分类法或分类表;二是适用于产品、商品、物资等信息实体及其有关它们的信息分类标引的工具,一般称为分类代码表或分类目录;三是用于信息统计、汇总的分类标引工具,称检索词典。 2.主题标引的准备工作 为了保证主题标引的质量,取得预想的揭示、组织和检索效果,主题标引开始之前也要进行一系列的准备工作。 1) 标引人员培训、招聘或组织。标引是一种复杂的智力活动。标引人员的素质如:知识结构、思维能力与方式等直接影响到标引的质量。 2) 根据所要建立的信息检索系统的性质、应用范围和预期目标,确定主题标引所采用的词汇控制方式。 3) 如果选择叙词、标题词为标引词,需要作的工作就是选择恰当的词表或修订、设计词表,将其作为主题标引的工具。 4) 制定标引规范 由于信息记录的主题类型多,标引员对信息记录主题、学科的判断和选用标识的数量、专指度存在主观的理解和不同做法,因而,必须制定一个所有标引员共同遵循的标引规则,以最大限度的避免各种人为因素造成的错标、漏标、过度标引、过粗标引、组配错误等误差,以求得标引的一致性、准确性,保证标引的质量。 3.主题标引的原则和方法 1) 选词准确 主题标引的基本原则适用接近自然语言的语词,简明、具体的揭示标引对象有关的各种主题和特征。选词类型不同,使用的方法也有差别。例如:选择关键词,叙词标引显然是不同的,在计算机全文检索系统中,标引词可以是任意实词。这也是为什么计算机全文检索被视为最有前途的一种检索途径。 如果选择叙词作为标引词,所选词必须是词表中的正式叙词,而且这些词要能够代表标引对象的主要特征。对标引人员来讲,选择的标引词首先要符合专指度的条件,即选择内涵和外延都比较确切的词。 2) 操作规范 一般而言,在受控标引的情况下,标引的标准和方法都会载入标引工具之中,成为使用说明的一部分内容。因此,了解特定的标引工具,就可以按其说明操作;在自建词表标引的 26
情况下,标引标准和方法应记载在标引规范当中,这些记录在案的标引原则与正式词表一样是标引人员选择标引词必须遵守的规范。 4.主题分析与标引 主题分析就是根据信息组织、存储与检索系统的要求,对信息内容进行特征分析,从中提炼出主题概念,确定主题类型和要素,剖析主题词结构的过程,其目的是在适当的深度上分析和掌握信息的中心内容,从概念上加以提炼和压缩,以便据此选择一组恰当的语义相应的主题词作为语义信息的检索标识和组织依据。主题分析是一种典型的描述性内容分析。所谓描述性内容分析一般不涉及信息传播行为判断与推理,而是通过一套系统化方法把信息内容准确分解并提炼出来。它是标引过程的主要步骤和关键环节。标引质量的好坏,检索效率的高低,首先要取决于主题分析的优劣。 主题按信息所表达的中心问题数量的多少,主题可分为单主题和多主题两种类型。不论是单主题还是多主题最后都归结为每个单主题为,分析其结构。 所谓主题结构,就是主题要素、主题中心和主题面的构成形式及其相应关系。主题由某个或某些概念所组成。构成主题的每个概念叫主题要素。主题中心是指主题中体现该主题的最关键的主题要素。主题面就是根据各主题要素在主题中的不同地位和作用总结归纳出来的主题各个组织方面的总称。一般包括对象面、属性面、条件面、方法面、过程面、结果面。在提炼主题时,要根据主题中每个概念的不同重要程度决定其取舍。 对信息记录主题进行分析之后,多因素主题的若干个主题因素如何排列,便成为必须解决的问题,这一问题在索引工作中一般称为标引的引用次序。 在进行主题分析时应注意标引的针对性、分析的客观性、主题的网罗度、主题的专指性、主题分析的一致性等。 分类组织法 分类组织法概述 所谓类是指一组具有某一共同属性的事物对象的集合,它可以是具体的事物对象,也可以是抽象的现象、概念。所谓分类是根据事物的属性进行区分和类聚,并按照其相互关系进行组织的活动,分类是人类思维的基本形式,人们对世界的认识通常都要借助于分类的思想和方法。 分类组织法是依照类别特征组织信息对象(包括信息概念、信息记录和信息实体)的方法。它的实施以对每一个排列组织对象进行属性等特征分析、为它们赋予分类代码或语词形式的类别标识为基础,然后,再按照类别的不同或分类代码的某种次序,排列组织所有对象。一般情况下,采用分类方法组织信息,基本上是通过准确无误、科学实用的分类标引工具将信息对象按类别特征组织起来。因此,采用分类组织信息的功效,是分类标引工具和标引过程的质量控制密切相关的。 分类组织法是使用历史最悠久、效果显著的普遍使用的一种信息组织方法,在社会生产、生活的各个领域广泛被采用。如:分类统计报表、分类索引、分类目录、分类词典、分类展品陈列、分类广告甚至分类电影。从本质上讲,分类组织法的效能可以看成是分类功能与效用的再现。它建立在对组织对象特征的分析、识别的基础上,既适用用于信息的组织,也适用于概念和实体的组织。即可以将各个领域有关部门的信息概念、事实、数据、信息记录和信息实体等,按照内容或形式特征,按照功能、用途等特征,分门别类地聚合在一起或被彼此分散开来,提供系统化识别、检索、利用的便利条件。文献的分类正是分类组织法在文献 27
领域的应用,所谓文献是指根据文献的学科属性和其它特征,将各种文献分门别类地、系统地组织和揭示地方法,它是我们常见的一种正规化、规模化、理论和技术都比较成熟的信息组织活动。 例: F733亚洲各国 000608204日本贸易政策研究;从贸易保护到贸易自由化/强磊(南京大学国际商学院);张二震//财贸经济.-1999,(12).-49-52 000608205日本粮食流通/刘春浦(国家国内贸易局科技术信息研究所)//中国商报.-2000,.-8 F735欧洲各国 000608206西欧短期轿车租赁市场的发展/邓泽英(解放军汽车管理学院)//世界汽车.-1999,(3).-19-21 F737美洲各国 000608207浅析北美自由贸易区的运作制度/张亿镭(复旦大学)//世界经济情况.-1999,(22).-7-11 000608208美国特许连锁经营的成功经验及启示/孙佩红(内蒙古财经学院工商管理系)//内蒙古财经学院学报.-1999,(4).-83-85 F74国际贸易 000608209欧元对国际贸易的影响及对策建议/刘玉侠(安徽财贸学院)//财贸研究.-1999,(6).-29-31 000608210 1998年世办贸易增长减缓/肖忠华编译//经济资料译丛.-1999,(3).-77-88 F740国际贸易理论与方法 00608211近年国外国际经贸理论述评/陈家勤(中国社会科学院财贸经济研究所)//财贸经济.-1999,(12).-53-55 000608212国际贸易理论的最新发展/纪均(天津财经学院国际贸易系)//江西财经大学学报.-2000,(1).-12-16 00068213论国际直接投资与国际贸易之间的联系/邱立成(南开大学国际经济研究所)//南开经济研究.-1999,(6).-33-39 000608214 WTO成立后的国际贸易环境/姚凯(深圳大学经济学院)//深圳大学学报;人文社科版.-2000,17(1).-22-26 000608215比较优势转移原因分析/孙清涌(淄博学院);宗永顺//淄博学院学报:社科版.-1999,(4).-30-32 000608216比较优势理论在国际服务贸易中的适应性分析/龚新宇(中南财经大学);李才波//河北经贸大学学报.-1999,(6).-73-77,87 000608217国际服务贸易自由化与我国的战略选择/王晓宇(铁法市建行筹资部)//经济学情报.-1999,15(4).-33-35 F741政策 000608218国际贸易政策理论中易犯的错误:关于关税的多面改革及对高技术产业的补贴/J.彼德.尼亚里著;李志展等译//经济资料译丛.-1999,(6).-69-72 000608220新贸易保护主义趋势与我国的对策/商逸(中华女子学院)//山西财经大学学报.-2000,22(1).-65-68 F742国际贸易关系 00608221世界贸易市场的新联合:论欧盟-拉美首次首脑会议召开对世界经济的影响/胡江(国务院办公厅)//世界经济研究.-1999,(5).-9-10 000608222绿色贸易壁垒及其对贸易的影响/唐雅晖(长春税务学院金融系)//税务与经济.-2000,(1).-68-71 000608223多极化世界中的多三色贸易格局/龙页玉//武汉交通管理干部学院学报.-1999,1(4).-19-22 F743国际贸易组织与会议 000608224世界贸易组织内的发展中国家/康斯坦丁·米查洛波洛斯著:吴荫东译//经济资料译丛.-1999,(4).-35-48 000608225 WTO的由来/李江;保国//行政与人事.-2000,(1).-22-23 F744国际贸易条约和协定 28
000608226纺织品服装协议执行情况及其评价(下)/顾强(国家纺织工业局)//中国纺织经济.-1999,(1).-8-10 000608227纺织品服装协议执行情况及其评价(上)/(顾强)(国家纺织工业局)//中国纺织经济.-1999,(9).-9-11 F745海关及关税 000608228讲解“有效关税率”时应注意的几个要点/陶忠元(江苏财经高等专科学校)//江苏财经高等专科学校学报.-1999,(4).-57-58 F746世界进出口贸易概况 000608229农产品国际市场销售策略的最优化分析/孙枫林(湖南大学国际商学院);陆少清//湖南大学学报:自然科学版.-1999,26(3).-98-101 000608230 21世纪初的国际纺织品服装贸易环境/顾强(国家纺织工业局)//中国纺织经济.-1999,(12).-5-10 F75各国对外贸易 000608231发展中国家贸易战略的选择与就业/苏应蓉(中南财经大学经济学院)//华中理工大学学报:社科版.-1999,(4).-88-92 F752中国对外贸易 000608232论中国外贸如何应对的挑战/曹垂龙(广西大学梧州分校)//北京商学院学报.-1999,(5).-55-57 000608223中国与WTO/张秋惠(长春税务学院国际经济系)//党员之友.-2000,(2).-28-29 000608234试论中国加入世界贸易组织的效应及其发展战略/蔡玲(中南财经大学)//党政干部论坛.-2000,(1).-13-15 000608235科技兴贸:迈进贸易强国的必由之路/许复兴(国家外经贸部科技司)//国际商报.-2000,.-2 000608236中国加入WTO的机遇和挑战/曹阳(盐城市计划与经济委员会)//黄海学坛.-1999,(3/4).-8-11 000608238“十五”期间中国对外贸易发展战略/王亚平/国家计委产业发展研究所)//经济工作者学习资料.-1999,(66).-8-17 000608239 1999年中国外贸外汇形势分析及2000年展望/钟正岩(对外贸易经济合作部)//经济工作者学习资料,-1999,(80).-25-34 000608240“十五”期间中国对外贸易发展战略/王亚平(国家计委产业发展研究所)//经济研究参考.-1999,(101).-11-19 000608241 1999年我国对外经济贸易运行情况和2000年展望/王希瑾(国家计委经贸流通司);张旭宏//经济研究参考.-1999,(114).-11-27 分类法与分类表 分类语言是指数字、字母、字母与数字结合或其它符号作为基本标识来区别或聚集事物的。在文献信息分类组织中采用数字、字母、字母与数字结合的字符标识系统,采用字符直接连接,并以圆点(或其他符号)作为分割符的书写法,以基本类目作为基本词汇,以类目的从属关系来表达复杂概念。 同主题语言类似,我们这里视分类组织法与分类法为不完全相同的概念,分类法是以知识属性来描述和表达信息内容的一种信息组织工具,通常称为分类表,分类语言是分类信息组织所使用的专门语言,是分类信息组织的基础。 1.文献分类法的类型 分类信息组织的代表是文献分类法,文献分类法按照其编制的方式可以分为等级列举式、分面组配式、列举—组配式。 等级列举式是以枚举方式为特征的传统分类体系,它将可能的主题概念一一列举,并按概念间的等级、从属关系分别赋予相应的分类号,将其编入分类表中。标引时,严格按照分类表中的号码选用分类号。这种体系分类法是一种直接体现知识分类的等级制概念标识系统,所以也有人将它称为体系分类法。它主要是以逻辑分类理论为基础,以系统排列为表现 29
形式。其基本体系结构是按知识门类的逻辑序列,从总到分,从一般到特殊,从低级到高级,从简单到复杂,逐级展开的层累号码制或顺序号码制。 如: 11 文学作品 12 中国 121 古代 古代 近代 现代 等级列举式分类法自始至终贯穿了科学分类的思想,较能集中体现学科的系统性,能反映事物之间的学科从属关系,按学科门类进行族性检索,所以它用来组织科学文献是一种较好的选择。目前国内外的主要分类表均按等级式的体系分类语言组织,著名的等级列举式分类法有美国《杜威十进制分类法》(DDC)、《美国国会图书馆图书分类法》(LCC)、我国的《中国图书馆图书分类法》(CLC)等。 分面组配式则把重点放在组面的分析与综合上的现代分类理论,它先将主题拆散成若干组元,然后根据信息所表述的概念重新组配这些组元,它是一种为克服等级列举分类法的不足,适应现代文献标引、组织和检索的需要而发展起来的。分面组配理论认为分类表应该对每门学科均列举其主题的基本组元,或者说,罗列按一定特征或组面划分出的各大类的基本概念或基本元素,以代替将所有主题按等级结构进行列举。另外还要有复分功能,比如信息载体类型、地区分类及时代分类被单独列出,供所有类目使用。使用这样一种分类表,分类活动实质上主要由“综合”组成。就是说识别和组配待分类信息主题的组元,各组元根据预先确定的次序进行组配,根据这种原理建立起来的分类体系称作组面分类法或分析—综合分类法。著名的分面组配式分类法有:印度阮冈纳赞的《冒号分类法》(CC)、英国的《布立斯书目分类法》(BC2)。 列举—组配法是一种在详细列举的基础上,广泛采用各种组配方式编制的分类法,也称半分面分类法,这种分类法以列举式为基础,同时广泛采用组配法。著名的列举—组配法有:欧洲各国使用的《国际十进分类法》)(UDC)、俄国的《图书馆书目分类法》(LBC)。 2.分类表 分类表通常由类目表、标记符号、注释和索引四部分组成。 1)类目表 类目是能够准确表达信息对象内容中一组有共同属性信息的名词、概念、词组或短语。类目名称是等级体系分类语言的“语词”,它限定着所表达的事物概念。概念由内涵和外延组成。概念的内涵就是概念所反映的事物的特有属性,是一事物区别于另一事物的关键;概念的外延,就是具有概念所反映的特有属性的事物。因此,概念的外延决定的是具有共同属性的一类事物。这种共同属性即是表征这一类事物的特征。一个类目可以表达一种或几种事物,也可以表达事物的一个或几个方面。请参考《中国图书馆图书分类法》示例。 30
年画 组画、插图画 .4连环画 .6壁画 .5组画、插图画 .7动画(卡通) .6壁画 .9其他 .7动画(卡通) 23各国绘画 .9其他 以以各种绘画作品,如需按作者的国22中国绘画 家区分时,可依世界地区表分,并用[]绘画史 “()”加以标识。例:英国油画集为宜入J209。 J233(561);列宾油画集为J233(512)。 221作品综合集 []绘画史 两种以上绘画形式的作品综合集入此;宜入J209。 两种以上绘画形式的个人作品集入231作品综合集 ;一种绘画形式的作品集入两种以上技法的画集入此。 J222/有关各类。 .9绘画范本 .1/.7各地方绘画作品集 232民族技法画 依中国地区表分。 .9中国国画 .8个人绘画作品集 各国画家作品入此。 .9绘画范本 233油画 222国画 .9漆画、涂料画 .2/.6历代作品 丙烯画、喷洒画入此。 依中国时代表分。 234素描、速写 .7现代作品 235水彩、水粉 建国后作品入此。 236粉画、蜡笔画 2223油画 237版画 .9漆画、涂料画 238各种用途画 丙烯画、喷洒画入此。 .1漫画、宣传画 224素描、速写 .5组画、插图画 225水彩、水粉画 .6壁画 226粉画、蜡笔画 .7动画(卡通) 227版画 .9其他 228各种用途画 29书法、篆刻 .1宣传画 292中国书法、篆刻 电影宣传画入此;报刊图案J5。 总论汉字书法及综论汉字书法和篆刻的著作入.2漫画 此;论画而兼及于题字书法和刻印的著作入J212。讽刺画入此。 汉字形体研究入H123。 .3年画 .4连环画 注:选自《中国图书馆图书分类法》 类目的名称简称类名。类名的选择应确切、科学、简洁。 在分类信息组织时所选定的那些属性特征称为分类标准,它决定着提供什么样的检索途径。在选择分类标准时,一定要从用户可能使用的查找习惯去考虑,这体现着信息组织的目的性原则。体系分类法是以知识分类为基本原理的,因而其类目之间的关系是学科体系及其相互关系的反映。类目之间的关系有通过上下位类的方式来体现的等级关系和反映了同一学科之下同一等级类目之间的关系的平行关系以及整体与部分关系。类目表是根据不同类目按其相互关系组织起来的类目序列表,并由此规定着各类目在整个体系中的位置和次序。 类目表包括:基本大类、简表、详表和复分表。详表是分类表的正文,是用以类分信息资料的真正依据。复分表(又称辅助表),是分类表中具有同一标准区分的共同子目,用以对主表中的类目进一步细分,包括通用复分表,如表示国家、地区、时间等的区分标准,适用于主表中的任何一级类目;专用复分表,是某一部分类目所共有的下属类目的汇集,只适用于该部分类目。 如下例,诗歌和小说都有古代、近代和现代,可以将它们单独列出作为复分表。 中国文学作品 诗歌 第 31 页
古代 近代 现代 小说 古代 近代 现代 2)标记符号 每部分类法都采用一套符号体系来作为标记类目。采用标记符号标记类目是为了简洁地标识主题,为逻辑排列提供一种简便的排列顺序,实际上,这是一种分类法和代码法的混合使用的信息组织方法。 标记符号通常是数字、字母、或数字加字母的形式。只用一种符号的标记称为单纯标记,采用一种以上符号的标记称为混合标记。不论采用何种符号,标记符号都应具有一定的助记性、科学性、可扩充性、表达性、容纳性和简明性。 标记方法可采用数序制、层累制或混合制。数序制又称为整数制,采用若干字母或数字连续编号的方法,类号不反映类目间的等级关系和并列关系。层累制又称为小数制,用类号的位数来反映类目的级别及其关系。类号位数越少,类目级别越高,反之则越低。混合制是把分类号分成两部分,一部分采用层累制,一部分采用数序制,两部分结合组成一部分类法,这种方法简明易记,且能反映类目之间的等级关系和并列关系,所以被分类表广泛使用。 例: 数序制: 《国会法》 H 社会学 HD 经济史:农业及工业 HD101—2200 土地与农业 HD4801—4890 劳动 层累制: 《中图法》 Q 生物学 Q1 普通生物学 Q17 水生生物学 混合制: 《科图法》 71 工程技术 75 金属学、物理冶金 75.63 合金钢 一个符号系统所能表达的符号数由它所采用的符号基数和号码长度决定的,所以一个符号系统所产生的号码总是相对有限的。层累制由于号码的第一位采用26个英文、后面位采用0—0数字组成,而构成的号码不可能太长且要求能反映类目之间的等级关系和并列关系,所以符号个数有限,在同一类目下出现的子类目个数过多的情况,不过可采用如下方法:1)双位法:在同位类个数过多时将展开的下位类以双位来标记;2)八分法:当同位类在10个以上时,用1—8加上81,82,83……89来标记同一级类目;3)借号法:同一位类目超出一两个时,可借用下位类的类号。由于这种情况的存在,仅凭类号的长度不能完全反映类目之间的关系。 3)注释 注释是对分类法的编制、类目的含义、使用操作等所做的说明。注释可包括编制说明、 第 32 页
大类说明、类目注释。它们对类目设置、标记符号及使用方法、每一大类的立类方法与其他大类的交叉关系、本类所包含的类目和不包括的类目、每一类目包含的范围、交替类目的指引、与其他类目的关系、类号组配方法和特殊的分类细则等问题做出说明。这些规定对类分信息资料有着重要的参考作用,是信息组织工作的直接依据。 4)索引 又称类目索引。以类目名称为标题按字顺排列,并附以相对应的类号,用以帮助使用者尽快从自然语言角度找到类目。索引又可分为直接索引和相关索引两类。 国外与国内的主要分类法 1.国外主要分类法 1)杜威十进分类法(Decimal Classification) 《杜威十进分类法》是信息分类领域使用历史最长、流行最广的一部等级式分类法。初版发表于1876年,其创造人为麦维尔·杜威(Melvil Dewey),是一部首创的十进制分类法,因而闻名世界,对西方国家及其以后产生的分类法均有较大影响,至1996年已出版了21版。该法1910年被介绍到我国,对我国近代分类法向现代分类法的演进起到了很大的推动作用。 2)国际十进分类法(Universal Decimal Classification——UDC) 国际十进分类法是几继DDC之后另一个历史悠久的分类体系。由比利时目录专家保尔·奥特勒和亨利·拉芳丹编制。1905正式出版第一版,至今已修订再版多次并已有23种文本,应用于世界许多国家约10万个以上单位,是现在西方使用最广泛的分类法之一。UDC的类目表由正表、辅助符号和辅助表组成,是一部层层展开的等级式体系分类法。标记符号采用纯数字和十进制度,类号排列采用小数制。运用多种辅助符号来代表各种主题概念。并使用组配方法充分全面反映多主题,复合主题,以标识各种复杂的信息资料主题。UDC类目详细,总量达15万条。 3)美国国会图书馆图书分类法(Library of Congress Classification——LC) 分类表大纲始于1901年,由美国国会图书馆编目部编制,是一部列举式等级分类表。共分21个大类,大类之下从一般到特殊详细列出子目。标记符号采用拉丁字母与阿拉伯数字组成的混合号码。字母表示基本大类和二级类,用数字表示三级以下类目,数字采用序数制。LC目前为美国的各图书馆广泛采用。 4)冒号分类法(Colon Classification) 著名的印度图书馆学家雅里·拉马立塔·阮冈纳赞(Shiyali Ramarita Ranganahan)于1933年首次编辑出版了《冒号分类法》。冒号分类法由分类规则及分类法使用说明、分类表,印度经典分类表三部分组成,另附有分类法主题索引。冒号分类法的思想体系是把事物分为本体、物质、动力、空间和时间五种基本范畴,按分面公式和连接符把不同的面组配成一个能表达完整概念的类号,突破传统的列举式分类体系,发明了分面分类理论,开创了分类法的新局面。 西方著名的分类法还有:《国际专利分类法》(IPC)、《国际疾病分类法》(ICD)、《国际教育标准分类法》(ISCE)、《信息编码分类法》(ICC)等。 2.国内主要分类法 1)中国图书馆图书分类法系列 a) 中国图书馆图书分类法(简称”中图法”) 由《中图法》编委会编写,于1975年出版第一版,5部23类,后附6个附表,标记符号使用字母数字混合的层累制。特别是二,三版修订后,吸取了国内外分类法的长处,是目前较好的一部类法,全国各图书馆已广为采用。 第 33 页
b) 中国图书资料分类法(简称”资料法”) 在《中图法》基础上由《中图法》编委会组织一些了解信息的专家对部分类目,特别是科学技术类进行目加细、扩展,因而较适用于对科学技术信息资料的分类, c)中国图书资料分类法简本(简称“中图法简本”) 是适用于中小型图书馆,信息机构使用的一部分类法。在基本类目不变的前提下对一些类目做了简化,减少类目,缩小分类法的体积。 2) 中国人民大学图书分类法(简称”人大法”) 中国人民大学图书馆张照、程德清主编,于1953年8月初版。是我国解放以后出版的较有影响的一部分类法,其总体的编制思想和体系一直为以后的分类法编制工作所重视。《人大法》共25大类,是一部大型的分类法,编号制度是纯数字展开层累制。该法只有少数馆使用。 3)中国科学院图书馆图书分类法(简称”科图法”) 1959年由中国科学院图书馆编制出版,共5部25大类,是一部大型的分类法,对自然科学的类目立类详细、系统。标记符号采用了数字层累制。该法也只有少数馆使用。 分类标引 1.分类标引工作 分类标引工作是以标引对象的特征分析为基础、以分类标引工具为依据、为标引对象赋予类别标识的工作。它是信息组织统计分析、存贮和检索不可缺少的加工处理程序。 分类的目的是揭示每条信息的学科属性,把具有共同学科属性的信息类聚在一起,同时依据多类之间的学科关系把信息组织成一个系统,实行科学管理。为了保持分类标引的一致性,提高信息检索的命中率,必须对分类过程加以控制,以求规范。这就需要制定共同遵守的分类原则。 2.分类标引的准备工作 分类标引的准备工作一般涉及以下三个方面的内容: 1) 招聘、组织或培训合格的标引人员。 标引工作对标引人员的素质、知识面、经验与技能都有较高的要求。标引质量决定了信息组织控制的质量,决定了信息可检索利用的程度,而标引人员的素质、知识面与业务水平,又决定了标引的质量。 2) 选择或设计标引工具。 标引人员要会同主管部门,根据标引对象的生产、组织、存贮、检索利用的特征,决定分类标引依照哪种工具进行。首先要选择各种符合标准化要求的分类代码表或分类体系,并进行比较,选择比较通用、便于进行信息交换的某种或几种工具作为自己使用的分类标引工具。如果没有可用的标引工具或标引工具不完全适用,就需要编制或修订标引工作,不论是重新编制或修订都必须按有关标准进行,并进行适当的创新。 3) 学习、研究分类标引工具,并结合实际标引需求对标引工具的使用做出一些规定。 此阶段要做的就是制定指导日常标引活动正常开展的标引规范。它的内容包括:标引方式的选择,有关部门的决定;分类标引工具的适当调整,如增类、合并类目,类目含义的扩大与缩小,分类代码的组配方式等;对标引质量的要求;应执行的标引操作程序等等。 总之在分类标引时要求归类准确、揭示充分、次序分明、相对稳定、方便组织与检索。 3.分类标引操作程序 对任何一个标引对象,尤其是具有复杂特征的标引对象进行分类标引,都不是一件简单的工作。一般要经过以下程序: l 全面分析标引对象的特征,得出归类意向。 第 34 页
l 在标引工具中查找能反映标引对象特征的类目。 l 为标引对象标出正式的分类代码或语词形式的类别标识。 l 进一步加工定型分类标识。 l 对标出的分类代码,语词形式的类别标识及其他符号进行复核,以确保无误。 4.分类标引的原则和方法 一般而言,信息分类标引的原则和方法在特定的标引工具和与之配套的解释性文章中都有明确规定。近年来,我国开始制定分类标引有关的国家标准。还有许多领域的标引规则要来源于一些标引工具。归纳起来有: 1) 考虑使用性 要把信息归入最符合其实际内容的类,尽量全面地考虑信息内容的各个不同角度,方便信息工作人员使用。 2) 主题通常先于类型 先按主题分,再按类型分,除非主题次于形式。 3) 使用最专指的类号 当没有专指的类号赋予时,依靠所用分类表给予邻近的上位最专指类号 4) 不孤立地从索引中取类号 从索引中选择的类号必须到主表中去加以论证,以确认该类号所组成主题在整个分类表结构中的位置是否合适,并且在分类表中使用以学科分类为主结构的分类表的检查类号所代表的主题是否恰当。 5) 结构分类法的系统性和有限性 凡是归入下位类的,不应该入上位类,凡是归入某类的下位类必须是具有上位类的学科性质。 6) 前后一致 在标引时坚持用统一的标准类分信息,做到对同类信息的标引前后一致。 自动分类 自动分类是指用计算机对文献等进行分类。自动分类始于20世纪50年代末,H·P Luhn在这一领域做了开创性的工作。1960年Maron在Journal of ASM上发表了有关自动分类的第一篇文章《基于相关性的概率标引和信息检索》。自动分类在国外经历了三个发展阶段:自动分类的可行性研究—自动分类的实验研究—实用化阶段。 自动分类通常包括自动聚类、自动归类和类号的自动转换。 1) 自动聚类 G·Salton对自动聚类做了深入的研究,自动聚类研究中的最重要的概念是文献间的相似度,通常以文献相似度矩阵计算,定义方法有欧氏距离法、数量积法、相关系数法、指数相似矩阵法、夹角余弦法、最大最小法。 按学科内容的相配程度将相近、相同特征的文献聚合在一起,聚类的过程同时产生相应的类目。聚类的一般分析方法和步骤是:先对系统中的样本文献进行量化,由此获得一个向量集合,然后计算样本文献的相应系数,产生相似系数矩阵。将每个样本文献各自作为一类,在相似的系统矩阵中找到最大的元素,将相应的两类并为一类,根据类的相似性,计算其他类的相似分类。在初始类目基础上,根据文献类目间的匹配度、匹配值完成类目选定。通过上述过程形成文献聚类体系。常用的自动聚类方法有联词法、文献矩阵法、聚合法和因子分析法等。 自动归类法按其实现法可分为基于词典法的自动归类系统和基于专家系统的自动归类系统。基于词典法的自动归类技术有主题词和分类号的关系表(目前国内有专家在做)和分 第 35 页
词算法的确定等;基于专家系统的自动归类技术有知识库构造和推理机。 2) 自动归类 自动归类是指计算机通过词频统计、语法分析和语义分析等途径得到代表文献内容的类主题词,然后按照某一分类表将文献划分到某个类目的过程。归类一般过程包括:对文献的题目或文摘进行分词,同时从词典中取出词法和语文知识赋予每个词。采用词频统计,语法和语义分析方法时,进行主题分析,选出类主题,然后利用一个能够反映类主题目之间相应关系的主题词进行归类,并转换为类号。由此可见,自动归类和自动标引,采用技术和方法上有共同之处。例如需要词语切分,利用词频统计,位置加权,语法和语义分析等,但是自动归类的目的不是选定关键词而是通过分类表和知识库选出类主题词并转换为类号。 不论是自动分类还是自动归类,自然语言的理解(NLP)是其进一步发展的关键。 其它信息组织法 字顺组织法 字顺组织法是按照揭示的信息对象所使用的语词或分类符号的音序或形序组织信息的方法。这种组织方法应用十分普遍,如在各种字典、词典、题名目录、人物姓氏目录、产品名录、机构名录中都有字顺组织法。 根据排序过程中采用的排序特征的不同,字顺组织法可以区分为音序组织法和形序组织法两类。 音序组织法是按照文字符号发音的不同,选择字母或某些注音、符号的顺序,来排列相关的信息概念或信息记录等。对于一些拼音文字来讲,使用音、序组织法非常简便,也相当自然。 形序组织法是按照文字的构造形态,书写顺序的异同,排列组织相关的语词或信息记录。对汉字来讲,这是一种有着悠久历史的组织方法。形序在操作上不如音序组织法简便。所以许多参考工具书中除了采用音序组织法排列正文或索引外,也会采用形序组织法排列正文或索引,从而保证了多角度检索。 汉字符号的字顺组织法都是从形、音两个方面入手的。 从形的方面考虑,可以选择的依据不外乎笔形和笔顺。常用的形序组织法有笔画笔形法和部首笔画法。汉字还可以采用音序组织法排列。这种方法以1958年第一届全国人民代表大会第5次会议批准的《汉字拼音方案》为基础,采用26个汉语拼音字母,其书写方法与排列次序均与拉丁字母相同。使用音序组织法时,应同时考虑字母次序和声调次序二种因素。一般是先将拼音字母相同的汉字集中在一起,然后再按照声调的次序排列。 目前,还出现了一种按五笔字型编码排列字词的方法。由于五笔字型编码方案中将汉字众多笔画进行了归类,并分别与键盘的26个字母键一一对应。这实际上是将汉字与英文字母建立了联系,使人们可以利用国际的通用方案将汉字系统排序。 总之,采用音序法组织排列汉字,比较接近国际通行的方法,基本不受汉字字形变化的影响,而且,由于汉语拼音的普及,它又成为许多人熟悉,喜欢的信息组织方法。 总之,字顺组织方法应用比较广泛。但是,要保证其质量并不是一件简单的事,应当严格遵守已选定的方式,认真仔细地操作,不能出现混乱无序的现象。在实际中常和其它方法一起使用。 第 36 页
时空组织法 时空组织法是按照信息对象存在、运动或其表示的内容所涉及的时间、空间特征组织信息的方法。由于世间任何事物都是在特定的时间与空间存在、运动和发展的,因此,时间和空间组织法可以适用于任何信息对象的组织。 具体说来,时间组织法可以利用人类已有的计时或纪年顺序组织信息。排序包括正顺序和逆顺序(升值和降值)二种形式。我们常见的大事记、历史年表、编年体史书、年鉴等都是采用时间组织法来组织信息的。 空间组织法则主要采用自然地理位置、空间结构或行政区划作为信息组织的依据。在社会信息统计方面,这种方法使用非常普遍。例如:人口统计,教育状况统计,医疗统计,经济统计等有关的数据,都是按照国家……省(市)……地区……县……乡镇……村……组……户等次序组织起来的。 用时间、空间组织法时,具体的排序依据可以是代码顺序,也可以按照文字标题组织信息或直接使用时间数字。时空信息组织法也常常和其它信息组织法一起使用。 随机组织法 随机组织法是按照信息加工处理过程中偶然产生的某种顺序组织信息的方法。例如:在加工处理信息记录或信息实体时,我们可以按照加工的次序为每个信息记录或信息实体赋予一个流水号,组织所有的信息记录或信息实体时,就按照这些流水号的次序,从小到大顺序排列。图书馆内图书流水号、数据库原始数据的记录号等是随机信息组织法,由于这种方法是“自然”形成的,所以从某种意义上讲它不能称为是信息组织方法。 应当指出的是,本小节所介绍的各种组织方法,除了可以单独使用外,还可以交叉使用,例如:分类组织法与时间、空间组织法的交叉;主题组织法与分类组织法和字顺组织法的交叉;随机组织法与分类组织法、主题组织法、字顺组织法的并用等。对信息对象进行多种方式的组织排列,以增加信息的检索途径。 习 题 信息组织方法有哪些? 什么是主题法?主题语言有哪些类型? 什么是分类法? 国外与国内有哪些主要分类法?何为分类标引? 试列举主题法和分类法若干应用实例? 什么是自动分类?它有哪些关键技术? 第 37 页
第3章 信息组织技术(一) 信息组织技术是信息组织方法和手段的综合,是信息组织方法在信息组织活动中的具体运用。它既包括传统的信息组织技术,如文摘、综述、目录和索引,还包括与信息技术相关的现代信息组织技术,如信息编码、数据库、数据仓库、超文本、虚拟现实等。本章及下一章对它们分别进行介绍。 文摘 文摘概述 1.文摘定义 国际标准化组织(ISO)对文摘的定义是:文摘是指一份文献内容的缩短的精确表达无须补充解释或评论。《国家标准GBG447—86文摘编写规则》对文摘的定义:文摘是“以提供文献内容概要为目的,不加评论和补充解释,简明、确切地论述文献重要内容的手段”。综合得之:文摘是对初始信息内容进行浓缩加工,即抽取其中的主要事实和数据,生产出的、基本保持原有信息含义的信息组织产品,是原信息的精华和反映。文摘技术就是编制文摘的手段、方法、经验和理论的具体运用。它是生产制作文摘操作的程序和依据。 2.文摘的历史演变 摘要的产生可追溯到遥远的古代,早在古埃及亚历山大图书馆存在时期,学者们就为许多篇幅较长的著作编写摘要。我国汉代司马迁编著《史记》就有篇章内容的简介,可视为我国出现较早的文摘。我国出现严格意义上的文摘是南宋时期由袁枢所编的《通鉴概本末》,它实质上就是《资治通鉴》的文摘本。现代意义上的摘要的普及和发展出现于西方。18世纪出现了一些专门刊登摘要为主的出版物。如1703年出版的法国莱比锡的文摘月报等。我国最早的摘要刊物是1897年在上海问世的《集成报》。进入20世纪,由于信息的爆炸性增长,使方便人们检索利用的各种文摘纷纷问世。如《化学文摘》(CA)、《生物学文摘》(BA),分别于1907年和1926年出版,至今享有盛誉,80年代中期,全世界共有文摘刊物5000余种,截止1994年3月,我国共有文摘报刊290余种。 3.文摘的类型 (1) 按文献内容压缩的程度,可分为报道性文摘和指导性文摘,报道性文摘是定量地揭示文献主要内容的文摘,以向用户提供信息的实质行内容为主要目的,在某种程度上可以起到代替原始文献的作用,这种文摘一般不超过400字;指导性文摘是定性地描述原始文献主要内容的文摘,以向用户提供原信息的主题范围、适用对象为目的,是原信息内容的纲要,不能代替原文,但可以指导读者去阅读原文,一般不超过200字。 (2) 按加工手段,可分为手工文摘和机编文摘。前者是指直接通过人脑的思维对原文进行分析后写出的文摘;后者是指借助计算机,运用人预先设计好的数学模型和程序,通过语词统计和语义分析进行逻辑处理后而编写出的文摘,它通常分为抽取文摘、自动文摘等。 (3) 按文摘编写的时间顺序,可分为首次文摘、同期文摘和期后文摘。首次文摘是指在文献出版发表之前,先发表的文摘;同期文摘是指与原始文献同时发表的文摘;期后文摘是指在原始文献出版后发表的文摘。 第 38 页
(4) 按照文摘的具体对象,可分为报刊文摘、会议论文文摘、学位论文文摘、科技报告文摘、专利文摘、人物机构文摘等。 (5) 按文摘所涉及的知识各门类,可分为综合性文摘和学科性文摘。前者是指涉及两个以上学科内容的文摘,如《科学文摘》;后者是涉及一个学科内容的文摘,如《化学文摘》、《金属文摘》等。 (6) 按文摘的编著者分,可将文摘分为作者文摘和文摘员文摘和读者文摘。作者文摘是指由原始文献的作者亲自编写的文摘;文摘员文摘和读者文摘指由文献作者以外的人员编写的文摘。作者文摘的优点在于能摘出文献中的精华,保证文摘的质量。文摘员文是专门的文摘员编写,故具有文体和结构统一、客观性强的特点。读者文摘因为是读者自己编写,针对性很强。 4.文摘的特点 (1) 浓缩性:文摘是对原文的高度浓缩的概括,以最少量的文字提供最大量的信息。这也是文摘价值的根本所在。它比原文短,包括了原文信息的精华,同时又克服了题录对原文内容揭示不够深入的局限,所以深受广大研究人员的欢迎。许多题录数据库都提高摘要。 (2) 真实性:文摘是对原文的客观、真实准确的描述,忠实于原文,不可评说,不作引申,这也是信息组织的基本原则之一。 (3) 情报性:文摘不是对原文的简单压缩、面面俱到,而是重在揭示文献中的新的观点、新的成果、新的数据、新的结论,把文献中有用的信息提炼出来。这些新的信息具有很高的利用价值。将它们按照一定的标准制成相应的检索工具——文摘检索刊物是读者判断是否检索原文的依据。由于文摘的高度浓缩性,篇幅仅是原始文献的几十分之一甚至更少,所以它是科学情报交流的重要手段。 (4) 独创性:主要是指文摘的独立性和创造性。文摘的形成包含了文摘作者的创造性劳动,一方面使文摘可以脱离原始文献独立存在,另一方面使原始文献得到了增值。所以文摘作者享有文摘作品的知识产权。 文摘的结构 文摘结构主要是指文摘款目结构,文摘正文内容结构和文摘刊物结构这三方面内容。了解文摘的结构是正确编制文摘的前提和基础。 1.文摘款目结构 文摘款目结构主要有题录部分、文摘正文和补充著录三部分构成。根据文摘原始文献类型的不同,文摘题录部分下具体细目也有不同之处。总的来说,文摘款目主要包括:(1)文摘类号、序号,(2)文献题名,(3)责任者,(4)责任者单位地址,(5)文摘正文,(6)补充著录。 2.文摘的内容结构 文摘的内容结构主要是指文摘正文的内容构成。不同标准对此要求不一,我国国际《文摘编写规则》(GD6447-86)规定文摘的内容要素包含: (1) 目的:研究、研制、调查等前提,目的和任务,所涉及主题范围 (2) 方法:所用的原理、理论、条件、对象、材料、工艺、结构、手段、装备、程序等。 (3) 结果:实验的、研究的结果、数据、被确定的关系、观察结果、得到的效果、性能等。 (4) 结论:结果的分析、研究、比较、评价、应用,提出的问题,今后的课题建设、启发、建议、预测等。 (5) 其他:不属于研究、研制、调查的主要目的,就其见识和情报价值而言也是重要的信息。 第 39 页
3.文摘刊物结构 作为一种检索工具,文摘刊物一般由说明、目次、正文、正文辅助索引等四部分组成。 文摘的编写 1.文摘编写的原则 根据《中华人民共和国国家标准(GB6447-86):文摘编写规》,文摘编写一般应遵循以下几条原则: (1) 忠实原则:要如实、客观地反映原始信息,不能加进编者的主观见解或评论。 (2) 逻辑性原则:合乎语法,遵循原始信息的逻辑结构。 (3) 新颖性原则:要着重反映新内容和新观点。 (4) 规范性原则:如要用第三人称,要采用规范化的名词术语等。 (5) 简明性原则:文摘结构要简明,表达要简明,语义要连贯。 2.文摘编写方法和步骤 文摘编写具体方法有:缩小法、提炼法、列举法、重构法。文摘编写一般需经过以下几个环节。 (1) 全面阅读、分析初始信息记录,在理解要点的基础上,将原文中有代表性和有重要价值的语句用符号标记或抄录下来。 (2)比较归纳已标记或抄录的语句,按原文逻辑顺序或语句本身的逻辑关系组织起来。按照标准规定撰写文摘正文,并与原文查核对。 DHA对大脑及视力的保健作用 DHA是维持大脑正常生长发育所必需的脂肪酸,特别是对胎儿及婴幼儿大脑的生长发育有促进作用,对大脑功能的衰退有延缓作用。许多动物实验都证实DHA有助于学习能力的提高。DHA是胚胎期或生命早期动物与婴儿视觉功能良好发育所必需的脂肪酸,也是维持正常视力的重要功能成分。DHA的缺乏可影响视网膜电图,视觉诱发电位及视敏度。DHA对脑及视网膜的构成是十分重要的。膳食对脑和视网膜中DHA含量有较大影响。DHA可能会增加或激活神经系统中以乙酰胆碱为代表的神经递质。乙酰胆碱是中枢神经系统内与学习记忆有关的重要神经递质,由于DHA能够促进智力发育,增进学习记忆,DHA摄取不足则会导致脑功能障碍,因此推测DHA提高学习记忆能力的机制也可能是通过提高乙酰胆碱的浓渡这一途径实现的。DHA可改善大脑氧及营养的供应。影响DHA对大脑及视力保健作用因素有发育阶段的影响、花生四烯酸及EPA的影响、n-6PUFAs/n-3PUFAs比例的影响、其他一些调节神经系统的物质DHA有协同作用。因此,孕期、哺乳期、婴幼期及老年期是DHA的关键时期,DHA的孕妇、婴幼及老年保健食品将具有很好的前景。参16[期刊,中]/吴克刚…//食品研究与开发,2000(2),41~43(艾馨)200008037 大豆的药用价值 大豆包括黄豆、青大豆和黑豆,而黄豆是人们食用最多的一种大豆。干黄豆粒中含有水分、蛋白质、脂肪、糖类、粗纤维、钙、磷、铁、胡萝卜素、维生素B1、B2、尼克酸、维生素E等。大豆油脂中,不饱和脂肪酸含量高。大豆含有较多的卵磷脂、异黄酮、皂甙等多种有效成分。大豆的主要药用作用有以下几方面:1.防治心血管疾病的作用。大豆油脂中的不饱和脂肪酸含量高,尤其是必需脂肪酸(亚油酸)含量高,只有当胆固醇与必需脂肪酸结合时才能在体内运转,进行正常代谢而不沉积到动脉血管壁上,从而降低血液中胆固醇含量,减少动脉粥样硬化;大豆皂甙还可抑制血小板减少和凝血酶引起的血栓纤维蛋白形成,具有抗血栓作用。大豆中至少有5种物质具有抗癌功能,它们是蛋白酶抑制素、肌醇六磷酸酶、植物固醇、皂甙、异黄酮。大豆皂甙抗癌机理:抑制癌细胞生长、破坏肿瘤细胞的结构或抑制DNA的形成。大豆皂甙对人类艾滋病病毒的感染有一定的抑制作用,同时还表现出对被病毒感染的细胞有很强的保护作用,可能机理是:通过抑制病毒DNA合成及调节机体免疫功能所致。大豆成分多,应用广泛,还有待挖掘,造福于人类。参8[期刊,中]/马立安…//食品研究与开发,2000(2),43~44(艾馨)200008038 (摘自《食品文摘》2001(1)) 绿色食品及最新技术 绿色食品是无污染、安全、优质、营养食品的通称。现代国际上所称的有机农业是指不使用化肥、农药而代之以有机肥料和病虫害的生物防治,并在生长操作上具有特定的和精确标准的作物栽培系统。在这种标准中栽培出来的农产品无污染加工成 第 40 页
的食品统称为有机食品。有机食品包括谷类、奶类、蔬菜、水果、饮料、水产品等。它是一种真正无污染、纯天然、高品质的食品。而绿色食品的生产是可以使用化肥与农药的,只是限量使用化学合成物质,从本质上说,它不能成为天然食品即有机食品。绿色食品的特征:1.产品及原料产地具备良好的生态环境,有害物的本底值符合国家规定的标准。2.原料作物的栽培管理必须执行农业部颁发的农药、化肥、植物生长调节剂等规定;灌溉水符合水质标准;家畜家禽的饲养必须符合国家标准局颁发的饲料标准。3.产品的生产、加工、包装、储运、销售等必须符合我国食品卫生法要求,最终产品经食品监测机构依据绿色食品有关标准检测合格。“天然”食品涉及的产品和技术很广,其中包括生物农业产品和没有施化肥的蔬菜、瓜果、不加任何防腐剂的罐头。在食品加工过程中,减少营养成分破坏的灭菌方法及保鲜保味的包装等。它所需的技术包括应用农业工程技术、生物工程技术、食品高新技术以及电脑控制等。绿色食品的出现对社会的影响有:绿色食品对贸易的影响和由于错误理解绿色食品可造成的影响。[期刊,中]/蒋丽…//食品工业科技,2000(3),80~81(艾馨)200008039 (摘自《食品文摘》2000(5)) Computer Programming Languages 00-9177c Regular closures of deterministic languages. Bertsch,Eberhard; Nederhor,Mark-Jan(Ruhr Univ ) SIAMJCOMPUT. , . pp. 81-102. ISSN 0097-5397 Published by:SIAM (usa).En. We recall the notion of regular closure of classes of languages. We present two important results. The first result is that all languages which are in the regular closure of the class of deterministic (context-free) languages can be recognized in linear time. This is a nontrivial result. Since this closure contains many inherently ambiguous languages. The second result is that the class of deterministic languages is contained in the closure of the class of deterministic languages with the prefix property or, stated in an equivalent way. All LR (k) languages are in the regular closure of the class of LR(0) languages. 9178C Logic design using at: 29th Annual Frontiers in Education Conference: Designing the Future of Science and Engineering Education’, a Juan, Puerto Rico, 11/10-11/13/, Massoud (Johnson & Wales , Rl, USA) PROCEEDINGS - FRONTIERS IN EDUCATION CONFERENCE, , 1999, pp. 13b4-22-13b4-, ISSN0190-5848, ISBN0-7803-5643-8 Published by: IEEE, PLSCATAWAY, NJ, (USA). En. In the digital sys tem design world, VHDL (Very High Speed Integrated circuit Hardware Description Language) has become an essential tool for designers. Understanding VHDL will help students successfully find a well paying position in today's job market. Nevertheless, not all engineering schools, especially those without a graduate program, offer a VHDL course. This paper intends to show how to integrate basic VHDL in the junior level Logic Design Course. 00-9179C Taking cues from , Michael; Cassel, Ricardo A. (Lancaster Univ, LanCaster, UK) IEEE POTENTIALS, , No, 1,2000,-15, ISSN0278-6648 Published by; IEEE, PISCATAWAY, NJ, (USA). En. Java and the World Wide Web are almost synonymous. However, it is important to realize that Java is just another programming language (JAPL). Many features of Java are a little different from those found in other contemporary programming languages. Java has many other possibilities for extending discrete event simulation. Their-build remote method invocation to support distributed and client /server simulations. The intenet and the intranet protocols are a suitable way of supporting these developments. 00-9180C Querying , John A; Sheth, Sonali (Univ of Georgia, GA, USA) IEEE , -26, ISSN 0278-6648 Published by ;IEEE, PISCATAWAY, NJ, (USA). En. Web-based environments will typically need to maintain many , this information would be held in a widely utilized and highly viewable format. The eXtensible Markup Language (XML) is a new standard that meets these criteria for world-wide web based applications. It is sophisticated enough so that complex real-world structures and relationships may be captured. Large collections of XML documents can be stored for efficient retrieval using database management systems (DBMS). 00-9181C Telescoping languages: A compiler strategy for implementation of high-level domain -specific programming ,Ken (Rice Univ,Houston,TX,USA)PROC INT PARALL PROCESS SYMP IPPS,2000,PP,297-304,ISSN1063-7133 Published by:IEEE, (USA).En As both machines and programs have become more complex, the programming process has become correspondingly more labor-intensive. This has created a software gap between the need for new software and the aggregate capacity of the current work force to produce it. This problem has been compounded by the slow growth of program-Ming productivity over the past two decades. One way to bridge this gap is to make it possible end users to develop programs in high-level domain-specific programming systems. The principal impediment to 第 41 页
the success of these systems in the past has be the poor performance of the resulting applications. To address this problem, we have developed a new compiler technology that supports script-based telescoping languages, which can be built from base languages and domain-specific libraries. By exhaustively compiling the libraries in advance, we can ensure that the performance and portability of the applications produced by such systems are high, while the compile times for scripts are acceptable to the and user. These qualities are essential if script=based systems are to be practical for development of production applications. 00-9182C Matchlock ESTEREL: A reactive framework for asynchronous design. Rajan, Basant; Shyamasundar, . (Tate last of Fundamental Research, Bombay, India) PROC INT PARALL PROCESS SYMP IPPS, 2000,-209, ISSN 1063-7133 Published by:IEEE, (USA). En A paradigm called Multiclock Esterel, based on the paradigm of the synchronous reactive language Esterel, is proposed for use in reactive systems and synchronous circuit design, it is shown that the Multiclock Esterel paradigm provides a general framework for the design of systems with multiple local clocks and the earlier paradigm Com-munication Reactive Processes can be obtained as an instance of the proposed para-digm. The paradigm also preserves the advantages of the classical Sterol and benefits from the advantages of verifiability of specifications/models. (Abstract from <Computer Abstract>,2001(2)) 机编文摘 1.机编文摘概述 随着时代的发展,科技事业得到迅猛地进步,与之相关的科技文献的数量飞速增长。为了使文献用户能够在比较短的时间内找到并了解文献中所包含的信息。在手工编制的基础上,出现了机编文摘的实验。机编文摘是主要是借助自动标引技术,进行词频统计和语词、段落、篇章的语义分析,利用计算机从原文中抽取“重要”句子自动完成文摘的制作。 机编文摘的发展主要经历了两个主要的阶段:自动摘录阶段与自动文摘阶段。 第一阶段主要是从50年代到70年代。美国的Luhn是机编文摘的第一人,他于1958年首先在美国IBM公司的IBM704数据处理机上进行了机编文献的实验,原理是根据词在文章中出现频率的高低得出文献的关键词,在此基础上再从原文中选取包含这些关键词的候选文摘句,经过适当技术处理后找出合适的文摘句组成原文的文摘。60年代,提出选择文摘句的四种方法,即提示词法、关键词法、位置特征及题名法,使文摘句的选取发展到以词频统计和句法语义方面的特征的新阶段,弥补了单纯以词频率作为加权依据的不足。到70年代,美国俄亥俄州大学的拉什教授和他的学生研制成功ADAM系统,这是一个比较完整实用的系统。 第二个发展阶段是70年代后期开始,自动文摘的发展进入了自动文摘编制的阶段,这一阶段的特征是人工智能、自然语言处理、专家系统等新技术在信息自动处理领域的广泛应用。其一种研究为基于自然语言理解的文摘方法,实现的办法是根据读者的实际需要从文章中摘取一些与文摘框架有关的特定信息组织成文摘,这种文摘虽然具有较好的连贯性和可读性,但它生产的文摘千篇一律,对不同的学科需要编制不同的文摘框架。耶鲁大学的Dejong于1979年研制成功RUMP系统,这是一个较为典型的自动文摘系统,该系统能够快速阅览英文新闻资料,然后提取用户关心的内容形成文摘。 另外一种研究途径为基于文本结构分析的自动文摘方法,这种方法是利用语言学的一些方法,通过修辞分析文章中句子之间或段落之间的关系,找出包含有重要信息的句子与段落,从而加工组织成文摘。90年代,日本Kenji Ono研究出根据连接词来推测出文章的修辞结构,推导出篇章结构树,进而再生成文章的摘要。这种方法是未来机编文摘的主要发展方向。 经过几十年的研究与发展,机编文摘的工作已经取得了一定进展,在国内外已经有许多自动文摘编制系统投入应用。我国研究机编文摘虽然起步较晚,但已取得许多重要成果,并已有自动文摘系统投入实用,如上海交通大学王永成研制的中文科技文献自动编写文摘系统及中文文献自动摘要系统已达到实用的程度。 第 42 页
自动文摘的主要方法有:自动摘录、基于理解的自动文摘、信息抽取和基于结构的自动文摘。 自动摘录(Automatic Extraction),是将文本视为句子的线性排列,将句子视为词的线性排列,是一种简单的对文献的机械抽取。在自动摘录中,计算词权、句权和选句的规则是关键,通常的指标有:词频、标题、位置、句法结构、线索词、指示性短语,即词、句子的抽取不仅要考虑词频的高低,还要考虑词句的标题、位置、句法结构、线索词、指示性短语的属性,以便正确选择构成文摘的句子。目前大部分实用系统都采用了其中的某些方法。这种摘录方法简便、实用、易于实现,但所生产的文摘不全面、不简洁、不连贯。 基于理解的自动文摘,是在人工智能,特别是在自然语言理解技术的基础上发展起来的文摘方法,它不仅利用语言学知识获取语言结构,更重要的是利用领域知识进行判断、推理,得到文摘的意义表示,最后从意义表示中生成文摘,其基本步骤是:语法分析—语义分析—语用分析和信息提取—文本生成。理解文摘避免了自动摘录的缺陷,但它要依赖于大规模真实语料的语法语义分析技术和学科知识框架的知识表示。 信息抽取(information extraction),信息抽取是基于文摘框架(frame)的一种文摘技术,它的原理是事先建立一个文摘框架,然后对文本进行分析,利用特征词从文本中抽取相关的短语或句子填充文摘框架,所生产的文摘可读性好,但文摘千篇一律,而且不同学科文体要建立不同的文摘框架,所以它只能适应专门的领域,不具有通用性。 基于结构的自动文摘是建立在篇章结构的分析基础上的一种文摘技术,但由于目前这一理论还不成熟,不同学者对篇章结构的识别大不相同,但它却能够反映文摘的本质规律。 未来自动文摘技术的发展应该是上面几种方法的综合,对文章进行多方面的分析和多手段处理,以生成满足实际需要的文摘。 2.机编文摘的实现方法 机编文摘实现的要求具有比较客观的原则作为指导。机编文摘实现的原理是利用计算机情报检索技术,对文章进行字频统计、词频统计或位置等分析,确定选取文摘句的标准并根据标准从文章中抽取句子,对抽取的句子进行加工整理、修饰、联结形成文摘。自动文摘实现的关键是从文章中抽取合适文摘句的方法。文摘句标准的制定及由此决定的文摘句的选取是机编文摘的关键。通常有以下标准: (1) 标题取最高权重:大部分文章的大小标题在一定程度上能够反映出全文或某个段落的主要内容,可以作为候选的文摘句; (2) 主要部分取较高权重:文章中的某些段落或段落中的前后部分具有重要的意义,应取较高权重,如文章的前言、结论或节段的开头、结尾部分的句子,; (3) 指示主题的句子取较高权重:文章中包含有诸如“本文论述”、“本文的目的”、“本文提出”、“本文讨论”、“本文指出”、“本文研究”等提示性语词的句子一般反映了文章论述的中心内容,可作为文摘的侯选句; (4) 根据文章中不同字或词出现的频率,从文章中选取句内词权值较大的句子作为候选的文摘句。 依据以上标准选取的句子,按文章的内在逻辑顺序排列成文。 基于词频统计的机编文摘是应用最早的也是较为实用的自动文摘技术,下面以该方法为例介绍编撰步骤。 (1)首先建立用词和停用字词表:文摘的机编是建立在自动标引技术基础上的,自动标引技术又是以对字词的统计为基础的,然后对选入的字词,即较高出现频率的字词所在的句子进行核心字词频率加权,高出规定值的即被选入。有一些虚词和连词,诸如“地”、“的”、“是”、“在”“于是”、“接着”对于体现文章内容的意义不大,在统计时可以将这些字忽略 (2)输入文章:录入、扫描、下载原文,即将其转换成计算机识别的数字形式,借用用 第 43 页
词和停用字词表统计出文章中不同字词的出现次数及文章的总字词数,并计算出文章中不同字词的相对频次。 (3)位置加权:对出在文章标题或副标题中的关键字词,它的实际权值应相对地高于统计出的相对频次。 (4)句子加权:按照文章中各个字词的相对频次,计算出文章中各个句子的权值。具体算法如下:将一条语句中已入选的各个字词的相对频次累加,然后除以语句的字数,即可得到句子的权值,同时考虑句子位置和指示意义的权值,计算出句子的总权值。 (5)抽取文摘:比较文章中各个句子的权值,根据事先确定的文摘字数,可计算出作为文摘句子的阀值,按照文章中句子的顺序,抽取大于阀值的句子进行排列组织。 (6) 加工成文:对从原文中抽取的句子进行自动加工或人为加工,去掉一些无意义的连接词,并删除文摘中无意义的句子,并对生成的文摘进行调整润色,使句子变得通顺,意义表达清晰,成为真正的文摘。 基于语义理解的文摘与此不同,有兴趣的读者可参考相关文献。 3.机编文摘存在问题及展望 虽然机编文摘的研究已有几十年的历史,但目前的自动文摘系统还不成熟,仍处在试验研究阶段,有些实用系统仅限应于某些具体的学科领域,生成的文摘还存在着不少问题,达不到完全自动生成的目的。目前利用机编文摘技术生成的文摘主要以下缺点: (1) 容纳性差:文摘不能完全反映原文的中心内容,不能保证准确地概括文章的原意,有些只反映了文章的一部分内容,而将文章的其它部分忽略,有些主要内容没有反映,却只反映了次要内容; (2) 精练性差:文摘包含了许多意义不大的信息,很难做到用简炼的语言文字来表述文章包含的信息,文摘的冗余较大; (3) 连贯性差:由于组成文摘的句子是从原文中直接抽取的,一般只注重包含关键词或关键字的句子,很少顾及整篇文章的篇章结构和段落结构,所以文摘的语句之间连贯性较差,难以做到句与句之间密切的联系,用户阅读文摘感觉到不太通顺,这是目前基于词频统计的文摘普遍特点。 总之,目前自动文摘系统还不能够完全满足用户的需求,为此需要引入其它相关技术如计算机科学、语言学、人工智能、数学、逻辑学等,尤其是基于语义的自动切分词技术与自动标引技术。只有这些学科和技术得到实质性的进展,自动文摘系统的研制工作才能取得更大的突破。 综述 综述的定义及类型 综述是对与主题相关的大量初始信息记录或非记录形式传播的大量初始信息或事实等进行分析、归纳、综合且按一定逻辑顺序而组织成的能在一定时间和空间上反映特定课题研究的全部或大部分情报的具有研究性质的二次信息产品。综述反映的是一批相关文献的信息,是它们的总体概括和提炼,它是信息组织和分析的产物,是信息组织活动的高级形式。 从信息控制的角度看,并非所有出版的初始信息记录都是要高质量的,也不是每篇论文都能对某一专业领域有促进作用;同时也由于现代社会信息的急骤增长,一般人员难以通阅所有文献甚至自己本专业的文献也不可能。因此,采用综述法加工初始信息,可以使一篇综述概括许多初始信息记录的内容,帮助信息用户在最短的时间内把握最多的内容,有助于用 第 44 页
户迅速掌握和了解多个领域的发展趋势或动态。综述的作用可归纳为:浓缩信息、系统报道、评价预测、提供检索、把握动态。 显然综述对信息对象的揭示比文摘更深刻,但对综述作者智力要求也比文摘高。米哈依诺夫认为:“编写综述通常介乎于科学情报工作与研究工作本身之间,有时已经处于两者的分界线之外”,正是对此的深刻反映。 根据不同的标准,信息综述可以分为以下类型: (1)按综述信息含量的不同可分为:叙述性综述、评论性综述和专题研究报告。 (2)按综述报报道内容的时间范围划分可分为:动态性综述、回顾性综述和预测性综述。 (3)按综述的来源和对象划分可分为:文献综述和事实(现象)综述。 (4)按综述报报道内容的时空范围划分可分为:横向综述和纵向综述。 综述的特点 1.综合性:这是综述的最基本的特点,它往往是围绕某一中心主题,记录了多种初始信息的精华,信息来源广泛,能集中反映综述对象多层面,一段时间空间内的总体情况。 2.浓缩性:综述用精炼的语言集中反映一定时期内一批文献的内容,浓缩大量信息,一篇综述可以反映几十至上百篇的原始文献,信息密度大,浓缩度要以是否集中足够的原始文献,能否全面反映综述主题来确定,英国的D.普赖斯认为,含有其他著作的引文25处以上的论文可视为综述性论文。英国的伍德沃德认为,论文含有100处以上参考文献时,可以视为综述。 3.简明性:符号和表达方式使用简练、明确,选题和材料的取舍和组织也十分严谨、明了。 4.客观性:综述的客观性表现在两个方面;一方面叙述和列举各种理论、观念和方法、技术及数据要客观,必须如实反映原文献的内容,不得随意歪曲或断章取义,还要避免因理解不同而出现可能的误解,另外,在分析、比较、评论多种理论观点、方法时要有一种客观的态度,应基于客观事实进行分析、评价和预测。客观性原则是信息组织的重要原则之一,失去这一点,综述也就失去了本身的价值。 综述的编写 综述是一种信息再创造活动,是信息组织的高级形式之一,它的编写过程与科技论文写作有许多相同之处,即:确定选题和研究重点;搜集资料,分析、评价资料价值,并进行筛选;整理资料使之系统化;撰写综述。 (1) 确定选题与研究重点 确定选题要注意选取当前热点、焦点报道,要充分考虑到人力、物力和时间的条件,还应避免重复选题,为此,选题应注意配合国家制定的科研发展方向和科研规划选题,针对国民经济建设和发展中重大的规划、政策、决策、重点建设项目以及新学科新问题、新思潮研究及学科发展的新理论、新方法选题,或配合国家经济、政治形势进行有关基础理论研究选题。 (2) 资料收集 确定好选题后,应明确资料收集的范围,运用工具书或联机进行检索,还应浏览近期的各类文献资料,以获取最新资料。文献资料的类型包括:图书、期刊、会议文献、专利资料、标准文献、报纸、百科全书、年鉴、手册、机构指南、图册、辞典、科技报告、学位论文、手稿、统计资料、产品资料政府出版物、内部资料以及缩微品、CD-ROM等,联机检索主 第 45 页
要是查检一些著名联机系统,如Dialog,还包括通过网络获取资料。资料选取应注意代表性原则、时间性原则,资料搜集和积累可采取摘记、剪贴、复印、扫描、下载等途径进行。 (3) 分析和评价资料的价值。 分析和评价资料的可靠性、客观性、相关性、适用性、新颖性及科学性,对每一指标进行定性或定量考核,然后决定取舍。 (4) 整理资料使之系统化 将收集的资料按综述论述的问题或主题加以分类排序,或按其它某种标准,如应用领域,方法、技术、产品等分类排序,使之系统化。 (5) 撰写综述 经过以上环节,综述的主要内容、结构、观点已基本成型,然后按完整的思路,合理安排材料,辅之以适当的修辞,使文章通畅达意,完成综述的撰写。 综述的结构 综述没有固定形式,但一般包括标题、导言、正文、结语以及参考文献五个部分,但有些并不是都应具备的要素。这些部分的写作与通常的科技论文基本相同,相对于文摘的编写来说写作比较灵活,个人创造的空间较大。 苏联解体原因探析 ——《苏联解体原因》国际研讨会综述 苏联解体是否有历史必然性 悉尼大学教授彼得罗夫:在当时的苏联并不存在导致经济、政治,以及国家体制突然崩溃的理论前提和实践条件。关键是要处理好政治和经济的相互关系。如果政策不对头,必然导致经济崩溃,而这种情况对社会主义、资本主义及历史上任何一种社会体制都是一样的。 德国曼海姆大学教授雅恩:即使到1987年,如果戈尔巴乔夫能进行有效的改革,调整好与各加盟共和国的关系,苏联也不一定会解体。 前俄罗斯总统顾问活尔科夫:在政治学著作中,特别在宣传文章中常可见到这样的说法,似乎苏联解体是不可避免的,是历史的必然。这种说法经不起批评。解体是一系列偶合情况的结果,首先是党政领导低劣的政治错误造成的。 苏联解体的历史原因 德国学者诺伊贝特:列宁看到了旧俄国的落后性,发动十月革命时曾经期盼世界革命的支持。但第一次世界大战后世界革命陷入低潮,苏联社会主义革命和建设是在一种受围困、受孤立的情况下进行的,列宁不得不实行高度集中的体制,利用有限资源以克服“落后性”。列宁是在俄国这样的民族条件下看待社会主义建设的。由此得出三个结论:第一,人类发展的社会主义前景并没有过时;第二,重复苏联社会主义模式是不可能的,应该寻找我们自己建设社会主义的道路;第三,无论当前和未来社会主义都不能设想是单一的模式,社会主义发展应该呈现出多种模式、多样化。 俄罗斯科学院乌拉尔分院副院长阿列克谢耶夫院士:俄国学术界对斯大林模式,特别是斯大林时期大清洗死了很多人等历史事实,倾向于用社会发展的眼光来看待。斯大林时期,苏联在极端困难的条件下,走上了工业化道路,资本主义原始积累时期“羊”吃“人”,比斯大林时期死的人还要多。斯大林的模式虽然有弊端,但取得的成就是不能抹杀的。 法国学者维尔特:如果30年代选择布哈林等人的方案,可能苏联付出的代价较小。以前对30年代苏联大清洗被杀害、被流放的人数统计被大大夸大了,根据最近的统计资料,被杀害的人数为70万左右,而原来估计有700~800万;被流放的人数,原来估计有2,500万,实际上只有原来所说的1/10和1/15。 苏联解体的现实原因 保加利亚学者基列夫:戈尔巴乔夫从改革一开始就抱着瓦解社会主义的目的,戈1999年在土耳其某大学的讲演中,就公开宣称要瓦解共产主义(但不少学者仍认为,戈的演变有一个过程,他最终不过是一个社会民主党人)。 澳大利亚学者彼得罗夫:改革与公开性是毁灭苏联社会主义的基本理论,也是苏联崩溃和解体的主要政治驱动力。戈尔巴乔夫的改革政策无论在原则上还是在实践中都是错误的。“公开性”一词的意思是将经济社会进程中的信息充分地、不经修改地反映出来。但是在戈尔巴乔夫“公开性”政策下,反映的是十足的谎言和虚假的信息,发展为对共产党和社会主义的恶意攻击和诽谤。正是公开性破坏了反馈体系,使得社会主义不可避免地要分裂和走向灭亡。 俄罗斯科学院哲学研究所布洛夫博士:戈尔巴乔夫倡导的“民主化”、“公开性”破坏了苏联社会主义的基础,消除了社会有机的、相对无痛苦的发展。失去了整个现代化进程的可能性,给活着的几代人带来苦难并使未来发展前景十分暗淡。其破坏主要表现在:在思想上使人民形成对“西方文明”的盲目崇拜;在经济改革中造成坚信“市场自由就是一切”,由国家进经济改革的想法遭到驳斥;在文化方面把市场自由和自由等同起来,天真地认为市场能“吸收”最优秀的书籍、影片和科学成果。他们以为只要人为推行市场和民主,国家就会自动地繁荣,完全没想到苏联这样一个国家政治民主和经济自由之间可能并且实际上发生了冲突。 沃尔科夫教授:“改革”本身的特点是前后不一贯和缺乏深思熟虑的纲领和行动计划,这与戈尔巴乔夫当选总书记有关。以其为首的苏共领导对国内分裂倾向的出现没有给以足够的重视,而依旧执行过急的方针,这一方针导致了政治体制削弱,共产党在国内主导作用的丧失,共产党领导权的丢失。这一点在1989年5月25日苏联人民代表大会开始工作后表现得特别明显。在大会上,各地区代表联结成的反对派集团对国家所有政治和经济政策进行了毫不留情的批判。 阿列克谢耶夫院士:资本主义社会从产生到确立,至今发展了500年。“激进民主派”亚夫林斯基先生让苏联在500天内完成这一过程,结果必然是失败。中国改革进行20年,取得了成绩,因为中国没有企图在20天内就达到这样的效果。 雅恩教授:国家的社会制度可以改变,但不一定都要导致国家解体。比如瑞士等联邦制国家在形成中并不是都解体了。从苏联1986—1987年的形势看,当时是可以签订新的联盟条约的。如果戈尔巴乔夫正确地把握了时机,苏联就可避免解体的悲剧。 第 46 页
有的学者以苏联社会结构的变化为视角来论证苏联解体的原因。认为戈尔巴乔夫进行政治上分权、经济上放权的改革导致联邦国家权力分裂,使社会流动渠道、社会流动驱动力多元化。新生资产阶级的形成,使苏联社会的基本社会结构,工人、农民、知识分子队伍逐渐瓦解,致使建立其上的社会主义体制坍塌。 民族问题对苏联解体的影响 阿列克谢耶夫院士:地域主义(亦可译为地方主义)是苏联解体的重要原因之一。在政治实践上常常回避的地域主义,“是具有内外表现形式的要求独立的综合现象”,“它是一些区域集团为了争取社会经济及民族文化权利的独立性而进行的政治、经济运动”。俄国十二月党人早就提出:在俄国这样一个多民族国家,必须按区域原则而不是按民族原则作为国家的区划。随着20世纪初革命运动的发展,“按民族原则划分区域”开始对“按发展区域原则划分”占上风。苏维埃政权虽然是最终维护了原帝国疆土的政治统一,但一旦地方上的精英们羽翼丰满分裂主义情绪就会爆发出来。他说,任何一种按民族划分的原则都不能使所有民族感到满意,他们都有权要求获得自治,这就将导致国家分崩离析。俄罗斯这样一个多民族国家却按民族原则进行行政政治区划,最终应了十二月党人彼斯杰尔一百年前预见的结果。 俄罗斯科学院斯拉夫研究所所长沃尔科夫:在苏联解体中,民族官吏阶层起了十分显著的作用;为民族主义分子的活动提供自由,并为外国势力肆无忌惮地干涉内部事务大开方便之门。民族官吏阶层作为苏联社会官僚特权阶层的一部分。在民族自治区域内,这个阶层像在单一民族区域一样,无视其他民族的权益,为自己谋取实惠和权力,任人唯亲,大搞裙带关系,按民族特征提供特权等等。以哈萨克斯坦为例,在80年代初,这里哈萨克族只占36%,俄罗斯人占41%,其他民族居民占23%,但在党、国家和各种管理机构中,哈萨克族却占70%以上。为保证民族特权,1986年12月在阿拉木图发生了由民族官吏阶层秘密组织的最早的群众性骚动。在1988—1989年的苏联人民代表选举前后,各民族共和国出现了以“人民阵线为组织形式的民族分裂活动。大部分民族官吏、氏族阶层迎合“人民阵线”和部分民族知识分子的活动。在1990年春举行的共和国最高苏维埃选举中,很多民族官吏为了中选,不惜离开马克思主义意识形态,加强“民族色彩”。他们还利用联盟中央权力的削弱,勾结地方民族主义势力(即原政权反对派),以宪法中规定的民族自决权和直至分离的条款为武器,宣布主权独立,脱离苏联,从而造成了联盟国家的解体。 苏联解体的外部因素 ——西方和平演变影响 保加利亚学者基列夫:西方对苏联有计划的进攻是导致苏联解体重要原因。这种进攻表现在三个方面:第一,在经济方面,阻挠、拖延苏联经济的发展,破坏其社会发展纲领的完成,以引人民的不满,搞垮社会主义;第二,在思想方面,正如美国国务卿杜勒斯所说:为欺骗和愚弄苏联人投入全部力量;第三,美国反苏“第五纵队”的进攻。美国中央情报局建立数十个研究所、中心,目的是对苏联的瓦解和解体过程实行领导。曾任苏联情报机构的领导人安德罗波夫1977年向苏共中央报告:美国中央情报局要在苏共队伍中寻找其代理人,这些人他们后来终于找到了。 阿列克谢耶夫教授:(针对很多学者指出美国利用军备竞赛来拖垮苏联经济发展的事实)如果当时苏联不搞原子弹,今天的世界历史可能就会重写。试想只有美国一家有原子弹,世界会是什么样?对俄罗斯当时顶住美国压力和霸权主义的作用,我们还评价不够。 布罗夫教授:在公开性和多元化条件下,苏联历史遭到否定,社会主义社会自身存在的权利遭到怀疑,而许多苏联人成了对西方的盲目崇拜者。“民主运动”的领导人不是在苏联现有的社会经济和文化资源基础上制定改革方案,而是从一切要符合西方的、即美国的发展模式,实践证明这是一种乌托邦的想法。 叶拉索夫:苏联的精英们认为西方是惟一“真正的”文明,所有社会都应仿效它,“别无选择”。许多政治家,从戈尔巴乔夫到外长科济列夫开始,经常把俄罗斯的任务表述为“进入世界文明”。在这样的情况下,俄罗斯的大部分历史遭到抹黑。所有这一切促使部分精英和知识分子思想上急剧倒向西方,倒向对自身文明的精神背叛。一些俄罗斯学者认为:从根本上看,西方不希望有一个统一、强大的俄罗斯联盟出现。以“俄白联盟”为例,就遇到很大的国际阻力。俄罗斯与独联体其他国家的联合也面临着西方的压力。在研讨会上,几乎所有外国学者都对中国改革开放所取得的巨大成就和实行的正确的改革路线表示了高度赞扬。俄罗斯科学院哲学所主任研究员布洛夫多次为戈尔巴乔夫未能采纳中国改革模式而深表惋惜。他说,现在许多俄罗斯人都持这一看法,甚至连戈尔巴乔夫本人在退休后也不得不承认当时应当采用中国的方法。 目录 目录的概念 什么是目录?到目前为止人们尚未给出统一的解释。由于传统的信息记录是图书或文献,所以长期以来目录等同于书目。我国颁布的国家标准《文献著录总则》指出,目录是“将一批款目按照某一事实上的次序编排而成的一种文献报道和检索工具”。实际上,目录的含义要远远超出传统的图书,文献的范围,目录的揭示对象还应包括特定的事实、现象,信息记录和信息实体。为此,我们将目录如下定义:目录是将从信息对象中抽取出来、能反映信息对象的某些特征并能提供查找线索且按某种规则和次序编排而成的一批款目的集合。题录(Title List)是目录的一种常见形式。 目录的类型与结构 1.按照目录所揭示信息内容的不同可以分为文献目录、实体目录、事实目录 1)文献目录 文献目录以各种文献为揭示对象,揭示内容都是与文献有关的特征,如题名、作者、出 第 47 页
版者、出版日期、 载体形态、主题内容、获得方式。文献目录品种繁多,如图书目录、论文目录、专利目录、报刊目录、磁带目录、金石目录等。文献目录是为了传播、方便利用文献而制作的。我国制作文献目录历史非常悠久,如中国古代的《七略》、《四库全书总书目》,解放后的《全国总书目》和《全国新书目》都有广泛的影响。 2)实体目录 实体目录是将物质实体作为揭示对象的一种目录形式,其中商品、产品目录最为常见。揭示的内容都与物质实体的各种属性有关。如商品的品名、型号、规格、主要技术数据或指标、用途、供货方式、分格等。 3)事实目录 事实目录以与人类有关的各种活动、事实现象等作为揭示对象,内容涉及各种活动,事实现象的进展、现状、以及其他相关数据,它常冠以名录、指南大全等,如招生目录、企业名录、会议目录、演出目录。也有面向某一机构或系统内部的科学管理而编制的内部目录,如企业客户目录、员工目录、户籍目录、海关关税目录。 2. 按目录载体特征的不同,可分为印刷型目录、感光型目录和电子型目录两种类型 印刷型目录常见有卡片式目录、活页目录、书本式目录;感光型主要有缩微目录;电子型目录有磁介质和光学介质目录,即以磁性材料和光学材料作为信息记录载体的目录形式。如MARC记录、联机书目、光盘书目数据库、OPAC、网上书目数据库等。 3. 其它类型 另外按目标内容所涉及的范围,可将目录分综合性目录和专题性目录;按目录专用功能不同,可以将目录区分为报道性目录和检索性目录;按目录中各个记录单元的组织排列方式的不同,可以分为分类目录、主题目录、字顺目录、编年目录;按目录存在方式的不同,可以区分为独立目录和附属目录。 4. 目录结构 目录结构包括数量结构和构成结构,前者指目录包含的记录量,它决定了目录的规模。构成结构指每条记录包含的单元,每一单元都反映了信息对象的某一属性,它们都可以成为检索的入口。例如人员基本情况目录包括姓名、性别、出生年月日、民族籍贯、学历 、职称、健康状况、婚姻状况等,一个人就是一条记录,而其中每个人的各种情况即是记录的数据项,是目录的构成单元。 目录的编制方法 制作目录的主要工作,就是为目录涉及的每一个揭示对象,制作出项目齐全或符合要求的记录单元,最后,再按照一定的方法组织排列这些记录单元,使之成为一个有机的整体。不同对象其目录的制作有些差别,下面以书本式目录的手工制作过程介绍一下目录的基本制作过程。 书本式目录下制作,要经过选题、编写前言;制作单一记录单元、组织排列记录单元;编定目录和其它辅助资料;审核印刷等程序。每一程序的具体操作方法和要求如下: 1. 选题 即确定目录揭示的对象、主题范围、目录的类型并拟定适当的题名。选题要根据信息揭示、组织、传播、检索的信息量等方面的因素来考虑。重点要考虑用户获取和利用信息的需求,它是选题乃至编制目录的根本。 2. 编写前言 编写前言就是以文字或图例介绍目录的编制目的、结构、格式、使用方法等有关的内容。前言所陈述的目录格式、结构等方面的内容,既是方便用户使用也是具体编制目录过程中不 第 48 页
可缺少的参照和规则系统。 3. 制作单元记录 制作单元记录就是为目录涉及的有关对象一做出简明的特征描述,它在整个工作量中占最大的份额。由于各种目录揭示对象不同,因而,单一记录单元的格式、项目和符号等也有所不同。如产品/商品目录的记录单元所包括的项目往往有:产品/商品名称、型号、规格、用途、性能、包装、价格、生产厂家,联系地址等,而企业目录记录所包括的项目一般有:法人代表姓名、企业名称、成立日期、职工总数、固定资产额、厂址、通信联络途径、主要产品或经营范围、企业所获荣誉及业绩、近期经营状况等等。如果是科研成果目录,每一记录单元包括的项目就应当有:科研成果的名称、主持或完成者、立项时间项目来源、完成时间、成果形式、所达到的水平、社会反响等。虽然差别较大但对同一类的信息对象尽量统一目录的格式与制作方法,为文献信息的揭示、组织、传播、交流、检索和利用创造良好的条件。 目前,我国已公布了一系列与文献目录制作有关的标准。它们分别是: 《中文书刊名称汉语拼音拼写法》(GB3259—82) 《检索期刊条目著录规则》(GB3803—83) 《文献著录总则》(—83) 《普通图书著录规则》(—85) 《连续出版物著录规则》(—85) 《非书资料著录规则》(—85) 《档案著录规则》(—85) 《地图资料著录规则》(—86) 《古籍著录规则》(—87) 《文后参考文献著录规则》(GB7714—84) 随着时间的推移,有关的标准仍在不断推出和完善。国家标准《文献著录总则》(—83)中,对文献目录中单一记录单元应包括的基本项目和格式做出了明确的规定。具体请参该国家标准。 在没有统一标准的情况制作目录,目录的编者对目录的总体功能和具体记录单元的项目、格式应进行细致的思考。确保将揭示对象有关的信息简明、准确、统一、有序地显示出来,为充分发挥目录的功能提供技术保证。 4. 编排目录正文 编排目录正文就是将制作好的众多单一记录单元组织排列成有机的整体。具体的组织排序方法主要有分类法、主题法、编年法、字顺法等,请参阅本书第二章。无论采用什么方法组织排列目录正文,最后就是要给每一记录单元一个固定的位置,使他们成为有序集合,便于检索利用。 5. 编定目次 这项工作是在正文编排完毕、并且编好页码之后,用单独页码列出目录正文各主要部分的标题和所在页码,制作一个目录之目录,以便一目了然地显示目录正文的整体内容和各部分的出处。 6. 编制辅助资料 目录中的辅助资料是为了方便目录用户从多角度迅速检索出目录正文有关的信息或解释正文中不容易理解的概念、符号而设计和制作的信息记录。如大型的文献目录制作题名索引、出版社索引、著者索引等,为产品/商品目录制作商品名称索引、商标索引、生产厂家索引等等,制作索引不外乎为用户提供更多的检索途径。 7. 审校、印刷、装订 第 49 页
在结束上述六项工作之后,就形成了目录初稿。经过认真审核定稿之后,可以打印或交由出版单位出版印刷。 目录数据库的制作前面的环节与此相同,只是后面多了计算机处理的操作,它另包括数据库的逻辑结构设计和物理结构设计,书目数据的录入,书目数据库的维护等工作。 机读目录 机读目录(Machine Readable Catalogue,MARC),是一种经过人们编辑、组织的数字化的书目记录的集合,它是美国国会图书馆提出的著名的机读目录发展计划于1964—1968年期间研制,1969年发行MARC磁带。它将传统的卡片目录的内容以标准数据形式记录在光磁载体上供用户利用计算机等特殊设备查阅,它主要记载了文献的书目信息和存贮地址,记录格式统一。各国对MARC记录都规定了一些标准,如美国国会图书馆机读目录(LCMARC)、英国机读目录(UKMARC)、日本机读目录(JAPANMARC)、我国的机读目录“中文机读目录”(CNMARC)。 机读目录的每一条记录、每一项数据都应按一定格式存贮才能被计算机识读和查找,另一方面,为了便于书目数据的交流和共享,统一机读目录记录格式,使之标准化。1973年国际标准化组织(ISO)在美国国会图书馆MARCⅡ格式基础上制订并分布了《文献工作——书目信息交换用磁带格式》(ISO-2709),它把书目记录的总体结构定义为记录头标区(Leader)、目次区(Directory)、数据区(Data File)以及记录分隔符四部分。其构成形式如下: 字符位置 项 区 0—4 记录长度 5 记录状态 6—9 执行代码 10 指示符长 11 标识符长 头标区 12—16 数据基地址 17—19 用户信息 20—21 目次安排 22—23 将来使用 …… 字段号 …… 数据字段的长度 目次区 …… 数据字段的起始地址 …… 指示符 …… 标识符三个选 …… 数据择组合数据区 IS3 记录分隔符 表 书目记录格式 机读目录存贮载体占积小、容量大、复制速度快、易于收藏和携带,并可产生出多类型的卡片式或书本式目录,重要的是可以有效地实现对资源的管理,所以机读目录在图书文献机构中具有相当重要的地位。1982年我国参照这项国际标准,结合我国现实情况和传统做法,制定了国家标准《文献目录信息交换用磁带格式》(GB2901-82)。它的出现,满足了我国文献著录编目工作现代化的需要,也为我国实现文献资源共享、与国际接轨打下了坚实的基础。 索引 索引组织法是指将文献中的具有检索意义的特征项或语词、符号、代码等提出来形成一 第 50 页
条条的记录,在每条记录下面注明来源地址如页码、位置、时间等,并按照一定的规则排列起来的信息组织方法。它要求对文献的外部特征和内容特征用各种检索组织语言进行描述,并按照一定的方式将它们排列起来,其组织的结果就是“索引”。索引作为一种指南系统,既是查找信息的工具,也是组织信息的工具。在现代社会里,没有索引,查资料、打电话、订旅馆、找街道以及许多其他活动都将无法进行。 索引的概念与历史演变 索引一词是一个外来语。它由日文“さくぃん”音译而来英文为index,汉语称为索引或“引得”。索引的概念,目前国内外存在不同解释,美国1968年颁布的《索引的基本标准》将索引定义为“信息集合体中抽取概念的系统指南,并用按照某种众所周知的或阐明的可检顺序(如字母顺序、编年顺序或数字顺育)排列起来的项目来表示这些可检项或概念”。我国尚未有索引的国家标准。1989年出版《辞海》对索引作了如下解释:“将图书、报刊资料中的各种事物名称(如字、词、人名、书名、刊名、签名,内容主题名等)分别摘录,并加注释,记明出处、页码,按字顺或分类排列,附在一书之后或单独编辑成册,称为索引”。 综合国内外有关索引的定义,我们认为索引是由从信息对象抽取的概念及这些概念与信息对象之间的联系组成的信息集合,这些概念通常按某种可检顺序加以排列。它是一种查找信息对象内部的信息概念的检索工具。 索引的历史与图书几乎一样久远。目前公认的最早的《圣经索引》是13世纪由圣克雷的红衣主教C·休编制的。索引在中国出现较晚,1910年,新文化运动的倡导者之一林语堂首次将索引引入中国,1925年在上海设立了索引委员会,隶属于中华图书馆协会解放后,索引工作得到了很大发展,1991年中国索引协会在上海成立,标志着我国索引工作正在进入一个新的发展时期。 由于索引在检索中的重要作用,各国对编制索引的工作都非常重视,如50年代以来,台湾、大陆、香港共编了近千种索引。80年代,我国国家社会科学研究项目中,有一项是为《论衡》编制索引。国外许多原版著作书后都附有主题索引,它们为阅读和研究提供了极大便利。 索引工作的蓬勃发展,编制索引的技术方法不断改进,索引的载体类型不断多样化,目前,索引的半自动和自动化生产已成为现实,一些索引软件可实现快速为文献编制索引。索引技术还是现代信息检索系统设计、运行不可或缺的技术。 索引的结构 索引是由按一定的方式组织排列起来的一条条索引记录构成,每条索引记录由索引标目项和出处项两大部分构成,以下是其结构的示例。 索引标目项 索引出处项 图 索引结构示意图 1.索引标目项 索引标目项是对那些可以作为检索点的信息所做的描述项。索引标目项可以是语词形式的,如字、词、短语、书名、篇名、商品名、人名、地名、机构名等,也可以是代码或图形形式、视频、音频的片段,如商品代码、商标图案、专利代码,人物图片等,它们都可以作为标目项,构成检索的入口。由于标目项本身的特点,标目产生了单纯标目和复合标目的概念。前者是指标目项形式简明,含义单纯自明;后者是指标目项不具有单纯、自明的特征,需加注一些限定成分。因而复合标目项又可区分为主标目和附加标目。 附加标目的格式如下例所示: 第 51 页
信息组织(多媒体) 信息组织(网络) Distance Education (Internet) 2.索引出处项 索引出处项多是有关标目所揭示信息的定位标识,用于指示何处可以找到有关该信息内容的详细介绍。或者显示有关信息对象的存贮地址,索引出处项最常见的是页码,也有分类代码或其它符号文字等。 information : 3, 21, 29 information retrieval : 4, 7, 50 大多数索引都是针对文献制作的,有时由于实际需要,也可为信息实体编制索引,标目项是实体名称,而出处项可以是信息实体的具体位置。如:档案的管理、住房管理、期刊管理等。下表是一个库存期刊索引的示例: 期刊名 年 卷 期 架 位 新华文摘 2002 89 1 118 198 图 一个期刊索引示例 索引的类型和编制 1.索引的类型 1)按照索引对象的不同,索引可以区分成商品索引、物资索引、机构索引、姓名索引、图书索引、报刊索引、论文索引、专利索利、标准索引、档案索引、科技报告索引、会议索引、地图索引、工程图索引、视听资料索引、病历索引等。 2)按照索引标目所使用的揭示符号的不同,索引可以分为语词索引、图形索引和代码索引、数据索引等,如商标图案索引、指纹索引、徽章索引、基因图索引、化合物分子式索引、专利号索引、标准号索引、街道门牌号码索引、经济统计指标等等。针对同一对象,可以制作多种不同类型的索引,全方位、多途径地揭示相关信息,以方便用户从任意入口检索。许多大型的检索工具如CA、SCI等都提供了多种索引检索途径。 3)按照索引载体形式的不同,可以区分成纸介索引、感光介质索引、磁介质索引和电介质等。纸介质索引包括卡片式、活页式和书本式三种具体形式。感光介质索引包括缩微胶片和胶卷形式的索引,磁介质索引包括磁带、磁盘等形式,电介质如计算机的内存、IC等。它们是供计算机识读的索引,是计算机信息检索系统赖以存在的基础。 4)另外,按照存在方式的不同,索引分为独立索引和附属索引,按照索引记录单元的组织排列方式的不同,索引可以分成分类索引、主题索引、字顺索引、编年索引和代码序号索引等。 2.索引的应用与编制 索引可以单独使用,也可以同其它的信息组织方法结合使用,它是信息组织的产品,信息组织的技术和信息组织的方法。在信息组织活动中,我们常见的意义重大的索引的应用有: 1)自然语言索引:这种索引在编制时用计算机抽词而成,主要有关键词索引(如题内关键词和题外关键词索引)和语词索引。 2)隐示语言索引:它主要是指一些特殊索引,如音乐方面的主旋律索引,图象的色彩索引等。 3)人工语言索引:如标题词索引、元词索引、叙词词索引、分类号索引、环系索引、分子式索引等,它们都是使用人造符号来表达索引对象的索引语言体系。 由于主题索引是索引的重要应用,现简单介绍一下主题索引的结构原理。索引的最基本单位是款目,一个款目就是索引中的一条记录,是表示一个完整意义的基本结构。一个主题 第 52 页
索引系统由许多款目单元组成。款目由标题(标识)修饰语(间或有相关语)和查找号组成。标题又称引导词,其作用是控制款目在索引中的位置,并作为信息检索的入口和标识。修饰语主要用来限制主题,提高专指度。查找号,又称地址,一般为页码或文摘号。主题索引通过参照系统来表达标题或索引语言之间的内在联系,以明确它们的含义和所包含的范围,为检索者提供多途径检索和簇性检索。 索引的编制目前有手工编制、计算机辅助编制和全自动编制三种形式。无论采用什么方法编制索引,都可以分成两个阶段地操作,一是规划设计,二是具体制作。索引编制的原理并不复杂,但手工编制工作量极大,不过运用计算机自动编制索引却是非常容易的。 索引与目录的关系分析 1. 联系: 索引与目录既有联系有又区别,联系是主要的,表现在: !)从功能作用看:它们都是揭示、组织信息对象、检索信息的有效工具。 2)从总体结构看:二者的排列和存在方式基本相同。 3)从发展历程看:历史上目录和索引曾有混同现象,在现代目录与索引也出现了一些相互溶合的现象。 2. 区别: 1)对象不同:目录多是针对信息记录、信息实体、某种事实或现象进行总体性揭示的结果;而索引既可以针对信息记录、信息实体、某种事实或现象,也可以针对一些概念、数据集合甚至自然语言无法描叙的事物进行具体性揭示。 2)形式不同:索引比目录更简单、具体和专指。例如:目录的揭示项目一般较索引多些,但所涉及的多是宏观性信息或多方面具体信息的描述;而索引的揭示项目一般都比较少,它注重于一个概念、一个事实、一个数据、一个图案或一个名词这类微观信息的揭示,并且都以标注所揭示信息的具体地址为主要特征,索引虽然单纯,但却十分具体,制作索引对信息组织加工的深度要优于目录。 3)效果不同:对信息组织加工的广度或信息的网罗度而言,目录优于索引。索引对信息组织的深度更有独到之处,对信息对象的细微揭示,索引优于目录。 正是因为目录与索引各有的所长,才导致了二者的相互借鉴与溶合,出现了目录索引化、索引目录化的倾向。 引文索引 引文索引是一种特殊的索引,所以有必要单独介绍。所谓引文索引是依据文献之间的引证关系并按一定可查顺序排列编制而成的索引,它对文献检索、学科评价极其有用。 引文索引来源于科学著述中文献的相互引用,如文献B引用了文献A,则称A是B的“引文”(citation)或“参考文献”,B为“来源文献”。其关系如下所示: 来源文献 被引文献 引文 来源文献 来源索引 引文索引 图 来源索引与引文索引得关系 引文索引萌芽于19世纪,早在1873年,人们就根据引文索引的原理编制过一种供律师 第 53 页
和法学家查阅法律判例的检索工具,称为“波德引文”(Shepard’s citation)。由加菲尔德创立的美国“科学情报社”(ISI)1963年出版的《科学引文索引》( Science Citation Index,SCI)标志着引文索引的成熟。SCI是一部面向全部科技领域的跨学科的检索工具,具有完善的体学结构和操作程序,它在科学研究和评价工作中有极其重要的地位。至1991年,SCI摘录来源出版物3,213种,文献59万篇,引文12,229,290条。现在SCI发行了光盘版,并实现了网上检索。1973年ISI又出版了《社会科学引文索引》(Social Science Citation Index,SSCI)。 我国对引文索引的研究起步较晚,中国科学院文献情报中心编制的《中国科学引文索数据库》(CSCD)是引文研究和探索的重要成果;1998年始南京大学等开始研制中国社会科学引文索引(CSSCI),目前已取得重大进展。 引文索引具有十分鲜明的特点:(1)引文索引反映了作者之间、文献之间的引用和引用的关系;(2)提供回溯性检索;(3)语义相对稳定、适合计算机处理;(4)引得深度较大。 1.引文索引的结构 引文索引由引文索引、来源索引、机构索引、轮排主题索引四大部分组成,其中引文索引和来源索引是主体。 (1) 引文索引(Citation Index) 引文索引由全部引文款目组成,每个款目包括标目部分(引用信息)和修饰部分(引用者与文献信息)。标目部分包括引文作者姓名和该作者被引文献发表的有关信息(如引文类型、发表年份、所载期刊名称、卷、期、页等内容)。标目下面是修饰部分,指的是所有引用过该文的来源文献集合的有关信息(如来源文献的作者姓名、来源期刊的名称及发表年份、卷、期、页、文献类型等内容)(请参考前面)。标目的排列是先按第一作者姓名的字顺,姓名相同的,再考虑此文所载刊名、发表日期等其它信息。每一作者的文献以时间为序排列,如有同引,则以作者姓名字顺序排列。 CSCI和SCI的引文索引款目形式如下所示: 吴征镒…………………………引文作者 ·[其它]-84 ……………………………… 引文类型、出版年 金振洲 云南植物研究-94,16(1):1 ·云南植物研究-79,1:1 陈桂琛 植物学报-94,36(1):63 ………………引文刊名、出版年、卷(期)、页 ·云南植物研究-91(4):1 金振洲 云南植物研究-94,16(1):1 ·中国自然地理-植物地理.上册[图书]-83 李德铢 云南植物研究-94,16(1):1 吴正铠 …………………………………………同引作者 ·生物防治通报-88,4(4):168 洪华珠 真菌学报-94,13(1):77 ……………来源文献作者、刊名、年、卷(期)、页 CHANTOT JF ……………………………………引文作者 72 JERUSALEM S QUANTUM 4 205 BALMSLEY JA J PHYS CHEM R 88 2599 84R…………来源文献类型代码 YOUNG JK 37 322 82 CHANUSSOT G ……………………………………来源文献作者 65 APPL PHYS LETT 32 695 78 FERROELECTRICS 21 615 第 54 页
77 APPL PHYS LETT 31 3 HAFID L FERROELECTR 29 193 80 ……刊名缩写、卷、页、年。 CHAO D ……………… 引文作者 64 J PEDIATR 64 499………… 引文出版年、刊名缩写、卷、页 STORES DEVELOP BIO 11 208 81 CHAO GY 61 ACTA CRYSTALLOGR 14 940 PEXAT M J SOL ST CH 18 381 83 VINCENT H BK # 15187 80………… 书号和版权年 (资料引自倪晓建先生的《信息加工研究》186-190) (2) 来源索引 来源索引是由全部来源款目组成的,报道前一年或当前出版的最重要的科技文献,它分主要款目和参照款目两种类型。主要款目的标目为来源文献第一作者姓名,修饰部分包括来源文献的相关信息如合著者的姓名、文别、文献篇名、所载刊物名称、卷、期、页、发表年份、参考文献总篇数以及作者的地址等信息。参照款目以合著者标目,再简单列出第一作者姓名、来源文献所载刊物名称、发表日期等信息。来源索引款目按作者姓名的字顺排列。 引文索引中作者、文献信息不详,用户可根据来源款目判断查到的文献是否符合需求,这在论文作者鉴别和文献的准确查找上有重要意义。 CSCI和SCI的来源索引款目形式如下所示: 张玉民…………第一作者 9501141……………文献号 郑厚植-量子阱中电子隧时间的研究=Study on electron tunneling escape time fron quantum well[简]//红外与亳米波学报-94,13(1):69-72 参10 ……………… (合著者 正题名、并列题名 )期刊名称、出版年卷(期)、起止页引文数量 中科院半导体所 超晶体国家重点实验室 北京…………………… 机构名称、 国家重点实验室、 机构所在地 张玉文 9401143 陈钟颀,王启杰,吴清金-有分散热源矩形区域内熔化 问题的数值解=Numerical solution of meltingin a rectangular enclosure with discrete heat sources//计算物理-94,11(1):9-16参9中6 西安交大工 陕西西安 张裕怡 9500846 见 王有成…………………………………参照款目 应用力学学报 94,11(1):109 ABBEY A …………………………第一作者 ·BOORMAN KN LEWIS D- …………………………………………………合著者 THE AVALLABILITIES OF LYSINE,METHIONINE AND TRYPTOPHAN IN PROTEIN BY CHICK GROWTHASSAY………………………………………题名 J SCI FOOD 31(5):42-431 80 13R………………………引文数量 UNIV NOTTINGHAM,SCH AGR,LOUGHBOROUGH LE12 SRD, LEICESTERSHIRE, ENGLAND.…………………………作者地址 ABBI SC 第 55 页
·KOTHARI NC-GROWTH OF GAUSSIAN INSTABILITIES IN GARSSLAN LASER-BEAMS………………………………………来源期刊 J APPL PHYS 51 (3):1385-1387 80 13R卷(期)起止页 INDLAN INST TECHNOL,NEW DELHI 110029,INDIA 出版年 (资料引自倪晓建先生的《信息加工研究》186-190) (3) 机构索引 机构索引是引文索引和来源索引的辅助部分,它提供了来源文献作者工作机构的有关信息,提供了机构查找途径。如CSCI设有国家重点实验室部分。 CSIC的机构索引款目形式如下所示: 地理部分: 安徽 ……省 合肥 ……市 中国科大…………机构名称 ·物理系………………部分名称 范展国 *951907………文献号 张晓茂………第一作者 *9519675 ·应用化学系 吕刚…………合著者 9518008 9519066 中国重点实验室部分: 材料开放实验室(中科院半导体所)………实验室名称(实验室所在机构) 周开达……作者 *9418211……文献号 机构部分: 中国科大…………机构名称 安徽合肥…………机构所在地 230026……邮政编码 (资料引自倪晓建先生的《信息加工研究》186-190) (4) 轮排主题索引 轮排主题索引款目主要由两级标目构成。一级标目为主标题词,二级标目为副标题词。标题词是从来源文献篇名中抽取出来的一些关键词,把这些关键词中的任意两个按排列组合原理轮排,然后给出修饰项。修饰项可以是来源文献作者的姓名,也可以是文献号,但一定要具有检索意义。这种索引可以指引读者查找来源索引或引文索引。 CSCI的轮排主题索引款目形式如下所示: 固体表面发光……………主标题词 铬 ……………副标题词 *9518993 …………文献号(首次出现) 化学发光 *9518992 9518993 *9419152 镍 9518992 微量技术 9518992 (资料引自倪晓建先生的《信息加工研究》186-190) 第 56 页
2.引文索引的功能和作用 引文索引的独特结构决定了它具有一些独特的功能。 1)首先,引文索引提供了一种新颖的关系检索方法。用户只要沿着“文献间引用关系”这条主线,就能检索到相关的文献,象滚雪球一样越滚越多。而且这种关系检索不受学科分界和时空的限制,比一般检索工具更适于查找交叉学科、边缘学科的课题,对把握某个学科的发展脉络具有其它检索工具所不能比拟的优点。 2)其次,引文索引是科学计量的重要工具。引文索引中,引用与被引用关系把各种文献联结成一个引文网络系统,使整个科学成为一个跨越时空的立体体系。运用引文分析法,能定量地反映科学论文之间各种显形或隐性的相关性,有助于学科间的交叉继承关系、科学发展状况的研究,有助于系统把握研究热点乃至对科学的发展方向进行合理的预测。 3)引文索引还是文献计量研究的重要工具,引文索引为测定核心期刊、评定期刊、图书、论文质量,评价作者学术水平,研究文献老化规律等方面提供较为客观的指标,使之更具科学性。通过引文索引,我们还可以掌握某些作者或作者群的研究动向。这对指导文献收藏有重大意义。 习 题 什么是文摘?文摘的结构是什么?如何编写文摘? 什么是综述?综述的特点有哪些? 什么是机读目录?它有什么作用? 索引的结构是什么?索引与目录有何关系? 什么是引文索引? 第 57 页
第4章 信息组织技术(二) 信息编码与代码 信息编码的概念与应用 信息编码是指用一个或一组按特定规则排列起来的符号来表达信息的过程,简言之就是用符号表达信息。它实质上包含两个环节,一是信息的代码化;二是代码的组织。信息的编码与信息的传播、存贮、检索密切相关,是信息组织的重要内容和形式。在信息传播过程中,人们常需要将常规的语言、文字、数字、图形等符号进行转换,即编码,使之按某种规则排列起来,从而使信息符号与信息传输通道相匹配,实现信息由信源经信道到达信宿的正常传播。信息编码通常又分为信源编码和信通编码,信源编码是把信源输出的连续或离散符号序列,用某个给定大字母表中的字母编成最佳的字母序列;所谓信道编码就是把信源编码后的字母序列转换成适于信道传输的最佳信号、以适应信息空间的传输和时间传输的需要。 在通讯领域,信息编码常见的有差值脉冲编码调制(PAM)和脉冲编码调制(PCM)。信息编码的优劣从质和量两个方面评价,概括起来有:(1)实现信源信息符号到信道信息符号的良好转换,(2)保证信息在信道中传输时具有较好的抗干扰能力。(3)能有效提高传输速度。 在信息组织工作中,信息编码的应用也相当广泛,由此产生的各种代码,如分类代码、商品代码、报刊代码等等,这些代码都大大提高了信息组织的效率。在信息组织中,信息编码应具有如下一些基本功能,(1)能简化信息表达,便于信息的识别、记忆、组织、传播、存贮和检索。语言文字是一个庞大的符号系统,用其表达、识别记忆信息一般要耗费大量时间,随着信息的激增,这一问题更显突出,为此,人们迫切需要设计各种代码,使信息变得更加简明、有序,易于记忆存贮和识别检索。(2)在要求保密的情况下,能弥补基本符号由于通信导致不易保密的缺陷。 代码 1.代码的概念 代码是符号的一种,它与语言文字、图形、数字符号一样,可以用来代表或描述特定的信息,它不是通常的符号,而是指那些为便于信息组织、传播、存贮检索和加工处理而设计的非常规的符号。古代的烽火、鼓声,近代的莫尔斯电码,以及如今到处使用的各种代码,如邮政编码、门牌号码、准考证号码、学生证号码、身份证号码、电话号码、银行帐号、密码、条形码、专利号码等。在网络社会中,每个人从某种意义上说就是许多代码的集合体,如上网账号、密码、电子邮件账号、电子支付所用的银行帐号、聊天代码等等。 2.代码的功能 (1) 代码能够简明、精确地描述信息。代码设计严谨,代码与所代表的对象具有一一对应关系,避免了语言文字符号中的同形异义,同义多形的现象。如姓名可重复,但身份证号码不重复。因而在信息处理时,代码不需过多的解释和限定。 (2)代码可以反映信息的类别特征,因为,通常代码设计都是先按对象分类,再按类别设计专门的代码。如索书号、国别码、国民经济行业与职业代码、计算机域名和IP地址等。 第 58 页
(3)代码有利于信息组织,代码可以作为信息组织的依据,当我们将大量随机信息用代码标识后,可以按照代码的某种序列排列信息记录、信息实体和信息概念的次序,使之成为有序集合。由于代码简明、清晰,用代码序列组织信息简便易行。 (4)代码可以服务于特殊的信息处理需求。 如密码可满足信息不扩散传播的需求,二进制码可满足计算机对文本和非文本信息的统一处理。IP地址可以用来标明网络上每一台主机。 3.代码的类型 由于代码的应用领域非常广泛,故代码的分类也比较多。 (1)按代码构成成分不同,代码可分为单纯代码和混合代码。 单纯代码是指只采用一种基本符号系统构造的代码,常见的有数字型代码、字母型代码、图形代码和色彩代码,典型例子如电话号码、文献类型的双字代码、条形码、红绿灯。 (2)按照代码组织功能不同,可以将其划分成排序码和无序码。 排序码指那些在标识信息的同时,还可以提供标识对象之间的排序依据的代码,其特征是:代码配置有规律可循,次序分明,标识和组织信息的功能都比较强,因而实用的信息标识代码绝大数都是排序码。如:《国民经济行业分类和代码》(GB4754-84)、《国务院各部、委、局及其他机构名称代码》(GB4657-84) 无序码不注重显示或规定代码的排列顺序,只注重对代码标识对象的专门指代作,如 《健康状况代码》(GB4767-84)、《文化程度代码》(GB4658-84)、《集装箱运输状态代码》(GB4290-82)。 (3)按代码组合的方式不同,可分成层次码、特征组合码和镶嵌式组合码。 层级码是依次标识对象内在的层次或等级,将各个层次分别编码,然后按它们之间的逻辑关系组合为一体形成代码。通常层次越多,代码越长,典型的是《中国图书馆图书分类法》的代码。 特征组合码又称分面代码,它是由代表事物多方面特征的单元代码,按照表达特定标识对象的需要任意构成的代码。特征组合码突破传统的层级码的固定层次列举模式,着眼于适应编码对象的复杂性和全面表达多种特征的需求,对推动现代信息组织和加工技术的发展具有重要作用。特征组合码在反映对象的能力、变更代码、设计与操作上都具有较大的优越性。 镶嵌式组合码是一种比较独特的信息标识码,它由相互独立的两部分组成,总码位固定,但每一部分都可以变化,这种代码节约码位便于存贮,但编制复杂,一旦有代码溢出,整个结构便遭到破坏。国际标准书号(ISBN)即是这种镶嵌式代码,其总体结构是:ISBN码长为10位,其中,组号代表该书出版者的目录、地理区域、语种或其他分组特征,组号由国际标准书号中心分配,中国为一位数“7”。出版者号代表组区内的具体出版者,它其所隶属的国家或地区的标准书号中心分配。我国的出版者号由中国ISBN中心分配,该号分五个档次,长度为2mm位。由于码长固定,所以出版者号越少,可以出版的图书就越多,检验位是用来检验前9位代码是否正确,计算方法是,用10,9,8,7,6,5,4,3,2分别乘以ISBN的前9位数字,所得乘积除以11,所得余数即为校验码,如余数为10,用“×”表示,如为11,用“0”表示。 如《国际经济学》一书的ISBN号为: ISBN 7—300—02904—3/F·892 其含义是:组号—出版者号—书序号—校验号/分类号。 (4)按代码的主要用途,可以区分为信息识别组织代码和信息传输/交换代码。 信息识别组织代码主要指那些为了简化信息揭示符号,使信息对象组织排列成有序状态而设计的代码,这种代码历史悠久,可供人和计算机识别。信息传输/交换代码主要是指那些便于用机器进行信息处理和信息传播而设计的代码,如BCD码、Big5码、ASCⅡ码、程 第 59 页
序语言代码等。 4.信息代码的设计 信息代码的设计首先要确定代码符号系统以及码长,不同代码系统具有不同的代码基数,代码基数与码长的关系可用公式C=Sn描叙,C为可产生的代码数量,S为所用符号的基数,n为代码的位数。其次要考虑的问题是码元及位置确定。码元的选择和码元的位置的确定是编码方案的核心内容,它决定了每一个代码的含义。最后还应注意代码设计要标准化、系统化、实用化,使代码简明、有效地描述信息对象,便于信息组织顺利进行。 例如:为时间概念设计代码,或者为地区概念设计代码,然后按照代码的符号顺序排列。我们可以把“古代”用代码2表示,“中世纪”用代码3表示,“近代”用代码4表示,“现代”用代码5表示。这样,就可以直接按照2,3,4,5的次序组织有关的信息。有关地区概念的编码,目前已有多项标准代码。我们可以根据《世界各国和地区名称代码》(GB2659——86)的规定,给出日本的代码392,中国的代码156,英国的代码826,美国的代码840,然后,按照升值顺序排列有关的信息。即:156,392,826,840。 条形码 条形码是由一组粗细不一、相互平行的黑白条符组成并按一定编码规则组织起来,用来表示字母、数字、甚至汉字等信息。由于黑白条符对光的反射率不同,用光扫描器扫描条形码时,反射率不同的黑白条符转化成高低不同的电信号、据此,计算机读入了有关条码信息。 图 条形码示意图 1.条形码发展概论 条形码最早出现在20世纪40年代,1949年美国的N·J兰达发明了条码,并申请了专利。1960年,美国的斯万尼亚发明了铁路车厢标识用的条码,70年年代初在美国铁路车辆上获得推广。1973年,美国统一编码协会(Uniform Code Council,即UCC)从若干条形码备选案中,选定了IBM公司方案并加以改进,建立了通用产品代码UPC(Universal Product Code)作为美国统一的产品条形码,并在食品零售业上应用。从此,条形码开始进入实际应用阶段。在UPC的影响下,1973年,欧洲12国家的生产厂家和销售商举行代表大会,组建了“特别委员会”(Ad Hoe Council)。经过几年努力,在吸收UPC经验的基础上,开发了与之兼容的欧洲物品编码系统,同年即1977年2月3日,上述12个国家代表正式成立了欧洲物品编码协会(European Article Numbering Association简称EAN),1981年改名为国际物品编码协会INA,由于习惯也称之为EAN。EAN的建立有力地推动了条形码技术的研究和应用。目前,国际物品编码的成员超过47个。我国于1988年经国务院批准成立了“中国物品编码中心”,由国家技术监督局统一领导。目前,国际上流行条形码类型主要有UPC码、EAN码、39码,另外还有交叉25码、库德巴(Codabar)码、129码、93码、49码等不同类型的码制。条形码类型不同,使用的符号标准也不一样。 2.条形码技术的特点 1)信息输入速度快 条形码输入的速度是键盘输入的5倍,能实现“即时数据输入”,因而在大规模商品、物流的管理中发挥重要作用。有人建议,我国现有高速公路的收费系统,不仅阻碍交通,而且会造成能源浪费,所以应从人工操作转向自动收费,方法是所有汽车均刷上条形码,汽车在行驶时,安装在收费站的条形码阅读器立即读出数据,然后通过全国联网的支付系统支付。 第 60 页
2)信息输入准确性高 条形码输入的差错率仅为、甚至低于百万分之一,而键盘输入的典型差错率为1/300,而比较可靠的光学字符识别系统的典型差错率也达到万分之一。 3)信息的保持性高 条型码可方便地印贴在物品上,不论物品流动到何处,信息均不会丢失或混淆。 4)信息采集量大 一般激光扫描型条码阅读器一次可采集几十位字符的信息,而信息采集量的大小是整个信理管理系统水平的一个重要标志。 3.条形码设计的注意事项 目前已有多种条码投入使用,虽然它们在名称、应用场合、编码规划及构成上存在差异,但它们都是由符合特定编码规则的条与空组合而成的,因而在设计上存在共性。 1)条码字符集:字符集是指每种条码在设计时规定的代码可用的全部字符的集合。字符集中的字符总数与该码制的编码容量有关,字符集中的字符量大、种类多,就可以有更多的编码容量和表达能力。 2)条码符号的密度:条码符号的密度是指单位长度上所表示的条码字符的个数。构成条码各个单元的密度越小,条码符号的密度就越高,也就越节省印刷面积,同时扫描出错的可能性也就越大。 3)条码的结构:所谓条码的结构,是指每种条码的构成成分,它包括条码的基本结构和某种条码的具体结构两个方面。基本结构是指各种条码共有的结构形式。它们是空白区、起始符、终止符和数据符。这些符号都是用条码字符集中的字符为编码对象编制的代码。表达编码对象信息的是条码中的数据符,但不同的码制其具体结构和表达方式,含有一些变化,如EAN码增加了中间分隔符,并把数据符分成了左、右二个部分,还增加了校验符。如图所示: 左侧空白起始符 左侧数据区 中间分隔符 右侧分隔符 校验符 终止符 右侧空白区 区 图 条码基本结构 4)编码方法:所谓编码方法是指条码符号的编制规则及二进制逻辑表示的设置。编码方法分为宽度调节法和模块组配法二种。宽度调节法是利用条码符号黑白条符的宽度的差别,分别表示不同的二进制数字,多个条码符号的宽窄变化,就能表达条码字符集中的字符。模块组配法是把表达字符的条码符号进行了细致的分割,设置了“模块”这样一个基本单位(即宽度单位),条码的每个字符对应的条与空,均由若干模块组配而成,黑条符表示二进制数字1,白条符表示二进制数字0。一般来说一种条码所规定的模块宽度是固定的,不同的码制模块的宽度可以不同。 5)编码容量:编码容量是由编码方法决定的。它限制了条码字符集中所能全含的字符个数的最大值。采用宽度调节法编制,且只有两种单元的条码,其编码容量为Ckn ;对于模块组配法的条码,其编码容量为C2k-1n-1。 6)条码的连续性与非连续性:没有间隔符的称为连续条码,有间隔符的则称为非连续条码。 7)条码的长度:条码的长度是与条码可表示字符的个数的数量有关的概念。条码长度有固定长度和非固定长度两种控制方式。 8)条码识读的方向性:条码识读的方向分为单向识读与双向识读二种,多数条码都设计成双向可读的,即从左侧或右侧扫描,机器都可识别。这种特性的存在与扫描设备密切相关,一些条码的起始符号与终止符设计不同,无论从哪个方向扫描,译码器也会识别出正确 第 61 页
的代码顺序,例如:39条码、25条码、库德巴条码等。另外一些条码,像EAN码、UPC码,它们的起始符号和终止符是相同的,则无法利用它们判别方向,但是,可以通过条码数据符的特定组合来判定条码的方向。 9)条码的纠错能力:为了减少因印刷缺陷而导致的信息录入的差错,条码设计时应考虑使之具有纠错或检错能力。它可以通过二种方式实现,一是为条码设计校验位,如EAN码,二是将条码设计得具有自校验功能。 密码 1.密码的使用及其意义 密码在政治、经济、社会生活中都有广泛的应用。在古代,密码就开始被运用于各个领域,如我国古代的“瘦词”即隐语就是借助其它词语来间接叙述本意。《红楼梦》中一首诗“凡鸟偏从末世来,都知爱慕此生才;一从二令三人木,哭向金陵事更哀”隐喻王熙凤的命运;再如《水浒传》第六十四回“芦花丛里一扁舟,俊杰俄从此地游。义士若能知此理,反躬逃难可无忧”隐义“卢俊义反”。此外,一些帮会、黑社会组织等的黑话等都是特定的密码。 随着现代通信技术的发展,信息的交流和共享规模和范围空前,但为了保证信息传播的安全和权益的安全,密码被广泛使用。如银行存款密码、电话卡密码、计算机密码、以及网上PIN(Person Indentity Number),这些密码一旦遗忘、出现错误或被盗走,其损失往往非常巨大。如有些罪犯入侵银行网络系统,窃走用户密码,将大量奖金转至自己户头或海外,还有些黑客破坏网络的密码系统,侵入对方服务器或内部网,肆意删写文件,毁坏数据,这些给用户甚至国家安全都带来严重威胁。 2.密码的类型 密码的划分标准和方法很多,因此相应产生的密码类型也就更多。 1)替代密码 通讯时将明文中的文字或语句,依据双方首先约定的某套方案中规定使用的其他符号、图形、数字等来对应替代所得的密文。 ①单字替换密码 单字替换密码法很多,可以任意设计,如采用汉语拼音字码替换法可将明文“安徽”替换成密文0108 0858。 ②缀字替换密码 将明文分成若干段,以构成若干组群,再将这些组群按照一定方法分别替换成密文。③多表替换密码 多表替换密码是在单表替换密码的基础上发展而来的,它采用两个一大一小通讯圆盘,外圈是固定盘,里圈是可以转动的称动盘,里外两个圆盘靠周边处均等分26格,分别填空26个字母,外圈又称明文盘,里圈也称密文盘。 若选取动盘G对准A,则产生如下对应关系 明文盘:ABCDEFGHIJK…… 密文盘:g hikcmnopq r…… 则:明文为BOOK, 密文则为HUUQ 2)伪文密码 将明文依据特定方法掩蔽在伪文中,传递给对方。 ①漏格板密码 用一张切有不规则天窗的漏格板蒙在伪文上,其露出的文字连接起来就是全部的明文。 3)隐式密码 第 62 页
①隐写法 采用特殊的隐写墨水隐写明文,通讯对方需使用一定的化学方法使其现露出来方可辨认,或在公开书刊或器物等某处上,进行微雕或显微点书写,使第三者无法察觉。 ②暗语(暗号) 将通讯中重要内容对应地隐藏于日常生活的常用语中,尽管字面上是些极平常的通信内容,但实际上却传递给对方重要信息。 4)移置密码 移置密码是在通讯中将明文的单词、字母、语句等作为一个个基本单元,按照特定的原则、方法或规律进行移位、组配、分合、对换、旋转后产生的密码,如座标移置密码、几何图形移置密码、螺旋缠绕密码。 5)公开密钥密码和仿真密码 公开密钥密码是密钥是公开的,这种密码在电子商务的安全支付中有很大作用。 另外,在电子信息领域采用了更为先进更为复杂的加密技术,如运算加密法,换位加密法,选代加密法; 3.密码三要素 密码是相对明码而言的,通讯双方对于重要内容的明文进行加密,使其成为第三者无法解读的密文,密码通讯系统的三要素是:明文、密钥和密文。 1)明文 明文是通讯双方要传递信息的真实内容,它是容易被人所识别的,也是窃取者所要获取的真实的对象,正因如此,加密的目的就是在于保护明文,使其避免不必要的扩散或被窃取。 2)密钥 密钥(key)是指加密算法或变换规则,它是密码通讯的核心与关键,是明文与密文之间转换的中介,因而密钥必须绝对保密,密钥的质量会影响着加密的效果。 3)密文 密文是可以替代匹配明文在通讯过程中使第三者无法解读的一种特殊的语言、文字、符号或图像等。密文能隐蔽明文、不失真、利于对方解读但又不轻易被破译。加密的基本原理是:运用加密密钥对明文进行加密,使其转变成密文。 数据库 数据库及有关概念 1.数据管理 数据是描述事物的符号记录,数据本身不能完全表达内容,需要经过语义解释。数据管理就是对数据进行分类、组织、编码、存贮、检索和维护。 计算机描述数据经历了三个环节,即从现实世界转化为信息世界再转化为机器世界,其抽象过程如图所示。 信息组织 信息组织 现实世界——————信息世界——————机器世界 (报表、物体、人) (实体、属性、链) (字段、记录、文件、键) 第 63 页
图计算机描述数据三个环节 计算机数据管理的发展与硬件、软件的发展密切相关,其间大的经历了三个阶段,(1)50年代中期以前属人工管理阶段,计算机应用主要是科技计算,这时的数据管理是数据不保存、数据不共享、数据与程序混在一起,没有专用的软件对数据进行管理。(2) 文件组织阶段:50年代后期至60年代中期,计算机不仅用于科技计算,还大量用于管理。这时,数据管理虽然可以实现数据存贮和软件单独管理,但数据共享性差、数据独立性低,数据与程序依赖较强,所以它们仍属于传统的数据管理方法(traditional approach to data administration)。(3) 数据库系统阶段:60年代开始,数据有较多的独立性,数据库管理系统提供了数据的完整性、安全性、并发控制以及数据的恢复等数据控制功能。 2.数据库技术出现及意义 数据库技术是计算机软件的一个重要分支,产生于60年代末,1969年美国IBM公司推出了层次模型的IMS数据库系统。1969年10月,提出COBOL语言的美国CODASYL组织的数据库任务(DBTG)发表了网状数据库系统的标准文本,1970年美国的IBM公司的高级研究员E·F·Cod提出了关系模型。这三件事奠定了数据库系统的基础。 21世纪是知识经济时代,是建立在知识的生产、消费上一种新的经济形态,信息技术是支柱,因而组织、存贮和利用知识、信息的有力工具——数据库将得到广泛应用。如在因特网上,提供了诸如FTP之类的协议来帮助用户利用那些以文件形式保存和组织的信息,但随着网上信息的不断增多,以文件为单位来组织、传输信息也可能会使网络的负荷越来越大,而且当信息结构复杂时,对文件系统也难以实现有效的控制和管理,从目前WWW网页的增长的速度之快几乎超过人们的控制能力就足以说明这个问题。因此,从长远来看,文件只是网络信息组织的辅助形式。人们研究开发了许多网上搜索引擎,自动收集遍布世界各个角落的服务器上的WEB页,这其中就用到数据库系统的数据管理方法即数据库法(database approach)。在信息数字化、知识经济化、决策科学化、管理现代化、资源网络化的数字经济时代,数据库是使用相当普遍的信息组织方式。 毫无疑问,数据是对任何组织来说,都是一种最重要的资源。没有数据,不具备处理数据的能力,组织将无法生存下去。因为它将不能支付职员的工资、寄发各种帐单、订购新货物、管理客户数据和提供产品的售后服务,更不能帮助管理人员进行决策、提高企业的竞争能力。在现代组织内,数据库技术是其各种管理信息系统、决策支持系统、专家系统的基础,是企业信息化和社会信息化的前提。 3.数据库及数据模型 数据库(Database,DB)是存储在一起的相关数据的集合。DB能为各种用户共享,并且有最小沉余度,数据间联系密切。一个数据库的信息通常组织和存储在表(table)中,在表中,描述对象的项目称为数据项(又称字段),所有数据项组成一条记录,若干同类记录构成表文件,若干个表和它们之间的关系构成数据库文件。数据库上相应的操作和管理数据库的软件,即为一个数据库管理系统(DBMS)。 数据库就是以一定的组织方式存储在一起的可共享的相关数据的集合,它具有较小的冗余度、较高的数据独立性和易扩充性,它可以实现较好的数据安全性、完整性、和并发操作等控制。数据库中的数据按一定的数据模型组织起来的。数据模型是建立数据库的基础,它能够对系统的静态特性、动态特性、和完整性约束性条件进行精确描述,所以它由三个要素:数据结构、数据操作和完整性约束组成。常用的数据模型有层次模型、网络模型和关系模型三种。层次模型是以层次数据模型为基础建立起来的,其核心是以记录为结点的有向树或森林。它的特点是有且只有一个结点无双亲结点,其他结点有且只有一个双亲。在层次模型中,任何一个给定的记录值只有按其路径查看时,才能显示出它的全部意义,没有一个子女记录值能够脱离双亲记录值而存在。网络模型又称为丛结构,它与前者的主要区别在于可以有一 第 64 页
个以上的结点无双亲,至少有一个结点有多于一个双亲,两个结点之间可以有两种或多种联系。在关系模型中,人们可把逻辑结构看成是一个二维表,这个表就称为关系。实体及其联系均通过关系来描述,每一个关系为一个二维表,相当于一个文件,表中的每一行对应一个记录,每一列表示一个数据项。一个关系数据库中可以包含一个或多个关系,由于它比较简单、能够近似地描述客观世界,所以得到了广泛地应用,现在大多数地数据库都是关系数据库。 4.数据库的结构 在任何数据库系统中,都要考虑这样一些问题:1)内容(content),即要以何种成本、收集那些数据?2)存取(access),也就是在什么时候向那些用户提供那些信息?3)物理组织(physical organization),就是要确定数据存放的物理位置;4)逻辑结构(logic structure),即怎样安排数据以使它能够为给定的用户所理解。在数据库系统中,数据是经过组织的有一定的结构形式。从用户地角度看,数据库系统包括:单用户结构、主从式结构、分布式结构和客户机/服务器结构;从数据库管理系统地角度看,一个完整的数据库通常有三级结构,即物理级、概念级和用户级。物理级数据库对应于内模式,也称为存储模式。它包括数据库的全部存储数据,是数据库在介质上的物理存储位置。数据要经过组织以文件、记录数据项等形式,按照一定的方法存放到计算机的内、外存储介质上。对一个数据库系统来说,实际存放的只是物理级数据库,它是数据访问的基础。概念数据库对应于概念模式,也称模式,是对数据库整体的逻辑描述,它是数据库管理员眼中的数据库,与数据的物理存放位置无关。因此,概念数据库只是物理数据库的一种逻辑描述。用户数据库对应于外模式,是用户看到并获取、使用的那部分数据的逻辑结构,是用户与数据库的接口。用户可用数据库查询语言或应用程序去操作数据库中他能使用的那一部分数据,这部分数据称为用户子模式。一个数据库只有一个存贮模式、一个概念模式,但可有多个用户模式,这为数据的安全共享提供了可能。 5.数据库管理系统 数据库管理系统是在数据模型的基础发展起来的一系列专门用于描述、建立和管理数据库的专用软件。它通常由数据库语言、数据库管理程序和数据库使用程序三部分构成。数据库语言主要用于建立数据库、操作数据库和对数据库进行维护。数据库管理程序是对数据库的运行进行管理、调度和控制的例行程序。数据库使用程序是对数据进行维护并使其处于运行状态而使用的各种各样的数据库服务程序。 数据库管理系统的功能因系统不同而有所差异,一般包括:1)定义数据库,它又可分为概念模式、内模式、外模式定义和保密定义、数据格式定义等;2)装入数据库,即在定义基础上把实际数据存储到物理设备上;3)操作数据库,接收、分析和执行用户提出的访问数据库的各种要求,完成对数据库的检索、插入、删改和修正等操作;4)管理和控制数据库,完成对数据库的安全性、报名性和完整性的控制;5)维护数据库,完成数据更新、数据库再组织、数据库结构维护、数据库恢复和性能监视等操作;6)数据通信,负责处理数据的传输和流动,具备与操作系统的联机处理、分时系统和远程作业输入的相应接口通信等 数据库系统的设计 1.系统开发方法 系统开发方法是指人们在从事系统分析与设计时所普遍遵循的原则、方法和指导思想,它是系统开发认知体系在分析设计问题上的体现。下面是几种常见的方法: 1)自顶向下(top-down)的方法,其做法是,首先将整个系统做结构化分析,然后从高层到低层、从整体到局部、从宏观到微观进行分析与设计。 第 65 页
2)生命周期法(life cycle),其基本思想是将整个系统的开发过程划为系统规划、系统分析、系统设计、系统实施、系统维护五个阶段十几个步骤,不断循环。 3)需求分析法(requirement analysis),是通过调查、分析用户的信息需求来开发系统的一种方法。需求分析方法有Rockark的关键成功因子法(CSFs, critical success factors)和IBM的基于全面需求分析的企业系统规划法(BSP, business system planning)。 4)原型法(prototyping)其做法是,借助自动化程序生成工具和应用系统开发工具,快速模拟出一个原型系统,然后根据用户的要求反复修改,直至满意。 5)OO法,它是80年代中后期在面向对象程序语言的基础上发展起来的一种新的系统开发方法。所有的工作围绕对象而展开,在分析中抽象地确定对象的属性和操作等,据此开发系统。 2.数据库系统设计步骤 现在,数据库已用于各类系统,如办公系统、管理信息系统、决策支持系统、计算机检索系统。实际上,数据库系统已成为现代信息系统的基础与核心,数据库系统设计的好坏直接影响到整个系统的效率和质量。数据库系统设计是一个复杂的工程,涉及到计算机硬件、软件、信息源、人——机信息交换、信息组织、系统分析与设计等各方面,因而需要统一管理,多方协作。数据库系统的设计主要包括以下五个阶段。 1) 需求调查 不论是自主开发还是定制开发,在数据库系统开发之前都应充分调查用户的需求,它包括市场调研和需求调研。主要调查目前信息管理的状况,如信息加工、存贮、检索的工作流程及效能,以及现有的组织结构的职能和业务关系等,还要调查市场需求,用户对该数据库的期望等,并以此值为立项的依据。 2) 系统分析与概念结构设计 要设计一个有效的数据库必须要用系统工程的观点和方法处理问题。在第一阶段的基础上,与用户进行反复讨论,确定数据库系统所要进行的数据处理范围,确定人工完成的工作,以及人机接口的界面,系统功能与效能,最终得到业务信息流程图。 概念结构所涉及到的数据是独立于硬件和软件系统的,它的目的是以用户可以理解的形式,来表示信息的流程,从而可以和不注重计算机的用户交换意见。在概念结构设计阶段就是将错综复杂的现实世界用特定的概念描述出来,这里有许多方法,最著名的是ER方法。 3)逻辑结构设计与物理结构设计 逻辑结构设计的任务是将概念结构转换成DBMS能处理的数据模型,即网状层次或关系模型。 对于给定的基本数据模型选取一个最适合应用环境的物理结构的过程,称为物理结构设计。数据的物理结构主要指数据库的存储记录格式、存储记录安排和存取方法,这些都有赖于具体使用的系统。 4)数据库的实现与维护 数据库实现是根据物理设计的结果产生一个具体的数据库和它的应用程序,并将原始数据装入数据库。在装入数据时,要充分注意到数据的采集、组织、录入、校对等工作严格有序,并按标准化的要求进行数据库设计完成之后,还要经常收集和摘要系统运行的数据。在运行中,必须保持数据库的完整性,必须有效地处理数据库的故障和数据库的恢复。总之,数据库的设计和开发是一项复杂的工程,必须充分考虑到各种要求,如软、硬件要求,人、财、物的要求等,产品的实用性与必要性,数据库投入使用的收益等。另外,数据库的设计和开发还应走产业化、集团化、规模化、标准化、国际化的发展道路,使数据库开发迈上更高的阶梯。 第 66 页
常用的数据库管理系统(DBMS) 在20世纪60年代,计算机应用领域从科学计算逐步转向事务处理,导致了数据库技术的产生和发展;在70年代以后,层次数据库和网状数据库得到了广泛应用;70年代后期到80年代,关系数据库逐步从原型系统走向社会,由于关系数据模型简单性和数据库语言的简练,易用,因而关系数据库得到了迅速推广,虽然90年代出现了面向对象的数据库,但目前关系型数据库仍站主流,大部分关系数据库通过升级,也都具备了面向对象的数据库的一些功能。关系型数据库主要有: 1.微机型DBMS 微机型DBMS主要指DBASE、FoxBASE、Foxpro以及同它们存储结构兼容的微机关系DBMS。1978年美国Ashton-Tata公司在Apple微机上实现了DBASEⅡ。80年代初,发展到DBASEⅢ,其存储结构有了较大的改动。后来IBM PC上移植了DBASEⅢ,使其迅速推广,被誉为“大众化数据库”,后来又有DBASEⅢ—plus,DBASEⅣ等版本。1987年美国Fox软件公司推出了FoxBASE产品,它与DBASE兼容。90年代Fox又推出新软件FoxPro,取代FoxBASE。1992年6月,微软公司推出,随后亦出现。1995年6月,微软公司推出,它面向对象编程,有可视工具,并支持客户机/服务器(C/S)系统结构。1998年8月26日,微软公司推出了Visual for windows,其在功能、性能、巩固性和实用性方面都有了很大提高。该系统的特点和使用方法请参考有关书籍。 2.系统型DBMS 像Oracle,Informix,DB2,Sybase,Ingress等DBMS可在大、中、小微机上运行,功能比较完善,能适合于各种复杂应用和各种规模的数据库应用系统。 1) Oracle 系统 美国ORACLE公司在1979年推出以SQL为基础的商品化关系型DBMS,名为Oracle。目前使用的第8版Oracle主要有以下特点:①硬件环境独立性;②操作系统独立性;③SQL兼容性;④较强的可移植性;⑤提供一体化的数据字典;⑥提供丰富的工具;⑦提供分布式处理功能;⑧开放性。 Oracle系统是由一个RDBMS与一个CDE(Cooperation Development Environment)组成的软件群。 2) Sybase系统 Sybase系统是美国Sybase公司1985年开始推出了以SQL为基础的RDBMS,现已有Sybase 版。Sybase适用于各种开操作系统,它采用客户机/服务器的体系结构,实现开放的分布式的数据库管理方式。软件包括客户软件、服务器软件和客户机/服务器接口软件。 SQL语言介绍 SQL(Structured Query Language,结构化查询语言)是用于对存放在计算机中一种特定类型的数据库——关系数据库中的数据进行组织、管理和检索的一种工具。而控制这种数据库的计算机程序就是我们常说的 DBMS—— 数据库管理系统。譬如:SQL Server、Oracle、Sybase、DB2 等等。当用户想要检索数据库中的数据时,就通过 SQL 语言发出请求,接着 DBMS 对该 SQL 请求进行处理并检索所要求的数据,最后将其返回给用户,此过程被称作为数据库查询。 SQL 并不是象 C、COBOL 和 Fortran 语言那样的完整的计算机语言。SQL 没有用于条件测试的IF语句,也没有用于程序分支的Go to语句以及循环语句For或Do。确切讲, 第 67 页
SQL 是一种数据库子语言,SQL 语句可以被嵌入到另一种语言中,从而使其具有数据库存取功能。SQL 也非严格的结构化语言,它的句法更接近英语语句,因此易于理解,大多数SQL 语句都是直述其意,读起来就象自然语言一样明了。SQL 还是一种交互式查询语言,允许用户直接查询存储数据,利用这一交互特性,用户可以在很短的时间内回答相当复杂的问题,而同样问题若让程序员编写相应的报表程序则可能要用几个星期甚至更长时间。下面简单介绍一下几个常用的SQL语句。 1.Select语句 查询是 SQL 语言的核心,而用于表达 SQL 查询的 SELECT 语句则是功能最强也是最为复杂的 SQL语句,它从数据库中检索数据、并将查询结果提供给用户。在本文中我们将建立一个名为 student 的简单数据库,该库中存放了一个叫score 的成绩记录表,如下表所示 : 姓名 学号 籍贯 性别 计算机原理 英语 樊刚 20022500 上海 男 80 90 吴冠军 20023000 北京 男 90 99 雷鸣 20022000 四川 男 81 91 雪儿 20022500 广州 女 98 86 顾帆 20022600 大连 男 85 98 阿卓 20022000 天津 女 82 84 郭英 20020088 合肥 女 95 88 表 student 简单数据库的score成绩记录表 在该表中有6列即6个字段 :姓名、籍贯、性别、学号、计算机原理、英语。 接下来,我们做一个相对复杂的查询,列出英语优秀的所有女生的姓名、学号、英语成绩,并且按英语成绩排序。 Select 姓名,学号,英语 from student where 英语>85 And 性别 ="女" order by 英语 结果如下 : 姓名 学号 性别 英语 雪儿 20022500 女 86 郭英 20020088 女 88 表 一个SQL语句检索结果 SELECT 语句的完整格式包括六个子句,其中 SELECT 和 FROM 子句是必须的,其它子句可以任选,每个子句的功能如下: 1.Select 子句列出所有要求 SELECT 语句检索的数据项。它放在 SELECT语句开始处,指定此查询要检索的数据项。这些数据项通常用选择表表示,即一组用“,”隔开的选择项。按照从左到右的顺序,每个选择项产生的一个列的查询结果,一个选择项可能是以下项目: (1)列名:标识 FROM 子句指定表中的列。如果列名作为选择项,则 SQL 直接从数据库表中每行取出该列的值,再将其放在查询结果的相应行中。 (2)常数:指定在查询结果的每行中都放上该值。 (3)SQL 表达式:说明必须将要放入查询结果中的值按表达式的规定进行计算。 2.From 子句列出包含所要查询数据的表,它由关键字 FROM 后跟一组用逗号分开的表名组成。每个表明都代表一个包括该查询要检索数据的表。这些表称为此 SQL 语句的表源,因为查询结果都源于它们。 3.Where 子句告诉 SQL 只查询某些行中的数据,这些行用搜索条件描述。 4.Group By 子句指定汇总查询,即不是对每行产生一个查询结果,而是将相似的行进行分组,再对每组产生一个汇总结果。 第 68 页
5.Having 子句告诉 SQL 只产生有 Group By 得到的某些组的结果,和 Where 子句一样,所需要的组也用一个搜索条件指定。 6.Order By 子句将查询结果按一列或多列中的数据排序。如果省略此子句,则查询结果将是无序的。 例: a)select * from publishers where name like 'A' 含义:将表 publishers 中所有姓名中有字母 A 的记录查询出来 b)select * from titles where Year_Published > = 2001 含义:将表 titles 中所有发表年份大于或等于 2001 年的记录查询出来 c)select * from publishers where amount>10000 and sex='male' 含义:将表 publishers 中所有数量大于 10000 且性别为男的记录查询出来 d)select * from publishers where state< > 'NY' 含义:将表 publishers 中所有所在城市不为纽约的记录查询出来。 2.Insert、Delete、Update语句 SQL 是一种完备的数据处理语言,不仅用于数据库查询,而且用于数据库中的数据修改和更新,与支持 SQL 查询的 Select 语句的复杂性相比较,更改数据库内容的 SQL 语句就格外简单。然而对于一个 DBMS 来说,数据更新所造成的风险大大超出了数据查询。数据库管理系统必须在更改期内保护所存储的数据的一致性,确保有效的数据进入数据库,数据库必须保持一致性,DBMS 还必须协调多用户的并行更新,以确保用户和他们的更改不至于影响其他用户的作业。 用于修改数据库内容的 SQL 语句主要有以下三个: 1.Insert,向一个表中加入新的数据行 2.Delete,从一个表中删除数据行 3.Update,更改数据库中已经存在的数据 首先我们来看看 Insert 的用法: 标准语法: INSERT INTO table_name(col1, col2...)VALUES(value1, value2...) 下例要将樊刚作为一个新的销售员加入表 Salesreps 中 Insert Into Salesreps (name,num,sales,hire_date,income) values ('fangang',9,10000,'23-Feb-99',2000) 用来创建和修改数据库结构的一种语句,包括 Create 和 Drop语句。 3.Create 语句 标准语法: CREATE TABLE table_name ( field1 datatype [ NOT NULL ],field2 datatype [ NOT NULL ],field3 datatype [ NOT NULL ]...) 如: CREATE TABLE BILLS ( NAME CHAR(30),MOUNT NUMBER, CCOUNT_ID NUMBER) 尽管 Create Table 比前面介绍的语句难理解一些,但仍然很直观。它将 bills 赋予一个新表,并指定表中三列的名称和数据类型。表被建立后我们就可以添入数据了。如: Insert into bills(name,amout,account_id) values('gates',100,1) 4.Drop 语句 如果,你觉得不再需要保存产品信息,则可用 Drop table 语句将该表及其所包含的所有数据从数据库中删除掉。 第 69 页
标准语法: DROP TABLE table_name 数据库建设中的信息组织问题 综观国内外数据库建设的经验,信息组织工作是数据库建设中重要的基础工作,也是影响数据库质量的重要因素。计算机只是一种信息处理工具,虽然它可以对数据的合法性进行一些简单的预处理,但它仍然离不开人的干预和管理,人们必须保证数据输入的语法正确、形式正确,还要对装入的数据进行选择、揭示,组织和编码。如果对数据的这些预处理工作没有做好,就会“录进机器里的是垃圾,输出的仍就是垃圾”的情况。如我国90年代前的国产数据库,质量存在或多或少的问题,有的错误记录的总量竞点总记录的%这些错误出现的主要原因有: l 人为输入错误,没有对输入的数据进行质量检查而造成错误记录的出现,这个占的比例还是比较大的。 l 由于记录符号及格式方面的非规范化导致的。 l 数据采集滞后、失真导致的。 l 数据标引方面的问题导致的。如错标漏标、标引深度不统一等等。因此,在数据库建设中就严格加强标准化和规范化控制,充分做好信息的组织工作。 中国高等院校学报论文文摘(CUJA)数据库在建库时加强信息组织工作的典型范例,该数据库的研制思想是“统一规范—分工制表—集中处理”。虽然学报文摘由全国300所高校学报编辑部加工而成,但由于采用了一系列质量控制手段(如深层控制、标引控制、格式控制等),有效地实现了数据的准确、一致、完整、可靠、规范等质量目标。总之,数据的建设要以高质量的信息组织工作为基础,否则,建库时的人、财、物的耗费都会付诸东流。 数据仓库 随着社会竞争的加剧,从大量数据中查询和提取用于决策的信息就显得越来越重要。这种需求既要求联机服务,又涉及大量用于决策的数据,而传统的数据库系统尚无法满足这种需求,这体现在:(1)历史数据量很大(2)辅助决策信息涉及许多部门的数据,而不同系统的数据难以集成,(3)由于访问数据的能力不足,它对大量数据的访问性能明显下降。针对这种情况,近年来迅速发展起来一种新的组织、管理、存贮数据的新技术——数据仓库(Data Warehouse,简称DW)技术。它将决策分析所必需的大量分散的历史数据和详细的操作数据,经过处理转换成集中统一,随时可用的信息。 数据仓库技术的产生和发展 1.数据仓库技术的起源 70年代出现并广泛应用的关系型数据库技术为大量数据和信息的组织和管理提供了有效工具。然而从80年代中期开始,由于市场竞争和信息社会需求的发展,人们迫切需要信息系统支持决策,支持突发查询的能力,即对任何业务在任何时间提出解决任何问题的能力。这种需求促使在80年代中后期出了数据仓库思想的萌芽。90年代初,W·H·Inmon在其里程碑式的著作《建立数据仓库》中提出了“数据仓库”的概念,从此数据仓库的研究和应用得到了广泛关注。 2.数据仓库的定义 第 70 页
目前数据仓库还没有统一定义。被誉为数据仓库之父,现任Pine Cone System公司总载的W·H·Inmon在《建立数据仓库》一书中对数据仓库做了这样定义:数据仓库是支持决策过程的、面向主题的、集成化的、稳定的、不同时间的数据集合。这个定义体现了数据仓库作为信息组织技术和工具的鲜明特征,如主题性、有序性等。 3.数据仓库的特征 (1)数据量巨大。数据仓库的数据量很大,一般为10GB左右,它是一般数据库(100MB)数据量的100倍。 (2)数据按主题归类。传统数据库面向应用,数据仓库中的数据面向主题,每一个主题对应一个客观的分析领域。 (3)数据具有集成性和有序性。数据仓库的集成特性是指在数据进入数据仓库之前,必须经过数据的加工和集成——即信息组织,这是建立数据仓库的关键步骤。首先要统一原始数据中的矛盾之外,其次运用主题结构将原始数据按主题标引归类,做成面向主题的数据结构。 (4)数据具有稳定性。数据仓库的稳定性是指数据仓库反映的是历史数据的内容,并不是日常事务处理产生的最新的专有的数据,这些数据来源于其它数据库,经组织集成进入数据仓库后很少或根本不加改动。 (5)数据具有一定的时限。一般要求数据时限为5年至10年。数据仓库的建立并不是要取代数据库,而是要建立一个在较全面完善的信息应用的基础之上、用于支持高层决策分析的系统。 4.数据仓库的发展方向 数据仓库技术市场正以迅猛势头向前发展。一方面数据仓库市场需求量越来越大,每年约以400%的速度扩张;另一方面,数据仓库产品越来越成熟,数据仓库的厂家越来越多,今后几年数据仓库技术将会向以下方向发展: l 并行化和可扩展性。 l 集中化,数据仓库项目将越来越大,GartnerGronp预测;到2000年,约有70%的集中化信息管理将依赖于数据仓库市场。 l 数据仓库与Internet/Intranet的集成。 l 数据开采工具的成熟和广泛使用。 l 向通用数据库发展,支持面向对象的能力。 l 数据仓库打包应用。 数据仓库的系统结构 1.数据仓库的逻辑结构和物理结构 数据仓库是存储数据的一种组织形式,它从传统数据库中获得原始数据,先按辅助决策的主题要求形成当前的基本数据层,再按辅助决策的要求形成综合数据层,随着时间的推移,当前数据层转为历史数据层。可见,数据仓库中逻辑结构数据由3层到4层数据组成,它们均由元数据(Meta Data)组织而成。数据仓库中数据的物理存储形式有多维数据库存储方式,即虚拟存储方式和基于关系数据表的存储方式二种。 2.数据仓库系统 数据仓库系统(DWS)由数据仓库、仓库管理和分析工具3部分组成。 1) 源数据。数据仓库的数据来源于多个数据源,包括内容数据和外部数据。 2) 仓库管理。在确定数据仓库信息需求后,首先进行数据建模,然后确定从源数据仓库的数据抽取、清理和转换过程,最后划分维数及确定数据仓库的物理存储结构。之数据是数据仓库的核心,它用于存储数据模型和定义数据结构,转换规划、仓库结构、控制信息等。 第 71 页
仓库管理包括对数据的安全、归档、备份、维护、恢复等工作,这些工作需要利用数据库管理系统(DBMS)的功能。 3) 分析工具。用于完成实际决策问题所需的各种查询工具、多维数据的OLAP查询分析工具、数据开采DM工具和DSS的分析预测工具等,它们各自的测重点不同,适用的范围和针对的用户也不相同。具备了以上这些工具的数据仓库系统,才能真正高效地利用数据仓库中蕴藏的大量宝贵的信息,以实现决策支持系统的各种要求。 3.数据仓库应用的C/S结构形式 数据仓库应用是一个典型的C/S结构,其客户端的工作包括客户交互、格式化查询及结果和报表生成等。服务器端完成各种辅助决策的SQL查询、复杂的计算和各类综合功能等。现在,一种越来越普遍的形式是三层结构,即在客户与服务器之间增一个多维数据分析服务器。OLAP服务器能强化和规范支持的服务工作,集中和简化原客户端及DW服务器的部分工作,降低系统数据传输量,因此工作效率更高。 4.数据集市 数据集市(Data Mart)是一种规模小,面向市门特定应用的部门级数据仓库。它是中央数据仓库的一个子集,只包含一个或几个主题;数据集市由业务部门具体设计、开发、管理和维护;它具有紧密集成的工具集,能提供更详细的预先存在的数据仓库的摘要子集,并可升级到完整的数据仓库。目前,全世界对数据仓库总投资在一半以上均集中在数据集市上,它提供了一种分析数据的廉价途径。 数据仓库的开发工具 数据仓库的巨大市场,使得数据仓库产品不断出现,其中Busimam objects,Sybase和Platinum technology等解决方案。 1.Businam objects解决方案 Businam objects是集查询、报表和OLAP技术为一体的智能决策支持系统,它使用独特的“语义层”技术和“动态微立方”技术来表示数据库中的多维数据,具有较强的查询和报表功能,提供挖掘(Drill)等多维分析技术,支持多种平台和多种数据库,同时还支持Internet/Intranet,可以通过WWW进行查询、报表和分析决策。 2.Sybase解决方案 Sybase的数据仓库的解决方案称为Quickstart Data Mart,它能同时处理几十个即时查询,其Bit—Wise技术和垂直数据存储技术使系统只访问特定的少量数据,使得查询速度比传统的关系型数据库管理系统快100倍。 超文本 超文本 起源与超文本相关的术语最早可追溯到1704年数学家F·Klein 提出的“hyperspace”。1945年,美国科学家V·Bush在《大西洋月刊》杂志上发表了一篇题为“As We May Think”的文章,在这篇文章中,Bush设想了一种他称之为“Memex”的专门存储户籍、档案和信件的机械,并可模仿人的联想记忆能力进行快速灵活的查询和检索。60年代,计算机科学家Ted Nelson提出了超文本(Hyper text)这一名词,进入70年代超文本研究稳步发展,1987年的专题会议hyper text’87将超文本的发展推向了一个高潮。同年,Apple公司首次推出 第 72 页
具有深远意义的HyperCard软件,标志着超文本从实际阶段走向市场。进入90年代,众多软件引入了超文本技术,风靡全球的Internet 也以此作为主要的信息组织和编排技术,推出了诸如HTML等标准化的超文体描述语言以及众多的超文本开发工具,标志着超文本技术走向成熟。 超文本的概念 从原理上讲,超文本技术在印刷型文献中早已使用,如文献中的脚注、页注、引文、参考文献等,这些信息与文本之间存在着一种文献信息网,但这种手工方式的“超文本”使用起来存在许多局限性。当计算机技术达到一定水平,人们在计算机上阅读、检索信息变得异常方便时,超文本技术获得了相当大的现实意义。 从技术角度看,超文本是收集、存储和浏览离散信息,以建立和表示信息之间关系的技术;从网络的拓朴性质上看,超文本是一个由若干个结点(node)及结点间的链构成的语义网络;从信息组织方法上看,超文本是运用超链接组织起来的信息。 总之,超文本(Hyper text)是一种新型的信息组技术,它以结点为单位,在结点与结点之间通过表示它们之间关系的链加以连接、构成表达特定内容的信息网络,它类似人类的联想思维方式,从而能更有效地表达和组织信息。超文本技术不仅可以采集组织文本信息,还可以组织如图形、图像、动画、声音、视频等信息等多媒体信息,所以有时也称之为超媒体,二者含义基本一致。 超文本的三要素 超文本是结点、链和网络三要素的组合,其结构如图示 图 超文本结构示意图 从图中看出,超文本是由若干内部互联的文本块组成,这些信息块可以是计算机的若干屏,也可以是若干窗口、文件或者甚至是一个单词,这样一个信息单元就称之为一个结点,每个结点都有指向其它结点或由其它结点指向该结点的指针,这个指针就是链,也称超级链或超级链接,链接着两个结点,它通常是有向的。我们将它分别称为去向链和归向链。当用户点击某一节点时,将激活去向链,从而达到迁移的目的。 1.结点(node) 结点是表达信息的基本单位,每个结点可表示文本信息和非文本信息。结点中所包含的是最小信息单位,依不同情况称“点”(Point)和“域”(field)显示节点中的信息内容,一般可采取两种方式:一种是依据结点的某种次序顺序显示,另一种是以窗口形式显示,这时结点和窗口是一一对应的。 2.链(link) 链是超文本中将节点联系起来的中介,是超文本信息组织的基础,没有链就没有超文本。由于超文本没有规定链的规范与形式,因此目前超文本系统的链的形式多种多样。 链的结构一般可分为三部分:链源、链宿及链的属性: 1) 链源 链源指结点信息迁移的原因,链源可以是热字、热区、图元、媒体对象或结点等。 2) 链宿: 第 73 页
链宿是链的目的所在,一般超文本链的链宿都是结点。 3) 链的属性 链的属性决定了链的类型,链的类型有: l 索引链:索引链实现结点中点、域之间的链接,通过索引链可实施对相关信息的查找及交叉参考,它起到检索和导航的作用。 l 结构链:结构链对层次性信息进行操作,即它所连接的是处于不同层次的父子结点,比如将一个结点中的某个点与另一个结点链接。这种链接的方法在超文网络中形成了树状子网。 l 隐形关键字链:隐形关键字链可用结点的标识或属性作为关键字,也可将链本身与作为关键字,以关键字访问结点可能有多个匹配。 3.网状 超文本中由结点和链构成的网络是一个有向图,这种有向图与人工智能中的语义网有相似之处。语义网是一种知识表示方法,其中结点表示概念,而结点之间的弧表示两个概念之间的关系。超文本中的结点可以看作是对单一概念或思想的表达,而结点之间的链则表示概念或思想之间的语义关系。从这个观点看,超文本也可以看作是一种知识组织和表达方法。与人工智能范畴的知识工程不同的是,后者致力于建立知识的表示,以便于机器推理,而超文本知识表达的目的是将各种思想、概念组合到一起便于浏览,而不考虑机器推理。网络的一部分称为子网,它是超文本中的一个结群,有时也把它称作宏结点。宏结点的概念十分有用,因为当超文本网络非常大时仅通过一个层次的超文本网络管理会很复杂,因此分层是简化网络拓朴结构的有效方法。 超文本的基本特征 1. 非线性组织结构 超文本是模拟人类联想式思维的一种信息组织和检索技术,结点与结点的组织并不是依照信息本来的逻辑顺序,而是一种离散的、非线性的顺序。 2.单元(或信息块)是超文本信息组织的对象 这些单元在不同的系统中分别称为结点(Nodes)、结点卡(node cards)、帧面(frames)或页(pages) 3.信息的层次性 信息单元之间用链(link)连接在一起,系统提供面向窗口或鼠标的用户界面跟踪链路,使用户在结点中航行(navigation)时不至迷失航向,体现了信息的层次关系。超文本信息是结构化的,信息单元之间体现了层次关系。 4.交互界友好 几乎所有的超文本系统都有良好的交互性和友好性,一般都采用多窗口、多媒体等技术向用户充分显示自身的组织特点、功能优势等;另外用户还可在信息单元上作注释(annotation)或更改、扩充已有的链路关系。 5. 具有检索(retrieval)功能。 超文本系统是目前最为直观、最为方便的检索系统,它的出现使非专业的用户也能轻松获取信息。 超文本的体系结构 在超文本和超媒体结构方面在较著名的模型有Campbell—Gooelman模型及Dexter模型。两个模型基本类似,它们将超文本体系分为三个层次(以Campbell—Gooelmen模型为例), 第 74 页
这三个层次分别为用户接口层、超文本抽象机层、数据库层。如图示: 用户接口层 超文本抽象机 数据库层 图 超文本体系示意图 数据库层与普通的数据库的概念区别不大,首先必须要解决超文本系统中信息量大及信息块的快速存取问题。一般用硬盘和光盘做外存储器。目前更重要的一个应用是把信息存放在远程服务器上。就数据库而言,超文本的结点和链只不过都是数据对象,如HyperCard的数据对象有单媒体对象、卡片、卡堆、文献卡堆、超文本文献,它们是一个逐级包含的关系。 卡堆 选择 卡 片 文献卡堆 超文本文献 组织 单媒体对象 图 HyperCard的数据对象及其关示意图 超文本抽象机层位于数据库层和用户接口层之间,这一层中要确定超文本系统中的结点和链的基本特性及维护它们之间的联系,同时要给定不同超文本系统之间相互传递的信息转换格式。超文本抽象机层实际上是超文本的概念模式,这是设计超文本系统的关键。 用户接口层是超文本系统直接面向用户的界面,包括用户可以使用的命令,抽象机层信息等。流行的接口风格用菜单选择方式、命令交互方式、图示引导方式、直观方式、混合方式。特别是图示引导方式为超文本系统的一个特色。它将抽象机层的结点和超级链连成网络用图显示出来,如导航图的使用。 超文本的技术实现 超文本技术是一项综合性的技术,涉及到数字处理技术、通讯技术、计算机图形技术、数据库技术、数据存储技术、计算机输入输出技术、人工智能的知识表达技术和传递激活技术等。其应用到的关键技术有: 1)数字处理技术,包括数模转换技术、音频、视频信息的编码和解码技术,音频、视频信息的压力缩和解压缩技术等 2)通讯技术,包括网络管理技术、高速网络技术协议、ISDN和B-ISDN技术、异种网络互联技术等。 3)多窗口技术,多窗口体系为超文本系统创造了灵活、友好的界面,形成超文本系统的一大特色。 4)数据库技术,超文本作为一种有效组织信息数据的结构,与数据库技术相连,实现信息的快速、有效的查询是其根本用途之一。很多数据库本身就提供有用非线性的超文本形式组织信息的手段,以实现数据库的联想功能。 5)数据存储技术,超文本系统需要寻求一种大容量、高速度的信息存贮技术,如CD-ROM)、WORM、可擦写光盘、DVD等,不过现在硬盘技术已经有很大进步,其容量正 第 75 页
在向以千G(1KG=1024G)为单位的容量发展。 6)输入输出技术,主要包括图像扫描技术、触摸屏技术、摄像技术、音像合成技术、彩色输出技术等。正是因为有了高速的图像、声音输入输出技术和设备,才能使超文本技术得到如此广泛的应用。 7)超文本系统的浏览、回溯等功能模拟了人脑的思维和记忆功能。对超文本信息的组织、表达、搜寻采用了人工智能的知识表达的传递激活技术。传递激活技术分两种类型,一种是约束性传递激活,一种是启发性传递激活。 约束性传递激活是在传递过程中为了不使这种激活扩展过大甚至传遍全网,设置了一些阈值以限制传递激活的范围,使激活链路在一定时机终止。对激活的约束可以是各种各样的。如通常存在着下列三种约束:(1)距离约束(Distance constraints),(2)扇出约束(Fanout constraints),(3)利用推理模式进行限制(Inference schema);启发性传递激活是指针对用户往往把需求描述得超出实际需要范围的心理,对语义网上专指的词进行启发式搜索(专指的词指邻节点少的索引词),并优先激活较专指的链和距离较短的路径。 超文本信息组织过程及工具 1.超文本信息的组织过程 超文本的信息组织主要包括:获取信息、分析理解信息对象与对象之间的关系,并利用这种关系组织成超文本,以及界面设计。 1) 获取任务信息 超文本信息来源可以是一切现存的信息渠道,如:各种已有的资料、文件、图表、音像等,或从现有的文本库或数据库中转换而来,还可以是与该领域专家交谈讨论的结果、作者的第一手资料。 2) 任务信息的理解和分析 组织超文本信息必须理解任务信息的内容、基本对象及对象之间的关系,然后利用这些关系设计系统的结点、链和整体结构。 3) 用户界面设计 用户界面设计必须强化多媒体效果,采用用户喜欢而又优美的导航系统,要有丰富而简练的导航和操作工具。 2.超文本开发工具 组织开发一个大型超文本系统一般都需通过开发工具来实现,组织开发的工具可以分为简单工具和专用工具。 1) 简单工具 简单工具包括文本编辑器、图形编辑工具、音频和视频编辑工具,其中文本编辑应能嵌入超文本指令(如Word97),能把标准的字体模式翻译成超文本系统能理解的符号、颜色;它能提供多任务的环境,能方便地进行文本格式转换。 2) 专用工具 普通工具用来组织创建超文本的内容,而专用工具则是用来组织结点,专用工具包括: ①结点和链的列表工具 超文本开展工具应能生成组成超文本的所有结点表和链表,一个好的结点能帮助读者确定在什么地方,什么时刻发生迁移。结点表还提供检测结点内容和链的精度的基础。 ②提供结点信息功能的工具 开发系统还应易于生成指定结点的名表、内容说明、链及索引项,开发者在系统设计时可以使用这些信息,在编辑和链接时也有参考价值。 ③注释结点的工具 第 76 页
开发系统允许开发者在结点处附加解释性的注释。这是程序和系统开发的必要工作和环节。 ④画简图工具 使用工具从画简图开始,搞清系统的定义,快速地逐步地进行调整。 ⑤分块工具 超文本开发的一个原则是每个结点的信息要短,内容一般不超过一屏或两屏。有人把很大的文本进行分块是很费时的,最好用一个专门用于分块的工具,利用它自动把源文件分解为较小的结点或许多单个的文件。 ⑥结点内部工具 用于结点内部的串扫描、索引、词频率分析及抽取关键字等。 ⑦外部设备和程序链接工具 多媒体开发经常要从多个存储设备中获取信息,如硬盘和CD-ROM、网络服务器等,此外开发出来的超文本系统应能进行直接操作、系统调用、与外部程序进行信息调换等。 虚拟现实 虚拟现实(Virtual Reality,简称为VR)就是利用计算机和其它的专用硬件和软件产生一种境界的仿真,参与者可以通过视觉、听觉和触觉等感觉与仿真的内容交互操作,达到一种“真实”的感觉,所以有人也称其为“灵境”。通过虚拟现实人们可以创造一种并不存在的人工世界,可以仿真一个学习场所,也可以仿真游戏或冒险行动,还可以仿真一个工作环境,这在电子商务、远程教育、远程医疗、飞行模拟训练、军事演习等场合有极其重要的用途。 虚拟现实系统的发展过程 虚拟现实研究涉及到如下几个方面:仿真(模拟)、计算机图形、人机接口、体视学(从三维观察物体)以及人造现实(artificial reality)。 Link飞行模拟器是虚拟现实的几个先驱中的一个。1892年,Edwin Link设计了一种竞赛乘坐器,它使得乘坐者有一种在飞机中飞行的感觉。20世纪60年代初期由Morton Heilig研制的sensiranma街道模拟器是虚拟现实的另一个先驱,它利用视觉、声音、运行、甚至味觉等使参与者就像乘坐摩托车通过Brooklyn和其它地方一样。 20世纪60年代和70年代的几项技术进展对当前的虚拟现实技术的发做出了很大的贡献。1965年,Ivan Suterland设计了一种头戴式计算机图形显示器,它可以跟踪佩戴者的头部位置。这种设备允许参与者观看由线框图形拼凑成的模拟环境,根据参与者的头部运动改变对线框图形的观察点,因而就可以像身临其境一样。1967年,在Frederick Brooks的指导下,北卡罗来大学开始了Grope计划,使参与者能感受到一种计算机仿真的力。1972年,Nolan Bushnell开发了第一种电子游戏,称为Pong,它允许玩游戏的人可以在电视屏幕上操纵一个弹跳的乒乓球。80年代中期,美国宇航局(NASA)的Ames研究中心利用当前流行的液晶显示电视和其它零部件开展研制低成本的虚拟现实设备,为虚拟现实技术走向普及化奠定了基础。 在互联网时代,VR技术发展更为迅速,不少类浏览器都支持许虚拟现实技术,一些公司也采用虚拟现实技术来增强电子商务的功能,在网上推出虚拟现实现实的产品。可以预计,虚拟现实技术将把多媒体技术推向极至。 第 77 页
虚拟现实系统的组成 虚拟现实系统可分为三大类:桌面虚拟现实系统(Desktop VR)、临境虚拟现实系统(Immersive VR)和分布式虚拟现实系统(Distributed VR)。桌面VR也称为窗口中的VR,这类系统由于采用标准的CRT显示器和立体(Stereoscopitic)显示技术,其分辨率较高,价格较便宜。临境VR系统利用头盔显示器把用户的视觉、听觉和其它感觉封装起来,产生一种身在虚拟环境中的错觉。分布式VR则是在临境VR系统的基础上将不同的用户(参与者)联结在一起,共享用一个虚拟空间,使用户达到一个更高的境界。不管是哪一种系统,它都有:虚拟现实显示设备、音频系统和虚拟现实环境发生器、输入输出设备和虚拟现实软件等构成。 1. 虚拟现实显示设备 1)计算机屏幕:计算机屏幕是最简单的虚拟现实显示设备,常常将立体眼镜配合计算机屏幕使用而提供一个立体图像。2)头戴式显示器:头戴式显示器(HMD)可以为每一只眼睛提供一个单独的图像,3)虚拟现实眼镜:虚拟现实眼镜可以为每只眼镜产生不同的图像。头戴式显示器(即虚拟现实眼镜)将图像直接提供给眼睛,而将所有的无关视觉信息过滤除掉。这种眼镜要配合头部位置跟踪设备一起使用。 2. 音频系统 大多数专业性的虚拟现实系统都采用专用音频卡,根据计算机信号产生立体声,耳机可以提供较好的声音再生,同时可使耳朵隔离外部环境的干扰声音。随着语音识别和生成功能的日益增强,虚拟现实技术将会很好地采用它们。 3. 虚拟环境发生器 虚拟环境发生器是任何虚拟境界。现实发生器服从软件指令,以便组合、处理和显示与产生虚拟境界有关的全部数据。现实发生器必须具有足够强大实时处理的功能才能避免参与者的运动和现实发生器响应应该运动之间产生的延迟。虚拟现实程序可以在个人计算机、工作站和超级计算机上运行。 4. 虚拟现实输入输出设备 虚拟系统输入设备可以帮助参与者与虚拟现实系统产生的三维物体仿真进行交互活动。六自由度(6DOF)性能指标可以反映仿真中虚拟物体的位置和取向。根据所采用的设备和设计的虚拟环境,仿真的参与者最多可以按六个自由度的虚拟环境中邀游,并与其交互。它包括的设备有: 1)二维鼠标器 标准的计算机鼠标器是一种二自由度(2DOF)输入设备,大多数是机电型的。鼠标器在二维(X和Y)空间内的运动方向。跟踪球输入设备类拟于鼠标器,只是它的球是固定的,用户用手使它转动。 2)浮动鼠标器 浮动鼠标器类似于标准的计算机鼠标器,但当它离开桌面后就成为一个六自由度探测器,大多数浮动鼠标器在其内部具有电磁探测器。如Logitech 3D浮动鼠标器利用内部构成的超声接收器和具有发射器的固定基座来测量鼠标器离开桌面后的位置和方向。 3)手持式操纵器 手持式操纵器包含一个位置跟踪探测器和几个按钮,专门放在手中使用,它类似于浮动鼠标器,但没有鼠标球。 4)力矩球 力矩球是一种可以提供六自由度的桌面设备,它安装在一个小型的固定平台上,可以扭转、挤压、压下和接出、来回摇摆等。力矩球通常使用发光二级管和光接收器来测量力。 5)数据手套 第 78 页
数据手套可以捕捉手指、大拇指和手腕的相对运动,从而为虚拟现实系统提供在虚拟境界中使用的各种信号。它可以允许手去抓或推动虚拟物体,或者由虚拟物体作用于手。数据手套也包括一个六自由度探测器,因而可以跟踪手的实际位置和方向。 5. 虚拟现实软件与虚拟境界的产生 各种虚拟现实软件包通常称为境界构造程序,境界构造的主要任务是设计参与者在一种虚拟境界中会遇到的景和物,及各种物体在虚拟境界中的行为特性。图形程序或计算机辅助设计(CAD)程序可用来对虚拟境界中出现的物体建模(modeling)。润色(rending)可以给一个物体的外表面加上纹理、色彩、阴影等。虚拟现实工具包可用来将三维物体与虚拟境界组合在一起,并赋予它们某些特性。虚拟现实工具包包含各种在编写应用程序时可以使用的程序功能库和物体库,虚拟现实工具包还允许程序员将某些行为赋予给虚拟境界中的各个物体。仿真管理程序是一个协调景、物、事件、输入信息的专用软件,它使得虚拟境界让参与者接近真实生活。该仿真管理程序还包含可以立即运行的虚拟现实应用程序。虚拟现实的编程人员一定要认识到交互性在开发虚拟境界中的关键作用。声音和入口是引用的交互性的两个方面。C++是大多数虚拟现实编程人员选用的编程语言,利用具有图形用户接口(GUI)的境界构造工具包,一些编程新手也可以产生各种虚拟境界。 VRML是用来构造虚拟现实境界的专门语言,具有类HTML语言的特点,建立的文件具有WRL扩展名,利用它可以非常方便地建立一个虚拟现实境界。VRML在网上被广泛使用。 虚拟现实是计算机建立的人工媒体空间。虽然的虚拟的,但它能使参与者产生真实感。这种真实感是虚拟现实交互技术巧妙地运用了人的心理与生理特点产生的。人在与虚拟现实系统打交道的过程中,最主要的感觉通道是视觉、听觉和触觉等,只要让它们产生相应的“真实”感觉,人们就能有“身临其境”的感受。 自动分词与自动标引 自动分词和自动标引是信息组织自动化的基础,而自动分词对中文信息处理的意义就更大。信息处理归根到底是要对信息内容的字、词、概念进行正确理解,然后才有主题的分析和分类的标引,才有可能进行自动文摘、自动分类和聚类,才有信息的大规模的现代化集成处理。所以,自动标引是基础,而自动分词又是文献标引的基础之基础。下面对汉语的自动分词技术和自动标引技术做一简单介绍。 自动分词 目前常用的汉语分词技术有: (1)词典分词法:即扫描文本,将读出的信息(字词)与机内词典匹配,按匹配标准匹配,如果匹配即记录下来作为预备标引词,并对该词做标记。常见的匹配法有:最长匹配法、最短匹配法、长短结合法、词首匹配法。目前大部分分词系统都用该法。 (2)切分标记法:即构造切分标记字典,将词首字、词尾字、独立字或用“非用字”、“条件用字”构成字典。其中较为实用的是“非用字后缀法”。 (3)单汉字标引:以上两者分词都有不少歧义,于是有人提出单汉字标引,以绕过分词的难题,即构造停用字表直接利用单个汉字标引,实践证明,它的标引质量和效率的不令人满意的。 (4)智能分词法:建立分词库、以此作为语法、语义分析器推理和判断句子,达到正确分词的目的。它被认为是分词法的发展方向。 第 79 页
自动标引 自动标引是以计算机代替人工,自动生成表达信息记录内容特征的主题、分类或其它有意义的标识,它是标引技术与计算机结合的产物,是信息组织自动化的基础。 自动标引在西方国家已有四十多年的历史。1957年,卢恩在IBM公司的研究刊物上发表了第一篇有关自动标引的文章,题名为“文献处理机械化编码和检索用的统计学方法”,首次提出了一个基于统计的文献处理自动化系统的概念。随后,自动标引研究在美国呈现活跃状态,其中以萨尔顿(Salton)成功建立的自动标引与检索系统最为著名。继美国之后,前苏联、日本、英国、联邦德国、荷兰等国也都先后建立了实用型的自动标引系统,并投入使用。汉语自动标引起步较晚,1980年以后,国内始有人涉足,现已有一批系统投入实际使用。早期的自动标引仅仅对文本进行处理,后来由于多媒体信息技术的出现,自动标引也发展到多媒体信息标引阶段,多媒体信息自动标引比文本信息自动标引要复杂得多,单基本原理是一致的。 自动标引的基本过程是计算机读入待标引的信息和标引工具集,对读入的信息记录的进行内容(而不仅仅是文本)分析统计,选择相关语词或其它(如波形、图象轮廓)标识。将选择出的标识与计算机内存贮的标引工具集进行匹配扫描。将自动标引结果和标引对象的信息存贮在一起,形成一条完整记录。 不论是分类标引还是主题标引,关键的一步是抽出内容的特征标识,即利用计算机扫描标引对象有关的信息符号,将有意义的内容特征提出来。扫描结果的处理有三种处理方式:一种是利用存入的词表选择即受控方式,该方法简便、准确,所以目前大部分文本标引系统都采用该方法,第二种是利用各种数学模型和算法计算,即选出候选词的权值,再根据权值的大小选词。这种即为非受控方式。第三种是利用各种数学模型和算法分析,构造信息对象的特征库,目前基于内容的多媒体信息标引即采用该方法。 中文文献由于汉语分词技术的限制,许多自动标引算法和实际系统都不能达到理想的效果,有些学者提出单汉字标引以避免触及分词问题。单汉字标引的优点显而易见,一由于它为每个汉字都建立了索引,所以速度快;二是避免了分词的问题,使人们可以有更多的时间考虑其它问题。但单汉字标引的缺点也是显然的,如空间开销过大、解决误组配的能力有限、无法解决禁用词表的负作用问题、检索词首字的判断缺乏客观严谨的标准,主观臆断性较大、不能提供对词的浏览,最重要的是不能有很好的簇性检索,而这是信息检索关注的核心之一。 基于内容的多媒体自动标引 随着计算机技术、多媒体技术以及网络技术的快速发展,对诸如数字图书馆、多媒体电子出版物、多媒体教学软件以及交互式视频服务等越来越重要。基于内容的多媒体自动标引是制利用计算机自动识别内容特征并赋予其确切的标识,不需要其它的信息表示方法。基于内容的信息检索(CBR: Content-based Retrieval)则是指根据媒体对象的语义和上下文联系进行检索,是基于内容的多媒体自动标引的目的。基于内容的多媒体自动标引直接从媒体中提取信息线索,以某种标识近似表示信息内容。其中图象标引、视频标引和音频标引是其难点。图象标引是在分析图象的事件点如线与线的交叉点等和图象数据如颜色、粗糙度、对比度和纹理方向等,建立一个图象特征库;视频标引在分析各个特征数据,如镜头、关键帧、动态特性等,音频标引在分析各个音频特征数据如音调、音色、音域、旋律等之后建立一个视频和音频特征库。多媒体的信息检索就是分析了多媒体提问信息的特征,并将它与多媒体特征库进行匹配,相似度大于某一阀值即视为命中。 第 80 页
一点建议 在西文文献中,分词不是一个问题,但对汉语却不一样了。汉语由于本身的书写特点,即汉语的字词间没有间隔,使利用计算机进行自动处理语词和概念变得非常困难。目前,国内学者对该问题做了艰苦的探索,但适于各个学科、文体的真正实用的分词算法还没有实现。我们认为,要真正改变这一状况要依赖计算机技术的进一步发展,如生物计算机和神经网络技术的成熟和应用,即使这样,我们也不能保证能百分之百的正确。不过,我们有一个简单但却是根本的解决办法,即改变汉语的书写习惯,即象西文文字一样采用空格分隔字和词。从汉语书写的发展史上,已经经历过一场变革,古汉语书写一写到底,中间没有任何符号,这一现象在书法作品中仍然被保留。这种书写对信息量小、语义简单的小短文并不构成大问题,但对于长篇的或语义复杂的作品,这个问题却是非常严重的,阅读和理解都非常费力,理解错误的可能性越来越大(如众所周知的一个“句逗”故事,“下雪天留客天天留我不留”,两种不同的“句逗”造成截然不同的句意)。后来人们使用“句逗”解决了这一问题,但仍然存在一些歧义问题,如句子“发展中国家兔的养殖”,显然有两种不同理解。在信息化时代,这个问题的严重性越来越突出,既然人都对某些句子有理解歧义,那么,只能机械地、至多近似仿人地切分语词的计算机对此只会有更多的歧义理解。这极大地影响了我国对信息资源的大规模处理,对汉语同其它语言的交流也带来了很大障碍,目前汉语分词的不够准确也是制约我国机器翻译进一步发展的关键因素之一。从宏观看,给我国在知识信息时代信息资源的建设、配置和管理以及国家竞争力都会造成不可忽视的影响。“继承人类文明的一切先进成果”是发展我们新时代文化的根本要求,我们引入和创造了拼音和标点符号,我们也改变了某些汉字的书写习惯而创造了“五笔字型”汉字输入法,这个输入法遭到不少“捍卫”汉字书写顺序的学者的反对,但它依然是最有效的输入法。所以我们应树立改变汉语的书写习惯是解决歧义理解的最彻底的办法的观念,至少目前是如此。如我们可以这样书写:“中国 人民 从此 站 起来 了”,“伟大 的 中华人民共和国 万岁”,“实践 是 检验 真理 的 唯一 标准”,“创新 是 一 个 民族 发展 的 不竭 动力”,……。 习 题 什么是信息编码?什么是代码?谈谈它在实际中的应用? 什么是数据库?常用的数据库管理系统(DBMS)有哪些?在数据库信息组织时应注意哪些问题? 什么是SQL语言?试用SQL语言写出下列操作表达式: 1)从数据库a中查出书名为“知识经济”的所有记录。 2)从数据库b中删除出版社为“长江出版社”的所有记录 什么数据仓库?它产生和发展的原因是什么?数据仓库的开发工具有哪些? 什么是超文本?超文本有哪三要素?超文本的基本特征是什么? 什么是虚拟现实技术?它对信息组织活动有何意义? 谈谈你对汉语分词和标引技术的认识。 第 81 页
第5章 多媒体信息组织的素材准备 多媒体信息组织的素材准备是指采集、制作和组织处理文本、图形、图象、声音、视频等多媒体信息,以便为多媒体信息组织阶段提供必备的信息素材。本章将介绍多媒体的基础知识,并对图形、图象、声音等多媒体信息素材的处理及工具软件做了一些介绍。 多媒体概述 多媒体的概念及分类 多媒体是兴起于20世纪80年代而流行于90年代,它横跨了5个主要工业领域:计算机、远程通信、出版、家用影像电子产品和电影、电视、广播工业。多媒体的这种特征使它几乎不可避免地对所有信息领域及其研究和市场都产生极大的影响。 多媒体的概念目前尚未形成公认统一的定义。通常,多媒体仅指数字化多媒体。数字化多媒体是一个与被计算机控制的文本、图形、静态或动态图像、动画、声音、视频等媒体的集成。综上所述,多媒体是指能综合传达和再现信息的多种媒体的有机统一体,而多媒体计算机是指能综合处理多媒体信息,使多种信息之间建立联系、并且具有交互性`的计算机系统。 按不同的标准,多媒体可划分为以下类型: l 按媒体的来源划分,可分为捕获媒体和合成媒体; l 按媒体的连续性划分,可分为连续媒体和离散媒体; l 按媒体的形式划分,可分为文本媒体、图形媒体、声音媒体等⑤按媒体的是否运动划分,可分为动态媒体和静态媒体。 l 按媒体的依存环境划分,可分为单一媒体和网络化媒体; 多媒体系统的组成结构 多媒体系统是指能对文本、图形、图像、动画、视频和音频等多媒体信息进行逻辑互连、获取、编辑、存储和播放等功能的一个计算机系统。该系统的组成通常有两种途径:一是直接设计和实现的多媒体系统,如DVI或Amiga系统;二是在已有的计算机基础上通过增加多媒体升级套件而扩展成为多媒体系统。多媒体系统是多媒体技术的灵魂,它能灵活的调度和使用多种媒体信息,使之与硬件协调的工作。通常多媒体系统是由多媒体硬件系统、多媒体操作系统、多媒体创作工具和多媒体应用系统等四部分组成 1.多媒体硬件系统 多媒体硬件系统是由计算机硬件设备、光盘存储器(CD—ROM)、音频输入/输出和处理设备、视频输入/输出和处理设备等选择性组合而成。 1) 主机 在多媒体系统中计算机是基础性部件,其关键部件有中央处理器、扩展总线,内存、硬盘、视频加速卡等,多媒体信息的处理需要它们具有较高的性能。 2) 光盘存储器 光盘存储器(CD—ROM,DVD-ROM)由光盘驱动器和盘片组成。一张光盘可以容纳大约650MB的信息内容,它适于存储数据量大的多媒体信息。 第 82 页
3) 音频卡 音频卡是处理和播放多媒体声音的关键部件,它通过插入主板扩展槽中与主机相连。卡上的输入/输出接口可以和相应的输入/输出设备连接。音频卡从声源获取声音后,进行模拟/数字转换或压缩等处理。音频卡还可以把经过计算机处理的数字化声音通过解压缩、数字/模拟转换后,送到输出设备进行播放或录制。 4) 视频卡 视频卡是通过插入主板扩展槽中与主机相连。通过卡上的输入/输出接口可以与录像机、摄像机、影碟机和电视机等连接,使之能采集来自这些设备的模拟信号,并以数字化形式存入计算机中进行编辑或处理,也可以在计算机中重新播放。通常在视频卡中固化了视频信号采集的压缩/解压缩算法。 另外几个重要的部件是内存、硬盘和视频加速卡等。 2.多媒体操作系统 多媒体操作系统,又称多媒体核心系统(Multimedia Kernel System)。它应具有实时任务调度、多媒体数据转换和同步控制机制,对多媒体设备的驱动和控制以及具有图形和声像功能的用户接口等。通常的多媒体操作系统是在已有的操作系统基础上进行扩充和改造或者干脆重新设计。例如,Microsoft公司研制的Windows,Apple公司在Macintosh机上推出的System , Intel和DVI系统开发的AVSS和AVK等系统,就是目前推出的第一批这样的软件产品。 3.多媒体创作工具 多媒体创作工具是帮助制作多媒体应用系统的软件工具的总称。它可以对文本、图形、图像、动画、视频和音频等多媒体信息进行控制和管理,并把它们按要求连接成完整的多媒体应用系统。多媒体创作工具除具有一般编辑软件具备的信息控制能力外,还必须具有将各种媒体信息编入程序的能力,并具有时间控制、调试能力以及动态文件输入或输出的能力。 多媒体创作工具大致可分为多媒体素材编辑工具和多媒体著作工具两大类。前者包括:音频编辑,如WAVe Studio、SoundEdit、Cakewalk和Midisoft等,图形与图像编辑:如CorelDraw、Photoshop、Photostyler和Illustrator等,动画制作:如3D Studio MAX和3D F/X等,视频信息:如Premiere、Video For Windows(VFW)和Digital Video Producer(DVP)等。后者分为以下三类:1)以页式或卡片为基础的多媒体著作工具,常见的这类多媒体著作工具有:ToolBook、HyperCard等。2)以图标为基础的多媒体著作工具,常见的这类多媒体著作工具有Authorware、IconAuthor等。3)以时间为基础的多媒体著作工具,常见的这类多媒体著作工具有Director、Action等。 4.多媒体应用系统 多媒体应用系统,又称多媒体应用软件。它是由各种应用领域的专家或开发人员利用计算机语言或多媒体创作工具制作的最终多媒体产品,是直接面向用户的。多媒体系统通过多媒体应用系统向用户展现其强大的、丰富多彩的视听功能。目前,多媒体应用系统所涉及的应用领域主要有文化教育(教学软件)、电子出版(百科全书或字典)、音像制作、影视特技、动画制作、咨询服务、信息系统(酒楼或宾馆)、通讯(电视会议或可视电话)和娱乐等。 多媒体应用系统的制作过程通常的信息系统开发过程有所不同。它主要分为六个阶段,即确定选题、编写脚本、数据准备、系统制作、系统测试和使用。 第 83 页
多媒体素材处理 数字音频基础 声音是传播信息的主要媒体之一。在多媒体信息组织中,一个很重要的方面是对声音素材进行采集、编辑、处理、组织、合成和输出等操作。多媒体系统中正是有了声音才使其具有“引人入胜”的气氛和效果。 1.模拟音频和数字音频 模拟声音的录制是将代表声音波形的电信号转换到适当的媒体上,如磁带或唱片,播放时将记录在媒体上的信号还原为声音波形。 数字声音是通过采样技术记录的。采样就是将模拟量表示的音频电信号转换成由许多二进制数1和0组成的数字音频文件。采样过程所用的主要硬件是A/D转换器。 2.数字音频质量 数字音频质量取决于采样频率,取样大小和声道数。 1) 采样频率:采样频率,又称取样频率。它是将模拟声音转换为数字声音时,每秒钟所抽取声音波幅度样本的次数。采样频率越高,声音的保真度越高,声音的质量越好,目前通用的标准采样频率有三个,它们分别是、和。 2) 取样大小:取样大小,又称量化位数。它是每个采样点能够表示的数据范围。量化位数越高,音质越好,数据量也就越大。 3) 声道数:声道数是指所使用的声音通道的个数。 3.数字音频存储 在多媒体技术中,存储声音信息的文件格式主要有两种:即WAV格式和MIDI格式。 WAV文件来源于对声音模拟波形的采样,其计算公式是: WAV文件的字节数/每秒=采样频率(Hz)× 量化位数(位)× 声道数/8 例如,用的采样频率对声波进行采样,每个采样点的量化位数选用16位,则录制1分钟的立体声节目,其波形所需的存储容量为: 44100×16×2×60/8=10,584,000(B)=10,(KB)=(MB)=7张3寸软盘容量 MIDI即MIDImusical是 Instrument Digital Interface(乐器数字接口)的缩写。MIDI文件中包含音符、定时和多达16个通道的乐器定义,每个音符包括键、通道号、持续时间、音量和力度等信息。所以MIDI文件记录的不是乐曲本身,而是一些描述乐曲演奏过程中的指令。 4.数字音频播放 为了播放声音,必须配置音频卡和音箱。它们质量的好坏将直接影响到播放声音的效果。WAV文件的播放可以使用Windows中的[录音机]或[媒体播放器]以及音频卡附带的应用软件。MIDI文件的播放有两种方法:一种是将MIDI信息送回原来的电子音乐设备,由这些设备根据发送回来的指令恢复原来的声音;另一种是将MIDI信息通过音序器送到合成器中,由合成器根据一系列数字指令,还原成模拟波形,然后通过扬声器播出声音。 要使多媒体系统具有实时处理声音的功能,必须采用高效的数据压缩编码技术。常用的压缩编码方法有两种:一种是波形编码技术,另一种是声码技术。 音频卡的功能主要包括以下三部分:录制与播放、编辑与合成处理、MIDI接口。新加坡创新科技有限公司开发的Sound Blaster系列音频卡已成为多媒体计算机事实上的一个标准系列产品。 第 84 页
图形与图像组织与处理 图形与图像是多媒体技术的重要组成部分,在多媒体应用系统中,灵活的使用图形与图像,可以提供色彩丰富的画面和良好的人机交互界面,大大改变了计算机的原来“面目”。 1. 图形与图像的基本概念 图形和图像是实现生活中各种形象和画面的抽象浓缩或真实体现。图形反映物体的局部特性,它是真实物体的模型化;图像则反映物体的整体特性,它是物体的真实再现。图形处理是在计算机上借助于数学的方法生成、处理和显示图形;而图像处理是指将客观世界中实际存在的物体映射成数字化图像,然后在计算机上用数学的方法对数字化图像进行处理。利用真实感图形绘制技术可以将图形数据变成图像,利用模式识别技术可以从图像数据中提取几何数据,把图像转换成图形,在基于内容的多媒体信息组织和检索中应用越来越大。 图形和图象有数字化和非数字化之分。其中数字图像包括位图,又称点阵图像;另一个是矢量图。矢量图最显著的特征是图象放大不失真,占用的空间很小,但表现力不如点阵图。 1) 图像的重要参数 分辨率是影响位图质量的重要参数,它可以分为屏幕分辨率、图像分辨率和象素分辨率等等。 l 屏幕分辨率 屏幕分辨率是指屏幕上的最大显示区域,即水平和垂直方向的象素个数。屏幕分辨率与显示模式有关,例如标准VGA卡的屏幕分辨率是640×480个象素,现在流行的显示器的屏幕分辨率是1024×768个象素。 l 图像分辨率 图像分辨率是指数字图像的实际尺寸,即该图像的水平和垂直方向的大小。 l 象素分辨率 象素分辨率是指一个象素的宽和长之比。 2) 颜色深度 位图中各象素的颜色信息用若干数据位来表示,这些数据位的个数称为图像的颜色深度(又称图像深度)。颜色深度决定了位图中出现的最大颜色数。目前图像的颜色深度有以下几种,即1、4、8、16、24和32。若图像的颜色为24,位图中每个象素有24个颜色位,可包含16,777,216=16M种不同的颜色,这种图像称为真彩色图像。 3) 图像文件的大小 图像文件的大小是指在磁盘上存储整幅图像所需的字节数,它可按以下公式来计算: 图像文件的字节数=图像分辨率×颜色深度/8 例如:一幅640×480的真彩色图像,它未压缩的原始数据量为: 640×480×24/8=921600B=900kB 4)图像的文件格式 一般图像处理软件都能支持通用的图像文件格式,例如BMP,GIF,JPEG、PCX,TIF,TGA,和WMF等。其中,BMP是Windows所采用的基本位图格式,支持各种颜色深度。GIF是由CompuServe公司开发的,目的是便于在不同的平台上进行图像交流和传输,GIF图像的颜色最多为256色,在网络上使用的多为JPEG格式图象。 5)图像的处理方法 图像数字化后存入计算机,还需做进一步的处理或加工,才能更好地使用图像信息。这些处理包括放大、缩小、平移、坐标变换。坐标轴旋转、透视图制作、几何校正、v校正、灰度反转、二值图像、灰度变换、伪彩色增强与平滑、边缘加强和轮廓线抽取、等灰度制作、图像复原、图像重建、局部重建、局部图像选出或去除、轮廓周长计算、面积计算以及各种 第 85 页
正交变换等。 2. 绘图软件与图像处理软件 在多媒体应用系统的开发过程中,需要制作许多图形、图像界面和各种插图。对于图形制作软件具有专业水平的很多,比如CorelDRAW,Freehand和Illustrator等,CorelDRAW是一个基于矢量的带有扩大文字处理和精确绘图功能的高级绘图软件。利用它可以创建准确的图形,绘制精美的艺术作品,编辑教学图片、配注简单的描述甚至还可以制作动画片。因而它被广泛应用于图案设计、出版印刷、教学演示、广告制作、电视节目与片头制作等许多领域。图像处理也有很多成熟的软件包,如Photoshop 、Photostyler、PC paintbrush等。本节以Photoshop中文版为例,使读者能够了解计算机图像处理的基本技能和一些特殊处理方法。 l Photoshop介绍 Photoshop堪称世界上首屈一指的图像设计与制作工具,它是集图像创作、扫描、修改、合成以及高品质分色输出等功能于一体的工具软件。自从20世纪80年代末由美国Adobe公司推出以来,获得了巨大成功,一举成为PC机和Macintosh机上最优秀的图像处理软件。它的诞生引起一场图像出版领域的深刻变革,使用Photoshop处理图像,灵活直观,所见即所得。 1) Photoshop工具简介 Photoshop有多达数十种工具,它可以帮助用户对图像进行创建修改、编辑及色彩校正。 图 Photoshop用户界面 a) 选定工具(Selection) 包括遮罩(Marquee)、套圈(Lasso)和魔术棒(Magic Wand)。如果用户想选定某个对象,通常要使用选定工具。 ①遮罩工具。它允许用户用矩形、椭圆和水平线或垂直线,去选定一个图像区域。 ②套圈工具。它可以当作一个徒手画工具来使用,用户可以用它描绘形状不规则的轮廓。 ③魔术工具。它是按颜色相似进行选定的。 b) 移动工具(Move) 移动工具是用来移动所选定的对象或层。 c) 裁剪工具(Cropping) 裁剪工具用于切除图像的某一部分,并且移去剩下的部分,它还可以用来设定图像的大小。 d) 文字工具(Type) 文字工具可以用来向文档添加文字。 e) 徒手和缩放工具(Hand and Zoom) f) 着色工具(Painting) 着色工具较多,它包括漆桶、梯度、线条、橡皮擦、铅笔、喷枪、画笔和滴管。 第 86 页
g) 编辑工具(Editing) 编辑工具包括橡皮图章、涂污、模糊/清晰、躲闪/亮化/海绵。 h) 色彩控制图标 色彩控制图标允许观看或切换颜色。 i) 模式图标 j) 屏幕显示图标 2) Photoshop的使用 在Photoshop中,图层和滤镜的使用颇具特色。 下面以立体字为例,介绍Photoshop的使用方法。 操作过程: 1.使用File菜单的New命令建立一个RGB文件,背景为白色,大小为12×6cm。 2.使用文本工具在图像中输入“立体字”三字,在Type Tool对话框中选择Faux Italic项,使字体有点斜。 3.按Ctrl键,同时在Layers面板中单击文本层,将文字选中,形成文字选区。 4.单击Layers面板上的删除按钮,将文本层删除,此时应确保选区还在。然后单击Layers面板上的新建按钮,建立一个新图层Layer 1。 5.在工具箱中选择线性渐变工具并双击,打开它的选项面板,在Gradient下拉列表中选择Copper选项。 效果如下图所示: 图 photoshop文字制作效果 计算机动画制作 动画很早以前就出现了,随着微型计算机的迅速普及,使计算机动画进入了大众化时代。例如电影《侏罗纪公园》、中央电视台制作的大型动画系列片《西游记》以及流行游戏《三国演义》、《帝国时代》等,其中就用到了计算机动画技术,这大大增强了它的表现力和可观赏性,。 近年来,随着计算机动画技术的迅速发展,它的应用领域日益扩大,主要应用于影视创作、广告制作、辅助教学、模拟仿真、科学计算、工业设计以及娱乐中。 1.动画的基本概念 动画是通过一系列连续单个画面来产生运动的一种技术,并通过一定的速度放映来达到连续运动的效果。按不同标准计算机动画分为:逐帧动画和实时动画、二维动画和三维动画、计算机辅助动画和造型动画、五级动画、关键帧动画和算法动画、 计算机动画系统是一种用于动画制作的由计算机软硬件组成的系统。目前计算机动画系统有工作站和微机两种形式,分别以SGI工作站和PC系列为代表。 三维动画制作软件一般包括实物造型、运动控制、材料编辑、画面着色和系列生成等五部分。同拍摄故事片需要物色演员、制作道具、选择外景类似,动画软件必须具有在计算机内部给这些角色、模型、周围环境进行造型的功能。通过动画软件中提供的运动控制功能,制作人员可以对控制对象的动作在三维空间里进行有效特性进行有效特性控制。利用材料编辑功能,制作人员可以对人物、实物、景物的表面性质和光学特性进行定义,从而在着色过程中产生逼真的视觉效果。 计算机动画制作软件是又计算机动画专业人员开发的制作动画的工具软件。使用这一工 第 87 页
具不需要编程,通过相对简单的交互式操作就能实现计算机的各种动画功能,这样一来只要有一定计算机操作技能,在加上一定的动画及美术知识,就可以根据已创作的动画脚本制作计算机动画。 2.二维动画制作软件——Flash 目前比较流行的二维动画制作软件有Animator Studio和AXA2d、flash等。 Flash5是Macromedia的又一力作,是制作网页素材的得力工具。现在,相当多的网站都能看到它的身影。 1) Flash 5的增加功能 (1)新的播放器:根据Macromedia公司的统计资料显示,目前已有92%的在线用户可以观看用Flash 5制作的交互影片。用Flash 5制作的交互影片有更高的可播放性和信赖程度,而且跨越各种浏览器,操作系统和硬件平台。 (2)高品质网页打印: Flash 5提供了新的网页打印方式,比如:WYPINWYS(What You Print Is Not What You See所见并非所得),可打印的内容会随之下载,使网站浏览速度更快。 (3)支持QuickTime和RealPlayer: Macromedia Flash 5支持读入、增加和转存Apple QuickTime 4影片的功能,Flash 5的交互影片还可以发布成RealFlash格式,让RealPlayer G2和RealPlayer 7/8进行播放。 (4)支持XML转换以及HTML文字 Flash 5允许开发人员在以Flash为基础的网站应用中,使用XML的结构化资料,以便达到电子商务方面的目的。可以使用Flash来建立销售表单、虚拟购物车、客户意见反馈调查表以及库存系统等等。Flash 5已经具备建设大型商务网站的能力。 Flash 5也将丰富的图形以及传统浏览的文字做了最佳的整合。设计人员现在可以选择消除锯齿的图形式文字,或是HTML格式的文字合并使用,创造出新一代的网页内容。 (5)Macromedia Generator Developer Edition支持 Macromedia Generator 2是一个资料导向的应用服务器,它可以提供Flash网站动态内容,是Flash连接数据库的最佳解决方案。使用Generator Developer Edition 自动生成Flash产品。 (6) ActionScript开发工具 Flash从版本开始加入了较复杂的互动性,包含有变量,判断及执行时间线控制物件的内容属性。其主要功能有: ActionScript语法 ActionScript编辑器 外部脚本 错误检查器 (7) 影片探索器 这个新增功能对于分析Flash编辑文件的组织和结构有很大帮助。影片探索器提供下列的功能帮助设计者加速工作流程。 以树状目录的方式,即时显示出巢状多层物件以及它的位置 轻松编辑和浏览巢状多层物件。 可以将文件结构图打印出来。 可以搜索文字、字体、动作脚本以及元件的名称。 可以将常用的检查过滤条件存储起来。 (8) 共用元素库 Flash 5中新增加的共用元素库功能,可以将影片所使用的物件单独开放为库,放到另 第 88 页
一个Flash影片中使用,而且如果修改了共用元素库文件,所有使用这个库元素的影片都会自动对应改变。 2) 基本操作界面和对象 (1)工具栏 向用户提供在Flash 5中所有工具的选择和切换。 (2)TimeLine Flash中最重要的项目之一,对动画的所有控制,变化都要靠它完成。 (3)Frame面板 设置Tweening动画的类型,在Flash动画中有两种最基本的变化过程,即Motion变化和Shape变化。Motion可以设置物件的大小、位置、颜色、透明度等等,但前提是此物件为一个独立的符号(Symbol)或一个组(Group)。而Shape则可以设置物件的形状变化,前提是此物件为打散状态(Break Apart)。 打开Frame的方法是选择Windows菜单下的Panels子项下的Frame命令(快捷方式Ctrl+F),打开后在Tweening项中我们可以选择变化类型。 当了解上面的三个主要项目后,就可以开始做一个最最基本的动画了。 (4)Motion Motion变化是Flash中另外一个重要的变化。它不仅可以产生物件的位置变化,同时还可以设置大小、色彩及透明度等多种变化的。不过要设置Motion变化,前提是物件为一个独立的符号(Symbol)或一个组(Group)。 (5)库面板(Library) 在Flash的编辑过程中,很多对象都是以独立的Object(物件)出现的,这些物件包括我们建立的Symbol(符号),导入的声音、图片等。而有些物件在整个影片中可能出现不止一次。要在影片中建立两个相同的对象无疑会增加影片体积和加大劳动量,通过Flash中提供的物件管理工具Library,可以将影片中用到的对象都做成独立的物件,然后随意调用,而且相同物件可应用到不同层,不同场景并且可做任意的操作。 (6)打散与组合(Break Apart and Group) 在正常状态下,打散与组合没有区别,但选中以后,组合的对象周围有一个蓝框,表示当前物件处于选中状态,而打散的对象则以星点表示。在移动时,组合的对象在拖动过程中始终以一个整体进行移动,物件的外框线出现在当前的拖动位置,当放开鼠标后,对象整个移至外框线位置;被打散的对象则不同,可以单独移动选中的部分,被选中部分可以与整体分离,单独移动,当然,也可选中全部对象进行移动。这是Flash中对象的两种基本形态,打散与组合。我们要对建立的对象打散,可按快捷键“Ctrl+B”,若要对打散的对象进行组合(Group)则可按“Ctrl+G”,或者通过Modify菜单进行选择。 (7)色彩与透明 选中TimeLine第一帧的物件,然后选择Windows菜单下Panels子菜单下的Effect项打开Effect面板,通过它,我们可以调整物件的各种色彩属性。 (8)Layer层 在Photoshop中就用过图层,Flash也以层的概念来存储影片,类似于Photoshop中的层,区别在于一个是静止的一个是运动的。有时候要做一个影片,在一个层中很难完成,因为在同一层中不能同时控制多个对象。 (9)音频对象 Flash5没有音频剪辑功能,要给Flash影片配音,先找好需要的音频文件,或者用外部音频编辑工具做好剪辑再由Flash导入。Flash 支持直接导入MP3,选择File菜单下的Import项,在打开的对话框中文件类型栏中选择欲导入的文件类型。导入的音频文件以图标 第 89 页
出现。在Library面板上部窗可以看到声波图。 3.三维动画制作软件——3D Studio MAX 三维动画数3D Studio MAX,它是Autodesk公司推出的功能强大的三维动画制作软件,它具有友好方便的界面、简易快捷的操作、细腻逼真的画面、出色的渲染的效果。在影视广告、动画片头、建筑装潢、电脑游戏等行业随处可见3D Studio MAX 的身影。3D Studio MAX 能够轻而易举的创建复杂的场景并让任何对象生成动画。 3D Studio MAX 的推出使MAX具有更强的编辑修改工具、更多的外挂插件,这一切使3D Studio MAX 更具吸引力。 1) 3DS MAX 的功能 3DS MAX 是利用PC机完成专业质量的三维模型及胶片质量的影像文件的强大工具。以下将对MAX 基本功能作以简单介绍。 3DS MAX 有以下5个功能模块: l 建模(Modeling object) 3DS MAX 的重要特点是有一个集成的建模环境。可以在同一个工作空间完成二维图纸、三维建模及制作动画的全部工作。建模、编辑和动画工具都可以在命令面板和工具栏上找到。 l 材质设计(Material design) 3DS MAX 在一个浮动的窗口中提供了一个高级材质编辑器,可通过定义表面特征层次来创建真实的材质。表面特征可以是静态材质,在需要特殊效果时也可以产生动画材质。 l 灯光和相机(Lighting and Camera) 创建各种特性的灯光是为了照亮场景。灯光可产生投射阴影、投影图像,也可以创建大气光源的容积光效果。 创建的相机有着真实相机的控制器,如焦距、景深,还有各种运动控制,如推进、转动、平移。 l 动画(Animate) 通过单击Animate 按钮,可以在任意时间使场景产生动画。通过时间的改变及对场景中对象参数的控制即可产生动画。 还可以通过Track View(轨迹视图)控制动画。Track View是一个浮动窗口,可用于编辑关键帧,建立动画控制器或编辑运动曲线。 l 渲染(Rendering) 3DS MAX 渲染器的特征包括选择性的光线跟踪、分析性抗锯齿、运动模糊、容积光和环境效果。还可在Video Post (视频后处理)窗口渲染和编辑多幅动画视图。 2) 3D Studio MAX 的用户界面 3D Studio MAX 的界面布局与MAX其它版本有所不同。不但菜单栏中增加了更多的选项,而且更多的功能命令被转化为图标,放在界面上,如图所示。 图 3D Studio MAX 的用户界面 第 90 页
3) 创建几何造型 创建几何造型即建模是制作动画的前提。在3D Studio MAX 中提供了基本的实体造型(见object 菜单下),但它们也有许多细节和不同材质,这些将通过Modify(修改)命令面板设置各种参数, Material Editor(材质编辑器),渲染,使用灯光与相机以及其它操作来实现。 4) 环境设置 在三维动画制作重要实现最终的整体视觉效果,环境设置是必不可少的。使用环境设置可以为场景设定背景影像,在场景中增加雾化、光柱的特殊效果。 5) 动画制作 在3D Studio MAX 中,你只需创建记录每个动画序列的起始、结束和关键帧(每个单幅画面被称为帧),关键帧之间的插值即让画面动起来的工作是由3DS MAX 自动计算完成的,当对象的参数被确定后,就可通过3DS MAX的渲染器完成每一帧的渲染工作,生成高质量的动画。在图中按下Animate 键后,设置好关键帧的画面,即可由动画播放控制器进行播放。表示动画播放到100帧的第0帧。 多媒体的概念及分类是什么?简述多媒体应用系统的制作过程。 数字音频信息如何处理? 图形与图像的概念是什么?常见绘图软件如何操作? 计算机动画制作如何进行? 第 91 页
第6章 多媒体信息组织 多媒体信息组织是指利用多媒体著作工具、多媒体语言工具等手段以及各种信息组织的方法对文本、图形、图象、声音、视频等多媒体信息进行集中处理,以增强信息的表现力,提高信息的使用价值的活动。多媒体信息组织广泛存在于多媒体电子出版物、多媒体教学软件等的设计和制作以及网络信息管理中。 本章将分别介绍多媒体著作工具、多媒体应用系统以及在这些环境下多媒体电子出版物、多媒体教学软件的信息组织工作等。 多媒体著作工具 所谓多媒体著作工具是指能够集成处理和统一管理多媒体信息,使之能够根据用户的需要生成多媒体应用系统的工具软件,也有人称它为多媒体创作工具或多媒体写作工具等。多媒体著作工具提供了组织和编辑多媒体应用系统各媒体元素所需的框架,用多媒体著作工具设计交互性用户界面,将各种多媒体信息组合成一个连贯的节目,并在屏幕上予以展现。本节介绍多媒体著作工具的功能和产品,并着重介绍多媒体著作工具Authorware的特色、功能和使用方法。 多媒体著作工具的功能和产品 1.多媒体著作工具的功能 由于应用目标和使用对象的不同,多媒体著作工具在功能上往往会有较大的差别。一般认为,多媒体著作工具应有以下功能。 ①编程环境:即能对媒体元素进行基本的信息和信息流控制操作,包括条件转移、循环、数学计算、逻辑运算、数据管理和计算机管理等。 ②超媒体链接:超媒体链接是指由一个静态对象去激活一个动作或跳转到一个相关的数据对象进行处理的能力。 ③动态链接:多媒体著作工具应能从一个多媒体应用程序来激发另一个多媒体应用程序,并加载数据,然后返回运行的多媒体应用程序。 ④模块化和面向对象:多媒体著作工具应能让开发者编成独立片段模块化,甚至目标化,使其能“封装”和“继承”,让用户能在需要的时候独立使用。 ⑤.动画处理能力:多媒体著作工具可以制作和播放简单动画,还应能播放由其他动画制作软件生成动画的能力,以及通过程序控制动画中的物体的方向和速度,制作各种过渡特技等。 ⑥媒体数据集成管理:多媒体著作工具软件应具备一定的数据输入和处理和综合管理的能力。 ⑦良好的界面:尽量考虑兼顾更多的标准,具有良好的兼容性与扩充性。向用户开放系统,提供必要的扩充接口。 ⑧拖放式操作:软件工具的易用性决定了该软件的应用范围和对象,目前,大多数多媒体著作工具都是基于WINDOWS窗口式界面,用户只须用鼠标点击和拖动操作对象, 第 92 页
即可设计多媒体应用系统。 2.典型的多媒体著作工具 目前市场上国内外多媒体著作工具较多,除了我们特别熟悉的Powerpoint以外,还有许多性能很好的多媒体著作工具如Authorware等,下面对常用的典型产品简要作一介绍。 1) Authorware简介 Authorware是美国Macromedia(微体)公司开发的多媒体系统著作工具。它是一个基与图标的适合Windows和Macintosh平台的开发环境,它可以用来制作多媒体教学系统、多媒体咨询系统、多媒体交互式数据库、军事指挥和模拟系统以及仿真模拟培训等各种多媒体应用系统。详细情况下面有介绍。 2)ToolBook简介 ToolBookⅡ是美国Asymetrix公司推出的第二代ToolBook系列产品,ToolBookⅡ不仅可以开发基于Windows的多媒体应用系统,而且可以开发基于Internet的分布式的学习应用系统。使用附件 (widgets)、课程样板(course templates)和自动著书专家(automated book specialists)开发Internet 应用系统只需拖动鼠标、点击按钮即可。该软件还为开发者提供了Open Scriipt 描述语言或Java编程进行深层次的开发,为高级多媒体程序开发提供了可能性。 3)Action简介 Action是美国Macromedia公司推出的集文本、图表、图像、动画、声音、特技及交互功能于一体的多媒体著作工具。在Action中联接场景的主要工具是时间线。 4)Director简介 Director是美国Macromedia公司开发的用于制作和播放交互式应用系统、专业多媒体演示和动画的一种工业级标准的多媒体著作工具。Director包含有丰富的工具集,它为多媒体开发者提供了强大的功能和灵活的编辑手法。通过综合使用Studio中的总谱窗口、图形窗口、角色窗口和舞台窗口等功能,开发者可以实现二维动画的各种复杂创作,Studio所提供的角度窗口,还可以负责管理和存储一个高度集成的多媒体信息库。 Director为开发者提供了广泛而灵活的标准化开放式多媒体信息接口,可以利用Director以外的多媒体素材编辑工具产生的多媒体信息。Director还为开发者提供了一种面向对象的脚本描述语言Lingo。 5)MultiBase简介 MultiBase(摩天超媒体创作系统)是由上海摩天办公室自动化技术有限公司推出的一种多媒体著作工具。它同时具有多媒体、数据库、网络及实时控制等功能。用MultiBase可以开发出任何类型的多媒体数据库管理系统及咨询信息系统。例如:销售管理系统、多媒体监控和工业系统、辅助教学和学习考试遗体化系统、多媒体电子邮件系统、多媒体地理信息系统、宾馆酒店管理咨询系统等。 6)方正奥思简介 方正奥思是北大方正多媒体技术公司开发的一种多媒体著作工具。通过它,用户可以把文本、图形、图像、动画、视频和音频等多媒体信息集成起来,并利用方正奥思的图形编辑和动画功能加以编辑,制作出高质量的交互式多媒体应用系统。方正奥思由层次结构管理器和页编辑器两大部分组成,它共有两种工作状态,编辑层和运行层。方正奥思采用基于层次结构的多媒体应用构造模型,以支持分层抽象的信息组织方法。 Authorware 多媒体著作工具 Authorware 是美国Macromedia公司20世纪90年代初推出的一种多媒体著作工具。多年来,Authorware从版、版、版到目前的版,一直是众多多媒体著作工具中 第 93 页
的佼佼者。Authorware可以将文本、图形、图像、动画、视频和音频有机的结合起来,完成多媒体应用系统的制作。 Authorware提供了一个面向对象的创作环境,它使用了13个功能图标,不同的图标被看作不同的对象,可以随意穿插或叠合。它提供了丰富的屏幕管理功能,可以实现图形、文本的叠加和移动,也可以设定各种显示效果。通过函数编程实现超媒体功能。兼容各种数据库格式,操作数据库通过ODBC方式来实现。最具特色的是,Authorware以流线式的形式先建立应用程序的初始结构,然后再往结构中添加内容来形成应用程序结构。它还提供了许多系统变量和函数,具有极强得数据采集能力。另外可以通过Windows的DLL外部动态连接库,实现自定义函数的功能。 Authorware可以把做好的多媒体产品进行打包(package),生成能够脱离开发环境的exe文件,作为Windows的一个应用程序直接运行。而且使用Shockware技术,可以将Authorware制成的多媒体应用系统快速地发布到Internet网上,这对快速开发网上远程教育课件提供了极大的便利性。 图 Authorware用户界面 有着Windows风格的工作界面。在打开的初始画面中,可以在窗口中看到,窗口中最上端是多媒体应用程序的菜单栏;菜单栏的下方是控制设计操作的各种按钮;在窗口的最左边,是用于设计多媒体应用程序的各种图标,在窗口的中间部分,是用于控制流程图的设计窗口,窗口的最右边是用来设计知识对象的窗口。 作为一种多媒体程序设计软件,最基本的功能是对各种多媒体素材进行编排和开发。它的多媒体开发程序可以编排各种各样的多媒体表现形式,例如文字、声音的编辑、图像的组合润色、图形的变换处理、视频文件的剪辑和动画的编辑制作等等。 Authorware的主要功能有: 1) 积木式图标创作 Authorware为多媒体应用系统提供了一种堆积木式的创作方法。开发者只需将一个多媒体应用系统划分为相对独立的媒体素材片段,使之能用图标分别表示,然后将这些图标用流程图方式有机的结合在一起,即可完成多媒体应用系统的制作。 图标是Authorware的核心部分,它共包括13个图标、2个流程起始标记和调色板。采用Authorware进行创作,不需要开发人员有程序设计语言的经验,只要了解其变量和函数的使用方法,即可方便地用流程图和图标创作出各种丰富多彩、画面生动的多媒体应用系统。 2) 广泛的外部接口 Authorware 除了具备各种创作功能外,还为开发者提供了多种形式的外部接口功能,使开发者可以方便地调入许多其他开发工具制作的多媒体数据文件。以下是几个主要的接口:Word接口、数据库接口、C语言接口以及支持OLE技术。 3) 有效的多媒体集成 通过Authorware提供的各种多媒体工具和具备的多种外部接口,使开发者可以将文本、图形、图像、动画、视频和音频等多种媒体素材有效的集成在一起,形成具有充分表现力的 第 94 页
多媒体应用系统。 4) 丰富的变量和函数 Authorware提供了300多种变量和函数。开发者通过巧妙使用,可以达到对多媒体应用系统的演示效果细致入微的控制。 5) 独立的应用系统 采用制作的最终多媒体应用系统,可以有两种运行方式。一种是制作成可在Windows下直接独立运行的exe文件;另一种是制作成使用播放器的播放文件,Authorware为最终用户提供了一种播放器,供播放最终多媒体应用系统使用。 6) 结合Internet进行创作 在Authorware 中采用了Shockwave技术,能使多种经Shockwave技术压缩的文件, 在Internet中进行播放。 7) 跨平台运行 Authorware是目前少有的可以跨平台运行的多媒体著作软件之一,为开发者提供了在Windows平台和Macintosh平台上几乎完全的操作环境。 Authorware的具体使用在本章第二节和第三节有介绍。 多媒体教学软件 多媒体教学软件是指运用计算机制作和播放、采用多种媒体予以表现、体现教学目标、表现特定的教学内容的一类教学软件。随着多媒体技术日益成熟,多媒体技术在教育中的应用也越来越普遍。多媒体计算机辅助教学是当前国内外教育技术发展的新趋势,已成为计算机辅助教学的一个很需要组成部分,本节首先介绍多媒体教学软件的相关概念,多媒体教学软件设计,特别介绍了网络多媒体教学软件的设计。 多媒体教学软件概述 1.多媒体教学软件的基本要求 多媒体教学软件可以用来存储、传递和处理教学信息,能让学生进行交互操作,并对学生的学习作出评价。因此,多媒体教学软件应达到以下基本要求。1)正确表达学科知识内容,2)完成教学过程,3)体现教学策略,4)具有友好交互界面,5)实施教学评价和反馈 2.多媒体教学软件的类型 根据多媒体教学软件的内容和作用不同,可以将多媒体教学软件分为以下几种类型。1)课堂演示型,主要用于辅助课堂教学,2)个别化交互型,主要用于自主学习,目前网上远程教学采用的是该类型,3)操练复习型,4)资料工具型,5)教学游戏型。 多媒体教学软件的教学设计 教学设计的基础是认知学习理论,它是以教育传播过程为对象,采用系统科学方法设计的一种教学规划、过程和操作程序。多媒体教学软件的教学设计,就是要应用系统科学的观点和方法,按照教学目标和教学对象的特点,合理地选择和设计教学媒体信息,并在系统中有机地组合,形成优化的教学系统结构。教学设计包括以下几个方面: l 认真领会教学大纲,掌握教学内容体系结构。 l 分析学生的原有认识结构和原有认识能力。 l 依据教学内容、学生特征和社会需要确定教学目标。 第 95 页
l 根据对教学内容与教学目标合理选择与设计媒体信息。 l 依据教学大纲,建立教学内容知识结构和呈现顺序。 l 依据教学目标和教学内容设计练习。 多媒体教学软件的教学过程 多媒体教学软件的教学按以下过程进行: l 示,呈现信息,呈现(讲授演示)教学内容信息,让学生进行感知。 l 例,举例验证:主要是对教学内容进行举例验证和演示说明,加强学生对教学内容的理解和记忆。 l 练,操练复习:主要是培养学生对新知识内容的运用技能,即实践能力的培养。 l 结,归纳总结:主要是对所教授的知识内容的归纳与总结,以便让学生对所学习的内容能从感性认识上升为理性认识。 l 验,反馈强化:反馈是教学过程的必不可少的一环,起巩固所学的知识内容作用。 多媒体教学软件的设计 1. 确定选题 多媒体教学软件的设计是一项颇费体力和脑力的工作,同时教学内容千差万别,有的理论多、有的实践多,有的图表多、有的文字多,有的结构复杂、逻辑强,有的简单,但更具情节性。那么,选择好一个题目是至关重要的,因为有的教学整个内容都要设计成多媒体教学软件,有的只需要将其中一部分制作成多媒体教学软件。 2. 稿本编写 稿本编写是多媒体教学软件开发中的一项重要内容。规范的多媒体教学软件稿本,对保证软件质量,提高软件开发效率,将起到积极的作用。稿本是多媒体教学软件设计思想的具体体现,稿本为多媒体教学软件的制作提供直接的依据,稿本是沟通学科教师与软件开发人员的有效工具 多媒体教学软件稿本的编写,包括文字稿本的编写和制作脚本的编写两部分内容。 文字稿本是按照教学过程的选择顺序,用于描述每一章节的教学内容用其呈现方式的一种形式。一般情况下,文字稿本的编写由学科专业教师来完成。完整的文字稿本应包含有学生的特征分析、教学目标的描述、知识结构流程图、问题的编写和一系列文字稿本卡片等。 通常多媒体教学软件制作脚本应包含软件系统结构说明、知识单元的分析、屏幕的设计、链接关系的描述和制作脚本卡片等。 3. 确定软件框架 根据以上的稿本,确定多媒体教学软件的逻辑框架。 4. 数据准备 运用相应的工具软件设计制作和输入教学软件所需要的各种素材,如文本、图形、图像、声音、动画、视频等。这些素材是事先制作好的,制作方法请参考第5章内容。 5. 系统制作 在上述基础,利用Authorware等多媒体著作工具来制作多媒体教学软件。 下面是“计算机基础知识”教学软件的具体操作步骤: (1)在Windows环境下,进入Authorware应用程序窗口,然后选择[File/File Setup],在出现File Setup对话框的Title文本框中输入“计算机基础知识教学软件”,Menu Bar,Background Colors为淡兰色,再选择[File/Save]或[File/Save As]保存为 文件。 (2)拖曳一个交互图标到流程线上,并命名为“组成菜单”,再拖曳一个组图标到“组 第 96 页
成菜单”的右侧释放,此时出现Response Type对话框,从中选择Button类型,单击OK 按钮,命名该图标为“计算机组成及工作原理”。然后依次拖曳四个群组图标,分别命名为“windows2000”、“Office2000”和“多媒体技术”、“Internet使用基础”。接着按住Ctrl键不放,单击“Internet使用基础”下面的流线箭头,改变其流线方向。然后拖曳一个群组图标到交互图标的下方,并命名为“关闭”。 (3)双击“组合菜单”交互图标,出现“组合菜单”对话框,从中将Erase Interaction设置为After Each Entry,再单击OK-Edit Display按钮,进入Presentation Window界面。将其中的按钮都移动到右边的交互区。选择File/Import菜单命令,将预先准备好的合适大小的淡青色的图像粘贴到窗口中,输入必要的文字。 (4)双击“计算机组成及工作原理”的群组图标,进入其二级设计窗口,拖曳一个交互图标和三个属组图标,分别命名为“工作原理菜单”、“冯·诺依曼设计思想”、“计算机的基本部件”和“计算机的工件过程”。 (5)双击“计算机的工件过程”的群组图标,进入其的三级设计窗口拖曳一个显示图标来描述本屏幕的主要内容(文字或图像),一个声音来进行配音讲解,一个交互图标和一个动画图标(位于交互图标右侧),以便可以选择性播放模拟计算机工件过程的动画文件。 (6)在一级设计窗口中,双击[关闭]群组图标,设置一个名为“再见”的显示图标和一个名为“退出”的计算图标。双击“再见”显示图标,选择File/Import菜单命令,放入内容为“谢谢使用”的图像文件,设定Attributes/Transition后,关闭显示图标。双击“退出”计算图标,在计算式中置quit(0),单击[关闭]按钮。 (7)各项工作满意后,可以File/Package菜单命令打包为,这样就可以直接在Windows下运行了。 网络多媒体课件的设计 知识经济时代整个社会对知识的依赖越来越大,对劳动者有更高的素质要求,培养高素质的人才要靠教育,而知识经济时代的教育更注重因“才”施教,即个性化的教育。培养具有专门知识人才,仅靠正规教育及“五大”教育已远不够,而且在现代社会,人们在学校所学的知识根本满足不了全部实际需要,这就需要依靠Internet方式的远程教育形式实现持续化和终身化的教育。美国总统克林顿在1997年的公开演讲中说,“终身教育是知识经济的成功之本”。 最能实现个性化及终生化的教育莫过于Internet远程教育。目前国内有相当多的大学如清华大学、上海交通大学、中国人民大学、湖南大学等开展了网上远程学历或素质教育。有人认为,未来网上远程教育将取代目前的非正规教育,对正规教育也会产生很大的冲击。 1.Internet远程教育的优势 随着Internet广泛普及。基于Internet方式的远程教学由于其本身的显著优势将取代其它类型而居主导地位。这些优势体现在: (1)Internet教学没有时间、教室、教师人数、招生名额的限制,学员可完全按照主观意愿选择是否学习、何时学习、学习地点、学习时间的长短、学习的专业。因而具有很大的灵活性。 (2)费用低廉,学生不必交培训费、住宿费、出差费等。何伯登大学(Aberdeen University)一项用Web取代面对面教学的试验表明Internet教学可大幅度降低学员的开支并节约时间。 (3)Internet教学允许测试和跟踪学生的学习进度,真正实现了单一化教学,每个学员均可按自己实际情况顺序性或跳跃性学习,而Internet提供的超文本链接更是增加了学生学习的自由度。 (4)Internet课件由专家设计,教学安排,课程 设计等都是一流的,并充分运用了文本、 第 97 页
图形、图像、动画、声音、视频等媒体形式,保证了学员在单位时间内获取最多的信息量,充分调动他们的积极性和交互性。如傅秀芬等同志设计的《计算机网络课件》,学生通过点击鼠标就可方便地进入任一章节任一知识点,同时该系统具有丰富的即时反馈信息,人机交互能力强,学生在轻松、自主的环境下完成课程的学习。这也有效地避免了因教师水平的不均衡而导致教学效果的较大差异。 (5)Internet的多种功能与技术手段如Email、BBS等能为学生之间,学生与教师的学习、交流提供了多种途径。 2.网络课件制作的一般过程 课件(Courseware)制作是Internet远程教育的核心内容。目前,某些部门、地区、机构正在筹办跨地区、跨行业系统的培训中心,运用其先进的技术设备,对在职人员开展有关专业知识的培训与继续教育。 依靠课件完成教学任务的过程如图示: 计算机 学生 启示 选择学习内容 呈现者学信息 接受教学信息 补习 提出问题 反应 判断不反馈 接受反馈、强化 进一步决策 图 依靠课件完成教学任务的过程 因此,课件设计包括以下几个方面: (1) 教学设计 建设合理的课程体系,按照教学大纲安排教学内容以及知识点之间的链接。导航策略、版面设计、界面设计等要充分体现教学方法的要旨,尤其是信息呈现、提问、反馈等。 (2) 系统结构设计 课件系统结构包含输入输出子系统、创做系统及多媒体数据库及超文本索引。 教师 多媒体 输入系统 CAI课体编辑器 学生 浏览器 多媒体数据库与超文本素引 图 网络课件完成教学任务的原理 (3) 系统实现 网络课件可用多媒体创作工具和编程语言实现。前者有以页式或卡片为基础的ToolBook、Hypercard,以图标为基础的Authorware和IconAuthor和以时间为基础的 Driector和Action,运用它则可使非专业人员也能制做出界面优美、性能良好的网络课件,而Authornare等依靠Shockwave技术还可将制做好的多媒体课件快速发布到网络上。后者有可视化语言VB、VC、VFP及Java等编程语言,其中Java语言是一种简单的,面对对象,独立于平台、多线程,动态的和通用的网络语言,所以它特别适合于开发Web课件,它不仅 第 98 页
可单独执行,还可以Java Applet方式嵌入网页运行,它与Java Script及HTML语言一起极在大丰富了网页的动态交互及媒体呈现能力。运用Java等语言可开发出性能卓越的网络课件,但需要相当的专业技巧。通常是运用多媒体创作工具制做课件的初本,然后通过一些语言编程丰富某些功能,因为许多多媒体创作工具都提供语言编程接口。 3.系统评价 课件系统评价是保证系统不断更新以适应教学发展的需要。试运行期间,应从教学内容安排的科学性、界面友好交互性、教学反馈与效果等方面注意收集用户的反馈信息,以不断开发出更优秀的课件。 多媒体电子出版物 多媒体电子出版物概述 1.电子出版物 电子出版物以数字代码方式将图文声像等信息编辑加工后存储在磁、光、电介质上,通过计算机或者具有类似功能的设备读取使用,并可复制发行的大众传播媒体。 根据《CD-ROM Professional》杂志对1993年4000多种CD-ROM出版物的统计,其中%载有单媒体信息,%载有两种媒体信息,22%载有3种或4种媒体信息。从内容上看,科技占31%,综合(百科全书、参考书等)占21%,社会科学占18%,商务、法律占17%,人文、艺术占13%。CD-ROM出版物的数量到1994年底就已达到1万种。 多媒体电子出版物包括电子图书、电子期刊、电子新闻报纸、电子手册与说明书、电子公文或文献、电子图画、广告、电子声像制品等。 多媒体电子出版队伍一般由编导、文字编辑、美术编辑、视频编辑、音频编辑和软件工程师组成,通常采用工作组制,每个工作组由3~5人。 2.多媒体电子出版物的制作环境 由于各单位经济条件不同,项目需求及制作群体的相差很大,所以多媒体电子出版物的软硬件环境不尽相同。下面是软硬件环境的最低配置,供用户参考。 1) 硬件环境 (1) CPU:586/166 (2) 内存:32MB (3) 硬盘:2,1GB (4) 显示卡:640×480/256色~1024×768/16M真彩色 (5) 音频卡:Sound Blaster系列 (6) 附加设备:光盘动器、视频卡、网卡、打印机、扫描仪、录音机、MIDI设备、录像机、CD-R刻录机等。 2) 软件环境 (1)操作系统:Windows9x; (2)文字工具:Word97等; (3)图像工具:CorelDRAW,Photoshop,Photostyler,Freehand; (4)动画工具:Animator Studio,3D Studio MAX,3D F/X; (5)视频工具:Video for Windows,Premier,Asymetrix DVP; (6)音频工具:WaveStudio,SoundEdit,Cakewalk,MIDIsoft; (7)多媒体著作工具:Authorware,ToolBook,Director,,VC++, 第 99 页
Java等。 3.电子出版物的基本特点 电子出版物的信息是以数字代码的形式,存储在能用计算机或类似设备读取的介质上,所以它具有许多不同于传统出版物的特点: (1) 媒体信息种类多。即能记载文本、图形、图像等静态信息,还能记载和播放声音、音乐、视频图像等动态媒体信息。 (2) 信息的组织检索和使用方式灵活。如支持数据库、超文本或超媒体的形式的信息组织、存储和检索。 (3) 具有可交互性,能与读者进行信息交流。交互性使电子出版物可以广泛用于计算机辅助教学、电子游戏、交互式电视、实时系统等领域。 (4) 可通过改进的图书发行系统发行和网络在线服务传播。随着网络的普及,这一优势更为明显,目前在网上销售的产品主要是软件和电子出版物,可以说,电子出版物对电子商务的发展也起到了应有的作用。 (5) 内容和信息更新快、获取快、传播快,复制快。这同时也带来了一些新的问题,如电子出版物的知识产权保护以及内容监控难以进行。 4.电子出版物主要载体形态 目前,电子出版物的主要载体形态有:(1)软磁盘(FD),(2)只读光盘(CD-ROM),(3)交互式光盘(CD-I),(4)图文光盘(CD-G),(5)照片光盘(Photo-CD),(6)集成电路卡(IC Card),(7)网络在线服务器,(8)DVD-ROM等,后三者在未来具有极好的发展前途。另有图像激光唱盘、三维光盘、数字视盘等。 国内外电子出版物发展状况 1.国外电子出版物出版概况 国外电子出版物的发展从书目数据库开始,可以追溯到20世纪50年代末。早在1959年,美国匹兹堡大学卫生法律中心就建立了一个全文检索系统。进入90年代,电子出版物出现了前所未有的发展,尤其是CD-ROM的诞生,使全球电子出版业发展非常迅速。1993年《CD-ROM世界》杂志提供的数据表明:1992年全球的光盘驱动器和数据库的销售总收入比上年增长了50%。TFPL公司出版的《CD-ROM指南》收录全球出版的光盘出版物,最初一年只收录了48种产品,后来就以指数速度增长:1990年817种,1991年为1,400种,1992年为2,212种,1993年为3,500种,1994年未达到8,200种。欧共体委员会信息市场监察部1992年报告指出:1988~1991年间欧洲的CD-ROM市场增长了235%。 据美国《电子出版业评估报告》提供的数字,1993年是美国电子出版快速发展的一年。电子出版物(主要指光盘)的销售额达70亿美元,比上年增长149%;其产值占全美出版业年总产值的28%。电子出版物销售量在美国市场上达到万部,亦居全球之首。根据IDG市场调查报告,1994年,美国多媒体光盘最终用户市场所占的份额是:专业应用占11%,商业应用占49%,教育占%,消费市场占%。 2.我国电子出版物的发历史与现状 我国的电子出版物起步于80年代中期,经过近10年的开拓和发展,以FD为载体的电子出版物在我国取得了长足发展,据不完全统计,1994年我国共出版各类电子出版物数千种,发行量超过6万套,销售额超过1000万元,并有部分进入国际市场。 近两年多来,国产CD-ROM行业的迅速崛起,截止1994年底,国内已有20余家单位,制作出版了近百种CD-ROM。其中较具影响的有《故宫》、《1993年人民日报全文数据库》、《中国药典》、《中国法律法规大全》、《神奇的西藏》等。1996年7月的中国出版成就展表明,全国有30多家出版社一共出版了480多种CD-ROM电子出版物。这充分显示出我国发 第 100 页
展中文电子光盘的强劲势头和巨大潜力。 目前,我国电子出版业与发达国家相比虽然有较大的差距,但通过我国各方面人员的努力,已形成发展电子出版的大好条件。(1) 管理体制正在理顺,(2)出版过程的电子化为电子出版业的发展奠定了技术基础,(3)有多种中文电子出版物制作平台开发完成, 电子出版物出版流程简介 电子出版涉及出版诸环节的全过程,因此它包括以下三方面的内容:(1)出版物的电子化;(2)出版过程的电子化;(3)出版信息电子化。其中最本质的是出版物的电子化。 电子出版物制作的流程与多媒体教学软件基本相同,包括: 1.节目规划阶段 这是CD-ROM计划中最最关键的一步。在这一阶段中,要进行详实的市场调查,分析产品销售对象、确定主题、收集相关资料、策划节目构思等。 2.设计阶段 包括节目的组织结构图、流程图、屏幕模拟显示、界面的描述以及媒体说明等。 3.素材制作阶段 素材制作就是将各种媒体数据重新格式化,使之可应用于软件开发工具上。这包括将文本、图形、图像、声音、动画、视频等信息数字化。 4.节目编辑合成阶段 当设计规格要求审核通过之后,开发工作就可以开始了。在CD-ROM产品开发过程中最常用的工具是编著软件包、信息检索软件及编译器。这方面的软件工具有很多(本章前面已有介绍),如Macromedia的Authorware,以及北大方正开发的、具有自主版权的“奥思”多媒体编辑工具。程序语言编译器如Microsoft C++和Microsoft Visual Basic等。 5.测试评估阶段 本阶段主要对程序进行测试及排错,并对节目进行修改及形成相关文件。对应用程序的测试与检验主要包括三个部分:(1)界面,(2)数据,(3)使用性能。 6、生产制造及加工推广阶段 接下来,预制母盘(在磁带上准备CD-ROM映像文件)、制作母盘(将电子信息转移到金属模片上)及光盘复制的工作就可以开始了,在产品的销售上一定要重视网络营销理论和技术的运用,借助网络这一先进的工具加强产品的售后服务,不断使产品升级换代。 电子出版物制作实例 图 Authorware开发程序具体步骤一 以下以《花卉》电子版的制作过程,说明Authorware开发程序的具体步骤: 1)首先从图标栏上拖动一个框架图标到流程线上,双击该框架图标,可以看到框架图标的内部程序结构,它由两部分构成:“项目”和“退出”,分别被称为框架图标的入口部分和框架图标的出口部分,用它来管理整个程序流程的页面。如图所示: 第 101 页
2)拖动一个群组图标到流程线上,取名为“ch1”,双击该群组图标,可以看到一条新的流程线;(1)拖动一个擦除图标到流程线上,用它来擦除背景图;(2)拖动一个显示图标到流程线上,取名为“背景”,然后双击这个显示图标将它打开,选择“File”菜单中的“Import”选项,通过导入外部图像来设置背景;(3)拖动一个显示图标到流程线上,取名为“目录”,双击这个显示图标将它打开,输入一些文字,并对它进行编辑;(4)拖动一个显示图标到流程线上,取名为“ch1”,然后拖动一个导航图标到它的右侧,会自动完成流程的连接,并弹出交互类型的对话框选择对话框中需要的交互类型;可以通过双击交互图标每个分支上的交叉点上的小图标来打开响应属性对话框,这个小图标同时也说明了交互的类型;(5)再拖动三个导航图标到右侧,取名为“ch2”,“ch3”,“ch4”,分别设置成另外三个分支的响应方式;(6)拖动一个计算图标到导航图标的右侧,取名为“退出”,在“退出”的结果图标中输入如下内容:“quit()”,“quit”这个函数是一个用来控制程序退出的函数。这样整个《花卉》电子流程的第一个分支就完成了,如图所示: 图 Authorware开发程序具体步骤二 3)回到流程图第一级,拖动一个群组图标到流程线上,取名为“ch2”,双击打开;(1) 拖动一个擦除图标到新的流程线上,用以擦除上一个页面;(2)接着拖动两个显示图标,取名为“背景”和“背景文字”,分别打开并输入相应的文本材料;(3)再拖动一个显示图标到流程线上,取名为“可动文字1”,打开并输入文字;(4)拖动一个动画图标到流程线上,取名为“动画设置1”,打开并设置动画方式和时间;(5)同理设置“可动文字2”和“动画设置2”;f 拖动一个交互图标到流程线上,取名为“返回”;(6)拖动一个导航图标到其右侧,双击打开,设置其应答方式,并设置其指向主画面。这样整个《花卉》电子流程的第二个分支就完成了。如图所示: 图 Authorware开发程序具体步骤三 4)回到流程图第一级,再拖动三个群组图标到流程线上,分别取名为“ch2”,“ch3”,“ch4”,制作类似于“4”的三个分支。 5)试用完成的程序,并做进一步修改。 6)程序初始页面如下图所示: 第 102 页
图 Authorware开发程序具体步骤四 设计开发多媒体电子出版物,关键在于电子版的总体规划设计,并要兼顾考虑信息的存贮容量,图、文显示和影、音重放质量等要素在各种不同机型上的播放效果。同时还应充分考虑适合各层次读者阅读能力,设计出友善的人机交互界面。只有这样,设计出来的多媒体电子出版物才有生命力。 习 题 什么是多媒体著作工具? Authorware 多媒体著作工具的特点有哪些?如何使用? 什么是多媒体教学软件?多媒体教学软件如何设计? 什么是多媒体电子出版物 ?简述多媒体电子出版物出版流程。 第 103 页
第7章 网络信息组织理论 网络信息组织概述 随着因特网的发展,网上信息资源的组织问题已经日益突出。网络信息在社会信息量中所占的比重呈日渐上升的趋势。今天我们从事的信息工作很重要的一部分便是将传统信息组织上网,或将网上信息下载供人们使用,而其中的关键是网络信息组织。如果说网络是开启通往世界的窗口,则网络信息便是窗口展示的内容,网络信息组织便是对窗子进行装璜和布局。 网上信息具有一些新的特点,主要表现为: 1)数量庞大、增长迅速。据估计,因特网每天大约要发布14万条新信息,总量约为450MB,全网提供的信息总量已经超过20TB; 2)内容丰富、形式多样。网上信息包罗万象、应有尽有,而且不限于传统的文本形式,还有大量的声音、图像、视频、动画等形式; 3)变化频繁、价值不一。因特网是一个动态的信息资源网,其中的信息始终处于不断增加、更新、修改、删除的发展变化之中,同时又由于因特网具有很强的开放性,其上的信息发布具有很大的自由度和随意性,加之缺乏有效的信息组织,所以网上信息的冗余度大、可信度小、质量不高; 4)结构复杂、分布广泛。因特网是通过TCP /IP协议把各种不同的计算机网络联成一体的,只要遵守该协议(其它协议则需通过一定中介)就可以接入因特网,因而导致网络的结构复杂,分布很广,网中有网,网网交叉。目前,我国互联网域名混乱的现象足以说明这一问题的严重性。 5)因特网对网上信息资源的组织却没有统一的要求。网上信息存储在世界各地的服务器上,而这些服务器采用的却是不同的操作系统和数据结构。故从整体上看,网上信息资源还处于无组织状态。 网络信息组织的含义 世界上万事万物都在产生和传播信息,这些信息需要加以整理和组织才能为人们所利用。因此信息组织是人们认识事物的基础也是认识事物的结果。网络信息是存储于网络并传播于网络之上的信息,网络是其依附的载体。网络信息组织是指人们根据网络信息本身的特点(或属性)、运用各种工具和方法,对网络信息进行加工、整理、排列、组合,使之有序化、系统化、规律化,从而有利于网络信息的存储、传播、检索、利用,以满足人们的网络信息需求的活动过程。因此网络信息组织的对象是网络信息,如网页(WWW)、Email、Ftp、 Gopher、BBS、Usenet等,其中以网页为主要存在形式。 网络信息组织同其他信息组织一样,即经过序化阶段和优化阶段两个过程对信息进行整序。语言学、逻辑学、系统科学、信息科学是其理论基础。网络信息组织既是理论又是方法,既是社会实践又是一种逻辑思维。网络信息组织是网络信息存储、传播、检索和利用的基础,并贯穿于网络信息资源管理的全过程。但是网络信息毕竟与传统信息有很大不同:从传播方式看,网络信息凭借计算机通讯网络将信息从一台计算机传送到另一台计算机,其传播速度、 第 104 页
质量明显高于传统信息,传播的时间、次数亦不受限制;从存储方式看,网络信息存放在网络计算机上,是一种形式分散、实质集中的存储方式;从呈现方式看,差异更为明显,网络信息以web页的方式通过浏览器呈现给用户,网页包含的交互式多媒体极大地增强了信息表现力等等。由于存在以上特点,所以网络信息组织较之其它类型的信息组织必然存在较大差异。 网上信息组织的信息对象的类型有信息型、商务型、组织型、专题型和个人型。信息型有图书馆数据库等、商务型有公司网页等、组织型有教育站点网页等、专题型有旅游、财经等信息网页、个人型有个人简历等。 网络信息组织方法 网上信息的出现给传统的信息组织方法提出了新的挑战。具体表现在一下方面: 1) 网上信息组织需要实现自动化。随着因特网的发展,信息组织的对象已经从各种类型的数据库发展到具有丰富内容的知识。传统的信息组织方式大多数属人工方式,其中的著录、标引等都是通过手工劳动实现的,而词表的编制和维护一般也是通过手工方式进行的。但是现在网上出现的大量信息是实时信息、全文信息、多媒体信息,而且时效性很强,这就要求信息组织的方法必须要适应这种变化。具体地说,就是要尽可能减少信息组织中的中间环节,尽可能缩短信息组织所需要的时间。为此就要实现信息组织的自动化,包括分类、标引、编目、索引、文摘、词表编制等方面的自动化。 2) 网上信息组织要从纯文本向多媒体方向发展。由于网上的信息除了大量的文本形式外,还有许多的非文本形式,比如图形、图像、声音等,这些信息没有文献信息那样易处理格式,因而需要探索新的信息组织方法。 3) 网上信息组织要求从数据结构转向知识表示。网络环境下信息用户的成分将越来越复杂多样,但由于大多数信息用户没有接受过专门的训练,这必然要求网上信息组织方式要易于用户理解和使用,换句话说,就是要使用一般用户自己熟悉的语言来组织信息,显然传统的高度专业化的信息组织方式已经不完全适合需要。 凡是能将网络信息有序化的方法都是网络信息的组织方法。方法的种类多,划分的途径也多,如分为思维领域的组织方法和实践领域的组织方法,或分为宏观领域的组织方法和微观领域组织方法,或分为内容特征组织方法和形式特征组织方法等。但是这些划分并不十分完善。如果按照一切事物都具有形式、内容、效用三个方面的特征或属性来划分则比较全面、合理、科学,并有较强的实际作用。据此,网络信息组织方法可归纳为语法信息组织方法、语义信息组织方法和语用信息组织方法。其方法分类体系如下表所示: 字顺组织法(形序、音序) 语法信息组织方法 代码组织法 地序组织法 时序组织法 其它组织法 元素结构组织法 逻辑组织法 网络信息组织方法 语义信息组织方法 分类组织法 主题组织法 超.级.链.节.组.织.法. 权值组织法 概率组织法 语用信息组织方法 个性组织法 数.据.库.组.织.法. 重要性递减组织法 表网络信息组织方法 这些组织方法仅是理论分解的产物,在实际使用时往往是多种方法综合使用,目的是让信息组织得更加有序,更加符合人们的认识规律。如主题法与分类法共同使用形成分类主题一体化的组织方法;主题法的主题词,分类法的类目通常按字顺排列,因而又采用了字顺法; 第 105 页
分类法的类目常需编码(即分类代码),毫无疑问又用到代码法。因此更准确地说,网络信息组织方法是综合方法,是若干种方法共同作用的结果。 上述方法绝大部分与传统信息组织方法本质上是相同的,只是某些方法因使用的对象不同而略有差异,如分类法用到网络信息组织必须进行相应修改,网络DDC与传统DDC有较大不同。 目前网上信息组织的主要方式大致有四种:文件方式、数据库方式、主题树方式和超媒体方式。 1.文件信息组织法 文件是计算机存贮数据的重要方式,需要长期保存的数据,计算机都将其保存为文件。从最终式样看,网上所有的信息,无论它表现为WWW,还是BBS,还是……,都以文件的形式存放在网络上,我们这里关心的是在网上直接表现为文件形式的信息,如大量存在的FTP文件即是如此。 2.数据库信息组织法 数据库在网上广泛存在,可以说,网上质量高的信息大多表现为数据库。除了提供信息服务的大量文献数据库外,在网上在存在着如客户数据库、市场行情数据库、竞争对手数据库、新产品开发数据库等与企业密切相关的数据库。网上的数据库需要通过CGI等通用网关程序才可以为用户所检索。但通过数据库方法组织信息对数据的安全保护有积极意义。 3.主题树信息组织法 主题树信息组织方法就是将信息按照某种事先确定的主题概念体系分门别类地逐层加以组织,用户通过浏览器的方式层层递进遍历,直到查找到所需要的信息线索,再通过信息线索联结到相应的网络信息单元,如果用线条从最高主题层层连接到最低主题,所形成的图即是一树状图,故此得名。该方式具有严密的系统性和良好的可扩充性,但它组织和检索费时、费事,且主题得选定带有很大主观性,所以不大适合大型的综合性网络信息系统,只有建立专业性或示范性的网络信息系统时才能体现出它的优点。 4.超媒体信息组织法 超媒体信息组织方法是在超文本和多媒体技术相结合的基础上产生的信息组织方法。所谓超媒体是指超文本与多媒体的有机结合。超文本比较适合表达多媒体信息。超文本是按照人脑的联想思维方式非线性地组织信息的一种技术。可以简单地将其定义为:由“结点”(node)和表示结点之间关系的链(link)组成的网,用户可以对网络中的信息进行浏览、查询、加工、存储、编辑和注释等操作。 从计算机信息组织的角度来看,超文本首先是一种数据库方法,它提供了一种沿链访问数据库的新方法。 其次,超文本是一种表达思想的方法、一种思想工具,是一个类似于人工智能中的语义网式的表达方法。它可以在各种媒体的信息之间建立语义联系,因而超越了媒体类型对信息组织的限制。 最后,超文本还是一种接口技术,它采用“控制按钮”的方式组织接口。超文本可以看做是结点、链和网络这三个要素的结合。结点是表达信息的一个单位,它表达信息可以采用文本、图形、图像、音频、视频、动画甚至一段计算机程序等方式。不同系统中节点的表示方法也不同,一般以窗口的形式显示。链在超文本中用来连接结点,它有隐性和显性之分。显性链又可以划分为索引链和结构链两种。网络是超文本中由结点和链构成的一个有向图,其中结点用以表示概念,结点之间的链表示两个概念之间的关系。超文本的结构可以看做是单一概念或思想的表达,结点之间的链则表示概念之间的语义关系。超文本网络也可以看作是一种知识工程,但与人工智能的知识工程不同,超文本作者的目的不是为了进行机器的推理,而是将各种思想、概念组合到一起以便浏览。 第 106 页
5. 网上信息组织的新方法 数据库与超媒体技术的结合将是网上信息组织方法发展的新方向。目前,人们提出了三种结合途径。 1) 通过超级链接联结数据库 这种方法是数据库作为超媒体系统中的一个独立的特殊结点,由特殊的链接(某种转换机制)将数据库结点和其他超媒体结点连接起来。超媒体系统中的其他结点如要访问数据库中的信息,需要将访问请求转换成数据库查询语言,其结果也需要转换成超媒体所规定的格式。这种途径最容易实现。目前WWW与数据库的连接一般都采用这种方法。具体地说,要实现数据库与超媒体的结合可有多种方法,其中比较常用的有五种。 (1)CGI(common gateway interfere)。它是WWW服务器与外部应用程序的通信规范接口,其过程是用户从WWW客户端的FORM表单发送查询请求,WWW服务器激活CGI程序,CGI程序把用户请求嵌入数据库SQL语言中,交由数据库服务器处理,处理后的查询结果由数据库服务器在交给CGI程序,由WWW服务器解释成HTML语言格式文件,返回客户端。该方法因为是“量体裁衣”的,所以它的可移植性较差。 进行CGI编程需要了解服务器环境变量,它是前端用户提问与后端数据库联系的中介。由于服务器环境变量较多,我们仅将一些常用的变量在下表中列出: ALL_HTTP:客户端发送的所有HTTP标题文件。 CONTENT_LENGTH:客户端发出内容的长度。 CONTENT_TYPE:内容的数据类型。如:“text/html”。同附加信息的查询一起使用,如HTTP查询GET、POST和PUT。 LOCAL_ADDR:返回接受请求的服务器地址。如果在绑定多个IP地址的多宿主机器上查找请求所使用的地址时,这条变量非常重要。 LOGON_USER:用户登录WindowsNT的帐号。 QUERY_STRING:查询HTTP请求中问号(?)后的信息。 REMOTE_ADDR:发出请求的远程主机(client)的IP地址。 REMOTE_HOS:发出请求的主机(client)名称。如果服务器无此信息,它将设置为空的MOTE_ADDR变量。 REQUEST_METHOD:该方法用于提出请求。相当于用于HTTP的GET、HEAD、POST等等。 SERVER_NAME:出现在自引用URL中的服务器主机名、DNS化名或IP地址。 SERVER_PORT:发送请求的端口号。 (2)API技术(application program interfere)。该技术克服了CGI技术运行速度较慢,容易形成性能瓶颈等方面的限制,但它需要程序员有较高的编程技巧。其中比较著名的有Netscape公司的NSAPI和微软公司的ISAPI。 (3)Active X技术。它是微软公司提出的基干DCOM(distributed component object model)的可重构建技术,其方法是运用VB、VC等面向对象对象语言先编写一个Active X控件,其中包括用户可能需要访问数据库进行的各种操作,即事件和属性,以后超媒体系统如果需要访问数据库,就将该Active X控件嵌入相应的WWW页面。这样浏览器就会自动地从网上获取Active X控件并通过它实现对数据库的访问,如ADO组件就是一例,目前广泛运用的ASP技术即是建立在此基础上。具体说ActiveX组件是一个存在于WEB服务器上的文件,该文件包含执行某项或一组任务的代码,组件可以执行公用任务,这样就不必自己去创建执行这些任务的代码。例如,股票行情收报机组件可以在WEB页上显示最新的股票报价。当你在WEB服务器上安装完ASP环境后,就可以直接使用它自带的几个常用组件,如Database Access组件。当然也可以从第三方开发者处获得可选的组件,也可以编写自己 第 107 页
的组件。利用组件作为脚本和基于WEB应用程序的基本构造块,只要知道如何访问组件提供的对象,就可以在不了解组件运作方式的情况下编写ASP程序。总而言之,利用ActiveX组件不用学习复杂的编程就能够写出强大的WEB服务器端脚本。如果你是位WEB应用程序的开发者,可以使用任何支持组件对象模型(COM)的语言来编写组件,如,C、C++、Java或Visual Basic。如果你熟悉COM编程,ActiveX组件就是Automation服务器。但是要在WEB服务器上运行,ActiveX组件不能有图形用户接口元素,如Visual Basic的MsgBox函数。组件是可以重复使用的。在WEB服务器上安装了组件后,就可以从ASP脚本、ISAPI应用程序、服务器上的其他组件或由另一种COM兼容语言编写的程序中调用该组件。 (4)ODBC技术(Open database connectivity)。ODBC是微软公司开发的异种数据库互联技术,它提供了对多种类型数据库的连接技术,通用性的提高是以牺牲速度微代价的,WindowsNT支持ODBC技术,因而可以用ASP或IDC方便地访问服务器上地数据库。为大规模地发展C/S、B/S系统提供了捷径。 (5)JDBC技术(Java database connectivity)。JDBC与ODBC非常类似,但据说性能更好一些。它是用Java语言设计的访问数据库的API,其目的是使Java程序与数据库服务器的联结更加方便。Java应用程序访问数据库过程是:用户通过浏览器从WWW服务器上下载含有Java applet(即Java小应用程序,可直接嵌入WEB页)的HTML页面。如果该页面调用了JDBC,则该浏览器直接通过JDBC与指定的数据库建立联接。 2) 在数据库上附加链服务 这种方式就是将数据库模式存储的数据信息根据需要重新组合,构造成超媒体的虚拟结点,在此基础上根据信息之间的内在联系建立结点(包括虚拟结点)之间的链接。这样,超媒体系统就能够以更自然的方式与数据库中的信息建立链接,而不再需要特殊的转换机制。由于数据库中存储的信息量大、内容庞杂,要建立起虚拟结点和结点之间的链接是非常困难的。 3) 建立超媒体结构的数据库系统 这种方法就是以超媒体模型代替传统的关系式或面向对象模型来构建数据库系统。超媒体模型是采用超文本技术组织多媒体信息的数据模型,以此模型为基础建立数据库系统,可以充分体现各种类型媒体之间的自然联系,从根本上克服超媒体系统与数据库系统在结构和功能上的差异。但是,超媒体数据库的理论目前还很不成熟,将其全面地应用于使还为时过早。 网络信息组织的步骤和艺术 网络信息组织主要表现为网页的设计,所以本节以网页的设计为例介绍网络信息组织的步骤,它包括:设计大纲、确定发布的内容和风格、具体设计、试发布、修改和维护。在网页设计时应注意有些技巧和艺术,每个人、每个网站有所不同,但下面的技巧是值得重视的。 1) 首页精简:首页是门户,一般的网页在首页都有体现。因此首页的设计以醒目为准则,避免过多堆砌,让人抓不住要点。 2) 页面要简朴,避免过多图片和音频、视频信息。过多图片和音频、视频信息会大大降低访问的速度,还会影响网页信息主题的传达。 3) 确定一个好的标题(title),并在各大搜索引擎注册登记。 4) 在<meta>中填入恰当的语词,如关键词、作者、描述等,方便搜索引擎的搜索。Meta在本章后面有介绍。 5) 有丰富链接和完善的导航功能,为用户提供尽可能多的选择。 6) 页面颜色搭配应庄重而不影响活力,朴素而不影响美观,简洁而不影响表达。 7) 少用帧(Frame)多用表格。 第 108 页
8) 少用闪烁文字和动态效果。 9) 经常更新,否则用户和搜索引擎会很少光顾。 10)少用非标准技术和ActiveX组件。 11)内容与标题应吻合,避免语法和字词、标点符号错误。 12)避免使用无用图象和无效链接。 网络信息组织工具 网络信息组织除需用组织方法以外,还需借用一定的工具方可进行。这些工具主要有两大类,即创作工具和语言工具。 1.网络信息组织创作工具 创作工具是指网页制作软件,利用它,创作者无须懂得编程即可将信息组织成具有一定水平的网页。常用的创作工具有word2000、Frontpage、dreamweaver、Pagemaker、Navigator Communicator的Composer等。还有多媒体著作工具Authorware等依靠Shockwave技术可将制做好的多媒体系统快速发布到网络上,缺点是不能任随主观意愿创作出高水平的或特殊需要的网页。 2.网络信息组织语言工具 网络信息组织语言工具正好弥补了创作工具的不足,创作者可以充分运用各种编程技巧以制作出高水平的精美的网页,甚至能完成发布网上数据库等一些创作工具所不能完成的网上信息组织工作。常用的语言工具有HTML、JavaScript、VBscript、Java、XML、ASP等。 HTML是超文本置标语言,它可以组织并以某种效果显示网络信息。 JavaScript和VBscript都是一种描述性的脚本语言,它们的功能比HTML强,可与HTML语言混合编程,只是它们的开发商不一样。 Java语言是一种简单、面对对象、独立于平台、多线程、动态的和通用的网络语言,所以它特别适合于网络信息组织,它不仅可单独执行,还可以Java Applet方式嵌入网页运行,它与Java Script及HTML语言一起极大地丰富了网页的动态交互及媒体呈现能力。运用Java语言工具可使网络信息组织有卓越不凡的表现。 网络信息组织评价指标体系 由于在解决知识获取与传播过程中提供了很多方便、有效的信息工具,Internet在近十多年的时间里迅速发展成为世界第一大计算机网。到1999年6月,Internet将拥有主机3亿多台,用户超过15亿。但在如此这样一个庞大的网络社会里却没有相应的管理机构,无许可的自由进入和退出导致网站频繁出没和网民(netizen)的良莠不齐,进而导致网站信息内容的优劣不分,从而在一定程度上影响了Internet的现实效果甚至未来发展。因此,开展对网站信息内容等方面的评估,规范网络秩序,保证Internet健康有效地运营和发展,保证用户快速、有效、安全地搜寻网上信息显得十分必要。 网站以网页的形式凭借通信网络载体突破时间和空间的限制,以交互的方式发布多媒体信息,所以对其评估应包括信息内容的评估和技术内容的评估。 网站信息内容评估 1.影响力 1) 访问人次数 第 109 页
网站对用户的吸引力的大小直接表现为访问人次数的多少。一般网站的主页均设有计数器,它可以对访问人次数进行自动统计。这种统计分为全程累计和每日累计。在具体分析指标时可进一步考虑日平均人次数、月平均人次数、年平均人次数等,以考察平均影响力,或根据职业、年龄、文化程度等类别特征对访问者进行分类统计,以考察网站在不同用户群中的影响。 2) 访问时间 它包含访问时间长度和访问进入时点两个指标。访问时间长度是指访问者自进入网站到退出网站的时间跨度,访问进入时点指访问者访问某站点时的连通时点,它与访问人次数结合可计算出访问时间人次分布率。访问时间是衡量网站影响力的一个非常重要的指标,根据访问时间长短可排除偶然访问者,访问进入时点和访问时间人次分布率对判断非常事件(如网上直播、发布重大新闻等)对网站的影响状况尤其有用。 3) 引用比率 网站影响力还表现在有多少用户引用该网站网页的信息。这里又有两个指标,一是在网页上设有该网站链节点的网站数,即机构引用率。二是引用该网站网页信息的论文著者数,即个人引用率。 4) 所属机构权威性 网站是机构在互联网上的代表,机构的权威性直接决定了网站的权威性。 2.具体内容 网站总要发布一定的内容以表达发布者的意图,网站信息的含量高低、准确性、可靠性、合规性对网站有着至关重要的意义和影响,也是网站评估的主要方面。用户对信息既有量的需求也有质的需求,试想一个空洞无物、错误百出的网页能对用户产生多大吸引力。当前网上暴力、色情的信息并不少见。因此,加强网络管理,制定相应法律法规,使网页内容合乎规范是十分必要的。因而具体内容评估应包括内容的质量、可靠性、合规性等指标。 3.表现形式 信息总是要通过一定的形式表现出来。如网页制作是否美观、合理在一定程度上影响用户访问的兴趣。评价指标有: 1)美观性 评价指标内容有:颜色搭配(即字的颜色、背景图案及内嵌图片之间颜色是否协调)、字体选择、图像图形、音频视频、提交按钮、页面帧、提示框的选择安排是否美观大方等。 2)条理性 评价指标内容有:主次问题如何处理,结构如何安排,节点与节点之间如何链节等 3)科学性 评价指标内容有:分类采取什么标准,检索词是按照主题还是类别组织的,信息之间的逻辑性如何等。 网站技术内容评估内容 1.性能 性能评价主要从硬件和软件两方面进行,其中安全性、可靠性、运行速度尤其重要。 l 硬件:网络结构、网络传输介质及速率、网络安全性、服务器性能及服务器的数量类型等。 l 软件:网络操作系统性能、数据库性能、网关接口性能、Ftp服务器文件下载便利性、Web的响应速度、 Search的查准率与便利性、反病毒反“黑客”入侵能力等。 2.维护 网络的正常运转有赖于日常维护。评估日常维护工作可从服务器日均非正常中断次数、 第 110 页
网页月更新次数、用户权限和网址过滤是否采取措施、管理员的技术水平和责任心、规章制度是否完备合理等方面入手。 在具体操作时,对以上两大因素、若干小因素分别设定权重,再与所评得分相乘即得综合评价。当然,也可从经济角度进行评估,如成本-效益分析法。对评估结果应在网上公布。为此,应在互联网上建立评估机构网址(如),除最高域名外其它均一致,这样既起到了对网站监督作用又方便了用户的信息搜寻。 信息组织方法在网络信息组织中的应用与发展 主题法和分类法在网络信息组织中的应用与发展 1.网上分类法与主题法的使用 分类法和主题法是信息组织最为重要的两种方法。主题法广泛运用于所谓的门户网站,由于没有采用统一的主题表,故每一网站使用的主题往往不尽相同,所以统一改编现有的针对印刷型文献的主题表使其适用于网上信息组织活动迫在眉睫。 分类法在网上信息组织中使用得最多,如yahoo分类索引共有14大类,sohoo包括18个大类,它们都囊括了社会生活的各个方面,它们开创了网络分类法的先河,是网上信息组织和检索的事实标准。但由于没有统一规范,所以目前存在许多问题,如体系不统一、类目不规范、分类缺少指引、无分类代号、层次不近合理等,总体上说缺乏统一控制。所以专家呼吁,要尽快规范之,目前最现实的解决方法是将现有的分类法移植到网上来。如DDC正在向网上扩展,我国的代表性的分类法—《中图法》也应朝这个方向发展,即考虑新的使用对象—网络信息进行网络信息分类的原则有:直接性原则、实用性性原则、自然性原则、快捷性原则等,根本上要使分类具有简明性、实用性、科学性和开放性。 目前广泛流行的针对网上信息资源分类组织的元数据Metadata——DC,是用来描述网上信息资源的,而另外一种语言XML对网上信息资源也有很好的描述和规范作用,并且XML可以描述网络MARC格式。可以说,它们代表了未来信息组织分类法的发展方向。 2.Metadata简介 Metadata被定义为“关于数据的数据”(data about data)或“描述数据的数据”(data that describes data),通常译为元数据,即是描述任何Internet数据和资源的数据,是促进Internet信息资源的组织和发现的有力工具。网上搜索引擎就是通过搜索网页内嵌的META元素,来描叙该页面的。 Metadata非常类似于图书馆的书目卡片,图书馆书目卡片记录了图书题名、著者、出版者、分类号、主题词、ISBN号、流水号以及馆藏号等特征信息。与此类似,Metadata则描述了某Internet站点的资源类型、Web页面的标题、作者、主题及关键词及内容摘要等信息。面对目前Internet上汪洋般的且正在迅速增长的信息资源,许多人惊呼,泛滥的信息洪流正在把我们淹没!专家呼吁,我们应当以图书馆员的思维方式,以业已成熟的图书情报学理论和方法对这些资源进行组织和管理,目前象OCLC等机构正在尝试这项工作,并已取得了可喜的进步。 Metadata存在的目的就在于使Internet上的Web页面“更象一个图书馆,而不象一堆满地板乱扔的肮脏书籍”。组织Internet资源并促进Internet资源的发现是Metadata的基本功能。更具体而言,Metadata有以下用途: ·描述和组织Internet数据据内容 ·方便Internet信息搜索 第 111 页
·允许用户决定所需要的数据 ·防止某些用户(如孩子)非法存取某些数据 ·让用户可以重新得到或使用数据的另一份拷贝 ·指导怎样操作和理解数据(如说明数据的格式是什么,采用什么样的编码方式,怎样进行解密等等) ·给出影响数据使用的一些信息(如数据使用的法律条件,数据使用的范围,数据使用的时限等等) ·给出数据的联系信息(如给出数据拥有者的EMail等使用本数据所需的其它数据和程序) ·对数据管理的控制 ·对某些缺少文本的数据(如图像)进行文字说明 Metadata的内容是通过meta标记来描述的。Metadata由一组有关资源的各个方面的属性组成,每个属性包括一个属性类型和一个或多个属性值。在HTML文件中,最常用的Metadata标记是“description”和“keywords”项。“description”给出某个HTML文件的摘要信息,而“keywords”则给出这个HTML文件的关键词。 例如 〈HEAD〉 〈TITLE〉National Digital Library〈/TITLE〉 〈META name="description" content="You can retrieve anything you want to know"〉 <META name ="keywords" content=" digital book,digital periodicals, database, pictures, films, file , manuscripts”〉 〈/HEAD〉 在上面的例子中,“name=”后面的description和keywords标记即是属性类型,而“content=”后面的内容则是属性值。 被称为下一代网络语言的新型标记语言XML环境,产生了多种Metadata规范,其中较有影响的有都柏林核心元素Dublincore及PICS、Web Collections、CDF、MCF、RDF等。将这些规范进行合理统一并制定出一种灵活的,能够支持多种Metadata规范的Metadata标准,是目前Metadata研究领域内的一个难题。本节仅介绍两个较有影响的Metadata规范。 3.Dublin core Dublin Core是Dublin Metadata Core ElementSet的简写,它是一个由15个Metadata标记元素组成的Metadata系统,其主要目的是为了揭示和组织网上信息资源(包括文本及图像等)。Dublin Core的发明者是网页制作者,他们用它来描述网页制作的基本情况。一些正规的资源描述团体,如图书馆和博物馆组织,注意到这是一种非常好的资源描述方式。在1995年末有关组织对这种资源描述方式进行了规范,确立了目前仍还在使用的15个Metadata标记元素。现在Dublin Core已被产业界、学术界、研究开发领域、及图书馆情报界的广泛接受。 Dublin Core的15个Metadata元素是: 序 号 元 素 中 文 含 义 1 Title 资源文件名 2 Author of creator 资源作者或创建者 3 Subject and Keywords 资源的主题词或关键词 4 Description 资源简要描述 5 Publisher 出版者 6 Other Contributors 其它对此资源有贡献的人 7 Date 时间 8 Resource Type 资源类型 第 112 页
9 Format 资源格式 10 Resource Identifier 资源标识 11 Source 来源 12 Language 语言 13 Relation 与基它资源的关系 14 Coverage 覆盖范围 15 rights Management 版权管理 应该说,Dublin Core中整个元素集都是可扩展的,其中的每一个标记元素都是可重复使用或有选择的使用。每一个Dublin Core的Metadata元素都有可以有子类型和子模式。目前Internet上的网页,大多数都带有符合Dublin Core规范的Metadata。下面是一个使用Dublin Core对一篇网页进行描述的例子。 〈META NAME="" CONTENT="Metadata:Enabling the Internet"〉 〈META NAME="" CONTENT="(SCHEME=keyword)Metadata,Dublin Core,PICS,Resource Discovery"〉 〈META NAME="" CONTENT="(TYPE=name)Renato Iannella")〉 〈META NAME=""CONTENT="(TYPE=affiliation)DSTC Pty Ltd"〉 〈META NAME=""CONTENT="(TYPE=name)Andrew Waugh"〉 〈META NAME=""CONTENT="(TYPE=email)@"〉 <META NAME="" CONTENT="(TYPE=affiliation)CSIRO"〉 <META NAME="" CONTENT="(TYPE=name)DSTC Pty Ltd"〉 <META NAME="" CONTENT="(TYPE=creation)(SCHEME=ISO31)1997-01-20"〉 META NAME="" CONTENT="(TYPE=current)(SCHEME=ISO31)1997-01-20"〉 META NAME="" CONTENT="(TYPE=url) <http:// META NAME=""CONTENT="(SCHEME=iso639)en"〉 与其它Metadata相比,Dublin Core主要有以下优点: (1) 简单,Dublin Core的15个标记元素通俗易懂,就如利用目录卡片描述电子资源一样,直接了当。 (2) 灵活,它既可以用于专业的正规的资源描述领域,又可以用于非专业领域(如主页制作者自己使用)。用户可以根据需要,附加上一些额外结构,或对语义进行更精确的定义。国内已有学者开始依据某些Metadata标准制定适用于网上信息描叙的MARC标准,实践证明这是将MARC推向互联网时代的有益尝试,有关文献请参考《情报学报》等杂志。 (3)国际一致,Dublin Core得到了来自英国、澳大利亚、瑞典、丹麦、挪威、芬兰、德国、法国、日本、加拿大,及美国的专家的积极参与。就目前来看,Dublin Core俨然是一个国际范围内通用的适用于资源发现系统的Metadata标准。 4.PICS 由W3C(WWW Consortium)组织开发的PICS(the Plateform for Internet content selection,Internet内容挑选平台)是另外一个旨在描述Internet资源的Metadata标准。1995年8月,一些Internet上的主要团体聚集在一起制定了这一规范,他们的初衷是方便或拒绝某些用户的信息查找,但现在PICS可以被用于多种不同的目的,例如数字签名、知识产权管理等等。 引入内容分类定级机制是PICS最为显著的地方。不同的组织可以根据他们的目的及价值取向,对Internet上的资源进行分类定级。PICS设计了一系列的分级系统,以确保网上信息的分级过滤,使不同级别的信息用户只能使用不同安全程度的信息。它们是: 第 113 页
l 自我分类定级 l 第三方分类定级 索引法在网络信息组织中的应用与发展 索引法是信息组织的重要方法之一,由于索引法可以帮助人们有效地组织和检索信息,它在传统文献组织中一直占有十分突出的地位;由于同样原因,它在网络信息组织中也得到了广泛运用。 1.索引法的基本原理 索引是以揭示具体信息线索,显示单一的概念、事实、数据等与特定的信息现象或实体集合之间的联系为目的而制作的信息记录,是揭示和检索信息的工具。索引是索引记录单元的有序集合,每一索引记录单元由索引标目项和出处项组成,索引标目项可以是一切可供检索的对象,其符号表现可以是语词、代码、图形或图像等;出处项即是所揭示信息的定位标识,它指明标目项的出处或存贮地址。索引法的基本原理可用图表示: 标目项 出处项 信息实体 图 索引法原理 2.链接—索引法在网络中的应用 超媒体技术是网络信息组织的基础。网络信息依靠超级链接将信息单元按其之间的内在联系组织成一个有机统一体,它表现为网状的非线性结构,且每个信息单元称为一个节点每一个节点以一个网页展示,它可以包含单媒体,也可包含多媒体;每个网页又以一个文件存放,节点与节点之间采用超级链节联系起来。 超级连接与索引法是非常类似的,都有标目项、信息实体以及它们之间的联系中介。区别在于索引法在标目项与信息实体之间的联系中介是出处项,而超级链节从逻辑层次上没有这一项,但在物理层次上计算机是靠文件的存储地址实现信息实体定位的,形式上联系中介表现为超级链节。所以从本质上看,链节是索引法在多媒体和网络信息组织中的具体运用。不论是网页内部、网页与网页之间,还是网站与网站之间都体现着这一本质特点。 主题法和分类法在网络信息组织中通常是同索引法一起使用的,单独使用主题法和分类法的现象比较少见。如yahoo网页条目按主题进行分类,共有50个最流行的分类,它们是树状结构的主题分类索引。一方面,分类法的线性排列的等级体系不适合于超文本系统的管理;另一方面,主题法虽然能反映概念间的复杂关系,但除在网络检索工具站点的主页上有较多出现外,在大量的非检索工具网站的网页上使用并不是太多,即使使用也是用来规范索引标目项的。通常,索引法和分类法在组织索引标目项时多在中首页,随着网页逐层向下展开,这两种方法逐渐丧失它的地位,也就是说,主题法和分类法在独立索引中有重要作用,而在单一索引中几乎无太大价值。 综上所述,如果每一网站都采用统一的主题词表并配以统一分类法为网页编制索引,将会大大提高人们利用网页的效率。而对非文本的信息还要采用统一编码标准,并辅以必要的分类措施,当然也可以用非文本信息点作索引标目项,如东方网景有许多风景画即是直接用图片作标目项的,不过作为索引的图标字节数几乎只有原图像的百分之一。 3.搜索引擎深刻体现着索引法在网络中的应用 在1993年之前,多数用户查找Web信息是从一个URL开始,沿超级链接搜寻。显然, 第 114 页
这种方法要想在具有海量信息的网上检索到所需的信息非常困难。一些站点依靠人力搜集一些网址,并按主题或类目组织起来供用户查询,这种方法颇费时力。1994年出现了搜索引擎(也被称为robot 、spider、 scooter等),它是一段程序,能沿着WWW超级链节在网上漫游,采用广度优先和深度优先两种算法搜寻。不过它首先要从网页制作者注册到检索网站的网页开始,一旦发现新网址,robot即记录下URL以便再次访问,如此,新网址即被索引直至没有为止,并从标题、META tags等表征特殊文献,但不从页面显示的信息行抽取相关信息作为标引项,结果形成分类系或主题树供用户查询。但不是所有检索服务都采用robot,如yahoo就没有。到目前为止比较成熟的Robot有Infoseek、Ultraseek以及Alta Vista 的Scoter和Excite 的Architext。 Robot以一定速度定期(通常一周到一个月)更新,访问速度大不相同,Alta Vista 每天搜索250万网页,Open Text 则是5万页。其索引范围也有较大差异,由此决定了检索工具各自的特色,如alta vista 全文索引,open text仅索引web、gopher和ftp,lycos索引页名、网址、子标题、文本的前的20行和100个加权词。yahoo索引范围是 web和新闻组。 用户正是凭借robot建立起的庞大的索引库,才在网上较为容易实现检索目的。 网络信息的类型及其组织 我们对网络信息资源的类型的划分通常是根据因特网上信息资源的特征和表现形形式,如WWW、BBS、EMAIL等,但从人们对网络信息开发利用的需要,我们可以把网络信息划分为一次信息资源和二次信息资源。下面对此问题介绍一下。 网上一次信息的组织与管理 面向信息网络组织的信息通常来源于两个途径,一是网外丰富的文献信息资源,二是直接投入信息网络数字化的信息资源。这两种信息源最终都要成为网上的数字化信息。如同一次文献的生产一样,我们把这种经过数字化的信息称为“网上一次信息”。网上一次信息来源广泛、种类繁多、内容复杂、包罗万象。网上一次信息主要有以下组织方法: 1) 主页方式(Home page) 按WWW主页形式组织信息是目前网上信息组织的主要方式,它将有关信息集中组织在一起,以节点为基本单位,节点间以链路相连,形成一个信息的网络。用户可以从任一节点开始,根据网络中信息间的联系,从不同角度浏览和检索信息。目前因特网上绝大部分一次信息均采用这种组织方式。 2)电子邮件 电子邮件是目前网络上传播和使用的另一个主要信息资源,它是完全一次信息源。由于它不属于公开发表的信息,且信息质量、信息的价值都很高,所以它对企业的竞争情报的开展,对一个国家的竞争力的确立都有不可小视的作用。一些发达国家意识到电子信息资源对于一个国家的经济、社会乃至国家安全都有相当重要的作用,如美国投巨资构建了全球电子邮件监控系统,对世界各国的电子邮件进行监控、截取、分析,从中提取有用的信息资源;另一种电子邮件是半公开的电子邮件群,它的信息价值非常大,许多专家学者在这里讨论各种问题,由于它的广泛性和及时性,各种观点发表及时,反馈及时,从而大大推动了学科的发展。 3)BBS BBS是思想的宝库,是情报的海洋,是智慧的源泉,它不仅提供了相当可观的一手信息资料,还提供了许多有益的思想和决策信息。在现代企业的战略管理中,对BBS信息资 第 115 页
源的搜集、处理和分析是不可缺少的一环。为此许多大公司纷纷设立自己的网站,建立以自己企业为中心的垂直型网络社区,增强用户对企业的信任度。 4)Usenet、Newsgroups 网络新闻一般也属于一次信息源,它的新颖性很高,有些网站的新闻甚至比传统的媒体如电视、广播、报纸还要快。 网上二次信息的组织与管理 一次信息入网后,如何快捷、高效地从浩如烟海、急剧增长的网上一次信息中找到用户所需要的信息,是非常不容易的,虽然信息网络集成了各种现代信息技术,但由于各种原因,最主要的是缺乏统一的信息组织标准,所以不具备将网上信息资源自动转换为用户所需特定信息的情报功能。为此需要将信息学关于知识信息组织的理论、原理和方法应用于网络上的信息层次控制,构建网上一次信息检索工具和途径。将网上一次信息源经过替代、重组、综合、浓缩后形成二次信息源。二次信息源经过二次替代、重组、综合、浓缩,输出三次信息源,成为书目之书目、文献指南、综述、述评之类的信息产品。 目前网上二次信息的组织主要有下列形式: 1) 搜索引擎(Search engine)形式。 这是目前因特网上对网上二次信息进行组织的主要形式,如Hotbot,yahoo,Altavista,Archie,中文的如新浪、网易、北极星、263、指南针、网典等,它是一种报导、存贮、指引网上一次信息的检索工具。用户在搜索引擎上输入自己的检索提问,由搜索引擎自动将其与存贮在服务器上的索引库内信息的特征进行比较匹配,将符合用户要求的网上一次信息的网址或网页显示给用户。现在许多搜索引擎支持对检索结果进行二次检索功能,按相关度进行排序,有的还支持自然语言检索,多语种检索,基于内容的多媒体检索等等。 网上搜索引擎一般包括搜索软件,索引库、算法三部分,搜索软件负责采集网络信息和数据,索引库是存放搜集来的网页或网页信息,算法是关于诸于如何搜索网页、如何标引网页、如何对网页自动摘要、提问如何与数据库匹配等问题的解决方法。 2) 菜单索引方式(Menu type) 这种方式主要用来组织用于浏览的网上二次信息。在网络环境下,浏览检索的重要性日渐突出,用户越来越多地通过浏览检索来确定其尚不清晰的信息需求,并初步了解网上一次信息的内容,根据需要及时调整检索策略,这就是所谓的网上信息检索的动态策略。动态策略的发生,有两种因素起了重要作用,一是在交互过程中是否出现问题,二是在完成新的意图后是否继续原来的交互意图,这两种因素的作用形成交互意图的4种类型。 不继续 继续 没问题 计划变更 机会变更 有问题 选择变更 辅助变更 以菜单方式组织的网上二次信息本来是一个超文本文件,一般是围绕某一专题,采用分类法、空间法、时序法、主题法、字顺法等方式,将与该项目有关的网上一次信息的线索(一般是其地址)和有关描述信息依次排列,供用户浏览选择。一般习惯称为栏目或频道。这种方式类似于手工检索中在某一专题下对款目的浏览。由于菜单方式组织的网上二次信息专题性较强,且能较好地满足族性检索的要求,因而受到用户的欢迎。目前因特网上的大部分网站的首页都有菜单索引的身影,如yahoo、sohu、sina、等,均是以菜单方式组织网上二次信息范例。 对网上一次信息进行加工,运用搜索引擎和菜单索引等方式组织成网上二次信息,从而使网上一次信息进入二次信息领域,实现了对网上一次信息的控制,在逻辑上序化和优化了网络信息资源,为充分开发利用这种资源提供了前提条件和可能。网上二次信息源的存在使 第 116 页
网上信息流得以控制,使信息流的流量得以测度,使信息流向得以合理调节,使日益泛滥的信息资源在一定程度上为人所利用。 从“网上一次信息”到“网上二次信息”,再到“网上三次信息”,进入网络的信息资源的可控性、有序性、易用性一步步增强,网络信息组织程度也大大提高。“网络信息链”的概念,是从整体、有序和动态的高度来探讨网络信息的产生、演变和结构规律的,有助于人们正确了解,即首先借助于三次信息,进而掌握二次信息,最后获得一次信息。因此,网络信息链有助于人们高效、充分地利用网络信息资源(马费成)。 网络信息组织与发布 将准备好的信息按照一定的组织方法和规则,运用创作工具和语言工具对这些信息进行组织,制作成若干个文件,就可以上网公布。本节我们将介绍一下如何将自己加入Internet,构造网上信息发布的平台。 接入Internet 1.拨号连接(Dialup Connection) 拨号连接是比较常用的一种接入Internet的方式,一般适宜于个人用户、信息量小的企事业单位。这种方式主要是通过现有的市话线路拨号连接到一台已经直接连在Internet的主机上,这种方法,经济灵活。拨号连接需一台计算机和一部调制调解器,一根电话线及相应的Internet软件包,并到当地的ISP(Internet Service Provides)处申请一个服务帐号,就可以进入Internet。调制调解器有内置和外置之分,但一定要注意是否支持“HayesAT”命令集;拨号软件在Windows9X 和WindowsNT等操作系统都有捆绑,通常不需另行购买。 2.专线与ISDN连接 上述拨号连接虽然经济灵活,但数据传输速度太慢,所以对于大中型的企事业单位,显得并不够用,此时应申请一个节点,然后通过专线接入Internet网。 1) 数字数据网(DDN) DDN(Digital Data Network),是利用数据通道提供的永久或半永久线路,建立的以数据信号为主的网络,其中包含数据通信、数字通信、数字传输、数字交叉连接、计算机带宽管理等技术,可以为客户提专用的数字数据传输通道。 我国的DDN建设始于20世纪90年代,到目前为止,已覆盖全国的大部分地区,呈现出较好的发展势头,已开通的中国公用数字数据网(CHINADDN),能为客户提供电路、帧中继、语音163、传真和虚拟专用网等业务,它已联通21个省会城市;此外,各省(市)也都在积极规划建设DDN。DDN网数据传输速度快、质量高,所以对数据传输要求高的图像、声音、视频信息的传输能较好地支持。 2) ISDN(Integrated Services Digital Network) 由于各种通信网如电话网、电报网及用于数据通信的分组交换网都是各自独立的,当用户需要利用多种通信业务时,必须每项申请,这显然是不经济、不方便的,为此,人们推出了“综合业务数字网”,有了这种网络,用户只需提出一次申请,仅用一条用户线就可以将多种业务终端接入同一网内。目前ISDN功能的实现涉及了用户线双向数字传输、信息系统、数字网的同步、ISDN用户/网络接口、ISDN编号计划与路由选择,ISDN与现有电话网和分组网的互通这六种关键的技术。 ISDN服务的种类有如下类型: (1) 通过数字电话机,这种连接方式是通过一部数字电话机及NTI的数据终端连接ISDN 第 117 页
网络,它不需要客户添加其他PC硬件设备,只需将数字话机与计算机的串口连接,通过数字话机即可实现ISDN方式连网。 (2) 通过ISDN适配器,这种是针对没有数字话机的用户而产生的,ISDN适配器类似于Modem,并且这种方式在上网时并不影响电话的使用,但对上网速度有影响。 (3) 利用ISDN网卡,这种方式是通过一块内置的ISDN网卡实现上网连接。 3)ADSL(Asymmetric Digital Subscribe Line) ADSL(Asymmetric Digital Subscribe Line)是“非对称数字用户环线”的简称,它与其它DSL的其他成员HDSL、SDSL、VDSL、RDSL一起称为xDSL,ADSL在一对铜线上支持上行速率640Kbps~1M bps,下行速率为1Mbps~8M bps,有效传输的距离在3~5公里,具有较高的性能价格比,安装也极为便利,特别适合企业使用。 网络信息的发布 在网络上发布信息需要一定的软硬件的支持,如一台装有网络操作系统的计算机和能提供网上信息共享的软件,以及必要的通讯设施,另外还要申请一个IP地址。下面我们以为例介绍一下网络信息发布平台的构建。 1.硬件 上网发布布信息必须拥有一台服务器(Server),所谓服务器是指能为多个网络用户提供服务的共享设备,与工作站相比服务器通常有更多的内存和硬盘存储空间、更快的速度、更坚固的结构以及更强的可扩展性,如支持磁盘双工,即服务器上的两个磁盘组执行完全相同的工作,当一个磁盘出现故障时系统将自动切换至第二个磁盘组,从而保证整个网络系统的可靠性。对服务器而言,其硬件的典型配置是: Intel Pentium133CPU 2GB硬盘 5英寸高密软件盘驱动器 8速光盘驱动器 32MB内存 NE2000网卡 兼容鼠标 2.网络操作系统 目前存在的网络操作系统有影响的有Unix、Linux和WindowsNT等,其中WindowsNT由于其视窗式操作界面,与微软其它Windows系列产品风格一致,操作直观简便而深受用户青睐。现已面世,其功能更强大、数据更安全。 3.网络信息服务 使用Microsoft NT Server 操作系统提供的 Microsoft Internet Information Server (IIS)可使安装WindowsNT Server的计算机成为大容量、功能强大的Web服务器。IIS可提供WWW、FTP和Gopher的信息发布方式。实际上在Windows9X上,安装一下安装盘携带的附加软件PWS或在Workstation上安装Peer,或从网上下载自由软件件WebSite安装于Windows9X上,也可以将主机变成服务器,但它们只能提供小规模的信息发布,并且安全性等不是很高,所以它们通常只适合于个人信息或小企事业单位的信息发布。 4.网络连接设备 连接网络需用路由器(Router)、网桥(Bridge)或者网关(Gateway)和必要的通讯线路。 5.其它条件 除了物理的连接,还需IP地址(以及适当的子网掩码)和域名注册、DNS服务等。网络上每一台计算机都有唯的一个IP地址。DNS城名系统是匹配相应的IP地址的数据库,当用 第 118 页
户以域名的方式浏览网上信息时,浏览器首先与DNS服务器联系以便识别IP地址,然后用此地址与计算机联系。 服务器的建立与配置 1.WindowsNT的安装 中文版有多个安装目录,分别适应不同类型的计算机,/I386是提供给X86用户使用的,提供,和两个版本。 可在MS-DOS,Windows9X以 WindowsNT早期版本环境下安装,如果安装目录与已存在操作系统不是同一目录,可实现多重启动功能。当安装进入“安装 WindowsNT网络”时,接下来的工作是: 1)安装 (1)选择联网方式 提供给用户两种方式连接 WindowsNT网络:一是用线路连接网络,计算机通过ISDN适配器或网络适配器连接到网络;二是远程访问网,计算机通过调制调解器连接到网络。 (2)安装Microsoft Internet Information Server Microsoft Internet Information Server(IIS)是一个集成Web、Gopher和FTP为一体的服务器软件,如果在安装时未安装,可在以后利用“控制面板”中的“网络”选项来安装。安装成功后会出现一个目录\wwwroot,当用户将网页文件存放在此处时,就可提供信息的发布了。 (3)选择与设置网卡、选择网络协议、确认网络组件设置、调整网络绑定、设置域。 (4)完成设置: 完成选择Internet Information Server的安装组件,设置日期与时间、时、显示设置等之后,系统即初步安装成功,接下来进入设置。 2)设置 (1)网络的设置,打开控制面/网络后,即可开始配置网络标识,网络适配器、网络协议,网络服务和绑定。 ①添加TCP/IP协议 选择TCP/IP协议后,接下来配置TCP/IP属性,首先是配置IP地址,这个地址是从ISP或网管中心获取,如果要实现访问两个不同的网络就需要进行两个路由设置,即安装两块网卡,并对两卡分别设置IP地址及网类,如果通过代理服务实现内部网与外部的联接,通常也需两块网卡,分别设置IP地址和网类。 ②设置DNS 如果用户准备在网中增加DNS服务器的话,则应选择DN选项卡,填入主机名及域,DNS服务器搜索顺序。利用“DNS搜索顺序”用户可指定多个DNS服务器,安装配置好DNS服务器后,需要在DNS层次命名结构中写上,并在上一级的DNS服务器注册。 ③设置WINS 如果IP地址是静态分配的,则不需要此项;如果IP地址采用动态分配,动态分配也就是主机启动时,才由DHCP(Dynamic Host Configuration Protocol)服务器指派给主机,则须要用WINS(Windows Internet Name Service)来解决这个问题。 2.IIS的设置 缺省情况下,WWW、FTP、Gopher的运行目录分别是C:\Inetpub\wwroot,C:\InetPub\ftproot, C:\Inetpub\gophroot,选择“Internet服务管理器”可对和Gopher服务进行配置和管理,如设置ftp Gopher的登记帐户和密码。 第 119 页
3.Microsoft Proxy Server Internet代理服务器 Internet代理服务器可以用作防火墙,使内部网Intranet与外部网Internet隔离开来,屏蔽掉内部网络的IP地址和内部网络的应用服务器,动态过滤出入代理服务器的数据包,从而解决因IP地址不足,而造成的问题,并使系统管理员能对网络用户所能看到的信息或能访问的站点施加限制;代理服务器的另一作用是存储访问过的网页,当Internet网中的某个用户访问某个Internet Web站点,Internet代理服务器将自动存本地服务器中存储该用户所访问过的Internet网页,下次一旦企业其他用户访问此网页时,则该代理服务器自动调出网页,从而节省了上网时间和费用。 利用 Frontpage 维护网站 Frontpage 2000功能强大,将网页制作与公布、管理于一身。使用Frontpage2000管理网站,首先应在服务器端安装Frortpage2000,然后从Frontpage Server Administer中进行安装和对用户进入管理等。要让用户能远程维护网页,须选择“install”,在服务器上安装Frontpage Extension组件。远端用户启动Frontpage后输入编辑该站点的用户名和口令,然后选择Frontpage文件菜单中的Publish Frontpage Web即可将新网页或修改的网页安装至站点。 建立网站发布信息,除可用一台实际的主机外,也可用虚拟主机,其效果完全一样。而且费用要低得多。 网络信息组织的信息安全与知识产权问题 网上信息组织是基于高速信息网络的一种全新的信息组织活动,由于它的大部分环节在网上进行,所以,安全性也是网上信息组织的不可忽视的问题。网上信息组织的安全问题包括:设施安全、软件安全、数据安全、运行安全,其中数据安全是核心。同时网上信息组织的信息对象有相当大的部分来自于网络,这个问题在数字图书馆的信息组织中更为明显,人们一方面可以自由获取信息,另一方面要对创作者的知识产权实施保护,所以在进行网上信息组织时知,识产权的保护也必须予以考虑。 网上信息组织的信息安全保护 1999年1月,有人利用在新闻组中查到的普通技术手段,轻而易举地从多个商业站点窃取了8万多个信用卡帐号和密码,并标价26万美元出售。一群黑客不久前曾成功闯进了美国军方一个控制卫星地计算机系统等等。所以网上的信息安全是极其重要的。 信息安全主要强调信息的机密性、完整性、可用性和可控性,威胁信息安全的因素主要有非人为因素和人为因素,非人为因素如自然灾害等;人为因素主要包括黑客、病毒、逻辑炸弹、电子欺骗、搭线窃听。信息安全不仅影响信息本身的机密性、完整性、可用性和可控性,影响个人的财产安全,并且对国家的政治、经济和社会的稳定、发展都带来难以估量的影响。由于这些原因,信息安全的保护得到了各个国家的高度重视,信息安全产品一般都提倡自主生产,它对信息安全的保护具有关键的作用,信息安全产品在信息产品中也有市场份额。如我国的杀毒软件在该市场就有较高的只有率,不过我国的杀毒软件还仅仅着眼于个人市场,对企业市场还没有很好地开拓。 网络信息安全保护的措施主要有以下几个方面: 1. 信息存储安全保护 第 120 页
信息存储安全保护采取的办法是RAID技术(Redundant Array of Inexpensive Drives),所谓RAID技术是指将小容量、廉价的驱动器结合在一起,通过数据冗余提高数据存储的安全性,从而实现对数据进行保护的方法。RAID1又称磁盘镜像,即有两个磁盘,执行完全相同的操作。另外还有RAID0、RAID2、RAID3、RAID4、RAID5。 2. 入网安全保护 除了进行口令保护外,还可以对入网时间、登录的工作站、帐号等进行控制。 3. 权限安全保护 权限的分配有两种,一是为用户分配权限,二是为对象分配权限。对共享数据有三种类型,即共享权限、目录权限、文件权限。这些权限一般包括查看、修改、增加、删除等操作。 4. 防火墙安全策略 防火墙只对越过网络边界的信息进行监测、控制,对内部人员的攻击不能防范。防火墙的安全措施有:包过滤、应用网关、代理服务。代理服务因为其性能良好而被广泛使用,它可以有效的隔离内部网和外部网。 5. 信息传输安全保护 信息传输安全保护主要方法是对传输的数据进行加密,加密的方法非常多,总体可分为硬件加密和软件加密,它们的原理是一样的。在数据加密中,加密算法是关键。在通常的密码体制中,信息交流的双方有相同的密钥。这种体制在人数较少时比较可靠,但在互联网上,这种体制会造成成本过高、密码容易泄露,所以人们采用了一种叫做公开密钥的密码体制。它的原理是:加密采用私有密钥,解密采用公开密钥,它在电子商务数字签名中广泛使用。下面分别介绍一下。 1)加密技术 加密技术是网上信息安全采取的主要措施,信息双方可根据需要在信息交换的阶段使用。目前,加密技术分为两类,即对称加密和非对称加密。 (1)对称加密或对称密钥加密 在对称加密方法中,对信息的加密和解密都使用相同的密钥。也就是说,一把钥匙开一把锁,使用对称加密方法将简化加密的处理。每方都不必彼此研究和交换专用的加密算法,而是采用相同的加密算法并只交换共享的专用密钥。如果进行通信的双方能够确保专用密钥在密钥交换阶段未曾泄露,那么机密性和报文完整性就可以通过对称加密方法加密机密信息和通过随报文一起发送报文摘要或报文散列值来实现。对称加密技术存在着在通信的双方之间确保密钥安全交换的问题。此外,当某一方有“n”个信息交换关系时,那么他就要维护“n”个专用密钥(即每把密钥对应一方)。对称加密方式存在的另一个问题是无法鉴别发起方或最终方。因为双方共享同一把专用密钥,双方的任何信息都是通过这把密钥加密后传送给对方的。 (2)非对称加密或公开密钥加密 在非对称加密体系中,密钥被分解为一对(即一把公开密钥或加密密钥和一把专用密钥或解密密钥)。这对密钥中的任何一把都可作为公开密钥(加密密钥)通过非保密方式向他人公开,而另一把则作为专用密钥(解密密钥)加以保存。公开密钥用于对机密性的加密,专用密钥则用于对加密信息的解密。专用密钥只能由生成密钥对的对方掌握。公开密钥可广泛发布,但它只对应于生成该密钥的一方。双方利用该方案实现机密信息交换的基本过程是:甲生成一对密钥并将其中的一把作为公开密钥向其他方公开,得到该公开密钥的一方乙使用该密钥对机密信息进行加密后再发送给甲,甲再用自己保存的另一把专用密钥对加密后的信息进行解密。甲只能用其专用密钥解密由其公开密钥加密后的任何信息。 RSA(即Rivest, Shamir Adleman)算法是非对称加密领域内最为著名的算法,但是它存在的主要问题是算法的运算速度较慢。因此,在实际的应用中通常不采用这一算法对信息量大的信息(如大的EDI 第 121 页
交易)进行加密。对于加密量大的应用,公开密钥加密算法通常用于对称加密方法密钥的加密。 2)密钥管理技术 (1)对称密钥管理 对称加密是基于共同保守秘密来实现的。采用对称加密技术的双方必须要保证采用的是相同的密钥,要保证彼此密钥的交换是安全可靠的,同时还要设定防止密钥泄密和更改密钥的程序。这样,对称密钥的管理和分发工作将变成一件潜在危险的和繁琐的过程。通过公开密钥加密技术实现对称密钥的管理使相应的管理变得简单和更加安全,同时还解决了纯对称密钥模式中存在的可靠性问题和鉴别问题。一方可以为每次交换的信息(如每次的EDI交换)生成唯一一把对称密钥并用公开密钥对该密钥进行加密,然后再将加密后的密钥和用该密钥加密的信息(如EDI交换)一起发送给相应方。由于对每次信息交换都对应生成了唯一一把密钥,因此各方就不再需要对密钥进行维护和担心密钥的泄露或过期。这种方式的另一优点是即使泄露了一把密钥也只将影响一次信息交换,而不会影响到双方之间所有的信息交换关系。这种方式还提供了信息伙伴间发布对称密钥的一种安全途径。 (2)公开密钥管理即数字证书 信息伙伴间可以使用数字证书(公开密钥证书)来交换公开密钥。国际电信联盟(ITU)制定的标准(即信息技术—开放系统互连—目录:鉴别框架)对数字证书进行了定义该标准等同于国际标准化组织(ISO)与国际电工委员会(IEC)联合发布的ISO/IEC 9594-8:195标准。数字证书通常包含有唯一标识证书所有者的名称、唯一标识证书发布者的名称、证书所有者的公开密钥、证书发布者的数字签名、证书的有效期及证书的序列号等。证书发布者一般称为证书管理机构(CA),它是信息各方都信赖的机构。数字证书能够起到标识信息方的作用,是目前网上广泛采用的技术之一。微软公司的Internet Explorer 和网景公司的Navigator 都提供了数字证书的功能来作为身份鉴别的手段。 (3)密钥管理相关的标准规范 目前国际有关的标准化机构都着手制定关于密钥管理的技术标准规范。ISO与IEC下属的信息技术委员会(JTC1)已起草了关于密钥管理的国际标准规范。该规范主要由3部分组成:第1部分是密钥管理框架,第2部分是采用对称技术的机制,第3部分是采用非对称技术的机制。该规范现已进入到国际标准草案表决阶段,并将很快成为正式的国际标准。 3)数字签名 数字签名是公开密钥加密技术的另一类应用。它的主要方式是:报文的发送方从报文文本中生成一个128位的散列值(或报文摘要)。发送方用自己的专用密钥对这个散列值进行加密来形成发送方的数字签名。然后,这个数字签名将作为报文的附件和报文一起发送给报文的接收方。报文的接收方首先从接收到的原始报文中计算出128位的散列值(或报文摘要),接着再用发送方的公开密钥来对报文附加的数字签名进行解密。如果两个散列值相同,那么接收方就能确认该数字签名是发送方的。通过数字签名能够实现对原始报文的鉴别和不可抵赖性。ISO/IEC JTC1已在起草有关的国际标准规范。该标准的初步题目是“信息技术—安全技术带附件的数字签名方案”,它由概述和基于身份的机制两部分构成。 4) Internet主要的安全协议 (1)安全槽层协议( SSL)。 SSL是由Netscape公司研究制定的安全协议,该协议向基于TCP/IP的客户/服务器应用程序提供了客户端和服务器的鉴别、数据完整性及信息机密性等安全措施。该协议通过在应用程序进行数据交换前交换SSL初始握手信息来实现有关安全特性的审查。在SSL握手信息中采用了DES、MD5等加密技术来实现机密性和数据完整性,并采用的数字证书实现鉴别。该协议已成为事实上的工业标准,并被广泛应用于Internet和Intranet的服务器产品和客户端产品中。如Netscape公司、微软公司、IBM公 第 122 页
司等领导Internet/Intrnet 网络产品的公司已在使用该协议。 此外,微软公司和Visa机构也共同研究制定了一种类似于SSL的协议,这就是PCT(专用通信技术)。该协议只是对SSL进行少量的改进。 (2)安全的超文本传输协议(S-HTTP)。 S-HTTP是对HTTP扩充安全特性、增加了报文的安全性,它是基于SSL技术的。该协议向WWW的应用提供完整性、鉴别、不可抵赖性及机密性等安全措施。目前,该协议正由Internet工程任务组起草RFC草案。 网上信息组织的知识产权保护 目前对网上的信息行为的法律问题大部分还仅停留在学术讨论的范围,实际出台的法律还不多,主要原因是,网上的信息行为还是一个新兴事物,法律对此问题的界定相对滞后,另一方面,网上的信息行为是相当复杂的,也就是说,其法律边界比较模糊,而法律讲究明确界定。但不论怎样,有关网上信息行为的法律终究是要产生的。网上信息行为的法律问题主要有以下几个方面须重点关注: 1. 作品数字化行为的法律定性 关于作品数字化行为的法律定性,一种观点认为,数字化是一种复制行为,因为它不具有创造性;另一种观点认为,数字化是一种翻译行为,它是将人工语言翻译成机器语言。不过,大部分人和已有的法律对此问题都倾向于数字化作品是复制行为。 2. 网络传输行为的法律定性 以美国为代表的一些国家倾向于网络传输行为属发行权的解释,不少人对此有异议,认为网络传输行为只能是传播权而不能视为发行权。 3. 合理使用的法律界定 各国都做出规定,不得擅自复制他人作品,但“为个人学习、研究或欣赏”,可以使用他人已经发表的作品。但在网络是时代情况就大不一样了,个人信息传输与公开传输界限变的模糊。 4. 多媒体产品的法律归属 前面已经讲过,多媒体作品在组织时往往要使用许多其他人的作品,最终的产品的知识产权归属谁,如果归先前作品作者所有,那又有谁愿意制作如多媒体数据库的多媒体作品呢;如果归最后作品人,那先前作品的产权又如何保护。 5. 取得在先作品的授权问题 多媒体作品在组织时往往要使用许多其他人的作品,如果每一幅图、每一幅动画、每一电影片段都要取得在先作品的授权,那多媒体作品是很难完成的,因为这些作品的所有人分布在不同地区、国家。这是影响多媒体作品进一步发展的主要障碍。 著名网站信息组织简介 2000年中国互联网信息中心评出十大最佳网站,它们在网络信息组织和服务等方面堪称中国互联网网站的典范.它们分别是: 1. 四通利方信息技术有限公司的“新浪网” 2. 网易计算机系统有限公司的“网易” (、、) 3. 北京搜狐公司的“搜狐” (、) 第 123 页
4. 广州飞华电信工程有限公司的“163电子邮局” 5. 北京京讯公众信息技术有限公司的“首都在线” (、) 6. 中国国际网络传讯有限公司的“中华网” 7. 世纪龙信息网络有限责任公司的“21CN” 8. 北京东方网景数据通讯有限责任公司的“东方网景” (、) 9. 上海在线信息网络集成有限公司的“上海热线” 10. 天极信息发展有限公司的“《电脑报》电子版” 下面介绍一下网易、yahoo和263网站的信息组织情况。 网易信息组织 1.网易简况 网易公司(NASDAQ:NTES)是中国领先的互联网技术公司,在开发互联网应用、服务及其它技术方面,网易始终保持国内业界的领先地位。自1997年6月创立以来,凭借先进的技术和优质的服务,她深受广大网民的欢迎,目前注册用户已达590多万,日访问量达2,400万人次,曾两次被中国互联网络信息中心(CNNIC)评选为中国十佳网站之首。 在开发互联网应用、服务及其它技术方面,网易始终保持业界的领先地位,并取得了中国互联网业的多项第一:第一家中文全文检索,第一个大容量免费个人主页基地,第一个免费电子贺卡站,第一个网上虚拟社区,第一个网上拍卖平台。所有这些成绩将载入中国互联网发展的史册。 通过不懈的技术创新和敏锐的市场观察,网易正在成为一个集丰富的网上内容,活跃的虚拟社区和大规模的电子商务平台于一身的精彩网站。 网易具有全面而精彩的网上内容。网易开发、组织并推出了16个各具特色的网上内容频道,为用户提供国内国际时事、财经报道、生活资讯、流行时尚、影视动态、环保话题、体坛赛事等信息。网易同国内外150多家网上内容供应商建立了合作关系,以确保网上内容的丰富性和独特性。网易的26种免费电子杂志,目前拥有260多万的订阅量。网易是中国第一家能让用户根据自己的兴趣和爱好创建"个性窗口"的网站,这一服务也叫"在线个性化服务"。同时,网易还是中国第一家免费为用户提供主页空间的网站,目前已有465,000多个用户创建了个人主页,在这里,他们有了抒发个性,展示才华的场所。 第 124 页
图 网易首页 网易是中国首家提供在线互动式社区服务的互联网公司。他们的虚拟社区提供了200多个论坛,主题包罗万象,大到时事评论,小到厨艺交流,人们可以根据自己的兴趣,张贴信息和文章,发表意见,并对别人的意见作出评价。网易成员还可以在社区内举办个人论坛,讨论自己感兴趣的话题,目前个人论坛共有22,000个。网易还提供了多种类型的社区聊天室,最高峰时甚至有34,000人同时在线进行聊天。注册社区成员可以在聊天室聊天,参与调查,并且可以向其他注册成员递送即时信息。 网易也是中国首家提供在线拍卖业务的互联网公司。网易推出了永久性“商家对消费者”的拍卖服务,拍卖物品现在多达38,000多种。网易的电子商务平台能支持各种网上支付形式,包括网上信用卡和记帐卡,用户还可以用支票支付或选择现金快递支付。此外,网易还同后勤供应商结盟,以使在电子商务平台上进行交易的卖主能以低价进行货品交易。 2000年6月份,网易推出网易商城,它为电子交易商务供应商和传统企业客户提供了在线电子商务平台。 作为中国网站的领先者,网易公司致力于电子商务及IT产业的持续发展,同时也在努力促进中国人民的数字化生活。为了这个目标,网易正在通过广阔的虚拟社区,把千百万的中国人民聚集在一起,实现最新资讯的共享。网易公司将继续开发最先进的技术,为用户提供更好的服务,为他们创造更愉悦的在线体验。 2.网易信息组织 网易的信息共分新闻、体育、财经、电脑、游戏、影视、音乐、女性、生活、房产、职业、旅游、科技、健康、文化、教育等16大类,每一大类对应一个网址,相对独立。 同时,网易也是著名的搜索网站,它将信息分为:娱乐休闲、电脑网络、经济金融、医疗健康、文学作品、艺术分类、生活资讯、体育竞技、教育学习、情感绿洲、政法军事、少儿乐园、会文化、新闻出版、旅游自然、科学技术、公司企业、个人主页等类目,十分方便查找。 今日导读 >> 站点导航栏目将最新信息分为[体育]、[财经]、[电脑]、[游戏]、[影视]、[音乐]、[女性]、[生活]、[房产]、[职业]、[旅游]、[科技]、[健康]、[文化]、[教育]、[广东]、[上海]、[杂志]、[商城]、[心理],用户可以根据喜好浏览和阅读。以下是2001年5月28日的“今日导读”,它与上述栏目对应: [体育]西亚真会联手? 十强赛分组抽签五大悬念 [财经]聚焦新经济:中国中小企业需要“E先锋” [电脑]献给chinaByte宫玉国的慨叹“悲剧英雄” [游戏]E3展会看任天堂的未来、游戏业的未来 [电影]电影《珍珠港》64张精彩照片先睹为快 [音乐]胡兵: 港台发展障碍是八卦新闻太多 [女性]婀娜广播:女人比男人更为眼尖是其心细? 第 125 页
yahoo信息组织 1.雅虎历史 图 yahoo首页 正如计算机时代的很多新事物一样,Yahoo!起源于一个想法,随后变成一种业余爱好,最终成了使人全身心投入的一项事业。Yahoo!的两位创始人大卫·费罗(David Filo) 和杨致远(Jerry Yang)皆是美国斯坦福大学电机工程系的博士生,他们于1994年4月建立了自己的网络指南信息库,将其作为记录他们个人对互联网的兴趣的一种方式。但是不久,他们就发现他们自己编写的列表变得很长,不便于处理。于是他们开始在Yahoo!身上花费越来越多的时间。 1994年,他们将Yahoo!变成了一个可定制的数据库,旨在满足成千上万的、刚刚开始通过互联网社区使用网络服务的用户的需要。他们开发了可定制的软件,帮助他们有效地查找、识别和编辑互联网上存储的资料。 Yahoo!的含义是“另一个层次化的、非正式的预言”,但是大卫·费罗和杨致远更愿意说,他们之所以选择这个名称是因为他们认为自己是yahoo(野蛮人)。最初Yahoo!存放在杨致远的学生工作站“akebono”上,而搜索引擎存放在Filo的计算机“konishiki”上(这些计算机的名称都来自于一些具有传奇色彩的夏威夷摔交手)。 1995年初,Netscape Communications 公司(位于加州Mountain View)的联合创始人之一Marc Andreessen邀请大卫·费罗和杨致远将他们的文件转移到Netscape公司提供的更大的计算上。这一做法不仅使斯坦福大学的计算机网络恢复了正常,而且令双方都有所受益。 今天,Yahoo!含有链接到互联网上的成千上万台计算机中存储的信息。San Jose Mercury新闻最近指出:“其实Yahoo!的贡献最近乎于Linnaeus的工作,Linnaeus是一位18世纪的植物学家,他所创建的分类系统有效地划分了整个自然界。” 2.雅虎公司概况 雅虎公司是一家全球性的互联网通讯、商贸及媒体公司。其网络每月为全球超过一亿八千万用户提供多元化的网上服务。雅虎是全球第一家提供互联网导航服务的网站,不论在浏览量、网上广告、家庭或商业用户接触面上,都居于领导地位,也是最为人熟悉及最有价值的互联网品牌之一,在全球消费者品牌排名中位居第38位。雅虎还在网站上提供各种商务及企业服务,以帮助客户提高生产力及网络使用率,其中包括广受欢迎的为企业提供定制化网站解决方案的雅虎企业内部网;影音播放、商店网站存储和管理;以及其他网站工具及服务等。雅虎在全球共有24个网站,其总部设在美国加州圣克拉克市,在欧洲、亚太区、拉丁美洲、加拿大及美国均设有办事处。 3.雅虎中国及其信息组织概况 雅虎在全球共有24个网站,12种语言版本,其中雅虎中国网站()于1999年9月正式开通,它是雅虎在全球的第20个网站。雅虎中国网站()致力于通过与本地优秀合作伙伴的密切合作,不断强化其内容和服务,为国内互联网用户提 第 126 页
供丰富、及时、本地化的内容和讯息交流服务。 雅虎中国网站( 雅虎中国网站信息内容十分丰富,它包括艺术与人文:文学, 绘画, 表演艺术;商业与经济:公司, 金融与投资, 就业...;电脑与因特网:因特网, 聊天室, 软件...;教育:大专院校, 各类考试, 海外留学...;娱乐:酷站, 音乐, 电影, 明星照片...;政府与政治:地方政府, 中央政府机关, 法律...;健康与医药:医学, 疾病与症状, 传统医药... ;新闻与媒体;无线电广播, 杂志, 报纸, 电视...;休闲与生活:体育运动, 游戏, 旅游...;参考资料:图书馆, 字典与辞典, 电话号码...;区域:北京, 上海, 重庆, 天津...;科学:生物学, 工程学, 另类科学...;社会科学:人类学, 社会学, 经济学...;社会与文化:人物, 饮食, 宗教信仰...;等大类。 雅虎中国还为用户提供了一系列的沟通工具,如雅虎电邮()、我的雅虎()、雅虎通()、地址簿()、公文包()、记事本()、效率手册()等,它们可以帮助用户更方便、快捷地与朋友进行全方位的沟通与交流。 雅虎中国的新闻中心()、雅虎财经()、雅虎体育()、雅虎科技()、雅虎房地产()、天气()、英汉字典()、星相命理()等则为用户提供了丰富的综合在线内容,不仅包括政治、经济、文化、科技、房地产、教育、艺术、娱乐、体育、宗教等各方面的、来自本地和全球的信息,还有世界各主要城市的天气预报,并可下载软件,使你足不出户,就可轻松了解中外大事、体育赛况和天气状况等。 雅虎丰富多彩的网上虚拟社区则为用户提供了聊天室()、俱乐部()、网上传情()、雅虎相册()和雅虎请柬()等各种最酷最个性化的产品,无论你的兴趣是什么,想谈论什么话题,你一定能在雅虎中国上找到属于你社区,找到志同道合的朋友。 雅虎强大、统一的技术平台,不仅可以使所有这些产品都独立高效地使用,而且还可以配合使用,发挥集成优势,真正实现雅虎“找到任何事,沟通任何人”的目标。 自雅虎中国网站 ( 263在线―中国人的网上家园 通过认真的规划和不懈的努力,263在线已经跻身于中国主流门户网站的前列,同时263著名的263mail天下邮(@)电子邮箱用户持续增长,继续稳居全国领先地位。263在线将不断根据用户需求推出与大众生活密切相关的全方位、多层次的各类信息和功能服务,263网站信息按以下栏目分类组织起来的。 第 127 页
图 263首页 263主页(http://),是整个网站网页的集中入口,也是所有信息的总目录所在地。 263天下邮(http://)其中包括面向个人用户的免费信箱(Freemail)、专递信箱(Promail),面向企业用户的企业信箱(Commail);263天赢财经专网(http:// ): 263天赢作为专业财经站点目前共有15个栏目,近80个次级栏目,263天赢以股票服务为核心,横跨外汇、基金、债券、期货等金融业各个领域,形成了完善的股票行情及分析软件系统、实时高速的行情揭示、委托交易、行情警报、丰富的财经资讯和专业化咨询辅导等全面高效的专业服务; 263中国国际教育服务网();该栏目提供留学政策、各国概况、校园详情、生活环境、学科专业、学费标准等留学必备信息。网上学校展示,专设的BBS,网上咨询顾问等。 263游戏网(http:// ) :263游戏网由三大部分组成,263围棋网、263棋牌中心, 由263在线独立开发的大型JAVA棋牌游戏,已经推出围棋、中国象棋、国际象棋、五子棋、拖拉机,麻将,军旗,拱猪,锄大地等十几种传统棋牌游戏。263游戏专网 263新闻中心(http://):263新闻中心涵盖了时政、财经、科技、体育、娱乐、生活、都市便利、好望角等频道,每日新闻更新量近1000条。其中"都市便利"是"263新闻中心"推出的全新生活信息频道,该频道分春、夏、秋、冬四版,每季更换,从服饰、美食、家居、休闲、文化、美容、家电、IT、日用等方面。 漂亮女人(http://):专为女性开设的网上家园,分15类、50小类。 263中国婚介网(http:// ):以会员资料的真实全面、婚恋知识的专业咨询、快速便捷的搜索功能和体贴周到的优质服务受到各界的高度评价。 263在线"健康人生"(http:// ):在"263医疗保健网"的基础上成功推出了"健康人生"频道。该频道充分发挥了原有网站的优势,推出了"网上诊室","医学词典"和"养生美容"等特色频道,并提供了大量和广大网友的生活息息相关的网上服务和极为全面的各类信息资讯。 影音服务中心(http:// ) 在这里可以享受新歌试听、影片欣赏、明星访谈、在线广播、网上婚礼等服务的乐趣; 另一方面中心也为企业用户提供网上直播、网上会议、影音广告等众多旨在推广企业形象的网上多媒体解决方案; 263 数码音乐网(http:// ) 263IT频道(http://) 内容涵盖IT领域中的软件、硬件、资讯和各类功能服务。如"下载中心"、"在线攒机"和"硬件商情"、"病毒急救站"、"软件互动平台"、"网上新书下载"等服务。 生活易站(http:// 生活易站已经形成以跳蚤市场(提供二手房屋、通讯产品、电脑产品、家政服务等众多网下商品、服务信息)、比较购物(提供网上销售商品的集中、精选推荐服务)、比较拍卖(提供网上拍卖商品的集中、精选推荐服务)为核心的个人消费者服务中心。 263搜索(http:// ) 目前已经有每日数十万个pageview和数十万次搜索记录,263搜索已经成为中国最受互联网用户喜爱和信赖的搜索引擎服务商之一。拥有1500万个网页、25万多个网站的庞大数据库及上万个分类科学、符合用户使用习惯的目录体系。除了提供中文网站、网页及目录的 第 128 页
检索查询,还根据网民对信息检索更深层次的不同需求,通过对检索信息的精加工,推出了263站内检索、热门排行、专题搜索、好站推荐及个人空间等更多的搜索服务。 263全国聊天网(http://) 263全国聊天网提供的技术服务产品:租用聊天室,聊天服务器架设。 另有263网上家园虚拟社区、贺卡站/个人图片库(http:// )、个人主页(http:// )、军事频道、汽车频道、旅游频道、保险频道、宠物频道、求职招聘频道、育儿摇篮频道等25个频道。 习 题 简述网络信息组织 网络信息组织如何评价? 谈谈信息组织方法在网络信息组织中的应用。 网络信息的类型有哪些? 网络信息如何发布?服务器如何建立与配置?利用 Frontpage 维护网站有何优点? 网络信息组织得信息安全和知识产权如何保护?。 选择国外若干著名网站,评价其信息组织状况。 第 129 页
第8章 网络信息组织工具 网络信息组织工具软件 网络信息组织的工具软件是指一些工具软件,借助这些工具软件用户只需按照软件的操作程序进行一些操作和添加必要的参数即可完成网页的制作和信息组织。常用的网络信息组织工具软件有Word、FrontPage、Homesite、Dreamweaver等,还包括一些网页素材编辑和制作软件,如flash、photoshop等。另有一些功能相对较弱但简便易用的软件工具,它们常可以从网上免费下载。 Frontpage 2000与主页制作 1.Frontpage2000的新特点 图 Frontpage 2000用户界面 Forntpage 2000保留和发展了frontpage 98的优秀功能,并增加了许多新的功能: 1) 无须编程,轻松建立具有专业水准的网站。Frontpage 2000的网站创建和管理工具给用户从未有过的控制权。用户可以精确地将每一个元素放置在网页的任何位置,为网站设定专业的、谐调的外观,输入和编辑html原代码,使用最新的网页技术,这一切不需要编写任何程序。 2) Frontpage2000可以用来制作建设和维护网站。工作组用户可以通过Frontpage2000使分布在世界各地的子公司一起工作。 3) Frontpage2000与其他office组件的整合性更高,打开和运行的速度比Frontpage98更快。 在接入Internet的计算机上,安装PWS即可以在自己的机器上调试网页,PWS程序在Windows98的安装盘“add-one\pws”文件夹内,执行即可以安装。 骤 2.利用Frontpage2000组建主页 1) 搭建主页框架 第 130 页
图 Frontpage 2000 搭建主页框架 搭建主页框架是为了将首页划分为不同功能区,如广告专区、栏目导航区、主要内容区、网络版权、联络方法区等。分区的划分依设计思想而定,但不宜过多。 方法:文件/新建/网页/框架网页。然后编辑欢迎区,制作导航条,添加访问计数器,添加主页内容。 2) 建立超级链接 常见的超级链接有WWW、HTTP、FTP、BBS超级链接。 方法:插入/超链接/创建超级链接 3) 添加网页图像 浏览器支持的最常用的图格式有GIF、JPEG和BMP。 方法:插入/图像 插入图像后需要对图像的属性进行设置,并可以使用“图片”工具栏的各种工具对网页中的图像进行编辑。若要使用背景图像,在“网页属性”中打开“背景”选项卡,然后进行相应的设定。 4) 用表格制作网页 表格的使用可以使设计布局更加合理、页面更加美观匀称。 加入表格的方法是:表格/插入,然后对表格进行必要的编辑和属性的设置。 5) 使用样式表 当需要制作大量的网页时,可以把常用的格式设置成固定的模板,以后在使用时可以直接套用这些格式。这就需要使用和编辑样式表。样式表是指一个样式的列表,是为网页中的各种元素设定好的样式的集合,它可以当作网页的模板来使用。 l 使用外部样式表:格式/样式表链接 l 创建内嵌式样式表:格式/样式/列表/用户自定义样式/新建 6) 让网页充满动感 文本动画效果:运用Frontpage2000可以增加文本的动画效果,如逐字放入、从右侧飞入、螺旋、波动等 l 图片动画效果:方法是;格式/动态LHTM l 设置网页过渡效果,Frontpage2000设置了20多种网页过渡效果,如合状收缩、圈入、向右擦等。 7) 制作交互式表单 制作交互式表单主要方法有两个:一是使用插入的方式创建表单,方法是插入/表单;二是利用表单模板创建表单。方法是文件/新建/网页/新建/表单网页向导。 8) 保存或上传主页 可以使用CuteFTP或web publisher上传主页,在网上发布信息。 第 131 页
Dreamweaver与主页制作 1. 什么是Dreamweaver? Dreamweaver是美国Macromedia公司开发的集网页制作和管理网站于一身的所见即所得网页编辑器,它是第一套针对专业网页设计师特别发展的视觉化网页开发工具,利用它可以轻而易举地制作出跨越平台限制和跨越浏览器限制的充满动感的网页,见下图。 图 Dreamweaver用户界面 Macromedia公司大家不会感到陌生,著名的多媒体开发工具Authorware和Director均出自该公司的旗下,以及目前在互联网(Internet)上越来越流行的网络多媒体开发工具Flash也是出自该公司的旗下。而Dreamweaver则是Macromedia公司继Flash以后向互联网(Internet)推出的又一梦幻工具。Dreamweaver、Flash以及在Dreamweaver之后推出的针对专业网页图像设计的Fireworks,三者被Macromedia公司称为Dreamteam(梦之队),足见市场的反响和Macromedia公司对它们的自信。 随着互联网(Internet) 的家喻户晓,HTML技术的不断发展和完善,随之而产生了众多网页编辑器。从网页编辑器基本性质可以分为所见即所得网页编辑器和非所见即所得网页编辑器(原始代码编辑器),两者各有千秋。 所见即所得网页编辑器的优点就是直观性、使用方便、容易上手,你在所见即所得网页编辑器进行网页制作和在Word中进行文本编辑不会感到有什么区别,但它同时也存在着致命的弱点。如难以精确达到与浏览器完全一致的显示效果。也就是说你在所见即所得网页编辑器中制作的网页放到浏览器中是很难完全达到你真正想要的效果,这一点在结构复杂一些的网页(如分帧结构、动态网页结构)中便可以体现出来;页面原始代码的难以控制性,比如你在所见即所得编辑器中制作一张表格也要几分钟,但你要它完全符合你要求可能需要几十分钟,甚至更多时间。 而相比之下,非所见即所得的网页编辑器,就不存在这个问题,因为所有的Html代码都在监控下产生,但是由于非所见则所得编辑器的先天条件如每一代码都要手工输入,所以了它的工作的低效率。 如何实现两者的完美结合,既产生干净、准确的Html代码,又具备所见即所得的高效率、直观性,一直是网页设计师梦想。在Dreamweaver之前,Frontpage98一直被人们认为是最好的所见即所得网页编辑器,但是它同样继承了所见即所得的种种弊端。 2. Dreamweaver特点 1) 最佳的制作效率 Dreamweaver可以用最快速的方式将fireworks,Freehand,或Photoshop等文件移至网页上。使用检色吸管工具选择屏幕上的颜色可设定最接近的网页颜色。对于选单,快捷键与格式控制,都只要一个简单步骤便可完成。Dreamweaver能与你喜爱的设计工具,如Playback Flash,Shockwave和外挂模组等搭配,不需离开Dreamweaver便可完成,整体运用流程自然顺畅。除此之外,只要单击便可使Dreamweaver自动开启firework或photoshop来进行编辑与设定图形文档的最佳化。 第 132 页
2)网站管理 使用网站地图可以快速制作网站雏形,设计、更新和重组网页。改变网页位置或文件名称,Dreamweaver会自动更新所有连结。使用文字、HTML码、HTML属性标签和一般语法的搜寻及置换功能使得复杂的网站更新变得迅速又简单。 3)无可比拟的控制能力 Dreamweaver是唯一提供Roundtrip HTML、视觉化编辑与原始码编辑同步的设计工具。它包含Homesite和bbedit等主流文字编辑器。帧(Frames)和表格的制作顷刻可就。进阶表格编辑功能使你简单地选择单格、行、栏或作不连续的选取。甚至可以排序或格式化表格群组。Dreamweaver支持精确定位,利用可轻易转换成表格的图层以拖拉置放的方式进行版面布局和美化。 4)所供即所得 Dreamweaver成功整合了动态式出版视觉编辑及电子商务功能,提供超强的支持能力给第三方(Third-Party),包括Asp、Apache、Broadvision、Cold Fusion、Icat、Tango与自行开发的应用软体。当你正使用Dreamweaver在设计动态网页时,所供即所得的功能,让你不需要透过浏览器就能预览网页。 5)梦幻样版和XML Dreamweaver将内容与设计分开,应用于快速网页更新和团队合作网页编辑。建立网页外观的样版,指定可编辑或不可编辑的部份;内容提供者可直接编辑以样式为主的内容,却不会不小心改变既定之样式。 6)全方位的呈现 利用Dreamweaver设计的网页,可以全方位的呈现在任何平台的热门浏览器上。对于CSS(Cascading Style Sheets)的动态HTML支持、鼠标换图效果、声音和动画的Dhtml效果资料库可在Netscape和Microsoft浏览器上执行。使用不同浏览器显示功能,Dreamweaver可以告知你在不同浏览器上执行的效果如何。当有新的浏览器上市时,只要从Dreamweaver的网站上下载它的描述文档,便可得知详尽的效果报告。 总之,Dreamweaver具有十分强大的功能和简易操作,并且可以方便嵌入各种脚本语言和ASP语言等。具体的使用方法可参考有关书籍。 网络信息组织语言工具 网络信息组织语言包括HTML、JavaScript、VbScript等常用语言工具,以及目前流行的ASP语言和功能强大的Java语言。实际上如VB、VC等语言通过一定的中介也可以进行网络信息的组织工作。目前又有一种新的语言引起了大家的普遍关注,这就是XML语言,这种语言可以对网上信息进行结构化描述,从而是人们组织和利用网上信息变得更为简单。 HTML语言工具 HTML语言含义是超文本置标语言,它是WWW网页信息组织的基础,一般网页制作工具可自动生成HTML语言代码,且比较简单。这里介绍,有关它以及新的标准的其他后续改动的细节,请参见 Netscape(http://)或 Microsoft ()corn)Web站点。 其基本语法结构是: <HTML> HTML文档开始标志。 第 133 页
<HEAD><title>…</title></HEAD> HTML文档的头部和标题。 <BODY> … HTML文档的主体 </BODY> </HTML> HTML文档结束标志 HTML标记用来创建具有文本、标题和列表的基本HTML页面,其基本的构成元素标记有: 1.注释 <!—…一>创建注释。也可以用来在不支持Javascript的例览器中隐藏Javascript。 <COMMENT>…</COMMENT>-一指定注释的新的正式方法。 2.结构标记 <HTML>…</HTML>——括住整个HTML文档。 <HEAD>…</HEAD>-一括住HTML文档的头部。 <BODY>…</BODY>——括住HTML文档的主体(文本和标记)。 属性:BACKGROUND、BGCOLOR、TEXT、LINK、ALINK、VLINK、BGPROPERTIES、TOPMARGIN、BOTTOMMARGIN。 <META>-一指示关于该文档的元信息(关于文档本身的信息)。例如,搜索引擎的关键词、用来检索该文档的特殊HTTP标题、过期日期等。 元信息通常以码/值对的形式出现,用于文档<HEAD>中。 属性:HTTP-EQUIV、NAME、CONTENT。 3.标题和题目 <H?>…</H?>——第?级标题,?从1到7。 <TITLE>…</TITLE>——指示文档的题目,用在<HEAD>中,所有标题标记都接受以下的属性:ALIGN 4.段落和区域 </P>…</P>-一普通段落。结束标记(</P>)是可选的。 5.链接 <A>…</A>-一加上HRE属性,可创建到另一文档或锚点的链接;加上NAME属性,可创建能链接到的锚点。 属性:HREF“…”——激活链按时要调用的文档的URL。NAME“…”--锚点名。TARGET=“…”--链接的文档应处于的框架名。 6.列表。 <OL>…〈/OL〉——有序(编号)列表。 属性:TYPE=“…”——用来标记列表项的编目符号。可能的值是DISC、CIRCLE(或ROUND和 SQUARE)。 <MENU>…〈/MENU〉——项目菜单列。 7.其他元素 <HR>-一水平标线。 属性:SIZE、WIDTH、 ALIGN、RIGHT和CENTER、NOSHADE、COLOR <ADDRESS>…</ADDRESS>-一用于签名或关于文档作者的一般信息。 <CENTER>…</CENTER>-一使文本或图像后中。 <BLINK>…</BLINK>-一使所括住的文本强烈闪烁。 <FONT>…</FONT>-一更改所括住的文本的字体大小。 第 134 页
属性: SIZE、COLOR、FACE 8.图像、声音和嵌入媒体 <IMG>-一在文档中插入内联图像。 属性:ISMAP、SRC、ALT、ALIGN、VSPACE、HSPACE、WIDTH、HEIGHT、BORDER、LOWSRC、DYNSRC。 <OBJECT></OBJECT>(MS)——在文档中插入图像、视频、 Java applet或 ActiveX OLE控件。 9.表单 <FORM>…</FORM>——指示输入表单。 属性: ACTION=“…”——处理该表单输入的脚本的URL。METHOD=“…”——表单输入发送到服务器端的网关的方式。可能的值是GET和 POST。ENCTYPE=“…”--通常值为 application/x-www-form-urlen coded。对于文件上载,使用multi-part/form-data。NAME=“…”--Javascript脚本用来引用该表单的名称。 <INPUT>——表单的输入元素。 属性: TYPE=“…”——该输入工具的类型。可能的值是CHECKBOX、HIDDEN、RADIO、RESET、SUBMIT、TEXT、SEND、FILE或IMAGE。NAME=“…”——在作为名称/值对的一部分传送给网关脚本时,该项的名称。VAlUE=“…”--对于文本或隐藏工具是默认值。对于复选框或单选按钮是与表单一起提交的值。对于Reset或Submit按钮则是按钮本身的标签。SRC=“…”——图像的源文件。CHECKED=“…”——对于复选框和单选按钮,表示工具已选中。SIZE=“…”——以字符为单位的文本工具的大小。MAXLENGTH=“…”——可在文本工具中输入的最大字符数。ALIGN=“…”——对表单中的图像,确定文本和图像的对齐方式(与<IMG>标记相同)。 <SELECT>…</SELECT>_创建可能项的菜单或滚动列表。 属性:NAME、SIZE、MULTIPLE。 <OPTION>-一指示<SELECT>元素内的可能项。 属性:SELECTED、VALUE。 10.表 <TABLE>…</TABLE>-一创建可包含大标题(<CAPTION>)和任何个数的行(<TR>) 的表。 属性:BORDER、CELLSPACING、WIDTH、ALIGN、BACKGROUND、BGCOLOR、BORDECOLOR BORDERCOLORLIGHT、BORDERCOLORLIGHT、VALIGN、FRAME。 <TH>…</TH>-一定义表的标题单元。 <TD>…</TD>-一定义表数据单元。 <COL>…</COL>——设置一列或多列的宽度和对齐方式特性。 <COLGROUP>…</COLGROUP>-一一次性设置一组列的特性(应包括一个或多个<COL>标记)。 <FRAMESET>…</FRAMESET>-一将主窗口分成一组可分别显示独立文档的框 架。 属性: ROWS=“…”--将窗口或框架组垂直地分成数字指定数目的列,整个窗口宽度的百分比。COLS=“…”——与ROWS相似,只不过窗口或框架组是水平地分成行的。 11.脚本和APPLET <APPLET>——插入自运行的 Java applet。 第 135 页
属性:CLASS、SRC、ALIGN、WIDTH、HEIGHT <SCRIPT>-一解释过的脚本程序。 属性:LANGUAGE、SRC。 12.特效 <MARQUEE>…</MARQUEE>-一在滚动的大框内显示文本。 JavaScript及VbScript语言工具 JavaScript和VBScript 均是描述(脚本)语言,此二语言可以被嵌入 HTML 的文件之中,功能也大致相同。目前流行的浏览器都支持这两种语言。 1.JavaScript JavaScript 和Java很类似,但并不一样!Java是一种比JavaScript 更复杂许多的程序语言,而 JavaScript 则是相当容易理解的语言。JavaScript 创作者可以不那么注重程序技巧,所以许多 Java 的特性在 Java Script 中并不支支持。相关的更多信息,可以去 Netscape 的网站查找。 如何执行 JavaScript?Netscape beta3版以上,就有执行JavaScript的功能,其他种类的 WWW 浏览器如Internet Explore 也同样支持。 以下以一些例子来讲述如何将JavaScript写在HTML文件中,并且体会一下新语言的特性,我们第一个例子是用JavaScript显示一串文字: 程序1: <html> <head> My first JavaScript! </head> <body> <br> This is a normal HTML document. <br> <script language="JavaScript"> ("这是用JavaScript打出的!") </script> <br> Back in HTML again. </body> </html> 以上范例的结果如下: This is a normal HTML document. 这是以 JavaScript 印出的! Back in HTML again. 接下来下一个例子所要介绍的是有关函数 (function) 的使用。函数通常是在HTML文件中<body>的部份被调用,当然它最好事先被声明并放在HTML文件中<body>之前,以便在<body>部分中使用到函数时,它已被确定以便读取。 第 136 页
另外,<script>标签的有关描述语法部分,可以用注解的符号将它括起来,以免旧版或无法读取JavaScript的浏览器读到,从而无法正确显示。 程序2: <html> <head> <script language="JavaScript"> function pushbutton{alert("Hello,World!"} </script> </head> <body> <form> <input type="button" name="Button1" value="Push me" onclick="pushbutton()"> </form> </body> </html> 在该例中,将会产生一个按钮,当你用鼠标去点击它的时候,应该会出现一个视窗上面有“Hello,World!”的字符串, 这个结果是如何产生的呢?首先,在 <head>内的函数会被载入并存于内存中,接着一个新的<form>标签<input type="button".....>将产生一个接钮。然后,你可以在后面看到'onClick'的指令,这就是告诉浏览器,当该按钮被按时,应会执行onClick后的函数'pushbutton()',而这个函数在程序刚刚被载入时就已安放在内存中了!在这个函数中我们用到了alert的方法(method),是JavaScript事先定义好的,它会以对话视窗显示信息,并有一"确定"(OK)的按钮。JavaScript定义了许多的method,method也可以做相当多的事情。 下面再列举一例: 程序3: <html> <body> This is a simple HTML- page. <br> Last changes: <script language="JavaScript"> <!—— hide script from old browsers () // end hiding contents ——> </script> </body> </html> 2.VBscript介绍 VBscript是VBA的一个子集,所以它有很多地方类似于VB语言,但它毕竟不同于VB,语言的功能和语言集都有许多差异。VBscript的基本格式与Javascript类似。下面列举一例: 程序1: <script language="vbscript"> <!-- sub windows_onload() 第 137 页
=blue msgbox"hello, world!" end sub --> <script> 从这里看出Vbscript语言同样有结构: <script language="vbscript"> <!-- …… --> </script> 其中 sub与end sub是Vbscript执行过程操作的主体,另外一个有用的是函数,其表示方法是 Function sum(x) Y=x*x End function Vbscript使用变量之前要用Dim、Public、Private语句进行定义,变量分为标量变量和数组变量,数组变量定义非常简单,使用Dim arr(x)即可,而且可以定义动态数组,这与C语言不同。 ASP语言与动态网页制作 由于asp语言强大的功能和易学易用的特点深受广大网络编程人员和用户的喜爱,所以这里对asp语言做一较为详细的介绍。 1.Active Server Pages 的特点 Microsoft Active Server Pages 即我们所称的ASP,其实是一套微软开发的服务器端脚本环境,ASP内含于IIS 和之中,通过ASP我们可以结合HTML网页、ASP指令和ActiveX组件建立动态、交互且高效的WEB服务器应用程序。所有的程序都将在服务器端执行,包括所有嵌在普通HTML中的脚本程序。当程序执行完毕后,服务器仅将执行的结果返回给客户浏览器,这样也就减轻了客户端浏览器的负担,大大提高了交互的速度。 以下是Active Server Pages 所独具的一些特点: 1)使用VBScript、JavaScript等简单易懂的脚本语言,结合HTML代码,即可快速地完成网站的应用程序。 2)无须compile编译,容易编写,可在服务器端直接执行。 3)使用普通的文本编辑器,如Windows的记事本,即可进行编辑设计。 4)与浏览器无关(Browser Independence),用户端只要使用可执行HTML码的浏览器,即可浏览Active Server Pages所设计的网页内容。Active Server Pages所使用的脚本语言(VBScript、JavaScript)均在WEB服务器端执行,用户端的浏览器不需要能够执行这些脚本语言。 5)Active Server Pages能与任何ActiveX scripting语言相容。除了可使用VBScript或JavaScript语言来设计外,还通过plug-in的方式,使用由第三方所提供的其他脚本语言,譬如REXX、Perl、Tcl等。脚本引擎是处理脚本程序的COM(Component Object Model) 物件。 6)Active Server Pages的源程序,不会被传到客户浏览器,因而可以避免所写的源程序被他人剽窃,也提高了程序的安全性。 7)可使用服务器端的脚本来产生客户端的脚本。 第 138 页
8)物件导向(Object-oriented)。 9)ActiveX Server Components(ActiveX服务器元件)具有无限可扩充性。可以使用Visual Basic、Java、Visual C++、COBOL等编程语言来编写你所需要的ActiveX Server Component。 2.运行 ASP 所需的环境: l Microsoft Internet Information Server version on Windows NT Server l Microsoft Peer Web Services Version on Windows NT Workstation l Microsoft Personal Web Server on Windows 95/98 正如前文所述,与一般的程序不同,ASP程序无须编译,ASP程序的控制部份,是使用VBScript、JavaScript等脚本语言来设计的,当执行ASP程序时,脚本程序将一整套命令发送给脚本解释器(即脚本引擎),由脚本解释器进行翻译并将其转换成服务器所能执行的命令。 要在非NT平台上开发并运行ASP应用程序,我们可以依赖于一套名为InstantASP的第三方软件。这套由Halcyon软件公司开发的软件使得你无需重复开发原有ASP应用程序即可以将它运行在任何操作平台上!这样非但节省了大量的开发时间,而且使得ASP真正成为了一种跨平台的Internet、Intranet或Extranet应用程序。关于Instant ASP,有兴趣的朋友可以到它的站点上去看看, ASP程序其实是以扩展名为.asp的纯文本形式存在于web服务器上的,你可以用任何文本编辑器打开它,ASP程序中可以包含纯文本、HTML标记以及脚本命令。你只需将ASP程序放在WEB服务器的虚拟目录下(该目录必须要有可执行权限),就可以通过WWW的方式访问ASP程序了。 3.ASP程序结构 <% %>符号是标准的ASP定界符,所有的ASP命令都必须包含在<% %>之内,ASP通过包含在<% %>中的表达式将执行结果输出到客户浏览器,如:<%=test%>就是将前面赋给变量test的值发送到客户浏览器中,如当变量test的值为Chinese时,以下程序: This weekend we will test < % =test %>. 在客户浏览器中则显示为: This weekend we will test Chinese. 4.ASP编程简介 1)基本知识 (1)变量:作为一门语言,ASP同样具有自己的变量,所谓变量是计算机内存中已命名的存储位置,其中包含了数字或字符串等数据,它使用户便于理解脚本操作的名称,为用户提供了一种存储、检索和操作数据的途径。变量分为局部变量和全局变量,可以有相同的名称,因为作用领域不同,改变其中一个的值并不会改变另一个的值。ASP提供两个内建对象来让你存储变量:Session对象和Application对象。 (2)程序结构:ASP的程序结构同样有三种情况,即循环结构、条件结构和顺序结构。如使用For...Next循环,如下所示: < % For i = 1 To ("hobby").Count ("hobby")(i) & "< BR>" Next %> <% For Each i In ("hobby") i & "< BR>" 第 139 页
Next %> (3)组件:提供对组件的支持是现代面向对象编程语言的特点之一。Active Server Pages (ASP) 提供了在服务器上运行ActiveX脚本和ActiveX组件的服务器方脚本环境。开发人员可以将脚本和组件结合在一起创建基于Web的应用程序。如ASP提供了ADO Active组件,它是为基于Internet以数据为中心的应用程序而优化的一组基于对象的数据访问接口。ADO基于已发布的规范并且随带在Microsoft Internet Information Server和Microsoft Visual InterDev中。 组件使人们不用学习编程就能够编写强大的脚本。它是包含在动态链接库.dll或可执行文件.exe中的可执行代码。组件可以提供一个或多个对象以及对象的方法和属性。要使用组件提供的对象,应创建对象的实例并将这个新的实例分配变量名。使用ASP的方法可以创建对象的实例,使用脚本语言的变量分配指令可以为对象实例命名。如下例: Set db=("") 2)对象与编程 对象就是指由当作完整实体的操作和数据组成的变量。对象是基于特定模型的,在对象中客户使用对象的服务通过由一组方法或相关函数的接口访问对象的数据,然后客户端可以调用这些方法执行某中操作。 目前的ASP版本总共提供了六个内建对象,下面让我们将通过实例分别来介绍。 (一)、Request 对象 可以使用 Request 对象访问任何基于HTTP请求传递的所有信息,包括从HTML表格用POST方法或GET方法传递的参数、cookie和用户认证。Request对象使你能够访问客户端发送给服务器的二进制数据。 Request 的语法 : Request[. 集合 | 属性 | 方法 ]( 变量 ),使用的集合有: a)Form :Form集合通过使用POST方法的表格检索邮送到HTTP请求正文中的表格元素的值。语法:(element)[(index)|.Count] b)QueryString:QueryString集合检索HTTP查询字符串中变量的值,HTTP查询字符串由问号(?)后的值指定。如:< A HREF= " is a sample">string sample < /A> ,语法:(variable)[(index)|.Count] 。 c)Cookies :Cookie其实是一个标签,当你访问一个需要唯一标识你的站址的WEB站点时,它会在你的硬盘上留下一个标记,下一次你访问同一个站点时,站点的页面会查找这个标记。使用Cookie还可以在页面之间交换信息。Request提供的Cookies集合允许用户检索在HTTP请求中发送的cookie的值。这项功能经常被使用在要求认证客户密码以及电子公告板、WEB聊天室等ASP程序中。 语法:(cookie)[(key)|.attribute] d)ServerVariables:大家都知道在浏览器中浏览网页的时候使用的传输协议是HTTP,在HTTP的标题文件中会记录一些客户端的信息,如:客户的IP地址等等,有时服务器端需要根据不同的客户端信息做出不同的反映,这时候就需要用ServerVariables集合获取所需信息。 语法: ( 服务器环境变量) 由于服务器环境变量较多,在此不一一列举了,读者可参考相关书籍。 (二)、Response对象 第 140 页
与Request是获取客户端HTTP信息相反,Response对象是用来控制发送给用户的信息,包括直接发送信息给浏览器、重定向浏览器到另一个URL或设置cookie的值。 语法:|property|method ,使用的属性有: a)Buffer:Buffer属性指示是否缓冲页输出。当缓冲页输出时,只有当前页的所有服务器脚本处理完毕或者调用了Flush或End方法后,服务器才将响应发送给客户端浏览器, b) Charset:Charset属性将字符集名称附加到Response对象中content-type标题的后面。 c) ContentType:ContentType属性指定服务器响应的HTTP内容类型。如果未指定ContentType,默认为text/HTML。 d) Expires:Expires属性指定了在浏览器上缓冲存储的页距过期还有多少时间,以确保安全。 e) ExpiresAbsolute:ExpiresAbsolute属性指定缓存于浏览器中的页面的确切到期日期和时间。 方法有:a)Clear:可以用Clear方法清除缓冲区中的所有HTML输出。b)End:End方法使Web服务器停止处理脚本并返回当前结果。c)Flush:Flush方法立即发送缓冲区中的输出。D)Redirect:Redirect方法使浏览器立即重定向到程序指定的URL。E)Write:它是将指定的字符串写到当前的HTTP输出。 使用的集合有:Cookie:Cookies集合设置cookie的值。若指定的cookie不存在,则创建它。若存在,则设置新的值并且将旧值删去。 语法: (cookie)[(key)|.attribute]=value 下面给大家举一段简单的程序,文件名。(注意将<和%之间的空格去掉!!!) < % Dim user Dim flag Dim pwd Dim say =true ' 开启缓冲页面功能 ="text/HTML" ="gb2312" user=("username") pwd=("password") say=("say") %> < form method="POST" action=""> < p> 用户名 :< input type="text" name="username" size="12">< br> 口 令 :< input type="password" name="password" size="12">< br> < input type="submit" value=" 提交 " name="B1"> < input type="reset" value=" 取消 " name="B2">< /p>< /form> < %If say=1 then " 欢你的驾光临 !" End If If say > 1 then " 欢迎再次光临ASP网站 !" End If 第 141 页
If user="Adm" and pwd="fangang" Then =1 ' 设置该页面在浏览器的缓冲中存储 1 分钟后过期。 flag=1 ElseIf user="guest" and pwd="guest" Then =0 ' 使缓存的页面立即过期。 ' 清空存储在缓存中的页面 flag=2 ElseIf user="vip" and pwd="PASS" Then " 欢迎光临我的网站 " flag=3 Else flag=0 ' 立即停止脚本处理,并将缓存中的页面输出 End If "< p>< a href=' 动态网站设计实践练习</a></p>" ' 将变量 flag 的值传送给 %> < /p> 再将以下程序保存为 。 < % Dim saysay=("flag") Select case say case "1" " case "2" " case "3" " case "0" " End Select %> (三)、Application对象 在ASP的内建对象中除了用于发送、接收和处理数据的对象外,还有一些非常实用的代表Active Server应用程序和单个用户信息的对象。 让我们先来看看Application对象。在同一虚拟目录及其子目录下的所有.asp文件构成了ASP应用程序。我们非但可以使用Application对象,在给定的应用程序的所有用户之间共享信息,并在服务器运行期间持久的保存数据。而且,Application对象还有控制访问应用层数据的方法和可用于在应用程序启动和停止时触发过程的事件。Application对象。 1.属性:虽然Application对象没有内置的属性,但我们可以使用以下句法设置用户定义的属性也可称为集合。Application("属性/集合名称")=值 我们可以使用如下脚本声明并建立Application对象的属性。 第 142 页
Application("MyVar") = "Hello" 2.方法:Application对象有两个方法,它们都是用于处理多个用户对存储在Application中的数据进行写入的问题。Lock方法禁止其他客户修改Application对象的属性。Unlock方法允许其他客户修改Application对象的属性。 3.事件:Application_OnStart:当WEB服务器启动并允许对应用程序所包含的文件进行请求时就触发Application_OnStart事件。Application_OnStart事件的处理过程必须写在文件之中。Application_OnEnd:Application_OnEnd事件在应用程序退出时于Session_OnEnd事件之后发生,Application_OnEnd事件的处理过程也必须写在文件之中。 (四)、Session 与Application对象具有相近作用的另一个非常实用的ASP内建对象就是Session。我们可以使用Session对象存储特定的用户会话所需的信息。当用户在应用程序的页之间跳转时,存储在Session对象中的变量不会清除,而用户在应用程序中访问页面时,这些变量始终存在。 1.属性:SessionID属性返回用户的会话标识。在创建会话时,服务器会为每一个会话生成一个单独的标识。TimeOut属性以分钟为单位为该应用程序的Session 2.方法:Session对象仅有一个方法Abandon,Abandon方法删除所有存储在Session对象中的对象并释放这些对象的源。 3.事件:Session对象有两个事件可用于在Session对象启动和释放是运行过程。Session_OnStart和Session_OnEnd 下面将给大家举出一个ASP的Chat程序,供大家参考。请将以下代码剪贴到记事簿并保存为。 < %@ Language=VBScript %> < % =true ' 设置输出缓存,用于显示不同页面。 On error resume next ' 忽略程序出错部分 If ("Request_Method")="GET" then ' 判断客户是以什么方式请求WEB页面 '———————————————————————— ' 客户登陆界面 '———————————————————————— %> < form method="POST" action="">< p> < input type="text" name="nick" size="20" value="nick" style="background-color: rgb(192,192,192)">< br> < input type="submit" value=" 进入聊天室 " name="B1" style="color: rgb(255,255,0); font-size: 9pt; background-color: rgb(0,128,128)"> < p>< input type="hidden" name="log" size="20" value="1">< br>< /p> < /form> < % ' 结束程序的处理 Else ' 清空缓存中的内容 第 143 页
dim talk If ("nick")<>"" then ' 判断客户是是否在聊天界面中 Session("nick")=("nick") End If '————————————————————————' 客户聊天界面 '———————————————————————— %> < form method="POST" action="" name=form1> < p>< %=Session("nick")%> 说话:< input type="text" name="talk" size="50">< br> < input type="submit" value=" 提交 " name="B1"> < input type="reset" value=" 取消 " name="B2">< /p> < /form> < A HREF="/asptest/fangang/"> 离开 < /a>< br>< br> < % If ("log")<>1 then If trim(("talk"))="" then ' 判断用户是否没有输入任何内容 talk=Session("nick")&" 沉默是金。" Else talk=trim(("talk")) ' 去掉字符后的空格 End If Application("show")="< table border='0' cellpadding='0' cellspacing='0' width='85%' >< tr>< td width='100%' bgcolor='#C0C0C0'>< /td>< /tr>< tr>< td width='100%'>< font color='#0000FF'> 来自 "&("remote_addr")&" 的 "&Session("nick")&time&" 说:< /font>"&talk&"< /td>< /tr>< tr>< td width='100%' bgcolor='#C0C0C0'>< /td>< /tr>< /table>< br>"&Application("show") Application("show") End If End If %> (五)、Server对象 Server对象提供对服务器上的方法和属性的访问,其中大多数方法和属性是作为实用程序的功能服务的。有了Server对象,我们就可以在服务器上启动ActiveX对象例程,并使用Active Server服务提供象HTML和URL编码这样的函数。 1.语法:|method 第 144 页
2.属性:ScriptTimeout超时值,在脚本运行超过这一时间之后即作超时处理。 <%=100%> 3.方法:HTMLEncode方法允许你对特定的字符串进行HTML编码;Server对象的URLEncode方法可以根据URL规则对字符串进行正确编码;MapPath方法将指定的相对或虚拟路径映射到服务器上相应的物理目录上。语法如下:(Path)Path指定要映射物理目录的相对或虚拟路径;CreateObject方法是ASP中最为实用,也是最强劲的功能了,它用于创建已经注册到服务器上的ActiveX组件实例,正是因为这些组件才使得ASP具有了强大的生命力。 其语法如下:("Component Name") 可以使用<OBJECT>标记并设置SESSION或Application的SCOPE属性,也可以在对话及应用程序变量中存储该对象。如下例程: < % Set Session("ad") = ("")%> 这里需要注意的是,不能创建与内建对象同名的对象实例,否则,如下列脚本将返回错误。 下面列出了ASP可安装的常用组件。 Ad Rotator创建一个AdRotator对象,该对象可按指定计划在同一页上自动轮换显示广告。 Browser Capabilities创建一个BrowserType对象,该对象决定访问WEB站点的每个浏览器的性能、类型及版本。 Database Access 提供用 ActiveX Data Objects (ADO)对数据库的访问。 Content Linking创建一个NextLink对象,该对象可生成WEB页内容列表,并象书一样将各页顺续连接。 File Access组件提供文件的输入输出访问。 Collaboration Data Objects for NTS 组件 可以快速、简便的在WEB页上添加收发邮件功能。该组件只适用于Internet Information Server for Windows NT Server 。 MyInfo创建一个MyInfo对象,该对象追踪个人信息,例如站点管理员的姓名、地址及显示选择。 Counters创建一个Counters对象,该对象可以创建、保存、增加或检索任意数量的独立计数器。 Content Rotator自动翻转WEB主页上的HTML内容字符串。 PageCounter记录并显示WEB页被打开的次数。 下面重点介绍Database Access组件: ASP内建的Database Access 组件使得我们能够轻而易举地通过ActiveX Data Objects(ADO)访问存储在服务器端的数据库或其他表格化数据结构中的信息。ADO是对当前微软所支持的数据库进行操作的最有效和最简单直接的方法,它是一种功能强大的数据访问编程模式。ASP程序员就可以访问任何与ODBC兼容的数据库,包括MS SQL SERVER、Access、Oracle等等。 以下是利用ASP的Database Access组件通过ADO连接并操作WEB数据库的步骤 第一步:指定想要连接的数据库,有DSN和DSN-less两种方法。 DSN(Data Source Name 数据源名称):建立一个系统数据源名称,方法如下: 1)单击“开始”,选设置控制面板。 2)双击图标“32位ODBC”,将弹出一个对话框,选标签“System DSN” 3)单击“Add”添加一个 DSN入口,选择如“Microsoft Access Drive”并确认。 第 145 页
4)在“Data Source Name”栏里输入你希望指定的DSN,然后单击“Select”选择数据库存放位置,你可以按“Browse”来选取。 ` 5)以上步骤完成后,在ASP程序中指定DSN,如下所示: < %connstr = "DSN"%> DSN-less:是另一种通过在ASP文件里直接指定数据库文件所在位置,而无需建立DSN的方法。由于许多公司没有自己的WEB服务器,他们的网站往往是存放在远端的虚拟服务器上,因此要建立和修改DSN的设置比较麻烦。而使用DSN-less方法直接指定远端数据库所在位置恰恰解决了这一问题,方法如下: < % connstr = DBQ="+("database/")+";DefaultDir=;DRIVER={Microsoft Access Driver (*.mdb)};DriverId=25;FIL=MS Access;ImplicitCommitSync=Yes;MaxBufferSize=512;MaxScanRows=8;PageTimeout=5;SafeTransactions=0;Threads=3;UserCommitSync=Yes;" %> 在指定了想要连接的数据库后,就可以通过以下方法连接并打开数据库: < % Set Conn = ("") constr %> 第二步:指定想要执行的SQL指令,可以使用RecordSet。 当连接了数据库后就可以对数据库进行操作,比如查询、删除、更新等等,这些操作都是通过SQL指令来完成的,如下例在数据库表datebase中查询所有姓名中有“A”的记录: < % sql="select * from datebase where name like 'A%%'" Set rs = (sql) %> 第三步:使用RecordSet属性和方法,并显示执行的结果。 更为常用的是Recordset对象,它可用于精确地控制指针的行为,提高你检查和更新结果的能力。 Recordset的使用方法如下: Set rs = ("") SQL指令,Conn,1,1`读取 打开、复制和关闭Recordset的方法是: [source],[ActiveConnection],[Cursor Type],[LockType],[Options] Source参数可以是SOL语句或其他语句。 Close与Clone分别关闭和复制Recordset。 通过以上指令,我们创建了一个包含数据的游标(RecordSet)“rs”,事实上游标是存储在活动内存中的类似记录和字段的数组东西,当通过RecordSet组件创建一个游标时,它从数据提供者的得到一个数据集,并用它来充实游标。RecordSet的字段是用RecordSet的Field集合表示的。 下面列出了所创建的RecordSet对象(游标)的一些属性和方法: : RecordSet对象的字段总数。 rs(i).Name:第i个字段的名称,i由0算起到-1。 rs(i):读取第i个字段的数据,i由0算起到-1。 第 146 页
rs("字段名称"):读取指定字段的数据。 :游标中的数据记录总数。 :是否已指到最后一条记录。 : 将指标移到下一条记录。 : 将指标移到上一条记录。 : 将指标移到第一条记录。 : 将指标移到最后一条记录。 : 关闭 RecordSet 对象 这里以SQL 的PUB数据库中EMPLOYEE数据表为例,通过对pub_id列和fname列的内容进行查询匹配,将检索的结果通过执行显示在客户端。 下面是程序的源代码: -------- <html> <br> <title>职工列表</title> <h1>职工列表</h1> <style type="text/css"> <!-- td { font-size: 9pt} body { font-size: 9pt} --> </style> <hr><br> <% Set OBJdbConnection = ("") "DSN=asp_em;UID=sa;PWD=123" SQLQuery = "SELECT * FROM employee" Set RS = (SQLQuery) Set session("rs")=RS '将查询结果以表的方式输出 "<table border=1>" "<tr>" for i=0 to session("rs").-1 "<td>" & Session("rs")(I).name & "</td>" next "</tr>" Do While Not session("rs").EOF %> <tr> <td><%= session("rs")("emp_id")%></td> <td><%= session("rs")("fname")%></td> <td><%= session("rs")("minit")%></td> <td><%= session("rs")("lname")%></td> <%ppp=session("rs")("job_id") %> 第 147 页
<td> <a HREF="http://blacko/文档/<% =ppp %>.txt"><%= session("rs")("job_id")%></a></td> <td><%= session("rs")("job_lvl")%></td> <td><%= session("rs")("pub_id")%></td> <td><%= session("rs")("hire_date")%></td> </tr> <% session("rs").MoveNext Loop %> </table> <form method="POST" action="http://blacko/asp/" > <p>按pub_id检索:<input name="class" size="15" style="font-size:9pt"> 按fname检索: <input name="name" size="25" style="font-size:9pt"> <input type=submit value="检索" style="font-size:9pt"><input type=reset value="重置" style="font-size:9pt"></p> </form> </body> </html> <html> <br> <h1>职工检索结果</h1> <% aaa=("class") %> <% bbb=("name") %> <% Set OBJdbConnection = ("") "DSN=asp_em;UID=sa;PWD=123" SQLQuery = "SELECT * FROM employee where pub_id like '%"& aaa &"%' and fname like '%"& bbb &"%' order by fname" Set RS = (SQLQuery) Set session("rs")=RS '将查询结果以表的方式输出 "<table border=1>" "<tr>" for i=0 to session("rs").-1 "<td>" & Session("rs")(I).name & "</td>" next "</tr>" Do While Not session("rs").EOF %> <tr> <td><%= session("rs")("emp_id")%></td> <td><%= session("rs")("fname")%></td> <td><%= session("rs")("minit")%></td> 第 148 页
<td><%= session("rs")("lname")%></td> <%ppp=session("rs")("job_id") %> <td><a HREF="http://blacko/文档/<% =ppp %>.txt"> <%= session("rs")("job_id")%></a></td> <td><%= session("rs")("job_lvl")%></td> <td><%= session("rs")("pub_id")%></td> <td><%= session("rs")("hire_date")%></td> </tr> <% session("rs").MoveNext Loop %> </table> <form method="POST" action="http://blacko/asp/"> <p>按pub_id检索:<input name="class" size="15"> 按fname检索: <input name="name" size="25"> <input type=submit value="检索" ><input type=reset value="清除"></p> </form> </body> </html> Web技术中的Asp的应用使得Asp与数据库的集成更为有效和简洁,使得用户通过客户端浏览器按定制格式输入条件就可以对数据库进行检索、插入、删除、修改等各种操作,打破了原来各种数据库的操作需要通过特定方式来实现的局限。这将推动Web信息检索系统向一种全新的技术模式Browser/Server模型发展。 (六)、Recordset对象 进行ADO存取数据库时的分页显示,其实就是对Recordset的记录进行操作。所以我们首先必须了解Reordset对象的属性和方法: BOF属性:目前指标指到RecordSet的第一条。 EOF属性:目前指标指到RecordSet的最后一条。 Move方法:移动指标到RecordSet中的某一条记录。 AbsolutePage属性:设定当前记录的位置是位于哪一页AbsolutePosition属性:目前指标在 RecordSet中的位置。 PageCount属性:显示Recordset对象包括多少“页”的数据。 PageSize属性:显示Recordset对象每一页显示的记录数。 RecordCount属性:显示Recordset对象记录的总数。 下面介绍一下这些重要的属性和方法 1、BOF与EOF属性 使用BOF与EOF属性,可以得知一个Recordset对象是否包含有记录或者得知移动记录行是否已经超出该Recordset对象的范围。如: <% if not then ... %> < % if not ( and ) %> BOF与EOF都为True,则在RecordSet里没有任何记录。 2、Move方法 可以用Move方法移动指标到RecordSet中的某一条记录,语法如下: NumRecords,Start 第 149 页
所有的Recordset对象都支持Move方法,如果一个空的Recordset 对象调用 Move 方法,将会产生一个错误。Move方法有如下类型: MoveFirst 方法:将当前记录位置移至第一条记录。 MoveLast 方法:将当前记录位置移至最后一条记录。 MoveNext 方法:将当前记录位置移至下一条记录。 MovePrevious方法:将当前记录位置移至上一条记录。 Move [n]方法:移动指标到第 n条记录,n由0算起。 3、属性 AbsolutePage属性设定当前记录的位置是位于哪一页的页数编号;使用PageSize属性将Recordset对象分割为逻辑上的页数;AbsolutePosition属性数值为目前指标相对于第一条的位置,由1算起,即第一条的AbsolutePosition为1;若要启用AbsolutePosition,必须先设定为使用用户端cursor(指针),ASP码如下:=3;使用PageCount属性,决定Recordset对象包括多少“页”的数据。大小等于PageSize属性的设定。PageSize属性是决定ADO存取数据库时如何分页显示的关键,使用它就可以决定多少记录组成一个逻辑上的“一页”;用RecordCount属性来找出一个Recordset对象包括多少条记录。如:<% totle=%>。 习 题 如何利用Frontpage 2000 和Dreamweaver制作主页? 网络信息组织语言工具有哪些?试用 ASP语言编写网页计数器。 第 150 页
第9章 信息组织与知识组织、知识经济 从情报组织到信息组织再到知识组织反映了人类对信息组织的认识不断深化,情报组织是为满足传统农业经济、工业经济时代人们利用科技文献的需要而出现的一种独立的活动,图书馆、情报所是这一时代的产物。信息组织是信息时代出现的新鲜事物,在信息社会,信息急剧增加,信息成为与物质、能源同等重要的资源,国民经济和社会信息化是其主要特征,信息资源的占有、使用、传播与开发的能力决定了信息主体的竞争优势。但在人们认识到信息资源的重要性的同时,信息产出的数量迅速膨胀,如目前因特网上的信息资源的指数增长就是一个例子,大量虚假、低质的信息淹没了人类社会赖以生存和发展的知识,人们识别、获取知识越来越困难。于是及时提出了知识组织,还知识的原来面目。知识组织是来源于信息组织但又高于信息组织,它是知识管理和知识经济的基础。本章先讨论知识组织,然后讨论信息组织在知识经济社会的作用。 信息组织与知识组织 知识、信息与情报的关系 对知识、信息和情报之间的关系的讨论由来已久,通常认为信息是存储在自然界、人类社会和人类精神世界之中的对客观世界的反映,人类认识世界正是凭借这些信息才得以顺利进行的。知识是人类在社会生产、生活和实践中产生、积累、总结出来的经验和理论,它由个人的隐式经验、想法、洞察力、价值、以及判断等组成的,是人脑加工的产物,是智力成果,所以知识来源于信息,信息是知识的源泉,但同时知识又是信息的一种形式,是其构成的一部分。而情报是用于交流的信息和知识。所以三者的关系可以表述为:(信息)包含(知识)包含(情报)。但也有一种观点认为,信息是可编码化的知识,即显性知识,这样处于人的精神世界的隐性知识因无法编码而不属于信息,因而知识包含了信息。 按英国哲学家波谱尔的“三个世界”,信息可分为三类:即(1)有关客观物质世界的信息,属本体论信息,(2)有关人类精神世界的信息,(3)有关客观概念世界的信息,即显性信息。第二、三类信息属认识论的信息,而知识来源或表现为后二者。知识大致可以分为两部分,即显性知识(explicit knowledge)和隐性知识(tacit knowledge)。显性知识是指记录在各种介质上的知识,如图书、档案、数据库、各种计划、总结、报表等等。是具有有形的物质载体、被符号化了的知识,它是知识的一种沉淀,属静态知识;隐性知识是指存在于人的头脑中的未编码的经验性知识,如个人的技术诀窍、直觉、想象与创意等等,是高度个性化的且难以格式化的知识,是活跃着的动态知识,而且只能通过与有知识的专家直接合作与交流才能获得。实际上隐性知识本身并不是未编码的,它也是通过一种特殊的编码方式存贮在人的大脑中,只是目前科技还没有能力揭示它的原理而已,人类所尝试研制的生物电脑就是要模拟人脑对知识的编码、存贮和检索等功能的。 显性知识和隐性知识二者可相互转化,显性知识通过学习即成为隐性知识,隐性知识记录下来(即符号化)即转变为显性知识。由于这一点,学习知识成为提高国家、社会、企业、个人竞争力的根本途径,知识也就成为最重要的财富。知识资本、知识经济、知识管理、知识型企业成为人们关注的焦点。 第 151 页
知识组织的内涵 从字面上理解,“知识组织”有两种含义,一是对知识的组织,二是知识型组织,前者是按照某种方法、体系、标准将知识系统化,是人类的一种社会实践活动;后者是指建立在知识的采集、处理、生产、服务等基础上的新型组织形态,是社会的机构单位。我们讨论的是前者。 据专家研究,最早提出“知识组织”概念的是美国图书馆学家布利斯( Bliss, 1870 - 1955), 布利斯1929年在《知识组织和科学系统》、《图书馆的知识组织》两部专著中阐述了以文献分类为基础的知识组织的思想。我国最早使用“知识组织”的是著名文献情报学家袁翰青教授,他在1964年指出“文献工作是组织知识的工作”,存在这种思想是不足为怪的,因为文献所载的便是符号化的知识,对文献内容的组织实质是对知识的组织。 由于文献是绝大多数显性知识的表现形式,所以知识组织的研究也始于以处理文献、服务社会为宗旨的图书情报界。不过长期以来,知识组织一直局限于文献的分类、标引、编目等范畴之内,这种以文献知识为组织对象的知识组织是狭义的知识组织;广义的知识组织还包括人工智能(AI)或称知识工程(KE)。目前,知识组织的研究已超出图书情报界,波及到计算机科学、管理科学、经济学、社会学等众多学科,知识组织和管理对社会的发展进步和经济增长显示出越来越强大的推动力。 提出知识组织问题或概念不是偶然的,有其深刻的社会原因。众所周知,当今社会是信息社会,其重要特征是信息过剩,表现形式为信息爆炸、信息泛滥和信息污染等。信息的载体是出版物,出版物以印刷、文本、声音、图形、图像、动画等多种形式按指数增长,并由此形成循环递归机制。对其中蕴涵的知识越来越难以把握,因而需要对其进行系统组织,以方便人们学习和利用。 虽然知识组织的研究方兴未艾,但什么是“知识组织”?目前还没有统一的认识。虽有专家认为“缺少统一定义并不影响我们继续对知识组织进行研究,因为许多其它学科也缺少统一定义,不是照样做得很好吗”?,但作为从学科发展来看,对“知识组织”的定义是学科建立和发展的基础。为此本文结合部分专家的观点提出自己的认识,以资借鉴:知识组织是按照知识的内在逻辑联系,运用一定的组织工具、方法和标准对知识对象进行诸如整理、加工、表示、控制等一系列的序化、系统化的活动。 知识组织按不同的标准可分为多种类型:从知识运动的流程看,知识组织可分为生产过程中的知识组织、知识交流过程中的知识组织以及知识利用过程中的知识组织;从知识对象看,知识组织可分为显性知识组织和隐性知识组织;从知识组织的主动性看,知识组织分为知识被组织和知识自组织,知识自组织是指人工智能领域的知识组织或没有统一管理的大规模的知识组织活动中所达到的一种平衡状态。 知识组织的历史 从知识组织实施者来看,知识组织经历了个体组织时期和机构组织时期。个体组织时期主要表现为单个个体自发的知识组织活动,标准不一,无固定模式,如孔子的“删诗书,定礼乐”,清代张之洞的《书目答问》。机构知识组织活动大多受政府或机构之命而为,由多个人共同完成,通常有统一的标准和程序,知识组织活动是在统一的组织领导下进行,如明代的〈永乐大典〉,清代的〈四库全书总目〉,建国后的〈全国新书目〉。知识组织的政府化、机构化、常规化和规模化使知识组织达到了新的层次。 虽然英国著名分类法专家.布利斯早在1929年就使用过“知识组织”这个词,但对知识组织进行专门的深入研究并开展各种学术活动却是近10年的事情。 第 152 页
1989年成立的秘书处设在德国的法兰克福的国际知识组织学会(ISKO)标志着知识组织活动走向了国际化道路。ISKO自成立后,开展了一系列活动:1990年8月在德国的达姆施塔特举行了第一届国际ISKO大会,会议主题是“知识组织工具与人类交往”;第二届于1992年 8月在印度的马德拉斯举行,主题为“知识组织与认知范式”;第三届于1994年在丹麦的哥本哈根举行,主题为“知识组织与质量控制”;第四届于1996年7月在美国的华盛顿举行,主题为“知识组织与变革”。ISKO在一些国家成立了分部,如德国、丹麦、西班牙、俄罗斯、印度等。ISKO分部也举行了一系列学术会议,如俄罗斯先后于1993年和1995年举行了两届ISKO俄罗斯分部大会;西班牙举行过两届;德国举行过4届;1994年9月在捷克的布拉迪斯拉发举行了第一届ISKO欧洲大会,主题为“环境知识组织与信息管理”;1992年10月在西班牙的马德里还召开了国际文献工作联合会分类法研究委员会(FID/CR)和ISKO的联席会议。 知识组织是在分类法的基础上发展起来的。在第二届国际ISKO大会上,提出了将国际性学术刊物《国际分类法》改名的建议,该建议得到ISKO执委会的赞同,委托ISKO科学咨询委员会提出4种方案,最终确定使用《知识组织》(Knowledge Organization),从1993年的第20卷起正式更名。该刊的副刊名中包括概念学、分类法(含叙词表) 、标引和知识表示(含语言学和术语学)。原刊的“分类文献”书目栏目,现在改为“知识组织文献”。此外,1983年在德国出版的《分类与标引人名录》,1993年ISKO执委会决定改名为《知识组织人名录》重新出版。 从分类法到知识组织是个飞跃,人们的研究领域已经突破了分类法的原有范围,延伸到知识组织所能概括的所有问题,这表明知识组织将以一门新的学科形式出现并将迅速发展起来。 知识组织的研究对象和范围 作为一个研究领域,知识组织的研究对象知识、知识组织活动及与之相关的一切要素,包括知识的表示与编码、组织方法与技术、知识组织系统及其构成要素;知识组织的活动的人、活动、物的要素;知识组织的发展史研究方法与背景等。 知识组织的研究范围是比较广泛的。国际知识组织学会(ISKO,法兰克福)会刊〈知识组织〉把这个领域的研究范围划分为9个方面: 1)理论基础和一般性问题 即基本理论研究,包括:分类理论,概念逻辑,知识组织的数学基础、系统理论、科学学方面、心理学方面,以及知识组织的历史。 2)分类系统和主题词表 此部分包括分类系统和主题词表的结构成分、建造、更新维护和评价,词间关系,标记制度和代码,数值分类,检索语言的兼容性和对应互换问题。 3)分类和标引方法 它包括分类标引的技术方法,手工标引与自动标引,索引的生产和程序等。 4)通用分类系统和主题词表 此部分主要研究各种通用的检索语言,如DDC、UDC、LCC、LBC、CC、TEST等。 5)面向专门对象的分类系统 此部分主要研究那些面向形状和结构、能源和物质、宇宙和地球、生命、人类、社会、经济和技术、科学和文化等领域的特定事物或现象的分类系统。 6)面向特定学科或专业的分类系统和主题词表 此部分主要研究各种专业分类表和主题词表,与第四部分相对。 7)采用语言和术语的知识表示 第 153 页
此部分主要研究与知识有关的自然语言问题,语义学,自动化语言处理,联机检索系统和技术,词汇和词典问题,术语问题,专业术语工作,多语言和翻译问题。 8)分类和标引技术的应用 此部分研究数据、原始文献、图书、二次文献、非图书分类、标引和索引工作。 9)知识组织的环境 此部分主要研究与知识有关的机构、团体、人物、教育、法律、经济、用户和标准化问题。 知识组织的方法 知识组织方法多种多样,其中最常用的是依据知识组织的语言学基础,分为语法知识组织方法、语义知识组织方法和语用知识组织方法。具体的知识组织方法有7种:知识表示、知识重组、知识存检、知识聚类、知识编辑、知识布局和知识监控。具体见下表: 知识表示主观知识表示 逻辑表示法、产生规则表示法、语义网络表示法、框架表示法 客观知识表示法 分类标引法、主题标引法 知识重组知识因子的重组 目录、索引、文摘、题录、书目之书目、文献指南等二次文献 知识关联的重组 综述、述评、词典、手册、年鉴、类书、百科全书等三次文献 以学科聚类 类目体系 以主题概念聚类 主题词及其参照体系 知识聚类 以人聚类 以用聚类 以时空聚类 知识存检知识的脑内存检 知识的脑外存检 知识编辑辑录性编辑、撰写性编辑、汇集性编辑、审读性编辑、译介性编辑、 评价性编辑、专辑性编辑 知识布局主观知识布局 自然性布局、政策性布局 客观知识布局 自然性布局、政策性布局 思想监控 知识监控法律监控 标准监控 表 知识组织方法 知识组织的原理 知识由众多结点(知识因子)和结点联系构成的语义网络,知识因子是组成知识对象的基本单位。符号、概念、语词、句群以及一切事物都可以看成知识因子。知识联系是知识因子间的特定关系。知识组织就是运用一定的方法按一定的标准把知识对象中的知识因子和知识联系揭示出来,便于人们认识、学习、理解和接受,促进知识运用和知识创新。 具体说,知识组织的原理可从以下几个方面考察: 知识重组(语法学原理):知识重组是知识组织的初级但很重要的方法,是对知识对象内的知识因子和知识联系进行语法结构上的重新整合,结果生产出新的知识产品。它包括知识因子的重组和知识联系重组。 知识表示(语义学原理):知识表示是将知识对象中的知识因子和知识联系表示出来,便于人们识别和理解。知识表示是知识重组的前提。知识表示包括采用分类标引表示法和主题标引表示法表示的知识因子表示法和以一阶为谓词逻辑表示法、产生式规则表示法、框架 第 154 页
式表示法、语义网络表示法表示的知识联系表示法。 知识记忆(语用学原理):知识组织最终要为用户认识和记忆,分类法和主题法近似模拟了人脑识记的机理和结构,但要达到较好的效果,还应建立后控词表和利用超文本技术(本书信息组织方法一章有详细介绍),最重要的是要发展神经网络技术,使知识的重组和表示更接近人脑的识记忆原理。 知识组织的理论意义和现实意义 提出知识组织问题或概念不是偶然的,有其深刻的社会原因。众所周知,当今社会是信息社会,其重要特征是信息过剩,表现形式为信息爆炸、信息泛滥和信息污染等。信息的载体是出版物,出版物以印刷、文本、声音、图形、图像、动画等多种形式按指数增长,并由此形成循环递归机制。人们对信息和知识越来越感到难以控制和利用。知识组织理论和方法的提出正是顺应了这一形式的需要。 首先,信息潮(Message Flood)促进专业化。面对潮水般涌来的信息,为了有效地获取和利用它们,在有限的时间和精力内,人们不得不缩小自己的专业领域,而这种缩小又是不间断的,不可避免地使人们更加专业化。与此同时,出版物也进一步专业化,致使人们的视野越来越狭窄。 其次,专业化导致“无能”。专业化的直接后果是新领域越来越多,而一个人所熟悉的领域却越来越少。一个人在越来越少的领域中有能力,是以在越来越多的领域中丧失能力(无能) 为代价的。 再者,“无能”产生虚假知识。在自己的领域是专家,对其它领域了解是肤浅的,他们生产的知识往往是虚假知识。 最后,虚假知识推动信息潮。虚假知识充斥于各种出版物,降低了出版物的质量。他们再用获取的虚假知识去生产虚假知识,最终使信息潮一浪高过一浪,无法遏制信息泛滥和污染。 应当指出,现在的问题是信息过剩,而不是知识过剩。这就是说,核心知识增长不大,而分散在各种出版物中的外围知识和虚假知识却在与日俱增,从而导致知识存贮状态的无序化。为此应及早采取抑制措施,以使知识存贮有序化和容易获取,并形成和发展知识组织的一系列理论、技术和方法。 知识组织是科学研究的前提。知识组织构成了在科学中的单个分支,以学科的形式从事知识的生产、表达、处理和利用,还包括有助于结束信息泛滥的活动。此外,它也构成了超越学科界限的合理主题,并与本体论、认知科学相联系。ISKO的任务应当是协调个别领域中的各种活动。 知识组织的任务主要是: 知识表述、知识提供、 知识文献评价。 最后要说的是,网络信息资源与知识的管理与开发利用使我们面临众多挑战,但同时也给我们带来了新的发展机遇。由于人们迄今仍未找到语义和语用信息的表示和测度方法,使我们只能借助信息概念和知识因子的字面含义来组织信息知识,这是一种线性的低效率的信息知识表示,用户往往不能从这类系统中获得满意的信息结果,不能对知识进行有效的识别和记忆。建立在高度发达的信息技术基础上的各类全文检索系统、多媒体异构信息系统、超文本系统和超媒体系统,从不同角度、不同侧面展示信息结构,为知识信息的组织提供了一定的技术支持,使人们有可能超越知识信息组织理论的约束,按知识和信息的逻辑结构来组知识信息,并通过网络信息知识导航、并使信息知识可视化,对信息知识进行深层次的揭示和挖掘(Mine),逼近但还达不到完全满足用户真正的需求。这完全改变了传统的知识信息组织模式,形成了知识信息组织模式,形成了知识信息组织、获取、传输和利用的新格局,大大拓展了信息知识组织和管理的用武之地。 第 155 页
信息组织与知识经济 知识经济是继农业经济、工业经济之后的一种崭新经济形态.1990年联合国提出了“知识经济”这一概念,1996年经济合作与发展组织(OECD)在其《以知识为基础的经济》中再次提出“知识经济”并对此做了解释。OECD认为“以知识为基础的经济就是知识经济”,这种经济是建立在知识和信息的生产、分配和使用基础上的。在知识经济时代,一个最直观、最基本的特征即是知识作为生产要素的地位空前提高,知识不在是资本的附庸,它作为资源的最重要的形式不仅本身可以用来消费,而且它还能有效克服传统资源的瓶颈制约,并且能极大提高对传统资源的使用效率。 知识对经济增长的贡献愈来愈显示出巨大威力。美国,技术和知识的增长已占经济增长的80%左右,日本也达到75%左右,而29个经济合作组织国家,GNP的50%是通过知识经济实现的。 信息组织在知识社会中的重要作用体现在: 信息组织与知识内涵 什么是知识?“知识是经过浓缩加工、系统化、理论化的信息”。因而,知识是信息的一个子集,是信息组织的结果。没有信息组织活动,知识便无法形成;另外,要有效地利用知识,知识也要再组织,这种组织包括按外表特征(如载体形态等)和内容特征进行组织,这种组织既有信息组织的内容也有知识组织的内容,但都属于信息组织,是其重要的构成部分。因而,信息组织活动是知识创造中的基本活动、必经环节。信息组织的质量直接关系到知识的价值,从而直接影响着经济活动的效益。 信息组织与知识经济的特征 1.经济发展持续化 制约经济进一步发展的因素是传统经济资源的稀缺性,然而知识这一资源可以无限被开发,被使用,它突破了传统资源稀缺性的制约,能进一步促进经济的发展,这种发展具有可持续性的特点,因为它不是以对自然资源掠夺性开发为发展动因,而是建立在知识的生产、消费、使用上。然而,知识的开发、使用离不开信息组织活动。只有从大量的信息(如文献、资料、记录、数据)中抽取有价值的信息,并按照某种标准组织起来,才能为知识经济提供源源不断的生产资源, 2. 资产投入无形化 知识经济的投入主要是知识,知识是一种无形的资产,随着知识投入在总资产投入中的比重不断提高,资产也就向无形化过渡。但这并不是说资金、自然资源、人力资源并不重要,在知识经济中它们仍然是经济远行的基础和必要条件,只不过是知识资源更加重要。例如它渗透于自然资源,可以最大限度地提高自然资源的利用率,知识与人力资源结合形成人力资本可以创造出倍加的劳动,大大提高劳动生产率。所以知识这一资产的投入不是单独的、局部的,而是广泛地、全面地渗透于各种有形资产中,使之无形化,从而使经济运行更加有效、流畅、和谐。 3. 世界经济一体化 世界经济一体化进程目前有加快的趋势。世界经济一体化就是要实现资源在全球范围内的合理化配置,世界各国经济联系日益密切。随着互联网的发展,信息和知识已可以实现全球化配置。无疑,信息资源的全球化配置会引导和促进资源的全球配置,促进产品的生产和 第 156 页
销售的全球一体化。然而,要实现信息和知识的全球化,按一定的标准和程序加以组织对其进行组织是非常必要的。 4. 经济决策知识化 现今的决策过程中常存在信息匮乏的问题,即决策依赖于主观臆断甚于大量被掌握的信息基础上。其实,这还不是决策中的关键问题,真正缺乏的是从大量的芜杂的信息中选取很少的一部分,它对建立重要的普遍法则和解决经济运行中的问题有显著作用。实际上,这很少的一部分信息即为有用的知识,因而决策要知识化而不是泛泛的信息化,要实现决策的知识化,对信息的组织是其重要环节和基础。 信息组织与企业经营管理 在知识经济时代,企业的经营管理讲呈现出诸多不同的特点,对知识的利用和驾驭能力空前提高。信息组织在其中所起的作用主要表现在:①通过信息组织活动,企业所掌握的大量的内外信息被系统化、经验化、理论化,有利于企业决策的科学化和准确化②通过对信息的有效组织,可以发现企业所依存的外部环境的变化规律,有利于提高企业的应变能力③合理的信息组织,使企业及时获取各种反馈信息,各项要素和资源合理配置,各部分合作更加紧密,运行效率得到更大提高④通过信息的有效组织,可以形成许多有用的知识,这些知识可能是企业行之有效的原则、方法、措施的沉淀,当把这些沉淀、提高的知识广泛应用于生产和经营管理活动中,将会极大地提高企业的创新能力、竞争能力,形成竞争优势。 信息组织与现实网络经济 网络经济是知识经济的重要表现形式,全球网络经济的发展将全面变革传统产业的生产与经营管理方法,体现在: 1) 信息组织活动不仅仅是一种信息活动,更是一种经济活动。信息组织是支柱产业之一,并广泛渗透于其它高新技术产业并促进它们的发展。 2) 信息型企业与信息型管理的迅速崛起和广泛推行使信息组织工作更加重要。信息型企业与信息型管理均是建立在信息网络基础上,企业内部的信息流比资金流、物质流更加重要的一种新型企业组织和管理形式,信息的沟通、传递与组织将决定企业的命运。信息型企业与信息型管理对外部环境的变化更加敏感、适应能力更强,而这些必须建立在对信息的科学有效的组织上。同时信息型企业广泛参与国际经济活动,是经济全球化和一体化的积极倡导者和努力实施者,而信息网络将赋予信息型企业的跨国经营以新的灵魂,它使各个跨国分支机构联系更加紧密。 3) “信息本位制”的兴起引起政府功能的重新定位。在知识经济社会。“信息本位制”正在取代“金钱本位”和“权利本位”,政府的以市场这只“看不见的手”为基础的兼以宏观引导的管理方式正逐渐让位于“看不见的头”的管理方式。这个“看不见的头”是指善于收集信息、组织信息、利用信息的新型政府。“看不见的头”取代“看不见的手”将是改变西方国家长期存在的“滞胀”的根本解决途径。 信息组织与信息化 国民经济和社会信息化,也称信息化,包括许多内容,其涵义就是:在国家统一规划和组织下,在农业、工业、科学技术、国防及社会生活各个方面应用现代信息技术,深入开发、广泛利用信息资源,加速实现国家现代化的进程。信息化的核心是信息资源的共享和利用,其显著标志是信息技术的广泛应用,其进程是一个动态发展的过程。 第 157 页
江总书记早就对信息化的重要性做出精辟论断,“四个现代化哪一化也离不开信息化”,2000年明确提出了“以信息化带动工业化,发挥后发优势,实现跨越式发展”的信息化战略。朱总理特别强调指出,“信息化是一场深刻的革命”,“信息化是改革的一个重要方面”, 他说政府信息化是一场深刻的革命,而对企业信息化而言,就是企业管理的革命。2001年4月朱镕基,2001年11月江泽民在不同场合又反复强调信息化的重要意义。 《中共中央关于制定国民经济和社会发展第十个五年计划的建议》指出:“大力推进国民经济和社会信息化,是覆盖现代化建设全局的战略举措。以信息化带动工业化,发挥后发优势,实现社会生产力的跨越式发展。” 其它国家信息化也不例外,从发达国家如美日欧到发展中国家“亚洲四小龙”都视信息化为提高国家竞争力的根本举措,不惜纷纷斥巨资于信息基础设施的建设,可以说信息化是企业自主要求和政府引导的一场波及世界各个角落的全球浪潮。此处以信息技术及产品的增长为例说明一下。 信息技术的飞速发展使得信息服务能满足人们的程度越来越高。技术基础的发展与市场的发展相互促进,形成良性循环,在这一次需求拉动型的信息化浪潮中,贸易额不断上升。信息技术的发展对国际信息服务的内容、手段和方法带来了前所未有的革新。 1995年信息技术产品的出口额高达5950亿美元,超过了世界农产品的出口额,在世界贸易额中的比重已上升12%。据OECD《观察》杂志报道,在过去10年中,全球信息技术市场以8%的增长率发展,增幅可观。美国力主在1996年底的WTO部长级会议上讨论的《信息技术协议》,即到2000年取消信息技术产品的全部关税,这项协议与同年2月26日达成的基础电信协议一起,共涉及10000亿美元的全球贸易额,超过了农产品、汽车、纺织品三者的贸易总和,加速了信息技术产品贸易自由化和全球化的进程。 卫星通讯的发展也非常迅速,通过卫星提供各种信息服务将是不久将来信息服务贸易的一个高增长点。由美国波音公司和微软公司共同拟订的太空国际互联网(Internet In The Sky)建设计划目前已经开始启动。这项计划预计投资90亿美元,将在地球周围布设数百个低轨道同步卫星,低成本、高速度、高质量地实现全球计算机彼此间的信息交流。两家行业巨人将联合其它的无线通讯卫星,每颗卫星的重量为1,300公斤,价值约2,000万美元,距地面的高度是700公里。目前,波音公司已决定就该项大型项目投资1亿美元,微软更是正在积极活动以促进其他大电话公司加入他们的行列。Intel公司、Motorola公司、休斯公司也纷纷加入太空争霸战。 经济信息化包括行业信息化和企业信息化,企业信息化是信息化和国民经济和社会的基础。企业信息化发展的水平,不仅直接关系到国家信息化战略的顺利实施,还将直接影响到国民经济的持续稳定发展。企业信息化是指利用以计算机技术和网络技术为核心的现代信息技术,通过信息网络开发和利用信息资源,加速信息流通,实现信息资源共享,提高信息利用能力,减少企业交易成本,改造企业生产、经营、管理和决策方式,提高企业的创新能力、经济效益和市场竞争力。 信息组织与经济全球化 全球化是当今世界经济的发展潮流,它是资本主义在全球的蔓延和扩张所致。这一过程正逐步加快,任何一个国家都难以摆脱它的影响。不仅商品(特别是技术、信息密集型产品、高技术产品)贸易迅速增长,而且服务贸易和技术贸易增长速度更快。1998年世界商品和服务出口占世界总产出的比重从1992年的%增至20%以上。国际间资金流动规模扩大、金融自由化加速发展,1990-1994年间,全世界对外投资额每年在1700-2000亿美元之间。世界外汇市场日交易额从1992年的9000亿美元增至15000亿美元。 作为世界经济一体化最主要的推进因素,目前世界上共有跨国公司万家,其遍布全 第 158 页
球的分支机构达26万家。跨国公司国际分支机构的销售额高达5万亿美元,远远超过世界商品贸易总额,其内部贸易占世界贸易50%左右其国外直接投资占世界跨国直接投资的70%以上,技术转让占80%以上,占国际贸易总额的40%,占对发展中技术转让的90%以上等等。跨国公司内部的信息服务贸易增长速度比世界信息服务贸易的增长速度要大得多。随着全球经济一体化的加速和我国加入世贸组织,任何一个企业都将面对来自本行业、本地域乃至世界各国企业的最强有力的竞争和挑战,同时也有机会在全球范围内发展自己的客户。企业的竞争归根到底就是以最好的质量、最短的时间、最低的成本、最完善的服务满足客户日益个性化的需求。这是企业得以生存的前提和基础,也是互联网经济的要求。准确及时了解、分析、转化、开发、引导、实现用户需求往往不是人力所能完成得了的,需要现代信息技术如分析、统计、检索与管理软件的辅助;尤其是,信息资源在战略意义上比物质、能量资源更加重要,企业竞争力在很大程度上取决于企业的信息竞争力,即企业获取和利用信息资源的能力,而信息资源的管理和开发利用既是信息化的结果也是信息化的促进剂,信息组织是信息资源管理的基础。 互联网和经济全球化为世界各国带来了新的发展机遇,但把握机遇、创造财富、赢得市场的决定因素是我们对机遇的把握能力。企业只有依靠提高管理水平,提高技术创新能力,提高企业的信息化水平,提高企业的信息利用能力,才有可能应对挑战、赢得市场、获得发展。由此可见,在新的机遇和挑战面前,谁在信息化方面领先一步,谁就将在未来的国际竞争中赢得主动权。 国家经贸委信息中心主任刘力说:“应用信息技术改造传统产业的一个重要方面,就是利用信息技术加快技术创新,大力开发具有自主知识产权的技术和产品。这是我们最终走向世界,赢得发展机会,实现以信息化带动工业化,以工业化促进信息化战略目标的前提”。 信息组织与全球电子商务 随着国际互联网络的迅猛发展,集计算机技术、网络技术等现代信息技术为一体的电子商务将以其快捷、方便、高效率、高效益的显著优势,成为 21世纪国际贸易的主要方式。 互联网最大的优势之一就是超越时间、空间的限制,能够有效地打破国家和地区之间各种有形和无形的壁垒,对于促进每个国家和地区对外经济、技术与合作等的交流将起到革命性的作用。电子商务将间接刺激对外贸易。比如在减少繁文缛节方面将节省大量费用。据统计 1996年跨国界贸易的杂项开支约为3500亿美元,在有些情况下处理配运的货物竟需上百份文件和经过几十个不同部门和机关。而以电子商务开展国际贸易所节省的费用,估计可达1000亿美元。世贸组织预测,国际贸易中电子商务的份额将从1996年的6亿美元激增至1999年的665亿美元。电子商务使全球的经济联系更为紧密,而且使生产与经营方式发生转变,信息资源的运作更加重要。如1992年全球网站(website)仅为52个,1998年就达到了3000万个,2002将超过30亿,届时70%的大公司都将通过互联网络进行销售。 在2001年4月5日在北京召开的第五届中国国际电子商务大会上,世界经合组织官员欧本在发表演讲时说,电子商务打破了国界,使金融市场国际化。美国商务部副部长助理米歇尔·奥尼尔在开幕式上说,到2004年,全世界电子商务交易总额预计将达7万亿美元,到2005年,世界上将有10亿人使用国际互联网。她说,互联网的迅速发展及其带来的无限商机促使世界各国政府采取与国际接轨的电子商务政策。欧盟官员菲利普·肖夫表示,欧盟正在与发展中国家开展合作,以使后者在电子商务推广过程中受益。日本电子商务推进协议会国际部部长在会议上说,从1998年起,日本电子商务进入了实用开发阶段。 移动电子商务是近两年来出现的一个新的产业,可以预计,真正推动国际信息服务贸易的将是移动电子商务。一份市场研究报告显示,到2004年,移动电子商务市场将达到2亿美元,而通过移动电话进行的交易量每年将达到140亿美元,移动电子商务将对人们的消费 第 159 页
购物行为产生根本性的变化。美国电子商务市场分析公司丘比特·米特里克斯公司不久前称,今年全球大概有600万人在使用移动电子商务,交易额达亿美元。到2005年,预计将有亿人使用移动电子商务,交易额将达108亿美元。欧洲一家市场分析公司也认为,欧洲移动电子商务的营业额每年将成倍增长。 我国电子商务虽然还未发挥它应有的作用,但最近CNNIC最新的调查结果显示了它的光明前景,截止到2001年6月30日,我国的上网计算机数已达1002万台,比去年同期增长54%,是三年前万台的倍;CN下注册的域名数已达128362个,比去年同期增长%;WWW站点数达242739个;国际线路总容量为3257M,各项指标与三年前相比,均有了大幅的增长。 该次调查显示网民对中国实现大规模电子商务充满信心,79%的用户认为中国5年之内能实现大规模的网上电子商务。"网上购物"被用户认为是将来最有希望的网上事业(%);用户对"网上学校"(%)、"网络通讯"(%)以及"网上炒股"(%)的前景也非常看好。 信息组织与信息服务贸易 信息产业是当前发展最快的产业之一,信息产业的迅速发展提升传统经济并促使传统经济向数字经济时代过渡。美国商务部2000年电子商务报告《数字经济2000》中认为仅信息技术产业在1995年到1999年间对美国实际经济增长的平均贡献就达到了30%。信息产业的发展给传统信息服务业带来了新的生机并拓展了信息服务业的范围,如伴随因特网出现的ISP、ICP就是一个典型的例子。多数学者认为,信息服务业是从信息产业中分离出来的,因而信息服务业是信息产业的重要组成部分。也有学者认为,信息服务业只有部分属于信息产业,它是信息产业与其它产业的交集。 美国将信息服务业划分为七个大类:信息处理服务、网络服务、系统软件、应用软件、一揽子委托服务、系统集成服务、专业培训咨询和系统运行服务。我国对信息服务业的分类的构成也做了初步界定,1992年,中国信息产业商会在对国内从事信息服务的企事业单位进行广泛调查,结合国际上流行的信息服务业分类方式,将我国的信息服务业划分为五个大类,即信息提供业、信息处理业、软件开发与服务业、系统集成服务业、咨询业及其它,具体见表: 分 类 工 作 内 容 数据库信息检索服务,联机信息检索服务,联机信息服务(包括因特网信息服务如信息提供业 WWW、EMAIL、BBS、新闻组、邮件列表等——笔者注),文本信息产品提供服务(如刊物式或剪报式信息提供等) 计算机计算和分时服务,数据输入、处理和验证服务,穿孔打印服务,机时租赁服务,信息处理业 光学扫描数据服务,计算机制表服务,磁盘间、磁盘与磁带间转换服务,信息输出打印服务,电子数据交换服务,增值网络服务,库存管理服务,委托数据处理 软件开发与服务业 软件的设计、开发与维护,按需修改用户软件,通用软件的销售,定制软件的开发 计算机及外围设备管理、操作、维修人员的提供,CAD/CAM系统服务,计算机辅助工系统集成服务业 程(CAE)系统服务,计算机网络集成服务,综合计算机办公自动化系统,计算机系统集成,交钥匙系统,计算机设备管理服务,计算机硬件和系统的需求分析等 提供调查报告,定题研究,现场咨询,辅助决策咨询,为用户培训软硬件操作和使用咨询业及其它 人员,为用户办培训班,培训维修人员,其它不便归于前四类的服务(如知识产权提供)。 表 中国信息产业商会的信息服务业分类 当然,由于近十年的信息技术的发展,尤其是因特网的迅速发展产生了一些新的信息服务业,即基于因特网的信息服务业,如ISP(因特网服务提供商)、网上冲洗胶卷、网上存贮空间提供、网上信息搜索、网上电子信箱、网吧等。虽然形式多了,但总体上仍然可以归入上述五大类。 第 160 页
综上所述,笔者认为,信息服务产业是指以提供信息内容和从属于信息技术产品的一切服务为目标的一种商业存在。它包括知识产权转让、信息内容提供、信息技术服务。信息服务业是信息产业的重要构成部分。如果按照产业大类来划分,信息服务业属于服务业。信息服务同样可以分为有偿信息服务和无偿信息服务。 国际信息服务贸易目前还没有一个准确的定义,不过我们可以按照1994年乌拉圭回合谈判达成的《服务贸易总协定》中对服务贸易所作的定义对国际信息服务贸易界定为[2](1)过境信息交付,即从一成员境内向另一成员境内提供的信息服务,如国际联机信息检索,因特网信息(包括WWW、BBS、EMAIL等)的过境,数字产品及软件的国际销售,电视节目的国际广播,国际电话服务,卫星信息传送,技术、专利、发明的跨境交易,样品、数据库的过境销售等。(2)境外消费,在一成员国境内向其它成员的用户提供的信息服务,如出国考察,出国培训,出国人员接受所在国的各种信息服务。(3)商业存在,一成员的信息服务提供者在其它成员国设立信息服务结构,如建立服务器、设立镜像站点,或直接在对方设立信息服务组织。这里尤其值得注意的是,世界一些著名联机机构、网络公司在我国一些高校设立了镜像站点或真实站点,如OCLC、DIALOG、BA、EI、YAHOO等,授权使用,这是国际信息服务的一个重要趋向。(4)信息服务人员流动,一成员的信息服务提供者在任何其它成员境内通过自然人存在提供信息服务。如一成员的专家、学者、咨询人员受聘其它成员国或以无偿援助的名义从事各种信息服务。 综上所述,信息服务贸易包括了技术(知识产权)的贸易;无形的信息内容商品如市场行情、经贸信息、软件等;与计算机、通讯等信息技术产品密切相关的管理、维修、售后服务等。信息服务贸易加上有形的信息技术产品如计算机及通讯设备等构成信息贸易,信息贸易、商品贸易与劳务贸易共同构成国际贸易的所有内容(见表)。 货物贸易 劳务贸易 信息技术产品贸易 国际贸易 信息贸易技术类信息服务软件/服务产业 信息服务贸易贸易 通讯服务产业 非技术类信息服无形信息商品、知识产务贸易 权、咨询、培训等 表 国际贸易各构成部分之间的关系 国际信息服务贸易包括的国际技术与管理咨询服务贸易(如工程咨询、法律、财务服务贸易)、国际经贸信息服务贸易、国际专家服务(如国际教育、技术专家服务贸易)等,大部分都可通过信息网络的“运送服务”方式进行信息的交流和反馈,“足不出户”即可为全球各地的众同时提供服务。提供网上信息搜索服务的雅虎(Yahoo)的股票价格已升到1996年发行价23倍,1998年8月25日的市场现金价值为91亿美元,这一天每股美元的价格是当年预计每股赢利32美分的305倍。 美国商务部报告《浮现中的数字经济Ⅱ》对信息技术服务贸易的统计显示,1993年到1997年间,信息技术服务业进出口总额每年递增%,1997年达到了207亿美元。在1993年到1997年间,信息技术服务业出口总额平均每年递增%,而进口总额则为%,两者相比,长期贸易顺差前景看好。信息技术服务业中的计算机相关服务业(包括计算机和数据处理服务的销售和购买、数据库和其它信息服务、还有软件特许使用费),平均每年递增25%以上,几乎是全部服务贸易平均增长率的倍。到1997年计算机相关服务业在国家信息技术服务贸易中占41%。从1993年到1997年,信息技术服务业中的这一部分使贸易顺差平均每年增长42亿美元。美国的跨国公司海外分支机构,计算机服务业销售额每年大约增长30%,在1996年这部分贸易的总额就超过了280亿美元。由此可见,美国新经济的发展,信息服务业立下了汗马功劳。 第 161 页
欧洲国家和日本,一些发展中国家如亚洲四小龙、印度等,信息服务贸易发展也非常迅速,如印度的软件出口额已占其出口总额的相当比重,成为新兴的软件大国。 国际信息服务的发展进一步促进了信息在国际范围内通过信息网络的自由流动和信息处理的跨国传递,信息技术的进步和服务的增长导致的这种信息较为完备的市场环境消除了一些贸易及投资障碍,使发展中国家的中小企业具备了与发达国家的大企业竞争的条件及抓住世界市场的机会。所以积极发展信息服务贸易对已经入世的我国经济的发展具有非常重要的意义。 习 题 试述知识组织的方法。 知识组织的原理是什么? 信息组织与知识经济的关系。 第 162 页
《信息组织》实习教学大纲 一、实习目的: 熟悉常用主题包、分类表的使用,学会编写文摘、综述、目录和索引。 二、实习材料: l 《汉语主题词表》 l 《中国图书馆图书分类法》 l 机编文摘软件(如word2000) l 机读目录标准和光盘 l 若干图书资料 三、实习安排: 实习共安排4课时,实习(1)、(2)为2学时,实习(3)、(4)(5)为2学时。 四、实习要求: l 实习前认真阅读有关章节内容、作好知识准备。 l 认真实习、学会基本操作技能。 l 撰写实验报告,写出心得体会。 l 实习预备知识。 五、实习内容: 实习一、《汉语主题词表》的使用 了解《汉语主题词表》的结构、使用方法,并选一些文献进行主题标引。 实习二、〈中国图书馆分类法〉的使用 了解《中图法》体例结构、使用方法,选择若干本图书资料进行分类标引。 实习三、机编文摘 使用文摘编制软件(如Word 2000)自动为若干电子文献编制文摘。 实习四、机读目录 熟悉MARC记录标准,了解其内容和意义,并掌握从机读目录库中套录书目数据,生成相应的库记录和目录卡的技能。 实习五、索引的编写 了解索引的结构和本质,试为指定图书资料编写索引。 六、实习评价: 第 163 页
《信息组织》实验教学大纲 一、实验目的: 通过实验使学生掌握多媒体信息组织的知识和技能,如图形图像的组织和处理,多媒体教学软件和电子出版物的制作;掌握网络信息组织的知识和技能,如网页制作与发布等;尤其是培养学生在网络时代的信息组织能力。提高学生的综合素质。 二、实验器材: 应用软件:CorelDraw, PhotoShop, Animator studio, 3DMAX,Authorware,Toolbook, Frontpage2000, ,Dreamweaver, , 等。 系统软件:, Windows2000 硬件:联网电脑(PentiumⅣ以上)60台;服务器一台;若干网络硬件如HUB,网卡,网线等。 三、实验安排: 本实验共需机时18学时,共9周, 四、实验要求: (一)知识准备: l 信息组织方法:如主题法,分类法,时空法,随机法等 l 信息组织技术:如文摘,综述,目录,索引等 l 多媒体的概念及多媒体出版物、多媒体教学软件的概念和制作技术等 l 网络信息的特点,超级链节的概念和特点 l 有关windows的知识和操作技能 (二)教学要求: l 学生上机为主,教师辅导为次。 l 学生认真完成实验内容。 l 实验结束撰写实验报告,组织讨论。 五、实验内容: l 多媒体信息组织:图形图像的组织和处理,动画制作。 l 多媒体教学软件和电子出版物的制作。 l 网络信息组织:网页制作与发布。 六、实验项目: 实验一 图像信息组织与处理 学会利用CorelDraw,PhotoShop等软件处理图形和图像。 实验二 动画制作与信息组织 学会利用Animator studio, 3DMAX制作二维动画和三维动画。 实验三 多媒体教学软件的制作 学会利用Authorware等制作多媒体教学软件。 实验四 多媒体电子出版物的制作 学会利用Toolbook等制作多媒体电子出版物。 实验五 HTML语言与网页编制 学会利用HTML语言编制网页编制。 实验六 Frontpage2000与网页制作 学会利用Frontpage2000制作网页。 第 164 页
实验七 ASP语言与动态网页制作 学会使用ASP语言编写一些高级动态网页,如网页计数器,聊天室,BBS等。 七、实验评价: l 上机测试(占分70%) l 实验报告(占分20%) l 实验表现(占分10%) 第 165 页
参 考 文 献: [1] 霍国庆·论信息组织·情报资料工作,1997(6) [2] 洪漪·分类法在信息网络中的应用·情报学报,98(1) [3] 王志强,刘清涛·多媒体应用系统设计与制作·北京:电子工业出版社,1998 [4] 胡道元。计算机局域网。北京:清华大学出版社, [5] Paige and Linda 。 Collaborative Design of World WideWEBPages:A Csae Study 。 Information Technology and Libraries,VOL16,,1997 [6] 章琳等·WWW检索工具比较研究。情报学报,98(8) [7] 萧琛·《全球网络经济》·华夏出版社,1998,9 [8] 马费成·《信息经济学》·武汉大学出版社·1997,11 [9] 肖燕·信息揭示组织原理与方法,济南:山东大学出版社,1997,5 [10] 洪漪·分类法在信息网络中的应用·情报学报,98,1 [11] , Dave Kinnaman·Internet信息查询技巧,北京:机械工业出版社,1997 [12] 张晓辉·WWW上的信息发现与搜索引擎技术·小型机微型计算机系统·(6) [13] 昭东等·信息工作理论与实践·科学技术文献出版社,1995 [14] 王万宗等·信息管理概论·书目文献出版社,1996 [15] 肖燕·信息揭示组织原理与方法·山东大学出版社,1997 [16] 倪晓建·信息加工研究·北京图书馆出版社,1998 [17] 孟广均等·信息资源管理导论·科学出版社,1998 [18] 党跃武·信息管理导论·四川大学出版社,1995 [19] 王文举·信息学概论·中国商业出版社,1995 [20] 倪波等·信息传播原理·书目文献出版社,1996 [21] 乌家培·信息与经济·清华大学出版社,1993 [22] 马费成等·信息经济学·武汉大学出版社,1997 [23] 谢康·微观信息经济学·中山大学出版社,1995 [24] 吴季松·知识经济·北京科学技术出版社,1998 [25] 胡继武·信息科学与信息产业·中山大学出版社,1995 [26] 萧琛·全球网络经济·华夏出版社,1998 [27] 王志强等·多媒体应用系统设计与制作,电子工业出版社,1998 [28] 李贺,王平·利用实现网络数据库的多方式检索,情报学报, 2000 12 [29] 宿静如,濮德敏· 利用实现数据库动态查询·情报学报,2000 10 [30] 唐菊生,孔勇· 基于的数据库访问·计算机与信息技术.,2000 [31] 张英慧·利用ASP实现网上数据库检索·计算机与信息技术, 2000 [32] 储荷婷,张晓林等·网络信息检索·北京:清华大学出版社,1999 [33] 朱世平· 数据库组合检索技术的实现·情报理论与实践.,2000 [34] 邱均平等·再论知识管理和信息管理·图书情报工作,2000(10):5-8 [35] 肖勇·从信息管理透视七代企业管理·情报学报,2001(4):161-167 [36] 王知津·知识组织的目标与任务·情报理论与实践,1999(2):65-68 [37] 蒋永福·论知识组织·图书情报工作,2000(6):5-10 [38] 蒋永福等·论知识组织方法·中国图书馆学报,2001(1):3-7 第 166 页
[39] 赖茂生·知识组织理论与技术·北京大学信息管理系,1994:3-4 [40] 张智雄·Metadata:组织和发展Internet信息资源的数据·现代图书情报技术,1999(2)21-23 [50] 马费成等·面向高速信息网络的信息资源管理(一)——从技术角度的分析·中国图书馆学报,2000(1):1-3 [51] 张琪玉·情报语言学基础·武汉大学出版社,1997年9月 [52] C·David Whittington, Niall Sciater· Building and Testing a Virtual University,Computer Education, 98,30 [53] Melanie ward, David Newlands· Use of the web in undergraduate teaching,1998,31(2) [54] 傅秀芬等·基于WWW的交互式网络课件系统的开发技术·计算机工程与应用,98(8) [55] 王永桦,汤立峰·谈世纪之交的馆员素质·中国图书馆学报,98(4) [56] 乔杨·知识经济革命·网络与信息,98(9) [57] 教育部人事司·高等教育学·北京:高等教育出版社,1998 [58] 陈同仇,薛荣久·国际贸易·对外经济贸易大学出版社,1997,5:160~165. [59] 美国商务部·数字经济2000·国家行政学院出版社,2000,10:124~131. [60] 刘光峰等·实战网络营销——理论与实践·清华大学出版社,2000,6: 335~359. [61] 赖春萍·全球信息流动对国际贸易的影响[J]·世界经济,1999,4: [62] 马张华等·文献分类法主题法导论·北京图书馆出版社,1999,7 [63] 王珊等·数据库系统原理·清华大学出版社,1998,7 [64] 赖茂生·计算机情报检索·北京大学出版社,1993,3 [65] 赖茂生·科技情报检索·北京大学出版社,1994,3 [66] 周宁·情报数据库·武汉大学出版社,1994,7 [67] 苏新宁·信息传播原理·南京大学出版社,1998,4 [68] 姜旭平·信息系统开发方法·清华大学出版社,1997,3 [69] 崔雅萍·网络环境下信息资源得知识产权保护·情报学报,1998(5) [70] 马海波·通讯网络中得信息安全问题·情报学报,1998(1) [71] 刘挺等·自动文摘的四种主要方法·情报学报,1999(1) [72] 成颖等·自动分类研究与展望·情报学报,1999(1) [73] 李培·单汉字标引方法的改进研究·情报学报,1999(5) [74] 黄建年·网络信息分类浅议·情报学报,1999(6) [75] 张彦民·基于内容的检索技术·情报学报,1999(6) [76] 赵华等·网络环境下的信息资源组织·情报杂志,2000(1) 第 167 页
第 168 页