心理测量学
Psychological Testing
一、说明
(一)课程性质
本课程适合于大学本科心理学、教育科学等专业的本科生及研究生教育。本课程的学习将有助于实验设计、教育评价、心理与教育统计学等学科的学习,是培养学生科学研究及掌握研究方法的基础性学科。
(二)教学目的
通过学习,要求学生掌握心理测量的基本知识、心理测量的编制和实施、以及良好测量所要求具备的基本条件。更重要的是,通过本课程的学习要使学生熟练掌握不同心理测量的实际应用。
(三)教学内容
本课程的主要教学内容有:心理测量的基本内涵及其评价和测量的一般步骤和方法两部分。内容涉及一般测量解析,测量的要素及量表类型,测验信、效度、难度和区分度,测量的一般步骤和方法,智力测验、人格测验等心理测验,以及心理测量的综合应用和心理测量理论的新发展等内容。
(四)教学时数
54个课时
(五)教学方式
课堂教学与实践应用相结合。
第一编 心理测量的基本内涵及其评价
第一章 绪论
教学要点:
通过本章的学习,了解测量的基本性质及其要素,测量量表的四种水平,心里测量的本质、基本条件及功能,心里测量的发展以及心理测量的道德准则等内容,对心理测量有一个概括化的了解。
教学时数:[10学时]
教学内容:
一、一般测量解析
1.测量(Measurement)概论
2.测量的分类
3.心理测量的种类
(1)以测量对象来分,(2)以测量的目的来分,(3)以测量的方式来分类,(4)以项目结构或组成形式来分,(5)按评价参照的标准分类
4.测量与测验(Test)、考试(Examination)、评价(Evaluation)联系与区别
二、测量的要素及量表类型
1.测量的要素
识记: 单位(Unit),参照点(Reference Point),量表(Scale)
2.量表类型
(1)称名量表
称名变量只说明某一事物与其他事物在名称、类别或属性上的不同,并不说明事物与事物之间差异的大小、顺序的先后及质的优劣。
(2)顺序变量
顺序变量是指可以就事物的某一属性的多少或大小按次序将各事物加以排列的变量,具有等级性和次序性的特点。
(3)等距变量
等距变量除能表明量的相对大小外,还具有相等的单位。
(4)比率变量
比率变量除了具有量的大小、相等单位外,还有绝对零点。
三、心理测量的本质、基本条件及功能
1. 心理测量的本质
2. 编制心理测验的基本条件
3. 心理测量的功能
(1)理论研究功能,(2)实际应用功能
四、心理测量发展简史
1. 主观经验性考试阶段(1864年以前)
2. 客观标准化测验阶段(1864年——1940年)
3. 客观测验的深入发展阶段(1940年——)
4. 西方心理测量的发展
5. 心理测验在我国的发展
(五)心理测量的道德准则
1.心理测量工作者的素质要求
(1)心理测量工作的知识结构.(2)对心理测量的态度
2.心理测量工作者的道德准则
(1)测验的保密和控制原则(2)测验中个人隐私的保护
考核要求:
1.心理测量的种类
2.测量与测验(Test)、考试(Examination)、评价(Evaluation)联系与区别
3.测量的要素及量表类型
单位,参照点,量表,称名量表,顺序变量,等距变量,比率变量
4.心理测量的本质、基本条件及功能
5.心理测量发展简史
第二章 经典测验理论的基本假设
教学要点:
通过本章的学习,掌握经典测验理论的基本假设,心里特之及其特性,心里测量的误差和种类,以及真分数的含义等内容。
教学时数:[6学时]
教学内容:
一、心理特质(Trait)及其可测性假设
1.经典测验(Classical Test Theory ,CTT)理论
2.特质假设
二、测量误差及其来源
1. 测量误差的含义
2.误差种类
识记: 随机误差,系统误差
3.误差来源
(1)来自心理测量工具,(2)来自测量对象,(3)来自实测过程
(二)真分数模型及其假设
1. 真分数的含义
2.真分数数学模型解析
领会:(1)几个推理,(2)CTT的基本含义,(3)CTT的基本公式
3.经典测验理论的不足
考核要求:
1.心理特质(Trait)及其可测性假设
2.测量误差及其来源
3.真分数模型及其假设
4.经典测验理论的不足
第三章 测验信度
教学要点:
通过本章的学习,掌握信度的意义,信度系数的计算,了解影响信度的主要因素以及提高信度的常用方法等内容。
教学时数:[4学时]
教学内容:
一、信度的意义
1. 信度指实测值和真值相差的程度
2. 信度指统计量与参数之间的接近程度
3. 信度是指一种测验对相同的应试者再次测验时引起同样反应的程度
二、信度系数的计算
1.稳定性系数
2.等值性系数
3.等值稳定性系数
4. 内部一致性系数
5. 评分者的信度系数
三、提高测验信度的方法
1. 信度系数以多大为宜
2. 影响信度的因素
3. 提高测验信度的方法
考核要求:
1.信度的意义
2.信度系数的计算
识记:稳定性系数,等值性系数,等值稳定性系数,内部一致性系数,评分者的信度系数
3.提高测验信度的方法
请列举一些你所使用过或接触过的量表
思考: 量表的作用是什么?
你如何解释下述现象?
一个很聪明的孩子,测得智商是80分
一个学习很好的学生,考试成绩为60分
一个人缘很好的人,人际关系测量低于常模值
量表帮助我们了解心理现象(心理特质),就像尺子帮助我们测量身高。
思考:我们如何知道我们有多高?
有两个工具:尺子 / 秤
尺子的数据与我们的目测更一致,而秤盘的数据则与我们的目测不一致。因此,尺子是测量身高的有效工具——效度。
什么材料的尺子?——钢铁(热胀冷缩)
涉及到一致性的问题。——信度
物理不等于数学
与的关系
总结:量表是我们用来了解心理特质的工具,但这个工具是有误差的。误差要控制在一个许可的范围内。
回顾
什么是误差?
误差的种类?
误差是在测量中与目的无关的变因所产生的不准确或不一致的效应。
误差分为随机误差和系统误差。
高尔顿的智力观
比奈的智力观
判断题、选择题和问答题
SX2 = ST2 + SE2 ST2 = SV2 + SI2 SX2 = SV2 + SI2 + SE2
SE2
SI2
SV2
SX2
ST2
信度
稳定性 \ 可靠性 \ 一致性
信度乃是一个被测团体真分数的变异数与实得分数的变异数之比。
rXX=ST2/SX2
信度的定义二
信度乃是一个被测团体真分数与实得分数的相关系数的平方。
rXX=P2TX
思考:相关系数的平方?
信度的定义三
信度乃是一个测验X与它的任意一个平行测验X'的相关系数。
rXX=PXX'
A卷:你是一个喜欢热闹的人吗?
1=绝对是
2=是
3=不一定
4=不是
5=绝对不是
B卷:你是一个喜欢安静的人吗?
1=绝对是
2=是
3=不一定
4=不是
5=绝对不是
信度的估计方法
重测信度(Test-Retest Reliability)
定义:同一量表,同一被试群体,在不同时间,两次施测,求其相关。
实质:表示测验结果的稳定性。故称之为稳定性系数(Coefficient of Stability)
形式:施测—适当时间—再施测
时间间隔的把握
间隔时间越长,稳定性系数越低。适宜时间间隔依照测验目的、性质及被试特点而定。几分钟至几年。
年幼儿童,间隔要小;年长群体,间隔可大。智力测验的间隔不能太短,成就测验的间隔不能太长。
一般间隔时间不超过六个月。(即不能让被试记住上一次测验的内容,又不能让其特质发生变化,或对所学知识产生遗忘)
复本信度(Alternate-form raliability)
因为任何测验只是所有可能题目中的一份取样(行为样本),所以可编制许多平行的等值测验,叫做复本。
复本等值要符合下列条件:
各份测验测量的是同一种心理特性。
各份测验具有相同的内容和形式。
各份测验的题目不应重复。
各份测验题目数量相等,难度和区分度大体相同。
各份测验的分数分布(平均数和标准差)大致相等。
复本编好后,应再测一次,以确保各份测验的等值。
定义:两个复本施测同一被试群体,求其相关。
等值性系数:同时连续施测,反映内容变异。
形式:复本A—最短时间—复本B
稳定性与等值性系数:
时间间隔施测,内容变异+重测信度误差
形式:复本A—适当时间—复本B
分半信度(Split-Half Reliability)
定义:在测验没有复本且只能实施一次的情况下,可将测验项目分成对等的两半,根据被试在这两半测验中所得的分数计算相关系数,即得分半信度。
计算分半信度先要对测验分半。不同的分半法可能会得到不同的信度值。
分半信度(Split-Half Reliability)
为了使两半基本等值,可将项目按由易到难的顺序排列编号,然后按奇数和偶数序号将项目分半。要注意使那些性质相同、联系紧密的项目分在相同的一半,否则会使信度值偏高。
由于分半信度实际上只是半个测验的信度,测验越长、项目越多,两半分数的相关就越高。因此,对长度不同的测验,要用校正公式。
同质性信度(Homogeneity Reliability)
同质性指测验的所有题目测量的是同一种心理特质,表现为各个题目得分之间有较高的相关,相关越高则同质性越强。
因素分析的思路
五、评分者信度(Scorer Reliability)
评分者信度是指不同评分者之间在测验结果计分上的一致性。
在心理测验中,评分者信度的计算,通常是随机抽取若干份试卷,由至少两位受过训练的评分者按计分规则分别判分,然后计算它们的相关。几个评分者的评分越一致,评分者信度越高。
五、评分者信度(Scorer Reliability)
最简单的估计方法就是随机抽取若干份答卷,由两个独立的评分者打分,再求每份答卷两个评判分数的相关系数。这种相关系数的计算可以用积差相关方法,也可以采用斯皮尔曼等级相关方法。
如果评分者在三人以上,而且又采用等级记分时,就需要用肯德尔和谐系数来求评分者信度。
估计信度的方法与测验复本的数目
以及施测次数的关系
复本信度
(间隔施测)
再测信度
二
副本信度
(连续施测)
分半信度
同质性信度
评分者信度
一
二
一
所需要副本的数目
所需要
施测的次数
在一般情况下,间隔施测的副本信度最低,因为很多因素有机会影响到分数。相反,校正过的分半相关,因为影响的因素少,所得的信度估计为最高。
各种信度系数相应误差变异的来源
时间取样
内容取样
时间与内容取样
内容取样
内容的异质性
评分者间的差异
再测信度
复本信度(连续施测)
复本信度(间隔施测)
分半信度
同质性信度
评分者信度
误差变异的来源
信度系数的类型
实际上,有多少种误差来源,便有
多少种估计信度的方法。一个测验
哪种误差大,便应该用哪种误差估
计。有时一个测验需要有几种信度
系数,这样我们就把总分数的变异
数分成不同的分支。
假设对100个六年级学生以两个月的时间间隔先后施测一个创造力测验的A\B两个复本,所得的等值性与稳定性系数为。我们还根据
被试对每个复本的反应计算出分半信度为
(先计算每个复本的分半相关系数。将二者平
均后再用斯皮尔曼-布朗公式校正)。同时,
我们让另一个评分者随机抽取50份卷子另外评
分,得到评分者信度为。然后,我们对这
三种方法所产生的误差变异进行分析。
一个假想测验的误差变异来源分析
=
真实变异
++=
误差变异总和
评分者差异
=
评分者信度
时间取样
=
上述二者差异
内容取样
=
分半信度
时间与内容取样
=
复本信度(间隔施测)
误差变异来源
误差变异量
信度类型
一个假想测验的误差变异来源分析
评分者间差异
时间取样误差
内容取样误差
时间上的稳定性,复本之间的一致性,评分者之间的一致性
8%
10%
20%
62%
误差变异
真实变异
第四章 测验的效度
教学要点:
通过本章的学习,掌握效度的含义,效度估计方法,了解影响信度与效度的关系,影响效度的因素以及提高信度的几种方法等内容。
教学时数:[10学时]
教学内容:
一、 效度概述
1. 效度的一般定义及其内涵
效度是指测验的准确性,即测验能够测出他们所欲测的特质的程度。
2. 效度的统计与原理
3. 效度的信度关系
(1)高效度,高信度(2)高信度,低效度(3)低信度,低效度
二、 效度的估计
1966年美国心理学会在《教育心理测验值标准》中将效度分为三大类:
1. 内容效度(Content Validity)
内容效度指测验实际测到的内容与所要测量的内容之间的吻合程度。
2. 结构效度(Construct Validity)
结构效度是指测验对于被称作构想的某一理论概念或特质测量的程度。
3. 实证效度(Criterion related Validity)
实证效度是指一个测验对处于特定情景中的个体的行为进行估计的有效性。
三、 提高测量效度的方法
1. 各种测量效度的要求
2. 提高效度的方法
(1)控制系统误差,(2)精心编制量表,(3)妥善组织测验,(4)扩充样本容量,(5)适当增加测验的长度
3. 效度的一般定义及其内涵
效度是指测验的准确性,即测验能够测出他们所欲测的特质的程度。
4. 效度的统计与原理
5. 效度与信度的关系
(1)高效度,高信度(2)高信度,低效度(3)低信度,低效度
四、 效度的估计
1966年美国心理学会在《教育心理测验值标准》中将效度分为三大类:
1. 内容效度(Content Validity)
内容效度指测验实际测到的内容与所要测量的内容之间的吻合程度。
2. 结构效度(Construct Validity)
结构效度是指测验对于被称作构想的某一理论概念或特质测量的程度。
3. 实证效度(Criterion related Validity)
实证效度是指一个测验对处于特定情景中的个体的行为进行估计的有效性。
五、 提高测量效度的方法
1. 各种测量效度的要求
2. 提高效度的方法
(1)控制系统误差,(2)精心编制量表,(3)妥善组织测验,(4)扩充样本容量,(5)适当增加测验的长度
考核要求:
1.效度的一般定义及其内涵
2.效度的统计与原理
3.效度与度的信度关系
4.效度的估计
内容效度,结构效度,实证效度
5.提高测量效度的方法
第五章 测验的难度和区分度
教学要点:
通过本章的学习,掌握测验难度和区分度的含义,以及难度、区分度的计算,了解难度、区分度对测验质量的影响等内容。
教学时数:[10学时]
教学内容:
一、测验难度的计算
1. 计算难度的基本公式
(1)以试题通过率计算难度:P=R/N,(2)用平均数计算试题的难度
2. 用极端分组法计算难度
二、 难度的转换
难度转换的方法
三、 测验题目难度水平的确定
四、 区分度的定义
1. 定义:区分度是指测验对于考生实际水平的区分度程度或鉴别能力。
2. 区分度与测验信度、难度的关系
五、 区分度计算
1. 用极端分组法计算
(1)客观题计算,(2)论文题计算
2. 用内部一致性系数(Internal Consistency)计算区分度
(1)用点二列相关计算区分度
(2)用二列相关计算区分度
(3)用Φ相关计算区分度
(4)用四分相关计算区分度
(5)用皮尔逊相关法计算区分度
(6)D(鉴别指数)的经验标准
考核要求:
1.测验难度的计算
2.计算难度的基本公式
3.难度的转换
4.测验题目难度水平的确定
5.区分度的含义
6.区分度与测验信度、难度的关系
7.区分度计算
用极端分组法计算,用内部一致性系数(Internal Consistency)计算区分度
第二编 测量的一般步骤和方法
第六章 测验的编制与实施
教学要点:
通过本章的学习,掌握编制测验的基本程序,测验的实施过程及须注意的事项等内容。
教学时数:[10学时]
教学内容:
第一节 编制心理与教育测验的基本程序
一、 确定测验的目的
1. 明确测量对象
2. 明确测量目标
3. 明确测量用途
二、 制定编题计划
三、 编辑测验项目
1. 收集测验资料
2. 选择项目形式
3. 编写测验项目
四、 测验与项目分析
1. 预测
2. 项目分析
五、 合成测验
1. 测验项目的选择
2. 测验项目的编排
3. 编制副本
六、 测验标准化
1. 测验内容
2. 实测过程
3. 测验评分
4. 测验分数解释
七、 鉴定测验
1. 信度
2. 效度
3. 测验量表与常模
八、编写测验说明书
第二节 测验的实施
一、 测验的实施过程
1. 实测前的准备工作
2. 指导语
3. 测验情境
4. 测验焦虑
5. 与受测者建立良好的协调关系
6. 评分技术
二、 测验分数的解释
1. 如何看待测验分数的意义
2. 如何向受测者报告测验分数
考核要求:
1. 编制测验的基本程序
确定测验的目的,制定编题计划,编辑测验项目,测验与项目分析,合成测验,测验标准化,鉴定测验,编写测验说明书
2.测验的实施过程及须注意的事项等内容
3.测验分数的解释
第七章 测验分数的解释与应用
教学要点:
通过本章的学习,掌握测验分数的类型,常模及常模类型,以及测验分数的解释和常模的应用等内容。
教学时数:[4学时]
教学内容:
一、分数与常模
1. 分数的种类和含义
识记:(1)原始分数,(2)导出分数
2. 常模
3. 年龄常模
4. 年级常模
5. 百分等级常模
6. 标准分数常模
二、 测验的等值
1. 测验等值的实质
2. 测验等值的条件
(1)同质性,(2)等信度,(3)公平性,(4)可递推性,(5)对称性,(6)样本不变性
3. 测验等值的基本算法
识记:(1)百分位等值(2)线性等值
4. 常用等值设计
5. 测验等值误差估计
考核要求:
1.分数
原始分数,导出分数
2.常模
年龄常模,年级常模,百分等级常模,标准分数常模
3.测验的等值的实质与条件
4.测验等值的基本算法:百分位等值,线性等值
第八章 测验的项目分析
项目分析包括定性分析和定量分析。定性分析包括考虑内容效度、题目编写的恰当性和有效性等;定量分析主要是指题目难度和区分度的测量。
对项目进行筛选和修订,可以提高测验的信度和效度。
第一节 测验的难度
一、难度(difficulty)的意义
难度,指项目的难易程度。
在最高作为测验中,称为“难度”,而在典型作为测验中,则指“通俗性”。两者都是指在总体中,能够正确或确切回答某项目的人数。
二、难度的计算
(一)二分法记分项目的难度
1.通过率
P=R/N
2.极端分组法(上下27%)
P=(PH+PL)/2
(二)非二分法记分项目的难度
P=X / Xmax
X为所有被试在该项目上的平均得分, Xmax为该项目的满分。
三、测验难度水平的确定
效标参照测验、掌握测验:不考虑难度;
选拔测验:难度=录取率;
对于选择题来说,难度一般应大于猜测概率;
无论是速度测验,还是难度测验,一般都应防止被试得满分,因为满分的意义是不明确的。
大体而言,难度为时最理想,此时项目具有最大的鉴别力。但在实际操作中,让所有项目难度都到达困难很大,而且也不必要,一般只需使项目的平均难度接近,而各个项目的难度在± 之间变化。
四、难度的等距变换
根据正态分布表,将难度P作为正态曲线下的面积,转换成相应的Z分数,这就是等距量表。
P
Y
0 Z
Z
Y
P
.00
.39894
.00000
.50
.35207
.19146
.24197
.34134
.12952
.43319
.05844
.47500
.05399
.47725
.01753
.49379
.01431
.49506
.00443
.49865
.00087
.49977
.00014
.49997
美国教育服务中心以Δ 作为难度指标:
Δ=13+4Z
P = .0013 Z = +3 Δ= 25
P = .16 Z = +1 Δ= 17
P = .50 Z = 0 Δ= 13
P = .84 Z = -1 Δ= 9
P = .9987 Z = -3 Δ= 1
五、难度对测验的影响
(一)测验难度影响测验分数的分布形态
难度大,正偏态
难度低,负偏态
(二)测验难度影响测验分数的离散程度
测验过难或过易,分数全距缩小,信度降低。
P=时最佳
第二节 测验的区分度
一、区分度的意义
区分度(discrimination)是指测验项目对被试心理品质水平差异的区分能力或鉴别能力。
项目的区分度是测验是否有效的“指示器”。
二、区分度的计算
(一)项目鉴别指数法
1.鉴别指数(index of discrimination,D)的计算
D = PH - PL
取值范围:-1~ +1
鉴别指数
题目评价
以上
很好
~
良好,修改会更好
~
尚可,仍需修改
以下
差,必须淘汰
2.极端组的划分
27%规则
一般情况下,取上下25%~33%均可。
样本少时,可以取50%
注意:
由于计算机的方便使用,可以上下50%作为划分高低组的标准,或者多分几组,对区分度和难度作详细分析。因为只取上下两端,只利用了一部分资料,浪费了很多信息,有可能得出错误结论。
(二)相关法(项目-总分相关)
1.点二列相关
Xp-Xq
rpb= √pq
St
2.二列相关
Xp - Xq pq Xp - Xt p
rb= • 或 rb= •
St y St y
3.φ 相关
ad-bc
rφ=
√(a+b)(c+d)(a+c)(b+d)
4.四分相关
5. 项目和总分相关重叠的校正
当测验项目超过20个项目时,校正法通常毫无意义。
rtpSt – Sp
rpq =
√St2+ Sp2 –2rtpStSp
(三)项目特征曲线(item characteristic curve, ICC)
项目特征曲线描述了效标分数不同的被试在该项目上的通过率。
曲线坡度越陡,鉴别力越好,预测的误差越小。
率
概
的
目
项
答
回
确
正
低 中 高
能力
鉴别力较好
低 中 高
能力
率
概
的
目
项
答
回
确
正
低 中 高
能力
率
概
的
目
项
答
回
确
正
鉴别力为负
鉴别力较低
率
概
的
目
项
答
回
确
正
低 中 高
能力
ABC
难度不同的3个项目的ICC
率
概
的
目
项
答
回
确
正
低 中 高
能力
AB
CD
多项选择中每个选项的ICC
三、区分度与难度的关系
难度(P)
区分度(D)
0
1
0
难度和区分度都是针对一定团体而言的。
一般来说,较难的项目对高水平被试区分度高,较易的项目对低水平被试的区分度高。
四、区分度的相对性
(一)不同的计算方法,所得区分值不同
区分度有几种计算方法?
(二)样本容量大小影响相关法区分度值的大小
样本越大,区分度越……
(三)分组标准影响鉴别指数
分组越极端,区分度越……
(四)被试样本的同质性程度影响区分度值的大小
样本越同质,区分度越……
第三节 项目分析的特殊问题
一、多重选择题的项目分析(诱答分析)
对于多重选择题,除了分析难度和区分度外,还要对每个选项进行分析。
下列哪一个最有可能是偏执型精神分裂症患者的次级症状:
A 幻听
B 瘫痪
C 记忆丧失
D 厌食
如果所有被试都选择某一正确的选项,说明该选项……
如果没有一个被试选择某个错误选项,说明该选项……
如果所有被试都选择某个错误选项,说明该选项……
如果高分组被试的选择集中在两个选项上,说明该选项……
如果高分组和低分组对正确选项的选择没有区别,说明该选项……
如果所有被试都未回答某个题目,说明该题……
如果选择各个选项的人数几乎相等,说明该题……
二、速度测验的项目分析
对前面部分的测验项目,难度和区分度都……
对后面部分的测验项目,难度和区分度都……
三、标准参照测验的项目分析
在标准参照测验中,无须考虑项目的难度和区分度,只要项目的内容很重要就行。
也可以通过比较教学或训练的前测和后测结果来进行项目分析,用来说明教学或训练的效果以及项目编制是否适当。
四、项目-团体的相互作用
具有不同性质(性别、种族、职业等)的团体,在测验得分上也存在差异,即同样的项目可能有不同的难度。
如果测验要求对所有个体都相对“公平”,那么,就应该排除那些有利于或不利于不同性质的亚团体的项目;
如果测验的目的就是为了考察不同亚团体的差异,那么,就应选择使团体差异尽可能大的题目。
五、有效性与可靠性的矛盾
同质性信度要求项目之间有高相关,各项目的难度均等;
对于预测效度来说,因为效标的变异范围较大,如果项目越同质,那么效标关联效度则低;因此,效标关联效度要求各项目之间要有一定的差异,即项目之间相关低,这样才能保证测验得分与效标之间有高相关,即高的效标关联效度。
因此,对于多数心理测验来说,项目之间中等程度的相关,可使二者调和,获得较为满意的(同质性)信度和(效标关联)效度。
第九章 学绩测验
第一节 学绩测验概述
一、学绩测验的性质
最高作为测验可以分为:学绩测验、能力测验、能力倾向测验。
学绩,指经过一定的教学或训练后所学到的东西,是在一个比较明确的、相对限定的范围内的学习结果。
能力倾向指学习的能力,是在给予适当的机会时获得某种知识或技能的能力。
能力介于学绩和能力倾向之间,指的是当前的知识或技能的水平,既有正式学习的,也有非正式学习的结果,既包括学术技能,又包括非学术技能。
学绩测验用来描述现状,指明一个人已经学会了什么和能做什么。
二、学绩测验的基本假设
1 学绩测验所测量的知识和技术的范围能明确界定。
2 测验所测量的是研究者认为重要的东西,而不是与测量目的无关的东西。
3 被试有同样的机会学习测验所包含的材料。
三、学绩测验的分类
(一)按测验的编制方法分
教师自编课堂测验,标准化学绩测验
(二)按测验内容分
单科测验,多科测验
单元测验,总测验
(三)按测验的用途分
考察性测验,诊断性测验,准备性测验,选拔与安置测验,职业水平测验,用于研究的测验
(四)按测验评分的参照系分
常模参照性测验,目标参照性测验
(五)按测验的题型分
客观测验,论文式测验
四、学绩测验的应用
1 反馈功能
2 诊断功能
3 辅助教学管理
4 研究工具
5 人才选拔与安置
第二节 标准化学绩测验
一、标准化学绩测验的基本要求
1 命题组卷标准化
测验目标,试题的措辞、难度、区分度,题型比例、题量
2 施测标准化
环境、时间、指导语、主试
3 评分标准化
标准答案、评分细则、评分者人数
4 测验分数解释标准化
是常模参照还是目标参照
二、标准化学绩测验的编制
由学科专家与测验编制专家共同完成,其步骤与一般心理测验的编制程序相同。
(一)确定测验目的,选定测验编制的方法
考察还是诊断,常模参照还是目标参照
(二)分析测量目标,拟订测验编制计划
双向细目表,题型,题量
(三)编题征题与选题组卷
编题征题→试测→组卷
(四)调查测验质量参数,编制测验常模
难度、区分度、信度、效度、常模
(五)编写测验指导书,正式出版发行
三、国外常用标准化学绩测验简介
(一)斯坦福成就测验
综合性学绩测验
适用范围:1~9年级
内容:词汇、阅读理解、拼字、听理解、词汇学习技能、语言、数学概念、数学计算、数学应用、社会科学常识、自然科学常识
斯坦福早期学校成就测验(适用于幼儿园和小学一年级)
斯坦福学业技能测验(适用于8~12年级)
导出分数:百分等级、标准九、年级当量、量表分数、正态曲线当量
分测验信度均在以上。
(二)关键数学算术诊断测验
适用范围:学前儿童~小学六年级
测验内容:
内容块:数学、分数、几何、符号
运算块:加法、减法、乘法、除法、心算、数字推理
应用块:文字题、补充、金钱、测量、时间
诊断:
总体水平诊断
分块水平诊断
分测验水平诊断
项目水平诊断
四、标准化学绩测验的题库建设
一个高质量的题库应具有的性质:
有一种科学的测量理论;
贮备一定数量的试题,所有试题品质优良,技术参数完备;
题库内部结构层次清楚、分类严谨,试题检索方便;
题库管理方便,可控性强,易于维护更新;
保密性强。
五、我国高考的标准化试验
第三节 教师自编课堂测验
一、教师自编课堂测验的特点
测验形式灵活多变,与测验目的完全一致
测验内容与教材内容完全一致
测验难度切合学生的实际水平
测验编制简易快速
二、教师自编课堂测验的步骤与方法
审查测验目的
制定测验编制计划
命题与组卷
三、教师自编课堂测验应注意的问题
教师要深入研究教材,深入研究学生
要维护准确稳定的合格标准
要客观评价自己的命题技术,合理使用各种题型
要注意总结命题经验,提高命题技术
要尽量控制评分误差,防止简单粗糙
要做一些定量分析研究
第十章 能力测验(上)
第一节 智力测验的理论基础
(一)什么是智力?
Spearman(1904,1923):智力是一种普遍的能力,它主要涉及联系的引出(eduction)和相关的引出。
Binet & Simon(1905):智力是正确进行理解、判断和推理的能力。
Terman(1916):智力是形成概念,并且抓住其重要性的能力。
Thorndike(1921):智力是从真理或事实角度产生良好反应的能力。
Thurstone(1921):智力是抑制本能反应,灵活地想象不同反应,并且把修改后的本能反应转换为外显行为的能力。
Wechsler(1939):智力是个体有目的地行动,理性地思考以及有效地应付环境的总体能力。
Piaget(1972):智力是总括性的术语,指用来适应物理和社会环境的认知结构的组织和平衡的高级形式。
Sternberg(1985):智力是指自动信息加工和产生适合于新情况的行为的心理能量,它包括元成分、操作成分和知识获得成分。
Eysenck(1986):智力是将信息无错地传递过皮层的能力。
Gardner(1986):智力是解决问题,制造在某些文化范围内有价值的产品的能力或技术。
共同点:
w 智力是适应环境的能力
w 智力是通过经验进行学习的能力
智力是人们在获得知识和运用知识解决实际问题时所必须具备的心理条件或特征。
Boring(1923):智力就是智力测验所测量的东西。
Sternberg等(1981)的研究
专家认为:语词能力、问题解决能力和实际智能最重要
外行认为:实际问题解决能力、语词能力和社会能力最重要
(二)智力的理论
Galton和感觉敏锐度
1.二因素论
Spearman的一般因素(G)和特殊因素(S)
2.多因素论
Thurstone的群因素(语文理解、言语流畅性、推理、空间想象、数字、记忆、知觉速度)
内容
视觉
听觉
符号
语义
行为
3. Guilford的智力结构模型(内容×操作×结果=150)
产品
单元
类别
关系
体系
转换
蕴涵
评价
聚合思维
发散思维
记忆
认知
操作
4. 智力层次理论
Vernon
G因素
言语和教育 操作和机械
数学 语文 … 空间知觉 机械能力 …
5.二维结构模型
希莱辛格和古特曼(1966)
第一维:言语能力、数学能力、图形和空间能力
第二维:规则应用能力、规则归类的能力、学术成就
6 Cattell的流体智力与晶体智力
7. Gardner的多元智力理论
言语、逻辑-数学、空间、音乐、身体运动、社交、自知
8 智力的生物学理论(反应时)
作出反应
9 智力的认知心理学理论
Sternberg
智力成分:元成分、操作成分、知识获得成分
智力情境:适应环境、塑造环境、选择新环境
智力经验:处理新任务、自动化加工
10 其他:
情绪智力(EQ)、成功智力、实践性智力(practical intelligence)
第二节 个体智力测验
一、比内量表
(一)比内-西蒙量表
1.1905年量表
世界上第一个智力量表;
内容:30道题(记忆、言语、理解、手工操作)。
题目排列方式:从易到难。
指标:通过项目数。如白痴最多只能通过6项,低能的成人可通过7~15项。
眼睛是否随动的物体移动。
用触觉刺激唤起抓握反应。
用视觉刺激唤起抓握反应。
辨认食物。
搜寻食物。
执行简单的命令和模仿简单的手势。
认识物体。
认识图片。
列举图片中的人物和物体。
比较两条线的长短。
复述两个数字。
比较两个重量。
暗示。
解说物体与人物的名称。
复述句子。
说出二物的不同点。
记忆图片中的物体。
靠记忆重画图片。
复述数字。
说出二物的相同点。
比较线的长短。
比较重量。
重量记忆。
说出同韵字。
填词。
用三个词造句。
对答问句。
交换长短针的位置。
剪纸。
抽象名词的定义。
2.1908年量表
内容:增至59道题。
方式:把测验项目按年龄分组。每一岁一组。每个年龄组项目数量不等,最多8项,最少3项。
年龄范围:3~13岁。
指标:智力年龄。
例:一个4岁儿童心理年龄的计算
心理年龄(MA):4岁2个月
3 14
总分
0
2
0(最高年龄)
7岁
— 2
2
1
6岁
— 2
1
2
5岁
— 2
1
2
4岁半
— 3
1
3
4岁
— 5
1
5
3岁半
3 —
—
6(起始年龄)
3岁
全部得分
年 月
每项测验得到的月数
通过的测验数目
年龄水平
3.1911年量表
题目:删旧补新,但总数仍为59题。
增设一个成年组。
除4岁组仅有4个项目外,其他每个年龄组一律为5项,便于计算。
对比内-西蒙量表的评价
成就:
(1)比西量表是第一个采用复杂任务来测量高级心理过程的测验。以前的测验主要测量感知觉、运动等低级心理过程。
(2)比西量表首次采用年龄作为智力的标准,这样可以对测验作出通俗易懂的解释。
(3)比西量表首次从整体上测量智力,也就是测量智力的普通因素,而以往心理学家把感觉辨别力、记忆力、注意力等割裂开来测量。
不足:
(1)施测和记分没有标准化。
(2)常模团体的代表性不够,因而有些项目的安排位置不当。
(3)测验项目过少。
(二)斯坦福-比内量表
1.斯坦福-比内量表的发展
(1)1916年量表
在修改基础上增设39个新项目,达到90个项目。
最早对施测和记分提供了详细的指导语。
引入了智力商数的概念(比率智商)。
适用年龄:3~13岁。
样本:1000名儿童和400名成人。
(2)1937年量表
由 L 和 M 两个等值型量表构成
年龄范围扩大:~18岁
样本:3184名~18岁儿童,但仅限城市白人
(3)1960年量表
合并了L和M两型中最好的项目,改为单一量表。
年龄:2~成人
离差智商
4498名~18岁儿童(1937年量表的施测对象)。
(4)1972年量表
测验内容未变;
取样范围扩大(地区、社会阶层、经济状况、民族)。
共2100名被试,其中2~岁每半岁选100名,6~18岁每一岁选100名。
2.斯比量表的信度和效度
(1)信度
复本信度:L和M相关在~之间。
再测信度:高于。
(2)效度
内容效度:测验内容属于公认的智力范畴。
效标关联效度:与学业成绩、受教育年限的相关在~之间。
结构效度:假设智力发展随年龄增长,先快后慢(证据:随年龄增长,再测稳定性逐步提高);
存在G因素(证据:各项目与测验总分的平均相关为)
(三)中国比内测验
陆志伟和吴天敏1924年、1936年、1982年三次修订
内容:51题
指标:离差智商
年龄范围:2岁~18岁
生活常识
知觉速度及观察力
空间知觉力和想象力
记忆力
语言能力
判断推理能力
二、韦克斯勒(Wechsler)智力测验
生平:
1896年出生于罗马尼亚,6岁迁居美国。一战期间从事心理测验工作,用陆军甲、乙种测验、斯比量表来甄选新兵,积累了丰富的经验。
1919年去伦敦大学,师从Spearman和Pearson,接受G因素理论。1920~1922年在巴黎与西蒙有过接触。
1925年,在哥伦比亚大学获博士学位,论文《情绪反应的测量》。
1932~1967年,任纽约贝尔韦精神病院的主任心理学家。
二、韦克斯勒(Wechsler)智力测验
编制背景:寻找一种测量成人智力的有效方式
当时的智力测验存在下列问题:
测验项目引不起成人的兴趣;
过多的项目涉及语词的操作;
指导语过分强调速度,牺牲了准确性;
计算心理年龄,不适合成人测验要求。
测验者的实际测验分数
IQ=
这一年龄测验者的平均测验分数
韦氏智力测验家族:
1939年,韦克斯勒-贝利弗测验
1946年,韦克斯勒-贝利弗测验Ⅱ
1949年,韦克斯勒儿童智力量表(WISC)
1955年,韦克斯勒成人智力量表(WAIS)
1967年,韦克斯勒学前和小学儿童智力量表(WPPSI)
1974年,韦克斯勒儿童智力量表修订版(WISC-R)
1981年,韦克斯勒成人智力量表修订版(WAIS-R)
1989年,韦克斯勒学前和小学儿童智力量表(WPPSI-R)
1991年,韦克斯勒儿童智力量表第三版(WISC- Ⅲ )
韦氏测验的特点:
(1)10~12个分测验:使用多个分测验,不仅可以得到总IQ,还可以分析个体在智力上的强项和弱点;
(2)言语量表和操作量表各由5~6个分测验组成,可以单独评价言语或操作的各项智力成分,体现了左右脑功能的整合,而且可以显示个体的职业能力倾向。
(3)共同的IQ计分系统:对所有测验和所有年龄组,IQ平均为100,标准差为15。而且每个分测验的平均分为10,标准差接近3分。这样就可以比较被试的各项分测验分数,了解其相对强弱。
(4)不同年龄组有相同的分测验:例如,WAIS-R,WISC-R,WPPSI-R有相同的8个核心分测验。这不仅方便施测者,而且有助于测验之间的相互比较。
韦克斯勒测验的分测验
(1)常识(information)
33个一般知识性问题,如“谁发现了美洲?”“我国的首都在哪里?” “儿童节是哪一天?”
得分越高,说明兴趣越广泛,好奇心强,长时记忆好。
把该测验放在首位,容易与被试建立关系,不易引起被试的紧张和厌烦。
(2)数字广度(digit span)
分顺背和倒背两部分(2位到9位数)。
主要测查瞬时记忆能力。对智力低者,测其智力;对智力高者,测其注意力。
按0或1计分,总分为两部分之和。
智力高者在该项上得分未必高,有时倒背可能会高于顺背成绩。
脑功能障碍者一般得分较低。但对有些白痴学者,能轻易得高分。
(3)词汇(vocabulary)
要求被试定义和解释通过视觉或听觉呈现给他们的字词的一般意义。例如“什么是杯子?”“什么是美丽?”
该测验与抽象概括能力有关。年龄大的、智力高的、受教育程度高的、经历丰富的人,其得分高。
问题是计分困难。答案分四级:
一级:用同义词,且能说明二者的细微差别;
二级:具体运用词汇来造句;
三级:望文生义,作字面解释;
四级:做手势或指实物给主试看。
一级计2分,二级计1分,三四级计0分。
(4)算术(arithmetic)
简单项目主要是加减法运算。难一些的问题需要对问题进行分析,并运用两种以上的算术运算。
主要测量基本的数理知识和数学思维、推理能力。
(5)理解(comprehension)
容易的题目主要测常识,如“为什么人要穿衣服?”
难的项目需要了解社会、文化传统,如“为什么最高法院任命终身法官?”
该分测验能反映被试对于社会价值取向、风俗、伦理道德是否理解和适应,在临床上可以鉴别脑器质性障碍的病人。
(6)类同(similarities)
让被试区分物体、事实和观念的重要的相似性与不重要的相似性,如“衬衫和袜子有什么相似的地方?”测查个体的逻辑思维、抽象思维、分析和概括能力。
(7)填图(picture completion)
要求被试回答图中缺少了什么重要成分。主要测的是记忆、细节注意能力和视觉敏锐性。
具有病态观念的患者往往将自己的思想投射到测验中去。智力落后者的填图成绩很差。
(8)图片排列(picture arrangement)
有意打乱图片的顺序,要求被试重新排列图片,使之组成一个有意义的故事。
测量被试的分析综合能力、观察因果关系的能力、社会计划性、预测能力和幽默感等。
(9)积木图案(block design)
呈现10张红白相间的几何图案卡片,要求被试用4个或9个积木照样摆出来。
主要测量视知觉、分析能力、空间定向能力和视觉-运动综合协调能力。
该测验与操作量表总分相关很高,被认为是最好的操作测验。在临床上帮助诊断知觉障碍、分心、老年衰退等症状。
(10)拼图(object assembly)
要求被试把一套切割成几块的图形板,拼成一个熟悉物体的完整画面。测量概括思维能力与知觉组织能力、辨别部分与整体关系的能力。
拼图
(11)译码(coding)或数字符号(digit symbol)
主要测查注意力、简单感觉运动的持久力、建立新联系的能力和速度。
文书工作人员得分高,具有强迫观念和强迫行为者得分高。做事认真、一丝不苟者得分低;女性比男性得分高。
(12)迷津(maze)
测量的是知觉运动速度、知觉组织能力、抑制冲动反应的能力。
(13)句子(sentences)
要求被试逐字重复主试大声读出的句子。
测查注意和记忆能力。
(14)几何图形(geometric design)
10个图案,每个图形由一个圆、一个正方形和一个菱形组成,让儿童复写。
(15)动物房(animal pegs)
把某种颜色的圆锥(黑、白、黄、蓝)放到合适的动物(狗、小鸡、猫、鱼)的洞里。测查学习能力、手的灵活性、维持注意的能力。
(一)韦氏成人智力量表
共有11个分测验,其中6个言语量表(常识、数字广度、词汇、算术、理解和类同),5个操作量表(填图、图片排列、积木图案、物体拼凑、数字符号)
信度和效度
背数和数字符号分测验计算复本信度,其余部分计算分半信度,为~
结构效度:“从各个方面来测量智力,而不是测量不同类型的智力。”因素分析表明,有50%的变异来自智力一般因素;各分测验之间和分量表之间存在普遍的显著的正相关,表明智力G因素渗透于智力行为的各个方面。
内容效度:测验项目均取自或参照前人成功用过的量表(比内量表、陆军和)编制。
效标关联效度:与斯比量表的相关;文职人员的言语智商高于操作智商,技术工人则相反。
2.韦氏成人智力量表中国修订本(WAIS-RC)
修订者:龚耀先(1982年)
年龄范围:16~65岁
共有11个分测验,其中6个言语量表(常识、数字广度、词汇、算术、理解和类同),5个操作量表(填图、图片排列、积木图案、物体拼凑、数字符号)
常模:农村(992人)和城市(2029人)
信度:分半信度为~,再测信度为~
效度:高考成绩差异显著者,其智商也差异显著。
(二)韦氏儿童智力量表
12个分测验:5个言语测验(常识、类同、算术、词汇、理解),5个操作测验(填图、图片排列、积木图案、拼图、译玛),2个备用测验(背数和迷津)。
适用年龄:6~16岁
分半信度:~
再测信度:~
效标关联效度:以年龄为效标,得分随年龄增长而提高。与学绩测验或其他学业行为的相关为~;与斯比量表的相关为~
结构效度:发现智力一般因素的存在
韦克斯勒儿童智力量表(WISC-R)中国修订本
修订者:林传鼎、张厚粲等(1983年)
常模:中等以上城市(3000人)
修订原则:测题要适合中国儿童的特点;改动的测题尽可能与原题性质类似、难度接近。主要改动有:
(1)我国社会中不常见的或我国儿童不熟悉的测题内容,如“一个镍币等于几便士?”“美国成年男子平均身高是多少?”
(2)不合我国国情的,如“为什么把钱交给慈善机关比施舍给街头乞丐好?”
(3)由于语种不同,翻译后在难度上发生变化的,如“三月过后是几月?”“啤酒和黄酒的共同点是什么?”
(4)凡外国人名、货币名称以及图片上的人物等尽量使之中国化。
言语量表:常识、背数、词汇、算术、理解、类同
操作量表:填图、图画排列、积木图案、拼图、译码、迷津
(三)韦氏幼儿智力量表(WPPSI)
年龄:4~岁
11个分测验:5个言语测验(常识、理解、词汇、算术、类同),5个操作测验(填图、迷津、积木图案、句子复述),2个备用测验(动物房、几何图案)。
分半信度:
再测信度
结构效度:G
效标关联效度:与斯比量表的相关
对韦氏量表的评价
优点:
(1)具有复杂的结构,能够较好地反映智力的整体和各个侧面;
(2)各年龄组都接受相同的分测验,可以相互比较,并节省指导测验的时间;
(3)用离差智商代替比率智商,克服了计算成人智商的困难。
(4)采用因素分析法研究结构效度更具有理论意义。
(5)各量表之间相互衔接,适用的年龄范围可以从幼儿直到老年。
缺点:
(1)施测程序复杂费时;
(2)对于测量智力极高或极低的被试不大适用;
(3)缺乏充分的效度资料。
第三节 团体智力测验
一、陆军测验
一战时在Yerkes领导下编制。
陆军甲种(α)测验
8个分测验:
照令行事、算术、常识、异同(同反义词)、字句重组、填数、类比推理、理解
效度:与军官评定、斯比量表、教师评定、学业成绩的相关
陆军乙种(β)测验
7个分测验:迷津、立方体分析、补足数列、译码、数字校对、图画补缺、几何形分析
测试对象:母语非英语的被试和文盲被试
效度:与甲种测验的相关
二、瑞文推理测验
(一)瑞文推理测验的产生与发展
1.瑞文标准推理测验
6岁以上
5个系列,60个项目
A组 测知觉辨别力、图形比较、图形想象
B组 测类同、比较、图形组合
C组 测比较、推理、图形组合
D组 测系列关系、图套组合
E组 测套合、互换等抽象思维能力
2.瑞文彩图推理测验
5~11岁
3个系列,36个项目
3.瑞文高级推理测验
适合于高智力成人
第一套12个项目,第二套36个项目
(二)瑞文标准推理测验中国修订本
修订者:张厚粲(1985年)
取样:大、中、小城市
年龄:5岁~成人
信度:分半信度、再测信度
效度:与WISC-RC、高考成绩的相关。
联合型瑞文测验(CRT,Combined Raven’s Test)
(彩色+标准)
团体施测的适用范围:三年级以上,65岁以下
三、认知能力测验
桑代克
初级型:口头、词汇、关系概念、多重智力和数量概念
文字测验:词汇、句子填充、语词分类、语词类推
数量测验:数的大小比较、数列补充、建立关系
非文字测验:图形分类、图形推理、图形综合
团体测验与个体测验的差异:
个体
团体
施测方式
诊断
筛选
用途
一般
极大
样本
长
短
施测时间
施测者计分
计算机计分
计分
开放式
多项选择
题型
个体测验
团体测验
第四节 婴幼儿智力测验
一、盖塞尔发展顺序量表
适用年龄:出生~36个月
方式:自然情景下对儿童的观察
测试工具:响铃、三色环、拨浪鼓、积木、摇铃、蜡笔和纸、皮球、颜色板等
评定内容:
动作:分大动作和细动作。大动作指身体的姿态、头的平衡、坐、立、爬、走、跑、跳,细动作指手指的运用。
言语:听、理解和表达
环境适应:如对物体和环境的精细感觉、协调能力
社会应答:与人交往
诊断依据:每个成熟阶段的行为模式。
指标:DQ(发育商数) = 测得的成熟年龄/实际年龄
2岁小孩的动作发育
逐页翻书、叠起7~8块积木、用积木接成火车、把盛满水的杯子给人、学画圈、能说出4样画片的名称、踢球、跑且不摔交
应人能
言语能
应物能
动作能
成熟阶段
关键年龄
懂得成人逗玩,能自己吃饼干
能呼爸爸妈妈,除爸妈外能说另一字
能将两样玩具放在一起,平指摘小丸
可独坐,爬行,扶着物件站立
坐
40周
穿衣时能合作
能说二字,对“给我”二字有反应
能把方木置于杯中,试堆叠二方木
搀一手行走,摇摆
运动
52周
将足置于口中
呼号,哭时作“姆姆”声
伸手拿玩具,能将玩具自一手递交他手
扶起独坐,身体前倾
坐
28周
自动微笑迎人,玩弄己手
发出咕咕声,出声笑
开始接近有响声的玩具,注视手中有响声的玩具
颈可竖直,头微摇动,仰卧姿势左右对称
仰卧
16周
凝视四周,“倾听声音”
面部无表情,喉头作微声
眼光能短暂跟随人、物,给玩具立即放弃
不能控制头部,仰卧姿势左右不对称
仰卧
4周
婴幼儿智能发育阶段初步检查表
应人能
言语能
应物能
动作能
成熟阶段
关键年龄
能自己吃食物,能自己穿袜解扣。
能成句,能说出姓名、性别
模仿叠方木成品字形、房屋型,模仿画十字
能骑三轮脚踏车,能一足短暂独立
幼儿园前期
3岁
白天预示大小便,能照顾娃娃入睡
能说2~3字短语,能说3~5张画片中物名
堆叠6~7块方木,模仿画圆圈。
能跑,自行上下楼梯
幼儿园前期
2岁
白天能控制大小便;能携带及抱娃娃
能用10字言语(无任何意义)
堆叠3~4块方木,模仿一划
独自行走,自坐于小椅子中
运动
18月
能指出并说出所需之物,摸玩具
能用4~6个字
堆叠二块方木;能把6块方木置于杯内
独自行走,微有摇摆;自坐于小椅子中
运动
15月
二、丹佛发展筛选测验
(Denver Developmental Screening Test, DDST)
年龄:6岁以内
评定内容:
个人-社会行为、精细动作、语言、大运动
三、贝雷婴儿发展量表
(Bayley Scales of Infant Development)
心理量表:知觉、记忆、学习、问题解决、发音、初步的语言交流、初步的抽象思维
运动量表:大动作和精细动作
行为记录:情绪、社会行为、注意广度、目标定向等。
婴幼儿测验的预测效度
缺乏长期的预测效度:1岁内婴儿的测验分数对预测3~4岁的智商有一定的效度,但对长期预测几乎不起作用;
对缺陷儿童的诊断非常有效。
对儿童以后的智力发展,父母受教育的程度及社会经济地位要比婴儿测验的分数更有预测力。
第五节 传统智力测验中的几个问题
(一)传统智力测验的结构效度
不同智力测验有着不同的理论基础,其结构也不同,解释也不同,因此,应针对不同情况选择不同量表,也不能笼统地说一个人的智力如何。
(二)传统智力测验的功能
还不够精细,无法精确诊断。
不能贴标签,更主要的是要解决问题。
(三)传统智力测验的公平性
1.性别差异
传统智力测验中有利于男性和女性的项目的不平衡
2.职业差异
经历对智力的影响
3.文化和教育差异
城乡差别、种族差别
能否编制出绝对公平的测验?
4. 年龄(时代)差异:人是不是越来越聪明?
(四)传统智力测验的预测效度(智商的稳定性与不稳定性)
1.智力随年龄成熟而发展
不同年龄的智力成分是否相同?
智力是随年龄而增长的吗?
一个人的智商是否终身不变?
早期智力开发有无必要?
2.智力随环境而变化
智力中的遗传与环境的关系
同一家庭中成长的孩子,其所处的环境是否相同?
3.智力随个性特质的不同而产生不同变化
人格、动机、情绪对智力发展的影响,而传统智力测验没有考虑这些因素的影响。
学习困难儿童在自我批评和自我监控方面尤为不足。
高智商的人,其智力发展速率快。
积极的人格(进取心、面对挫折的态度)能促进智力的成长。
第十一章 能力测验(下)
第一节 能力倾向测验
一、能力倾向测验的产生原因
1 智力测验的局限
大部分智力测验只测量了言语能力和数目及抽象符号的关系能力,无法测得一些具体的能力。
2 个体能力倾向的差异
3 因素分析技术的发展
4 来自实际的需要
二、能力倾向测验的特点
1 能力倾向测验的预测目的性更强
能力倾向测验预测失败比预测成功更准确
2 测验的编制
每个分测验针对一种能力,应该是相互独立的。
重视特殊团体常模的建立
3 测验结果的解释
注意被试与常模性质之间的差异。
三、具体能力倾向测验介绍
(一)学术能力倾向测验(SAT)
美国的高考测验
语言:反义词、句子填充、类比推理、阅读理解
数学:算术、代数、几何
(二)分辨能力倾向测验(Differential Aptitude Test, DAT)
适用于初中和高中学生的教育咨询及就业指导
言语推理
数的能力
抽象思维
文书速度与准确性
机械推理
空间关系
语言运用:拼写
语言运用:文法
(三)一般能力倾向成套测验(GATB)
综合式职业性向测验(36个职业群常模)。
一般智力:
言语能力
数的能力
空间关系理解力
形状知觉能力
文书知觉能力
动作协调能力
手指灵巧性
手部灵巧性
第二节 特殊能力测验
一、音乐能力测验
(一)西肖尔音乐才能测验
音调、音量、时间音程、节奏、音色、音调
(二)音乐能力测验图
(1)T测验:音调形象(旋律、和声)
(2)R测验:节奏形象(速度、节拍)
(3)S测验:音乐感受(短句、平衡、风格等)
二、美术能力测验
(一)梅尔美术判断力测验
包括10对的绘画作品,一幅是公认的名画,另一幅稍作改动,要求被试判断哪一幅更好。
(二)格雷福斯图案判断测验
由90套二维或三维的空间抽象图案组成,每一套包括2~3个同一图案的变式,它们在整体性、平衡性、对称性等方面有所区别,要求被试判断哪一图案更好。
(三)霍恩美术能力问卷
包括两部分:(1)要求被试画出20种常见的物体或几何图形;(2)在长方框规定的基本线条内作图。
三、机械能力测验
(一)空间关系测验
1.明尼苏达机械拼合测验
要求被试拼排随机摆放的机械物体。
2.明尼苏达空间关系测验
要求被试尽快将木块放入相应的几何形状的槽中。
3.明尼苏达书面形式拼板测验
包括64道选择题,每题包括一个分解几何图形题和5个拼凑成整体的选择图案,要求被试选择正确的答案。
(二)Bennett机械理解能力测验
适用范围:9~12年级
限时:30分钟
测量对实际情况中对机械关系和物理定律的理解。
第三节 创造力测验
一、发散思维研究与创造力测验
二、吉尔福特发散思维测验
1 词语流畅:迅速写出包含一个指定字母的单词。
2 观念流畅:迅速列举属于某一种类的事物的名称,如“能燃烧的液体”有……
3 联想流畅:列举近义词。
4 表达流畅:写出每个词都以指定字母开头的四词句。如“K—U—Y—I”,”Keep Up Your Interest” “Kill Useless Yellow Insects”
5 非常用途:报纸可以用于……
6 解释比喻:“一个女人的美丽就像秋天,它……”
7 效用测验:尽可能列举一件东西的各种用途
8 故事命题:
9 推断结果:“假若人们不再需要睡眠,会出现什么情况?”
10 职业象征:蜡烛——老师
11 图形组合:类似七巧板,包括4种形状(圆、三角形、长方形、梯形),可以重复使用,可以改变大小。
12 绘图:把一简单图形复杂化,组成尽可能多的各种物体的图形。
13 火柴问题:
14 装饰:以尽可能多的不同设计修饰一般物体的轮廓图。
三、托伦斯创造性思维测验
(一)言语的创造性思维测验
包括7项活动:
1 发问: 呈现一张图画,要求列举为了了解图中之事而需要询问的所有问题。
2 猜测原因:列举图中之事发生的所有可能原因。
3 猜测结果:列举图中之事的所有可能结果。
4 产品改进:对给定玩具提出改进意见。
5 非凡用途:列举某物不同寻常的可能用途。
6 不平凡的疑问:对活动5中所示物体提出不同寻常的疑问。
7 推想结果:列举一种假想事件的所有可能结果。
从流畅性、变通性、独特性三个方面计分。
(二)图形的创造性思维测验
1 建构图画
要求被试把一张边缘为曲线的颜色鲜明的纸片贴在一张空白纸上,然后以此为出发点,画一个非同寻常的能说明一段有兴趣的振奋人心的故事的图画。
2 完成图画:利用少量不规则的线条画出物体的略图。
3 利用成对的短平行线(A本)或圆(B本)尽可能多地画出不同的图。
从流畅性、变通性、独特性、精确性4个方面来评分。
第十二章 人格测量
第一节 人格测量的一般问题
一、人格与人格测量
人格是与社会行为有关的心理特质的总和,包括需要、动机、兴趣、爱好、感情、态度、性格、气质、价值观、人际关系等。人格有下面四个特征:
独特性
稳定性
统合性(整体性)
功能性
在心理测验领域中,人格测验尚处于摇篮时期,原因在于:
人格内涵复杂。对于人格的结构及分类问题,至今没有一致结论。
人格是动态的,常随环境而改变。
人格测验的先驱:
高尔顿(Galton):
克雷匹林(Kraepelin):用对词的自由联想来诊断精神病人。
第一个人格问卷——武德沃斯(Woodworth)1919年编制的“个性资料调查表”
人格测验的方法或分类
自陈法、 投射法、 评定法、 情境法
自陈量表、投射测验、评定量表、情境测验
第二节 自陈量表
一、自陈量表(self-report inventory)的性质
让被试自己提供关于自己人格特征的报告。
基本假设:只有被试自己最了解自己。
(一)自陈量表的题目形式
是否式 是ɫ 否ɫ
二择一式
是否折中式 是ɫ 否ɫ 不一定ɫ
文字等级式
非常满意ɫ 比较满意ɫ 无所谓ɫ 不大满意ɫ 极不满意ɫ
数字等级式 5 4 3 2 1
(5—经常 4—多次 3—偶尔 4—极少 1—从不)
(二)自陈量表的特点
测量工具一般为调查表。
题量较大。
在同一测验中往往包含几个分量表,测多个特质。
通常采用纸笔测验,因而可以团体施测。
计分规则简单而客观。
自陈量表的问题:
社会称许性
自我防御:掩饰
默认
折中
(三)自陈量表的编制方法
1.逻辑分析法
确定要测量的特质 → 编写题目 → 编制问卷
爱德华个人偏好量表(EPPS)、詹金斯活动调查表、显性焦虑量表。
2.因素分析法
施测大量题目 → 相关题目构成因素,即人格特质
16PF、EPQ
3. 经验法
分组:选取具有某一特征的效标组,对照组
试测
能把两组分开的题目构成测验
MMPI
4. 综合法
逻辑分析法 → 因素分析法 → 经验法
杰克逊人格问卷(JPI)
二、自陈量表举例
明尼苏达多项人格调查表
(Minnesota Multiphasic Personality Inventory, MMPI)
编制者:美国明尼苏达大学Hathaway和Mckinley教授编制。
题量:566(其中有16道重复,实际题量为550)
项目内容:生理状况,精神状态,对家庭、婚姻、宗教、政治、法律、社会等问题的态度。
量表组成:10个临床量表和3个效度量表
10个临床量表:
Hs:疑病(Hypochondriasis)
D: 抑郁(Depression)
Hy:癔病(Hysteria)
Pd:精神病态(Psychopathic deviate)
Mf:男性化-女性化(Masculinity-femininity)
Pa:妄想狂(Paranoia)
Pt:精神衰弱(Psychasthenia)
Sc:精神分裂(Schizophrenia)
Ma:轻躁狂(Mania)
Si:社会内向(Social introversion)
Hs:疑病(Hypochondriasis): (30题)
异常担心自己身体有病
对身体极端关心
诉说症状笼统含混,
诉说有慢性的疲劳、疼痛、衰弱
自我中心
对他人严厉,间接地表现出敌意
悲观主义
愚钝,顽固,笨嘴拙舌
事事持怀疑观点,心理治疗不太有效
D: 抑郁(Depression):60题
忧郁、压抑、闷闷不乐、对未来悲观
对自己评价过低,缺乏自信,感到无能
抱有罪恶感
寡言、哭泣、动作缓慢
诉说衰弱、疲劳、精力丧失
焦虑不安,紧张
在学校和工作上的失败感
内向,害羞,与人保持距离
细心刻板
很难下决心
Hy:癔病(Hysteria):60题
以出现身体症状来对精神紧张进行反应,以逃避责任
有头痛、胸痛、衰弱、心跳不安等症状
有突然出现、突然消失的症状
缺乏对症状原因的觉察
缺乏对自己动机和感情的觉察
天真幼稚
自我中心
期待他人的爱抚和注意
与上司关系不好
Pd:精神病态(Psychopathic deviate):50题
难以接受社会的价值观和规范
沉溺于非社会或反社会的行为(说谎、盗窃、性异常、吸毒 )
反抗上司
对家族使用暴力
冲动、鲁莽、无计划性,行动不考虑后果
缺乏判断力,冒险,不能吸取经验教训
夫妻生活有问题
自我中心,任性
追求虚荣,出风头
对所干的事几乎无知罪的意识
Mf:男性化-女性化(Masculinity-femininity):60题
男性:
男性角色含混不清
柔弱
对审美和艺术很感兴趣
忍耐力强
女性:
反感自己的女性角色
具有机械、数学的爱好
竞争性强,想支配人
粗野,无礼
Pa:妄想狂(Paranoia):40题
明显的精神病行为
思维混乱
有被害妄想和夸大妄想
过敏,对他人的行为作过分的反应
疑心重
易怒
对家族表示敌意和反感
使用投射作为防御机制
Pt:精神衰弱(Psychasthenia):48题
不安,紧张,爱担忧,操心
心思集中困难
内省,沉默
强迫思维
劣等感,缺乏自信,自我怀疑,自卑
完美主义
对自己,对他人要求都高
规规矩矩
情感脆弱,依赖性强
有关植物性神经系统方面的体诉
Sc:精神分裂(Schizophrenia):78题
明显的精神病行为和生活方式
思维错乱,妄想,幻觉
判断力低
缺乏对社会环境的归属感,感到被孤立、被疏远、被误解
沉思,闭门不出,不与人打交道
广泛的焦虑
不能表现情感
固执己见
Ma:轻躁狂(Mania):46题
无目的的活动过多
说大话,夸张自己的价值,缺乏自知之明
幻觉,夸大妄想
精力旺盛,爱说话
对于涉及细节的事情几乎不关心
难以抑制冲动,易怒
非现实的、无根据的乐观主义
给人的第一印象好
人际关系肤浅
Si:社会内向(Social introversion):70题
内向,腼腆,胆怯,害臊,拘谨
喜欢独处
在异性面前不自然
缺乏自信,优柔寡断
很在意别人的看法
感情很少外露,而对不与别人交往感到苦恼
顺从
值得信赖
慎重,刻板,欠创造性
4个效度量表
Q:疑问量表(Question)——?
没有回答的题数和对“是”和“否”都做反应的题数。超过22分,结果不可信。
L:说谎量表(Lie)
超过10分,结果不可信。
F:诈病量表(Frequency)
说明伪装疾病或精神病程度重。
K:校正量表(Correction)
根据被试对测验的态度对测验得分进行校正。
计分方法
原始分→T分数→剖面图
计算Q量表的原始分。超过22分或30分无效。
分别计算各量表的原始分。
对5个量表加K分校正。
查表把原始分转化为T分;或计算T分。
60以上为异常(中国标准)
T = 50 + 10(X - X)/ SD
画出剖析图。
卡特尔16种人格因素量表
(The Sixteen Personality Factor Questionnaire, 16PF)
编制者:美国伊利诺州立大学Cattell
题量:187题
维度:16PF
计分:原始分→标准10分制→剖面图
敏感、感情用事
理智、注重实际
敏感(I)
冒险敢为
畏怯退缩
敢为(H)
有恒负责
权宜敷衍
有恒(G)
轻松兴奋
严肃审慎
兴奋(F)
好强固执
谦逊顺从
恃强(E)
情绪稳定
情绪激动
稳定(C)
聪慧、富有才识
迟钝、学识浅薄
聪慧(B)
乐群外向
缄默孤独
乐群(A)
高分者特征
低分者特征
因素
紧张困扰
心平气和
紧张(Q4)
知己知彼、自律谨严
矛盾冲突、不明大体
自律(Q3)
自立、当机立断
依赖、随群附众
独立(Q2)
自由、批评激进
保守、服从传统
实验(Q1)
忧虑抑郁、烦恼多端
安详沉着、有自信心
忧虑(O)
精明能干、世故
坦白直率、天真
世故(N)
幻想、狂妄不羁
现实、合乎成规
幻想(M)
怀疑、刚愎
依赖随和
怀疑(L)
高分者特征
低分者特征
因素
16PF次元人格因素
适应与焦虑性
公式 [(38+2L+3O+4Q4)-(2C+2H+2Q3)]/10
内向与外向性
公式 [(2A+3E+4F+5H) -(2Q2+11)]/10
感情用事与安祥机警性
公式 [(77+2C+2E+2F+2N) -(4A+6I+2M)]/10
怯懦与果断性
公式 [(4E+3M+4Q1+4Q2) -(3A+2G)]/10
16PF的应用
心理健康者的人格因素
C+F+(11-O)+(11-Q4)
总分在4~40分之间, 平均22分 , 低于12分者情绪颇不稳定.
从事专业而有成就者的人格因素
2Q3+2G+2C+E+N+Q2+Q1
总分在10~100之间, 平均55分, 67分以上者应有其成就.
创造力强者的人格因素
2(11-A)+2B+E+2(11-F)+H+2I+M+(11-N)+Q1+2Q2
总分在15~150之间, 88分以上者属创造能力强.
在新的环境中有成长能力的人格因素
B+G+Q3+(11-F)
总分在4~40分之间, 平均为22分, 27分以上者则有成功希望.
爱德华个性偏好量表
(Edwards Personal Preference Schedule, EPPS)
编制者:美国心理学家Edwards1953年
题量:225(15个重复题)
内容:15种需要(Murray提出的需要理论)
成就、顺从、秩序、表现、自主、亲和、省察、求助、支配、谦逊、慈善、变异、坚毅、性爱、攻击
特点:采用强迫选择法来控制社会称许性
艾森克人格问卷
(Eysenck Personality Questionnaire, EPQ)
编制者:英国心理学家Eysenck
题量:101
维度:
E:内外倾性。高分表示人格外向,低分表示人格内向;
N:情绪性。低分表示情绪稳定,高分表示神经过敏;
P:精神质。高分表示孤独,难以适应环境,感觉迟钝。
L:说谎量表。
120
115
110
95
90
85
80
75
70
65
60
55
50
45
40
35
30
25
20
15
10
5
0
120
115
110
95
90
85
80
75
70
65
60
55
50
45
40
35
30
25
20
15
10
5
0
P E N L
T分
65 45 70 30
120
120
50
0
0
E
N
抑郁质(内向,情绪不稳)
胆汁质(外向,情绪不稳)
粘液质(内向,情绪稳定)
多血质(外向,情绪稳定)
第三节 投射测验
一、投射测验(projective technique)及其理论基础
投射测验是向被试题提供一些未经组织的刺激情境,让他在不受限制的情境下,自由表现出他的反应,分析反应的结果,便可推断他的人格结构。
基本假设:
人们对于外界刺激的反应都是有其原因且可以预测的;
被试当时的心理状况及整个人格结构,对当时的知觉与反应的性质和方向,都起了很大的作用;
人格结构的大部分处于潜意识中,当被试面对一种不明确的刺激情境时,就可以使隐藏在潜意识中的欲望、需求、动机等“泄露”出来,即把一个反映他的人格特点的结构加到刺激上。
投射测验的特点
测验材料没有明确的结构和意义。
受测者对测验材料的反应不受限制。
测验目的具有隐蔽性。
对测验结果的解释重在对受测者的人格特征的整体了解。
不受语言文字的限制。
计分困难。
投射测验的分类
根据被试的反应方式,可分5类:
联想法——罗夏克墨迹测验
构造法——主题统觉测验
完成法——句子完成测验
选排法——要被试根据某一准则,选择照片,或对照片进行排列
表露法——画人测验
二、罗夏克墨迹测验
(Rorschach Inkblot Test, RIT)
编制者:瑞士精神病学家Rorschach
材料:10张墨迹图
反应方式:自由联想
计分和解释:
计分和解释:
1. 反应部位:
整体:
局部:明显局部、细微局部、特殊局部
空白:
2. 反应的决定因素:形状、动作、彩色(情绪)、阴影(焦虑)
3. 反应的内容:
4. 反应普遍性
RIT反应部位的记分与解释
W(整体反应):正常20%~30%。W多表示能从大处着眼,不拘小节的性格特点。
D(普通大部分反应):正常45%~55%。较多的D表示具有务实精神的性格特点。
d(普通小部分反应):正常5%~15%。较多的 d表示过于仔细和谨慎。
Dd(异常小部分反应):正常在10%以内。 Dd数量多意味有刻板或不依习俗的思维,或有独特的见地。
RIT反应的决定因素记分与解释
F(形状):良好的形状答案(F+)表示被试的现实性思维,其适应是良好的,智能效率较高;拙劣的形状答案(F-)意味着思维过程混乱。
M(动作):M多意味着情感丰富,M少意味着人际关系差。此外,M也是内向性符号。
C(彩色):C是外向性符号,纯粹的C反应是情绪控制的病态欠缺,爆发性的,一触即发的情绪性指标。
RIT反应内容的记分与解释
H(人):H过少缺乏对人的理解,缺少与他人的共鸣及好的人际关系。
A(动物):正常人A在25%~40%范围,A%过低或过高,其社会成熟均有问题。
Sex(性):反应人格的病态倾向性,表示对性的关心、亢进及与社会的脱离。
At(动物解剖学概念):代表意识固着于身体,有焦虑反应,At%在10%以下正常。
三、主题统觉测验
(Thematic Apperception Test, TAT)
编制者:美国哈佛大学Murray和Morgan编制。
材料:31张图片
方式:看图编故事
1.主题
2.主人公
3.主人公的欲求和环境对他的压力
4.被试的言语
5. 故事的结局
四、投射测验的评价
优点:
可以对人格作综合的、完整的探讨,对被试的内心生活作深层的探索,并作出动态解释;
测验目的隐蔽,防止被试作虚假反应。
缺点:
评分缺乏客观标准,难以量化;
缺少充分的常模资料,测验结果不易解释;
信度和效度不易建立;
原理复杂深奥,非经专门训练者不易使用;
被试的反应更容易受测验情境的影响。
第三节 评定量表
评定(rating)指由熟知被试行为的第三者依照长期观察的结果对被试行为进行评定。
评定量表的种类:
数字评定量表:用数字表示不同程度
描述评定量表:用文字表示不同程度
标准评定量表:评判被试属于哪一类型的人
检选量表:给出一组形容词,把最能描述被试的形容词挑出来。
强迫选择评定量表:每组中有多个选项,评定者必须从中选出一个最能代表被试的项目。
常见的评定误差
严格误差:吹毛求疵
宽容误差:
趋中误差:
逻辑误差:把自认为相互联系的特质作同样的评价
“光环”效应:以偏概全
如何减少评定误差
明确界定所评定的行为特质
评定等级不应过细,5级为宜。
对评定者的训练
多人评定
采用相对评定法
注明评定依据。
分别评定各个特质
评定量表举例
莱氏品质评定量表
用于评定内外向
例如:
他的谈锋如何?
喋喋不休;善于辞令;倾向于听;只答复问题;沉默寡言。
倘若事情做错,他的态度如何?
对之悲伤;引以为虑;设法矫正;稍加考虑;坦然处之。
卜氏儿童社会行为量表
用于评定幼儿社会行为发展
孩子是否做过下列各项:
1 他与其他孩子玩耍吗?
2 他与其他孩子说话吗?
3 他偶然用摸或推的方式与其他儿童接触吗?
……
总分越高,社会行为发展越好
90项症状清单(SCL-90)
也叫症状自评量表
90个项目
5级评分:没有、很轻、中度、偏重、严重
评估时段:“现在”或“最近一星期”
适用对象:精神科或非精神科门诊的成年病人
内容:10个因子
10个因子:
躯体化
强迫症状
人际关系敏感
抑郁
焦虑
敌对
恐怖
偏执
精神病性
有关睡眠和食欲的情况
统计指标:
总分
总均分
阳性项目数
阴性项目数
阳性症状均分
第四节 情境测验
把被试置于特定的情境中,由主试观察其在此情境下的行为反应,从而判断其人格。
一、品格教育测验
用于测量诚实、自我控制、利他主义等品格。
如:让学生给自己的卷子打分(事先把卷子复印了1份),看其是否诚实。
让被试闭上眼睛,在圆圈中画记号,看其是否偷看过。
二、情境压力测验
选拔间谍
选拔领导——无领导团体情境
三、情境测验的评价
优点:真实,自然
缺点:
施测困难,费时费钱;
主观评定,误差较大;
被试在不同情境中有不同表现。
第五节 人格测量存在的问题
一、测量对象
人格特质:复杂多样
二、信度和效度
影响测验分数稳定性的因素复杂
缺乏可靠的效标(专家评定的可靠性不高)
人格测验的信度、效度比智力测验要低。
三、测验的题目
题目范围难以界定;
措辞的细微差别会导致反应的巨大差异;
题目含义笼统。(即使工作困难,你也会继续下去吗?)
在选项中,经常、有时、很少,每个人的理解也不一样。
四、分数解释
相同的得分能否给予相同的解释?
不同人之间是否有共同的人格结构?
多数人的行为是否就是正常的?
第十三章 其他心理测验
第一节 焦虑测验
一、焦虑概述
二、焦虑测验
(一)显性焦虑量表(MAS)
(二)状态-特质焦虑量表(STAI)
(三)测验焦虑量表
(四)其他临床焦虑量表
1.贝克焦虑量表
2.汉密顿焦虑量表
第二节 兴趣测验
一、兴趣测验概述
二、常见的职业兴趣测验
(一)斯特朗职业兴趣问卷
(二)库德职业兴趣调查表
(三)自我指导问卷
现实型、研究型、艺术型、社会型、企业型、传统型
第三节 态度和品德测量
一、态度测量
(一)态度概述
(二)态度测量方法
1.等距量表法
2.利克特量表法
3.哥特曼量表法
二、品德测量
(一)品德概述
(二)情境测验法
1.活动情境测验
2.假设的问题情境
(三)问卷测量法
第十四章 测量的综合应用
第一节 测量在心理咨询中的应用
一、心理咨询概述
二、心理测量在心理咨询中的应用
(一)在自我认识、人生规划咨询中的应用
(二)在神经症、人格障碍等咨询中的应用
第二节 测量在人事测评中的应用
一、人事测评概述
二、测量在人事测评中的应用
(一)在人的心理特点评估中的应用
智力测验
个性测验
专业知识技能测验
特殊能力测验
(二)人员培训后的心理特点评估
(三)工作人员的绩效评估
第三节 测量在教育评价中的应用
一、教育评价概述
二、测量在教育评价中的应用
(一)在测量学生的学习与发展状况中的应用
(二)测量在教师与管理者评价中的应用
参考教材与参考书目
参考教材:林崇德主编:应用心理学书系。郑日昌、蔡永红、周益群著:《心理测量学》。人民教育出版社,1999年9月第1版
中文参考书目:《心理测量》 金瑜主编 华东师范大学出版社 2001年8月第1版
《心理与教育测量》 戴忠恒编著 华东师范大学出版社 1987年版
《教育和心理测量》 余嘉元编著 江苏教育出版社 1987年版
《教育与心理测量》 宋维真 张瑶编著 科学出版社 1988年版
《教育测量》 王孝玲编著 华东师范大学出版社 1989年版
《心理测验——原理与实践》 彭凯平编著 华夏出版社 1990年版
《洞察人生——心理测量学》 谢小庆等编著 山东教育出版社 992年版
《心理与教育统计》 张厚餐 孟庆茂 北京师范大学出版社 1993年版
《心理教育与测量》(海峡两岸教育与心理测量学术研讨会论文集) 张厚 餐主编 浙江教育出版社 1997年版
《现代教育与心理测量学原理》 漆书青 戴海崎 丁树良编著
江西教育出版社 1998年版
《心理教育测量》 戴海崎 张锋 陈雪枫主编 暨南大学出版社 1999年版
外文参考书目:Anastasi, A.: Psychological Testing, New York: Macmillan,1988
Aiken, L. R.: Psychological Testing and Assessment, Allyn and Bacon, Inc. 1985
结束
Finished