病例对照研究
(case-control study)
1. 基本原理
2. 研究类型
3. 实例
4. 实施
5. 应考虑的问题
6. 资料整理与分析
7. 偏倚及其控制
8. 优缺点
第一节 基本原理
过去 现在
比较 人数 暴露
a/(a+c) a
c
b/(b+d) b
d
病
例
对
照
+
-
-
+
• 病例对照研究(case control study):以一组患有某病
者(病例)和一组或几组未患该病但在某些已知因素
方面与病例组相似者(对照)为研究对象,调查他们
过去是否暴露于某个或某些可疑致病因素或暴露剂量,
比较两组暴露比值,推断研究因子作为病因的可能性。
• 暴露(exposure):指研究对象接触某些因素,或具
备某些特征,或处于某种状态。
• 暴露因素(exposure factor):可以是机体固有的、先
天的,也可以是体外的、后天的,暴露因素也叫研究
变量(variable)。
• 混杂与混杂因素(confounding and confounding
factor):研究某因素与某疾病关联时,由于某个既与
疾病有制约关系,又与所研究的因素有联系的外来因
素的影响,掩盖或扩大了所研究的因素与疾病的联系,
这种现象或影响叫混杂,其所带来的偏倚叫混杂偏倚,
该外来因素叫混杂因素。
二、研究类型
(一)不匹配:对照数目与病例相等或略多
(二)匹配(matching):要求对照在某些因素上与病例保持一致。
如年龄匹配
1、频数匹配(frequency matching):匹配因素所占比例在病例
组和对照组一致。如病例组男女各半,平均年龄56岁。对照组亦
应如此(无显著性差异)。
2、个体匹配(individual matching):病例和对照以个体为单位
进行匹配。
目的:提高研究效率(study efficiency)
匹配因素:已知或疑为混杂因子(confounding factor)
常见匹配:1:1(配对);1:2;……1:R
匹配过度(over matching):匹配增加了对照选择的难
度,把不必要项目列入匹配,丢失了信息,降低了研
究效率。
匹配程度:连续变量可划分为若干组,按组匹配;离散
变量可完全匹配。
两种因素不能匹配:
(1)研究因素和中间变量:
吸烟——→血脂血脂↑——→心血管病
(2)只与可疑因素有关而与疾病无关的因素
避孕药——→子宫内膜癌
↑
↓
宗教宗教
(三)巢式病例对照研究(套迭式;嵌入式)
(nested case-control study):通过队列研
究,确认随访时发生的病例,作为病例组,以
同一队列的未发病者为对照。
优点:(1)暴露资料在发病或死亡前获得,
时间顺序清楚,无回忆偏倚。
(2)两组可比性好
(3)可提高统计及检验效率
暴露率高;共同暴露开始时间
缺点:只能比较暴露的等级
例:Kent(1988):血胆固醇与癌症
第二节 研究实例
Herbst关于年轻女性阴道腺癌的研究
• 美国波士顿Vincent记念医院,1966-69年发现7例年轻女性阴道腺癌
• 该病为罕见病:占女性生殖系统癌症%%,50岁以上多见
• 怀疑因素:使用阴道局部刺激物、阴道冲洗、阴道塞史;性交史;
避孕药应用史,均无意义。
• 重新研究目的:用病例对照研究比较病例从胚胎期至发病前的情况。
• 研究对象:7例加1例另一医院的阴道透明细胞癌患者。
• 1:4配对:要求对照与病例在同等级病房中出生,时间前后≯10天
• 使用统一调查表,培训调查员
• 结果:此次怀孕流血、以往流产史及此次怀孕使用雌激素史三个因
素有显著意义。
• 结论:母亲怀孕早期服用保胎药已烯雌酚使其女儿发生阴道腺癌的
危险性增加。
第四节 病例对照研究的实施
(一)提出假设:可发现或检验病因线索
(二)明确目的,确定对照形式:
不匹配或频数匹配:探讨病因线索
个体匹配:提高统计效率,适于罕见疾病
对照数目:按Pitman效率递增公式:
效率=2R/(R+1) 1:1时,效率=2×1/(1+1)=1
1:2时,效率=2×2/(2+1)=
1:3时,效率=
1:4时,效率=
1:4以上,效率增加缓慢,但对照选择难度增加,故≯1:4
(三)研究对象选择
1、病例:
(1)以医院为基础(hospital-based):某期间内全部门诊
或住院病人;病案及出院记录
(2)以社区人群为基础(community-based):社区的监测、
普查、抽样调查中发现的病例
注意:明确的诊断标准(国内外统一;自定);与对照的
可比性(性别、年龄等);新发、现患、死亡病例
2、对照:(理想:全人群或非病人群的随机样本
现实:病例的定义可确定其源人群,对照应为病例源人群
的随机样本)
(1)同一或多个医院其他病人:那些与暴露没联系者
吸烟与肺癌:排除呼吸道疾病入院者做对照
(2)人群对照(社区、社团非病例或健康人):随机抽样;
随机数字拨号
(3)朋友、同事、亲属及死亡对照
(四)样本含量的估计(size of sample)
1、影响因素
(1)对照组的暴露率(P0)
(2)估计的RR或OR
(3)希望的显著性水平(a= or =)
假阳性错误(false positive error)或称第一类错误(type I error)
即由于判断失误,从而拒绝了原本正确的无效假设。在统计推断
上指允许犯假阳性的概率。1- a 称为精确度。
(4)希望的把握度(power)或称功效,(1-
b)
• b为假阴性错误(false negative error or type II error),指由于统
• 计量(t)没有超过显著水平,从而接受了原本不正确的无效假设。
2、计算
(1)非匹配设计:病例数=对照数
例:吸烟与肺癌,预期RR=,人群吸烟率(p0)=20%,
定:a=(双侧)b= 查表得: Ua= Ub=
p1=(×2)/(1+×1)=
=(+)/2= ==
n=2××(+)2/)2
=232 (查表得:n=229)
(2)非匹配调查:病例数≠对照数
设:病例数:对照数=1:c; 则病例数为:
p1计算同上式;对照数=cn
(3)1:1配对设计:Schlesselman公式:
总对子数:M≈m/(p0q1+p1q0) m为结果不一致的对子数
p0;p1为目标人群中对照组和病例组估计暴露率
例:研究口服避孕药与先天性心脏病的关系,设a=(双侧),
b=;对照组暴露比例p0=;预期RR=
求:需要的总对子数?
解:查表得: Ua= Ub=
p1=P0RR/[1+p0(RR-1)]=×2/[1+(2-1)]=
p=RR/(1+RR)=2/(1+2)=2/3=
q1=1-p1==
q0=1-p0==
总对子数:M≈m/(p0q1+p1q0)
=90/(×+×)=186(人)(196)
(五)获取研究因素的信息
1、变量的选定:与目的有关的变量不能少与目的有关的变量不能少,且要细致(吸烟:
量、时间、种类、方式、戒烟时间等);无关的项目不能有无关的项目不能有。
2、变量的规定:明确规定,统一标准(吸烟者:每天吸烟至少
一支,持续一年以上者)
3、变量的测量:定性(是、否);半定量(经常、偶尔、不);
定量(平均每周几次?平均每次多少?)
4、使变量符合规定:以客观手段与证据为准绳(病情用医疗档
案核准;职业史以工厂档案核准;空气、水污染用检测结果核准;
吸烟量由亲属核准等)
(六)资料收集
调查问卷;查阅档案;采样化验;实地查看等。
第六节 资料分析
一、原则(目的)
1、比较两组暴露比例有无显著性差异
2、用暴露优势比估计患病优势比(联系强度)
3、控制混杂因素:匹配匹配;分层;多因素分析
二、方法
(一)描述性分析
1、研究对象的一般特征
2、均衡性检验
(二)推断性分析
• 分析类型:
不分层资料
非个体匹配资料
分层资料
1:1配对
个体匹配资料 1:2配对
1:M配对
分级暴露资料
多因素分析
• 病例对照研究中表示联系强度的指标
比值比( 比数比; 优势比; 交叉乘积比; odds ratio; OR ) :病例组暴
露比值与对照组暴露比值之比。
病例组暴露比值: 对照组暴露比值:
比值比:
OR取值为0~∞,OR>1为“正”关联,说明发病危险度增大;
OR<1为“负”关联,说明发病危险度减少。
OR≈RR的条件:1)良好的代表性
2)人群疾病频率较低(<5%)
•OR与RR之关系
病例对照研究资料整理表 队列研究资料整理表
暴露 疾病 .
病例 对照 合计
+ a b a+b=n1
- c d c+d=n0
合计 a+c=m1 b+d=m0 t
暴露 疾病 .
病例 非病例 合计
+ a b a+b=n1
- c d c+d=n0
合计 a+c=m1 b+d=m0 t
当人群疾病频率很低时,可将RR计算公式中 a/(a+c)和b/(b+d)中分
母的 a, c忽略不计,即: a+b→ b;c+d→d; 则:
因此,OR≈RR的条件:1)良好的代表性
2)人群疾病频率较低(<5%)
相对危险度(RR)与关联强度
(Monson RA, 1980)
RR(OR) 关联强度
~ ~ 无
~ ~ 弱
~ ~ 中等
~ ~ 强
< >10 很强
1、非个体匹配不分层资料
(1)整理表格
表5-5 口服避孕药(OC)与心肌梗死(MI)关系
(2)显著性检验
c2=(ad-bc)2n/(a+b)(c+d)(a+c)(b+d)=
(1)=< P<
OC 病例 对照 合计
+ 39(a) 24(b) 63(n1)
- 114(c) 154(d) 268(n0)
合计 153(m1) 178(m0) 331(t)
(3) 计算并检验联系强度
计算 OR=ad/bc=
检验(Woolf 的logit近似法)
Z值的判定标准: Z P
> <
> <
> <
本例: Z=> P<
(4)OR可信区间(confidence interval,,CI)
1)Woolf法:
本例:Var(lnOR)=
OR95%CI=±×
=~
OR95%CI =exp(; )
=~
2)Miettinen法:
本例:
2、非个体匹配分层资料
1)特点
(1)可评价分层因素本身作用及其与暴露之关系
(2)离散变量可完全控制分层因素的混杂作用,连续变量取决
于分层程度
(3)简单易行,一目了然,并帮助正确设计多因素模型
(4)缺点是丢失效率,分层太多,层中例数会出现 “零”
2)资料整理
表5-6 病例对照研究分层资料整理表
暴露特征 第 i 层的发病情况 合 计
病例 对照
+ ai bi n1i
- ci di n0i
合计 m1i m0i ti
表5-7 口服避孕药与心机梗死关系病例对照研究按年龄分层分析
(3)计算各层OR:
OR1=(21×59)/(26 ×17)=
OR2=(18 ×95)/(88 ×7)=
可见两层OR值均较不分层时大。
<40 ≥40岁 .
服OC 未服OC 合计 服OC 未服OC 合计
病例 21(a1) 26(b1) 47(m11) 18(a2) 88(b2) 106(m12)
对照 17(c1) 59(d1) 76(m01) 7(c2) 95(d2) 102(m02)
合计 38(n11) 85(n01) 123(t1) 25(n12) 183(n02) 208(t2)
分层OR值的齐性检验(Woolf法)
1、计算各层ORi、lnORi、Var(lnORi)、wi:
Var(lnORi)=1/a+1/b+1/c+1/d
wi=1/ Var(lnORi)
2、进行c2检验:
n为层数; 自由度为n-1
表 OR齐性检验资料整理表
计算总OR的:
ORw==
计算总OR的标准误:
计算总OR95%CI:
ORw95%CI=×~+×=~
层次 ORi lnORi Var(lnORi) wi
1 1/21+1/26+1/17+1/59=
2 1/18+1/88+1/7+1/95=
作c2检验:
• (1)=< P<
• 结论:各层间的OR值差异显著,说明两个资料不同质,
总OR值不能说明年龄、口服避孕药及心肌梗死的关系。
因此计算总OR值无意义。
进一步分析非暴露组年龄与MI及对照组年龄与OC之关系
表5-8 年龄与MI之关联
OR=;c2=
说明年龄与心肌梗死有联
系(小年龄有保护作用)。
∵∵年龄不是年龄不是OCOC和和MIMI的中间的中间
环节环节
表5-8 年龄与OC之关联
OR=;c2=
说明年龄与口服避孕药
也有联系。
∴∴年龄是研究年龄是研究OCOC与与MIMI关系关系
时的混杂因素时的混杂因素
<40岁 ≥40岁
MI 26 88
对照 59 95
<40岁 ≥40岁
OC 17 7
对照 59 95
(4)计算总OR值: Mantel-Haenszel公式:
本例:ORMH=
(5)计算总c2值:Mantel-Haenszel公式:
其中I为总层数,i 为第几层
本例 = u=处理组-1=4-1=3 P<
(6)估计总OR值95%CI
(7)计算标准化OR值:各层间OR值相差很大时,计
算标准化死亡比(standard mortality ratio, SMR)
或标准化率比(standard rate ratio, SRR),来说
明暴露组与非暴露组死亡率或发病率之比值。
分层分析的过程总结
每层OR
异质
齐性检验 标化OR
同质 总ORMH
OR不等 非暴露组混杂因素
粗分析 分层分析 与疾病之关系
(OR、c2) 是否混杂
OR相等 对照组混杂因素与
研究因素之关系
结论 混杂 方向及大小
?
3、分级暴露资料
(1)资料整理
表5-11 男性每日的吸烟支数与肺癌之关系
c2= n=3 P< ( R×C表卡方检验)
暴露 每日吸烟支数 .
水平(Xi) 0(X0)~ 1(X1)~ 5(X2)~ 15(Xt)~ 合计
病例ai 2(a0=c) 33(a1) 250(a2) 364(a3) 649(n1)
对照bi 27(b0=d) 55(b1) 293(b2) 274(b3) 649(n2)
合计mi 29(m0) 88(m1) 543(m2) 638(m3) 1298(n)
OR
(2)作R×C表卡方检验
(3)计算各分级的OR值:
例:Xi=5~ OR=(250 ×27)/(293×2)=
(4)进行趋势卡方检验(自由度为1):
Xi : 取每个暴露水平的中点值;第i 暴露水平
的Xi=i (如:X0=0;X1=1;X2=2;…)
(但是,Epi Ifo的取值为每个暴露水平的初值,
本例为X0=0;X1=1;X2=5;X3=15)
本例:(按Epi Info 计算)
T1 =6743; T2 =12373; T3 =7587649;
V =
c2 =
P <
(按Xi=i计算,c2 =)
4、1:1配对资料分析
(1)资料整理
表5-13 外源性雌激素与子宫内膜癌的关系
对照 病例 对子数
有暴露史 无暴露史
有暴露史 27(a) 3(b) 30(a+b)
无暴露史 29(c) 4(d) 33(c+d)
对子数 56(a+c) 7(b+d) 63(n)
(2)卡方检验:McNemar公式
大样本: c2 = (b-c)2/(b+c)
小样本: c2 = (|b-c|-1)2/(b+c)
本例: c2 = (|b-c|-1)2/(b+c)=
P <
(3)计算OR值: OR=c/b (b≠0)
本例: OR=
(4)计算OR95%CI:Miettinen法
本例: ORL~ORU=~
5、1:2配对资料的分析
(1)资料整理
表5-14 18个“对子”人工流产史与宫外孕关系
(2)计算OR值: OR=(b+2c)/(2d+e)= 16
(3)c2检验:
对 照 .
++ + - - -
+ 1(a) 6(b) 5(c)
病例
- 0(d) 1(e) 5(f)
宫外孕
人流史
式中: b的期望值: E(b)=2/3(b+d)=2/3(6+0)=4
c的期望值: E(c)=1/3(c+e)=1/3(5+1)=2
b的方差: V(b)=2/9(b+d)=
c的方差: V(c)=2/9(c+e)=
自由度=1, P <
(4)OR95%CI =
6、病因分值( etiologic fraction,EF)
( 1)暴露人群:(归因危险度百分比 attributive risk proportion,
ARP, AR%)
AFe =ARP=AR%= (Ie – Iu)/Ie = (OR-1)/OR
I:发病率;e:暴露人群 u:非暴露人群
暴露人群中因暴露于某因素引起的发病占全 部病例的比例。如
HBsAg携带者与肝癌关系研究表明,AFe=%,说明表面抗原阳性者中
发生的肝癌数占该组人群全部肝癌数的%。
(2)总人群:(人群特异危险度百分比 population attributive risk
proportion, PARP, PAR%)
AFp =PARP=PAR%=(Ip – Iu)/Ip = Pe(OR-1)/1+Pe(OR-1)
Pe:总人群暴露率(用对照组代替)
7、多因素分析
• Logistic回归模型(Logistic regression
model)
条件 (conditional):个体配对病例对照研究
非条件 (unconditional):非个体匹配病例对照研究
• Loglinear回归模型
第七节 偏倚(bias)及其控制
一、选择偏倚
(一)入院偏倚(Berkson):对照为部分病人;病例为特
定病例;医院、病人双向选择(( 随机;多医院选择对象)随机;多医院选择对象)
(二)现患病例-新发病例偏倚(Neyman bias):存活旧病
例的信息只与存活有关 ;或病例改变习惯(新发病例)(新发病例)
(三)检出征候偏倚(unmasking bias):因某些与致病无
关的症状就诊,提高了早期病例检出率,过高的估计了暴
露程度
(四)时间效应偏倚(time effect bias):慢性病,即将发
病者、已有早期病变但未检出、已有病变因监测手段未检
出从而划入对照组(用敏感检查技术;长期纵向观察)(用敏感检查技术;长期纵向观察)
二、信息偏倚(information bias; 观察或测量偏倚)
(一)回忆偏倚(recall bias):调查和事件时间间隔、事
件重要性、被调查者构成、调查技术等造成回忆失真。
病例回忆比对照准确但容易夸大。(选择重要指标;(选择重要指标;
问卷设计;调查技巧)问卷设计;调查技巧)
(二)调查偏倚(investigation bias):来自调查者和被调
查者:调查环境;对调查的态度;诱导偏倚(客观指(客观指
标;调查员培训;同环境、检查手段、时间、调查员)标;调查员培训;同环境、检查手段、时间、调查员)
三、混杂偏倚(confounding bias):由于混杂因子的影响
造成(匹配;分层;多因素分析)(匹配;分层;多因素分析)。
混杂与混杂因子(confounding and confounding factor):研
究某因素与某疾病关联时,由于某个既与疾病有制约关系,又与
所研究的因素有联系的外来因素的影响,掩盖或扩大了所研究的
因素与疾病的联系,这种现象或影响叫混杂,其所带来的偏倚叫
混杂偏倚,该外来因素叫混杂因素。
第八节 病例对照研究的优缺点
• 相对队列研究
(一)优点
1、适用于罕见病的研究
2、相对省力、省钱、省时,易于实施
3、应用广泛,如疫苗免疫学效果考核和爆发研究
(二)缺点:
1、不适合研究人群中暴露比例很低的因素
2、难以避免选择偏倚和回忆偏倚
3、难以判断暴露与发病的时间先后
4、结论说服力较弱