人类遗传统计基础——
术语、概念、基础统计
2004年10月,北京
常用术语与概念
染色体(chromosome,46条,23对同源染
色体(homologous chromosome))
有丝分裂(mitosis): DNA复制形成姐妹染色单
体(chromatid)→姐妹染色单体分开进入新细
胞。
减数分裂(miosis): DNA复制形成姐妹染色单
体→同源染色体配对(四倍体)、交换→“同源
染色体”分开进入新细胞→“姐妹染色单体”
分开形成配子进入新细胞。
单倍型(haplotype):一条染色体上不同基因座上
来自同一个亲体的基因排列。
遗传密码:DNA链上不同的碱基排列。为了
编码20种氨基酸,需要最少3个碱基组成1个
序列片段,称三联体密码 (tripletcode)。
每个三联体 (如 AAA)在 mRNA上的副本
(UUU)称为一个密码子(codon)。地球上所有
生物都具有统一的遗传密码。同一氨基酸可
有好几个密码,密码子的专一性主要由前两
个碱基决定。64个密码中61个都对应了相应
的氨基酸,其中一个(AUG,对应甲硫氨酸的
唯一密码)兼具起始密码功能,另有3个终止
密码(UAA、UAG和UGA)。
基因(gene):完成特定功能的一段核苷酸序列。
基因座(locus):基因在染色体上的位置
等位基因(alleles):同一位点上可能出现
的基因,例如ABO血型基因
基因型(genotype):同一位点上两个等位基
因的组合
纯合体(homozygote): 如A/A
杂合体(heterozygote): 如A/O
表现型(phenotype):基因型控制的性状
表现型与基因型并非一一对应关系。
单基因性状:由单个基因控制的性状。
这些性状之间的差别明显,一般没有中
间过渡类型,呈不连续变异(质量差异)
, 称 为 质 量 性 状 ( qualitative
character)。如单眼皮/双眼皮,卷舌,
用手习惯,卷发/直发,血友病、色盲
等。单基因性状属于孟德尔式遗传。
多基因性状:由多个基因共同控制的性
状。这些性状的变异有一系列过渡类型
彼此间只有数量的差别,没有明显质的
界限,呈连续变异。因此,多基因性状
又称为数量性状(quantitative
character)。人类性状多是数量性状
(如智力、身高、肤色、冠心病、消化
性溃疡等)。
多基因遗传:一种遗传性状的表达受两
对或两对以上基因的控制,各对基因彼
此间没有显性隐性关系,每对基因对表
型的效应都很小,各对基因的作用有积
累效应。
多基因遗传的特征:1)纯合亲本->F1
的表型一般是双亲的中间类型。2)F2
个体的表型平均值大体上与F1相近,但
变异幅度显著增加。3)含有环境效应。
环境因子数目越大,变异越接近正态分
布。4)当双亲不是极端类型时,其子
女可分离出高于高亲值或低于低亲值的
类型,称超亲遗传。
基因频率(allele frequency):人群中一
个等位基因占该位点全部基因的比例
基因型频率(allele frequency):人群中
特定基因型占该位点全部基因型的比例
基因多态性(polymorphism):一个位点上
等位基因频率中最大值不超过95%
孟德尔第一定律(独立分离):得到父母2
等位基因之一的概率为1/2
孟德尔第二定律(自由组合):不同染色体
上的等位基因传递独立:
P{→AB|AaBb}=P{→A|Aa}× P{→B|Bb}
哈代—温伯格平衡:无迁移、选择、突变,
群体中的基因频率和基因型频率保持不变。
P(A)=p , P(B)=q , P(O)=r
全部:(p+q+r)2
(近交系数F一般<)
遗传漂变: 有限群体中,除迁移、选择和突变
外,基因库中仅部分个体贡献下一代配子,
这种因抽样产生的随机性导致下一代基因频
率变化。
有效群体:群体中生育年龄个体数。
有效群体大小:N=4MF/(M+F)
例:达到生育年龄男性50,女性200
N=4×50×200/(50+200)=160
ABO血型基因型与表现型
基因型
表现型
A型 B型 AB型 O型
A/A 1 0 0 0
A/B 0 0 1 0
A/O 1 0 0 0
B/B 0 1 0 0
B/O 0 1 0 0
O/O 0 0 0 1
白人4种ABO基因的基因型与表现型频率
(基因频率a1:, a2:, b:,
o:)
基因
型
表 现 型 基因型
频率A1 A2 A1B A2B B O
a1/a1
a1/a2
a1/b
a1/o
a2/a2
a2/b
a2/o
b/b
b/o
o/o
1
1
0
1
0
0
0
0
0
0
0
0
0
0
1
0
1
0
0
0
0
0
1
0
0
0
0
0
0
0
0
0
0
0
0
1
0
0
0
0
0
0
0
0
0
0
0
1
1
0
0
0
0
0
0
0
0
0
0
1
表现型
频率
1
隐性(recessive)
显性(dominant)
共显性
(codominant)
表现型 基因型 基因型
频率
A AA
AO
P2
2pr
B BB
BO
q2
2qr
O
AB
OO
AB
r2
2pq
交叉(crossover)、互换:减数分裂中
同源染色体配对4条染色单体之间,
一次减数分裂至少一次交叉
重组(recombination) :奇数次互换
导致一个重组
重组率θ(recombination fraction)
:
● 无连锁→θ=1/2
● 连锁 →θ<1/2
● 连锁分析需家系资料
● 亲体须双杂合体才可能有信息
● 男女亲体θ不同
◆回交(backcross)/测交
(testcross)Aa×AA/aa
◆杂交(intercross)
(仅对2 alleles适用)
◆重组体(recombinant)
◆非重组体
(nonrecombinant)
◆有连锁信息的条件:至
少一个亲体为双杂合个体
(double
heterozygote)
遗传度(heritability):遗传因素在性状表
现中所起作用的大小。如果性状变异完
全由环境因素造成,遗传度等于零。如
果性状变异完全取决于遗传因素,则其
遗传度为100%。
参与遗传机制的基因可以是1个、2个、
几个和多个。遗传性状可以是定量、定
性的。对定性形状,假定存在一个定量
的“易感性”,当其超过阈值时“发病
”(多基因阈值性状)。
一些估算遗传度的公式:
◇双生子资料:h2=2(ρMZ-ρDZ)
◇父母子女资料:h2=2ρ父子
◇亲属(无父母)资料: ANOVA=>ρL => h
2
ρL=(MSb-MSw)/[MSb+(n-1)MSw]
h2=2ρL
◇流行资料(prevalence data):根据人群
患病率Bp和患者直系亲属患病率Bo计算,
h2=2Bp[t-X(Bo)]/f(t)
t=X(Bp), X(y)=Φ-1(1-y), f(t)=φ(t)
分离分析: 检验家庭数据的遗传模式。估
计分离率τ,比较与期望分离率的吻合
度
常染色体显性遗传:单基因,等位基因
A/a, A致病,p(A)=p≈0,各婚配孟德尔
τ :
婚配型 AA Aa aa 患病率
AA*AA 1 0 0 1
AA*Aa 1/2 1/2 0 1
AA*aa 0 1 0 1
Aa*Aa 1/4 1/2 ¼ 3/4
Aa*aa 0 1/2 ½ ½
aa*aa 0 0 1 0
最可能出现的婚配型是Aa*aa,一个子
女患病一个不患病信息量最大,通
常假定为Aa*aa型,患病子女数X服
从二项分布b(n,τ) ,欲检验τ=1/2,
计算 χ2 =4[∑ri-n/2 ]2/n ν=1
n: k个家庭子女总数, ri: 家庭i患病子
女数
n: k个家庭子女总数, ri: 家庭i患病子
女数
例: 乳光齿质症,亲本之一患病,共调
查112子女,其中52人患病,
χ2 =4[52-112/2 ]2/112=
<p<
该病可能属常染色体显性遗传(单基
因)
常染色体隐性遗传: 单基因,孟德尔分
离率τ=1/4。按最大似然方法估计τ,
再与1/4比较。一般计算复杂,借助计算
机程序实现。
◆图距x:位点间的遗传距离,可转换成
θ
◆遗传图谱:已知图距的基因排列
x∝θ: θ=6% → x=6cM(Morgan)
(1cM=1000kb, 1kb=1000核苷酸对)
◆图距函数:x与θ的关系
Haldane:x=(1-2θ) 0≤θ<
x=∞ 其他
Kosambi: x=-1(2θ)
1-3位点,x12+x23→ θ13→x13
◆连锁群:1→2 →3 →...
◆多态性程度:
1. 杂合率(hiterozygosity)
H =1-Σpi
2 pi :第i个allele频率
Hu=H• n/(n-1)
ABO基因频率,,
H=1-=
◇ 考虑近交:(1-F)H 一般 F<
◇ a个等概:H=1-Σpi
2 =1-1/a
a=1/(1-H), 例:H=, a≥10
2. 多态信息量PIC
PIC =1-Σpi
2 -ΣΣ2(pi pj )
2
ABO基因频率,,
PIC=1--2(
)2-2()2 =
◇ 对max≤95%的多态性定义,有:
H ≥ , PIC ≥
◇ 突变率∝ H/(1- H)
似然函数
◆似然函数L:观察到手头样本F的概率。
对二项分布,p(A)=p, p(a)=1-p, 观察到
“k/n”(记为F)的概率为:
P(p,F)= P(p,n,k)= Cnkp k (1-p) (n-k)
例如n=4,k=1,p=,
P(p,F)= C41 =
如果 p=
P(p,F)= C41 =
◆ L随F和分布(参数)而变
似然函数与最大似然估计
◆分布常参数化为θ,似然函数写成L(θ,F)
二项分布, θ=p, F表示为(n,k)
L(θ,F)= P(p,n,k)=Cnkp k (1-p) (n-k)
F已知,L(θ,F)是θ的函数,“给定θ下的概率
”。
◆ θ 的最大似然估计:使L(θ,F)最大化的θ.
对上述例子(n=4,k=1, 二项分布,θ =p)
:
θ (p)
L(θ,F)
最大似然估计
◆ MLE的计算:对[მL(θ,F)/მθ]=0
求解
一般,令 {მ ln[L(θ,F)]/მθ}=0
对上述二项分布例子(n=4,k=1,θ =p):
L(θ,F) = L(p,F) = Cnkp k (1-p) (n-k)
= 4p(1-p)3
Ln[L(p,F)] = ln(4)+ln(p)+3ln(1-p)
令 {მ ln[L(p,F)]/მp}=1/p-3/(1-p)=0 ⇒
1=4p ⇒ θ 的MLE为。
★ MLE的单调变换仍是MLE
(例如Ӫ2 →θ2 )
★ MLE一般是有偏的
★ MLE一致(渐近无偏)、渐近正态
假设检验
实例:3例死亡1例,一般病死率57% → “
疗效好”。 1/3< ?
以为真病死率,100个n=3的样本:
d/n N样本 病例数 病死数
3/3 19 57 57
2/3 41 123 82
1/3 32 96 32
0/3 8 24 0
合计 100 300 171
总病死率=171/300=57% ,但1/3样本有32
个,0/3样本8个,共40个,占40%
→ 样本可能是这40%中之一
→ 结论有问题
★ 想证实疗效好(H)
★ 收集数据→ 作结论
? 结论没有考虑数据对H的支持程度
科研工作一般步骤:
★ 研究者的科学假设H
★ 进行试验得到样本数据S
★ 根据S对H的支持程度做出推断
假设检验——概率意义的“反证法
”
★ 先设立H的对立假设H0 (H记为H1)
★ 把H0下的样本空间Ω划分为拒绝域R
与接受域A (Ω =A∪R, A∩R=φ)
★ 观察样本S :落在A(或R)中?
★ 根据S位置进行推断:
接受H0,当S∈A;
拒绝H0 ,当S∈R 。
划分A和R的依据(Ω=A∪R,A∩R=φ)
α=p(R | H0) ; α很小, R | H0为小概率事
件,如果H0真,一次试验中{R |H0}一般
不会出现
实际实行:S → 统计量T ∈Π, T的分布
已知, 划分Π↔划分Ω
当T为t → t检验,Π=(-∞,∞),
A= (-t α ,t α), R={|t|≥t α}
似然比检验
◆ T(θ)=supL(θ,F)/supL(θ0,F)
如果H1真,则T(θ)倾向于大。当
T(θ)≧Tc时否定H0 ,Tc满足:
p(T(θ)≧Tc|H0)=α
按切贝雪夫不等式
p(T(θ)≧Tc|H0)≤1/Tc
∴ α ≤ 1/Tc
β=p(T(θ)<Tc|H1)
似然比检验
◆例:5个重组事件,1个重组型,θ= ?
H0:无重组(θ=), H1:θ=
T(θ)=×
若取α=, ⇒ Tc=20 ⇒ T(θ)<Tc
⇒ 不能否定H0 。
◆P值(经验显著水准) =p(T>T(θ)|H0)
上例,T(θ)=,
P值≈1/=
◆支持函数:(对数)似然函数。
◆似然方法:不光是MAX(L(θ,F))(似
然比检验时只考虑H0下似然比的分布),
而是直接根据L(θ,F)推断。
◆区间估计:…,连锁分析一般不做
◆支持区间:比似然函数曲线最大值小m
个单位处画一条横线,其与似然函数曲
线的两个交点对应了两个θ值,它们构
成“m单位支持区间”。一般取m=2。
◆Bayes定理:A,B1,…,Bn,已知p(A|Bi)
和p(Bi),欲计算p(Bi|A)
p(Bi|A)=p(BiA)/p(A)
=p(A|Bi)p(Bi)/Σp(A|Bi)p(Bi)
例:稀有显性病,致病等位基因频率为
p, E1:”患病父/母为纯合子”,
E2”杂合子”,n个子女患病(F)条
件下,患病父/母为纯(杂)合子的后
验概率?
E1的(非条件)概率为p2, E2为2p(1-
p),E1的相对概率(前概率) p2/(p2+2p
(1-p))=p/(2-p)
欲求后概率p(E1|F)、p(E2|F)
E1 E2 Sum
前概率 p/(2-p) (2-2p)/(2-p) 1
F条件概率 1
联合概率 p/(2-p) (1-p) -1 2-p
p+(1-p)-1
2-p
后概率 2
n-1p ִ
2n-1p+1-p
1-p ִ
2n-1p+1-p
1
if n=3 4p ִ
1+3p
1-p ִ
1+3p
1
连锁分析基础
◆基因连锁(linkage):同一染色体上
两个位点的等位基因一起传递的现象。
例如基因型AB|ab,形成AB和ab两种配
子。(若交换则形成 Ab和aB称重组体)
◆连锁分析:根据家系资料估计θ,后
者可用以分析基因座之间的图距。
◆θ= ≈> 1图距或1分摩(cM),一般图
距<25cM时这种近似线性关系成立。
◆连锁平衡(linkage equilibrium):
两个基因座上的等位基因独立。否
则称连锁不平衡(disequilibrium)
◆连锁不平衡参数δ=p(AB)-p(A)p(B)
◆若初始δ0≠0,n代随机婚配后δ变
为:
δn =(1-θ)
n δ0
当θ=1/2,很快达到平衡
连锁分析方法
◆直接法:重组事件k/n,直接用k/n估θ
,可按二项分布计算可信区间。
问题:须确知父母基因型,但即使是已
知型双杂合体父母,也有时不能明确判
断重组。
◆Y统计量:重组事件k/n,给定双杂合
体父母相后,y=k(n-k)只随θ而变。
θ=1/2时最大,θ=0时为0。Y统计量的
效力低于最大似然估计。
◆同胞对法(Penrose):依同胞两性状异
同检验连锁。例:W,T为基因型WW,Ww及
TT,Tt的表现型,父母婚配为WT×wt,两
个子女可能的基因型组合有10种:
同胞1 同胞2 同胞1 同胞2
WT WT WT wT
Wt Wt WT wt
wT wT Wt wT
wt wt Wt wt
WT Wt wT wt
可归4类,做成四格表如下:
若不连锁,则4个格子里的频数应差不多
一样,可按四格表χ2检验法进行检验。
未考虑父母基因型,低效。
◆受累同胞对(ASP)法:见后
性状2同 性状2不同
性状1同 A B
性状1不同 C D
◆最大似然法:max T(θ) (似然比)
改变θ∈[0,1/2],找到极大化T(θ)者为MLE。
可信区间:困难,一般计算支持区间(见后)。
◆u统计量法:两代家系,仅对松散连锁有效
◆似然分数法:LOD(Z(θ)),是似然比
T(θ)的常用对数。
Z(θ)= log10[T(θ)]
= log10[L(θ,F)/L(θ0,F)]
不一定最大化Z(θ),而是计算一系列
Z(θ)
例:腺瘤样息肉,显性遗传(Ff),标记等位基因
1或2。祖父是纯合体f2/f2,祖母患病已死,子
女患病/未患病→祖母疾病基因型Ff,子女标
记基因有12/22,→祖母标记基因型12。但祖母
可能有2相, Ⅰ:F1/f2, Ⅱ:F2/f1。Ⅰ相⇒4个
非重组型,Ⅱ相⇒4个重组型。两相按等概处
理:
L(θ)=(1-θ)4 /2 +θ4/2=[(1-θ)4 +θ4]/2
似然比统计量T(θ)=L(θ)/L(1/2)=8[(1-
θ)4+θ4]
Z(θ)=log10[8]+log10[(1-θ)
4+θ4]
若θ=,Z(θ)=
例:疾病位点等位基因记为1,2和3,标记
位点是HLA(等位基因a,b,c,d)或ABO血
型(等位基因A,B,O)
--------------------------------------------
个体 表现型 可能的基因型 --------------------------------------------
父 1/3;a/b I:1a/3b II: 1b/3a
母 3/3;c/d 3c/3d
子 3/3;a/c 3a/3c
女 3/3;b/c 3b/3c
--------------------------------------------
父I型下子重组,II型下女重组,似然函
数为L(θ)=θ(1-θ)/2+(1-θ)θ/2=θ(1-
θ)
L(1/2)=1/4⇒ Z(θ)=log[4θ(1-θ)]
--------------------------------------------
个体 表现型 可能的基因型 --------------------------------------------
父 ━ I:1a/3b II: 1b/3a
母 3/3;c/d 3c/3d
子 1/3;a/c 1a/3c
女 1/3;b/c 1b/3c
女 3/3;a/d 3a/3d
--------------------------------------------
父表现型未知,通过其他成员得其可能的基因
型。I型下2重组,II型下1重组,似然函数:
L(θ) =θ2(1-θ)/2+(1-θ)2θ/2
=θ(1-θ)/2
L(1/2)=1/8⇒ Z(θ)=log[4θ(1-θ)]⇒
此3子女信息量与上面2子女同
-------------------------------------------
个体 表现型 可能的基因型 -------------------------------------------
父 1/3;O 1o/3o
母 1/3;A I: 1a/3o II: 1o/3a
子 1/3;O 1o/3o
子 1/3;O 1o/1o
子 3/3;A 3a/3o
--------------------------------------------
因子有O型血,故母亲杂合。I下若1st子的1o来
自母亲则为重组,来自父亲为非重组,II型下反
之。给定任意1型,其概率为:
[θ/2+(1-θ)/2]/2=1/4,是常数,在LOD里消掉,
无信息贡献。次子与三子在I型下重组。
L(θ) =θ2/2+(1-θ)2/2=[θ2+(1-θ)2]/2
Z(θ)=log2+log[θ2+(1-θ)2]
----------------------------------------------------------
个体 表现型 可能的基因型 ----------------------------------------------------------
父 ━ p2:3a/3o 2p(1-p): 3a/xo或3o/xa
母 1/1;O 1o/1o
女 1/3;O 3o/1o
子 1/3;A 3a/1o
子 1/3;O 3o/1o
----------------------------------------------------------
父的ABO基因必是a/o,疾病位点只考虑3,把
其他并为“x”。记3的基因频率为p,有3种可能
的基因型:1: 3/3,此时3个子女基因型出现概
率为1/2,条件似然Lc为1/8,无连锁信息。此
情形出现的概率为p2。2: 3/x,若3a/xo,则长子
非重组,其余2子女重组,Lc=θ2(1-θ)/8;
3o/xa下反之, Lc=θ(1-θ)2/8 。加总得
Lc =θ (1-θ)/16,其概率2p(1-p)。
把条件似然按概率加权求和得到:
L(θ)=p2/8+p(1-p)θ(1-θ)/8 ⇒
Z(θ,p)=log{4[θ(1-θ)(1-p)+p]/(1+3p)}
Zmax在θ=1/2处达到(Zmax=0) ,其他lod皆
为负值。Z(θ,p)除了随θ改变而外,还依
赖于参数p。
◇ 多个齐性家系的资料,Z(θ)值可以累
加(固定θ)。一般以表格形式报告连锁
分析结果,列是不同θ的值,行是不同
的家系。
◇ 由于不完全外显、信息缺失、男女重组
率不同等原因,Z(θ)一般需通过计算机
程序计算。
◇ 资料如果有偏,似然函数L(θ)会受影
响,但似然比统计量T(θ)(因而Z(θ))
不受影响,因为分子分母同时受影响而
抵消。
◇ 一般θ从0以步长变到1/2,计算一
系列的Z(θ)值
◆ Morton双位点连锁分析
当 –2< Z(θ)< 3 →继续抽样
当 Z(θ)≧3 →推断有连锁,
当 Z(θ)≦-2 →无连锁
α=,β=
对X连锁位点,上界为2即可。
~>χ21, ×3=→渐近p=
因单尾,渐近p=
当考虑男女θ不同,应取为上界,否
则p实际上=。
◆ Morton后验Ⅰ类错误概率
P(H0|s)=P(s|H0)p(H0)/
[P(s|H0)p(H0)+ P(s|H1)p(H1)]
一般认为p(H1)=(在44条染色体中,2
基因位于同1条上的概率为),若
β=,α= →%的后验
◆为什么连锁分析里设定的α那么小?
为了使Morton后验Ⅰ类错误概率不过大
◆简单假设下的切贝雪夫不等式
p(T(θ)≧Tc|H0)≤1/Tc 对广义似然比检
验(此时θ不事先设定,而是估出)仍成立:
p(Zmax≧Zc|H0)≤10
-Zc
例如Zc=3对应的p值上界是。
◆任何观察到的Zmax,对应了一个不超过10
-Zmax的经验P值。例如Zmax=4对应的经验p
值≦,
Zmax=的经验p值≦。
◆θ的1-单位支持区间:高度为Zmax-1的横线
与Z(θ)曲线产生两个交点。若Z(θ)在θ=0时
最大,则下界取0。
~>χ21,1个Z(θ)单位乘以就转换为
χ2单位。一个对θ=θ0的χ
2检验在χ2达到
时对应了一个的渐近水准。因此,上述支
持区间有时被看作渐近置信区间,置信度
%。按切贝雪夫不等式
p(Zmax≧Zc|H0)≤10
–Zc,置信度下界为90% 。
为了使支持区间一致于检验,仅当Zmax≧3时才
构造3-单位支持区间。
◆等量观察数
当k/n已知,则k/n=θe为θ的MLE,对θe≠0:
Zmax =nlog2+(n-k)log(1-θe) + klogθe
=nlog2+n(1-θe)log(1-θe) +nθelogθe
=n[log2+(1-θe)log(1-θe) +θelogθe]
Zmax =nlog2 当θe=0
⇒解出n :
n= Zmax / [log2+(1-θe)log(1-θe) +θelogθe]
当θe≠0
n= Zmax / log2 当θe=0
k= n θe
◆例:6家系连锁分析,n=24,k=0,在θe=0
处得到 Zmax =, 等量观察数
n= Zmax / log2= k=0
实际观察数24 比等量观察数11大,说明
未知相与基因型而人为指定时夸大了资
料的信息量。
◆简单家系资料的精确检验(n家系,m子女)
已知相双回交家系,可明确判断重组数k,可
计算Zmax,以及结果显著的概率ps (样本空间
里那些*的样点概率之和)。
对不同θ值,计算的ps列于表中:
当n<10, Zmax不可能>3,
当n=10-15,仅Zmax(0/n)可>3,故ps=(1-θ)
n,
当n=16-19,仅Zmax(0/n)和Zmax(1/n)可>3,故
ps=(1-θ)
n+nθ(1-θ)n-1 。
“n双回交家系,m子女”不同θ下得到显著性结果的概率
*原为nm=10 **原为nm=16
Z0=3 Z0=2
相已知 相未知 已知 未知
θ n=10
m=1 *
n=16
m=1**
n=10
m=2
n=10
m=3 nm=7
n=7
m=2
n=4
m=3
0
1
1
1
1
1
1
1
可见:
1。如果以Zmax>3(或2)为依据,则α不再固定。
故有人建议除了报道Zmax,还要报道p值。
2。仅当连锁紧密时(θ=)功效好。
◆多重检验问题:单个检验假阳性概率α1
,g次独立检验后假阳性概率 α=1-(1-
α1)
g ⇒
α1=1-(1-α)
1/g ⇒ α1≈α/g,称
Bonferroni校正。
另一方面,排除掉一部分标记位点增大了
剩余标记位点连锁的先验概率。二者抵消
⇒以基因组为单位的假阳性概率不用校正。
但对复杂性状,无事先假定的疾病位点,
须通过检验来发现,不存在增大剩余标记
位点连锁先验概率效应,随着标记位点增
加,位点间图距缩小(或只是重复检验次数
增加)以基因组为单位的假阳性概率也增加。
按Bonferroni校正原理,有人提出一个简
单公式(Kidd-Ott 1984):
◇记单个检验水准为α1,g次检验后水准
约为α=gα1⇒gα1≦10
-Z(这个Z控制了总
水准) ⇒α1≦10
-(Z+log(g)) ⇒为了控制总
水准,取单次检验界值为 Z0=Z+log(g)。
例如,当Z=3,做5次检验,可取
Z0=3+log(5)=
一般可通过模拟(例如SIMULATE程序)来
近似总水准。
◆对受累同胞对分析情形,有人对标记位点
的不同图距计算了α1和Z0 :
受累同胞对分析,给定相邻标记位点图距
和全基因组扫描总水准α=时的lod分数界值
据Bonferroni校正结果,相邻标记位点图
距在8cM以上时大致可视为稀疏(独立)
相邻位点距
离
Lod分数界值 单个检验水
准α1
Bonferroni校
正的水准α
10cM
5cM
2cM
1cM
◆家系资料的似然函数:L=p(x1,x2,…,xm),此
处xi表示第i个家系成员的表现型。 L条件
独立:L=p(x)=∑gp(x,g)=∑gp(x|g)p(g)
◆Elston-Stewart算法:逐步计算条件概率L=∑p
(xm-1|gm-1)p(gm-1|.)p(xm|gm)p(gm|.),从家
系最底层开始 (LINKAGE)
◆Lander-Breen算法:计算量随家系成员数
指数增加,随标记位点数线性增加
◆Kruglyak算法:定义遗传向量
ν=(p1,m1,…),分量为0/1变量,以及记分
函数S(ν,F),F是观察到的表现型。
(GENEHUNTER)
家系资料的信息量
◆ 最大似然分数Zmax
◆ Fisher信息量I(Ô)=-d2lnL(Ô)/dÔ 2
Ô必须是θ的最大似然估计解析解
I(Ô)是θ估计值的近似方差
◆ 期望似然分数:在θ处把每个LOD按发
生概率加权求和,得到一条期望LOD曲
线,ELOD一般指期望LOD曲线的最大值。
ELOD的计算例
(3子女,k重组,r=,表内是Z值)
θ (重 组 率)
K P(k) Zmax
0
1 -
-
-
-
2 -
-
-
-
0
3 -
-
-
-
0
◆期望LOD对不同家系有可加性,例如,
为使似然分数≥3,需要多少这样的3子
女家系? 3/=⇒ 大约7个。
◆ MELOD:期望LOD曲线的最大值
◆ EMLOD:期望最大似然分数E(Zmax),
不可加
◆ ELOD≦MELOD≦EMLOD
◆ 检验功效:p(Zmax≥Zc),本例
p(Zmax≥3)=0, p(Zmax≥)=
,
p(Zmax≥)=
◆对表现型不详的家系资料,ELOD通过模
拟来近似。如条件ELOD,目的是在测定
标记基因型之前预测:如果测定了标记
基因型,大致会得到什么样的Zmax。
◆期望信息量与方差
Fisher信息量I(θ)=-d2lnL(θ)/dθ2
假设有1个重组, 3个非重组事件
Ln[L(θ)]=lnθ+3ln(1-θ) 最大值在
θ=1/4处。对Ln[L(θ)]求二阶导数得:
I(θ)={Ln[L(θ)]}''=-1/θ2+3/(1-θ)2
I(θ)={Ln[L(θ)]}'' =-1/θ2+3/(1-θ)2
I()=-1/+3/ =
此I(θ)是在MLE处计算的。
期望信息量是真重组率r的函数I(r)。当结
果分c类,每个观察值的期望信息量是:
i(r)=∑cq
2(r)/p(r)
p(r)是类别发生概率,q(r)是p(r)'
例如重组与非重组,c=2, p(r)=r,
q(r)=1,非重组率p(r)=1-r,q(r)=-1, i(r)=1/r+1/
(1-r)=1/[r(1-r)]
n个子女提供的总期望信息量是
I(r)=n×i(r)
1/I(r)为MLE的渐近方差。多参数情形下,
I(r)取矩阵形式,称信息矩阵
◆按婚配类型计算期望信息量的步骤:
1.列出可能的单倍体⇒可能的基因型
合并难以区分的基因型
2.按表现型归组基因型⇒各型概率⇒按
i(r)=∑cq
2(r)/p(r)
计算期望信息量。
◆例:A1|B2×A1|B2型婚配,共显性。A配
子概率为1/2,A2为r/2,A1为(1-r)/2
双亲配子及子女基因型概率归纳如下:
-------------------------------------
一方父母 另一方父母
--------------------------
A1 B2 A2 B1
(1-r)/2 (1-r)/2 r/2 r/2
-------------------------------------
A1 (1-r)/2 A1|A1 A1|B2 A1|A2 A1|B1
B2 (1-r)/2 B2|A1 B2|B2 B2|A2 B2|B1
A2 r/2 A2|A1 A2|B2 A2|A2 A2|B1
B1 r/2 B1|A1 B1|B2 B1|A2 B1|B1
-------------------------------------
实际上只有10种不同的子女基因型⇒
子女基因型及其概率
这些基因型确定了9种表现型:
基因型 概率 基因型 概率
A1|A1 ¼(1 - r)2 A2|A2 ¼r2
A1|B2 ½(1 - r)2 A1|B1 ½r(1 – r)
B2|B2 ¼(1 - r)2 B1|B2 ½r(1 – r)
A1|A2 ½r(1 – r) A2|B1 ½r2
A2|B2 ½r(1 – r) B1|B1 ¼r2
A1|B2×A1|B2型婚配子女表现型及其概率
型号 表现型 概率
1 AA-11 ¼(1 - r)2
2 AA-12 ½r(1 – r)
3 AB-12 ½[r2+(1 - r)2]
4 AB-11 ½r(1 – r)
5 AA-22 ¼r2
6 AB-22 ½r(1 – r)
7 BB-11 ¼r2
8 BB-12 ½r(1 – r)
9 BB-22 ¼r(1 – r)
∑ 1
表现型的概率如果相同,它们的LOD分数也相同,
对期望信息量的贡献也相同。因此把它们合并
归为一类:
A1|B2×A1|B2婚配归类表现型及其概率
类号 型号 P Q=P' Z(θ)
1 1+9 ½(1- r)2 r-1 log[4(1-
θ)2]
2 2+4+6+8 2r(1-r) 2-4r log[4θ(1-
θ)]
3 5+7 ½r2 r log[4θ2]
4 3 ½[r2+(1 -
r)2]
2r-1 log[2θ2
+2(1-θ)2]
∑ 1 0
◇总lod=∑nZ(θ),加总是对所有表现型类
别,n是各类的子女数。
◇一个子女的费歇信息量为:
i(r)=1/[r(1-r)]+[4r(1-r)]/[r2+(1-
r)2]-2
◇ 期望LOD=∑P(r)*Z(θ),以r替代θ,得
到:
ELOD=(1-r2)log[2(1-r)]+r(2-r)log(2r)+ ½
[r2+(1-r)2]log[2r2+2(1-r)2]
给定真重组率r,上式提供了已知相双杂交
子女的平均连锁信息量。在r=½处ELOD=0
,而在r=0处达最大值。因此,为了
得到3或更大的期望lod,需要
3/=,即大约7个子女。
◆多个等位基因情形下的双杂交
假定2位点各有4个等位基因:ABCD和
1234,考虑婚配A1/B2×C3/D4,按上述
步骤,每个子女都是双杂合体,有16种
可能的不同基因型,它们的概率有3种:¼
(1-r)2、¼r(1-r)和¼r2。合并为3类后,
类概率为(1-r)2、2r(1-r)和r2。婚配
A1/B2×C3/D4每个子女能判断出2个重组
事件,其Fisher期望信息量为:
i(r)= 2/[r(1-r)]
ELOD为:
ELOD= 2rlog(2r)+2(1-r)log[2(1-r)]
二者都大于A1|B2×A1|B2型(2等位基因)
婚配子女,因为等位基因数增多了。
当r=0,ELOD=,2-allele型为,
二者比值为 ∴对紧密连锁,100例4
-allele子女相当于133例2-allele子女。
随着r增大,比值逐渐趋近于2。
i(r)比值在r=0时为1,随着r增大,比值
逐渐趋近于2。
因此,4-allele子女的信息量大致为2-
allele子女的2倍。
◆已知相双回交A1|B2×A1|A1
此时k/n已知,i(r)=1/[r(1-r)]
期望lod=rlog(2r)+(1-4)log[2(1-r)], 在r=0
处,期望lod=。 这种婚配每个子女相
当于一个重组事件,故常用作与其他婚
配比较的基准。
这种父母基因型已知的婚配,n个1子女
家庭提供的信息等同于n/2个2子女家庭,
也等同于1个n子女家庭提供的信息。
◆两子女的未知相双杂交
双杂合体为 I相:A1|B2 或II相:
A2|B1,纯合体为A1|A1,假定一个子女
为基因型为x=A1|A1,x在I相下是非重组
型,II相下是重组型⇒
p(x)=p(x|I)p(I)+p(x|II)p(II)=½(1-r)½+½r½=¼
与r无关,对似然函数及LOD没有贡献,其
他基因型也如此。故未知相双杂交的一
个子女对连锁分析无信息贡献。
2子女情形: 设x1=x2=A1|A1,对给定相,2
子女条件独立
p(x1,x2)=p(x1,x2|I)p(I)+p(x1,x2|II)p(II)
= ¼(1-r)2 ½+ ¼ r2 ½
= [(1-r)2+r2]/8≙f1
对子女基因型组合 x1=A1|A1,x2=A2|A1
p(x1,x2)=p(x1,x2|I)p(I)+p(x1,x2|II)p(II)
=¼(1-r)r ½+ ¼(1-r)r ½
=(1-r)r/4≙f2
其他所有可能的子女基因型组合概率都是f1(=
[(1-r)2+r2]/8)或f2(=(1-r)r/4 ):
子 女 2
子女1 A1|A1 B2|A1 A2|A1 B1|A1
A1|A1 f1 f1 f2 F2
B2|A1 f1 F1 f2 F2
A2|A1 f2 f2 f1 F1
B1|A1 f2 f2 f1 f1
把相同概率的基因型组合归组,得到:
类1指在I相下非重组,类2指在I相下重组。
可见在亲体相不清楚时子女基因型不独
立。这个表的相关系数ρ=(1-2r)2,1-2r
称为连锁参数,当r=0,ρ=1,否则>0。
子女2
子女1 类1 类2 ∑
类1 [(1-r)2+r2]/2 r(1-r) 1/2
类2 r(1-r) [(1-r)2+r2]/2 1/2
∑ 1/2 1/2 1
此表可进一步合并,得到2个类别:2子女
要么都重组要么都不重组(类别1),以及
一个重组一个不重组(类别2)。
只要两个位点都处于连锁平衡,两类别的
概率就独立于人群等位基因频率。
类别 概率p 导数q Z(θ)
类别1 (1-r)2+r2 -2(1-2r) log[2θ2 +2(1-
θ)2]
类别2 2r(1-r) 2(1-2r) log[4θ(1-θ)]
∑ 1 0
每同胞对的期望信息量为
i(r)=[2(1-2r)2]/{r(1-r)[1-2r(1-r)]}
在无重组的极限情形,此i(r)与已知相双回
交2子女的i(r)=2/[r(1-r)]一样。故在r=0时,
未知相并不降低重组率估计值的精度。
类别 概率p 导数q Z(θ)
类别1 (1-r)2+r2 -2(1-2r) log[2θ2 +2(1-
θ)2]
类别2 2r(1-r) 2(1-2r) log[4θ(1-θ)]
∑ 1 0
期望LOD=2r(1-r)log[4r(1-r)]+[r2 +(1-
r)2]log[2r2 +2(1-r)2]
当r=0,ELOD=,是已知相双回交一个
子女的ELOD。未知相导致信息损失一半。
已知相2子女的ELOD与未知相2子女ELOD
比值R在r=0时为2,即 R(0)=2,
R()=, R()=, R()=,
R()=∞。
对n个2子女未知相双回交家系,可直接估
计重组率:
n个2子女未知相双回交家系,其中类别2 (2
子女1个重组1个非重组)家系数为k。类别2
家系概率为2r(1-r),我们又可写成
2r(1-r)=k/n,求解r,得到:
Ӫ=[1-√(1-k/n)]/2
其近似标准差为
1/√[n×i(r)]
以Ӫ代r,得到标准差估计值。
◆ 受累同胞对(ASP)法
认为标记基因与疾病基因连锁,故集中
考虑患病子女。巧妙地避开了不完全外
显(penetrance)问题,但受到拟表现型
(thenocopy)干扰。观察子代接受同样标
记基因(基因同源,IBD)情况,例如,父母
标记基因有4种alleles,二同胞可能的同源
基因数有0、1和2,按孟德尔方式,其出
现比例为1:2:1。如果紧密连锁,父母
可能会把标记基因的一个等位基因和疾
病一起传给后代,导致共享IBD数增加。
记共享i个IBD基因的概率为ki, i=0,1,2,
资料中观察到的相应比例为Ќi, 在无连锁
情形,k0=¼, k1=½, k2=¼ 。
◆Minmax检验(Whittemore-Tu 1998)
u=(Ќ0 –Ќ1) n½
Ќi为共享i个IBD基因的比例,n为同胞对
总数,u~N(0,1) , Minmax为最大风险
极小化。当Ќ0=¼, Ќ1=½,u=0。
◆均数检验(mean test):计数亲体传递的共
享IBD基因个数(只有0或1个);例如俩亲
体的标记基因型为1/2和3/4,受累同胞对
的基因型为1/3和1/4,则亲体“1/2”的
分数为1,“3/4”为0。p为传递了1个共
享IBD基因的亲体比例,计算 u=(2p –
1)n½, u~N(0,1),当|u|太大,则倾向于认
为存在连锁。
例如:301个亲体中173个传递了1个共享
IBD基因,u=(2*173/301–
1)√301= ⇒ p=
◇均数检验对显性性状功效高
◆比例检验(proportion test):Ќ2的期望值
在无连锁时是¼,据此构造检验统计量:
u=(4 Ќ2 –1) (n/3)½
n为同胞对数。
在H0(无连锁)情形下,u~N(0,1) 。
◆ ASP方法与LOD分析
Zmax是ASP方法观察到的共享IBD基因总
个数的单调变换,因此,在适当选择界
值后,均数检验等价于LOD检验。
薛禾生 (010) 13691446315
hshxue@