协方差分析
一个协变量的协方差分析
例:为研究三种饲料(A1(g=1),A2(g=2),A3(g=3))对猪催肥效果,用每种饲料喂养8头猪,实验用猪的初始体重(x)未控制。喂养一段时间后,观察小猪的增重(y)。所得资料如表2-1,试分析三种饲料对猪催肥效果是否相同。
资料结构:(文件名)
x
y
g
15
85
1
13
83
1
11
65
1
12
76
1
12
80
1
16
91
1
14
84
1
17
90
1
17
97
2
16
90
2
18
100
2
18
95
2
21
103
2
22
106
2
19
99
2
18
94
2
22
89
3
24
91
3
20
83
3
23
95
3
25
100
3
27
102
3
30
105
3
32
110
3
对于不考虑初始体重影响而评价三种饲料的统计分析为单因素方差分析(One-way ANOVA),由于小猪的增重与初始体重有关,因此在分析三种饲料对增重的关系时,应该考虑校正初始体重对增重的影响。并假定初始体重与增重呈线性统计关系以及要求初始体重与饲料不构成交互作用。称校正变量(初始体重)为协变量,分组变量为因子变量。因此可用协方差分析上述统计问题,相应的角模型如下:
A1(g=1)
A2(g=2)
A3(g=3)
不校正初始体重
校正初始体重
用STATA命令为:
anova y g x g*x,class(g)
Number of obs = 24 R-squared =
Root MSE = Adj R-squared =
Source | Partial SS df MS F Prob > F
Model | 5
|
g | 2
x | 1
g*x | 2
|
Residual | 18
Total | 23
由g*x项的P值=>,说明初始体重与饲料不构成交互作用。
anova y g x,class(g)
Number of obs = 24 R-squared =
Root MSE = Adj R-squared =
Source | Partial SS df MS F Prob > F
Model | 3
g | 2
x | 1
Residual | 20
Total | 23
regress
Source | SS df MS Number of obs = 24
-------------+------------------------------ F( 3, 20) =
Model | 3 Prob > F =
Residual | 20 R-squared =
-------------+------------------------------ Adj R-squared =
Total | 23 Root MSE =
y Coef. Std. Err. t P>|t| [95% Conf. Interval]
_cons
g
1
2
3 (dropped)
x .2548332
,,,
A1 vs A3:,H0:(1=0 vs H1:(1(0
对应的P值为<,因此认为两组总体均数不同,由(1的95%可信区间可认为A1的均数大于A3的均数,差别有统计意义。
A2 vs A3:,H0:(2=0 vs H1:(2(0
对应的P值为<,因此认为两组总体均数不同,由(2的95%可信区间可认为A2的均数大于A3的均数,差别有统计意义。
A1 vs A2:,H0:(1-(2=0 vs H1:(1-(2(0
test _b[g[1]]-_b[g[2]]=0
( 1) g[1] - g[2] =
F( 1, 20) =
Prob > F =
对应的P值为<,因此认为两组总体均数不同,由于点估计为:<,P值小于,因此可认为A2的均数大于A1的均数,差别有统计意义。
结论:
1)A2饲料喂养的小猪增重最高,A1饲料喂养的小猪增重也高于A3饲料喂养的小猪的增重,差别均有统计意义,P值均小于。
2)小猪的增重与初始的呈正相关,P<。
两种干预的效果评价中校正混杂因素
有2种干预治疗高血压,现仅以收缩压为例,讨论评价疗效的方法。
分组
治疗前
治疗后
group
x1
x2
1
1
2
1
3
1
4
1
5
1
6
1
7
1
8
1
9
1
10
1
137
11
1
134
12
1
13
1
14
1
15
1
16
2
144
17
2
18
2
19
2
20
2
21
2
127
22
2
23
2
24
2
25
2
26
2
27
2
28
2
139
29
2
30
2
一、计算治疗前后的改变量:gen d=x1-x2
二、计算两组的平均改变量:tab group, su(d)
| Summary of d
group | Mean Std. Dev. Freq.
------------+------------------------------------
1 | .58415673 15
2 | .53966211 15
------------+------------------------------------
Total | .72843602 30
第2组比第1组多下降(即:两组疗效的差异为)
校正治疗前的影响,则用协方差模型
anova d group x1,class(group)
Number of obs = 30 R-squared =
Root MSE = .525257 Adj R-squared =
Source | Partial SS df MS F Prob > F
-----------+----------------------------------------------------
Model | 2
|
group | 1
x1 | 1
|
Residual | 27 .275894984
-----------+----------------------------------------------------
Total | 29 .530619029
说明:疗效与基线情况有关,并且两组干预的疗效有差异。
. regress
Source | SS df MS Number of obs = 30
-------------+------------------------------ F( 2, 27) =
Model | 2 Prob > F =
Residual | 27 .275894984 R-squared =
-------------+------------------------------ Adj R-squared =
Total | 29 .530619029 Root MSE = .52526
-----------------------------------------------------------------------------
d Coef. Std. Err. t P>|t| [95% Conf. Interval]
-----------------------------------------------------------------------------
_cons
group
1 .1931656
2 (dropped)
x1 .0402676 .0178409 .0036612 .076874
-----------------------------------------------------------------------------
校正了基线以后,两组疗效的差异为,并且有统计学意义。
(注:未校正前的两组疗效的差异为)
一个协变量、二个因子的协方差分析
例2-2 某园艺家研究鲜花的种类(因子A:花种LP(a=1)和花种WB(a=2))和湿度(因子B:湿度低(b=1)和湿度高(b=2))对出售鲜花量(y)的影响。因为试验田的大小不等,故把试验田的大小(x)作为协变量,每个试验田重复6次,资料如书(p28)所述,试分析出售鲜花量与这2个因子的关系。
数据结构:
y
x
a
b
98
15
1
1
60
4
1
1
77
7
1
1
80
9
1
1
95
14
1
1
64
5
1
1
71
10
1
2
80
12
1
2
86
14
1
2
82
13
1
2
46
2
1
2
55
3
1
2
55
4
2
1
60
5
2
1
75
8
2
1
65
7
2
1
87
13
2
1
78
11
2
1
76
11
2
2
68
10
2
2
43
2
2
2
47
3
2
2
62
7
2
2
70
9
2
2
由于试验田大小(x)同样可以影响出售鲜花量(y),所以可用协方差分析:
花种
湿度低(b=1)
湿度高(b=2)
无x
(ANOVA)
LP(a=1)
WB(a=2)
含x
(Co-ANOVA)
LP(a=1)
WB(a=2)
anova y a b a*b x a*b*x,class(a b)
Number of obs = 24 R-squared =
Root MSE = Adj R-squared =
Source | Partial SS df MS F Prob > F
Model | 7
|
a | 1
b | 1
a*b | .027656949 1 .027656949
x | 1
a*b*x | 3
|
Residual | 16
Total | 23
由于协变量x与因子a和b的交互项a*b*x的检验的P值=>,所以可以认为因子a和b与协变量x无交互作用。
Number of obs = 24 R-squared =
Root MSE = Adj R-squared =
Source | Partial SS df MS F Prob > F
Model | 4
|
a | 1
b | 1
x | 1
a*b | 1
|
Residual | 19
Total | 23
anova y a b x ,class(a b)
Number of obs = 24 R-squared =
Root MSE = Adj R-squared =
Source | Partial SS df MS F Prob > F
Model | 3
|
a | 1
b | 1
x | 1
|
Residual | 20
Total | 23
regress
y
Coef.
Std.
Err.
t
P>|t|
[95% Conf.
Interval]
_cons
a
1
2 (dropped)
b
1
2 (dropped)
x
.1346936
,,,
说明:在同样的试验田数的情况下,花种LP的鲜花销售量高于花种WB的鲜花销售量,差别有统计意义。P=<
在同样的试验田数的情况下,低湿度的鲜花销售量高于高湿度的鲜花销售量,差别有统计意义。P=<
试验田越大,销售量越大,差别有统计意义,P<
test _b[a[1]]=_b[b[1]]
( 1) a[1] - b[1] =
F( 1, 20) =
Prob > F =
相比之下,湿度因子影响销售量高于花种的影响销售量。