经济与管理学的数学基础 概率论与数理统计部分讲义 复旦大学管理学院统计学系 徐勤丰 2009
概率论与数理统计部分教学目标 系统回顾以微积分、线性代数为基础的概率论与数理统计的基础知识。 教材与参考书目 Casella, G. and Berger, R. L., Statistical Inference (2nd edition), Wadsworth, 2001. (影印版,机械工业出版社,2002) 茆诗松等,概率论与数理统计教程,高等教育出版社,2004。 茆诗松等,高等数理统计,高等教育出版社,1998。 课程安排: 概率论部分四次,数理统计部分四次。 1.第一章 概率;第二章 随机变量 2.第三章 随机向量 3.第四章 数字特征 4.第五章 特征函数;第六章 概率极限定理 5.第七章 样本与统计量 6.第八章 参数估计(点估计) 7.第八章 参数估计(区间估计);第九章 假设检验 (基本概念) 8.第九章 假设检验 考核方式: 平时作业 (30%) 考试(70%) 1
第一章 概 率 随机现象 l 特点: a) 可能结果不止一个; b) 究竟出现哪个结果,事先无法预知,视机会而定。 l 有规律可循,其规律称为“统计规律”。不同随机现象的统计规律有共性。 概率论 l 起源于赌博,17世纪 Pascal 、Fermat、Huygens等人的研究。 l 是研究随机现象中的统计规律的一门学科。提供了一套用于对总体、随机现象建模的工具。是统计学的基础。 § 概率的公理化定义 1. 基本概念 概率论建立于集合论的基础之上。 随机试验(Random Experiment) 在一定条件下(自然条件或实验条件),对某种随机现象进行的一次观测,称为一次随机试验。基本特点是:所有可能的观测结果事先已知,但一次试验中究竟观测到哪一个具体结果,事先无法预知,视机会而定。 基本概念 概率论的含义 集合论的语言 样本点 一项随机试验可能出现的基本结元素,常用 s, w 等符号表示 果 样本空间 所有基本结果的集合 全集,我们用 S 表示,文献中也常用 Ω 表示 随机事件 对试验结果的判断或陈述 子集,常用 A,B,C等大写字母表示 基本事件 仅涉及单个基本结果的陈述 由一个元素构成的子集 事件的发生、不发生: 设试验的实际结果为 s,若 s∈A,则称事件 A发生;否则称 A不发生。 S为必然事件,∅为不可能事件。 2
例 1) 掷一枚硬币一次。 可能的样本点为:s1: 得正面,s2: 得反面。样本空间为 S={s1,s2}。 2) 从一批产品任取三个,检查是否合格。 若关心每件产品是否合格,样本空间为 S={(GGG),(GGB),L,(BBB)},包含8个样本点; 若只关心不合格产品数,则样本空间可取为 S={0,1,2,3}。 3) 观察某天早上7~8点间到达复旦车站的乘客数。 S可取为非负整数集。 4) 观察某只股票明天的收盘价。 S={s:a(1−10%)≤s≤a(1+10%)},其中 a 为今天的收盘价,已知。 注: l 样本空间的选取应根据研究目的而定,也往往需要考虑数学处理的方便程度。 l 不同的随机现象可能用相同的样本空间去描述。 事件的关系与运算 u 包含:A⊂B,含义为“A发生则B必发生”。 u 相等:A=B⇐⇒A⊂B且B⊂A。 u 交:A与B同时发生,记作 AIB=AB={s:s∈A且s∈B}。 u 并:A或B发生,记作 AUB={s:s∈A或s∈B}。 若 AB=∅,称 A与B不相容(互斥),此时 AUB 也记作 A+B。 u 余:A的对立事件(A不发生)称为 A 的余,记作 Ac={s:s∈A}。 显然,Ac=∅,A+Ac=S。 u 差:A发生但B不发生,记作 A−B=ABc。 Ac=S−A。 3
运算规则 1) 交换律:AUB=BUA,AB=BA。 2) 结合律:(AUB)UCAU(BUC),(AB)C=A(BC)。 3) 分配律:(AUB)C=(AC)U(BC),(AB)UC(AUC)(BUC)。 4) De Morgan 定律:ABc=AcBABc=Ac(),()Bc. 多个、可列个事件的交、并运算 n∞IAAALi12n,IAiA1A2L==UAAUAULAi1n,UAiA1UA2UL若两两互斥,则记n∞ A1,2∑AUA, ii∑AUAii=1=1=1=1∞∞分配律:A(UA)U(AA)iii=1i=1∞∞∞∞DIAcUAcUAce Morgan Th.(),()IAciiiii=1=1i=1i=1 极限 ∞若 A1⊂A2⊂L,则记 limAn=UAn; n→∞n=1∞若 A1⊃A2⊃L,则记 limAn=IA。 →∞nnn=1 2. 概率的Kolmogorov公理化定义 对于一个随机试验,如何合理地定量描述各事件发生的可能性大小,这是概率论的基本任务。 定义 (σ 域、事件域)设 S 是一个样本空间,F 为由 S 的某些子集构成的一个非空集合类。若 F 满足下列三条性质: a) S∈F; b) 若 A∈F,则c A∈F; c) 若 A1,A2,L 是 F中的可列个元素,则 U∞F。 i=1A∈i则称 F 为 S 上的一个 σ 域(事件域)。 4
例 1) S={s1,s2,L,sn},F是 S 的所有子集组成的集合类,则它是一个σ 域。 2) �上的 Borel 域 B� :包含了所有形如 (−∞,a] 的区间的最小σ 域,a∈�; �k上的 Borel 域 B�k:包含了所有形如 (−∞,a1]×(−∞,a2]×L×(−∞,a] 的区域的k最小σ 域,(a1a2La∈�k,,,)。 k 定义 (概率)对于一个给定的样本空间 S 及S 上的一个事件域 F,定义在 F 上的实值函数 P(⋅) 若满足下列三条公理: a) (非负性)P(A)≥0,∀A∈F; b) (规范性)P(S)=1; c) (可列可加性)若 A1,A2,L 是 F 中的可列个互不相容的事件,则 (∑∞∞PA)=P(A)。 i=1i∑i=1i则称 P(⋅) 是 (S,F) 上的一个概率(函数),称 (S,F,P) 是一个概率空间。 注: l Kolmogorov公理化定义只是明确了作为概率的数学模型应该满足的基本条件,并不涉及对概率的解释,也不涉及如何确定具体事件的概率值。 3. 概率的基本性质 (1) P(∅)=0。 (2) (有限可加性)设 A∈F,i=1,L,n 且两两互斥,则nn P(∑A)=∑P(A)。 ii=1ii=1i (3) ∀A∈F,i)P(Ac)=1−P(A);ii)P(A)≤1。 (4) 若 A⊂B,则 P(A)≤P(B)。 (5) (减法公式)P(B−A)=P(BAc)=P(B)−P(BA)。 (6) (加法公式) 5
P(AUB)=P(A)+P(B)−P(AB);P(AUBUC)=P(A)+P(B)+P(C)−P(AB)−P(AC)−P(BC)+P(ABC); nnPA∑PA−∑PA∑PAA+L+−−1()()()()(1)P(IA).iiijijkii=1i<ji<j<k= ∞∞(7) (次可列可加性、Boole 不等式) P(UA)≤∑P(A)。 iii=1i=1nn(Bonferroni 不等式) P(IA)≥∑P(A)−(n−1)。 iii=1i=1(8) 可列可加 ⇐⇒ 有限可加 + ∅上连续 ⇐⇒有限可加 + 下连续。 4. 确定概率的例子 (1) 有限样本空间。 设 S={1,s2,L,s},F =2Ssn,设 p1,p2,L,pn 是n 个非负实数,且 ∑np=1,若对 ∀A∈F, 取 P(A)=i=1i∑p。则可以验证,这么定义的函数 P(⋅)is∈Ai就是一个概率。p1,p2,L,pn取不同的值,则对应于 (S,F) 上不同的概率函数。 同理,也可确定无限可列样本空间上的概率。 (2) 古典概型 (Classical Scheme)。 是历史上研究得最早的概率模型。描述的是一类最简单的随机现象。概率的确定建立在经验事实的基础上(对基本事件作等概率的假定)。通过逻辑分析得到感兴趣事件的概率。 特点: a) 样本空间有限,不妨记作 S={s1,s2,L,sn}; b) 假定每个基本事件 {s},i=1,L,n发生的概率相等,即 i1P({s})=,i=1,L,n。 inc) 事件A的概率 A中包含的样本点数P(A)=S中的样本点数。 容易验证,按上述方法得到的概率,符合 Kolmogorov 公理化定义。 6
例 1) 彩票中奖问题: 买一注35选7的福利彩票,中各奖项的概率多大? 2) 生日问题: r (<365) 个人中至少有两人生日相同的概率多大? 3) 抽签问题: N个签中有A个签有奖,各人依次抽签,第t人中奖的概率多大? 4) 抽样检验问题: N个产品中有M个次品,其余合格。从中抽取n个,求恰好抽中x 个次品的概率。分两种情况:有放回;无放回。 (3) 几何概型 a) 样本空间 S 是�k中的一个区域,且有几何量度 m(S); b) “等可能性假定”:试验结果落在 S 中某一子区域 A 中的概率只与 A的几何量度m(A)有关,与A的形状、位置无关; m(A)c) P(A)=。 m(S) 例 1) 会面问题 2) Buffon投针问题 (4) 频率方法 7
§ 条件概率与事件的独立性 1. 条件概率 引进条件概率的作用:考察事件之间的关系;简化概率的计算。 定义 (条件概率)设 (S,F,P) 是一个概率空间,B∈F,P(B)>0。对于∀A∈F,称 P(AB)P(A|B)= P(B)为事件B发生条件下A发生的条件概率。 例 在一般人群中任取一人,有肺癌的概率极小。但若已知抽中的人有很长的吸烟史,则该人患肺癌的概率就大了。后者就是条件概率。例如,一个1万人的人群结构如下 患肺癌 (A) 不患肺癌 (Ac) 合计 抽烟 (B) 80 1920 2000 不抽烟 (Bc) 8 7992 8000 合计 88 9912 10000 从中随机抽1人,此人有肺癌的概率为 881P(A)==, 100001若已知抽中的人抽烟,则其有肺癌的条件概率为 808010000111P(A|B)===。 20020010000111 注: l 条件概率可视为将样本空间 S 缩小到 SB=B 之后来研究各事件的概率。 l 对于给定的事件B,P(A|B),∀A∈F 形成了 (S,F) 上的一个新的概率函数,即满足Kolmogorov公理化定义的三条公理: a) (非负性)P(A|B)≥0,∀A∈F; b) (规范性)P(S|B)=1; 8
c) (可列可加性)若 A1,A2,L 是 F 中的可列个互不相容的事件,则 ∑∞∑∞P(A|B)=P(A|B)。 =1ii=1i而且,它具有概率的一切性质。 l 若 B=S,则 ∀A∈F,P(A|B)=P(A|S)=P(A),故无条件概率可视为特殊条件下的条件概率。 n乘法公式:若 A1,A2,L,An 是 (S,F) 中的 n 个事件,且 P(IA)>0,则 ii=1nP(IA)=P(A1)P(A2|A1)P(A3|A1A2)LP(A|A1A2LA−1)。 inni=1 全概率公式: n若 B1,B2,L,Bn 互不相容,且 P(B)>0,i=1,L,n,A⊂i∑B,则 ii=1nP(A)=∑P(A|B)P(B)。 iii=1 例 (抽签问题)已知100个签中有10个有奖,每人依次抽一签。 (1) 求第三个人首次中奖的概率; (2) 求第二个人中奖的概率。 Bayes 公式: n设B1,B2,L,Bn互不相容,且P(B)>0,i=1,L,n。A⊂∑B,P(A)>0。则iii=1对 ∀j∈{1,2,L,n}, P(A|B)P(B)P(B|A)=jj。 jn∑P(A|B)P(B)iii=1 9
例 (甲胎蛋白法检查肝癌)某地区肝癌发病率为,当时用甲胎蛋白法检查肝癌,真阳性率为99%,假阳性率为%。随机抽1人作检查,呈阳性。求此人患肝癌的概率。 解:记A为此人患肝癌,B为检查阳性。已知 P(B|A)=,P(BAc|)=,P(A)=,求P(A|B)。由Bayes公式知 P(B|A)P(A)P(A|B)=P(B|A)P(A)+P(B|Ac)P(Ac) ×=×+× 2. 事件的独立性 独立性是概率论中一个重要概念,是用概率论的语言对经验直观的独立性概念给出的严格定义。 定义 (两事件的独立性)事件 A、B 若满足 P(AB)=P(A)P(B), 则称事件 A 与 B 相互独立。 注: l 两事件独立意味着条件概率等于无条件概率,. 若 A与B相互独立,则 当 P(B)>0 时,P(A|B)=P(A);当 P(A)>0 时,P(B|A)=P(B)。 l 概率为0 或1 的事件与任何事件独立;特别地,S,∅与任何事件独立。 性质: 若 A与B相互独立,则A与BcAc与BAc ,,与Bc也都相互独立。 定义 (多个事件的独立性)A1,A2,L,An 是 n 个事件,若对集合 {1,2,L,n}的任意一个至少含两个元素的子集 C 有 P(IA)=∏P(A), jjj∈Cj∈C则称事件 A1,A2,L,An 相互独立。 10
性质: 设事件 A1,A2,L,An 相互独立,则 a) 从中任取 m 个事件 (2≤m≤n) 也相互独立。 b) 从中任取 m 个事件 (2≤m≤n),对每个事件取余或不取余,得到的 m 个新事件也相互独立。 c) 将这 n 个事件任意分成 m 组,各组通过组内事件间的运算各自得到一个新事件,则这 m个新事件相互独立。 d) 独立乘法公式: nnP(IA)=∏P(A)。 iii=1i=1e) 独立加法公式: nnnP(UA)=1−P(IAc)=1−∏P(Ac)。 iii=1=1i=1 例(两两独立、但三事件不独立)设样本空间为 (aa),(bb),(ccc),S=(abc),(bac),(cba),。 (acb),(bca),(cab)假定各基本事件等概率。记 Ai 为第 i 个位置上是字母 a,i=1,2,3。则 P(A)=,i1,2,3;P(A12)==P(A1)P(A2),i9 P(A13)=P(A1)P(A3),P(A23)==P(A2)P(A3).9说明 A1,A2,A3 两两相互独立。但是1 P(A1A23)=≠P(A1)P(A2)P(A3),说明三9事件不独立。 定义 (试验的独立性)一个随机试验E (an experiment) 由 n 个子试验 (subexperiment or trial) E1,E2,L,En构成。设E的样本空间为 S,=1,L,n,E 的ii样本空间为 S=S1×S2×L×Sn(笛卡尔乘积)。若对任意一组事件 {A(i)⊂S:=1,L,n},其笛卡尔积A=A(1)×A(2) ×L×A(n)为E的一个事件, 都i11
有 nnI()PA=P()()Ai∏P(Ai, i=1i=1则称子试验 E1,E2,L,En 相互独立。 独立性概念的作用: 对于给定的概率模型,判断复杂事件间的独立性关系; 用于建模时以经验的独立性判断作为假定,简化概率模型。 12
第二章 随机变量 § 随机变量及其分布 1. 随机变量 (random variable, r. v.) 在研究随机现象时,往往需要用数值记录观测结果,这就产生了随机变量的概念。 定义 (随机变量)定义在样本空间 S 上的实值函数 X(s):S→�,称为样本空间S上的随机变量。 注: l 随机变量通常用大写英文字母 X, Y, Z, … 等表示,其取值常用小写字母 x, y, z, …等表示。 l 有些样本空间本身就是某个实数的子集,观测结果本身就是一个随机变量。 例如: � 掷一枚骰子出现的点数 X; � 观察某大卖场一天内来到的顾客数X 及 营业额 Y; � 抽取某厂生产的某型号的电视机检测其寿命 T; l 有些样本空间不是实数的子集,可根据研究需要定义适当的随机变量。 例如: � 检验一个产品,看它是否合格。样本空间 S={合格,不合格}。可定义 . X 为不合格品数。则 X(s) s 0 合格 1 不合格 � 观测投掷一枚硬币三次的结果。样本空间 S={HHH,HHT,HTH,THH,HTT,THT,TTH,TTT}。可定义 . X 为正面数。则 X(s) s 0 TTT 1 HTT,THT,TTH 2 HHT,HTH,THH 3 HHH l 一个随机变量通常可视为考察随机现象的一个视窗。 导出概率分布 13
设 (S,F,P) 是一个概率空间,X 是定义在 S上的一个随机变量。那么,由 X可在实数空间 (�,B�) 上导出一个新的概率 PX(⋅)。PX(⋅)称为随机变量X(导出)的概率分布,∀B∈B�, PX(B)=P(X∈B)=P({s:X(s)∈B})。 注: l 随机变量 X 的概率分布完全由 (S,F,P) 决定。 l 了解 X 的分布,至少可以了解 P 的某一个侧面的信息。 l 定义在不同概率空间上的随机变量可能有共同的分布,因此,抽象地研究随机变量的分布有助于找到共同的方法去研究同类随机现象。 2. 分布函数 定义 (分布函数)若 X 是一个随机变量,称函数 F(x)=PX(−∞,x])=P(X≤x),x∈� 为 X 的(累积)分布函数 (. / .)。常记为 X~F(⋅)。 注: l 分布函数与概率分布一一对应。 l 引进分布函数,实质上是将 (�,B�,PX) 转化为一个实函数来研究。 l 通常用F, G, H 等大写字母表示分布函数. 基本性质: F(⋅) 是某个随机变量的分布函数,当且仅当 F(⋅) 同时满足下列三个条件: a) (单调性)∀a<b,F(a)≤F(b); b) (有界性)lim()=0,lim()=1; x→−∞Fx→∞Fxxc) (右连续性)∀x0∈�,F(x0)=lim→0+F(x)。 xx 注: l 分布函数的另一种定义为:F%(x)=P(X<x),x∈�。此时,基本性质 a) b) 不变,c) 变为“左连续”。 14
定义 (同分布)若随机变量 X 与 Y 的分布函数相同,则称 X 与 Y 同分布。 用分布函数可以计算哪些事件的概率? l P(X>a)=1−P(X≤a)=1−F(a) l P(a<X≤b)=P({X≤b}−{X≤a})=F(b)−F(a) l P(X<a)=limF(x)=F(a−0) x→a−l P(X=a)=P({X≤a}−{X<a})=F(a)−F(a−0) l P(X≥a)=1−P(X<a)=1−F(a−0) l P(a≤X≤b)=F(b)−F(a−0) l P(a≤X<b)=F(b−0)−F(a−0) l P(a<X<b)=F(b−0)−F(a) 例 设 . X 具有如下分布函数 0,x<0,1,0≤x<1,Fx=4() 1x,1≤x<2,21,2≤) P(X<1)=F(1−0)=。 41112) P(X=1)=F(1)−F(1−0)=−=。 244133113113) P(≤X<)=F(−0)−F(−0)=−=。 222222423334) P(X=)=F()−F(−0)=0。 2225) 求 c 使得2 P(X≤c)=。即求 c 使得2 F(c)=,解得4 c=。 3336) 求 c 使得 P(X≤c)=;求 c 使得 P(X≤c)=。 15
定义 (分位点)设 . X 的分布函数为 F(x)。对于给定的p∈(0,1),若ap满足 F(ap−0)≤p≤F(ap), 则称 ap 为 X 的 p分位点 (quantile)。 一些常用的分位点及其特殊名称: 中位数 (median) a0 第一四分位数 (f第三四分位数 (third quartile) .25irst quartile), a0,a,L, 第一~第九十分位数 (first decile ~ ninth decile) 3. 离散型随机变量与分布列 若一个随机变量最多只可能取可列个值,则称之为离散型随机变量。 定义 (分布列)若离散型随机变量 X 的可能取值为 x,i=1,2,L,则称数列 ip=P(X=x),i=1,2,L iˆi为 X 的概率分布列 (probability mass function/discrete probability density function)。 分布列与分布函数的关系: � 离散型随机变量的分布函数必是阶梯函数,与分布列一一对应。 � 在定义的条件下,有 p=F(x)−F(x−0),i=1,2,LiiiF(a)=P(X≤a)=∑p,∀a∈� ix≤ai� 根据分布列可计算离散型随机变量落在任意给定的实数区间内的概率。 分布列的基本性质: 一个数列 {p:i=1,2,L} 是某个离散型随机变量的分布列,当且仅当它同时满i足下列两个条件: a) (非负性)p≥0,i=1,2,L; i∞b) (规范性)∑p=1。 ii=116
分布列的表示方法: a) 通项公式; b) 表格形式; c) 条形图。 4. 连续型随机变量与密度函数 定义 (连续型随机变量)若存在非负函数 p(x),x∈�,使得随机变量 X 的分布函数 F(x) 可表示为 xF(x)=∫p(t)dt,∀x∈�, −∞则称 X 是连续型随机变量,称 p(x) 为X的概率密度函数 (.)。 密度函数的基本性质: 一个函数 p(x) 是某个连续型随机变量的密度函数,当且仅当它同时满足下列两个条件: a) (非负性)p(x)≥0,∀x∈�; b) (规范性)∞∫p(x)dx=1。 −∞ 连续型随机变量的特点: 1) ∀a<b,P(a<X≤b)=F(b)−F(a)bab =∫p(t)dt∫p(t)dt=∫p(t)dt.−∞−∞a∀A∈B�,P(X∈A)=∫p(t)dt. A2) P(X=c)=0,∀c∈�。 3) 分布函数处处连续。 bP(a<X≤b)=P(a<X<b)=P(a≤X<b)=P(a≤X≤b)=∫p(x)dx。 a4) 连续型随机变量的密度函数不唯一。改变密度函数在有限个点、可列个点(甚至更多个点)处的函数值,不改变分布函数。 5) 若 p(x) 在x处连续,则有 F'(x)=p(x)。因此,若分布函数 F(x) 处处可导,则可取 F'(x) 作为密度函数。 密度函数的来源——直方图 17
§ 常用概率分布族 1. 离散型分布 (1) 二项分布 (Binomial Distribution) 独立地重复进行 n 次成功概率为 p (0<p<1) 的 Bernoulli 试验,记成功次数为X。称 X ~ B(n, p)。 分布列为 nPX=k(k)=p(1−pn−k),=0,1,L,n。 k 分布特点: � p< 时分布右偏,p= 时分布对称,p> 时分布左偏。 � (对称性) 若 X~B(n, p),则 Y=n-X~B(n, 1-p)。 � 若记 X 为第 i次Bernoulli试验中的成功次数,则n X=i∑X。 i=1i (2) 超几何分布 (Hypergeometric Distribution) 来源于对有限总体的不放回抽样。设一袋子中共有 N 球,其中有M个白球。从中不放回地任取n个球,记抽中的白球数为 X。称X ~ HG(n; N, M)。 分布列为 MN−Mkn−kP(X=),k=max{0,n−(N−M)},L,min{M,n}。 Nn 当 n=N 且 n<M 时,不放回抽样与放回抽样非常接近,有 nMkMn−kP(Xk=)≈1−。 kNN (3) Poisson 分布 分布列为 lkP(X=k)=−le,k=0,1,2,L k!其中 l是大于0的参数。记作 X~Poi(l)。 来源:二项分布概率的近似计算。当 n较大,np较小时,对于给定的较小的k, 18
nkpk−pn−kl≈−l(1)e,其中l=np。 kk! 应用: � 用于对一定时间段内某类事件发生的次数建模。基本假定:记在充分小的时间段h内,这类事件发生的次数为Y,则 1) P(Y=1)与h成比例;2) P(Y≥2)=0;3) 在不交叉的时间段内该类事件发生的次数相互独立。 � 用于对一定空间范围内某类事物出现的个数建模。 � 例 � 1875-1894年间普鲁士军队中每年被马踢死的士兵数; � 给定时间段内一个放射源发出的a粒子数; � 二次大战中,在固定时间长度内,伦敦被炮击中的城区数; � 一分钟内到达某银行的人数; � 一定时间内通过某个十字路口的汽车数; � 单位布匹上的疵斑数 … … (4) 几何分布 (Geometric Distribution) 独立地重复进行成功概率为p的 Bernoulli 试验,记首次成功时的试验次数为X。称 X ~ Ge(p)。 分布列为 P1(X=k)=(1−pk−)p,k=1,2,3,L 特点:无记忆性。对于 k>0,s>=0, PX=ks1(k+s)(1−p)+−pP(X=k+s|X>s)==P(X>s)∑∞pl−1()p l=s+1=−pk−1(1)p=P(X=k). (5) 负二项分布 (Negative Binomial Distribution / Pascal Distribution) 独立地重复进行成功概率为p的 Bernoulli 试验,记第 r 次成功时的试验次数为X。称 X ~ NB(r, p)。 分布列为 k−1PX==k−rr(k)(1−p)p,k=r,r+1, r−1L若记第i 1次成功之后至第 i 次成功时的试验次数为 X,=1,2,L,r,则 irX1,L,(p),且 X=r∑X。 ii=119
2. 常用连续型分布 1) 均匀分布 (Uniform Distribution) 若 . X 具有 . 11,ifx∈[a,b],p(x)=I[a,b(x)=]b−a b−a0,else.则称 X~ U[a,b]. . 为 0,x≤a,xx−aF(x)=∫p(t)d=,a<x≤b, −∞b−a1,x>b. 用于描述一类几何概型。 例如,Bertrand 悖论。在单位圆内任取一条弦,求弦长大于内接等边三角形的边长的概率。按照不同方法取弦,则会得到不同的概率值。 a) 假定在一条直径上按均匀分布随机取一点,过该点作垂直于该直径的弦。则所求概率为1/2。 b) 在圆上任取一点,按 U[0, pi] 任取一个角度作为弦切角大小作弦,则所求概率为 1/3。 c) 在圆内任取一点作为弦的中点。所求概率等于? 2) Gamma分布 常用作对“寿命”建模。 若 . X 具有 . 1pxab=a−1−/b(;,)xex()Γ(0,∞, )(a)baIx其中 a>0 称为形状参数 (shape parameter),b>0 称为尺度参数 (scale parameter)。则称 X~Gamma(a,b). 特例: � 卡方分布 (Chi square distribution)。当 b=2时,令ar=,则gamma分布的变为 20
1px=xr/2−1e−x/2(;r)I∞(x), r(0,)Γr/2()22称为自由度为r的卡方分布,记为Xc2 ~(r)。 � 指数分布 (Exponential distribution)。当a=1时,gamma分布的. 变为 1pb=−/b(x;)exI∞(x), b(0,)称为 X~Exp(b)。 指数分布具有无记忆性,即对于 ∀s>0,∀t≥0,有 P(X>s+t|X>t)=P(X>s). Gamma分布与Poisson分布的关系 若 X ~ Gamma(a, b),a 是一个正整数,那么,对于 ∀x>0 有 P(X≤x)=P(Y≥a), 其中 Y~Poi(x/b). 3) 正态分布 (Normal Distribution / Gauss Distribution) . p2112(x;m,)=exp{−(x−m)},x∈�. 2ps2s其中m∈�,s>0为参数。记作 X~Nms2(,)。 特点: � . 关于 x=m 对称;函数值在 x=m 处最大,有界;x→±∞时,p(x)→0。 � x=m±s是 . 的两个拐点。 � 固定 s,改变 m 的值,. 曲线形状不变,位置随 m 平移;固定 m 改变 s,则 .中心位置不变,形状随 s 变瘦高或矮胖。 标准正态分布: �m=s2 0,=1的正态分布为标准正态分布,. N(0,1)。 � 记 . 为 f(x),. 为 Φ(x)。 21
� 与Nm2 (,s)的分布函数F(x)、密度函数f(x)之间的关系: (Φx−m1x−mFx)=(), f(x)=f(). sss 4) Beta分布 . 为 ab1p=a−1b−1(x;,)x(x)I, ab(0,1)(x)B(,)其中 a>0,b>0为参数。 与二项分布的关系: 设 X~Beta(a,b),其中 a,b 都是正整数且 b=n−a+1,则对 ∀x∈(0,1) 有 F(x)=P(Y≥a), 其中 F(x) 为 X 的 .,Y~B(n,x). 5) Cauchy分布 . 为 1p(x;q)=,x∈(−∞,+∞), p2[1+(x−q)]其中 q∈(−∞,∞) 为参数。 22
第三章 随机向量 § 随机向量及其联合分布 1. 随机向量 定义 (随机向量)定义在样本空间S上的k个随机变量组成的k维向量(X1(s),L,X(s)) 称为k维随机向量 (random vector, r. vec.)。 k 定义 (联合分布函数)设 X=(X1,LX) 是k维 r. vec.,则称k元实值函数 k%F(x1,L,x)=PX≤xLX≤xxLx∈�k(1,,),(1,,) kkkk为 r. vec. X的联合分布函数 (.)。 % 注: l 定义在样本空间 S 上的 k维随机向量X,就是一个S→�k的映射。通过 X 可%%由概率空间 (S,F,P) 在 (�k,B�k) 上导出一个新的概率PX,称为X(导出)的%概率分布。∀B∈B�k, PX(B)=P(X∈B)=P({s:X(s)∈B}), %%其中 B�k是k维Borel域,它是包含所有k维“长方体”的最小sigma域。 l X的概率分布与其联合分布函数一一对应。 %kl {X1≤x1,L,Xk≤xk}I{s:X(s)≤x} iii=1l . 是理论研究的重要工具,但一般难以用于计算概率。 联合分布函数的基本性质: 若F(⋅) 是某个k维随机向量的联合分布函数,则 F(⋅) 必满足: a) (单调性) ∀x1<x2,F(x1,L,x−1,x1,x+,L,x)≤F(x1,L,x−1,x2,x+1,L,x); jjjjjkjjjkb) (有界性) 23
F(x1,L,−∞,L,x)=limF(x1,L,x1,x,x1,L,x)=0,j=1,L,k,k→j−jj+kx−∞jF(+∞,L,+∞)=1. c) (右连续性) ∀x∈�k,F(x1,L,x+0,L,x)=F(x1,L,x,L,x),j=1,L,k。 jkjk% 这三条是 . 的必要条件,但不充分。对于 k=2的情形,除 a)~c) 外二元函数 F(.) 还需满足 d) ∀a1<b1,a2<b2,F(b1,b2)−F(a1,b2)−F(b1,a2)+F(a1,a2)≥0 才能成为二元.。 例 二元函数 0,x+y<0,G(x,y)= 1,x+y≥0.满足二维 . 的性质 a)~c),但不满足d),故不是一个 .。 2. 离散型随机向量 定义 全部由离散型随机变量组成的随机向量称为离散型随机向量。 定义 设 k维离散型随机向量X的可能取值范围为D(必是一个可列集),称 %{pL=ˆP(X=x,L,X=x):(x,L,x)∈D} x1,k1kk1k为X的联合分布列。 % 注: l 离散型随机向量的性质完全由其联合分布列决定,分布列与.一一对应。 l 联合分布列的基本性质: a) 非负性:pL≥0,∀(x,Lx)∈D; x1,k1kb) 规范性:∑pL=1。 xL1,,xk(x1,,xk)∈Dl ∀A∈B�k,P(X∈A)=∑px1,L。 ,xk%(x1,L,xk)∈AIDl 二维联合分布列也常用表格形式表示。 例 从1、2、3、4中随机取一个数记为X,再从1~ X 中随机取一个数记为 Y。求:(1) (X,Y) 的联合分布列;(2) P(X=Y)。 解:(X, Y) 的可能取值范围为 D={(i,j):j=1,L,i,i=1,L,4}。∀(i,j)∈D, 24
11P(X=i,Y=j)=P(Y=j|X=i)P(X=i)=⋅。 i4联合分布列可用表格形式表示为: Y 1 2 3 4 X 1 1/4 0 0 0 2 1/8 1/8 0 0 3 1/12 1/12 1/12 0 4 1/16 1/16 1/16 1/16 4111125P(X=Y)=P∑{X=i,Y=i}=+++==。 i=148121648(X,Y) 的联合分布函数为 0y<1orx<1,1/4,1≤y,1≤x<2,1/4+1/81≤y<2,2≤x<3,1/42/8,2≤y,2≤x<3,1/4+1/81/12,1≤y<2,3≤x<4,F(x,y)=1/4+2/82/12,2≤y<3,3≤x<4, 1/4+2/83/123≤y,3≤x<4,1/4+1/8+1/12+1/16,1≤y<2,4≤x,1/4+2/8+2/122/16,2≤y<3,4≤x,1/4+2/83/12+3/16,3≤y<4,4≤x,1,4≤y,4≤x, 例 多项分布(Multinomial Distribution) 一次试验的结果可分为A1,L,A r个互斥的r类;一次试验的结果落入A类的概率为 P(A)=p>0,j=1,L,r,其中 jjjp1+p2+L+p=1。独立地重复n次试验,记A类结果出现的次数为 rjX,j=1,L,r。则称随机向量 (XMNnppL,p)。 j1,X2,L,X−1)~(;r1,2,r联合分布列为 Lnn−x1LxrPX=xxX1x2x(r11,−1=x−)=p1p2Lprx1x2xr n!=12rLpx1px2Lpx,x1!x2!x!r其中 x∈{0,1,L,n},j=1,L,r,且j∑r x=n。 j=1j 25
3. 连续型随机向量 定义 设随机向量X=(X1,L,X) 的. 为 F(xk1,L,x)。若存在非负实函数 k%p(x1,L,x) 使得 kLx1LxkF1L1LL�k(x,,x)=∫∫p(t,,t k)dtdtk,∀(x1,,xk)∈,−∞−∞则称 X为k维连续性随机向量,称 p(x1,L,x) 为X的联合密度函数 (.)。 k%% 联合密度函数的基本性质: (1) 非负性:p(x1,L,x)≥0∀x1Lx∈�k,(,); kk∞(2) 规范性:L∞∫∫p(x1,L,xk)dx1Ldxk=1。 −∞−∞ 其他性质: l ∀A∈B�k,P(X∈A)=∫L∫p(t1,L,t)dtLdt。有关连续型随机变量的事件k1k%A概率可通过联合密度函数的重积分来计算。 l 若 p(x1,L,x) 在 (xk1,Lx) 处连续,则 k∂kF(x1,L,xk)L=p(x1,L,x。 k)∂x1∂xk l 连续型随机向量的性质完全由其 jpdf 决定,jpdf 与.一一对应。 例 设 (X,Y) 的 . 为 Ae−2x−y,x>0,y>0,p(x,y)= 0,otherwise.求:(1) 参数A ; (2) (X,Y)的.; (3) P(X<1, Y>1); (4) P(X>Y)。 解:(1) A应使联合密度函数满足规范性,即 ∞∞∞1=∫pxydxdy=Ae−2x−y(,)dxdy−∞−∞∫0∫0∞1∞ =Ae−2x−1⋅−ey=A,002因此,A=2。 26
(2) ∀xy∈�2(,), xyF(x,y)=∫∫p(u,v)dvdu−∞−∞0x≤0ory≤0,=xy −2u−vedu⋅edv,x>0andy>0.∫0∫00,x≤0ory≤0,=1−2x−y(e)(1e),x>0andy>0.(3) P(X<1,Y>1)=∫∫p(x,y)dxdy{(x,y):x<1,y>1} 1∞=−2xy21∫∫edxdy=−−−(1e)(4) P(X>Y)=∫∫p(x,y)dxdy{(x,y):x>y}∞x=−x−y∫(∫22edydx00) ∞=2e−2x−∫(1ex)dx021=1−=.33 常用连续型多元分布 (1) 均匀分布。设D是k �中的子区域,“体积”为V>0。若 r. vec. X=(X1,L,X)k%具有 . 1p(x1,L,x)=I(x1,L,x), kVDk则称 X~U(D)。 % (2) 多元正态分布。设 m=(m1,L,m)'是k 维实向量,Σ是k阶正定矩阵。称具有k%. p−/21/211(x)=(2)|Σ|exp−(x−m)'Σ−(x−m),x∈� 2%%%%的r. vec. X~N(m,Σ)。 k%% 27
§ 边际分布 设X=(X1,L,X)是k维r. vec.,Y是X的一个 m维子向量,m∈{1,2,L,k−1},k%%%则称 Y的分布是X的边际分布 (marginal distribution)。 %% 描述边际分布的工具:边际分布函数;边际分布列;边际密度函数。 1. 边际分布函数 (.) l k=2。设 (X1,X2)的. 为 F(x1,x2),则 X1的 为 F1(x)=P(X1≤x1)=P(X1≤x1,X2<∞) limF(x1,x2)=ˆF(x1,∞),x1∈�.x2→∞同理,X2的 为 F2(x)=F(∞,x2),x2∈�. l k=3。设 (X1,X2,X3) 的. 为 F(x1,x2,x3),则 X1的 :F1(x)=F(x,∞,∞),x∈�. X2的 :F2(x)=F(∞,x,∞),x∈�. X3的 :F3(x)=F(∞,,x),x∈�. (X1,X2)的 :Fxx=Fx∞xx212(1,2)(1,2,),(1,2)∈�. 2. 边际分布列 设离散型随机向量 X=(X1,L,X) 的联合分布列为 k%{pL=ˆP(X=x,L,X=x):(x,L,x)∈D}, x1,k1kk1k则 X 的边际分布列为 jp(x)=P(X=)∑L∑∑L∑P(X1=x1,L,X=x)。 jjjkkx1x−1x+1xjjk 28
例 从一个装有2个白球、3个黑球的袋中随机地取球两次,每次一个。记第i次取得的白球数为X,i=1,2。求 (X及边际分布列。 i1,X2)的联合分布列(1) 有放回地取。 X2 0 1 X1的边际分布列 X1 0 (3/5)2 (3/5)(2/5) 3/5 1 (3/5)(2/5) (2/5)2 2/5 X2的边际分布列 3/5 2/5 (2) 无放回地取。 X2 0 1 X1的边际分布列 X1 0 (3/5)(2/4) (3/5)(2/4) 3/5 1 (3/4)(2/5) (1/4)(2/5) 2/5 X2的边际分布列 3/5 2/5 注:这两种情况下,两个分量的边际分布相同,但联合分布不同!所以,边际分布不能确定联合分布。 例 (X1,X2,L,X−1)~MN(n;pr1,p2,L,p)。求其边际分布列。 r 3. 边际密度函数 k=2。设(X1,X2)的. 为 F(x1,x2),jpdf 为 p(x1,x2)。则 X1的 mdf 为 F1(x)=P(X1≤x,X2<∞)x∞ ∫(∫p(t1,t2)dt2)dt1,x∈�.−∞−∞因此, ∞f1(x)=∫p(x,v)dv,x∈� −∞是 X1的 mpdf。 同理, ∞f2(x)=∫p(u,x)du,x∈� −∞是 X2的 mpdf。 29
例 设 (X,Y) 具有 . 1,0<x<1,|y|<x,p(x,y)= 0,otherwise.求:(1) 边际密度函数; (2) P(Y>1/2)。 例 设 X~N(m,Σ),求 X(1)=(Xk1,LX),r<k的边际密度。 r%%% § 条件分布 条件分布是条件概率概念的推广,用于描述随机变量之间的关系。设 (X,Y) 是k维%%随机向量,在给定 Y∈B 的条件下,m维子向量X的条件概率分布为 %%∈∈P(X∈A,Y∈B)P(XA|YB)=%%,A∈B�m。 %%P(YB)% 1. 离散型随机向量 k=2 的情形。设 (X1,X2) 的联合分布列为 {p=ˆP(X1=x1,X2=x):i=1,L,n1,j=1,L,n2}。 ijij若 p=P(X1=x1)>0,则在给定 X的条件下,事件 {Xi⋅i1=x1 i2=x2} 的条件概j率为 pPX=ij(2x2|X1=x1)ˆ==p。 jij|ipi⋅{p,j=1,L,n} 为给定 X条件下 Xj|i21=x1 i2 的条件分布列。 同理,p{p=ijˆ,i=1,L,n} 为给定X列。 i|j12=x2条件下Xj1的条件分布p⋅j 续例 (1) 有放回情形。 P(X=i,X=0)3/5,i=0,PX=12(1i|X2=0) P(X2=0)2/5,i=(X=i,X=1)3/5,i=0,P12(X1=i|X2=1) P(X2=1)2/5,i=1. 30
可见,已知X2取值的情况下,X1的条件分布都相同,且都与其边际分布相同。这说明X1与X2之间没有关系。 (2) 无放回情形。 X2 X1的边际X2=0时X1X2=1时X10 1 X1 分布列 的条件分布 的条件分布 0 (3/5)(2/4) (3/5)(2/4) 3/5 1/2 3/4 1 (3/4)(2/5) (1/4)(2/5) 2/5 1/2 1/4 X2的边际分布列3/5 2/5 可见,已知X1的条件分布随X2取值的不同而不同。这说明两者之间有关系。 2. 连续型随机向量 对于连续型分布的 r. vec. (X,Y),若 P(Y∈B)=0,则给定 Y∈B 条件下X%%%%%条件分布无法直接由条件概率来定义。但可以借助于极限的概念来处理。 以二维连续型随机向量 (X,Y)的情况为例。若给定 y,对于 ∀e>0,P(y−e<Y≤y+e)>0,且若 ∀x∈�,下列极限存在 limP(X≤x|y−e<Y≤y+e), e→0+则称此极限形成的函数为给定Y=y条件下X的条件分布函数,记为 FXY(x|y)。若|存在非负 fXY(x|y),使得 |xFXY(x|y)=∫fXY(u|y)du,∀x∈�, |−∞|则称 fXY(x|y) 为给定Y=y条件下X的条件密度函数。 | 定理 设(X,Y)是k维连续型随机向量,具有jpdf f(x,y)。Y是 k−m维子向量,%%%%%fY(y) 是其边际密度。若 fY(y)>0,则给定Y=y条件下X的条件密度函数为 %%%%%f(x,y)mfXxy=%|Y(|)%,x∈�。 %%%fY(y)%% 31
注:由定理知,jpdf f(x,y) 与 条件pdf有如下关系 %%fX(x)fYyxfx>fyf=|X(|),if X()0,Y()XY(x|y),if fY(y)>0,|f(x,y)=0,else.0,else. 例 设 (X,Y) 服从圆xyx2+y2 {(,):≤1} 内的均匀分布,求条件密度。 解:(X,Y) 的jpdf 为122 f(x,y)=I(x+y≤1)。X的mpdf为 p∞fX(x)=∫f(x,y)dy−∞ 1−2x2=2∫dy⋅I(x)=1−xI(x).−1−2(1,1)(1,1)xp−p−故x∈(−1,1) 时 fX(x)>0。给定 X=x(x∈(−1,1))条件下 Y 的条件密度函数为 f(x,y)1fYX(y|==I(y). |f(x)21−2−−22(1x,1−x)Xx同理可得,给定 Y=y(y∈(−1,1))条件下 X 的条件密度函数为 f(x,y)1fX|Y(x|==I(x). 22f(y)21−2(−1−y,1−y)Yy可见,mpdf fX(x) 与条件pdf fXY(x|y) 是不同的。这说明X与Y是有关系的。 | 例 设 (X,Y)~N(m,Σ),其中 X是m维子向量。求给定 Y=y条件下 X的k%%%%%%%条件密度。 § 随机变量的独立性 随机变量之间的独立性,也是随机事件独立性概念的推广。 定义 设 (X1,L,X) 是k维 r. vec.,其中X是k维子向量,rj∑rk=k。若有 jj=1j%%%rP(X≤x=Lk,j1,r)∏P(X≤x),∀(x1,L,x)∈�, jjjrj=1%%%则称子向量 X1,L,X 之间相互独立。 r%% 32
注:若(X1,L,X)的 jdf 为 F(xLx,则 Xr1,,)r1,L,X 之间相互独立等价于 r%%%%%%rF(x1,L,x)∏F(x)∀xLx∈�k,(,,), rjr%%=1%%%其中 F(⋅) 是 X 的mdf。 jj% 定理 随机向量 X1,L,X 之间相互独立等价于 r%%rrPI{X∈A}∏P(X∈A),∀A1∈B�k,L,A∈Bjjj1�k. r=1%=1% 注: l 对于离散型随机向量,X1,L,X 之间相互独立等价于 r%%rP(X=x,j=1,r)∏P(X=x),∀(x1,L,x)∈D。 jjjr%%%%%j=1 l 对于连续型随机向量,若 p(⋅)是X的mpdf,则 Xjj1,L,X 之间相互独立等价r%%%于 rp(x1,L,x)∏px,∀x1Lx∈�k()(,,) rjr%%=1%%% 是(X1,L,X)的jpdf。 r%% l 对于随机向量(X,Y),若对于任意使 pY(y)>0 的 y,在给定 Y=y条件下,%%%%%%%X的条件分布都与y无关,则 X,Y 相互独立。 %%%% 性质: 设 X1,L,X 之间相互独立,则若将它们分割成互不相交的m个块,则这m个r%%块各自的函数 Y1,Y2,L,Ym 之间相互独立。 33
例 (1) 续例. 有放回情形下 X1,X2相互独立,无放回情形下不独立。 一般地,二个离散型随机变量相互独立等价于它们的联合分布列的各行成比例,或者各列成比例。 (2) 设 (X1,X2)~U(D)。当 D 是�2中的矩形时,X1,X2相互独立;反之,不独立。 (3) 设 (X,Y)~N(m,Σ),其中Σ1Σ12kΣ=。则X,Y相互独立等价于Σ %%Σ'12=0。12Σ22%% § 随机变量、向量函数的分布 在概率统计的理论与应用中,经常涉及到计算随机变量或随机向量的函数的分布问题。设 X 是定义在概率空间 (S,F,P) 上的一个 k 维随机向量, gkm(⋅):�→� 是一个m维 (m≤k)的函数。记Y=g(X),那么,Y 是一个m维的随机向量,它的概率分布完全由X的概率分布决定。本节讨论如何根据 X 的分布来求 Y 的分布。 支撑(support):设p(x)是一个pdf或分布列,则称 X={x:p(x)>0} 为该分布的支撑。 若 Y=g(X),X是 X分布的支撑。则 Y分布的支撑为 Y={y:y=g(x),x∈X}。 一、X是离散型分布的情况 设 X 是离散型的 r. vec.,其分布列为 P(X=x),x∈X。则 Y 也是一个离散型 r. vec。其分布列的计算步骤为: 1) 计算出 Y的支撑 Y={y=g(x):x∈X }; 2) 计算 P(Y=y)∑P(X=x),∀y∈Y. ( 把相同的g(x)合并,对应{x∈X:g(x)=y}的概率值相加。) 34
例 (1) 设r. v. X 的分布列为 X -2 -1 0 1 2 P 求=X2 Y+X的分布列。 解:列表计算 Y 的可能取值: X -2 -1 0 1 2 Y=X2+X 2 0 0 2 6 P 得 Y的分布列为 Y 0 2 6 P (2) (Poisson 分布的独立可加性) 设 X~Poi(l),=1,2,且 X,Xjj12相互独立,则Y=X1+X2~Poi(l1+l2)。 解:显然,Y的支撑为非负整数。 kP(Y=k)=P∑{X1=i,X2=k−i}i=0k∑P{X1=i,X2=k−i}(卷积公式)i=0k∑P(X1=i)P(X2=k−i)(独立性) i=0=......1=l+lk−(l1+l2)(12)e,k=0,1,2,Lk!所以 Y~Poi(l1+l2)。 一般地,若 X~Poi(l),j=1,2,L,n,且 Xjj1,X2,L,Xn相互独立,则nnY=∑X~Poi(∑l)。 =1j=1j (3) (二项分布的独立可加性)若 X~B(n,p),j=1,2,L,m,且 XXLXjj1,2,,m相互独立,则mmY=∑X~B(n,p)j=1j∑。 =1j 35
二、X是连续型分布的情况 1. 一一对应变换 定理 设 r. vec. X=(X1,LX) 具有 jpdf p kX(x1,L,xk),其支撑为 X。y1=g1(x1,L,x)kx1=h1(y1,L,y)ky2=g2(x1,L,x)kx=hyLyk 在X→Y上一一对应,逆变换为22(1,,)LLLL, y=g(x1,L,x)kkkx=h(y1,L,y)kkk变换的 Jacobi 行列式存在,记为 ∂x1∂y1∂x2∂y1L∂x∂yk1∂(x1,L,x)∂x1∂y2∂x2∂yL∂x∂yk2J=k(y1,L=,y)LLLL。 k∂x1∂y∂x2∂yL∂x∂ykkkkY1=g1(X1,L,X)k则随机向量Y2=g2(X1,L,X)k pdf 为 LL 的 jY=g(X1,L,X)kkkLpX(h1(y,L,y),L,h(y1,L,y))⋅|J|,(y1,L,y)∈Y,p(1,,)=kkkkYyyk 0else. 例 (1) (对数正态分布LN(m, s 2))设XNms2 ~Y=eX(,),,求 Y 的pdf。 解:显然,X=�Y=�+,,且x y=e是X→Y 上一一对应的变换,逆变换为 x=logy,dx1J==。因为 X 的pdf 为 dyy2(x−m)1−p22X(x)=es,x∈�, 2ps故由定理得 Y的pdf为 2(logy−m)1−21e2s,y∈�+,pY(y)=2psy 0,else. 36
(2) (逆Gamma分布)设1 X~Gamma(a,b),Y=,求 Y 的pdf。 X (3) (多元正态的线性变换)设 X~N(m,Σ),Y=AX+b,其中 A是给定的k阶k非退化的方阵,b是给定的k维列向量。则 Y~N(Am+b,AΣA')。 k 2. m<k的变换 方法一,补一些变换,构造成一一对应变换,然后通过边际分布求得。 求随机变量和的分布。 设(X1,X2)~pX(x1,x2),求 Y=X1+X2 的分布。 先求 Y1=X1 的jpdf,然后对之积分获得Y的pdf,即 (Y1,Y)的mpdf。 Y=X1+X2由定理得, pY(y,y)=p1,1X(x1(y1,y),x2(y1,y))|J| =pX(y1,y−y1),因此,Y 的pdf为 ∞pY(y)=∫pX(y1,y−y1)dy1. (卷积公式) −∞若 X1,X2相互独立,则 ∞pY(y)=∫pX(y)p−。 −∞1X(yy21)dy1多个随机变量之和的分布也类似可求。 例 (1) (多元正态的线性变换)设 X~N(m,Σ),Y=AX+b,其中 A是给定的km×k阶行满秩矩阵,b是给定的m维列向量,m<k。则 Y~Nm(Am+b,AΣA')。 (2)(独立Gamma分布之和)设 X~Gamma(a,b),i=1,L,k,且XLX相互ii1,,k独立,则∑kGk YX~amma(∑a,b)。 =1i=1i 求随机变量商的分布。设(X1,X2)~pX(x1,x2),求 U=X1/X2 的分布。 37
先求U=X1/X2 的jpdf,然后对之积分获得U的pdf,即 (U,V)的mpdf。 V=X2由定理得, pUV(u,v)=pX(x(u,v),xu,v))|J|,12( =pX(uv,v)|v|,因此,U 的pdf为 ∞pU(u)=∫pX(uv,v)|v|dv. −∞ 方法二,先求 U的分布函数,再求pdf。 U 的分布函数为 FU(u)=∫∫pX(x,y)dxdyx/y≤u0∞∞uyp∫(x,y)dxdy+p(x,y)dxdy−uy∫0∫−∞Xlett=x/y0∞p∫X(ty,y)|ydtdyp(ty,y)ydtdy−∞−∫0∫ −∞∞u=∫∫p(ty,y)|y|dtdy−∞−∞∞p∫X(ty,y)|y|dyd−∞∫t,∀u∈�.−∞所以 U 的密度函数为 ∞pU(u)=∫pX(uy,y)|y|dy. −∞ 求随机变量最大值、最小值的分布。 设X1,X2,L,Xn . f(x)。记 Y=min(X1,X2,L,Xn), Z=max(X1,X2,L,Xn)。求 Y,Z的概率密度。 记 f(x) 对应的分布函数为 F(x)。Y 的分布函数为 FY(y)=P(Y≤y)=P(min{X1,L,X}≤y)=1−P(min{X1,LX}>y)=1−P(I{X>y}) =1=1−∏P(X>y)i=1n=1−[1F(y)],∀y∈�, 38
对其求导可得 Y 的pdf为 n−1fY(y)=n[1−F(y)]f(y),y∈�. Z 的分布函数为 FZ(z)=P(Z≤z)=P(max{X1,L,Xn}≤z)n=P(I{X≤z}) i=1=[F(z)],∀z∈�,对其求导可得 Z 的pdf为 n−1fZ(z)=n[F(z)]f(z),z∈�. 求次序统计量的分布——概率元法 3. “多对一”的变换 定理 设 r. vec. X=(X1,LX) 具有 jpdf pkX(x1,L,xk),支撑为X。X1,L,Xr是X的一个分割。函数 y1=g1(x1,L,x)kx1=h1(y1,L,y)iky2=g2(x1,L,x)kx=hyL,y)ikLL 在X→Y上一一对应,逆变换为22(1,iiLL, y=g(x1,L,x)kkkx=h(y1,L,y)kikk变换的 Jacobi 行列式存在,记为 J,i=1,L,r。 iY1=g1(X1,L,X)k则随机向量Y2=g2(X1,L,X)k f 为 LL 的 jpdY=g(X1,L,X)kkkrpY(y1,L,yk)∑pX(h1(y,L,y),L,h(y1,L,y))⋅|J|I(ikikkYy1,L,yk)。 ii=1 39
第四章 数字特征 虽然,随机变量、随机向量的统计规律可由其概率分布全面地描述,但实际应用中往往需要用少量数值去概括一个概率分布的主要特征。这些数值就称为概率分布的数字特征。数字特征完全由分布决定 常用的数字特征有: � 矩 (moments),包括原点矩与中心矩两类,数学期望、方差、协方差是其中最常用的数字特征。 � 与矩有关的数字特征,如标准差、偏度系数、峰度系数、相关系数等。 � 分位点(quantiles),常用的有第一四分位数、第三四分位数、中位数等。 � 与分位点有关的数字特征,如四分位间距、极差等。 � 众数。 § 数学期望 (Expectation) 数学期望是最重要、最基本的数字特征。直观含义是将随机变量的可能取值按其相应的概率加权平均。是刻划随机变量分布的中心位置的一种办法。源于17世纪Pascal对于分赌注问题的研究。 (分赌注问题)甲乙两人各出赌注50法郎,用轮流掷一枚均匀硬币进行赌博。规则是掷一次硬币算一局,得正面算甲胜,得反面算乙胜。谁先胜三局就赢得全部100法郎赌注。掷三次硬币后,甲胜两局乙胜一局,赌博因故中止。问这100法郎赌注该如何分配才算合理? 定义 设 . X 的分布函数为 F(x),g(x):�→�是一已知函数,若 Lebesgue-Stieltjes 积分∞∞ ∫|g(x)|dF(x)<∞,则称 L-S 积分 ∫g(x)dF(x) 为 g(X) 的数学期望,−∞−∞记为 Eg(X)。 注: (1) g(x)≡x时,即得 EX。 b(2) L-S 积分是 Riemann-Stieltjes 积分的推广。[a,b] 上R-S 积分 ∫g(x)dF(x) 的含an义是:和式 ∑g(x)[F(x)−F(x−1)] 在分割细度趋于零时的极限。 iiii=1 40
(3) 当 F(x) 为阶梯函数时,即 X 具有离散型分布,设其分布列为 {P(X=x):x∈X},则 Eg(X)=∑g(x)P(X=x)。 x∈X(4) 若 X 具有连续型分布,∞p(x)为其密度函数,则 Eg(X)=∫g(x)p(x)dx,此处的−∞积分往往等同于Riemann积分。 (5) 若记 Y=g(X),其分布函数为 FY(y),则可证明 ∞∞EY=∫ydFY(y)=g(x)dF(x)−∫。 −∞ 定义 设 . (X1,L,Xn) 的分布函数为 F(x1,L,xn),g(x1,L,x):�nn→�是一已知函数,若 Lebesgue-Stieltjes 积分 ∫|g(x1,L,xn)|dF(x1,L,xn)<∞,则称 L-S �n积分 ∫g(x1,L,xn)dF(x1,L,xn) 为 g(X1,L,Xn) 的数学期望,记为 �nEg(X1,L,Xn)。称 (EX1,L,EXn) 为 . (X1,L,Xn) 的期望向量。 注: (1) 若记 Y=g(X1,L,Xn),其分布函数为 FY(y),则可证明 ∞EY=∫ydFY(y)=∫g(x1,L,xn)dF(x)。 −∞�n特别地,取g(x1,L,xn)=xj,则得 L∞EX=∫xdF(x1,,x)=∫xdF(x)。 jjn−∞jjj�n(2) 当 (X1,L,Xn) 具有离散型分布时, Eg(X,,X)=∑g(x1,L,xn)P(X1=x1,L,Xn=xn)。 (x1,L,xn)∈X(3) 当(X1,L,Xn)具有连续型分布,p(x1,L,xn)为其密度函数,则 Eg(X1,L∞,n)L∞X=∫∫g(x1,L,xn)p(x1,L,xn)dx1Ldxn, −∞−∞此处的积分一般等于n-重积分。 41
数学期望的性质 (1) 若 a≤g(x)≤b,∀x,则 a≤Eg(X)≤b。特别地,Ec=c。 (2) (线性性质)E[ag1(X)+bg2(X)+c]=aEg1(X)+bEg2(X)+c。 (3) 若 g1(x)≥g2(x),∀x,则 Eg1(X)≥Eg2(X)。 (4) 若 X1,L,X相互独立,X�k 的维数为 k,jf(⋅):→�,j=1,L,r,则 rjjj%%%E[f1(X)Lf(X)]=Ef1(X1)LEf(X)。 rrr%%%% 注 性质中 X 可以是 n-维随机向量,相应的g(⋅),g1(⋅),g2(⋅)为�n→�的函数。 例 (1) 设 X~B(n,p),则 EX=np。 (2) 设 X~Poi(l),则 EX=l。 (3) 设 X~Ge(p),则1 EX=。 pa+b(4) 设 X~U(a,b),则 EX=。 2(5) 设 X~Exp(l),则1 EX=。 l(6) 设Nms2 X~(,),则 EX=m. (7) 设 X 的分布列为 PXk−k(1)2/k=−=2,=1,2,L。虽然 ∞∑(−1k−k)2/k⋅2=−log2, k=1但该级数不绝对收敛,所以X的期望不存在。 (8) 设 X 服从 Cauchy分布,pdf为1 p(x)=,x∈�,则EX不存在。 p2(1+)(9) 设XNms2Y=eX2 ~(,),~LN(m,s),则 12∞1−−m2s(x)m+EY=EXxe∫ee2s2dx=e2。 −∞2ps 42
(10) 设 X1,(l),Y=max(X1,X2),则 ∞∞EY=∫max(x1,x2)p(x1)p(x2)dx1dx−∞∫−∞2x1∞∞∫xp(x)p(xdxd+011212∫0∫x2p(x1)p(x2)dx1dx2 x13=.2l(11) 设 X~HG(n;N,M),即分布列为 MN−Mkn−kP(X=),k=max{0,n−(N−M)},L,min{M,n} Nn则M EX=n⋅。 Nn(12)Xc2 ~(n),EX=n;X~t(n),EX=0(n>1);X~F(m,n)EX=(n>2).n−2 § 方差 (Variance) 定义 若 E−EX2(X) 存在,则称之为 . X 的方差,记为 Var(X)。称Var(X)为X的标准差(standard deviation, std)。 方差是刻划随机变量取值分散程度的一个量,方差越小说明X的取值越集中,越大则越分散。方差存在则期望一定存在;反之不然。 计算方法 ∑x−EX2()P(X=x),X离散型分布,l Var(X)=x∈X ∞2∫(x−EX)p(x)dx,X连续型分布.−∞l2 Va=EX−EX2r(X)() 43
方差的性质 (1) c为常数,则 Var(c)=0。 (2) a,c为常数,则aX+c=a2 Var()Var(X)。 (3)2 Var(X)=minE(X−c)。 cnn(4) 若 X1,L,Xn 相互独立,则 Var(∑X)∑Var(X)。 iii=1i=1(5) (Chebyshev 不等式m=EXs2) 若 ,=Var(X),则对 ∀t>0,有 s2P(|X−m|≥t)≤。 2t若令 t=cs,则有 1P(|X−m|≥cs)≤。 c2Chebyshev不等式的一般形式: 设X是一个.,g(x)是一个非负函数,则对∀EgXr>0,有() P(g(X)≥r)≤。 r(6) Var(X)=0⇐⇒P(X=EX)=1. 随机变量的标准化 若m=s2 EX,=Var(X)>0,则称*X−m X= 是X的标准化。易知,sEX*=0X*,Var()=1。 例 (1) 设 X~B(n,p),则 EX=np,Var(X)=np(1−p)。 (2) 设 X~Poi(l),则 EX=l,Var(X)=l。 (3) 设1−p X~Ge(p),则1 EX=,Var(X)=。 pp2(4) 设 X~U(a,b),则a+b EX=,1Va2r(X)=(b−a)。 212(5) 设 X~Exp(l),则1 EX=,1Var(X)=。 ll2 44
(6) 设 X~Nms2(,),则 EX=m,Va2r(X)=s。 (7) X~c2(n),EX=n,Var(X)=2n;nX~t(n),EX=0(n>1),n>2时Var(X)=; n−2X~F(m,n),EX=?Var(X)=? § 协方差与相关系数 协方差与相关系数是刻划两个. 之间线性相关程度的数字特征。 定义 若E(X−EX)(Y−EY)存在,则称之为. X 与 Y 的协方差,记为 Cov(X,Y)。定义CovX,Y) 若Var(X)⋅Var(Y)>0,则称(为 X与Y的相关系数,记为rVX,Y。 ar(X)Var(Y) 注: >0,称X,Y正相关l Cov(X,Y)(orrX称不相关 ,Y)=0,X,Y<0,称X,Y负相关l 设** X,Y 分别是 . X, Y 的标准化,则Co** v(X,Y)=rX=。 ,YrX*Y*, 性质 1. Cov(X,Y)=Cov(Y,X)。 2. Cov(X,Y)=E(XY)−EX⋅EY。 3. Cov(X,X)Var(X);Cov(X,c)=0,∀常数c。 4. Cov(aX+b,cY+d)=acCov(X,Y)。 5. Cov(X1+X2,Y)=Cov(X1,Y)+Cov(X2,Y)。 6. 与方差的关系:Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)。 7. (Cauchy-Schwartz 不等式) 对任意随机变量2 X,Y 有 E≤X2⋅EY2[(XY)]E;等号成立当且仅当存在不全为0 的 45
a, b, 使得 P(aX+bY=0)=1。 推论C21. [ov(X,Y)]≤Var(X)⋅Var(Y);等号成立当且仅当存在不全为0 的a, b, 使得 P(aX+bY=c)=1。 推论2. ∀X,Y,|rX,Y|≤1; rXY=±1⇐⇒∃a≠0,b,∋P(Y=aX+b)=1,,且当a>0时rX=当a<时 r=−,Y1,0X,Y1. 8. (独立与不相关) 若 X, Y 独立,则 Cov(X,Y)=0;反之不成立。 例 设 (X,Y) 服从单位圆内的均匀分布,则 Cov(X,Y)=0 但两者不独立。 例 设 (X,Y) 服从二元正态分布,则 X与Y相互独立等价于 Cov(X,Y)=0。 定义 设 X=(X1,L,Xn)' 是一个随机向量,记 b=Cov(X,X),称 ijij%(b)n×n=ˆCov(X,X) 为X的协方差矩阵;记 r=r称 (r)×=ˆ(,X)ijijX,X,ijnnCorrXij%%%%%为X的相关系数矩阵。 % 性质: 若 Cov(X,X),i,j=1,L,n存在,则 Cov(X,X),Corr(X,X) 非负定。 ij%%% 例 若 X~N(m,Σ),则 kEX=m;Cov(X,X)=Σ;X1,L两两不相关等价于X1,L,X独立 .k 46
§ 其他数字特征 矩及与矩有关的数字特征 k阶原点矩:EXk,k=1,2,L k阶中心矩:E(X−EXk),k=1,2,L 偏度系数:E−3(XEX)g3= V3/2[ar(X)]峰度系数:EX−EX4()g4=−3 [V2ar(X)]变异系数:Var(X)CV=(EX>0) EX对于随机向量,还常用到各阶混合矩。 条件期望与条件方差 E(X)=E[E(X|Y)] Var(X)E[Var(X|Y)]+Var[E(X|Y)] 与数学期望有关的常用不等式 1. Chebychev’s Inequality 设EgXX是一个.,g(x)是一个非负函数,则对∀r>0,有() P(g(X)≥r)≤。 r 2. Hölder Inequality 设 X, Y 是任意两个随机变量,常数 p, q 满足11 +=1,则 pq11|EXY≤EXY≤EXpEYq|||(||)(||)。 3. Cauchy-Schwartz Inequality 设 X, Y 是任意两个随机变量,则 11EXY≤EXY≤EX2EY2||||(||)(||)。 47
4. Minkowski Inequality 设 X, Y 是任意两个随机变量,则对 ∀p∈[1,∞) 有 111E|X+Ypppp|≤(E|X|)+(E|Y|)。 5. Jensen Inequality 设 g(x) 为 (a,b) 上的凸函数,X 是 (a,b) 上的随机变量且 EX有限,则 g(EX)≤Eg(X)。 若 g(x) 严凸且 P(X≠EX)>0,则不等号严格成立。 (多元情形) 随机向量 X 定义于开凸集k S∈�上,且X 的期望向量 EX 存在、有限,g(x) 为 S 上的凸函数,则 g(EX)≤Eg(X)。若 g(x) 严凸且P(X≠EX)>0,则不等号严格成立。 48
第五章 特征函数 特征函数是分布函数的Fourier变换,是全面描述概率分布的又一个工具,在处理有些问题时非常方便。它能把求解独立同分布随机变量和的分布的卷积运算转换成乘法运算,能把求分布各阶矩的运算转换成微分运算,还能把求随机变量序列极限分布的问题转换为一般的函数极限问题。 一、随机变量的特征函数 定义 (特征函数) 设 X 是一个随机变量,分布函数为 F(x) ,则称 ∞j(=EitX()=itxte∫edF(x),t∈(−∞,∞) −∞为 X (或 F(x)) 的特征函数 (characteristic function)。其中 i=−1 是虚数单位。 注: l 由欧拉公式知 eitx=cos(tx)+isin(tx),因而 j(t)=Ecos(tX)+iEsin(tX),它是一个实变量的复值函数。由于eitx ||=1,所以特征函数 j(t) 对∀t∈(−∞,∞) 都有意义。 l 特征函数只依赖于分布函数,由分布所决定。 l 若 X 服从离散型分布,分布列为 {P(X=x),j=1,2,L},则X的特征函数为 j∞jitxj(t)∑eP(X=x),t∈�; jj=1若 X 具有连续型分布,密度函数为 p(x),则 X 的特征函数为 ∞j=itx(t)∫ep(x)dx,t∈�。 −∞ 特征函数的性质 设 j(t) 是某个随机变量的特征函数。 性质1. |j(t)|≤j(0)=1,j(−t)=j(t). 性质2. j(t) 在 (−∞,∞) 上一致连续。 50
性质3. (非负定性) 对任意正整数 n、任意实数 t1,L,tn,及任意复数 z1,L,zn,有 nn∑∑j(tu−tv)zuzv≥0。 u=1v=1性质4. 设 Y=aX+b,其中 a,b 为常数,则 Y 的特征函数为 j()=ibtYtejX(at)。 性质5. 两个独立随机变量之和的特征函数等于它们的特征函数之积,即若X与Y相互独立,则 jX+Y(t)=jX(t)⋅jY(t)。该性质亦可推广到n个独立随机变量之和的情形。 性质6. 若X的k阶矩存在,则 X的特征函数 j(t) 可 k次微分,对 m≤k有 j(m)=mEXm(0)i(), 且有如下展式 2k(it)j=++EX2(it)+L+EXk+otk(t)1(itEX()。 2!k! 逆转公式与唯一性定理 定理 (逆转公式) 设随机变量 X 的分布函数为 F(x),特征函数为 j(x),则对 F(x) 的任意两个连续点 x1<x2 有 1−itx1−−itxTee2F(x2)−F(1)=limj(t)dtT→∞2p∫。 −Tit 定理 (唯一性定理) 随机变量的分布函数由其特征函数唯一决定。 定理 若特征函数 j(t) 绝对可积,即∞ ∫|j(t)|dt<∞,则其相应的分布函数 F(x) −∞的导数存在且连续,而且 1∞F'(x)=e−itxj(t)dt2p∫。 −∞ 常用分布的特征函数 (1) 退化分布 P(X=c)=1:j(=eictt)。 51
(2) B(n,p):nj()=ittpe(1p)+−。 it(3) Poi(l):j=el(e−1)(t)。 eibt−eiat(4) U(a,b):j(t)=。 it(b−a)s22t2imt−N0j=e−t2(5) (,1):(t); Nms2(j2,):(t)=e。 itExpljt=−−1(6) ():()(1)。 l(7) Gamma(a,):j()(1b−abt=−it)。 |t|(8) t(1)(Cauchydistribution): j(t)=e−。 二、随机向量的特征函数 定义 (随机向量的特征函数) 设随机向量 (X1,L,X) 的分布函数为 F(xL,k1,,x)k则称 L∞∞j=i(t1X+Lt)(kXit1x1++t)(,,)=LLkxk(1,L,)1L∈�kttEeedFxx ∫∫k,(t,,t−∞−∞k)为 (X1,L,X) (或F(x 的特征函数。 k1,L,x))k 性质 设 jk(t),t∈� 是k维随机向量的特征函数。 %%(1) |j(t)|≤j(0)=1,j(−t)=j(t). %%%% (2) j(t) 在k � 上一致连续。 % (3) 两个相互独立、维数相同的随机向量之和的特征函数等于它们的特征函数之积,即若X与Y相互独立,则 jX+Y(t)=jX(t)⋅jY(t)。该性质可推广到n个独立随机向量之和的%%%情形。 (4) (唯一性定理)随机向量的分布函数与特征函数一一对应。 (5) EXm1LXmk 若矩 (1) 存在,则 k 52
m1+L+mLL∂kXmXm(1k=i−(m++mjtEk)1k)()m1Lm%。 ∂t∂tkt=0%% (6) 设k维随机向量X=X(1)X(2)j(1)(2) (,)~(t,t,其中m (m<k)维子向量 %%X(1)~jt(1)1(,k−m维子向量X(2) ~jt(2)2(。则 %%(a) X1)的特征函数j(1)(1) 1(t=j(t,0); %%%(1)b) X(2),X相互独立当且仅当(1 j)(2)=j(1)j(2)(t,t1(t2(t。 %%%% (7) 若 X~j(t),Y=AX+b,则 Y的特征函数为 jib'tY(t)=e%%jX(A't)。 %%%% (8) k维随机向量 X 的分布由一切形如 ak'X,a∈� 的分布唯一决定。 %%证:因为 a'X的特征函数为j=it(a'X) a(t)Ee%。取 t=1 得j=ia'X (1)aEe%,%%%把它看作 a 的函数正好是 X 的特征函数。由唯一性定理知,它决定了X的分布。 % 多元正态分布的特征函数 1itm−tΣtX~N(m,Σ),则 X 的特征函数为''j(2 t)=e%%%%。 k%% 三、其他生成函数 矩母函数 (moment generating function):设 X~F(x),若存在 h>0,使得 ∀t∈(−h,h), EetX 存在,则称 MtXX(t)=Ee 为X (或F(x)) 的矩母函数。 累积量生成函数 (cumulant generating function):K(t)=log[MX(t)]。 53
第六章 概率极限定理 一、 依概率收敛 (Convergence in Probability) 定义 (依概率收敛)设 X1,X2,L 是一个随机变量序列,X是一个随机变量。若对 ∀e>0,有 limP(|Xn−X|<e)=1, n→∞则称序列 {Xn} 依概率收敛于 X,记作 Xn→PX。 注: 序列 {Xn} 服从大数定律(Law of Large Numbers) 等价于 Yn→P0,其中 1nYn=∑X−a。 inni=1 常见的大数定律 1. (常用的形式) 设 X1,X2,L .,EX=m21,Var(X1)=s<∞,记1n Xn=∑Xi。ni=1则 Xn→pm。 (用Chebyshev 不等式可证) 2. (Chebyshev LLN) 设 X1,X2,L 是一列两两不相关的随机变量序列,各个变量的方差存在且有共同上界,即 Var(X)≤c,i=1,2,L。则 i1n∑1nX−∑EX→0。 iipni=1ni=1 3. (Markov LLN)设 X1,X2,L 是一列两两不相关的随机变量序列,各个变量的方差存n在,且满足11n Var∑X02i∑1n X−∑EX→0。 iipn→。则ni=1i=1ni=1 4.(辛钦LLN)设 X1,X2,.,若 EX1=m 存在,则 Xn→pm。 54
定理 (斯鲁茨基定理)设 {X1n≥1},{Xn≥1},L,{Xn≥1} 是 k个随机变,2,k,n量序列,且 X→Paj(n→∞),j=1,L,k, j,n又 R(x1,L,x)是k元有限的有理函数,则有 kR(X1,n,L,X,n)→PR(a1,L,ak)。 k 定理 设 Xn→PX,h(⋅)是一个连续函数,则 h(Xn)→Ph(X)。 二、 几乎处处收敛 (Almost Sure Convergence) 定义 (几乎处处收敛)设 X1,X2,L 是一个随机变量序列,X是一个随机变量。若对 ∀e>0,有 P(lim|Xn−X|<e)=1, n→∞则称序列 {Xn} 几乎处处收敛于 X,记作 Xn→.。 注: l 几乎处处收敛强于依概率收敛。通常前者可以推出后者,反之不行。 l 一个依概率收敛的序列,可以找到一个几乎处处收敛的子列。 n定理 (强大数定律) 设 X1,X2,L .,EX1=m存在,记1 Xn=∑Xi。则 ni=1Xn→.。 三、 分布收敛 (Convergence in Distribution) 定义 (分布收敛)设 F(x),F1(x),F2(x),L 是一个分布函数的序列,若对 F(x)的每个连续点 x 都有 limFn(x)=F(x), n→∞则称分布函数序列 {Fn(x)} 弱收敛于 F(x),记作 Fn(x)→WF(x)。 55
若随机变量序列 X1,X2,L 的分布函数 Fn(x)弱收敛于随机变量 X 的分布函数,则称序列 {Xn} 按分布收敛于 X,记作 Xn→DX。 定理 若 Xn→PX,则 Xn→DX。 定理 Xn→Pc(c 为常数) ⇐⇒Fn(x)→WF(x),其中 Fn(x)是Xn的分布函数,F(x)是退化分布 P(X=c)=1的分布函数。 定理 分布函数序列 {Fn(x)} 弱收敛于分布函数 F(x) 的充要条件是相应的特征函数序列 {jn(t)} 收敛于 F(x) 的特征函数j(t)。 中心极限定理的一个常用的形式。设 X1,X2,L .,EX=m21,0<Var(X1)=s<∞,记1n Xn=∑Xi。则 ni=1x12X−ms≤x=/2limP{ny(n)}n∫e−dy→∞。 −∞2p 定理 (Slutsky) 若 Xn→DX,Yn→Pa,则 a) YnXn→DaX; b) Xn+Yn→DX+a。 56
第七章 样本与统计量 一、 统计学概述 1. 统计学(statistics) 的由来 统计源于社会活动中的计数需要,历史可以追溯到原始社会。早期主要为统治者了解人口、土地、财富等国情的需要服务。 对statistics一词的由来说法不一,例如有 � 源于意大利,统计学即国情学(陈希孺《机会的数学》,p55); � 源于1660年德国人Hermann Conring(Iversen, G. R.等著,吴喜之等译《统计学--基本概念和方法》,p2); � 源于十八世纪中叶德国学者G. Achenwall(,《统计与真理--怎样运用偶然性》,p31); 等等。 2. 统计学 统计学是一门关于收集和分析数据的科学和艺术。(《不列颠百科全书》) 统计学内容包括:收集数据、分析数据、并从中得到有用信息为决策提供依据的一系列概念、原则和方法。是一门研究数据的学问。 3. 数理统计(mathematical statistics) 以研究推断方法为主要目的,是统计学的一个分支,也是现代各类统计学的基础。 研究的数据 —— 带有随机性的数据。 研究的方法 —— 以概率论等数学方法为工具 研究的内容 � 如何有效地收集数据:采用各种随机抽样方法收集数据,使数据代表性好、尽量避免主观干扰。有抽样调查、试验设计两个分支。 � 分析数据:将研究对象的全体视为总体,将获得数据的部分个体视为样本,采用数学模型描述总体、样本及两者间的关系,由样本数据推断总体信息。 分析方法有参数估计、假设检验、回归分析、时间序列分析、多元分析、非参数分析等等 与概率论的差别:是归纳推理而不是演绎。可视为概率论的一种应用。 本课程中,主要介绍一些统计分析的思想与方法,对数据收集方法不作详细讨论。 4. 统计学的应用领域 应用涉及:社会、经济状况调查,民意测验、市场调查、收视率调查,保险、金融,司法,交通,气象、地质,医药、疾病研究,生物、遗传研究,心理学、教育学研究,语言学研究,航天航空,质量管理等等。 与具体应用领域相结合,形成特定领域的统计学分支学科,如:计量经济、金融统计、教育统计、国民经济统计、可靠性统计、生存分析、保险统计、生物医药统计等等,这些分支学科大多以数理统计为基础。 57
二、 总体与样本 总体(population) 一项统计研究关心的往往是某个特定群体的整体信息。我们称该特定的群体为总体。 总体由个体(element)构成。 个体是承载数据的基本单位。数据收集是针对个体进行的。但是,统计研究中,收集个体的数据不是为了研究个体本身,而是为了从个体数据中得到总体的信息。 变量:一项统计研究通常不会对每个个体的一切方面都感兴趣,而只对它的某一项或几项数量指标感兴趣。由于一个数量指标在各个体上的取值往往是不同的,因而常称为变量,用大写英文字母 X, Y,... 等表示。 总体分布 欲研究的某些变量在总体中取各种值的比例分布称为总体分布(类似于概率分布)。统计研究主要关心的是某些变量的总体分布情况,所以常把总体分布与总体等同看待。 总体分布族 对欲研究的总体分布,往往有些信息已知,有些信息未知、需要推断。数理统计中,往往会根据一些已知的信息,对总体分布作一个合理的模型假定。即假定待研究的总体分布是某个分布族 {F(x;q):q∈Θ} 中的一员,其中 q 表示总体分布中的未知的信息。总体分布究竟是这个分布族中的哪一个,取决于 q。如果q是一个维数有限的未知参数向量,则称相应的总体分布族为参数型的;否则,称为非参数型的。 例 (1) 为了解上海市居民家庭经济情况,从市区常住户口中随机选取500户,对他们去年的收支情况进行详细记录,获得统计数据。根据这些数据对全市家庭去年的收支情况作推断。 总体:全部上海市的居民家庭。个体:家庭。变量:各项收入、支出。 (2) 收视率调查。AC尼尔森公司从上海市居民中随机选取1000户,对每户中若干成员收视各电视节目的情况用仪器作详细记录。由此对各电视台、节目的收视情况作推断。 总体:全部上海市居民。个体:居民。 若用X=1表示一个居民一周中看过某节目,X=0表示未看过,则X就是一个变量,其总体分布可用B(1,p)来表示。p是指全部上海市民一周中看过该节目的人数比例。 若Y表示一个居民一周中看某节目的时间,则 Y的总体分布可以用某种取值非负的随机变量的概率分布来描述。 样本(sample):总体中的部分个体构成的集合。 样本容量(sample size):样本中所含个体的数目。 抽样是统计研究中的最常用的一种手段。只要样本对总体有良好的代表性,那就可以对总体进行合理的推断。抽样方法对样本的代表性有重要影响。 58
通常采用随机抽样,其主要优点: � 采用随机化机制抽样,不受主观意志的误导,样本代表性好。 � 能借助概率统计理论科学地推断总体信息,并对误差大小给出估计。 � 能根据精度要求、费用限制,事先确定合理的样本容量。 若采用随机方法抽取一个容量为n的样本,那么抽样之前哪些个体被抽中是不确定的,因此变量X的样本观测值也是随机的,记为 X1,X2,L,Xn,其联合分布称为样本的分布。抽样之后,变量X的样本观测值确定下来了,记为 x1,x2,L,xn。 样本的分布取决于总体分布与抽样方法,是统计推断的主要依据。 独立同分布(.)的样本(也称简单随机样本)是数理统计中研究得最多的一种情况,满足如下两条性质: � 代表性:样本每一个分量 Xi 的边际概率分布都与总体分布相同; � 独立性:样本各分量 X1,X2,L,Xn 之间相互独立。 对于有限总体进行有放回、等概率的随机抽样得到的就是.样本;但是采取不放回抽样得到的就不是 . 样本。对于无限总体,如果样本可视为在相同条件下重复观测获得,且各次观测之间互不影响,那么,. 是对样本的一种合理假定。 . 样本的分布结构较为简单。设总体分布函数为 F(x;q),q 表示未知参数。那么. 样本(X1,X2,L,Xn)的联合分布函数为 nF(x1,L,x;q)=∏F(x;q)sampleni=1i。 若总体分布是连续型的或者离散型的,具有概率密度函数 p(x;q),则. 样本的联合密度函数为 np(x1,L,x;q)=(;)samplen∏pxq。 i=1i 三、 描述性统计分析 在收集了数据(样本或普查数据)之后,首先要对数据进行适当的整理、汇总,可以帮助我们: � 检查数据中是否有错漏; � 概括数据的主要特征、揭示潜在结构(分布形状如何、变量间的相互关系如何、是否有离群点等); � 为进一步的分析提供启示。 59
常用方法: � 图形:点线图、茎叶图、盒子图、直方图;条形图、饼图;散点图、时间序列图等。 � 表格:频率分布表、列联表等。 � 常用统计量:众数、中位数、均值;极差、方差、四分位间距;相关系数等。 注意:不同的方法适用于不同类型的数据。 四、 统计量与抽样分布 定义 设 (X1,X2,L,Xn) 是从某总体中抽取的一个容量为 n 的样本;T(x1,L,xn)是一个实值或实向量值函数,不含任何未知参数,且定义域包含(X1,X2,L,Xn)的样本空间。则称 T=T(X,X,LX) 为统计量(statistic),其概率分布12n称为抽样分布(sampling distribution)。 统计量就是概括、分析样本观测数据的方法。抽样之前,因样本的随机性,统计量也是随机的。通过抽样分布就能了解统计量所反映的总体信息,以及用之作推断时的效果好坏、误差大小。抽样分布的研究时数理统计学的一项重要内容。 例 设总体X~Nms2(,),其中2 m,s 是未知参数。从中抽取一个简单随机样本 (X1,L,Xn),则1n X∑X,T1=X1+X2,T2=X−X 都是统计量。 i(n)(1)n=1(T1,T2)是一个二维的统计量。但X−m X−m, 不是统计量。由正态分布性质知 ss2X~N(m,),这就是统计量 X的抽样分布。 n 常用统计量及其抽样分布 设 (X1,L,Xn) 是来自某总体的样本。 1. 样本均值1n X=∑X。样本均值主要反映总体均值的信息。 ini=1定理样本均值的性质:22s1.若X1,L,(m,s),则X~Nm,.n2若,,总体X,总体分布的均值为m,方差为s,则 EX=mVa2(1),r(X)=sn;2(2当样本容量充分大时,snX~&Nm,.n 60
2. 样本方差 n称2S21=∑(X−X 为样本方差,称=2 SS为样本标准差。称i)n−1i=12S21nn=∑(Xi−X)为有偏方差。样本方差主要反映总体方差的信息。 ni=1 常用公式 nnnQ∑2X−X∑X22−nX∑X−−−c2()(c)n(X)。 iiii=1=1i=1 定理样本方差的性质:1.若XLX总体,总体分布的方差为2,则 221,,(S)=s;2. 若XX21,,(m,s),则2s(1)X~Nm,; nn−S2(1)c2(2)~(n−1);s2X与S2(3)相互独立;n(X−m)(4T=~t(n−1).S 3. 样本矩 (sample moments) 样本各阶矩主要反映总体各阶矩的信息。 n样本v阶原点矩1 A=∑Xvvi,样本v阶中心矩1nvBv=∑(Xi−X)。 ni=1ni=1 定理(样本矩的性质)X1,L,.总体X。(1)若总体分布的v阶原点矩m存在,则E(A)=m; vvv若m存在,则12(22Var(A)=(m−m).vvvvn 4. 样本偏态系数、峰态系数 样本偏态、峰态系数主要反映总体分布的偏态、峰态系数的信息。 61
称B3BSk==3为样本偏态系数,B3/2S23/22(n) 称KuB4B=−3=4−3为样本峰态系数。B22(Sn) 5. 次序统计量 (order statistics) 设(X1,L,Xn)是从总体X中抽取一个容量为n的样本,将它们从小到大排序为X≤L≤X。称XL为样本的次序统计量;称X为 (1)(n(,,)(1)(n)(i)第i个次序统计量。 X=min{XXLX;(1)1,2,,n}称为最小次序统计量X=max{X,X,L,X}称为最大次序统计量; ()12R=X称为样本极差。(n−X(range))(1) 若总体分布已知,那么单个次序统计量、若干个次序统计量的联合分布都是可以求的。 关于连续型分布总体的次序统计量的抽样分布的主要结果: 设(X1,X2,L,Xn是取自总体X的一个简单随机样本,X的分布函数是F(x),密度函数是p(x)。则: (1)第k个次序统计量的.为nn−k+1k−1n−kp(x=[F(x)]p(x)[1F(x)k] k−11n!Fk−1n−k[(x)][1F(x)]p(x)(k−1)!(n−k)! (2)第j,第个次序统计量(j<k)的.为p(x,x)=jkjkn!j−1k−j−1Fn−k(x)F(x)F(x)Fxpxpxk[1()k]()(),jk(j−1)!(k−j−1)!(n−k−)!ifx<x;jk0else. 样本极差的分布可由最大、最小次序统计量的联合分布推导得到。 62
例 设X1,L,(l),则:的为nl−nlxe,x>0,•Xpdfp(x)=(1)10,x≤0.的为nle−lxn−1−(1)elx,x>0,•Xnpdfpn(x)=()0,x≤0.•(X,Xn的jpdf为(1)()n−l2−l(x+y)−lx−lyn−2(1)e(ee),0<x<y,p1,n(x,y)=0,else.•极差R的pdf为n−le−lre−lrn−2(1)(1),r>0,pR(r)=0,r≤0. 注: l 只有在少数几种总体分布下,少量几个统计量的精确分布能够用简洁的公式表示出来。 l 对于简单随机样本,当样本容量足够大时,由中心极限定理可得,样本矩等统计量渐近地服从正态分布。 l 有些情况下,可以用随机模拟得方法来寻找统计量的分布。 6. 正态总体下的三大抽样分布 � χ2 分布 � t 分布 � F 分布 7. 经验分布函数 定义设从总体X中抽取一个容量为的样本,样本观测值为x1,x2,L,xn。将它们从小到大排序后记为x,x,Lx(1)(2)(n。对于x∈(−∞,+∞),令)0,x<x,(1) Fn(x)=knx≤x<x()(+1),k=1,2,L,n−1,kk1,x≥x(n,)称Fn(x)为该样本的经验分布函数。 注: 63
•Fn(x)=观测值x1,L,xn中小于等于x的频率。•F(x是一个右连续、单调非降、取值于[0,1]的阶梯函数,因而可视之为以等概率取x1,L,xn的离散型随机变量的分布函数。 •抽样之前,对∀x,F(x)都是随机变量。 8. 格里汶科定理 定理设总体X的分布为F(x),(X1,X2,L,Xn)是取自该总体的简单随机样本,对它的任意一个观测数据(x1,x2,L,xn),记Fn(x)为其经验分布函数,又记Dn=supFn(x)−F(x). −∞<x<+∞则有P(limDn=0)=→∞格里汶科定理说明,当样本容量足够大时,简单随机样本的任意一组观测数据的经验分布函数几乎都与总体分布函数充分接近。因此,由对样本数据的分布描述就可以得到总体分布的信息。 五、 充分统计量 定义 设总体分布族为F={Fq:q∈Θ}。X1,L,Xn是从总体中抽取的一个样本,T=T(X1,L,Xn)是一个统计量。若在给定 T=t 的条件下,样本的条件分布 (X1,L,Xn)|T=t与 q无关,对于 ∀t都成立。则称统计量 T 是分布族 F 的充分统计量。 注: l 定义中的 q可以是有限维参数,也可以是无限维参数。 l 在总体分布族假定下,充分统计量包含了样本中关于总体分布的所有信息。因而若用充分统计量替代原始样本作统计推断,没有任何损失。 l 充分性严重依赖于对总体分布族的假定。一个统计量对于 F1 是充分统计量,但是对于 F2未必充分。 l 若统计量 T 是总体分布族F的充分统计量,T=g(U),则 U 也是F的充分统计量。 例 设 X1,L,(1,p),p∈(0,1).n>2. 考察统计量 nT1∑X,T2=X+X i12i=1的充分性。 64
样本的联合分布是 nnxn−xP(X=L==∑1ixXx−∑111,,n)p=(1p=in), 其中 x=0or1,i=1,L,n。统计量 TTi1~B(n,p)。在给定 1=t 的条件下,样本的条件分布为 P(X1=x,L,Xn=xn|T1=t)P(X1x,L,Xn=xn,T=t)=P(T1=t)L∑n−1P(X1=x1,Xn−1=xn−1,Xn=t−x)=i=1i P(T1=t)1pt−pn−t−(1)n==ntn−ttp(1p)−t该条件分布与参数 p无关,对任意t都成立。因此 T1 是充分统计量。同理可验证,T2不是充分统计量。 定理 (因子分解定理)设样本的联合密度为 pq(x),q∈Θ。统计量 T(X) 是充%%分统计量,当且仅当存在非负函数gq(T(x))及与参数 q无关的 h(x),使得 %%pq(x)=gq(T(x))h(x),∀x,∀q∈Θ. %%%% 例(1) 设 X1,L,Xn 是来自于指数型分布族的 . 样本。总体密度为 kf(x;q)c(q)exp∑=w(q)T(x)h(x),q∈Θ, jjj=1其中 q是 d维参数,d≤k。则 nn(1,L,)∑1(),L,∑TXXn=TXT(X) ikii=i=1是充分统计量。这个结果包含了二项分布、Poisson分布、正态分布、指数分布、Gamma分布等诸多分布族的情况。 (2) X1,L,(0,q),q>0. 则样本的联合密度为 p(1L=−nx,,xn;q)qI(0<X<q(x,L,x)1n)。 (n)所以,X分统计量。 (n是充) 65
(3) 设总体分布的密度函数为 p(x;q),q∈Θ,X1,L,Xn是.样本,则次序统计量(X,L,X(1)(n是充分统计量。 ) 定义 设总体分布族为F={Fq:q∈Θ},T=T(X1,L,Xn)是充分统计量,且是任意一个充分统计量 S(X1,L,Xn)的函数,则称 T 为最小充分统计量。 定义 若一个统计量的抽样分布不依赖于任何未知参数,则称该统计量为附属的(ancillary)。 定义 设总体的未知参数q∈Θ,T 是一个统计量。若 Eqg(T)=0,∀∈Θ⇒Pq(g(T)=0)=1,∀q∈Θ 则称 T 是完备统计量。 定理 (Basu定理)若 T 是充分完备统计量,则 T 与任何附属统计量都独立。 66
第八章 参数估计 一、 参数估计简介 参数估计是一类重要的统计推断形式。目的是根据样本观测数据对反映总体分布特征或决定总体分布的一些未知参数作出估计。 待估参数一般是实数或实数向量,包括以下一些类型: 1) 决定总体分布的未知参数,这里记为 q。例如,假定总体服从N(m2,s),其中m2,s是未知参数,待估计。 2) 1) 中参数的函数 g(q)。例如, � 假定总体X~N(ms2,),q=m2 (,s),对给定的c,欲估计概率P(X<c),它等于Φc−m()=ˆg(q); s� 总体分布的各种未知的数字特征。例如:未知的总体均值、总体方差、p分位数、偏度系数、变异系数等,二维总体的相关系数等等。 参数估计的两种形式:点估计、区间估计。 点估计 (point estimation): 对未知参数 g(q) (实值或实向量) 选用一个维数与之相同的统计量hˆ(X1,L,Xn)来作推断。该统计量称为 g(q) 的估计量 (estimator)。获得样本观测值后,代入估计量,就得到g(q)的估计值 (estimate) hˆ(x1,L,xn)。 区间估计 (interval estimation): 选用两个满足如下大小关系的统计量 hˆL(X1,,X≤hˆn)U(X1,L,Xn) 构造一个随机区间来推断一维实值未知参数 g(q)。获得样本观测值后,代入此随机区间,就获得了概括 g(q) 信息的一个具体的区间 [hˆL(x1,,xn),hˆU(x1,L,xn)]。 问题:如何构造估计量? 如何评价估计量的表现? 67
二、 构造点估计量的两种常用方法 1.矩法估计 (Moment Estimation) 矩法估计源于英国统计学家K. Pearson提出的替换原则: � 用样本矩去替换相应的总体矩(这里矩可以是原点矩也可以是中心矩); � 用样本矩的函数去替换相应的总体矩的函数。 设X1,L,Xn是来自于总体X的简单随机样本,则按矩法估计的替换原则,有:1n•总体m阶原点矩的估计量为:ˆ∑Xmmmi,m=1,2,L;ni=11n总体阶中心矩n的估计量为ˆ=(X−Xmmmi)ni1•总体均值m=EX的估计量为:ˆX; n•总体方差s2Va2122r()的估计量为sˆ=∑(X−X)=S;inni=1二维总体的相关系数Cov(X,Y)=的矩估计量是样本相关系数:Var(X)⋅Var(Y)∑n(X−X)(Y−Y)r=i=1ii;∑n2nX−X∑Y−Y2()()i=1i=1i等等 求总体分布未知参数 q1,L,q的矩估计量的一般方法: k1) 求出总体分布的前 k 阶矩 m1,L,m 关于 qk1,L,q 的函数 km=m(q1,L,q),j=1,2,L,k; jjk2) 求此函数的反函数 q=q(m1,L,m),j=1,2,L,k, jjk将其中的 m 用相应的样本矩 mˆ 替代,即得 qjj1,L,q的矩估计量 kqˆ=q(mˆ,L,mˆ1),j=1,2,L,k。 jjk 若待估参数为 x=g(q1,L,q),则其中的 q量qˆLˆ k1,L,q 用其矩估计k1,,q替代,k即可得 x 的矩估计量xˆ=g(qˆLqˆ1,,)。 k 68
例设X1,L,X是来自总体X的简单随机样本。k1若XNms2,其中ms2是未知参数。因为m、s2)~(,),分别是总体均值、方差,所以它们的矩估计量分别为m=Xs2=S2ˆ,ˆn。 若,其中是未知参数。因为1求此反函数得12)X~Exp(lEX,l=,EX所以的矩估计量为1llˆ=h=PX≥=−lc的矩估计量为−c/X;(c)ehˆ)若X~U(a,b),其中a,b是未知参数。因为a+b−a2()EX=,Var(X)=212求反函数可得a=EX−3Var(X),b=EX+3Var(X),所以 a,b的矩估计量为a=X−S22ˆ3ˆn,b=X+)若X~P(l)。因为l=EX=Var(X),所以l的矩估计量可以为ˆ或者lˆ=S2n,但通常取前者。 2. 极大似然估计 (Maximum Likelihood Estimation) 极大似然估计最早是由Gauss在1821年提出的,但一般将之归功于R. A. Fisher,因为他在1922年重新提出这种想法,并证明了它的一些性质,使之得到广泛应用。 基本思想: 将样本观测视为“结果”,将总体分布(或决定总体分布的参数q)视为产生“结果”的“原因”。在获得样本观测值后,看哪种“原因”产生该“结果”的可能性最大,然后用该“原因”对应的参数值作为q的估计值。 似然函数 (likelihood function) 用于衡量取得某样本观测值的可能性大小。 1)若总体X服从离散型分布,分布列为P(X=a)=p(a;q),j=1,2,L,jj其中q是未知参数,设它的可能取值范围为Θ。因为样本X1,L,,所以获得 样本观测值 x1,L,xn的概率为:nnP(X1=x1,L,Xn=xn)∏P(X=x)=∏p(x;q).iiii=1=1这个概率可看作是未知参数q的函数,称之为样本观测值 x1,L,xn的似然函数,记作nL(q;x1,L,xn)∏p(xi;q),q∈Θ.i=1 69
2)若总体分布是连续型的,为 p(x;q),其中未知参数q∈Θ。则获得样本观测值 x1,n的可能性大小可用样本的联合密度函数在x1,L,xn处的值来度量:n f(x1,,xn;q)=∏p(xi;q).i=将它看作未知参数q的函数,也称之为样本观测值x,,xn的似然函数,记作nL(;x,,xn)∏p(xi;q),q∈Θ.i=定义 对于每个样本观测值ˆ x1,L,xn,令 (x1,L,xn)=argmaxL(;x1,,xn),则称 q∈Θqˆ(X1,L,Xn) 为未知参数 q 的极大似然估计量(MLE)。 定理 (MLE的不变原则) 若 qˆ 是 q 的 MLE,则 q 的任一函数 h=g(q) 的MLE为 hˆ=g(qˆ)。 求极大似然估计的基本步骤: 1)写出似然函数L(q;x1,L,xn),q∈Θ;2)求似然函数的最大值点。对数似然函数与似然函数的极大值点相同,因此,常用对数似然函数求MLE .对于 . 样本,l(q)=lnL(q;x1,L,xn)∑lnp(xi;q),q∈Θ.i=1 求导求极值法 若L(q)(或(q)是q=(q1,L,的凹函数,且二阶可微,则L(q)的最大值点存在,k可由求解下述似然方程(组)获得:∂l() =0,j=1,L,k∂j或求解方程(组)∂L(q)=0,j=1,L,k.∂j 70
例(1)X1,L,(1,p),∈[0,1]求p的MLE。解:样本观测值x1,L,xn的似然函数为nnLpxxxnxii(xLx∏pi−p−i;,,n){(1)1(1}=p∑−=1(1−p∑)=1,p∈[0,1],i=1对数似然函数为n l(p)=Tlnp+(n−T)ln(1−p),其中T∑=1l(p)在(0,1)上二阶可微、严凹,故存在唯一极大值点。似然方程为dl(p)Tn−T=−=0,dpp1−p解得p的MLE为Tpˆ==例(2)1,,(m,s),(m,s)∈(−∞,∞)×(0,∞),求m,s的MLE。解:样本观测值x,L,xn的似然函数为2nn(x−mi)n2L(xm∏−−−∑−i)Lms2122(,;x,,xess=c()ei=1ni=1ps对数似然函数为n22l(m,s)=−lns−∑(x−m)+c'22s2ii=1n2122=−lns−2s2∑(x−x)+n(x−m)+c'.ii=1对于∀s2>0,当m=x时,(m,)达到最大。再求l(x,s)的最大值点。可证s2关于s2l(x,)凹、二次可微,故其最大值点为下列方程的解:ds2nl(x,)n12=−+xx0,s2s22∑(−)=id22()i=1即s21n2=∑22(x−)。所以m,s的MLE为mˆ=X,sˆ=S. inn=1 例(3)X1,L,(l),l>0.求l的MLE。解:样本观测值x1,L,xn的似然函数为nL∏lxinLl−lnlx1i(;x1,,xe=−∑ei=n⋅c,l>0.=1x!ii对数似然函数为 nl()=−nl+Tln+c',其中T∑=1l()在(0,∞)上二阶可微、严凹,故存在唯一极大值点。似然方程为dl()T=−n+=0,l其解为l=Tn。故l的MLE为ˆ=X。 71
不能求导求极值的问题 例,L,. U(0,q),q>0.求q的MLE。解:样本观测值x1,L,xn的似然函数为1nL∏,x≤q, Lq()(;x1,,x)p(x;q)=nnnii=10,else.其最大值点为q=,所以q的MLE为 qˆX.()() 根据不变原则求MLE 例(1)X1,L,~Exp(),l>0.求m=EX的MLE。l解:样本观测值x1,L,xn的似然函数为nnLlL∏l−lxn−lx=l∑=i(;x1,,x){ein}e1,l>=1n对数似然函数为l()=lnl−l∑x, i=1l(l)在(0,∞)上二阶可微、严凹,故存在唯一极大值点。由似然方程dlnl()n=−∑x=0,llid=1解得l的M为nLElˆ=。因为1m,所以m的MLE为mˆ=X.∑nXl=1ii 例(2)X1,L,~N(m,s),m,s是未知参数。求l=P(X>3)的MLE。解:因为3−mP=>=−Φ2,而ms的E为X,S2(3)1,MLn。由不变原则知, s的M为3−XlLElˆ=1−Φ.S2n 72
三、 评价估计量的优良性准则 对于同一个未知参数,往往可以构造多个不同的估计量去估计,那么哪一种估计更好呢?每个估计量都有误差,误差大小随样本观测值变而变。故不能以具体某一次的使用效果来评价估计量的优劣,而应当根据长期使用的效果去评价。 常用准则: 均方误差准则 无偏性(unbiasedness) 有效性(efficiency) 相合性(consisitency) 等大样本性质 1. 均方误差准则 用平均误差的大小去评价估计量的优劣是非常自然的。均方误差(Mean Squared Error, MSE) 是衡量“平均误差”的一种方法,数学处理较方便。 定义 设 hˆ 是一维参数g(q)的估计量,称Ε2q(ˆh−g(q))为ˆh的均方误差,记为 MSEq(ˆh)。 显然, M2SE2q(hˆ)=Eq[(hˆ−Eˆqh)+(Eˆqh−g(q)]=Varq(hˆˆ)+biasq(h). 定义 设q∈Θ,hˆ1(X,L,Xn),hˆ2(X1,L,Xn)是一维参数g(q)的两个估计量,若有 MSEq[1(X,X)]≤MSEq[h2(X1ˆ,LXn)],∀q∈Θ, 且 ∃q0∈Θ 使不等式严格成立,则称在均方误差意义下 h1ˆ 优于 hˆ2。 例未知,欲估计2。已知2是s21,,(m,s),m,ssSn的有偏估计,S2是s2的无偏估计。那么哪个在均方意义下更优呢? 22由于nSn(n−1)SY==~c2,可计算得:s2s2n−1M2222n−SES42224(n)=E(Sn−s)=s,MSE(S)=E(S−s)=s,2n−1 所以,在均方误差意义下,S22n优于S,∀n>的偏倚b22212ias(Sn)=E(n)−s=−s→0(当→∞)。 73
2. 无偏性 定义 设q∈Θ,若一维参数g(q)的估计量hˆ(X1,L,Xn)满足 E[hˆ(X1,LXn)]=g(q),∀q∈Θ, 则称 hˆ 是 g(q) 的无偏估计 (unbiased estimator, .)。 注: 1) 有的参数不存在 .; 2) 若有 . 存在,一般 . 不唯一; 3) 若 hˆ是h的.,通常h(ˆh) 不是 h(h) 的.,例如,样本标准差 S 不是总体标准差 s的.。 定理设X1,LXn是来自总体X的.样本。若总体的阶原点矩1n1km=Ek存在,则样本k阶原点矩A∑Xk是m的 .;kikni=12若总体方差2存在,则2是2的,但2不是2)的.。 一个未知参数的无偏估计量也可以构造出很多,根据均方误差准则,我们可以用方差大小去比较不同无偏估计的优劣。 定义设q∈Θ,hˆ1(X,L,Xn),hˆ2(X1,L,Xn)都是一维参数g(q)的无偏估计量。若有 Varq[1(X,X)]≤Varq[h2(X1ˆ,LXn)],∀q∈Θ, 且 ∃q0∈Θ 使不等式严格成立,则称则 h1ˆ 比 hˆ2有效。 无偏估计量的标准差的估计称为标准误(standard error, .),常用于根据样本观测值推断估计值的误差大小。 例如:X是总体平均的UE,若总体方差2.存在sm,则std(X)=。若用S估计s,n 则X的标准误为S/n. 74
例=m=s2ms2(1)1,,,EX,Var(X),,未知。欲估计m。1•X与(X1+X2)都是的.,但212X1XVarXsV+21=ar2(),=s,n22 故当1n>2时,X比(X1+X2)有效。2nn•更一般地,若a,=1,Ln满足∑a=1,则称T是的线性ii∑aXmii=1=1无偏估计(LUE)。X是m的LUE中的一个。在所有LUE中哪个最有效呢? 例(2)X1,L,(0,q),>0未知。则2X是q的矩估计量,无偏;+1T是由的MLE构造的q的无偏估计。可证:当n>1时, ()T比X有效。 定义 设q∈Θ,h* 是g(q)的.。若对于g(q)的任意一个 . hˆ,都有 varq(h*)≤varq(hˆ),∀q∈Θ,则称 h* 是 g(q)的UMVUE。 注: 有的参数存在 UMVUE,有的没有。 有时候即使有 UMVUE 存在,也很难求得。 定理 (Rao-Blackwell) 设q∈Θ,T 是充分统计量,h 是g(q)的.。记 f(T)=E(hˆ|T)。则 f(T) 是g(q)的.,且 varq(f(T)≤varq(hˆ),∀q∈Θ。 定理 设q∈Θ,h 是g(q)的.。h 是g(q)的UMVUE 的充要条件是:h 与所有方差有限的 0 的无偏估计不相关。 定理 (Lehmann-Scheffé) 设q∈Θ,T 是充分完备统计量,f(T)是一个统计量,且是T的函数,则f(T)是其期望 g(q)=Eqf(T) 的UMVUE。 75
3.相合性 (consistency) 定义 设q∈Θ,若一维参数g(q)的估计量hˆ(X1,L,Xn)满足:对∀e>0,有 limPq[|hˆ−h|≥e]=0,∀q∈Θ, n→∞则称 hˆ(X1,L,Xn) 是g(q)的相合估计。 注:相合性的意思是,随着样本容量增大,估计量应当越来越接近参数的真实值。这是对估计量的一个最基本的要求。 判断相合性的基本工具: 1)大数定律;看是否有(ˆn)2)limn→∞MMSEhSE(hˆn)=0;(因为P(|hˆn−h|≥e)≤)e2 3若h1Lhk)ˆn,ˆ分别是h1,L的相合估计,x=g(h1,L,h是连续函数,则kk)g(hˆLhˆn,,n)是x的相合估计。 例)X1,L,X,若m=存在,则A是的相合估计。kkk2XLX222 )1,,(m,s).因为limn→∞MSE(n)=limn→∞MSE(S)=0,所以S2、2都是2的相合估计。1nX是m的相合估计,但(X1+X2)不是。2极大似然估计的渐近正态性 定理 设 F={p(x;q):q∈Θ} 是一个概率密度族,其中Θ是�上的非退化区间。假如该分布族满足下列正则条件: ∂p∂2p∂31) ∀logloglogpq∈Θ,偏导数 ,, 存在; ∂q∂q2∂q3∂p∂2p∂32) ∀q∈Θ,有logp <g1(x),<g2(x),<H(x),其中 gxgx在qqq1(),2()实数轴上可积,且∞ H(x) 满足 ∫H(x)p(x;q)dx<M,M与 q无关。 −∞22∂logp∂logp3) ∀q∈Θ,有 0E<=∫p(x;q)dx<∞。 q−∞q则在分布参数 q的未知真值q0为Θ的一个内点的情况下,其似然方程必有一个解依概率收 76
−12敛于真值∂ q0,且渐近地服从正态分布 Nlogpq0,nEq。 ∂q=q0 对于估计量的优劣可以从多个角度评价。有的估计量从某种角度看较好,但从别的角度看未必好。可以说,几乎没有面面俱到的、各方面都好的估计量。但有从各方面来看都不好的估计量,这样的估计量显然没有任何使用价值。 四、区间估计 基本想法: 选用两个满足如下大小关系的统计量 hˆL(X,Xˆ1,n)≤hU(X1,L,Xn) 构造一个随机区间来推断一维实值未知参数 g(q)。获得样本观测值后,代入此随机区间,就获得了概括 g(q) 信息的一个具体的区间 [hˆL(x1,,xˆn),hU(x1,L,xn)]。 对hˆL,ˆhU的自然要求:1)区间[hˆL,ˆU]中包含h的可能性尽量大; 2)区间长度尽量小。定义设总体参数q∈Θ,g()是一维参数,X1,LX是样本,hˆnL(X1,,Xn),ˆU(X1,L,Xn)是两个统计量。若对给定的a∈(0,1),有 Pq[hˆL(X1,,Xn)≤g(q)≤hˆU(X,,Xn)]≥1−a,∀q∈Θ,则称[hˆL,hˆU]是ˆ的置信水平为1−a置信区间(Confidence Interval,.)。 例 正态总体均值的置信区间。 ,,~N(,),已知,求m的置信区间。Qm~N∴X(0,1P≤z1−a=1−,/2sn其中z1−a为N(0,1)的1-/2下侧分位点。/2∴PssX −z1≤m≤X+z−a=1−a,∀m/21/2nn因此,ssXz1−a,X+z/21−a/2nn是 m的置信水平为1的. 77
,,~N(,),,均未知,求m的置信区间。QmX~t(n−1)∴P≤ta(n−1)=1−a,S/S/n1−2其中ta(n−1)为t(n−1)的1−/2下侧分位点。1−2 ∴SSPX−t(n−1)≤m≤X+ta(n−1)=1−a,∀m,s1−2所以SSX−ta(n−1),X+ta(n−1)1−12n−2n是m的置信水平为1的.。 构造.的一般方法——枢轴量法 设欲构造未知参数g(q)的CI。1.构造一个样本与(的函数G(X1,L,Xn;g(q)),对∀q∈Θ,其分布完全已知。 称此函数为枢轴量 (pivotal quantity)。注:G不是统计量,它往往是由(q)的估计量构造的, 刻划的是估量与g(q)的某种绝对或相对的差异。2.选择两个常数c,d,使对给定的a有P(c≤G≤d)≥1−a(或=1−a)。3.若能将不等式 c≤G≤d变形为 hˆL≤g(q)≤hˆU,其中hˆL,hˆU是统计量,则得P(hˆL≤g(q)≤hˆU)≥(或=)1−a,∀q∈Θ. 注:2.中c,d的取法很多,理论上应取使E(hˆU-hˆL)一致最小的c,d,但大多数场合难以做到。因此常取满足下式的c,d: P(G<c)=P(G>d)=a/2. 例 正态总体方差的置信区间。XLX21,,~N(m,s),ms2,均未知,求s2的置信区间。 2取枢轴量为G(n−1)S=,G~c2(n−1).s22c=a(n−1),d=−a(n−1),则P{c≤G≤d}=1−a∀m2,,s./1/2解不等式 2c≤Gd得s的 .2(n1)S(n−1)S,.c221−a(−1)c/a(1)/2 78
例 两正态总体均值之差的置信区间。 XLX22,,(m1,s1),Y,L,(m2,s),两样本相互独立。求m1−m2的CI。 显然,X−Y是m1−m2的合适的估计量。可证22s −1sXY~Nm1−m2,+.mn(1)若s2,s212已知,则可取枢轴量为G(X−Y)−(m1−m2)=. s2s21+mn22G~N故得s1s(0,1)m1−m2的1−−Ymz1−a+./2mn (2)若s2=s2=s21未知,则2+−2 2(m−1)S=1(n1)SSm+n−2是s2的合理估计。枢轴量可取为 G(X−Y)−(m1−m=2).11S+mnG11~t(m+n−2),故得m1−m2的1−−Ymt1−a(m+n−2)S+./2mn 当s2、2(3)1都未知时,构造m1-m2的置信区间的问题是历史上著名的 Behrens-Fisher 问题(1929).当 m、n都很大时,由X−Y−(m1−m2)~&N(0,1),S2S2 1+mn可得到m1-2的置信水平近似为 1-a 的置信区间S2S2S211X−Yz1−a+,X−Y+z/1−+.ma/2nmn 例 两正态总体方差之比的置信区间。 XLXms2YLY2,,(1,1),,,(m2,s2), 两样本相互独立。求 q=s2s212 的置信区间。 79
由于 S2、S2分别是 s2、s211的合适的估计量,且 m−S2s2cm−n−S2s2c2(1)1/~(1),(1)2/2~(n−1),两者相互独立,因此S2s2F=1/1~F (m−1,n−1).S2s22/2取F作枢轴量,可得q=s2212的置信水平为1-a的.S2S2111,S2F1−a(m−1,n1)SF/22a(m−1,n−1)/2 构造区间估计的大样本方法 有些问题中,很难求得枢轴量在小样本情况下的精确分布,但容易求得大样本情况下的近似分布。此时,可用该近似分布构造区间估计。 基本工具:中心极限定理。 设L21,2,...,(1),(1),则当时X−mXXiidEX=mVarX=sn→∞~&N(0,1).s2n即X−mP≤z1−a≈1−a./2sn于是可得的置信水平近似为的ssm1−C IXz1−a,X+z/21−a/2.nn若未知,则可用其相合估计替代,得C为SSsSIXz1−a,X+z/21−a./2nn例 1. 设X1,X2,L,(1,p),求p的置信区间。记X−pZ=当n→∞时,Z~&N(0,1).1p(1−p)n所以取Z 作为枢轴量。由P(−z1−a≤Z≤z/21−a)≈1−a得p的近似1−. /21lX(1)llX(1X)lXz,Xzl+a+++,n1−n4n2nn4n22n其中=2z1./2 80
当 n 较大时,X−pZ%=~&N(0,1).1X(1X)n也可取 Z%作为枢轴量,得 p的另一种近似. X(1−X)X(1−X)Xz1−a,X+z−a./21/2nn在前一个置信区间中略去1(的项,亦可得此.。)n 2. 设X1,X2,L,(1,p1),Y1,Y2,L,(1,p2)且两样本相互独立。 求p1−p2的置信区间。因为当m,n→∞时 X−Y−(p1−p2)~&N(0,1).1X(1−X)+Y(1−Y)mn由此可得 p1−2的近似1−. X(1−X)Y(1)X(1−X)Y(1−Y)X−Yza+,X−Y+zma+.−n1−mn2 3. 设X1,X2,L,(l),求l的置信区间。因为当n→∞时X−l~&N(0,1).ln由此可得 l的近似. XllXlX+za+,X++za+,n1−n4n22n1−n4n222其中l=2z1−a.略去其中的项可得近似. /2nXXXza,X+za.1−n1−n22 81
例 某厂生产的某种轮胎的寿命X被认为服从N(m,s2)。现随机抽取12个产品,测得其寿命分别为(单位:万公里): 。 求这种轮胎的平均寿命 m 的置信水平为的置信区间。 解:方差未知时,正态总体m的1−.为:SS[X−ta(n−1),X+ta(n−1)].1−n1−22n这里,a=,n=12,查表知t0(11)=。由样本观测数据计算得 .975X=,.故m的.为 例从全市抽取400户家庭,调查去年的年收入。发现收入低于贫困线的家庭数为12户。请对全市贫困家庭比例 p 给出95%.。解:记1,第i户为贫困家庭,X=i=1,L,n,n=400. i0,否则,根据题目条件有X1,L,(1,p)。p的近似95%.为Xmz1−aX(1−X)/n./2根据样本数据知,pˆ==。故p的近似95%.为 (, ). 82
第九章 假设检验 一、 基本概念 假设检验 (Hypothesis Testing) 是又一种重要的统计推断形式。 与参数估计相比: � 参数估计:对未知的总体参数给出一个具体的数值估计; � 假设检验:对涉及总体未知信息的某个命题作出拒绝或接受的判断。 这类统计推断有丰富的实际背景,例如: � 彩票的开奖机制是否公平? � 医生常常得根据血样化验报告判断就诊者是否患某种疾病; � 试制新药时,药厂得根据小鼠试验得结果判断:新药是否疗效更好?是否有毒性等副作用? � 工厂需要根据在线抽样检查得结果判断生产线是否运行正常; � 产品交验时,买卖双方需根据抽样检验的结果判断,一批产品的合格率、平均寿命等指标是否达到合同要求; 等等 例 某厂生产10欧姆的电阻。根据以往的情况,可以认为该厂生产的这种类型的电阻实际阻值X~Nm2(,)。现在随机抽取10个电阻,测得它们的实际阻值为: 10 该厂生产的这种类型的电阻,其实际平均阻值m是否确实等于标定值10欧姆? 这里 m 是未知参数,需回答的问题是:m=10 还是 m≠10? 命题“m=10” 就是涉及 m 的一个假设,需根据样本信息去判断。 命题“m≠10” 是另一个假设,是“m=10” 的对立假设。 假设检验就是要在这两个对立的假设中作出一个选择。 假设:关于总体分布(或未知参数)的命题。 解决假设检验问题的基本步骤 1. 对实际问题建模,形成假设检验问题。 将实际问题转化为一个统计问题,把欲判断的命题转化为 “假设”。 假设常常成对出现:一个称为原假设(null hypothesis),常用 H0 表示;另一个是它的对立面,称为备择假设(alternative hypothesis),常用H1 表示。将它们联立起来就表示一个假设检验问题。 83
例:回答例的问题,可转化为解决如下假设检验问题: H0: m=10 . H1: m≠10 注: w 在统计假设检验中,H0 与 H1 的地位有所不同。 H0 通常是比较可靠的、若无充分证据不能轻易拒绝的假设。H1 表示H0不真时最可能的情况。 w 假设分:简单假设、复合假设 2. 选择检验统计量,给出拒绝域的形式 解决假设检验问题,就是要给出根据样本观测值作出接受H0或拒绝H0判断的规则。也即将样本的可能取值范围(样本空间)一分为二,一个区域为拒绝域(Region of Rejection,记作W),另一个区域称为接受域。当样本观测落在W中时,作出拒绝H0的判断,反之,则作出接受H0的判断。这样的规则就称为检验(test)。 通常检验是通过一个检验统计量来构造的。该统计量应当集中了样本中与假设有关的尽可能多的信息。 例中,检验的是关于总体均值m的假设,而样本中关于m的信息主要集中在样本均值X中,所以常用X作为检验统计量。因为大时X大的可能性大,m小时小的可能性大,所以检H0:m=:m≠10直观判断规则是: 当|X−10|≥c时拒绝H0,其中c是一个合适的常数。该规则对应的拒绝域为 W={(x1,L,xn):|X−10|≥c}. 注:统计学中常强调“拒绝域”而较少提“接受域”,原因在于否定一个命题容易,只需要举一个反例即可;而证实一个命题难。 “接受原假设”的实际含义是没有充分证据反对原假设,并不表示已证实了原假设。 3. 确定显著性水平 w 假设检验也是用样本信息去推断总体信息的一种形式,因为样本信息是不完全的,所以检验难免会犯错误。 w 假设检验中会出现的两类错误: 84
总体情况 样本情况 判断 H0真 H1真 类错误 (x1,...,xn)∈W 拒绝H犯第I0 (拒真)√ 犯第II类错误 (x1,...,xn)∉W 接受H0 √ (受伪) 例中的两类错误 考虑按前面的判断规则“当|X−10|≥c时拒绝H0”或相应的拒绝域W来检验假设H0:m=:m≠10因为1X~N2(m,),所以不管c取何正值: 10H0真时,样本总有可能落入拒绝域;H1真时,样本同样也总有可能落入接受域。 犯两类错误的概率 一般地,设W为假设检验问题H0:q∈Θ:q∈Θ1 的拒绝域,则 W相应的检验规则犯第I类错误的概率为:Pq{(X1,L,Xn)∈W},q∈Θ.犯第II类错误的概率为: 1−Pq{(X,L,Xn)∈W},q∈Θ1.称g()=Pq{(X1,L,X)∈W},q∈Θ0∪Θ1为检验规则W的势函数(powerfunction). 例中的势函数、犯两类错误的概率 势函数为: g(m)=P(|−10|≥cmXc)1−cmX−m10+c−m=1−Pm<< m∈(−∞,∞). 犯第I类错误的概率:1−gc(m),m≠10. 85
理想地,我们希望建立的检验规则能使犯两类错误的概率同时足够小。但这在样本容量固定的情况下做不到!所以只能折衷。 如例10⋅中,gc(10)=21−Φ()↓,若c↑;但对任意给定的m≠10,1−gc(m)↑,若c↑. Neyman-Pearson原则:在控制犯第I类错误概率的前提下,最小化犯第II类错误的概率。 显著性水平(level of significance) 对于假设检验问题H0:∈Θ:q∈Θ1,若一个检验规则(拒绝域为W)满足 maxgW(q)≤a,q∈Θ0则称该检验规则的显著性水平为a。 注:a 的直观意义:“小概率事件”或“不太可能事件”的标准。 a 的选择应视具体问题而定。 a 常取为 ,,或 。 按照N-P原则,在确保显著性水平的前提下,应选择使用犯第II类错误概率尽量小的检验规则。 4. 给出具体的拒绝域或检验规则 根据前面确定的检验统计量与拒绝域的形式、显著性水平 a,就可以给出具体的拒绝域或检验规则了。 例中,若规定显著性水平为,则应取c,使maxgc()=21−Φ(1010⋅c)≤a,=10故c≥z1− 5. 解决实际问题 例中,取a=,则z0=。由样本数据计算得:.−10|−10|==< 86
对于一维的总体参数q,通常研究三种形式的假设检验问题:(1)H0:q≤:q>q0(2)0:q≥:q<q0 (3)H0:q=:q≠q0(1)、(2称为单边检验(one-side),(3称为双边检验(two-side)。解决这些检验问题的检验统计量往往是相同的,差别在于拒绝域的形式不同。 二、构造检验的方法 1. 直观分析法 根据点估计量、充分性原则等依据选择合适的检验统计量,根据直观分析确定拒绝域的形式,然后通过计算势函数、分析临界值与犯两类错误概率的关系给出具体的检验规则。如例。 例 设样本XLXms2 1,,(,),s2已知,欲检验 H0:m≥:m<m0, 其中 m0 是给定常数。 因 m的信息主要集中于样本均值 X中,故选 X作为检验统计量。直观地,m越大X也越大,m越小X也越小,故拒绝域形式应取为 {x:X≤c},c是待定的临界值。该拒绝%域的势函数为: c−mgc(m)=Pm(X≤c)=Φs, /n它关于m单调降,关于c单调增。犯第一类错误的概率上限为 maxg(m)=g(m0)。 ccm≥m0若取显著性水平为 a,则应取c,使得 g(m0)≤a,即 c≤zcas/n+m0。而c越小,犯第二类错误的概率越大,故取 c=zas/n+m0。这样就得到了水平为 a的拒绝域 X−m{xX≤0:za+m0}={x:Z=ˆ≤za}。 %n%s/n 87
例设样本 X1,L,(1,p),欲检验 H0:p≤:p>p0, 其中 p0 是给定常数。 因n T=∑X 为充分统计量,p的信息主要集中在 T 中。直观地,取拒绝域的形式i=1i为 {x:T≥c},c是待定的临界值。因 T~B(n,p),该拒绝域的势函数为 %n∑ngp=Pk()p(T≥c)p(1−p)n−k, ck=ck它关于p单调增,关于c单调降。固定c时犯第一类错误的概率上限为 maxg(p)=g(p0)。 ccp≤p0若取显著性水平为 a,则应取c,使得 g(p0)≤a,即 c应满足 cn∑nkp0(1−p−0)nk≤a。 k=ck而c越大,犯第二类错误的概率越大,故应取使上式满足的最小的c。这样就得到了水平为 a的拒绝域 {x:T≥c}。 % 例 某厂对产品次品率的要求是不超过5%。现从一天生产的产品中随机抽取20个检验,发现有2个不合格。请问这天的次品率是否达到要求? 解:设这天的次品率为 p。现欲通过一个容量为20的样本来检验 H0:p≤5%:p>5%。取水平a=。若以 {x:T≥c} 为拒绝域,则c 是满足下式的最小整数 %20∑20k(5%)(1−5%)n−k≤a。 k=ck取 c =0,1,2,4,5 代入上式,发现 c=4时上式刚满足。所以拒绝域为{x:T≥4}。%而T的观测值为2,所以接受原假设。 2. 似然比检验法 似然比检验法,是构造检验的一种较一般的方法。 88
设样本X=(X1,L,Xn)的联合密度函数(或分布列)为p(x;q),q∈Θ。考虑假设%%检验问题 H0:q∈Θ:q∈Θ1。 显然 Θ0IΘ1=∅,Θ0UΘ1=Θ。令 supp(x;q)q%p(xqˆ;)l=∈Θx0=0()%, %supp(x;q)p(xˆ;qMLE)q∈Θ%%其中 qˆ0 是p(x;q) 在参数子空间 Θ0上的极大值点,qˆMLE 是p(x;q) 在参数空间 Θ上%%的极大值点,即 q的极大似然估计值。它们都是样本观测值 x的函数,与未知参数无关。%所以,l(X)是一个统计量,称为似然比统计量。由于Θ0⊂Θ,所以 0≤l(X)≤1。 %%因为 p(x;q)可看作在给定 x时 q有“多大可能”出现的一种度量。直观地看,H0%%真时,l(X)较接近于1,否则较接近于0。因此可取拒绝域为 {x:l(X)≤c},其中c %%%(0<c<1) 为检验的临界值。水平取为 a时,c应取满足 supPq(l(X)≤c)≤a q∈Θ0%的最大值点。该检验称为水平为a的似然比检验。 如果存在统计量G(X),l(X)将随之严格上升,那么可以 {x:G(X)≤A} 为拒绝域。 %%%% 例 设样本 1,,(m,),m∈�s2,∈(0.∞)都未知,欲检验 H0:m=:m≠m0, 其中 m0 是给定常数。 X的联合密度函数是 %n−221np(x22;m,s)=(2ps)exp−∑(x−m)s2i2, %i=1这里参数空间Θ=ms2 {−∞<m<∞2(,):.s>0},Θ=ms220{(0,):s>0}。在Θ上,nm2,s的MLE分别是:m=Xs2ˆ,ˆ∑(X−X)/n;在Θi0上,s2的MLE为i=1 89
ns2∑X−m20(ˆ0)/n。因而 ii=1nn/2n/2nX∑2∑1l()=(X−X)/(X−mii0)=, 2%i=1i=11+T/(n−1)其中 T=n(X−m0)S。由于 l(X)关于 |T|严格单调降,因此,似然比检验的拒绝%域等价于 {x:|T|≥c}。再根据显著性水平确定c=t1−a2(n−1)。 % 3. 根据检验统计量的渐近分布构造检验法 Wilks 定理:设简单随机样本X1,L,Xn取自具有密度函数(或分布列)的总体,总体分布族为F={p(x;q):q∈Θ}。又参数空间 Θ=Θ0UΘ1,Θ0IΘ1=∅为有限维欧氏空间的子集。对假设检验问题 H0:q∈Θ:q∈Θ1,在分布族满足一定正则性条件下,当原假设为真时, −2lX2log()→Dc(k),(k=dim(Θ)−dim(Θ0)), %其中,l(X)为似然比检验统计量。 % 三、关于正态总体参数的假设检验 对于正态总体,常用的对有关参数的假设检验方法有以下六类: 1. 方差已知时,总体均值的检验—— Z检验(U检验) 2. 方差未知时,总体均值的检验——t检验 3. 均值未知时,总体方差的检验——c2检验 4. 两总体的方差比较——F检验 5. 两总体的均值比较——t检验 6. 成对数据的均值比较 1. 方差已知时,总体均值的检验。XLX21,,(m,s),s2已知。 H0 H1 检验统计量 水平为a的拒绝域 m≥m0 (或 m=m0) m<m0 {(x1,L,xn):Z≤za} X−mm≤m0 (或 m=m0) m>m0 Z=0 {(x1,L,xn):Z≥zs1−a} /nm=m{(x0 m≠m0 1,L,xn):|Z|≥z1−a2} 90
2. 方差未知时,总体均值的检验——t检验。XL21,,(m,s),s2未知 H0 H1 检验统计量 水平为a的拒绝域 m≥m0 (或 m=m0) m<m0 {(x1,L,xn):T≤ta(n−1)} X−mm≤m0 (或 m=m0) m>m0 T=0 {(x1,L,xn):T≥t1−a(n−1)} S/nm=m0 m≠m{(x,L,x≥− 0 1n):|T|t1−a2(n1)} 3. 均值未知时,总体方差的检验——c2检验。XLX21,,(m,s),m未知 H0 H1 检验统计量 水平为a的拒绝域 s2≥s20(或2=s22 s0) s<s20xLx2≤2 {(1,,n):cca(n−1)} s2≤s2220(或22 s=s0)>s222 s0 2(n−1)S{(x=1,L,x):cnc≥c1−a(n−1)} s20{22(x,L,xn):c≤c(n−1)s2=s220≠s2 s0 oc2≥c2r(−1)}1−a2 4. 两总体的方差比较——F检验d=s2s212 H0 H1 检验统计量 水平为a的拒绝域 d≥d≤0 (或=) d<d0 {(x,y):FFa(m−1,n−1)} %%d≤d0 (或=) d>d0 S22{(x,y):F≥FF=1S21−a(m−1,n−1)} %%d0{(x,y):F≤Fa2(m−1,n−1)d=d%0 d≠d0 % orF≥F1−a2(m−1,n−1)} 91
5. 两总体的均值比较——t检验 q=m1−m2 H0 H1 检验统计量 水平为a的拒绝域 q≥q0 (或=) q<q0 {(x1,L,xn):Z≤za} X−Y−qs22Z=01,s 2 q≤q0 (或=) q>q0 s2s2{(x1,L,xn):Z≥z1−a} 已知1+ mnq=q{(xL,x0 q≠q0 1,n):|Z|≥z1−a2} q≥qxyT≤t0 (或=) q<q0 {(,):a(m+n−2)} X%−Y−q%s2=s2T=0 1 q≤q0 (或=) q>q11(x,y):T≥t−a(m+n−2)} 0 {1未知Sw+%% mnq=q{(x,y):|T|≥t0 q≠q0 1−a2(m+n−2)} %% s221,s2 均未知 H0 H1 检验统计量 水平近似为a的拒绝域 q≥q0 q<q0 {(x1,L,xn):Z≤za} m(或=) ,n X−Y−q都充分Z=0 q≤q0 q>qS2S2大10 +2{(x1,L,xmnn):Z≥z1−a} (或=) q=q{(x0 q≠q0 1,L,xn):|Z|≥z1−a2} q≥qX−Y−q0 q<qT=0 xy):T≤tS2a(l)} 0 {(,S2%(或=)1% +2m,n mn不都充q≤q0 q>q{(x,y):T≥t0 1−a(l)} 分大S2S221%% (或=) +mnl= q=qS4S410 q≠q0 +2{(x,y):|T|≥t1−a2(l)} m2(m−1)n(n−1)%% 92
检验的p值 在实际应用中,检验的显著性水平视具体问题而定。为设计软件方便,人们提出p-值的概念。 一般地,若对假设检验问题 H0:q∈Θ:q∈Θ1, 水平为 a 的拒绝域为 Wa,它满足 Wa⊂Wa,ifa<a', '对于样本观测值 x,称 %p=inf{a:x∈Wa} %为观测值 x 的 p-值 (p-value)。 % p-值的直观含义是:在样本观测值给定的情况下,可以拒绝原假设的最小显著性水平。根据p-值很容易实现水平为 a的检验: 当 p≤a 时,拒绝原假设;否则接受原假设。 假设检验与置信区间之间的关系 假设检验与置信区间之间有密切关系。由单参数假设检验问题的水平为a的检验,往往可以得到该参数的置信水平为 1−a的置信区间。反之亦然。 例如,XLXs21,,(m,),m2,s均未知。检验 H0:m=:m≠m0的水平为 a 的拒绝域为 WX−m={x0:≥t1−a2(n−1)}, %S/n接受域为 WXm={x0:<t1−a2(n−1)}%S/n SS={x:X−t12(−1)<m0<X+t1−a2(n−1)}.%n若把上述接受域中的 m0 改为 m,那么由此接受域正好得到 m 的置信水平为 1−a 的置信区间。反之,由 m 的置信水平为 1−a 的置信区间,亦可得到检验问题H0:m=:m≠m0的水平为 a 的检验。 93
一般地,若假设检验问题 H0:q=:q≠q0的水平为 a 的检验的接受域若能等价地写成 W={xqˆ<<ˆqˆqˆ:L(x)q0qU(x)} 的形式,那么 (L(X),U(X)) 就是q的置%%%%%信水平为 1−a的置信区间。反之,若qˆ (L(X)qˆ,U(X)) 是q的置信水平为 1−a的置信%%区间,那么,对于H0:q=:q≠q0,下述规则就是一个水平为 a 的检验: 当q∈qˆˆ 0(L(X),qU(X)) 时接受原假设;否则拒绝原假设。 %% 四、分布拟合检验——c2方法 前面讨论的一些假设检验问题主要是对总体未知参数的检验,是参数型的。有时候需要对总体分布的形式作检验,这类检验问题统称为分布拟合检验。c2法是一类常用的分布拟合检验法,也是分析属性数据的常用方法。 1.不含未知参数的分布拟合检验 设总体可分为A1,A2,L,A r类。从中抽取一个容量为n的简单随机样本,记各类出r现的观测频数分别为 n1,n2,L,n,: r∑rn=n。欲检验j=1jH0:P(A)=p0,=1,L,:H不真, jj0其中 p0≥0,j=1,L,r 是给定的常数,且满足 j∑rp=1。 j=10j若 H0 成立,那么当 n 较大时,对每一类A,样本频率 nn 应与 p较接近。ji0比jK. Pearson 提出用下述统计量构造检验: rn−np2rn2(c∑j0)2j∑j−n, =1n=1np0并证明了H0 成立时若 n 足够大,则c2~2&c(r−1)。因而,水平为 a 的拒绝域为 {c2≥c21−a(r−1)}。 2.含未知参数的分布拟合检验 上述检验问题中,常有诸 p0,j=1,L,r 依赖于k (k<r) 个未知参数 qj1,L,q的情形。k即欲检验的问题是:H0:P(A)=p(q1,L,q),j=1,L,r。此时须对c2法作修改。c2统jjk 94
计量修改为 r−2(ˆnnp)c2=∑jj, =1npˆjj其中pˆ=p(qˆLqˆqˆLqˆ 1,,),(1,,)是MLE。R. A. Fisher在1924年证明了,在一定条件jjkk下,当H0 成立时若 n 足够大,则c2~2&c(r−k−1)。于是水平为 a 的拒绝域为 {c2≥c21−a(r−k−1)}。 例 某种动物的后代按体格的属性分为三类,各类的数目是:10, 53, 46。按照某种遗传模型,其频率之比应为2−−2 p:2p(1p):(1p)。问数据与模型是否相符?(a=) 解: 记后代的体格属性为X。考察数据与模型是否相符,就是要检验: HPX==pPX==p−pPX==−p20:(1),(2)2(1),(3)(1), 其中p 是未知参数,p∈[0,1];H1 是 H0 的对立面。可采用2 c 法检验。 首先,求H0真时 p的MLE。若样本 X1,L,,则H0真时其联合分布为 nPX=LX=∏{I(x=1)−I(x=2)−I(x=3)(xii11,,nxn)(p)[2p(1p)][(1p)]i}i=1 n2p2n1+n2−p2n+n(1)32nn其中 n1∑I(x=1),n2∑I(x=2),n3=n−n1−n2,x=1,2,or3,i=1,L,n。 iiii=i=1由样本数据知,n=109,n1=10,n2=53,n3=46。因此该样本的似然函数为 Lp=21053246()(p)[2p(1−p)][(1−p)] =253p73145(1−p),p∈[0,1]所以,p 的MLE为73 pˆ==。 73+145其次,列表计算各类的理论频数与c2统计量。 类别 实际频数n 理论频数npn−np2ˆ (ˆ)(npˆ) iiiii1 10 2 53 3 46 合计 109 109 95
水平a的检验规则为:当c2≥c21−a(3−1−1)时拒绝原假设。a=时,c20=>c2=(1) ,因而接受原假设。认为数据与模型相符。 3. 独立性与齐一性检验 设总体中的每一个个体都可按属性 A、B 分类。A有r个类别,B有c个类别。从总体中抽取一个容量为n的随机样本,将其中同时具有属性 AB 的个体的频数记为 n,ijij得到如下列联表。 B1 B2 … Bc 合计 A1 n11 n12 … n1c n1. … … … … … … Ar nr1 nr2 … nrc nr. 合计 … n 独立性检验:H0:p=pp,i=1,Lr。c2统计量为 iji..jcrn−nnn2()c2=∑∑iji..j, i=1j=1nnni..j自由度 df=(r−1)(c−1),于是水平为 a 的拒绝域为 {c2≥c21−a(df)}。 齐一性检验不同在于:抽样方法、原假设。计算、规则都与独立性检验相同。 例 一项致癌性研究旨在考察一种准备试用于人身上的药物是否有可能导致肿瘤。为此,总共用 300只(150只雄性,150只雌性)老鼠进行为期6个月的试验。开始时,随机地将100只(50只雄性,50只雌性)分配到控制组,100只分配到低剂量药物组,剩下的100只(50只雄性,50只雌性)分配到高剂量组。在6个月期间,每天给控制组注射一次惰性溶液,而给药物组注射一次掺有药物的溶液。样本数据如下。 肿瘤数目 组别一个或一个以上 无 控制组 10 90 低剂量组 14 86 高剂量组 19 81 问:在显著性水平 a=时,该药物是否存在与肿瘤有关的药物问题?也就是说,随着药物剂量的增加,患有肿瘤的老鼠的比例是否增加? 96
解:欲检验 H0:各剂量组内患肿瘤的老鼠的比例相同。H1:患肿瘤老鼠的比例不同。 采用c2法检验,水平a的检验规则为:当c2≥c21−a(df)时拒绝原假设。计算列表如下。H0真时,各类的期望频数列于下表每格中的第二行。每格中的第三行为: 实际频数-期望频数2()/期望频数 c2统计量的值为6个格子中的第三行数据之和, df=(3−1)(2−1)=2。c20=.99。因此,接受(2)50,认为没有充分证据说明患肿瘤的老鼠比例随药物剂量增加而增加。 肿瘤数目 组别一个或一个以上 无 合计 10 90 控制组 100 14 86 低剂量组 100 19 81 高剂量组 100 合计 43 257 300 97