概率統計基礎
工標部
6sigma專訓班
課程安排
統計技術的創立和發展﹔
概率論﹕隨機事件及其概率﹔
隨機變量及其概率分布﹔
參數估計與假設檢驗﹔
6sigma專訓班
統計技術的創立和發展
客觀世界中事物是互相聯繫互相依存的。
客觀世界中有一類數量關係,變量之間存在依存關係,但不完全確定。這就是相關關係。
許多偶然的因素使因變量產生波動,人們要從偶然的因素中分辨出主要的因素。
統計技術的發展與概率論密切相關 。
6sigma專訓班
統計技術的創立和發展
数理统计是数学的一个分支。研究怎样用有效的方法收集和使用带随机性影响的数据。
研究内容:1)用有效的方法去收集数据,即抽样理论和实验设计。2)有效地使用数据,即统计推断,是数理统计学的主要内容。
概率论是数理统计的基础。
統計學是對數量數據的收集,列表,分析,解說和展示的一種科學 。
6sigma專訓班
統計學的應用
統計方法廣泛適用于自然、社會、經濟、科學技術各個領域的研究。
政府要治理國家,作出決策,宏觀調控等都需要以充分、靈通、可靠的國民經濟和社會發展的統計資料爲基礎。
企業要開發産品,市場營銷,生産管理,質量控制,投資評估等等更需要統計資料和統計方法的支援。
幾乎所有的科學試驗都應用統計方法作爲有效的手段。
藥劑師應用統計方法進行新藥療效的顯著性檢驗,工程師應用統計方法測定新工藝、新材料的創新效果,天文學以統計方法爲基礎,預測星體的未來位置,生物學應用統計方法安排田間試驗,和遺傳工程研究等等。
6sigma專訓班
統計技術的特點和作用
對總體平均數進行估計。
相同的平均數可能有不同的分散度,數理統計就是告訴人們如何通過樣本對總體進行推斷。
比較兩個數量之間真正的差異。
分析影響事物變量的因素。
建立因變量與自變量之間的回歸關係 。
6sigma專訓班
概率论—随机事件及其概率
一、随机现象
在一定條件下,並不總是出現相同結果的現象為隨機現象。
隨機現象的特點:
1.隨機現象的結果至少有兩個。
2.哪一個出現,人們事先並不知道。
例子:
1.一天內進入某超市的顧客數
2.新產品在未來市場的占有率
3.加工機械軸的直徑尺寸
6sigma專訓班
二、随机试验的特点
1.可以在相同的条件下重复地进行;
2.每次试验的结果不止一个,并且能事先明确试验的 所有可能结果;
3.进行一次试验前不能确定哪一个结果会出现。
在概率论中,我们将具有上述三个特点的试验称作 随机试验。
三、样本空间,随机事件
(一)样本空间
我们将随机试验E的所有可能结果组成的集合称为样本空间,记为S,样本空间的元素称为样本点。
概率论—随机事件及其概率
6sigma專訓班
四、隨機事件
隨機現象的某些樣本點組成的集合稱為随机事件,简称事件。一般用大写拉丁字母A,B,C,…,表示。
如擲一骰子,”出現奇數點”是一個事件,可記為
A= 1,3,5
事件发生: 每次试验中,当且仅当这一子集中的一个样本
点出现时,称这一事件发生。
基本事件: 由一个样本点组成的单点集,称为基本事件。
必然事件: 在试验中必然会发生的事情,即S .
不可能事件:在试验中不可能发生的事情。即 .
概率论—随机事件及其概率
6sigma專訓班
五、 隨機事件的关系
1.包含: 在一個隨機現象中有兩個事件A與B,若事件A中任一個樣本點必在B中,則稱A被包含在B中,或B包含A。
概率论—随机事件及其概率
記為 A B
或 B A
6sigma專訓班
6sigma專訓班
6sigma專訓班
6sigma專訓班
事件的运算满足下述算律,设A,B,C为事件,则有
6sigma專訓班
6sigma專訓班
六、 概率
(一)概率的基本概念
1.定义:在相同的条件下,进行了n次试验,在这n次试验中,事件A发生的次数nA称为事件A发生的频数。比值nA/n称为事件A发生的频率,并记成f n(A) ,即
概率论—随机事件及其概率
6sigma專訓班
2、概率具有下列性质:
(3) 若A1, A2, … , Ak 是两两互不相容的事件,则
概率论—随机事件及其概率
0≦fn(A)≦1(非負性)
fn(S)=1(正則性)
6sigma專訓班
例1 考察 “抛硬币”这一试验,我们将一硬币抛5次,50次,500次,各做十遍。见下表
试验序号 n = 5 n = 50 n = 500
nH fH nH fH nH fH
1 2 22 251
3 1 21 256
5 1 24 251
7 4 18 244
9 3 27 262
10 3 31 247
6sigma專訓班
这种试验在历史上有人做过,数据如下表:
实验者 n nH f n(H)
得.摩根 2048 1061
蒲 丰 4040 2048
皮尔逊 12000 6019
皮尔逊 24000 12012
6sigma專訓班
例 2 考察英语中特定字母出现的频率。当观察字母个数n(试验的次数)较小时,频率有较大的波动性,但当n增大时,频率呈现出稳定性,下面是统计了438023个字母的频率表.
从上面的两个例子可以看出:
当n较小时,频率fn(A)在0与1之间随机波动,其幅度较大;而当n逐渐增大时,频率逐渐稳定于某个常数p,对每个事件A都有这样一个客观存在的常数p与之对应。这种“频率稳定性”即通常所说的统计规律性。它揭示了隐藏在随机现象中的规律性。
6sigma專訓班
字母 频率 H G
E L P
T D B
A U V
O C 00268 K
I F X
N M J
S W Q
R Y Z
6sigma專訓班
(二) 等可能概型 (古典概型)
定义 若试验E具有下列特点:
1。 试验的样本空间的元素只有有限个;
2。 试验中每个基本事件发生的可能性相同;(等可能性)
则称这种试验为等可能概型(也称古典概型)。
事件A中有k個樣本點
6sigma專訓班
(三).幾個重要計數原理
(1)加法原理
如果做某件事可由K類不同方法之一去完成﹐其中在第一類方法中又有m1種完成方法﹐在第二類方法中又有m2種完成方法﹐……﹐在第k類方法中又有mk種完成方法﹐那么完成這件事共有m1+m2+…+mk種方法.
6sigma專訓班
(2)乘法原理
如果做某件事需經K步才能完成﹐其中做第一步有m1種方法﹐做第二步有m2種方法﹐……﹐做第k步有mk種方法﹐那么完成這件事共有m1*m2*…*mk種方法.
(三).幾個重要計數原理
6sigma專訓班
(3)排列
從n個不同元素中任取r(r≤n)個元素排成一列稱為一個排列。按乘法原理﹐此種排列共有﹕
Prn=n(n-1)…(n-r+1)
記為 Pn=n!
(三).幾個重要計數原理
6sigma專訓班
(4)重復排列
從n個不同元素中每次取出一個作記錄,放回後再取下一個,如此連續取r次,所得排列稱為重複排列。
按乘法原理﹐此種排列共有﹕ 個
nr
(三).幾個重要計數原理
6sigma專訓班
(5)組合
從n個不同元素中任取r(r≤n)個元素組成一組(不考慮其間的順序)稱為一個組合。這種組合數有﹕
(nr)=
Prn
r!
(三).幾個重要計數原理
6sigma專訓班
例1 一只口袋有6只球 ,其中4只白球,2只红球。从袋中取球两次,每次随机地取一只,考虑两种取球方式:(a) 第一次取一只球观察其颜色后放回袋中,搅匀后再取一球。这种取球方式叫做放回抽样。(b) 第一次取一球不放回袋中,第二次从袋中再取一球。这种取球方式叫做不放回抽样。试分别就上面两种情况求: (i) 取到的两只球都是白球的概率,(ii) 取到的两只球颜色相同的概率,(iii)取到的两只球中至少有一只是白球的概率..
6sigma專訓班
解 (a) 放回抽样的情况:
设A,B,C 分别表示事件“两只球都是白球”,
“两只球都是红球”,“取到的两只球中至少有一
只是白球”。易知“取到的两只球颜色相同”这
一事件为AB,而C =
在袋中依次取两只球,每一种取法为一个基本事件,显然此时样本空间中仅包含有限个元素。且由对称性知每个基本事件发生的可能性相同,因而可利用古典概型来计算事件的概率。
6sigma專訓班
第一次从袋中取球有6只球可供抽取,第二次也有6只球可供抽取,于是
6sigma專訓班
( b)不放回抽样的情况,自己完成。
例2 将n只球随机地放入N(Nn)个盒子中去,试求每个盒子至多有一只球的概率(设盒子的容量不限)。
解 显然这是古典概型问题。因每一只球都可以放入N个盒子中的任一盒子,故共有NN … N=Nn种不同的放法,而每只盒子至多放一只球共有N(N-1)…[N-(n-1)]种不同的放法,故有
6sigma專訓班
例3 设有N件产品,其中有D件次品,今从中任取n件,问其中恰有k(kD) 件次品的概率是多少?
6sigma專訓班
一、 数理统计的基本内容
为了了解随机变量规律性,需要知道其分布,或数字特征,期望,方差等,这就需要知道反映问题全面情况的观测值,但这是不可能的。一般需从部分去推断全体。
例 一个钢筋厂日产某型号钢筋10000根,检验员每天只抽查50根,可提出
1. 怎样从仅有50根的钢筋强度去估计整批10000根的强度平均值?离散程度?
2. 若规定了该型号的标准强度,从抽查50个强度数据如何判定整批钢筋的平均强度与规定的标准强度有无差异?差异是否显著。
隨機變量及其概率分布
6sigma專訓班
3. 抽查得到的50个强度数据有大有小,如当天生产钢筋是采取不同工艺生产的,那么强度呈现的差异是由于工艺不同造成,还仅仅是由于随机因素造成?
4. 如果钢筋强度与某种原料成份有关,那么从抽查50根得到的强度与该成份含量的50组对应数据,如何去表述整批钢筋强度与成份之间的关系。
问题1、从50根强度数据去估计整批强度分布数字特征,称参数估计。
问题2、要求根据抽查得到的数据,去检验强度分布的某项数字特征与规定的标准差异。这就是检验数学期望。数理统计解决办法是先作一个假设(无差异),再检查是否成立,称假设检验。
问题3、分析误差原因,称方差分析。
问题4、研究变量关系,设回归分析。
6sigma專訓班
二、 隨機變量及其分布
一、隨機變量
表示隨機現象結果的變量稱為隨機變量。
常用X,Y,Z等表示隨機變量,其取值常用小寫的x,y,z等表示。
產品的性能一般都具有隨機性,其品質特性
就是隨機變量。
檢查一個產品,可能是合格品,也可能是不
合格品。設X表示檢查一個產品的不合格品數,
則X是只能取0或1兩個值的隨機變量。
隨機變量及其概率分布
6sigma專訓班
二、 隨機變量及其分布
二、隨機變量的分布
隨機變量的取值是隨機的,但在其背後是有規律性的,這個規律性就是分布。
分布包含如下兩個方面內容:
(1) X可能取哪些值,或X在哪個區間上取值。
(2) X取這些值的概率是多少,或 X在任一小
區間上取值的概率是多少。
6sigma專訓班
二、 隨機變量及其分布
三、離散隨機變量的分布
例: 設在10個產品中有2個不合格品,若從中隨機取出4個,則其中不合格品數X是離散隨機變量。
(1)它僅可取0,1,2等三個值。
(2)X取這些值的概率為:
X 0 1 2
P
事件”X=1”出現的機會最大,超過
6sigma專訓班
二、 隨機變量及其分布
三、連續隨機變量的分布
連續隨機變量X的分布要用概率密度函數p(x)表示。
例如: 一個接一個地測量產品的品質特性(長度),把測量的x值一個接一個地放在數軸上,差異就顯現出來。
當累積到很多x值時,就形成一定的圖形,體現出統計規律性。
6sigma專訓班
三、 均值、方差與標準差
隨機變量的分布有幾個重要的特徵數,用來表示分布的中心位置和散布大小。
均值是用來表示分布的中心位置,用E(X)表示。
方差是用來表示分布的散布大小,用Var(X)表示。方差大表示分布的散布較寬較分散,方差小表示分布的散布較窄較集中。
方差的開方稱為標準差,記為σ
σ=
6sigma專訓班
四、常用的分布
常用的離散分布,有二項分布、泊松分布、超幾何分布。
例; 在一個製造過程中,不合格品率為,從成品中隨機取出6個,記X為6個成品中的不合格品數,則X服從二項分布b(6,)
二項分布的均值、方差與標準差分別為:
E(X)=np=6*=
Var(X)=np(1-p)=6**=
σ(x)= = =
6sigma專訓班
四、常用的分布
例:(1)一定時間內,某操作系統發生的故障數
(2)一頁書上的錯字個數
(3)一件產品被擦傷留下的痕跡個數
以上可用泊松分布描述。泊松分布總與計點過程相關聯。計點是在一定時間內,或一定區域內,或一特定單位內的前提下進行的。
泊松分布的均值與方差相等。均為λ。均值、方差與標準差分別為:
E(X)= λ
Var(X)= λ
σ(x)=
6sigma專訓班
四、常用的分布
從一個有限總體中進行不放回抽樣常會遇到超幾何分布。
設有N個產品組成的總體,其中含有M個不合格品。若從中隨機不放回地抽取n個產品,則其中不合格品的個數X是一個離散隨機變量。假如n<=M,則X可能取0,1,…,n;若n>M,則X可能取0,1,…,M,記為h(n,N,M)。
均值、方差分別為:
E(X)=
Var(X)=
6sigma專訓班
五、正態分布
正態分布是品質管理中使用最頻繁的分布。
它含有兩個參數,μ 與σ ,常記為
μ為正態分布的均值,是正態分布的中心。 品質特性在μ附近取值的機會最大。
是正態分布的方差, σ越大,分布越分散, σ越小,分布越集中。
6sigma專訓班
統計基礎知識
总体 研究对象的某项数量指标的值的全体称为总体。
个体 总体中的每个元素称为个体。
如 某厂生产灯泡寿命的全体是总体,每个灯泡的寿命是一个体。
有限总体、无限总体:依据总体包含个体总数多少划分。有限总体很大时,近似为无限总体。
一般研究总体,即研究对象的某项数量指标X,它的取值在客观上有一定分布,X是一个随机变量。
總體就是一個分布。統計學主要研究:
(1)研究總體是什么分布?
(2)這個總體(即分布)的均值、方差是多少?
6sigma專訓班
了解总体性质的办法是抽样,即抽取一部分,去推断总体。
样本 从总体中抽取一部分个体进行观察,然后根据所得性质去推断总体性质,被抽出的部分个体,叫做总体的一个样本。样本中的個體稱為樣品。
抽样包括如何抽樣与统计推断,我们只讨论后者。
抽样,从方法讲:有放回与不放回。只要个体总数N比要抽到的样本容量n大得多,可将不放回抽样当作放回抽样处理。
简单随机樣本
(1)隨機性: 總體中每個個體都有相同的機會入樣。
(2)獨立性: 從總體中抽取的每個樣品對其他樣本的抽取無任何影響。
6sigma專訓班
一 、統計量與抽樣分布
統計量 不含未知參數的樣本函數稱為統計量。
抽樣分布 統計量的分布稱為抽樣分布 。
常用統計量可分為兩類:
(1)用來描述樣本的中心位置
(2)用來描述樣本的分散程度
1.有序樣本
設x1,x2,…,xn是從總體X中隨機抽取的容量為n的樣本,將它們的觀測值從小到大排列,這就是有序樣本。
2.描述樣本的中心位置的統計量
(1).樣本均值
樣本均值可以反映反映總體分布的均值。
6sigma專訓班
一 、統計量與抽樣分布
(2)樣本中位數 處於中間位置的數據。
(3)眾數 數據中最常出現的值,記為 Mod 。
樣本的眾數是樣本中出現可能性最大的值,它不
一定唯一。
2.用來描述樣本數據分散程度的統計量
(1).樣本极差
R=x(n)-x(1)
n為偶數
n為奇數
x=
6sigma專訓班
一 、統計量與抽樣分布
(2).樣本(無偏)方差
(3).樣本標準差
(4).變異系數
常用於不同數據集的分散程度的比較
6sigma專訓班
一 、統計量與抽樣分布
3.幾個常用的抽樣分布
(1).正態樣本均值 的分布為正態分布
(2).正態樣本方差 除以總體方差 的
的分布是自由度為 n-1的 分布,記為
(3).兩個獨立的正態樣本方差之比的分布是 F 分布
6sigma專訓班
中心极限定理
有些随机变量,它们是由大量相互独立的随机因素综合影响所形成的,而其中每一个别因素在总的影响中所起作用都是很微小的。这种随机变量往往近似服从正态分布。
6sigma專訓班
正態樣本均值的分布
1.設X1,X2,…,Xn是n個相互獨立同分布的隨機變量,假如其共同分布為正態分布
則樣本均值 仍為正態分布,其值不變仍為μ ,其方差縮小n倍。
2. 中心極限定理: 設X1,X2,…,Xn為n個相互獨立同分布隨機變量,其同分布未知,但其均值μ和方差
都存在,則在n較大時,其樣本均值近似服從正態分布。 隨機變量相互獨立是指其中一個取什么值不影響另一個的取值。
6sigma專訓班
中心極限定理表明﹕
無論共同的分布是什么(離散分布或連續分布﹐正態分布或非正態分布)﹐只要獨立同分布隨機變量的個數n較大時﹐ 的分布總是近似于正態分布﹐并且近似程度很好。這一結論是深刻的﹐也是重要的﹐這說明平均值的運算使人們從非正態分布獲得了正態分布。
6sigma專訓班
參數估計與假設檢驗
6sigma專訓班
统计推断的主要问题
由一些陈述的前提到达一个结论的过程称为推断,推断分为两种类型:演绎推断和归纳推断,数学的其他分支的推断都是演绎推断,只要前提正确,逻辑演绎正确,则得到的结论是永真的。归纳推断所得到的结论未必正确。
统计推断就是依据从总体的一个样本所取得的信息对总体做出一些结论。这一过程是一种归纳推断过程。
由于抽样受许多不确定因素影响,因此,由样本对总体做出的结论可信程度如何?如何做才更可靠?
由样本数据看,总体服从什么分布?
总体分布类型确定后,分布总的参数是多少?应该如何去估计?估计的可信度如何?
6sigma專訓班
参数估计
點估計: 設θ是總體一個未知參數,從該總體中隨機抽取容量為n的樣本是x1,x2,…,xn,那么用來估計未知參數θ的統計量 稱為θ的估計量,或稱為θ的估計。
矩法估計: 均值與方差在統計學中統稱為矩。總體均值與總體方差統稱為總體矩。樣本均值與樣本方差統稱為樣本矩。
矩法所得的估計稱為矩法估計。
(1).用樣本矩去估計相應的總體矩
(2).用樣本矩的函數去估計相應總體矩的函數
6sigma專訓班
参数估计
常用的矩法估計:
(1).用樣本均值 去估計總體均值μ
(2).用樣本方差 去估計總體方差
(3).用樣本標準差 s 去估計總體標準差 σ
矩法估計的優點是不要求知道總體的分布,缺點是估計不唯一。
6sigma專訓班
参数估计
例: 從某廠生產的一批鉚釘中抽取12個,測得其頭部直徑分別為:
求頭部直徑這一總體的均值μ與標準差σ 的估計
解: 用矩法估計得
=
=
6sigma專訓班
参数估计
例: 設樣本x1,x2,…,xn來自參數為λ的泊松分布,由於E(X)= λ,Var(X)= λ。
因此 與 都可以作為λ的矩法估計,
所以估計不唯一。常選用低階矩作為參數的矩法估計。均值是一階,方差是二階,故在泊松分布的場合,選用樣本均值 作為λ的估計。
6sigma專訓班
参数估计
點估計優劣的評選標準
(1).無偏性
設 是參數θ的一個估計量,如果
,則稱 是參數θ的無偏估計。
含義: 每次使用 估計θ是有偏差的,但多次使用
它,偏差的平均為零。
6sigma專訓班
参数估计
點估計優劣的評選標準
(2).有效性
設 都是參數θ的無偏估計量,如果對一切θ的可能取值有:
則至少有一個 ,嚴格不等號成立,
則 比 有效。
6sigma專訓班
参数估计
用樣本中的部分數據的平均去作μ的估計,雖然都是無偏的,但都比不上用全部數據的平均有效,我們應使用全部數據的平均去估計總體均值,它是最有效的。
6sigma專訓班
参数估计
正態總體參數的無偏估計
正態均值的無偏估計有兩個,一個是樣本均值,另一個是樣本中位數,優先選用均值。因為均值更有效。
正態方差 的無偏估計常用的只有一個,就是樣本方差
6sigma專訓班
参数估计
正態標準差σ的無偏估計有兩個,一個是對樣本极差 R 修偏而得,另一個是對樣本標準差s 進行修偏而得。
優先選用樣本標準差估計正態標準差。
因為它更有效。
6sigma專訓班
區間估計
在統計分析時,我們常常用一個區間及其出現的概率來估計總體參數.這種方法稱為區間估計.
具體來說,區間估計是用估計量和它的抽樣標準誤構成的區間來估計總體參數,並以一定概率保証參數將落在所估計的區間內.這一概率保証稱為置信,這計區間稱為置信區間.
6sigma專訓班
1.總體平均數的置信區間
如果總體服從正態分布,n>30,且總體方差己知,則有
置信區間包含有兩層含義.
a.從概率的意義上說,置信區間的含義是:對于來自正態分布的總體的所有樣本,若用上述置信區間公式
6sigma專訓班
計算它們的置信區間,則將有100(1-α)%的置信區間將總體平均數包括在其中
b.從實踐的意義上說,置信區間的含義是:對于來自正態分布的樣本,我們有100(1--α)%的把握性說該樣本的置信區間將總體樣本平均數包括在內。
估計總體平均數,這一置信區間可能包括ux,也可能沒有包括ux,一個置信區間包括ux的把握性只有100(1-α)%
6sigma專訓班
<30,且正態分布的方差未知,則有
例:某公司的股票價格服從正態分布,為了掌握該公司股票的價格,根據隨機抽樣方法,對其26天的交易價格進行調查,結果表明,平均價格為25元,方差為4元,求該公司股票價格的置信區間,置信度為98%.
6sigma專訓班
解:1.已知:n=26,a/2=,S²=4, =35
2. =
3.查t分布表,當a/2=1%,df=25時,
t1- a/2=,ta/2=.
4.根據置信區間的計算公式,該公司股票平均價格的置信區間為:
~35+
即:~
根據以上計算結果,我們可以說,按此區間估計方法,將有98%這樣的置信區間包括總體的股票平均價格.或者說,我們有98%的把握說總體的股票價格界于元至元之間.
6sigma專訓班
假設檢驗
假設檢驗是以樣本特征驗証假設的總體特征值是否成立的一种統計推斷方法,是抽樣推斷的另一重要內容。
我們在實際工作中,總體的數量特征往往是未知的.在這種情況下,我們只能根據歷吏的資料,工作經驗或某些事實, 假設總體參數等于某一定值。
6sigma專訓班
在总体分布函数完全未知或只知形式,但不知其参数的情况下,为了推断总体的某些性质,提出关于总体的某些假设。例如:
提出总体服从泊松分布的假设。
提出正态总体的数学期望等于0 的假设。
假设检验就是根据样本对所提出的假设作出判断:
是接受还是拒绝。
例1 某车间用一台包装机 包装葡萄糖。包得的袋装
糖重是一个随机变量,它服从正态分布。当机器正常时,
其均值为公斤,标准差为公斤。某日开工后为检
为检验包装是否正常,随机地抽取它所包装的糖9袋,称
6sigma專訓班
称得重量为(公斤):
问机器是否正常?
解 以, 分别表示这天袋装糖重总体X的均值和标准
差. 由于长期实践表明标准差比较稳定, 我们就设 =。
于是有X~N(, ). 这里未知. 问题是根据样本值来判
断=还是≠ . 为此, 我们提出假设
H0: =0=,
和 H1: ≠ 0,
这是两对立的假设。再给出一个合理法则。利用已知样本
6sigma專訓班
作出判断是接受假设H0(拒绝假设H1).还是拒绝H0:(即接
受H1). 如接受H0, 认为=0,机器是正常工作的.
检验的假设涉及总体均值,故想到用 来判断.如果
H0为真,则| -0|不应太大。且有
由于判断依据是一个样本, 当实际上H0为真时, 仍可能
6sigma專訓班
拒绝H0的判断,这是一种错误。犯这种错误的概率记为:
P{拒绝H0 |H0为真} 或
P0{拒绝H0 }, 表示参数m取m0时事件{·}的概率,
P∈H0{拒绝H0}, 表示 m取H0规定的值时事件{·}的概率。
虽然无法排除“弃真”错误,但希望控制在一定限度内,
即给出一个较小的数a(0<a<1),使犯错误概率不超过a,即
P{拒绝H0 |H0为真}≤a .
引入此式后就可确定k。我们取犯错误的概率最大为a ,即令
,由标准正态分布
由于当H0为真时
6sigma專訓班
分位点的定义得:k=Za/2 .
因而若观察值满足
则拒绝H0 。而若
则接受H0 。
本例中 ,取a=,则有k= = =.又
n=9, s=,再由样本算得 =,即有
于是,拒绝H0 ,认为这天机器工作不正常。
6sigma專訓班
一般取a=, . 故H0为真时, 即m=m0时,
上面的做法中, n固定时,选定后 , 数k就可以确定.再按
差异是不显著的. 数称显著性水平.上面判断是在显著水
平 之下做出的。
上述推断符合实际推断原理. 因通常a总是取得较小的
是小概率事件。若一次试验发生,则怀疑假设的正确性。
称为检验统计量
6sigma專訓班
前面的检验问题可叙述成:在显著水平下,检验假设
H0 : m=m0 ; H1 : m≠m0 ()
也常说成, “在显著水平下,针对H1 检验H0 ”。
H0称为原假设或零假设, H1称为备择假设。
当检验统计量取某个区域C中的值时,拒绝原假设H0
则称C为拒绝域,拒绝域的边界点称为临界点。如上例中
拒绝域|Z|≥za/2 , 临界点为z=-za/2 ,z=za/2 。
可能犯的错误: H0为真,拒绝之,称“弃真”,第Ⅰ类错误。
H0非真,接受之,称“取伪”, 第Ⅱ类错误。概率记为
P{接受H0 | H0不真} 或 P∈H1{接受H0}
6sigma專訓班
要使两类错误都小是不可能的,只能增大样本容量n。
一般控制犯第Ⅰ类错误的概率使它小于 。这种只对犯第
Ⅰ类错误的概率加以控制,而不考虑第Ⅱ类错误的检验问
题称为显著性检验。
形如()的备择假设H1,表示可能大于m0,也可能小于
m0 。称为双边备择假设,而该假设检验称双边假设检验。
还可提出单边检验:新工艺下,要求提高材料强度使
均值越大越好。提出
H0 : m=m0 ; H1 : m>m0 ()
(即新工艺不会比旧工艺差)()式称右边检验. 类似
H0 : m=m0 ; H1 : m<m0 ()
()称左边检验. 左边和右边检验,统称单边检验。
6sigma專訓班
假設檢驗的基本步驟
1.建立假設
原假設 備擇假設
備擇假設是在原假設被拒絕時而應接受的假設
2.選擇檢驗統計量,給出拒絕的形式
3.給出顯著性水平α,常取α=
4.定出臨界值 c,寫出拒絕域 W
5.判斷 樣本落入拒絕域 W,拒絕 即接受
樣本未落入拒絕域 W,接受
6sigma專訓班
假設檢驗的案例
例:某電工器材廠生產一种云母帶,其厚度在正常生產下服從 。某日在生產的產品中抽查了10次,發現平均厚度為,標準差不變,試問生產是否正常?(取α=)
解:1.立假設:
2.由於σ已知,故選用μ檢驗
6sigma專訓班
解:3-4.根據顯著性水平 α=及備擇假設
拒絕域為
5.由樣本觀測值,求得
觀測值未落在拒絕域中,所以認為生產正常。
假設檢驗的案例
6sigma專訓班
假設檢驗的案例
例:某廠規定產品必須經過檢驗合格後才能出廠,其不合格品率p不得超過5%。現從一批產品中隨機抽取50個進行檢驗,發現有4個不合格品,問該批產品能否出廠?(取α =)
解: 1.立假設
2.因為樣本容量較大,選用近似μ檢驗
3-4.拒絕域為
5.由樣本觀測值,
樣本觀測值未落在拒絕域中,允許出廠。
6sigma專訓班
6sigma專訓班