M2 - 基礎統計學 - 進階篇
(Advanced Basic Statistics)
Pg *
Pg *
回顧中心趨勢量測
衆數, 中位數 和 平均數
回顧偏差量測
全距, 變異數, 標準差
回顧“形狀”量測
基本繪圖工具 點狀圖, 直方圖, 箱形圖
論述機率概念和機率分佈概念
基本機率概念
常態分配:Anderson Darling,Skew,kurtosis
伯努利程式 (Bernoulli)
伯努力分佈和卜瓦松分配 (Poisson)
時間量測之指數與加瑪分配
章節目的與用途
Pg *
測量階段:可能取得的成果
明確專案定義
項目描述
運用 確立項目關鍵測量指標及文件跟踪
確認輸入及输出測量指標
製程流程圖及精簡製造(Lean Manufacturing)簡介
因果矩陣及魚骨圖
測量系統分析
數據系統和 Minitab軟體簡介
基礎統計學
量具研究: 定性型 / 定量型測量系統
確定製程能力
計算短期和長期 Cpk, Ppk, Sigma 水準, DPU, RTY
完成階段總段
結論,問題和下階段任務
Pg *
還記得 Taguchi 嗎?
LSL
USL
凡超出標準的部分
即表示品質損失
球門柱心態
傳統觀念
LSL
USL
凡因偏離目標而對社會造成的損失
即表示品質損失
變異有害無益
Taguchi 觀念
?
Pg *
屬性及變異數資料
增加資訊
類別
敘述
例子
統計工具
名目尺度
不連續的:
無秩序的
離散數據
無區間資料.
通過/失敗l
計算資料
屬性資料
產出資料
Chi2 Test
Contingency Tables
1- & 2-proportion tests
順序尺度
不連續的:
有條理的
離散數據
無區間資料
Good/Better/Best
適合的尺度
小/中/大
刻度 1 to 5
Nominal tests plus:
Sign Test
Wilcoxon Rank-Sum
Wilcoxon Signed-Rank
區間尺度
連續的:
Equal intervals;
No absolute zero.
Temperature (°C)
Position
Ordinal tests plus:
ANOVA Chi2 Test
DOE z, t tests
Regression F test
Kruskal-Wallis & More…
比率尺度
連續的:
Equal intervals;
Absolute zero.
Dimensions
Pressure
Concentration
Pg *
什麽是“統計值”?
從資料樣本中所提取的資訊:
最小值
最大值
百分位數(值): 25th, 50th,75th
分配次數
總數
缺點百分數
?
Pg *
基礎統計學概念
樣本統計學用於
估計 母體特徵
Pg *
爲什麽要産生基本統計資料?
透過解答下列問題藉以協助流程管理:
製程的輸出指標達到目標了嗎?
製程的輸出指標達到規格的程度是多少?
製程的績效改變了嗎?
兩條平行的製程是否一樣?
製程的輸出指標能達到什麽程度?
缺點率是多少呢?
Pg *
基礎統計學
主要的母體屬性:
位置
分 散 程 度
分 佈 的 形 狀
一致性
Pg *
中心趨勢量測
衆數
一組測量值的衆數的定義是出現次數最多(頻率最高)的測量值
如果將此組資料用直方圖或點圖來表示的話, 則最高的柱條或堆疊區間的中心點即爲衆值
中位數
一組測量值的中位數其定義是當測量值按大小順序排列時所取的中間數
Pg *
中心趨勢量測
算術平均數 (或平均數)
平均數是母體中所有可能的值乘以其發生的頻率之總和
母體平均數用希臘字母 m來表示
樣本平均數用 X 來表示, 並且用
?
估 計
Pg *
散佈與變異的量測
全距
一組測量值的全距是這一組測量值的最大值與最小值之差
?
這兩個分佈都有相同的全距值
但是它們的分佈形狀完全不同
Pg *
母體變異數 (s2)
變異數是所有規測數值與平均數之差平方的總和除以資料總個數.
用以估計母體變異數 (s2)
利用樣本變異數(s2) 形成一個“無偏差”估計值來估計母體變異數(s2)
散佈與變異的量測
?
估計
Pg *
散佈與變異的量測
母體標準差 (s)
標準差是變異數的正平方根
樣本標準差用以估計母體標準差
(s or Sigma “hat”)
Pg *
變異數的重要特性
變異數可相加性; 標準差不能相加
變異數後才可計算出“平均”標準差
Pg *
母體參數與樣本統計值
母體參數
母體平均數 (m)
母體變異數 (s2)
樣本統計量
樣本平均數(X-bar)
變異數估計值
Pg *
使用敘述統計的例子
收集資料來監控食品服務業浪費的情況
浪費的食物將以金錢呈現,且每個月累積
Pg *
使用統計和 Minitab作探測性的分析
?
使用 Minitab
計算
食物浪費資料的
敘述性統計值
描述性統計量: 浪費
Descriptive Statistics: Waste
去除兩端5%的極值後
變數 樣本數 平均數 中位數 平均數 標準差 平均標準誤差
Variable N Mean Median TrMean StDev SE Mean
Waste浪费 33
變數 最小值 最大值 第一個四分數 第三個四分數
Variable Minimum Maximum Q1 Q3
Waste浪费
Pg *
?
重Run Minitab ,再作一次分析, 這次包括圖形選擇
使用統計和 Minitab作探測性的分析
Pg *
位置
分散程度
形狀
假設資料是穩定的
下一步: 檢查資料隨時間延續的穩定性
使用統計和 Minitab作探測性的分析
Pg *
?
使用 Minitab 製作一個 運行圖 (Run Chart)
使用統計學和 Minitab作探測性的分析
Pg *
選擇: Editor Brush Set ID Variables
單擊 Brush 圖示
使用統計和 Minitab作探測性的分析
Pg *
拖曳滑鼠框住一組點來檢查子集合
使用統計和 Minitab作探測性的分析
Pg *
1/31/98 1
2/28/98 1
3/31/98 1
4/30/98 1
5/31/98 1
6/30/98 1
7/31/98 1
8/31/98 1
9/30/98 1
10/31/98 1
11/30/98 1
12/31/98 1
1/31/99 1
2/28/99 1
3/31/99 1
4/30/99 1
5/31/99 2
6/30/99 2
7/31/99 2
8/31/99 2
9/30/99 2
10/31/99 2
11/30/99 2
12/31/99 2
1/31/00 2
2/29/00 2
3/31/00 3
4/30/00 3
5/31/00 3
6/30/00 3
7/31/00 3
重新再作一次分析將資料以分組變數的形式分割開來
1st 組
2nd 組
3rd 組
使用統計和 Minitab作探測性的分析
Pg *
?
Variable Group N Mean Median TrMean StDev
Waste 1 16
2 10
3 7
Variable Group SE Mean Minimum Maximum Q1 Q3
Waste 1
2
3
使用統計和 Minitab作探測性的分析
Pg *
使用敘述統計:預測結果
敘述統計用於回答流程績效和客戶期望的眾多相關問題:
‘典型’的結果應為何?
結果的變動量是多少?
過了一段時間後,流程是否仍舊一致?
這些敘述統計工具,如機率分配可以用於:
解釋過去現象
預測未來
由次數或機率預測投資結果
Pg *
這些利益的頻率為何?
客戶滿意的頻率為何?
在流程中浪費的比率有多少?
在一小時內來店超過15個客戶的比率高不高?
零件出錯的比率為何?
打電話進來訂貨的放棄比率是多少?(可能在線上等太久而放棄.)
文件出錯的比率為何?
Pg *
在流程中浪費的比率有多少?
讓郵件上有正確的郵資
隨機抽取50 份郵件來衡量它們的重量,而這些資料將刊在
你猜有多少比率郵件是用第一類郵件的郵資,但其超過1盎司重量?
郵件是由大小分類.
所有商業大小的信封當於平信郵資,屬於第一類郵件
最大重量的第一類郵件的規定是1盎司.
Pg *
FC 郵件的敘述統計
位置, 散佈,形狀
Stat>Basic Statistics>Display Descriptive Statistics
(平均數)
(標準差)
Shape (Normal??)
Proportion > 1oz = 1/50 = .02
Note:Proportion estimate has low resolution
?
Pg *
母體分佈
Pg *
母體分佈
Pg *
常態檢定: Anderson-Darling
Anderson-Darling 試驗:
比較實際資料分配次數與理論常態分配, 使用樣本估計推算 m 與 s:
如果理論分佈適合這個資料分佈,計算出的試驗統計值A2 應該較小。
由p值大小可看出檢驗值A2 是否符合常態分配。
Pg *
介紹 Z-值
什麽是 Z-值?
Z-值 是基於標準常態分佈的
常態分佈機率 = 0 和 = 1
機率已知並記錄在案
可用 Z-值計算其他常態分佈的機率
標準常態分佈
所有常態分佈皆可轉換成標準常態分佈
Pg *
Z-轉換
Z-轉換將任何一個常態分佈(其 m 和 s) 轉換成一個標準常態分佈 (m = 0, s = 1)
其值, z (z-值), 表明以標準差爲單位 X 中的任何一個數距平均數有多遠
Pg *
實例: 評估蒸汽殺菌製程性能
組裝前, 對一台醫學儀器的某一子部件進行蒸汽殺菌以減少污染水平使其符合污染標準.
殺菌製程要求在“曝光”階段的全距非常小, 其標準爲 1250C ± .
每天, 在其中某次殺菌曝光運行中, 用控制探測棒提取樣本溫度.
一位技師已收集了兩個月的資料以供分析. 資料可在 文件中找到.
Pg *
Z-轉換
實例: 在 文件中研究來自高壓滅菌器過程的溫度資料
使用 Minitab 生成敘述性統計量
平均數 = 標準差 =
對於第一個容器溫度資料點, 其 z 值是多少?
Pg *
計算容器溫度 2的 Z-值
選 Calc>Calculator…然後鍵入下列資訊:
Pg *
真實世界與 Z 世界
將溫度 和 Z 的資料產生直方圖
Graph>Histogram…
Pg *
真實世界與 Z 世界 – 直方圖
?
真實世界
Z 世界
Pg *
Z 的詮釋
Z-轉換值是以Sigma為單位 Z 距平均數的距離
有多少缺點是由此製程産生的 ?
真實世界
Z世界
?
Pg *
從 Z 中計算不良率
缺點數是:
缺點數是:
真實世界
Z 世界
P(Temp < )
P(Temp > ) +
P(Z < )
P(Z > ) +
Pg *
Z > st 的機率是多少?
0
1
2
3
-1
-2
-3
%
~ 95%
~ 68%
Z 世界
~.006%
較高的不良率
%
或 百萬分之不良品率
60 DPPM
?
Pg *
常態分配機率
68%
95%
%
Pg *
常態分佈
Pg *
經驗性機率規則
下列值是對理論與經驗常態分佈機率的估計得出來的
標準差個數
標準差個數
標準差個數
± 1 s
68%
60-75%
± 2 s
95%
90-98%
± 3 s
%
99-100%
Pg *
第一堂課所談的重量是常態的嗎?
Pg *
常態檢定的例子
Pg *
常態檢定(Normality Test)
Stat>Basic Statistic>Normality Test
?
常態機率圖
機率
服務時間
Pg *
常態的量測: 偏斜(Skew)
常能機率分配的資料應平均的分佈於平均數週邊:50%分配於兩側
Skew (偏斜的)在衡量其不對稱調和
完美的對稱時 Skew =
正常
正偏
負偏
Pg *
常態的量測: 峰態 (Kurtosis)
常態分配應有標準的形狀對應其平均數與變異數
Kurtosis在衡量其壓扁(太扁或太平)或擠壓(太高或太瘦)的次數分配圖形與常態分配相關
Kurtosis 為 乃完美的適合度
壓扁的
正常
擠壓
Pg *
偏斜(Skew)和峰態(Kurtosis): Statistics from Minitab
?
Pg *
使用常態模式計算第一類郵件的不良率
Cumulative Distribution Function
Normal with mean =
and std dev =
x P(X <= x)
Calc>Probability Distributions>Normal
Pg *
練習:漢堡餡肉的重量
對漢堡餡肉而言,多少比例是人們不易察覺,是磅?
x P( X <= x )
Pg *
文件中有多少比例會出現錯誤?
採購所花的時間用於重覆處理採購訂單
150張訂單中的58張樣本需要加強審核
由樣本估計所有文件的錯誤率是58/150=.387
平均每週有40張新的訂單被送到採購部門
對任何一週而言,預期有更多人力投入此工作,訂單需要重工的最大可能數目為何?
Pg *
常用的機率分配介紹
Pg *
介紹二項式分配 (Bernoulli Distribution)
二項式分配是當傾向成功為p,而 0 p 1時,在一系列試驗中觀察成功的機率
此分配在下列情況下成立 :
所有結果各自獨立
傾向成功對所有試驗而言是一致的
符合這些條件的流程稱之為 :
Pg *
二項式(Bernoulli)分配的例子
投擲一公平的硬幣,設定硬幣“正面人頭朝上“為成功.
成功的機率是p =
二項式分配可算出投擲十次硬幣出現4次正面的機率 =
重複試驗中,“成功”代表發現的瑕疵品 。
如果p = 代表在95% 的信心下,100次試驗中,瑕疵品不超過12個
區分服務電話的成功,透過時間長度來決定 .
如果成功率= 98%,下20次服務電話成功的機率為
Pg *
二項式分配公式
二項式分配機率
N次試驗的伯努力實驗中,p代表成功,機率分配如下:
舉例:
過去,成功機率為3/4,現在6個中有4個失敗,所有事情改變了嗎?找出6個中有4個失敗的機率,你的結論為何?
DO NOT
MEMORIZE
Pg *
二項式分配 (Binomial Distributions)
以下為兩種不同的二項式分配.
第一種為每個試驗出現許多成功,最終會趨近於常態分配
第二種則每個試驗僅出現少數成功,最終趨近於卜瓦松(Poisson)分配
Pg *
計算訂單不良品的最大數量
對p的最佳估計為58/150 = .387
試驗的次數= 40(每週)
99%信心水準下不良品的最大數量?
Calc>Probability Distributions>Binomial
x P(X<=x ) x P(X<=x )
22 23
為何有2個值?
Pg *
卜瓦松分配 (Poisson Distribution)
卜瓦松分配可以用來計算流程結果的機率,如下列比率:mice/公畝、缺點/單位、來電量/小時等等。
Mice, 缺點, 及來電量是 “事件”
公畝、單位及小時代表事件發生的“機會區域“
卜瓦松分配有下列情況 :
事件的發生次數是相等的在整個機會區域內
事件發生的可能性在整體發生區域上各自獨立,互不影響
符合此條件者稱之為“卜瓦松分配(Poisson Process)”
Pg *
卜瓦松分配 (Poisson Distribution) - 離散
比較此兩種分配
第一種為低成功次數之伯努力分配
第二種為相同平均數下之卜瓦松分配
?
Pg *
卜瓦松分配 (Poisson Distribution)
定義:
在Poisson實驗中,代表在特定機會區域內的平均成功數, e=… 機率分配被定義為:
舉例:
在正常上班日的早晨,實驗室需求產出是每小時四件 .
在任何一個小時此產出水準到達每小時六件的機率為何?
DO NOT
MEMORIZE
Pg *
使用 Minitab計算卜瓦松機率(Poisson Probabilities)
在正常上班日的早晨,實驗室需求產出是每小時四件 .
在任何一個小時此產出水準到達每小時六件的機率為何?
Calc>Probability Distributions>Poisson
Poisson with mu =
x P(X = x )
Pg *
指數分配 (Exponential Distributions)
用來指定工作週期時間的機率
v
不須
記憶
Good News for
“Less the Better” Targets
Pg *
指數應用的例子
當量測服務時間時,蒐集資料用以決定印刷服務的品質
問題:所有工作的99%完成需多久時間?
v
Pg *
指數分配能夠被使用嗎?
Graph>Probability Plot
v
Pg *
指數應用的例子
假設 m = 82 分鐘
假設頻率的型態是指數分配
In Minitab: Calc>Probability Distribution>Exponential
P( X <= x ) x
Pg *
經驗 vs. 理論
考量單一工作週期時間的直方圖
經驗分配如何展現?
Two modes?
單一工作 10?
另外多重工作 33?
系統是否從單一工作流程轉化為多重工作流程 ?
為細節調查工作提供方向
Pg *
Gamma 分配
用來決定週期時間的機率
適用於一系列工作
Two Parameters:
a = 按順序執行的工作數目
b = 每一工作的平均服務時間 (1/b = Mean Service Rate)
Pg *
二個工作週期時間
= ab
2 = ab2
舉例:
b = 10分鐘/平均週期時間
a = 2 個工作
= 20 分鐘
= 分鐘
Pg *
三個工作週期時間
= ab
2 = ab2
舉例:
b = 10分鐘/平均週期時間
a = 3 個工作
= 30
=
Pg *
十個工作週期時間
= ab
2 = ab2
舉例:
b = 10 分鐘/平均週期時間
a = 10 個工作
= 100
=
Pg *
經驗 vs. 理論
從一個多重任務週期中思考描述性統計
平均數 =
變異數 =
平均數 = ab
變異數 = ab2
b = 2/ =
平均服務時間
1/b = .18
平均服務時間的比率
a = / b =
# Tasks
Pg *
練習
資料按整體批次記錄程序收集
回答以下的問題:
每批記錄中批次良品比率為多少?
如果以平均來看,每個班別生產25批,在任何一個班別中,少於5個不良品的機率為何?
每批記錄超過3個不良的機會為多少?
從回顧資料,有多少工作被包含於中,並且每個工作平均週期時間為多少?
每批於10分鐘內被記錄的機率?
Pg *
課後作業
批量記錄:
評估缺點率和流程時間的一致性,以班別、產品類型和週次
若任何因子看來很顯著,以因子水準評估第一次就做對,缺點率和流程時間
Pg *
模組中使用的文件:
Pg *
Pg *
Pg *
僅僅達到規定的公差是不夠的. 日本工程師 Genichi Taguchi 發明了一個函數來描述不按目標生産對社會造成的損失.
考慮到一個由許多部件組成的機械裝配, 是由許多零組件的零組件組成的部件, 而這些零組件是由許多元件組成. 在裝配等級上, 每一個零組件必須設計容差以應付其下的元件偏離目標的可能性. 每一個級別的裝配, 必須考慮越來越多的容差來應付零件偏差. 每一個零件越靠近目標, 總裝越好.
怎樣測量我們的成功?
Pg *
正如資料類型有連續性或離散性一樣, 也有描述連續性變數或離散性變數的機率分佈函數, 特別的, 我們將研究離散性資料的平均分佈, 伯努力和卜瓦松分佈, 和連續性資料的常態分佈. 其他分佈, 如STUDENT的 t 分佈和 Chi-平方分佈將會在以後的幾周內談到.
Pg *
統計值是從一組資料中創造出來的東西. 是整理資料創造資訊的結果
對樣本資料的操作如計數, 加和及分類爲作出決定提供了資訊
Pg *
統計學不總是用來確定資料組的特點, 而是用來從較大的“總體”抽取資料並試圖確定總體的特徵.
一個總體是分析人員感興趣的相似專案組成的集體. 對於製程式庫改進專案, 人們感興趣的總體一般是所有産品,或服務涉及的所有事件.
爲了確定製程式庫性能, 分析人員會從産出線上提取“典型”的樣本用來獲得描述性的統計資料以幫助描述“總體”或製程式庫輸出指標.
Pg *
生成統計資料很容易, 用象Minitab 和 Excel這樣的應用軟體, 只要敲幾下鍵盤就能得到一批統計值.
過去, 某些質量改進運動的失敗就是因爲大家只得到幾個統計資料而不加應用.
重要的是要先問問題, 再用適當的統計結果去回答. 否則, 大量時間會花在採集資料, 生成統計資料和表格上但沒有什麽效果.
Pg *
由“代表性”的樣本獲得的統計資料用於對總體的特徵進行客觀估計. 每個特徵雖需要瞭解但這還不足以描述總體特徵. 所有單個特徵加在一起才能讓我們完全瞭解流程行爲.
Pg *
理論上,沒有兩個測量結果能完全一致.用統計學的說法表達,兩個測量結果完全一致的機率是零. 不過, 根據分析所需的數值解析度, 測量結果可以分組在相同的區間內, 如直方圖表示的那樣. 出現測量資料頻率最高的區間即衆值. 在統計意見調查中, 衆值常被用於測量最受歡迎的看法. 一組資料可能會有超過一個值具有相同的頻率, 這時, 這組資料可被稱爲是雙衆值的,三衆值的,等等.
計算中位元值時, 資料要按大小排列. 排在中間的值就是中位值. 若資料個數是奇數,中心資料的值就是中位元值.若資料個數是偶數,中位值就是中間兩個數值的平均數. 當資料偏離常態分佈較多時常用中位元值表達資料組的中心趨勢.
Pg *
平均數 (或算術平均數) 是最常用的中心趨勢測量指標. 不過, 若總體資料高度歪斜, 即資料是非對稱的, 平均數具有誤導性,應用中位值來代替. 若資料是對稱的, 平均數和中位值是相同的.
Pg *
極差能有效測量資料的極端值, 但不能有效的提供資料在平均數附近的偏差資訊. 而變異數和標準差就能給出好得多的資訊.
Pg *
計算樣本變異數時似乎應由平均數偏離值的平方總和除以樣本個數. 變異數, 顧名思義是偏離值的平方的平均. 這個計算結果是對總體變異數的良好估計, 但又是一個有偏估計. 因爲若干這樣的估計值的平均不等於總體變異數. 第一個公式以 (n-1)爲分母實際上是總體變異數的定義公式(Dividing by (n-1)first formula is actually the definition of the population variance). 我們將在隨後的練習中使用計算樣本變異數的公式.
下面列出的公式便於在電腦程式裏或手算時計算變異數. EXCEL 實際上就是用該公式計算變異數和標準差.
Pg *
協變異數在偏離程度隨測量值變化而變化時很有用. 例如, 電壓,電流等電測量資料可能是對一個基本信號用線性放大器放大轉換而來的.
Pg *
人們常犯的錯誤是把標準差加起來.
這樣會得到錯誤結果.
小心!
Pg *
如果你想知道:
樣本變異數計算用 n-1爲分母的原因如下:
樣本平均數, x-Bar, 用以估計總體平均數. 由於相同的資料被用來估計總體平均數和變異數, 就存在數學上的局限. 這個局限是, 樣本各資料與平均數的差加在一起必須是零.即
.
因而只有n-1個差值是獨立的. 最後的差值由
和前n-1個差值決定
Pg *
Pg *
用 文件中的資料回顧描述性統計值的應用.首先用Minitab描述性統計工具,但不用圖表分析獲得對位置和離散度的估計值. 值得注意的是離散值很大, 且中位數和平均數的差別也很大.
Pg *
用圖表工具分析“形狀”後發現(中心)位置和離散度未必是有用的描述指標. 直方圖顯示資料是雙衆值的, 表明資料由多個群體夾雜在一起組成.
Pg *
第四個特徵是資料隨時間延續的穩定性.
Pg *
所生成的運行圖表明資料隨時間飄移…..可能是三個.
Pg *
用刷子(BRUSH)圖示可檢查潛在的資料分組.
在ID variable 對話方塊選定 [date] 和 [waste] 將使滑鼠選定的資料呈現出來.
Pg *
用Minitab的這個研究特徵發現資料有三組, 1/98-4/99 (16 個月), 5/99-2/00 (10 個月), 和 3/00-9/00 (7 個月). 下一步是對這個分隔進行評估. 給資料建立一個分組變數標識可大有裨益:
1 給 1/98-4/99
2 給 5/99-2/00
3 給 3/00-9/00
由於資料點很小,分組變數標識可在一個空的欄目中單個輸入.
如數據點很多, 用Minitab可建立一個識別變數欄, 爲各子資料組建立其獨特的欄目描述.分組變數標識也可以用計算器建立. 例如,假設c5 標記 第一組資料, c6第二組,c7 第三組. c8欄可標記 c5+2*c6+3*c7的計算結果, 把第1, 2 和 3組資料分別標記爲 1, 2 和 3 .
Pg *
Pg *
分析結果表明資料分隔是正確的. 雖然具體在哪個資料點開始分隔可能有爭議,但資料顯示流程隨時間在漂移. 這是一件好事嗎? 你還想知道其他什麽嗎?
Pg *
不論, 頻率的模式不僅是提供一個可達到顧客期望的流程的一種方法, 而且也能夠用來預測某些價值將如何發生。
我們很少能夠確切地預料某些價值什麼時候發生, 但是, 基於頻率的預先模式,我們能夠預料他們發生的頻率。
此外, 我們能夠利用頻率和可能性之間的關係, 如果一個事件每次發生的機率是10% , 則它這次將發生的可能性是 10% 。
Pg *
潛在過程輸出產值是process owner所關注的, 且他們發生的頻率將對資源配置產生衝擊。
舉例:
當不好的事物發生時, 資源將分配給改善作業, 它可能包括重工。
當需求超過職員模型時, 若不分配附加資源,品質將無法獲得顧客滿意。
Pg *
Pg *
從資料傳輸得到了對流程成果的評估。在50個樣本數中有一封信件的重量比最大重量1 盎司還重。
因為第50個樣本中有一個單位, 或者有2% 常態分配率, 我們能夠合理地預料將來2%郵件處理將不遵守此規格。
此方法解決了一個問題:
0 in 50 = ??
1 in 50 = .02
2 in 50 = .04
3 in 50 = .06
我們如何能夠在沒有收集更多資料的情況下,找到更精確的常態分配估計比率?
Pg *
現在我們考慮從平均數是100,標準差是10的總體中抽樣調查.
下面顯示出隨資料點按數量級增加引起的圖表形狀變化.
隨資料點增加, 分組區間越來越小. 在資料點足夠的時候, 總體分佈會趨於連續性分佈, 正如最後一個圖表所顯示的那樣.
定義: 一個離散隨機變數(如距離)的機率分佈是對各個可能出現的隨機變數賦予其出現機率的函數. 各機率值在零與一之間, 所有機率值的總和是一.
Pg *
Pg *
Pg *
標準常態分佈是機率研究中最有用的工具之一.任何常態分佈皆可轉換成標準常態分佈. 與Z值對應的幾率早在一個世紀前已列成表格. 在常用軟體如 Minitab 和Excel存在前, 人們就是用這些標準常態分佈表得到幾率值
標準常態分佈表可在本節後面的附錄中找到. 在隨後的例子裏我們會用他作很多計算.
Pg *
Z-轉換是一個把具有任何平均數和標準差的常態分佈轉換爲標準常態分佈的方法.
Pg *
Pg *
Z-轉換是一個把具有任何平均數和標準差的常態分佈轉換爲標準常態分佈的方法.
Pg *
Pg *
分組區間數的選取有一個指導方針, 如n 是資料點數, 分組區間數應接近由2k > n 獲得的 k 值,且 k 應在 5 和 15間.
這裏有35個樣本, 25 = 32, 所以 按指導方針應選取6 個區間. 我們選用五個區間以觀察中央區間的情況.
Pg *
如直方圖所示, Z-世界和真實世界具有相同的分佈形狀.
一個值的Z-分數只不過是該值距平均數的標準差個數.
Pg *
Pg *
Pg *
Pg *
再回到機率研究:
按機率分佈函數的定義, 我們知道從–1 到 +1 曲線下的面積等於一 .
從 –1 到 +1 曲線下的面積約爲總面積的 68%. 這意味著按照機率密度分佈函數,由該總體抽取的樣本在–1 和 +1 之間出現的可能性是68%.
Pg *
Pg *
如已知總體平均數和標準差, 可利用這個指導思想近似估計實際機率. 換句話說, 如總體平均數是 50 ,標準差是 5, 如果樣本測量值是62, 那麽這個樣本來自該總體的幾率只有 1-5%.
Pg *
P值對The Anderson Darling 檢定是一個從0到1的可能範圍, 0= no chance, 1=certain
這裡的P值是計算A2的可能性,其統計值可能像從一個人口的常態分佈中收集真實的地資料那樣大
評估這二個試驗假設:
H0: 資料是常態的
Ha: 資料是非常態的
H0 is given the benefit of the doubt.那麼, 除非 P 很小 (假設P = ),否則沒拒絕常態的假定。
Pg *
Pg *
Pg *
Pg *
Pg *
Pg *
計算這個未符合規格僅依觀察得到的數字,使用經驗性分配簡單地來估計不良率。在這資料中有一個沒有符合說明書的觀測資料。 有這個方法的局限性, 如同之前所述, 是可用於估計比率的決定。
如果分析者假設資料是從一常態分佈的流程中所收集, 則能夠用這個正態分佈來產生較佳的不良率估計。
在.733盎司的平均重量和.1436盎司的標準差下,製程產出率將不符合1盎司,最大數是.0315 or % 。
Pg *
在這個問題中, 認為 25 磅是最小的重量規格。
在.278 磅平均重量和 .030 磅的標準差下,漢堡 patties 的比例不依declared 重量的是.1791 或 % .
Pg *
Pg *
伯努力分配被用來決定為經歷 0,1,2 個…或者從一系列試驗“成功”的任何數字, 結果是成功或者失敗。由試驗者決定事件的成功與否。
如果每一個試驗成功的可能性(把它叫做P ) 是相同,並且不受過去的行為所影響,這個分配即為準確的。
在賭博方面有個“賭徒謬誤” 的現象,跟隨一位一貫在賭盤上壓選紅色的充滿希望的賭徒壓注。 如果“黑色”在一排出現了五次, 你們可能更傾向於下次以“紅色”為賭注,因為它是應出現的。 當然, 它不一定是真的。紅色或黑色在任何給定的旋轉賭盤中出現的機會並不受之前出現的情形所影響。第六個旋轉出“紅色“的機會與其他所有相同,是50-50。
Pg *
伯努力試驗的一個簡單的例子:
考慮將一副紙牌洗牌。將卡片中若抽到的紙牌為方塊定義為成功。 伯努力試驗是由從一副紙牌中抽取五張紙牌以決定是否成功或失敗所組成。在這個實例中: n=5 and p=
伯努力試驗需要在每次抽完紙牌後,將該紙牌放回原副牌中重新洗牌後再抽出下張紙牌。
若抽出的紙牌未放回原副牌中的實驗則稱為hypergeometric 試驗。 在任何統計學課文中能夠找到這種類型的試驗的分配機率。
Pg *
伯努力分配是相當複雜的,然而,若符合下面的條件, 我們能用常態分配估計伯努力分配:
那是, 如果試驗中的當數字大於或等於 5,用P 和Q 的最小值除以這個數字。這個必要條件確保伯努力分配是相當地對稱。
如果符合這個條件, 能夠由常態分配估計N 和P 的伯努力分配。
The binomial formula first fills up n slots with k “success” probabilities and (n-k) “failure” probabilities: P x P x P x P x ……x (1-P) x (1-P) x (1-P). This order, however is just one possibility. All k successes need not occur in the first k trials. It corrects for the fact that the k “successes” could occur in any subset of size k of the n slots, multiplying the probability by the number of combinations nCk
Pg *
一個高成功率的二項分配看起來是常態的,且事實上也能用常態分配來估計。
一個低成功率的二項分配能夠由下面簡報將討論的卜瓦松分配來估計。
Pg *
我們可在簡報第198頁中得知答案。伯努力分配的應用容易由Minitab來作。
利用樣本來為任何假設的試驗估計“成功”的機率,有用的報告值與累積的機率會相符合且能確定不良品的最大數量99%必然發生,換言之,大多數部門可能會有經驗。
Pg *
Pg *
這圖形例子是卜瓦松分配估計低成功頻率的伯努力分配的技能。
Pg *
當伯努力分配的標準近似值不能適用時,即當在區域中只有一些成功時, 卜瓦松分配能用來估計伯努力分配。
在定義這些分佈區域時可能是一個很枯燥的主題, 然而,在爾後的統計分析期間這些知識將越來越重要。
Pg *
Pg *
Pg *
Pg *
無論是否適合於特殊分配,用機率圖評估你的資料。
圖形的組成:
1.圖點表示作為累積頻率的序列符合資料的比例。
2.合適線對分配模型百分位數的圖形陳述。
3.對於合適線的一套近似 % 的信賴區間。
Anderson-Darling統計數值的計算測量適合度。 小的數值表示很適合。
Pg *
Minitab 有一套固定方法來計算指數分配的各種值之累積機率。
這個固定方法需要要知道平均數, 它唯一定義這分配。
For a population of service incidences whose mean is 82 minutes, Minitab reports that 99% of all services incidences will be completed within 377 minutes or hours.
Pg *
有時從樣本資料得到的“形狀”表示由多個母體一起摻雜組成。對於一些假設, 不同部分可能可被鑑定和突然發生,這些應該由製程專家確認得出的結論。
Pg *
Gamma 機率函數是用來計算事件週期時間的機率的通用工具。
有兩個變數決定位置、分佈範圍和形狀。
對週期時間的應用,這裡有兩個變數表示:
a = 按順序執行的工作數目
B = 每一工作的平均服務時間
如果a是整數, Gamma分配也叫作 Erlang 分配。
Pg *
對於 2 個工作, Gamma分配遠離 表現出一個模式。
計算式:
= ab = 2*10 = 20 分鐘
= [ab2]1/2 = [2*102]1/2
= [200]1/2= 分鐘
With 2 tasks, the gamma distribution exhibits a mode away from .
Calculations:
= ab = 2*10 = 20 minutes
= [ab2]1/2 = [2*102]1/2
= [200]1/2= minutes
Pg *
當工作數目增加,Gamma分配出現愈來愈標準的模式。
計算式:
= ab = 3*10 = 30分鐘
= [ab2]1/2 = [3*102]1/2
= [300]1/2= 分鐘
Pg *
最終, 一個標準的近似值可以適當的估計這個Gamma分配。
當一系列工作的數目(第一個變數)能充分的如下所示,上述情形將會發生。
-3 = 0 , or
= 3 , or
2=92, or
2/2 = 9, or
[a2/b2]/[a/b2] = 9, or
a = 9
不依賴平均的服務率記錄這個結果。
Pg *
應用所謂的Gamma分配, 由描述性統計分析的線索能夠決定或確認分析過程的類型。
Pg *
Pg *