CHAPTER 03
檢定的基本概念
Foundations of Hypothesis Testing
章節目錄
- 抽樣(Sampling)
- Screening test
- ROC CURVE
- 假設檢定(hypothesis test)
- 假設檢定(hypothesis test)是在對母群體參數提出假設的基礎上,利用樣本訊息來判斷假設是否成立的統計方法。
- 補充一:隨機變數的線性組合
- 補充二:抽樣平均數的標準誤
- 抽樣(抽出n個共有CnN組, X表抽樣平均數的平均):
- 補充三:抽樣變異數的平均推估群體的變異數
- 抽樣(抽出n個共有CnN組):
中央極限定理(central limit theorem, CLT)此定理宣稱,反覆從平均數為μ,變異數為σ2的母群體抽取樣本大小為n(n>=30)的樣本,並且計算每一次的樣本平均數X,不管母群是何種分配,這些抽樣而得的平均數都會成為常態分配。而且樣本平均數μX會等於μ,樣本變異數σX2=σ2n,因此標準差σX=σn,此稱為平均數的標準誤(standard error, SE)
抽樣(Sampling)
是一種推論統計的方法,是指從母體中抽出一部分作為樣本,通過樣本來做一些推斷。
抽樣原因
樣本比母體可以快速方便的研究
樣本比母體研究花費更少
大多數的情況不可能研究整個母體
樣本比母體研究結果更精確
經過適當挑選的樣本,有方法可以評估數據的誤差
挑選樣本可以降低異質性(heterogeneity)
取樣方法
簡單隨機取樣(simple random sampling)
也稱純隨機抽樣。從母體中隨機抽取個體作為樣本,每個個體被選中的機率一樣
方便統計,但實行過程非常困難
例子:從台北所有的癌症病患中,隨機取樣100個病患
系統取樣(systemic sampling)
也稱等距取樣。將母體中的所有單位按一定順序排列,在規定的範圍內隨機地抽取一個單位作為初始單位,然後按事先規定好的規則抽取其他樣本單位
前提是母體資料要均勻,否則易取到偏差值
例子:每個星期一去北榮就診的癌症病患中隨機取樣數達100。在這個例子中,每個星期一到日去北榮就診的病患沒有差異時,視為母體資料均勻
分層取樣(stratified sampling)
母體依照某種規則分成獨立不重複的層,然後利用簡單隨機從各層分別取樣
母體資料分配不均勻,可以先分層再來取樣
例子:從全台北的癌症病患中隨機取出50位男性病患與50位女性病患
群集取樣(cluster sampling)
將母體分成幾個群集,群集間的變異小、群集內的變異大,再從這幾個群集中抽出數個群集的全部個體進行抽樣
對不同群體,一群一群進行取樣
例子:從台北三間不同的醫院A、B與C分別取樣30、30與40位癌症病患
| 母體 | 抽樣(抽n個)的所有可能 | 抽樣平均 |
| 總共N個(μ,σ) | X11,X12,X13,…,X1n | x1 |
| X21,X22,X23,…,X2n | x2 | |
| … | … | |
| Xm1,Xm2,Xm3,…,Xmn | xm |
(其中m=CnN)
抽樣後的統計值(證明請看補充)
抽樣平均數的平均
μ=Ex=xiN
抽樣平均數的標準誤
σX=sd=σn
抽樣變異數的平均推估群體的變異數
sd=(xi-X)2n-1
Screening test
這裡指的是數量(COUNTS)
| 有病 | 沒病 | |
| 檢測為陽性(有病) | FALSE POSITIVE | TRUE POSITIVE |
| 檢測為陰性(沒病) | TRUE NEGATIVE | FALSE POSITIVE |
這裡指的是比率(PROPORTIONS)
| 有病 | 沒病 | |
| 檢測為陽性(有病) | 1-SPECIFICITY | SENSITIVITY |
| 檢測為陰性(沒病) | SPECIFICITY | 1-SENSITIVITY |
ROC CURVE
ROC分析是一個二元分類模型,就如上面分為有病和沒病一樣,但是如果你得到的數據是一個連續的值的話,就需要定一個邊界的值(閾值, threshold),例如如何診斷高血壓。
當你定了不同的域值,就會有不同的SPECIFICITY和SENSITIVITY,而此時,我們將P(Type-1 Error)=1-specificity當作X軸,把SENSITIVITY當作Y軸,然後把這些不同域值所對應的坐標連起來就是ROC曲線了,而當SPECIFICITY愈大了話,SENSITIVITY就會愈小,兩者是反向的變化,但因為在座標的處理有把SPECIFICITY加負號,所以在座標上的圖型是遞增的,就如以下曲線。
一般愈往左上凸的曲線,其分類效果愈好,也就是大至來說可以得到較高的Sensitivity和Specificity,而愈往左上凸的曲線其曲線下的面積就愈大,我們稱其為Area under the Curve of ROC(AUC ROC)。而我們定域值的方法就取決於我們要多大的Sensitivity或Specificity,可以由ROC曲線來決定,常見的方法是一個斜率為1的直線往右邊移動等一個碰到的點,但如果希望要比較大的Sensitivity時或Specificity時,也可以做調整,並沒有規定一定要取哪一個點。
假設檢定(hypothesis test)
步驟
根據研究假設寫出虛無假設( null hypothesis, H0)及對立假設( alternative hypothesis, H1或Ha)
宣稱原意犯的型一誤差之大小,並劃定拒絕區
進行統計分析、做裁決,並解釋結果
✽因為先假設虛無假設是對的,所以看的是型一誤差。也就是說先假設虛無假設是對的,然後抽樣做檢定,看抽樣所做的檢定的誤差是否在可接受範圍內,來看可不可以否定虛無假設,而誤差的可藉由統計的方法、資料的處理方式來決定怎麼看。由統計資料的數據格式來決定資料的處理方式,而不同的處理方式會有不同的分佈狀況,也就是可能會有常態分佈、t分佈、卡方分佈、F分佈等,因此就由這些分佈來看p值,也就是拿來看誤差的大小。
✽檢定是先假設虛無假設是對的,然後再抽樣比較,由型一誤差來看是否推翻。但是一個資料本來就有很多的面向,以上只是其中之一,而如果先假設對立假設是對的,則看的就是型二誤差β,但我們探希望他是對的,因此就有一個名詞叫做統計檢定力,其等於1-β。
✽然後其檢定可能用到t分佈、卡方分佈、F分佈等,這些都是由常態分配推導出來的分配,因此這個虛無假設也可以這樣看:假設虛無假設是對的,而在一般常態分佈下,資料經過一定處理會出現一個機率分佈的曲線(t分佈、卡方分佈、F分佈等),而抽樣出來應該會比較接近機率較大的地方,但如果抽樣出來的結果在機率很小的地方(p值很小),表示可以拒決虛無假設。
虛無假設與對立假設
假設(hypothesis),就是對母群體的某種看法。
假設檢定(hypothesis test)是在對母群體參數提出假設的基礎上,利用樣本訊息來判斷假設是否成立的統計方法。
在假設檢定中首先需要提出兩種假設:虛無假設(null hypothesis)與對立假設(alternative test)。
虛無假設:通常是研究者想要蒐集證據予以推翻的假設,用H0來表示。
✽而不論我們用的是常態分配、t分配、卡方分配、F分配,我們會有一個機率分佈圖,這個機率分佈圖其實就是我們假設虛無假設是對的情況下,抽樣的結果經過處理後所分佈的樣子,所以如果我們實際上抽樣的結果愈來愈偏離中心了話,就表示拒絕虛無假設的可能性愈大。
所以由上可知,我們後面用到的一些檢定方法,我們決定他是用什麼分配(常態分配、t分配、卡方分配、F分配)來求p值取決於我們把數據處理方法,也就是在資料為常態分配的狀況下,我們進行處理後他們會呈什麼分配,然後再用這些分配來求p值。
雙尾檢定與單尾檢定。
雙尾檢定的拒絕區在兩側,一般關心的只是差異,並不管其大小
單尾檢定則是有大小之分,如關心母群平均數是否「高於6000元」之類的,所以要偏向一個方向,拒絕域在一側。一般「大於」是右尾,「小於」是左尾。
p值在單雙尾的關係,在同一筆抽樣的樣本中,我們的p值是由檢定中先求出一個值,然後再用這個值來求p值,而在Z或t這種機率密度函數是對稱的圖形中,因為雙尾是兩邊的、單尾是一邊的,所以雙尾的p值是單尾的兩倍(我們所關注的只是抽樣所得的值來求p值,和所定的標準無關)。
型一誤差與型二誤差
| 真實裁決 | H0真 | H0假 |
| 拒決H0 | Type I errorP(機率)=α | 裁決正確統計檢定力1-β |
| 不拒決H0 | 裁決正確P(正確)= 1-α | Type II errorP(機率)=β |
裁決的方法
p值法
p-value:
在給定H0為真的情況下,觀察到一個檢定量至少像計算所得到的數值一樣極端的機率。The probability of obtaining a result as extreme as the one observed, if the null hypothesis is true.
和α值有關
A vital concept related to the level of significance.
一般來說p值愈小愈好(要拒絕虛無假設),而我們會先定一個標準如0.05或0.01之類的,而我們要做的是要看p有沒有小於我們定的標準
標準臨界值法在某種分配下,我們比較檢定之後所得的值和臨界值(critical value, 我們只己定的)的大小,反正就是要在臨界值外面就是了(其實就和信賴區間法類似),而臨界值外面的面積其實就和p值法我們定的0.05或0.01一樣,而檢定所得的值外面的面積(還要看單雙尾)其實就是p值
信賴區間法
信賴區間其實就是上面的臨界值之間,如果是單尾,就是一個臨界值的一邊;如果是雙尾,就是兩個臨界值之間。
而我們稱這個信賴區間為(1-α)×100%信賴區間,這邊的α其實就是p值法所定的0.05或0.01,然後要看的就是檢定之後所得的值是否在信賴區間之外(如果在外面的話表示可以拒絕),而信賴區間之外的面積其實就是p值
✽其實p值法、標準臨界法和信賴區間法都是差不多的東西,三者都是先定一個抽樣所得的值和虛無假設的差異可接受的範圍(p值法定的則是可以接受差異的範圍內的百分比),然後在看抽樣的結果有沒有在範圍內,而我們一般希望拒絕虛無假設,所以希望在範圍外,而p值則是希望愈小愈好。
虛無假設是後面所有介紹的檢定的核心,因為資料有很多種樣式(連續/不連續、一組/兩組/多組…),而一組資料給我們時,我們的虛無假設的方式也可能有多種,也就是一組資料的處理方式也可能有多種,但是最後都會用虛無假設的方式來呈現。因此我們之後再看這些檢定時,要關注的是抽樣資料的處理方式,及這樣處理後的抽樣資料在虛無假設是對的情況下會呈現什麼樣的分佈(可能本身就是那個分佈,或近似那個分佈),最後就可以用這些分佈及抽樣的結果來判定是否可以拒絕虛無假設(用p值或信賴區間)
補充一:隨機變數的線性組合
(LINEAR COMBINATION OF RANDOM VARIABLES)
當資料合併的需要用到的方法
形式:每組資料的隨機變數為Xi,進行以下的組合(ci為常數)
L=c1X1+…+cnXn=i=1nciXi
Ex.假設有兩組數據,其隨機變數為X1、X2
Lsum=X1+X2
Ldiff=X1-X2
Laverage=0.5X1+0.5X2
(平均數可看成線性組合,如抽樣平均數的標準誤)
公式:
EL=Ec1X1+…+cnXn
=Ec1X1+…E(cnXn)
=c1EX1+…cnEXn=i=1nciE(Xi)
VarL=Varc1X1+…+cnXn
=Varc1X1+…Var(cnXn)
=c12VarX1+…+cn2VarXn
=i=1nci2VarXi
✽注意:
因為是隨機變數,所以才可以在變異數的運算中直接拆開,在作運算時要清礎符號所代表的到底是樣本中的數還是隨機變數,因有隨機變數才可以進行以上線性合併的計算,符號要搞清楚才不會混淆。
補充二:抽樣平均數的標準誤
<法一>
母群體:
μ=Ex=xiN ,其中N代表母群體的個數
σ2=xi2N-xiN2=N-1N2xi2-2N2xixj
抽樣(抽出n個共有CnN組, X表抽樣平均數的平均):
X=所有抽樣組(抽樣中xi/n)/CnN=Cn-1N-1xi2/nCnN=xiN=μ
(因每個xi被取出Cn-1N-1次)
σX2=Cn-1N-1xi2+2Cn-2N-2xixjn2CnN-xi2+2xixjN2
(左式為每組平均平方的平均除組數:xi2出現Cn-1N-1次、xixj出現Cn-2N-2次; 右式為母群體平均的平方,所求及為母群體平方的變異數)
=N-nnN2xi2-2N-nnN2N-1xixj
=N-nnN-1N-1N2xi2-2N2xixj=N-nnN-1σ2
所以記抽樣平均數的標準誤σX=sd=N-nN-1σn
又母群體的N很大,因此N-nN-1(修正項)可忽略,記為σX=sd=σn
<法二>(老師上課所提的證明,例用隨機變數的線性組合)
有一母群體,如果取n個樣本的話,把他看成有n個相同的母群體各取一個然後除以n,得到的就是取n個樣本的平均,其忽略了取到重復的可能性,因為假設母群體很大,所以取到兩個一樣的可能很小。
取的是隨機變數X1,…,Xn(注意是隨機變數),進行L=1/n X1+…+1/n Xn的線性組合,就相當於取n個樣本的平均的分佈
而每個隨機變數的E(Xi)=μ、VarXi=σ2
(其中i=1~n, μ為母體的平均, σ為母體標準差)
則VarX=Vari=1nXin=i=1n1n2VarXi=σ2n
因為是隨機變數所以才能這樣運算!!!
補充三:抽樣變異數的平均推估群體的變異數
母群體:
μ=Ex=xiN ,其中N代表母群體的個數
σ2=xi2N-xiN2=N-1N2xi2-2N2xixj
抽樣(抽出n個共有CnN組):
σX2=1CnN組間[n-1n2組內xi2-2n2組內xixj]
=1CnN[(n-1)Cn-1N-1xi2n2-2n2Cn-2N-2xixj]
(右式為每一組變異數的平均,括號內則是每一組變異數的和)
=n-1Nnxi2-n-1N(N-1)n2xixj
=n-1nNN-1N-1N2xi2-2N2xixj=n-1nNN-1σ2
⇒σ2=N-1Nnn-1σX2
因此當你沒有母體標準差時,由樣本的標準差σ來推測時,
推測σ=N-1Nnn-1σ
又母群體的N很大,因此N-nN-1(修正項)可忽略,
推測sd=nn-1σ=(xi-X)2n-1,為樣本標準差