生物統計學習筆記從概念、推導到實務判讀

CHAPTER 04 · TOPIC 01

Z 檢定

Z 檢定(Z test)把樣本統計量與虛無假設所指定的母體參數相比,再用標準誤衡量兩者相差了多少個抽樣波動。完成標準化後,檢定統計量在 H₀ 成立時服從或近似標準常態分配,因此可以利用 Z 分配求臨界值與 p 值。

本頁內容
  1. 先分清楚:個別觀察值的 Z 分數與平均數的 Z 統計量
  2. Z 檢定為什麼會成立?
  3. 使用 Z 檢定的條件
  4. 單一樣本平均數的假設與裁決
  5. 兩個獨立樣本平均數的 Z 檢定
  6. 信賴區間:由同一個 Z 標準化式反推 μ
  7. 把 H₀ 與 H₁ 的分配放在一起
  8. 右尾檢定的 α:由 H₀ 決定臨界點
  9. 右尾檢定的 β:同一臨界點改由 H₁ 觀看
  10. 樣本數公式:保留 α,也要保留發現差異的能力
  11. 從公式看樣本數的關係
  12. 由同一推導得到 power
  13. 本頁公式的符號說明

Z 檢定(Z test)把樣本統計量與虛無假設所指定的母體參數相比,再用標準誤衡量兩者相差了多少個抽樣波動。完成標準化後,檢定統計量在 H₀ 成立時服從或近似標準常態分配,因此可以利用 Z 分配求臨界值與 p 值。

先分清楚:個別觀察值的 Z 分數與平均數的 Z 統計量

個別觀察值的 Z 分數,是描述某個 X 距離母體平均數 μ 有多少個母體標準差;Z 檢定平均數時,研究對象則是樣本平均數 X̄。因為 X̄ 的標準差是標準誤 σ/√n,所以兩個分母不同。

個別觀察值的 Z 分數Z=XμσZ=\frac{X-\mu}{\sigma}
樣本平均數的標準化Z=Xˉμσ/nZ=\frac{\bar X-\mu}{\sigma/\sqrt n}
符號代表意義
X一個個別觀察值
由 n 個觀察值計算出的樣本平均數;抽樣前應視為隨機變數
μ母體平均數
μ₀虛無假設 H₀ 所指定的母體平均數
σ已知的母體標準差
n樣本數
σ/√n樣本平均數的標準誤

Z 檢定為什麼會成立?

若母體為常態分配,樣本平均數本身就是常態分配;母體不完全常態時,在適當條件與足夠樣本數下,也可由中央極限定理得到近似常態的抽樣分配。前面抽樣章節得到 E(X̄)=μ 與 Var(X̄)=σ²/n,因此:

樣本平均數的期望值E(Xˉ)=μE(\bar X)=\mu
樣本平均數的變異數Var(Xˉ)=σ2n\operatorname{Var}(\bar X)=\frac{\sigma^2}{n}
樣本平均數的標準誤SE(Xˉ)=σ2n=σn\operatorname{SE}(\bar X)=\sqrt{\frac{\sigma^2}{n}}=\frac{\sigma}{\sqrt n}

在 H₀: μ=μ₀ 成立時,把 X̄ 減去它在 H₀ 下的中心 μ₀,再除以 X̄ 的標準誤,就得到標準常態統計量:

Z=Xˉμ0σ/nN(0,1)(H0 成立時)Z=\frac{\bar X-\mu_0}{\sigma/\sqrt n}\sim N(0,1)\qquad(H_0\text{ 成立時})
符號在這組公式中的意義
μ母體平均數或隨機變數的期望值
平方根;常用來把變異數轉成標準差
~服從某個機率分配
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

使用 Z 檢定的條件

  • 研究的統計量具有常態抽樣分配,或在適當條件下可用常態分配近似。
  • 觀察值來自隨機抽樣,且彼此獨立;若是配對或群聚資料,必須改用符合設計的方法。
  • 平均數 Z 檢定的母體標準差 σ 已知。若 σ 未知而以樣本標準差 s 估計,原則上使用 t 檢定。
  • 大樣本會使 t 分配接近 Z 分配,但『樣本大』本身不會讓未知的 σ 變成已知。

單一樣本平均數的假設與裁決

雙尾檢定H0:μ=μ0,H1:μμ0H_0:\mu=\mu_0,\qquad H_1:\mu\ne\mu_0
右尾檢定H0:μμ0,H1:μ>μ0H_0:\mu\leq\mu_0,\qquad H_1:\mu>\mu_0
左尾檢定H0:μμ0,H1:μ<μ0H_0:\mu\geq\mu_0,\qquad H_1:\mu<\mu_0
方向顯著水準 α 下的拒絕條件p 值
雙尾|Zobs| ≥ z₁₋α⁄₂2P(Z≥|Zobs|)
右尾Zobs ≥ z₁₋αP(Z≥Zobs)
左尾Zobs ≤ zαP(Z≤Zobs)

兩個獨立樣本平均數的 Z 檢定

兩組獨立樣本比較時,研究的是平均數差 X̄₁−X̄₂。兩組母體變異數已知且樣本彼此獨立時,平均數差的變異數等於兩組變異數相加:

平均數差的變異數Var(Xˉ1Xˉ2)=σ12n1+σ22n2\operatorname{Var}(\bar X_1-\bar X_2)=\frac{\sigma_1^2}{n_1}+\frac{\sigma_2^2}{n_2}
兩獨立樣本 Z 統計量Z=(Xˉ1Xˉ2)Δ0σ12/n1+σ22/n2Z=\frac{(\bar X_1-\bar X_2)-\Delta_0}{\sqrt{\sigma_1^2/n_1+\sigma_2^2/n_2}}

Δ₀ 是 H₀ 所指定的母體平均數差;檢定『兩組沒有差異』時,Δ₀=0。若資料相依或成對,兩個平均數之間的共變異數不能直接忽略,應改以每一對的差值分析。

信賴區間:由同一個 Z 標準化式反推 μ

雙尾 (1−α) 信賴區間不是另一套獨立公式,而是從標準常態中央面積為 1−α 的不等式,把未知的 μ 解出來。

中央機率P ⁣(z1α/2Xˉμσ/nz1α/2)=1αP\!\left(-z_{1-\alpha/2}\leq\frac{\bar X-\mu}{\sigma/\sqrt n}\leq z_{1-\alpha/2}\right)=1-\alpha
乘上標準誤P ⁣(z1α/2σnXˉμz1α/2σn)=1αP\!\left(-z_{1-\alpha/2}\frac{\sigma}{\sqrt n}\leq\bar X-\mu\leq z_{1-\alpha/2}\frac{\sigma}{\sqrt n}\right)=1-\alpha
解出母體平均數 μP ⁣(Xˉz1α/2σnμXˉ+z1α/2σn)=1αP\!\left(\bar X-z_{1-\alpha/2}\frac{\sigma}{\sqrt n}\leq\mu\leq\bar X+z_{1-\alpha/2}\frac{\sigma}{\sqrt n}\right)=1-\alpha
信賴區間Xˉ±z1α/2σn\bar X\pm z_{1-\alpha/2}\frac{\sigma}{\sqrt n}

例如 95% 信賴區間使用 z₀.₉₇₅=1.96,因此為 X̄±1.96σ/√n。信賴水準描述的是重複抽樣並以同一程序建構區間時,長期而言包含真實 μ 的區間比例;不是說固定完成的這一個區間有 95% 機率包含固定的 μ。

把 H₀ 與 H₁ 的分配放在一起

α 是 H₀ 為真時,樣本平均數越過臨界點而誤拒絕 H₀ 的面積;β 則是某個特定 H₁(例如 μ=μ₁)為真時,樣本平均數沒有越過同一臨界點的面積。兩者必須分別在 H₀ 與 H₁ 的抽樣分配下計算。

H₀ 與 H₁ 的抽樣分配重疊圖:同一臨界值右側在 H₀ 下為型一誤差 α,左側在 H₁ 下為型二誤差 β
α 與 β 使用同一條臨界線,卻分別是在 H₀ 與特定 H₁ 的抽樣分配下計算。來源:本站依原始筆記圖重製

右尾檢定的 α:由 H₀ 決定臨界點

以下以 H₀: μ≤μ₀、H₁: μ>μ₀ 為例。在 H₀ 的邊界 μ=μ₀ 下,選擇臨界樣本平均數 c,使右尾面積等於 α。

H₀ 抽樣分配右尾圖:臨界值右側面積為型一誤差 α
右尾檢定中,先在 H₀ 分配上選擇臨界值,使其右側面積等於 α。來源:本站依原始筆記圖重製
臨界點的 Z 值z1α=cμ0σ/nz_{1-\alpha}=\frac{c-\mu_0}{\sigma/\sqrt n}
解出臨界樣本平均數c=μ0+z1ασnc=\mu_0+z_{1-\alpha}\frac{\sigma}{\sqrt n}

右尾檢定的 β:同一臨界點改由 H₁ 觀看

假設真實平均數是 μ₁>μ₀。沒有越過 c 就無法拒絕 H₀,因此 H₁ 分配中 c 左側的面積是 β。

H₁ 抽樣分配左側圖:未越過同一臨界值的面積為型二誤差 β
把同一臨界值放到 H₁ 分配中,左側未能拒絕 H₀ 的面積就是 β。來源:本站依原始筆記圖重製
H₁ 下臨界點的位置zβ=cμ1σ/nz_\beta=\frac{c-\mu_1}{\sigma/\sqrt n}
型二誤差β=Pμ1(Xˉc)=Φ(zβ)\beta=P_{\mu_1}(\bar X\leq c)=\Phi(z_\beta)
統計檢定力1β=Pμ1(Xˉ>c)=1Φ(zβ)=Φ(zβ)1-\beta=P_{\mu_1}(\bar X>c)=1-\Phi(z_\beta)=\Phi(-z_\beta)

樣本數公式:保留 α,也要保留發現差異的能力

把同一個臨界點 c 分別代入 H₀ 與 H₁ 的標準化式,再相減,c 會消去。這正是原推導中最重要的技巧:兩個分配共用同一條裁決界線。

H₀ 下z1α=cμ0σ/nz_{1-\alpha}=\frac{c-\mu_0}{\sigma/\sqrt n}
H₁ 下zβ=cμ1σ/nz_\beta=\frac{c-\mu_1}{\sigma/\sqrt n}
兩式相減,消去 cz1αzβ=μ1μ0σ/nz_{1-\alpha}-z_\beta=\frac{\mu_1-\mu_0}{\sigma/\sqrt n}
利用常態分配的對稱性zβ=z1βz_\beta=-z_{1-\beta}
解出 √nn=(z1α+z1β)σμ1μ0\sqrt n=\frac{(z_{1-\alpha}+z_{1-\beta})\sigma}{\mu_1-\mu_0}
單尾單一樣本的樣本數n=[(z1α+z1β)σμ1μ0]2n=\left[\frac{(z_{1-\alpha}+z_{1-\beta})\sigma}{\mu_1-\mu_0}\right]^2

計算出的 n 若不是整數必須向上取整。這個公式適用於此處設定的單一樣本、單尾、已知 σ 的平均數 Z 檢定;雙尾規劃時,臨界值改為 z₁₋α⁄₂。

補充案例:用真實研究理解樣本數與可偵測差異

髖關節發育不良(developmental dysplasia of the hip, DDH)高風險嬰兒通常會在出生後約 6 週接受髖關節超音波篩檢。早產兒在相同出生後週數時,實際發育成熟度可能比足月兒低,因此 Hockett 等人想確認:中度早產或接近足月出生的嬰兒,是否需要依早產程度調整超音波篩檢時間。

研究將出生未滿 37 週的 premature cohort 與出生滿 37 週的 full-term cohort 比較,所有嬰兒都在未校正年齡 5–8 週接受超音波。主要比較包括 alpha angle、femoral head coverage、異常超音波比例與是否接受 Pavlik harness 治療;其中這個樣本數案例針對的是『兩組平均 alpha angle 相差多少度』。alpha angle 是超音波評估髖臼骨性覆蓋與髖關節成熟程度的量測指標,角度較小通常表示髖關節較不成熟。

研究的 power analysis 使用母體標準差估計值 4.9°、雙尾顯著水準 5% 與 power 80%,分別規劃偵測 premature 與 full-term 兩組平均 alpha angle 相差 3° 或 2° 時所需的樣本數。

兩組平均數差的標準誤SE(Xˉ1Xˉ2)=σ2n+σ2n=σ2n\operatorname{SE}(\bar X_1-\bar X_2)=\sqrt{\frac{\sigma^2}{n}+\frac{\sigma^2}{n}}=\sigma\sqrt{\frac{2}{n}}
兩獨立組別、雙尾檢定的每組樣本數n=2[(z1α/2+z1β)σδ]2n=2\left[\frac{(z_{1-\alpha/2}+z_{1-\beta})\sigma}{\delta}\right]^2
以標準化效果量表示d=δσ,n=2(z1α/2+z1βd)2d=\frac{\delta}{\sigma},\qquad n=2\left(\frac{z_{1-\alpha/2}+z_{1-\beta}}{d}\right)^2
輸入條件本研究設定
比較Premature vs full-term infants
母體標準差估計值 σ4.9°
顯著水準 α0.05,雙尾
Power 1−β0.80
標準常態分位數z₀.₉₇₅=1.96;z₀.₈₀≈0.842

希望偵測 3° 的差異

預期差異 δ=3°,相對於標準差 4.9°,標準化效果量約為 0.61。

效果量d=34.90.61d=\frac{3}{4.9}\approx0.61
代入樣本數公式n=2[(1.96+0.842)×4.93]2n=2\left[\frac{(1.96+0.842)\times4.9}{3}\right]^2
常態近似結果n41.942 hips per groupn\approx41.9\quad\Longrightarrow\quad 42\text{ hips per group}

論文的 power analysis 報告每組需要 43 hips。以精確的 two-sample t power calculation 計算時,會因使用 t 分配與整數取整而比上述常態近似略多;兩者的結果一致。

希望偵測 2° 的差異

若希望連 2° 的較小差異也能被偵測,效果量降為約 0.41,因此需要更多樣本。

效果量d=24.90.41d=\frac{2}{4.9}\approx0.41
代入樣本數公式n=2[(1.96+0.842)×4.92]2n=2\left[\frac{(1.96+0.842)\times4.9}{2}\right]^2
常態近似結果n94.295 hips per groupn\approx94.2\quad\Longrightarrow\quad 95\text{ hips per group}

論文的 power analysis 報告每組需要 96 hips,同樣與常態近似結果非常接近。

Reference: Hockett C, Mayfield LM, Gill CS, Kim HKW, Sucato DJ, Podeszwa DA, Jo CH, Morris WZ. Does screening ultrasound timing in developmental dysplasia of the hip need to be adjusted for moderate preterm and near-term infants: a prospective study. J Pediatr Orthop. 2024;44(1):e25–e29. doi:10.1097/BPO.0000000000002540. PubMed: https://pubmed.ncbi.nlm.nih.gov/37773040/

從公式看樣本數的關係

條件改變所需 n原因
α↓n↑要求更少的型一誤差,裁決門檻更嚴格
β↓(power↑)n↑要求更少漏失真實差異,需要更多資訊
σ↑n↑資料更分散,訊號較難從雜訊中辨認
|μ₁−μ₀|↑n↓預計辨認的差異越大,越容易被發現

由同一推導得到 power

先解出 zβzβ=z1αμ1μ0σ/nz_\beta=z_{1-\alpha}-\frac{\mu_1-\mu_0}{\sigma/\sqrt n}
單尾檢定力1β=Φ ⁣(nμ1μ0σz1α)1-\beta=\Phi\!\left(\frac{\sqrt n\,|\mu_1-\mu_0|}{\sigma}-z_{1-\alpha}\right)
原文使用的等價寫法1β=Φ ⁣(nμ1μ0σ+zα),zα=z1α1-\beta=\Phi\!\left(\frac{\sqrt n\,|\mu_1-\mu_0|}{\sigma}+z_\alpha\right),\quad z_\alpha=-z_{1-\alpha}
雙尾近似規劃式1βΦ ⁣(nμ1μ0σz1α/2)1-\beta\approx\Phi\!\left(\frac{\sqrt n\,|\mu_1-\mu_0|}{\sigma}-z_{1-\alpha/2}\right)
條件改變power直覺
n↑power↑標準誤縮小,兩個假設較容易分辨
|μ₁−μ₀|↑power↑真實效果離 H₀ 更遠
σ↑power↓分配更寬、重疊更多
α↓(其他條件固定)power↓拒絕門檻變嚴格,β 因而增加
H₀ 與 H₁ 重疊圖:標示型一誤差 α、型二誤差 β 與檢定力 1−β
其他條件固定時,移動臨界值會使 α 與 β 反向變化;減少兩個分配的重疊則能提高 power。來源:本站依原始筆記圖重製

本頁公式的符號說明

符號代表意義
zq標準常態分配的第 q 分位數,滿足 P(Z≤zq)=q
αH₀ 為真時卻拒絕 H₀ 的機率(型一誤差)
β指定的 H₁ 為真時卻未拒絕 H₀ 的機率(型二誤差)
1−β統計檢定力;指定差異存在時成功拒絕 H₀ 的機率
μ₁用來規劃或計算 power 的特定真實平均數
c把拒絕區與不拒絕區分開的臨界樣本平均數
Φ(z)標準常態分配在 z 左側的累積機率
Δ₀兩樣本檢定中 H₀ 指定的平均數差