CHAPTER 06 · TOPIC 02
ANOVA 事後比較
整體 ANOVA 若達統計顯著,只能說明至少一組母體平均數不同,不能直接指出差異發生在哪兩組。若研究者想進一步比較各組平均數,就需要使用事先規劃的對比或事後比較(post hoc comparisons)。
本頁內容
- 為什麼不能直接反覆做 t 檢定?
- 單次錯誤率與整體錯誤率
- 兩組平均數差的共同標準誤
- Fisher's LSD 法
- Bonferroni 法
- Holm 法
- Holm–Šidák 法
- 四種方法如何選擇?
整體 ANOVA 若達統計顯著,只能說明至少一組母體平均數不同,不能直接指出差異發生在哪兩組。若研究者想進一步比較各組平均數,就需要使用事先規劃的對比或事後比較(post hoc comparisons)。
為什麼不能直接反覆做 t 檢定?
兩兩比較時有兩個問題需要決定。第一,各組平均數差的標準誤如何估計?第二,做了多次檢定後,每一次比較應使用多大的顯著水準 α?不同方法對這兩個問題採取不同處理,因此在第一類錯誤與統計檢定力之間有不同取捨。
若共有 k 組,全部兩兩比較的次數為:
| 符號 | 在這組公式中的意義 |
| C(N,n) 或二項係數 | 組合數;表示不考慮順序時,從指定總數中選取若干個的方式數 |
例如 3 組共有 C(3,2)=3 次比較;5 組則有 10 次。比較次數增加時,只要求每一次檢定的第一類錯誤率都是 0.05,並不能讓整組比較發生至少一次偽陽性的機率仍維持在 0.05。
單次錯誤率與整體錯誤率
以 表示單次比較的第一類錯誤率,以 表示同一組 m 次比較中至少發生一次第一類錯誤的機率,也就是家族錯誤率(family-wise error rate, FWER)。若先用各次檢定彼此獨立來理解,則有:
兩組平均數差的共同標準誤
在傳統等變異單因子 ANOVA 中,各組被假設具有共同誤差變異數。事後比較因此可以使用 ANOVA 表中的組內均方 MSE,估計第 i 組與第 j 組平均數差的標準誤。
下面四種方法可以使用相同的平均數差與共同標準誤;主要差別在於如何調整判定顯著的門檻或 p 值。
Fisher's LSD 法
Fisher's least significant difference(LSD)法以 pooled t 檢定的方式逐對比較平均數,使用 ANOVA 的 MSE 作為共同變異數估計。若整體 ANOVA 使用 α=0.05,每一組 LSD 比較通常也直接以 0.05 判斷,不再因比較次數調整 α。
| 符號 | 在這組公式中的意義 |
| α | 顯著水準或信賴區間兩端所使用的尾端機率 |
Bonferroni 法
Bonferroni 法把希望控制的家族顯著水準 分配給 m 次比較。每一次比較使用 作為門檻;等價地,也可以把每個原始 p 值乘以 m,再與 比較。其他 t 統計量與標準誤的計算和前面相同。
例如 3 組共有 3 次兩兩比較。若希望整體 ,每次比較的門檻就是 。
Holm 法
Holm t test 又稱 Holm step-down procedure。它也是控制家族錯誤率的方法,但不讓每個 p 值都承受相同的最嚴格 Bonferroni 門檻,因此通常比單純 Bonferroni 更有檢定力。
- 把 m 個原始 p 值由小到大排列為 p(1)≤p(2)≤⋯≤p(m)。
- 先將最小的 p 值與「家族顯著水準除以全部比較數」所得的門檻比較。若不顯著,就停止,後面的比較都不判為顯著。
- 若最小的 p 值顯著,再檢查第二小的 p 值;分母隨尚未判定的比較數逐步減少,因此門檻會逐步放寬。
- 遇到第一個不顯著的 p 值時停止;該項及後面較大的 p 值都不拒絕虛無假設。
| 符號 | 在這組公式中的意義 |
| α | 顯著水準或信賴區間兩端所使用的尾端機率 |
原文以 p 值由大到小排列,依序乘以 1、2、3、…來理解;這與由小到大排列後依序使用 m、m−1、m−2、…的倍率是同一件事。實際計算調整後 p 值時還要保持單調性,避免較大的原始 p 值得到反而更小的調整值。
| 符號 | 在這組公式中的意義 |
| n | 本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準 |
Holm–Šidák 法
Holm–Šidák t test 將 Holm 的逐步程序與 Šidák 門檻結合。仍先把 p 值由小到大排序;當目前還有 r=m−i+1 個假設尚未判定時,第 i 步使用下列門檻:
若 ,就繼續檢查下一個 p 值;遇到第一個不顯著結果便停止。原文以由大到小排序後的序號 k 表示同一概念,因此寫成 。改用「尚未判定的比較數 r」可避免把排序方向與次序混淆。
四種方法如何選擇?
| 方法 | 如何處理多重比較 | 主要特性 |
| Fisher's LSD | 通常不調整 α | 較寬鬆、檢定力較高,但家族第一類錯誤容易膨脹 |
| Bonferroni | 將家族顯著水準平均分配給所有比較 | 簡單且控制穩健,但比較多時可能過度保守 |
| Holm | 逐步放寬 Bonferroni 門檻 | 控制 FWER,通常比 Bonferroni 更有檢定力 |
| Holm–Šidák | 使用逐步 Šidák 門檻 | 門檻通常略寬於 Holm,但需留意檢定之間的相依性 |