CHAPTER 06 · TOPIC 01
單因子變異數分析(One-way ANOVA)
單因子獨立樣本變異數分析(one-way independent-samples analysis of variance, one-way ANOVA)用來比較三組或以上彼此獨立的樣本,判斷它們在某個定量變數上的母體平均數是否全都相同。兩
本頁內容
- ANOVA 的核心想法:分組是一個模型
- 資料形式與研究問題
- 成立條件
- 為什麼各組的組內平方和可以合併?
- 為什麼均方相除會形成 F 分配?
- 建立假設
- 符號與資料結構
- 單因子 ANOVA 模型
- 第一步:分解平方和
- 第二步:分配自由度並計算均方
- 第三步:計算 F 值與 p 值
- ANOVA 摘要表
- 完整分析流程
- ANOVA 不只一種
單因子獨立樣本變異數分析(one-way independent-samples analysis of variance, one-way ANOVA)用來比較三組或以上彼此獨立的樣本,判斷它們在某個定量變數上的母體平均數是否全都相同。兩組資料也能使用 ANOVA,但只有兩組且採用相同的等變異模型時,獨立樣本 t 檢定通常更直接。
ANOVA 的核心想法:分組是一個模型
把觀察值分成不同組別,就等於建立一個以組別解釋結果的模型。模型若有解釋力,各組平均數應有明顯差異,也就是組間變異較大;同一組內的觀察值則應相對集中,使未被分組解釋的誤差較小。這個「模型所解釋的變異與誤差變異相比」的想法,之後也會出現在迴歸分析。
F 值越大,表示組間差異相對於組內誤差越大,資料與「所有母體平均數相同」的虛無假設越不相容,因此右尾 p 值通常越小。不過,F 值大並不等於模型一定「好」,仍要同時檢查研究設計、模型假設、效果大小與實際意義。
資料形式與研究問題
| 項目 | 單因子獨立樣本 ANOVA 的要求 |
| 自變數(因子) | 一個類別變數,包含兩個以上彼此獨立的組別或水準 |
| 依變數 | 可合理計算平均數的定量變數 |
| 觀察單位 | 每個觀察單位只屬於一組,各觀察值彼此獨立 |
| 研究問題 | 各組的母體平均數是否全都相同? |
「單因子」是指模型中只有一個自變數,不是指只有一組資料。例如,用治療方式將受試者分成安慰劑、低劑量與高劑量三組,再比較治療後血壓,因子是「治療方式」,三種治療方式則是這個因子的三個水準。
成立條件
- 獨立性:各觀察值彼此獨立,通常由抽樣或研究設計加以保證。
- 常態性:在每一組中,誤差項近似常態分布;實務上應查看各組分布或模型殘差。
- 等變異性:各組母體具有共同變異數 σ²,因此各組的組內平方和可以合併估計同一個誤差變異數。
為什麼各組的組內平方和可以合併?
計算組內均方 MSE 時,我們先把所有組別的組內離差平方和加在一起,再除以組內自由度 n−k。讀者很自然會問:每組平均數明明不同,為什麼這些離差可以直接合併?關鍵是離差都先以各組自己的平均數為中心,所以它們不再反映組與組之間的平均數差異,而是在描述各組內部的隨機變動。
傳統單因子 ANOVA 假設每組誤差的母體變異數都等於同一個 σ²。雖然各組平均數 μⱼ 可以不同,但各組的 SSE,j 都是在估計同一個誤差變異數,因此可以像等變異獨立樣本 t 檢定的 pooled variance 一樣,依各組自由度合併。每組估計自己的平均數會用掉 1 個自由度,所以合併後的自由度是 Σ(nⱼ−1)=n−k。
為什麼均方相除會形成 F 分配?
原文提到 F 分配由兩個卡方變數相除而來,這正是 ANOVA 公式成立的重要理由。更精確地說,在 H₀ 成立,且誤差彼此獨立、服從常態分布並具有共同變異數 σ² 時,組間平方和與組內平方和除以 σ² 後,會形成兩個彼此獨立的卡方變數。
F 分配不是直接把兩個卡方變數相除,而是把它們各自除以自己的自由度後再相除。代入 ANOVA 的兩個平方和,共同的 σ² 會在分子與分母中消去,最後正好得到組間均方除以組內均方。
| 符號 | 在這組公式中的意義 |
| Xᵢⱼ | 第 j 組中的第 i 個觀察值 |
| X̄ⱼ、X̄·· | 第 j 組平均數與全部資料的總平均數 |
| nⱼ、n、k | 第 j 組樣本數、總樣本數與組別數 |
| SSM、SSE、SST | 組間、組內與全體平方和 |
| MSM、MSE | 組間均方與組內均方 |
| F | 組間均方除以組內均方所得的 ANOVA 檢定統計量 |
| σ²、σ | 母體變異數與母體標準差;下標用來指出是哪一個統計量的標準差 |
| ~ | 服從某個機率分配 |
組內雖然包含很多組,但在共同變異數假設下,各組的組內平方和都是同一種誤差資訊;相加後形成一個自由度為 n−k 的合併卡方變數。因此 ANOVA 的分母只有一個 MSE。若各組變異數不同,這個傳統的共同 MSE 與上述精確 F 分配關係便不再成立,應考慮 Welch ANOVA 等不要求等變異的方法。
建立假設
符號與資料結構
假設共有 k 組,第 j 組有 nⱼ 個觀察值,總樣本數為 n。用 Xᵢⱼ 表示第 j 組中的第 i 個觀察值。
| 符號 | 意義 |
| Xᵢⱼ | 第 j 組中的第 i 個觀察值 |
| nⱼ | 第 j 組的樣本數 |
| n=Σnⱼ | 所有組別合計的總樣本數 |
| X̄ⱼ | 第 j 組的樣本平均數 |
| X̄·· | 全部 n 個觀察值的總平均數(grand mean) |
| k | 組別數,也就是因子的水準數 |
單因子 ANOVA 模型
每個觀察值可以寫成「總平均 + 該組效果 + 個人誤差」。組別效果描述第 j 組平均數相對於總平均的偏移;誤差則描述個別觀察值相對於自己組平均數的偏移。
在樣本資料中,同一個總離差也能直接拆成組間部分與組內部分:
| 符號 | 在這組公式中的意義 |
| Xᵢⱼ | 第 j 組中的第 i 個觀察值 |
| X̄ⱼ、X̄·· | 第 j 組平均數與全部資料的總平均數 |
| nⱼ、n、k | 第 j 組樣本數、總樣本數與組別數 |
| SSM、SSE、SST | 組間、組內與全體平方和 |
| MSM、MSE | 組間均方與組內均方 |
| F | 組間均方除以組內均方所得的 ANOVA 檢定統計量 |
第一步:分解平方和
離差有正有負,直接相加會互相抵銷,因此將離差平方後再加總。總平方和 SST 可以精確分解為組間平方和 SSM 與組內平方和 SSE。
第二步:分配自由度並計算均方
平方和會隨樣本數與組數增加,不能直接拿來比較。將各平方和除以對應自由度,得到可比較的均方(mean square)。
| 變異來源 | 自由度 | 理由 |
| 組間(model) | k−1 | k 個組平均數受到總平均數的一項限制 |
| 組內(error) | n−k | 每一組估計一個平均數,共損失 k 個自由度 |
| 全體(total) | n−1 | 全部資料估計一個總平均數 |
第三步:計算 F 值與 p 值
在 H₀ 成立時,組間均方與組內均方都在估計共同誤差變異數 σ²,因此 F 通常接近 1。若組別平均數確實不同,組間均方還會包含組別效果,使 F 傾向變大。
由 F 分配表或統計軟體求得 p 值後,將它與事先設定的顯著水準 α 比較。若 p≤α,拒絕 H₀,結論是至少一組母體平均數不同;若 p>α,則沒有足夠證據拒絕 H₀,但不能因此證明所有平均數完全相同。
ANOVA 摘要表
| 變異來源 | 平方和 SS | 自由度 df | 均方 MS | F 值 | p 值 |
| 組間(model) | SSM | k−1 | MSM=SSM/(k−1) | MSM/MSE | 右尾機率 |
| 組內(error) | SSE | n−k | MSE=SSE/(n−k) | ||
| 全體(total) | SST | n−1 |
完整分析流程
- 確認研究問題是一個類別因子對定量結果的平均數比較,且各組觀察值彼此獨立。
- 先看各組樣本數、平均數、標準差、分布圖與可能的異常值。
- 設定 H₀、H₁ 與顯著水準 α,並檢查常態性與等變異性是否合理。
- 計算 SSM、SSE 與 SST,確認 SST=SSM+SSE。
- 依自由度計算 MSM 與 MSE,再求 F 值及其右尾 p 值。
- 報告各組描述統計、F 值、兩個自由度、p 值與效果大小;若整體檢定顯著,再依研究問題進行適當的對比或事後比較。
補充:為什麼兩組資料會得到 F=t²?
當單因子獨立樣本 ANOVA 只有兩組時,若它與獨立樣本 t 檢定採用相同的等變異模型,兩者其實是在檢定同一個虛無假設。下面從兩種方法使用的變異數估計開始,逐步說明兩個統計量為什麼會滿足 F=t²。
第一步:寫出等變異獨立樣本 t 統計量
第二步:證明 ANOVA 的 MSE 就是 sₚ²
兩組各自的樣本變異數乘以自己的自由度,就是該組的組內離差平方和。把兩組相加,便得到 ANOVA 的組內平方和 SSE。
因此,等變異 t 檢定使用的合併變異數 sₚ²,與兩組 ANOVA 分母中的 MSE 是同一個共同組內變異數估計值。
第三步:求兩組 ANOVA 的組間均方
先以兩組樣本數加權,求全部資料的總平均數:
將各組平均數減去總平均數,可以把兩個組間離差都改寫成兩組平均數差的倍數:
兩組 ANOVA 的組間自由度是 2−1=1,所以組間均方 MSM 等於組間平方和 SSM。將上面的兩個離差代入:
第四步:將 MSM 與 MSE 相除
把剛才得到的 MSM 放入 F 的分子,再以 MSE=sₚ² 作為分母:
ANOVA 不只一種
本單元介紹的是單因子獨立樣本 ANOVA。若同一批受試者在多個時間點或條件下重複測量,應使用相依樣本或重複量數 ANOVA;若模型同時包含兩個因子,可使用二因子 ANOVA 並研究主效果與交互作用;若同時分析多個依變數,則可能使用多變量變異數分析(MANOVA)。這些方法都延伸自變異分解與模型比較的核心想法,但成立條件、平方和與解釋方式並不完全相同。