CHAPTER 08 · TOPIC 01
Wilcoxon 檢定
當資料不適合直接用平均數與常態模型描述時,可以改從符號、次序或等級建立檢定。這類方法通常稱為無母數方法。它們不需要指定完整的母體分配形式,但仍然需要獨立性、成對結構或分配形狀等相應條件,並不是完全沒有假設。
本頁內容
- Sign test:先把數值轉成正號與負號
- Sign test 如何計算 p 值?
- Rank-sum test:兩組獨立樣本一起排序
- 用五個等級建立 rank-sum 的精確分配
- Rank-sum 的平均數、變異數與常態近似
- Signed-rank test:方向之外也考慮距離
- 用三個成對差值建立 signed-rank 分配
- Signed-rank 的平均數、變異數與常態近似
- 三種方法如何選擇?
當資料不適合直接用平均數與常態模型描述時,可以改從符號、次序或等級建立檢定。這類方法通常稱為無母數方法。它們不需要指定完整的母體分配形式,但仍然需要獨立性、成對結構或分配形狀等相應條件,並不是完全沒有假設。
| 研究設計 | 只使用方向 | 方向與距離等級都使用 | 對應的 t 檢定 |
| 單一樣本或成對樣本 | Sign test | Wilcoxon signed-rank test | One-sample 或 paired t-test |
| 兩組獨立樣本 | Wilcoxon rank-sum test / Mann–Whitney U test | Independent-samples t-test |
Sign test:先把數值轉成正號與負號
Sign test 可用於單一樣本,也可用於成對樣本。單一樣本時,把每個 Xᵢ 與虛無假設指定的中位數 M₀ 比較;成對樣本時,先把同一對的兩次測量相減,再把差值與 0 比較。
例如,可用單一樣本 Sign test 檢查 1~7 分的住院滿意度中位數是否為 4;也可將同一名病人的飯前與飯後血糖相減,用成對 Sign test 檢查正差與負差是否同樣可能。
等於 0 的差值不提供正負方向,所以先移除,再把剩下的有效個數記為 n。令 C 為正差值的個數。若虛無假設成立,正、負方向應各有一半機率,因此 C 服從成功機率 1/2 的二項分配。
Sign test 如何計算 p 值?
依本單元採用的傳統計算界線,有效樣本數 n<20 時,直接使用 Binomial(n,1/2) 計算精確 p 值。若 n=10、觀察到 C=8,雙尾 p 值把與 8 同樣或更偏離 n/2=5 的兩側結果都算入:
| 符號 | 在這組公式中的意義 |
| N | 合併後的總樣本數,或符號秩檢定中的非零差值數;依該段定義 |
| n、m | 兩組的樣本數,且 N=n+m |
| W、Wₛ | 指定組別的秩和統計量 |
| T | Wilcoxon 符號秩檢定的秩和統計量 |
| Xᵢ、Yⱼ | 排序後的秩或不同觀察值的秩 |
| Σ | 求和符號;將指定範圍內的各項全部加總 |
| C(N,n) 或二項係數 | 組合數;表示不考慮順序時,從指定總數中選取若干個的方式數 |
n 較大時,可利用二項分配的平均數 n/2 與標準差 √(n/4) 作常態近似。因為 C 是離散值而常態分配是連續的,實際計算通常加入 0.5 的連續性校正。
單尾問題必須在看資料前依研究方向寫成 p>1/2 或 p<1/2,並只計算相應尾端的機率;不是得到結果後才選擇尾端。
Rank-sum test:兩組獨立樣本一起排序
Wilcoxon rank-sum test 與 Mann–Whitney U test 是同一個兩獨立樣本檢定的兩種等價統計量。它把兩組共 N 筆資料合併排序,再觀察其中一組取得的等級和是否異常偏大或偏小。
- 合併兩組共 N=n+m 筆觀察值,由小到大給予等級 1~N。
- 數值相同時,把它們應占名次的平均值分給每一筆。
- 選定其中 n 筆的處理組,把其等級相加得到 Wₛ。
- 在 H₀ 下,比較目前 Wₛ 與所有可能分組形成的虛無分配。
| 符號 | 在這組公式中的意義 |
| N | 合併後的總樣本數,或符號秩檢定中的非零差值數;依該段定義 |
| n、m | 兩組的樣本數,且 N=n+m |
| W、Wₛ | 指定組別的秩和統計量 |
| T | Wilcoxon 符號秩檢定的秩和統計量 |
| Xᵢ、Yⱼ | 排序後的秩或不同觀察值的秩 |
| Σ | 求和符號;將指定範圍內的各項全部加總 |
若 H₀ 表示兩組來自相同分配,組別標籤便可互換;從 N 個等級任取 n 個放入處理組的 C(N,n) 種方式,在 H₀ 下具有相同機率。這就是精確虛無分配的來源。
用五個等級建立 rank-sum 的精確分配
假設 5 位受試者依症狀由嚴重到輕微排成 1~5 級,其中 3 人接受藥物、2 人接受安慰劑。H₀ 表示治療組與對照組的結果分配相同,因此任選 3 個等級作為治療組共有 C(5,3)=10 種等機率配置。
| Treatment ranks | Control ranks | Wₛ |
| 1,2,3 | 4,5 | 6 |
| 1,2,4 | 3,5 | 7 |
| 1,2,5 | 3,4 | 8 |
| 1,3,4 | 2,5 | 8 |
| 1,3,5 | 2,4 | 9 |
| 2,3,4 | 1,5 | 9 |
| 1,4,5 | 2,3 | 10 |
| 2,3,5 | 1,4 | 10 |
| 2,4,5 | 1,3 | 11 |
| 3,4,5 | 1,2 | 12 |
| w | 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| P(Wₛ=w) | 0.1 | 0.1 | 0.2 | 0.2 | 0.2 | 0.1 | 0.1 |
| 符號 | 在這組公式中的意義 |
| N | 合併後的總樣本數,或符號秩檢定中的非零差值數;依該段定義 |
| n、m | 兩組的樣本數,且 N=n+m |
| W、Wₛ | 指定組別的秩和統計量 |
| T | Wilcoxon 符號秩檢定的秩和統計量 |
| Xᵢ、Yⱼ | 排序後的秩或不同觀察值的秩 |
| C(N,n) 或二項係數 | 組合數;表示不考慮順序時,從指定總數中選取若干個的方式數 |
其中 #(w;n,m) 是 n 筆處理組、m 筆對照組時,處理組等級和等於 w 的配置數。傳統 rank-sum 表格常只列到 n≤10、m≤10;超出表格範圍時,早期計算會改用常態近似。現代統計軟體可在更廣的樣本範圍直接計算精確或排列 p 值,因此應依軟體方法、樣本大小與 ties 情況決定,而不是把 10 當成統計理論的硬門檻。
Rank-sum 的平均數、變異數與常態近似
有 ties 時,等級使用平均名次,常態近似的變異數也要加入 ties 修正。連續性校正的方向依所計算的尾端決定;不能固定對所有 Z 都減 1/2。
補充:推導 rank-sum 等級和的平均數與變異數
令全部 N 個等級為 X₁,X₂,…,X_N,處理組從中任取 n 個,對照組大小 m=N−n。H₀ 下所有 C(N,n) 個配置等機率,因此平均數與變異數都必須從這些可能配置出發。以下先假設沒有 ties。
平均數:平均所有 C(N,n) 種配置
先把每一種處理組配置內的 n 個等級相加,再對全部配置取平均。固定任一等級 Xᵢ 後,其他 n−1 個位置可從剩餘 N−1 個等級選取,所以 Xᵢ 會出現在 C(N−1,n−1) 個配置中。
變異數:展開每一個配置的等級和平方
變異數先由 E(Wₛ²)−[E(Wₛ)]² 出發。展開一個配置的 (ΣXᵢ)²,會得到單一等級的平方 Xᵢ²,以及兩個不同等級的交叉項 2XᵢXⱼ。單一 Xᵢ 出現在 C(N−1,n−1) 個配置;指定的 Xᵢ、Xⱼ 同時出現時,剩下 n−2 個位置可從 N−2 個等級選,因此出現在 C(N−2,n−2) 個配置。
Signed-rank test:方向之外也考慮距離
Wilcoxon signed-rank test 用於單一樣本或成對樣本。Sign test 只記錄差值的正負;signed-rank test 進一步把 |Dᵢ| 排序,所以較大的差值會得到較大的等級。當差值分布合理地近似對稱時,這些大小資訊通常能提供比 Sign test 更多的檢定力。
- 計算每一筆相對 M₀ 的差值,或每一對測量的差值 Dᵢ。
- 移除 Dᵢ=0 的資料,將剩餘有效樣本數記為 n。
- 對 |Dᵢ| 由小到大排序;相同絕對差使用平均等級。
- 把原本的正負號放回等級,分別加總得到正等級和 T⁺ 與負等級和 T⁻。
- 雙尾精確檢定可使用較小的 T=min(T⁺,T⁻),或等價地以 T⁺ 的兩尾虛無分配求 p 值。
用三個成對差值建立 signed-rank 分配
比較新、舊肥料時,把 3 個草莓園各分成兩半,分別使用新肥料與舊肥料。這是成對設計,因為同一個果園內的兩個收穫量共享相近環境。
| 果園 | 1 | 2 | 3 |
| 新肥料收穫 | 76 | 82 | 80 |
| 舊肥料收穫 | 78 | 91 | 86 |
| D=新−舊 | −2 | −9 | −6 |
| |D| 的等級 | 1 | 3 | 2 |
H₀ 下,差值分布以 0 為中心且對稱,因此每個絕對差的等級配置正號或負號的機率各為 1/2。三個等級共有 2³=8 種等機率的正負配置。令 Vₛ=T⁺,只把帶正號的等級相加:
| 符號配置 | (−1,−2,−3) | (+1,−2,−3) | (−1,+2,−3) | (−1,−2,+3) | (+1,+2,−3) | (+1,−2,+3) | (−1,+2,+3) | (+1,+2,+3) |
| Vₛ=T⁺ | 0 | 1 | 2 | 3 | 3 | 4 | 5 | 6 |
| v | 0 | 1 | 2 | 3 | 4 | 5 | 6 |
| P(Vₛ=v) | 0.125 | 0.125 | 0.125 | 0.250 | 0.125 | 0.125 | 0.125 |
實際資料三個差值皆為負,因此 T⁺=0、T⁻=6。精確雙尾 p 值為 2P(T⁺≤0)=2×1/8=0.25;這 3 對資料不足以拒絕新、舊肥料效果相同的虛無假設。
Signed-rank 的平均數、變異數與常態近似
H₀ 下,每個等級以 1/2 機率進入 T⁺,所以期望正等級和是全部等級總和的一半。無 ties 時,各等級是否帶正號可視為彼此獨立的 Bernoulli(1/2) 指標。
傳統教材常以有效樣本數 n≥20 作為 signed-rank 常態近似的經驗界線,n<20 時則查精確分配表;這是計算上的近似規則,不是定理中的固定分界。現代統計軟體應優先依實際演算法選擇精確法或近似法。使用常態近似時,可依尾端方向加入 0.5 連續性校正;若有相同的 |Dᵢ|,還必須使用 ties 修正後的變異數。
補充:推導 signed-rank 正等級和的平均數與變異數
以下的 n 是移除零差值後的有效樣本數。令 Iᵣ 表示第 r 個等級是否帶正號:帶正號時 Iᵣ=1,帶負號時 Iᵣ=0。在 H₀ 下,每個差值取正、負號的機率各為 1/2;沒有 ties 時,正等級和可寫成 T⁺=ΣrIᵣ。
先由指標變數得到平均數與變異數
最後一行能直接相加各項變異數,是因為 H₀ 下各個非零差值的正負號彼此獨立,所以 Cov(Iᵣ,Iₛ)=0。若研究設計本身使各對差值不獨立,這個虛無分配就不能直接使用。
再從 2ⁿ 種正負配置完整展開
也可以完全依照精確分配的建立方式推導。令 X₁,X₂,…,Xₙ 為等級 1,2,…,n。每個等級可取正號或負號,因此共有 2ⁿ 種等機率配置;T⁺ 只加總配置中帶正號的等級。固定一個 Xᵢ,它在一半、也就是 2ⁿ⁻¹ 種配置中為正;固定兩個不同等級 Xᵢ、Xⱼ,它們同時為正的配置共有 2ⁿ⁻² 種。
由全部配置的二次動差推導變異數
若改用帶正負號的等級總和
另一種記法不是只加正等級,而是直接把正、負等級相加,令 W=T⁺−T⁻。每個等級 r 以相同機率取 +r 或 −r,因此平均數為 0,單一項的變異數為 r²。
兩種統計量包含相同資訊,因為 W=2T⁺−n(n+1)/2。閱讀軟體輸出或查表時,必須先確認使用的是 T⁺、較小等級和 T,還是帶符號總和 W。
三種方法如何選擇?
| 方法 | 樣本關係 | 使用的資訊 | 主要虛無假設 |
| Sign test | 單一或成對 | 差值正負 | 正差與負差機率各為 1/2 |
| Wilcoxon signed-rank | 單一或成對 | 差值方向+|差值|等級 | 差值分布以 0 為中心且對稱 |
| Wilcoxon rank-sum / Mann–Whitney U | 兩組獨立 | 合併後的資料等級 | 兩組分配相同 |
- 先判斷資料是單一樣本、成對樣本,還是兩組獨立樣本。
- 明確寫出虛無假設是在談正負機率、對稱差值中心,還是兩組完整分配。
- 處理零差值與 ties,並在報告中說明有效樣本數及所用修正。
- 小樣本優先使用精確或排列方法;使用常態近似時說明連續性校正。
- 同時報告統計量、p 值、效果方向與適合的效果量,不只寫顯著或不顯著。