生物統計學習筆記從概念、推導到實務判讀

CHAPTER 07 · TOPIC 03

Fisher Z 轉換與相關係數比較

Fisher Z 轉換(Fisher's Z transformation)把介於 −1 與 1 之間的樣本相關係數 r,轉換到沒有上下界的 z 尺度。轉換後的抽樣分布較接近常態,因此可用來檢定母體相關係數 ρ、建立信賴區間,以及比較兩個獨

本頁內容
  1. Fisher Z 轉換公式
  2. 檢定母體相關係數是否等於指定值
  3. 母體相關係數的信賴區間
  4. 比較兩個獨立群體的相關係數
  5. 兩組差異的信賴區間
  6. 哪些情況不能套用這個兩組公式?
  7. 建議如何報告?

Fisher Z 轉換(Fisher's Z transformation)把介於 −1 與 1 之間的樣本相關係數 r,轉換到沒有上下界的 z 尺度。轉換後的抽樣分布較接近常態,因此可用來檢定母體相關係數 ρ、建立信賴區間,以及比較兩個獨立群體的相關係數。

Fisher Z 轉換公式

樣本相關係數的轉換zr=z(r)=12ln(1+r1r)=arctanh(r)z_r=z(r)=\frac12\ln\left(\frac{1+r}{1-r}\right)=\operatorname{arctanh}(r)
母體相關係數的轉換zρ=z(ρ)=12ln(1+ρ1ρ)z_\rho=z(\rho)=\frac12\ln\left(\frac{1+\rho}{1-\rho}\right)
反轉換r=tanh(zr)=e2zr1e2zr+1r=\tanh(z_r)=\frac{e^{2z_r}-1}{e^{2z_r}+1}

當資料可合理視為來自二變量常態母體,且樣本數足夠時,Fisher 轉換後的統計量近似服從常態分布:

z(r)N(z(ρ),1n3),SE[z(r)]1n3z(r)\approx N\left(z(\rho),\frac{1}{n-3}\right),\qquad SE[z(r)]\approx\frac{1}{\sqrt{n-3}}
符號在這組公式中的意義
平方根;常用來把變異數轉成標準差
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

檢定母體相關係數是否等於指定值

若研究問題不是只檢定 ρ=0,而是要檢定母體相關是否等於某個指定值 ρ₀,可以先把樣本 r 與假設值 ρ₀ 都轉到 Fisher z 尺度。

雙尾假設H0:ρ=ρ0,H1:ρρ0H_0:\rho=\rho_0,\qquad H_1:\rho\ne\rho_0
Z 統計量Z=z(r)z(ρ0)1/n3Z=\frac{z(r)-z(\rho_0)}{1/\sqrt{n-3}}

由標準常態分布計算單尾或雙尾 p 值。若 ρ₀=0,則 z(ρ₀)=0;在二變量常態假設下,前一頁的 t 檢定是檢定零相關的傳統精確方法,Fisher Z 則是常態近似,兩者在大樣本時通常非常接近。

母體相關係數的信賴區間

原文先在 Fisher z 尺度建立 95% 信賴區間。一般的 100(1−α)% 區間為:

z 尺度下限Lz=z(r)z1α/21n3L_z=z(r)-z_{1-\alpha/2}\frac{1}{\sqrt{n-3}}
z 尺度上限Uz=z(r)+z1α/21n3U_z=z(r)+z_{1-\alpha/2}\frac{1}{\sqrt{n-3}}
95% 信賴區間z(r)±1.961n3z(r)\pm1.96\frac{1}{\sqrt{n-3}}

z 尺度的上下限不能直接當作相關係數報告,還要分別反轉換回 ρ 尺度:

CIρ=[tanh(Lz),tanh(Uz)]CI_\rho=\left[\tanh(L_z),\tanh(U_z)\right]
符號在這組公式中的意義
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

比較兩個獨立群體的相關係數

假設想比較男性與女性的身高、體重相關是否相同。性別把樣本分成兩個互不重疊的群體;問題不是各組內相關是否分別顯著,而是兩個母體相關係數本身是否不同。這可視為性別是否改變身高與體重關係的 effect modification 或 moderation 問題。

虛無與對立假設H0:ρ1=ρ2,H1:ρ1ρ2H_0:\rho_1=\rho_2,\qquad H_1:\rho_1\ne\rho_2
分別轉換兩組樣本相關z1=z(r1),z2=z(r2)z_1=z(r_1),\qquad z_2=z(r_2)

兩組彼此獨立時,z₁−z₂ 的變異數等於兩組變異數相加,和兩獨立樣本平均數差的概念相同:

差值的標準誤SE(z1z2)=1n13+1n23SE(z_1-z_2)=\sqrt{\frac{1}{n_1-3}+\frac{1}{n_2-3}}
比較兩個獨立相關的 Z 統計量Z=z(r1)z(r2)1n13+1n23Z=\frac{z(r_1)-z(r_2)}{\sqrt{\frac{1}{n_1-3}+\frac{1}{n_2-3}}}

原文分母中的 n₁−3 與 n₂−3 因轉檔而出現下標括號錯置;正確形式是分別以每組樣本數減 3。由標準常態分布取得 p 值後,即可判斷兩個母體相關是否有證據不同。

兩組差異的信賴區間

在 Fisher z 尺度上,兩組轉換後相關之差的信賴區間可以直接寫成:

(z1z2)±z1α/21n13+1n23(z_1-z_2)\pm z_{1-\alpha/2}\sqrt{\frac{1}{n_1-3}+\frac{1}{n_2-3}}
符號在這組公式中的意義
平方根;常用來把變異數轉成標準差
z標準化後的 z 統計量;下標通常表示指定尾端機率的臨界值
α顯著水準或信賴區間兩端所使用的尾端機率
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

這是 z(ρ₁)−z(ρ₂) 的區間,不是原始相關差 ρ₁−ρ₂ 的區間。因 tanh 是非線性函數,不能把差值區間的兩端直接各自做一次 tanh 就當成 ρ₁−ρ₂。若研究重點是原始相關差,可使用適當的大樣本方法或 bootstrap 建立區間。

哪些情況不能套用這個兩組公式?

  • 兩個相關係數來自同一批受試者,例如比較 corr(X,Y) 與 corr(X,Z)。
  • 兩組有重疊觀察值或配對關係。
  • 比較的是部分相關、等級相關或經複雜模型調整後的相關。
  • 群體內存在群聚、重複測量或其他破壞獨立性的資料結構。

上述情況中兩個相關估計值具有共變異數,不能只把 1/(n₁−3) 與 1/(n₂−3) 相加。應使用能處理相依相關係數的方法、迴歸交互作用模型、重抽樣方法或符合資料結構的模型。

建議如何報告?

  1. 單一群體:報告 r、n、ρ 的信賴區間與 p 值,並附散布圖。
  2. 兩獨立群體:分別報告 r₁、n₁、r₂、n₂,再報告 Fisher Z 比較統計量與 p 值。
  3. 清楚說明群體是否互相獨立,以及比較是事先規劃還是資料探索。
  4. 若解釋 effect modification,描述哪一組的線性關係較強及方向,不只寫有交互作用。