生物統計學習筆記從概念、推導到實務判讀

CHAPTER 02 · TOPIC 06

F 分配

F 分配(F-distribution)以 R. A. Fisher 的姓氏首字母命名。它描述兩個彼此獨立的卡方變數,各自除以自由度後再取比值所形成的分配,因此主要用來比較兩個獨立變異量的相對大小。

本頁內容
  1. F 分配如何形成?
  2. 為什麼 F 值不會小於 0?
  3. 兩個自由度如何影響形狀?
  4. F 分配的機率密度函數
  5. F 分配與 t 分配的關係
  6. 為什麼雙尾機率會合併?
  7. F 可以看成 t 的推廣嗎?
  8. F 分配常用在哪裡?

F 分配(F-distribution)以 R. A. Fisher 的姓氏首字母命名。它描述兩個彼此獨立的卡方變數,各自除以自由度後再取比值所形成的分配,因此主要用來比較兩個獨立變異量的相對大小。

F 分配如何形成?#

令 U 與 V 為兩個彼此獨立的卡方變數,其自由度分別為 ν₁ 與 ν₂。將 U 與 V 各自除以其自由度後相除,所得的 F 便服從分子自由度為 ν₁、分母自由度為 ν₂ 的 F 分配。

兩個獨立的卡方變數Uχν12,Vχν22,UVU\sim\chi^2_{\nu_1},\qquad V\sim\chi^2_{\nu_2},\qquad U\perp V
形成 F 分配F=U/ν1V/ν2Fν1,ν2F=\frac{U/\nu_1}{V/\nu_2}\sim F_{\nu_1,\nu_2}
符號代表意義
U、V兩個彼此獨立的卡方變數
ν₁分子自由度,屬於 U
ν₂分母自由度,屬於 V
U/ν₁、V/ν₂各卡方變數除以自由度後的平均變異量
Fν₁,ν₂具有分子、分母兩個自由度的 F 分配
表示兩個隨機變數彼此獨立

為什麼 F 值不會小於 0?#

U 與 V 都是平方和,因此不會是負數;它們除以正的自由度後再相除,F 也只能取正值。F=1 表示分子與分母的平均變異量相同;F>1 表示分子的平均變異量較大;F<1 則表示分母較大。

FFν1,ν21FFν2,ν1F\sim F_{\nu_1,\nu_2}\quad\Longrightarrow\quad \frac{1}{F}\sim F_{\nu_2,\nu_1}
符號在這組公式中的意義
~服從某個機率分配
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

兩個自由度如何影響形狀?#

F 分配通常右偏,右側具有長尾,其具體形狀同時由分子自由度 ν₁ 與分母自由度 ν₂ 決定。兩個自由度較低時,變異數估計較不穩定,分配較分散、右尾較厚;自由度增加後,比值通常更集中在 1 附近。

分子與分母自由度分別為 2 與 4、4 與 6、9 與 9、12 與 12 的 F 分配密度曲線
F 分配通常右偏;分子與分母自由度增加時,曲線逐漸更集中在 F=1 附近。圖例依序標示分子、分母自由度。來源:本站依 F 分配密度函數製作

F 分配的機率密度函數#

分子自由度為 ν₁、分母自由度為 ν₂ 的 F 分配具有以下機率密度函數。兩個自由度同時出現在係數、次方與分母中,因此任一自由度改變,都會改變曲線形狀。

f(x)=Γ ⁣((ν1+ν2)/2)Γ(ν1/2)Γ(ν2/2)(ν1ν2)ν1/2xν1/21(1+ν1ν2x)(ν1+ν2)/2,x>0f(x)=\frac{\Gamma\!\left((\nu_1+\nu_2)/2\right)}{\Gamma(\nu_1/2)\Gamma(\nu_2/2)}\left(\frac{\nu_1}{\nu_2}\right)^{\nu_1/2}x^{\nu_1/2-1}\left(1+\frac{\nu_1}{\nu_2}x\right)^{-(\nu_1+\nu_2)/2},\quad x>0
符號代表意義
f(x)F 分配在 x 位置的機率密度
xF 隨機變數的可能值,必須大於 0
ν₁、ν₂分子自由度與分母自由度
ΓGamma 函數;用於密度函數的正規化係數
補充:F 密度函數的推導

第一步:從兩個獨立卡方變數出發

令 U~χ²ν₁、V~χ²ν₂,且 U 與 V 獨立。定義 X=(U/ν₁)/(V/ν₂),並保留輔助變數 Y=V。

變數轉換X=U/ν1V/ν2,Y=VX=\frac{U/\nu_1}{V/\nu_2},\qquad Y=V
反向表示U=ν1ν2XY,V=YU=\frac{\nu_1}{\nu_2}XY,\qquad V=Y
Jacobian(u,v)(x,y)=ν1ν2y\left|\frac{\partial(u,v)}{\partial(x,y)}\right|=\frac{\nu_1}{\nu_2}y

因為 U 與 V 獨立,聯合密度等於兩個卡方密度的乘積。代入反向轉換並乘上 Jacobian 後,得到 X 與 Y 的聯合密度。

fX,Y(x,y)=fU ⁣(ν1ν2xy)fV(y)ν1ν2yf_{X,Y}(x,y)=f_U\!\left(\frac{\nu_1}{\nu_2}xy\right)f_V(y)\frac{\nu_1}{\nu_2}y

第二步:把輔助變數 Y 積分掉

對所有 y>0 積分,便可得到 X 的邊際密度。整理與 y 有關的部分後,積分再次呈現 Gamma 積分的形式。

fX(x)=0fX,Y(x,y)dyf_X(x)=\int_0^{\infty}f_{X,Y}(x,y)\,dy
0y(ν1+ν2)/21exp ⁣[y2(1+ν1ν2x)]dy\int_0^{\infty}y^{(\nu_1+\nu_2)/2-1}\exp\!\left[-\frac{y}{2}\left(1+\frac{\nu_1}{\nu_2}x\right)\right]dy

使用 Gamma 積分公式化簡並整理常數後,就得到正文中的 F 密度函數。因此,F 密度並不是額外假設出來的,而是由兩個獨立卡方密度、比值定義與變數轉換推導而來。

符號在推導中的意義
X推導中的 F 隨機變數
Y保留的輔助變數,等於 V
fX,YX 與 Y 的聯合密度
∂(u,v)/∂(x,y)變數轉換的 Jacobian 行列式

F 分配與 t 分配的關係#

若 T 服從自由度為 ν 的 t 分配,將 T 平方後便服從分子自由度為 1、分母自由度為 ν 的 F 分配。這是因為 T 的分子 Z 平方後服從自由度 1 的卡方分配,而分母原本就含有 U/ν。

從 t 的定義開始T=ZU/ν,Z2χ12T=\frac{Z}{\sqrt{U/\nu}},\qquad Z^2\sim\chi_1^2
平方後形成 F 分配T2=Z2/1U/νF1,νT^2=\frac{Z^2/1}{U/\nu}\sim F_{1,\nu}

為什麼雙尾機率會合併?#

t 分配以 0 為中心且左右對稱。若雙尾檢定的總顯著水準為 α,左右兩尾各占 α/2。平方後,T≤−|t| 與 T≥|t| 這兩個尾端都會映到 T²≥t²,因此原本兩側的機率會合併成 F 分配右側的一個尾端;這就是原文所說「兩邊重疊,所以機率差兩倍」的精確意義。

兩側事件平方後合併P(Tt)=P(Tt)+P(Tt)=P(T2t2)P(|T|\ge t)=P(T\le -t)+P(T\ge t)=P(T^2\ge t^2)
雙尾 t 與右尾 FP(Tνtν,1α/2)=α=P(F1,νtν,1α/22)P(|T_\nu|\ge t_{\nu,1-\alpha/2})=\alpha=P(F_{1,\nu}\ge t_{\nu,1-\alpha/2}^{\,2})
臨界值關係F1,ν;1α=tν;1α/22F_{1,\nu;1-\alpha}=t_{\nu;1-\alpha/2}^{\,2}
補充:由密度函數推導 T² 服從 F 分配

第一步:將 F 分配的分子自由度設為 1

從 F 分配的密度函數出發,令分子自由度 ν₁=1、分母自由度 ν₂=ν。先直接代入,再使用 Γ(1/2)=√π 與 (1/ν)^(1/2)=1/√ν 整理係數。

F 分配的一般密度fFν1,ν2(y)=Γ((ν1+ν2)/2)Γ(ν1/2)Γ(ν2/2)(ν1ν2)ν1/2yν1/21(1+ν1ν2y)(ν1+ν2)/2f_{F_{\nu_1,\nu_2}}(y)=\frac{\Gamma((\nu_1+\nu_2)/2)}{\Gamma(\nu_1/2)\Gamma(\nu_2/2)}\left(\frac{\nu_1}{\nu_2}\right)^{\nu_1/2}y^{\nu_1/2-1}\left(1+\frac{\nu_1}{\nu_2}y\right)^{-(\nu_1+\nu_2)/2}
代入 ν₁=1、ν₂=νfF1,ν(y)=Γ((ν+1)/2)Γ(1/2)Γ(ν/2)(1ν)1/2y1/2(1+yν)(ν+1)/2f_{F_{1,\nu}}(y)=\frac{\Gamma((\nu+1)/2)}{\Gamma(1/2)\Gamma(\nu/2)}\left(\frac{1}{\nu}\right)^{1/2}y^{-1/2}\left(1+\frac{y}{\nu}\right)^{-(\nu+1)/2}
使用 Γ(1/2)=√π 化簡fF1,ν(y)=Γ((ν+1)/2)πνΓ(ν/2)y1/2(1+yν)(ν+1)/2,y>0f_{F_{1,\nu}}(y)=\frac{\Gamma((\nu+1)/2)}{\sqrt{\pi\nu}\,\Gamma(\nu/2)}y^{-1/2}\left(1+\frac{y}{\nu}\right)^{-(\nu+1)/2},\quad y>0

第二步:和 t 分配的密度比較

自由度為 ν 的 t 分配密度如下。若把其中的 t² 換成 y,除了 y^(-1/2) 之外,其餘部分正好與 F(1,ν) 的密度相同。這個額外因子不是任意補上的常數,而是平方轉換改變橫軸尺度後產生的 Jacobian 修正。

fTν(t)=Γ ⁣((ν+1)/2)πνΓ(ν/2)(1+t2ν)(ν+1)/2f_{T_\nu}(t)=\frac{\Gamma\!\left((\nu+1)/2\right)}{\sqrt{\pi\nu}\,\Gamma(\nu/2)}\left(1+\frac{t^2}{\nu}\right)^{-(\nu+1)/2}

第三步:平方轉換會把兩個 t 值映到同一個 F 值

令 Y=T²。對每個 y>0,都有 t=√y 與 t=−√y 兩個來源;因此 Y 的密度必須同時收集 t 分配左右兩側的機率。反向轉換 t=±√y 的導數絕對值都是 1/(2√y)。

平方轉換與兩個反函數Y=T2,t1=y,t2=yY=T^2,\qquad t_1=\sqrt{y},\quad t_2=-\sqrt{y}
橫軸尺度的修正dt1dy=dt2dy=12y\left|\frac{dt_1}{dy}\right|=\left|\frac{dt_2}{dy}\right|=\frac{1}{2\sqrt{y}}
平方後的密度fY(y)=fT(y)+fT(y)2yf_Y(y)=\frac{f_T(\sqrt{y})+f_T(-\sqrt{y})}{2\sqrt{y}}

因為 t 分配左右對稱,f_T(−√y)=f_T(√y),兩側相加產生的 2,會和導數中的 2 抵消,最後留下 1/√y=y^(-1/2)。

利用 t 分配的對稱性fY(y)=2fT(y)2y=fT(y)y1/2f_Y(y)=\frac{2f_T(\sqrt{y})}{2\sqrt{y}}=f_T(\sqrt{y})y^{-1/2}
代入 t 密度後fY(y)=Γ ⁣((ν+1)/2)πνΓ(ν/2)y1/2(1+yν)(ν+1)/2=fF1,ν(y)f_Y(y)=\frac{\Gamma\!\left((\nu+1)/2\right)}{\sqrt{\pi\nu}\,\Gamma(\nu/2)}y^{-1/2}\left(1+\frac{y}{\nu}\right)^{-(\nu+1)/2}=f_{F_{1,\nu}}(y)
推導結果TtνT2F1,νT\sim t_\nu\quad\Longrightarrow\quad T^2\sim F_{1,\nu}
符號在推導中的意義
T自由度為 ν 的 t 隨機變數
Y=T²平方轉換後的非負隨機變數
fTt 分配的機率密度函數
fY平方後 Y 的機率密度函數
1/(2√y)由 t=±√y 對 y 微分得到的 Jacobian 修正
F(1,ν)分子自由度 1、分母自由度 ν 的 F 分配

F 可以看成 t 的推廣嗎?#

在分子自由度為 1 時,F 統計量確實就是某個 t 統計量的平方,因此 F 檢定可視為把這個雙尾 t 檢定改寫成只看正值的右尾檢定。更一般的 F 分配允許分子自由度大於 1,可以同時檢定多個效果;從這個角度,可把 F 檢定看成平方 t 檢定往多個自由度的推廣,但不能說所有 F 分配都等同於某個 t 分配。

比較方式回答的問題保留的資訊
整體 F 檢定多組平均數是否至少有一組不同?判斷整體差異,但不直接指出哪幾組不同
兩組 t 檢定指定的兩組平均數是否不同?可保留差異方向並提供該組對的細部資訊
事後成對比較整體 F 顯著後,差異出現在哪些組別?進一步比較多個組對,但需要校正多重比較造成的第一類錯誤膨脹

因此,多組資料可以先用 F 檢定回答「整體是否存在差異」,再用成對 t 型比較或其他事後比較找出「哪些組不同」。你原文所說反覆挑兩組比較可以取得更詳細資訊,核心是對的;需要補上的條件是不能直接做許多未校正的 t 檢定,通常要使用 Tukey、Bonferroni、Holm 等多重比較方法控制整體錯誤率。

F 分配常用在哪裡?#

  • 比較兩個母體變異數
  • ANOVA 中比較組間變異與組內變異
  • 檢定迴歸模型整體是否具有解釋力
  • 比較巢狀模型增加參數後是否顯著改善配適
  • 建立部分變異數相關的信賴區間或檢定