CHAPTER 02 · TOPIC 04
卡方分配
卡方分配(chi-square distribution,記為 χ² 分配)描述多個彼此獨立的標準常態變數平方後相加所形成的隨機變數。它把各方向的標準化離差轉成非負的總變異,因此與變異數估計、卡方檢定及後面的 F 分配密切相關。
卡方分配(chi-square distribution,記為 χ² 分配)描述多個彼此獨立的標準常態變數平方後相加所形成的隨機變數。它把各方向的標準化離差轉成非負的總變異,因此與變異數估計、卡方檢定及後面的 F 分配密切相關。
卡方分配如何形成?#
若 Z₁、Z₂、…、Zν 是 ν 個彼此獨立的標準常態變數,將它們分別平方後相加,所得的 U 便服從自由度為 ν 的卡方分配。每加入一個獨立的標準常態平方,就增加一個自由度。
| 符號 | 代表意義 |
| Zᵢ | 第 i 個標準常態變數 |
| U | 所有標準常態變數平方後的總和 |
| ν | 自由度;獨立平方項的數量 |
| χ²ν | 自由度為 ν 的卡方分配 |
為什麼卡方值不會小於 0?#
每個 Zᵢ 經過平方後都不可能是負數,因此平方和 U 也只能落在 0 以上。當自由度為 1 時,卡方變數就是一個標準常態變數的平方。可以直覺想成常態曲線左右兩側的值經平方後都映到正數範圍,但經過變數轉換後,密度形狀也會改變。
從標準常態曲線理解自由度 1 的形狀#
當自由度 ν=1 時,卡方變數就是 U=Z²,其中 Z 服從標準常態分配。標準常態曲線左側的負值與右側的正值,平方後都會映到 0 以上;例如 Z=−2 與 Z=2 都會得到 U=4。因此,可以直覺想成常態曲線左右兩側的機率被帶到正半軸並合在一起。
不過,平方不只改變正負號,也會改變數值之間的距離,所以密度不能只把兩側高度直接相加。進行變數轉換時還要加入修正因子;這正是原本筆記所說的「會有修正項」。
| 符號 | 代表意義 |
| φ(z) | 標準常態分配在 z 位置的機率密度 |
| √u、−√u | 平方後得到 u 的兩個原始 Z 值 |
| 1/(2√u) | 平方轉換造成的密度修正因子 |
自由度如何改變分配形狀?#
自由度較低時,卡方分配通常明顯右偏,許多數值集中在 0 附近,右側具有長尾。自由度增加時,獨立平方項愈多,分配中心向右移動、相對偏斜程度下降,外形會逐漸接近鐘形,但其取值仍然不會小於 0。
為什麼自由度增加後會逐漸呈鐘形?#
自由度為 ν 的卡方變數,是 ν 個彼此獨立的 Zᵢ² 相加。每一個 Zᵢ² 都可看成自由度為 1 的卡方變數,因此增加自由度,就相當於把更多個具有相同分配的獨立平方項累積起來。這和中央極限定理研究「許多獨立隨機變數的和」是同一條思路。
更精確地說,每個 Zᵢ² 的平均數為 1、變異數為 2,所以總和 U 的平均數為 ν、變異數為 2ν。當 ν 增加時,將 U 減去其平均數 ν,再除以標準差 √(2ν),所得分配會逐漸接近標準常態分配。因此,未標準化的卡方曲線會一面向右移動、一面變寬,同時相對偏斜程度下降,看起來愈來愈接近鐘形。
| 符號 | 在這組公式中的意義 |
| √ | 平方根;常用來把變異數轉成標準差 |
| n | 本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準 |
| 性質 | 自由度為 ν 的 χ² 分配 |
| 可能值 | 0 到正無限大 |
| 平均數 | ν |
| 變異數 | 2ν |
| 形狀 | 低自由度時右偏;自由度增加後相對較對稱 |
卡方分配與樣本變異數#
若從常態母體抽取 n 個彼此獨立的觀察值,樣本變異數 S² 與母體變異數 σ² 的比值經過調整後,會服從自由度為 n−1 的卡方分配。這是利用樣本變異數推論母體變異數的重要基礎。
| 符號 | 代表意義 |
| Xᵢ | 第 i 筆觀察值 |
| μ、σ² | 常態母體的平均數與變異數 |
| X̄、S² | 樣本平均數與樣本變異數 |
| n | 樣本數 |
| n−1 | 使用樣本平均數後剩餘的自由度 |
卡方分配的機率密度函數#
自由度為 ν 的卡方分配,其機率密度函數如下。公式決定不同自由度下曲線的高度與形狀,曲線下的總面積仍然等於 1。
| 符號 | 代表意義 |
| f(u) | 卡方分配在 u 位置的機率密度 |
| u | 卡方變數的可能值,必須大於 0 |
| ν | 卡方分配的自由度 |
| Γ | Gamma 函數,用來使密度曲線下的總面積等於 1 |
| e | 自然常數,約為 2.71828 |
補充:卡方密度函數的推導
第一步:先推導自由度 1
令 Z 服從標準常態分配,並定義 U=Z²。對任意 u>0,方程式 z²=u 有兩個解:z=√u 與 z=−√u。因為這兩個 Z 值都會映到同一個 U 值,密度轉換時必須把兩條來源相加。
其中 |dz/du| 是變數轉換的 Jacobian 修正。它反映平方會拉伸或壓縮數值間距,因此不能只把常態曲線左右兩側的高度直接相加。這個結果就是自由度為 1 的卡方密度。
依原文方式:把卡方自由度代 1 與標準常態比較
也可以從兩個已知密度反向核對。先將一般常態分配標準化為 μ=0、σ=1,再把卡方密度的自由度 ν 設為 1。
令 u=x² 後,卡方密度中的指數部分 e^(−u/2) 就對應標準常態密度中的 e^(−x²/2);多出的 u^(−1/2) 正是平方轉換留下的尺度修正。這就是原文所說「把 χ² 換成 x² 後,還差一個修正項」的完整對照。
第二步:推廣到 ν 個獨立平方項
令 U=Z₁²+⋯+Zν²。直接反覆計算密度的摺積會很繁瑣,因此可以使用動差生成函數(moment-generating function, MGF):獨立隨機變數相加時,總和的 MGF 等於各自 MGF 的乘積。
最後一個 MGF 正好對應形狀參數為 ν/2、尺度參數為 2 的 Gamma 分配,因此得到自由度為 ν 的卡方密度函數。
| 符號 | 在推導中的意義 |
| φ(z) | 標準常態密度函數 |
| |dz/du| | 變數轉換時修正密度的 Jacobian 絕對值 |
| Mᵤ(s) | U 的動差生成函數 |
| E | 期望值運算 |
| Π | 將各獨立平方項的 MGF 相乘 |
| Γ | Gamma 函數 |