生物統計學習筆記從概念、推導到實務判讀

CHAPTER 03 · TOPIC 01

抽樣與抽樣分配

抽樣(sampling)是從母體中選取一部分觀察單位形成樣本,再利用樣本提供的資訊推論母體。它是推論統計的重要起點:我們實際觀察的是樣本,真正想了解的通常是尚未完整觀察的母體。

本頁內容
  1. 母體、樣本、參數與統計量
  2. 為什麼需要抽樣?
  3. 抽樣誤差與抽樣偏差不同
  4. 常見的機率抽樣方法
  5. 1. 簡單隨機抽樣
  6. 2. 系統抽樣
  7. 3. 分層抽樣
  8. 4. 群集抽樣
  9. 中央極限定理
  10. 從一次樣本走向所有可能樣本
  11. 什麼是抽樣分配?
  12. 樣本平均數的抽樣分配
  13. 樣本變異數為什麼使用 n−1?
  14. 樣本數如何影響標準誤?

抽樣(sampling)是從母體中選取一部分觀察單位形成樣本,再利用樣本提供的資訊推論母體。它是推論統計的重要起點:我們實際觀察的是樣本,真正想了解的通常是尚未完整觀察的母體。

母體、樣本、參數與統計量#

母體(population)是研究問題所關心的全部對象;樣本(sample)是實際被選取並觀察的一部分。描述母體的數值稱為參數,根據樣本計算的數值稱為統計量。統計推論就是利用統計量估計或檢驗未知的母體參數。

層級對象常見數值性質
母體研究問題所關心的全部單位平均數 μ、變異數 σ²、比例 p通常未知,是推論的目標
樣本從母體中實際選取的 n 個單位平均數 X̄、變異數 s²、比例 p̂可由觀察資料計算,用來推論母體
母體大小與樣本大小N=population size,n=sample sizeN=\text{population size},\qquad n=\text{sample size}
樣本平均數Xˉ=1ni=1nXi\bar X=\frac{1}{n}\sum_{i=1}^{n}X_i
符號代表意義
N母體中的單位總數
n樣本中的單位數
Xᵢ樣本中的第 i 個觀察值
μ、σ²母體平均數與母體變異數
X̄、s²樣本平均數與樣本變異數
p、p̂母體比例與樣本比例

為什麼需要抽樣?#

  • 母體可能過大或無法完整列舉,全面調查在實務上不可行
  • 抽樣通常能降低時間、人力與成本
  • 有些測量具有破壞性,不可能測量母體中的每一個單位
  • 較小的研究有時能投入更多訓練、測量與品質控制
  • 使用機率抽樣時,可以用統計方法評估抽樣造成的不確定性

抽樣誤差與抽樣偏差不同#

同一母體反覆抽樣時,不同樣本通常會得到不同統計量,這種隨機波動稱為抽樣誤差(sampling error)。若某些個體較容易或較不容易被選入,使樣本系統性偏離目標母體,則屬於抽樣偏差(sampling bias)。

問題形成原因增加樣本數能否改善?
抽樣誤差隨機抽取不同個體造成的自然波動通常可以降低
抽樣偏差抽樣框、納入方式或未回覆造成系統性失真不能只靠增加樣本數消除

常見的機率抽樣方法#

1. 簡單隨機抽樣#

簡單隨機抽樣(simple random sampling)是從抽樣框中隨機選取個體,使每一個大小為 n 的可能樣本具有相同被選中的機會。概念最直接,但前提是能取得完整抽樣框,實務上不一定容易。

2. 系統抽樣#

系統抽樣(systematic sampling)先將抽樣框依固定順序排列,在前 k 個單位中隨機選擇起點,之後每隔 k 個單位抽取一人。它容易執行,但如果名單中存在和抽樣間隔相同的週期結構,可能造成偏差。

kNnk\approx\frac{N}{n}
符號在這組公式中的意義
N母體中的觀察單位總數
n由母體抽出的樣本數
xᵢ母體或樣本中的第 i 個觀察值
i、j不同觀察值的索引編號
sd標準差;依公式所在位置可能指資料標準差或抽樣平均數的標準誤

3. 分層抽樣#

分層抽樣(stratified sampling)先依重要特徵將母體分成彼此不重疊的層,再從每一層分別進行隨機抽樣。它能確保重要子群體都被納入,也可以依各層大小採比例分配,或刻意增加小族群樣本後再使用權重分析。

4. 群集抽樣#

群集抽樣(cluster sampling)先把母體分成自然形成的群集,例如醫院、學校或社區,再隨機抽取其中一些群集。單階段群集抽樣會調查被抽中群集內的全部個體;若再從群集內抽取部分個體,則屬於兩階段或多階段抽樣。

方法先做什麼?從哪裡抽?主要優點主要風險
簡單隨機建立完整抽樣框整個母體名單概念與分析直接完整名單可能難以取得
系統抽樣隨機起點並決定間隔 k每隔 k 個單位執行方便名單週期可能造成偏差
分層抽樣依重要特徵分層每一層都抽確保子群體代表性不等比例抽樣時需權重
群集抽樣建立自然群集只抽部分群集降低地理與執行成本群集內相似會降低有效資訊量

中央極限定理#

中央極限定理(central limit theorem, CLT)說明:若觀察值彼此獨立、來自相同分布,且母體具有有限平均數 μ 與有限變異數 σ²,當 n 增加時,樣本平均數經過標準化後,其分布會逐漸接近標準常態分配。

樣本平均數的近似分配XˉN ⁣(μ,σ2n)\bar X\approx N\!\left(\mu,\frac{\sigma^2}{n}\right)
標準化形式Xˉμσ/ndN(0,1)(n)\frac{\bar X-\mu}{\sigma/\sqrt n}\xrightarrow{d}N(0,1)\qquad(n\to\infty)

若母體本身服從常態分配,無論 n 大小,樣本平均數都精確服從常態分配;若母體不是常態,則需要 n 足夠大才有良好近似。常見的 n≥30 只是經驗法則,不是普遍保證:母體越偏斜、尾端越厚或離群值越多,通常需要更大的樣本。

從一次樣本走向所有可能樣本#

假設有限母體中共有 N 個單位,每次以簡單隨機方式、不放回地抽取 n 個單位,而且不考慮抽取順序,所有可能樣本數為 C(N,n)。每一個可能樣本都能算出一個樣本平均數。

所有可能樣本數m=(Nn)m=\binom{N}{n}
第 j 個樣本Xj1,Xj2,,XjnX_{j1},X_{j2},\ldots,X_{jn}
第 j 個樣本的平均數Xˉj=1ni=1nXji,j=1,2,,m\bar X_j=\frac{1}{n}\sum_{i=1}^{n}X_{ji},\qquad j=1,2,\ldots,m
母體大小為 n 的可能樣本該樣本的平均數
N 個單位,平均數 μ、標準差 σX₁₁, X₁₂, …, X₁ₙX̄₁
X₂₁, X₂₂, …, X₂ₙX̄₂
Xₘ₁, Xₘ₂, …, XₘₙX̄ₘ

什麼是抽樣分配?#

將所有可能樣本或概念上反覆抽樣所得的統計量整理成機率分配,就得到該統計量的抽樣分配(sampling distribution)。例如,把每次樣本平均數 X̄ 記錄下來,其分配就是樣本平均數的抽樣分配。

分布其中的數值是什麼?回答的問題
母體分布母體中每個個體的觀察值整個母體長什麼樣子?
樣本資料分布某一次樣本中的 n 個觀察值這次抽到的資料長什麼樣子?
統計量的抽樣分配重複抽樣得到的 X̄、p̂ 等統計量如果研究重做,統計結果會怎麼變?

樣本平均數的抽樣分配#

若 X₁,…,Xₙ 是來自同一母體、彼此獨立且具有平均數 μ、變異數 σ²的觀察值,則樣本平均數是一個不偏估計量:重複抽樣所得的樣本平均數,其平均會等於母體平均數。

抽樣分配的中心E(Xˉ)=μE(\bar X)=\mu
抽樣分配的變異數Var(Xˉ)=σ2n\operatorname{Var}(\bar X)=\frac{\sigma^2}{n}
樣本平均數的標準誤SE(Xˉ)=σn\operatorname{SE}(\bar X)=\frac{\sigma}{\sqrt n}
符號代表意義
E(X̄)重複抽樣時,樣本平均數的長期平均
Var(X̄)樣本平均數在不同樣本間的變異程度
SE(X̄)樣本平均數抽樣分配的標準差
σ個體觀察值在母體中的標準差
n每一次抽樣的樣本數
補充一:隨機變數的線性組合

隨機變數的線性組合(linear combination of random variables)是資料合併時會反覆用到的方法。在看公式以前,必須先分清楚公式中的符號代表什麼。

抽樣階段符號代表什麼?可以回答什麼?
抽樣以前/概念上重複抽樣Xᵢ(隨機變數)第 i 次抽樣可能得到的結果期望值、變異數與抽樣分配
抽樣完成以後xᵢ(觀察值)這一次實際得到的固定數字這份樣本的加總、平均與其他描述值

設 X₁,…,Xₙ 為隨機變數,c₁,…,cₙ 為常數,則:

L=c1X1++cnXn=i=1nciXiL=c_1X_1+\cdots+c_nX_n=\sum_{i=1}^{n}c_iX_i

和、差與平均都是線性組合

例如有兩個隨機變數 X₁、X₂,可以形成下列不同的線性組合:

相加Lsum=X1+X2L_{\mathrm{sum}}=X_1+X_2
相減Ldiff=X1X2L_{\mathrm{diff}}=X_1-X_2
取平均Laverage=0.5X1+0.5X2=X1+X22L_{\mathrm{average}}=0.5X_1+0.5X_2=\frac{X_1+X_2}{2}

1. 線性組合的期望值

E(L)=E(c1X1++cnXn)E(L)=E(c_1X_1+\cdots+c_nX_n)
=E(c1X1)++E(cnXn)=E(c_1X_1)+\cdots+E(c_nX_n)
=c1E(X1)++cnE(Xn)=c_1E(X_1)+\cdots+c_nE(X_n)
=i=1nciE(Xi)=\sum_{i=1}^{n}c_iE(X_i)

這裡先利用期望值對加法的線性性,再把常數 cᵢ 提到期望值之外。這一串等式不要求 X₁,…,Xₙ 彼此獨立。

2. 線性組合的變異數

依照你原文採用的獨立隨機變數情況,變異數可逐步寫成:

Var(L)=Var(c1X1++cnXn)\operatorname{Var}(L)=\operatorname{Var}(c_1X_1+\cdots+c_nX_n)
=Var(c1X1)++Var(cnXn)=\operatorname{Var}(c_1X_1)+\cdots+\operatorname{Var}(c_nX_n)
=c12Var(X1)++cn2Var(Xn)=c_1^2\operatorname{Var}(X_1)+\cdots+c_n^2\operatorname{Var}(X_n)
=i=1nci2Var(Xi)=\sum_{i=1}^{n}c_i^2\operatorname{Var}(X_i)

若隨機變數之間可能相關,就不能省略交叉的協方差項,完整形式為:

Var(L)=i=1nci2Var(Xi)+2i<jcicjCov(Xi,Xj)\operatorname{Var}(L)=\sum_{i=1}^{n}c_i^2\operatorname{Var}(X_i)+2\sum_{i<j}c_ic_j\operatorname{Cov}(X_i,X_j)
補充二:抽樣平均數的平均與標準誤完整推導

法一:列出有限母體的所有可能樣本

設有限母體為 x₁,…,x_N,母體大小為 N;每次不放回抽出 n 個且不計順序,因此共有 C(N,n) 個可能樣本。以下保留原推導使用的技巧:先展開平方,再計算單項與交叉項在所有樣本中各出現幾次。為避免重複計數,交叉項一律記為 Σᵢ<ⱼxᵢxⱼ。

母體平均數μ=1Ni=1Nxi\mu=\frac{1}{N}\sum_{i=1}^{N}x_i
先展開母體變異數σ2=1Ni=1Nxi2(1Ni=1Nxi)2\sigma^2=\frac{1}{N}\sum_{i=1}^{N}x_i^2-\left(\frac{1}{N}\sum_{i=1}^{N}x_i\right)^2
把平均平方展開成單項與交叉項σ2=N1N2ixi22N2i<jxixj\sigma^2=\frac{N-1}{N^2}\sum_i x_i^2-\frac{2}{N^2}\sum_{i<j}x_ix_j

第一步:所有樣本平均數的平均

固定一個 xᵢ 後,其餘 n−1 個位置可從另外 N−1 個母體值中選,所以每個 xᵢ 會出現在 C(N−1,n−1) 個樣本中。這個出現次數就是原推導的第一個組合計數技巧。

E(Xˉ)=1(Nn)所有樣本(1n樣本內xi)=(N1n1)i=1Nxin(Nn)E(\bar X)=\frac{1}{\binom{N}{n}}\sum_{\text{所有樣本}}\left(\frac{1}{n}\sum_{\text{樣本內}}x_i\right)=\frac{\binom{N-1}{n-1}\sum_{i=1}^{N}x_i}{n\binom{N}{n}}
(N1n1)(Nn)=nNE(Xˉ)=1Ni=1Nxi=μ\frac{\binom{N-1}{n-1}}{\binom{N}{n}}=\frac{n}{N}\quad\Longrightarrow\quad E(\bar X)=\frac{1}{N}\sum_{i=1}^{N}x_i=\mu

第二步:先求 E(X̄²),再扣掉 [E(X̄)]²

將每個樣本平均數平方後,會出現 xᵢ² 與 2xᵢxⱼ。固定一個 xᵢ 時,它出現 C(N−1,n−1) 次;固定一對 xᵢ、xⱼ 時,其餘 n−2 個位置可從 N−2 個值中選,所以這一對出現 C(N−2,n−2) 次。這就是原推導中交叉項係數的來源。

E(Xˉ2)=(N1n1)ixi2+2(N2n2)i<jxixjn2(Nn)E(\bar X^2)=\frac{\binom{N-1}{n-1}\sum_i x_i^2+2\binom{N-2}{n-2}\sum_{i<j}x_ix_j}{n^2\binom{N}{n}}
Var(Xˉ)=E(Xˉ2)[E(Xˉ)]2\operatorname{Var}(\bar X)=E(\bar X^2)-[E(\bar X)]^2
=(N1n1)ixi2+2(N2n2)i<jxixjn2(Nn)ixi2+2i<jxixjN2=\frac{\binom{N-1}{n-1}\sum_i x_i^2+2\binom{N-2}{n-2}\sum_{i<j}x_ix_j}{n^2\binom{N}{n}}-\frac{\sum_i x_i^2+2\sum_{i<j}x_ix_j}{N^2}

接著使用第二個組合化簡技巧:

單項係數(N1n1)(Nn)=nN\frac{\binom{N-1}{n-1}}{\binom{N}{n}}=\frac{n}{N}
成對交叉項係數(N2n2)(Nn)=n(n1)N(N1)\frac{\binom{N-2}{n-2}}{\binom{N}{n}}=\frac{n(n-1)}{N(N-1)}
Var(Xˉ)=NnnN2ixi22(Nn)nN2(N1)i<jxixj\operatorname{Var}(\bar X)=\frac{N-n}{nN^2}\sum_i x_i^2-\frac{2(N-n)}{nN^2(N-1)}\sum_{i<j}x_ix_j
=Nnn(N1)(N1N2ixi22N2i<jxixj)=Nnn(N1)σ2=\frac{N-n}{n(N-1)}\left(\frac{N-1}{N^2}\sum_i x_i^2-\frac{2}{N^2}\sum_{i<j}x_ix_j\right)=\frac{N-n}{n(N-1)}\sigma^2
SE(Xˉ)=Var(Xˉ)=σnNnN1\operatorname{SE}(\bar X)=\sqrt{\operatorname{Var}(\bar X)}=\frac{\sigma}{\sqrt n}\sqrt{\frac{N-n}{N-1}}

當 N 相對於 n 很大時,有限母體修正 √[(N−n)/(N−1)] 接近 1,因此得到常用形式 SE(X̄)=σ/√n。

法二:利用隨機變數的線性組合

把 n 次抽樣看成取得 X₁,…,Xₙ;每個 Xᵢ 都有 E(Xᵢ)=μ、Var(Xᵢ)=σ²。若它們彼此獨立,樣本平均數就是係數皆為 1/n 的線性組合。

Xˉ=1nX1++1nXn=i=1nXin\bar X=\frac{1}{n}X_1+\cdots+\frac{1}{n}X_n=\sum_{i=1}^{n}\frac{X_i}{n}
E(Xˉ)=i=1n1nE(Xi)=i=1nμn=μE(\bar X)=\sum_{i=1}^{n}\frac{1}{n}E(X_i)=\sum_{i=1}^{n}\frac{\mu}{n}=\mu
Var(Xˉ)=i=1n1n2Var(Xi)=i=1nσ2n2=σ2n\operatorname{Var}(\bar X)=\sum_{i=1}^{n}\frac{1}{n^2}\operatorname{Var}(X_i)=\sum_{i=1}^{n}\frac{\sigma^2}{n^2}=\frac{\sigma^2}{n}
SE(Xˉ)=Var(Xˉ)=σn\operatorname{SE}(\bar X)=\sqrt{\operatorname{Var}(\bar X)}=\frac{\sigma}{\sqrt n}

當 σ 未知時,實務上常以樣本標準差 s 估計,因此使用 s/√n 作為估計標準誤。若從有限母體中不放回抽樣,而且抽樣比例 n/N 不可忽略,還要加入有限母體修正。

以樣本標準差估計SE^(Xˉ)=sn\widehat{\operatorname{SE}}(\bar X)=\frac{s}{\sqrt n}
有限母體修正SE(Xˉ)=σnNnN1\operatorname{SE}(\bar X)=\frac{\sigma}{\sqrt n}\sqrt{\frac{N-n}{N-1}}

樣本變異數為什麼使用 n−1?#

樣本平均數 X̄ 是由同一批資料估計而來,因此 n 個離差 Xᵢ−X̄ 必須加總為 0,只剩 n−1 個可以獨立變動。使用 n−1 作為分母,可以使樣本變異數成為母體變異數 σ²的不偏估計量。

樣本變異數s2=1n1i=1n(XiXˉ)2s^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2
樣本標準差s=s2s=\sqrt{s^2}
不偏性E(s2)=σ2E(s^2)=\sigma^2
補充三:抽樣變異數的平均如何推估母體變異數(完整推導)

這裡沿用原文的有限母體列舉法。先令每個樣本以 n 為分母計算組內變異數 v;再把所有 C(N,n) 個可能樣本的 v 取平均。推導的關鍵仍是展開平方,以及計算 xᵢ² 與 xᵢxⱼ 在所有樣本中出現的次數。

v=1n樣本內(xixˉ)2=n1n2樣本內xi22n2i<j,樣本內xixjv=\frac{1}{n}\sum_{\text{樣本內}}(x_i-\bar x)^2=\frac{n-1}{n^2}\sum_{\text{樣本內}}x_i^2-\frac{2}{n^2}\sum_{i<j,\,\text{樣本內}}x_ix_j

對所有樣本加總時,每個 xᵢ² 出現 C(N−1,n−1) 次;每一對 xᵢxⱼ 出現 C(N−2,n−2) 次。因此:

E(v)=1(Nn)[n1n2(N1n1)ixi22n2(N2n2)i<jxixj]E(v)=\frac{1}{\binom{N}{n}}\left[\frac{n-1}{n^2}\binom{N-1}{n-1}\sum_i x_i^2-\frac{2}{n^2}\binom{N-2}{n-2}\sum_{i<j}x_ix_j\right]
=n1Nnixi22(n1)N(N1)ni<jxixj=\frac{n-1}{Nn}\sum_i x_i^2-\frac{2(n-1)}{N(N-1)n}\sum_{i<j}x_ix_j
=n1nNN1(N1N2ixi22N2i<jxixj)=\frac{n-1}{n}\frac{N}{N-1}\left(\frac{N-1}{N^2}\sum_i x_i^2-\frac{2}{N^2}\sum_{i<j}x_ix_j\right)
E(v)=n1nNN1σ2E(v)=\frac{n-1}{n}\frac{N}{N-1}\sigma^2

因此若母體變異數 σ²採用分母 N 的定義,從有限母體不放回抽樣得到的精確修正為:

σ2=N1Nnn1E(v)\sigma^2=\frac{N-1}{N}\frac{n}{n-1}E(v)

實務上通常看不到所有可能樣本,只看到其中一個樣本。以該樣本的 v 代替 E(v),並在 N 很大時令 (N−1)/N≈1,就得到熟悉的 n−1 修正:

s2=nn1v=1n1i=1n(XiXˉ)2s^2=\frac{n}{n-1}v=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2
s=s2=1n1i=1n(XiXˉ)2s=\sqrt{s^2}=\sqrt{\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2}

所以正文中的根號公式是樣本標準差 s;而推估母體變異數的核心是先證明樣本變異數 s²在相應定義下具有不偏性。

樣本數如何影響標準誤?#

標準誤和 √n 成反比,因此增加樣本數會讓樣本平均數的抽樣分配更集中,但改善並非線性。若希望把標準誤減半,樣本數必須增加為原來的四倍。

SE(Xˉ)1n\operatorname{SE}(\bar X)\propto\frac{1}{\sqrt n}
符號在這組公式中的意義
N母體中的觀察單位總數
n由母體抽出的樣本數
xᵢ母體或樣本中的第 i 個觀察值
i、j不同觀察值的索引編號
sd標準差;依公式所在位置可能指資料標準差或抽樣平均數的標準誤
平方根;常用來把變異數轉成標準差