生物統計學習筆記從概念、推導到實務判讀

CHAPTER 02

隨機變數的機率分配

Probability Distributions

章節目錄
  1. 隨機變數(random variable)
  2. 機率密度函數
  3. 隨機變數的機率分配
  4. 自由度
  5. 常態分配(又稱Z分配)
  6. t分配(t-distribution)
  7. F分配(F-distribution)
  8. 指數分配
  9. 二項分配
  10. 卜瓦松分配(Poisson distribution)
  11. 補充一:常態分配與卡方分配;t分配與F分配之間的關係
  12. 補充二:二項分配公式推導

隨機變數(random variable)

機率最主要的用途之一,當作隨機變數各種可能結果的模型,隨機變數這個名詞,代表的就是它字面上的意思。「變數」指的是以數字為值的量;「隨機」則是用來表示變數的值是由機遇決定。因此隨機變數這個名詞是在形容一個數值變數,該變數的值無法事先預測;我們可以把它想成是由機遇決定性影響的。

✽t分配中的t、卡方分配的χ²、F分配中的F都可以算是隨機變數

機率密度函數

把機率看成一個函數,描述隨機變數的輸出值,算是隨機變數中的某個取值點的可能性(密度),而在隨機變數中的某個範圍、區間內所圍的面積為機率(用到積分)。

隨機變數的機率分配

離散型二項分配(binominal distribution)、卜瓦松分配(Poisson distribution)、超幾何分配(hyper-geometric distribution)

連續型常態分配(normal distribution)、均勻分配(uniform distribution)、指數分配(exponential distribution)

自由度

指當以樣本的統計量來估計母體的參數時,樣本中獨立或能自由變化的數據的個數,稱為該統計量的自由度。換句話說就是當你有df筆資料時,你就能夠確定剩下的n-df筆資料的數據,也就是只有df筆資料可以自由的變化,如果有超過df筆資料自由變化的話,就可能無法符合你的樣本中所預設的條件(如:樣本的平均為某個數時,你有n-1個資料就能確定剩下的一筆資料,所以自由度為n-1)。

常態分配(又稱Z分配)

最初由高斯為描述誤差相對次數分配的模型而提出來的,因此又叫高斯分配。

在現實生活中,有許多現象都可以由常態分配來描述,甚至當未知一個連續母群體的分配時,我們總嘗試假設該母群體服從常態分配來進行分析。

其他一些分配(如二項分配)可以利用常態分配做近似計算

其他一些重要的統計分配,如t分配、χ²分配、F分配等是由常態分配所匯出的(這些分配都符合常態分配的假設下進行某些運算所得出的結果也就是當你使用t分配、χ²分配、F分配時,其實就已經假設其為常態分配了)

機率密度函數(記為Z~N(μ,σ2), 而當μ=1, σ=1時為標準常態分布): fx=12πσ2e-12(x-μσ)2

Cumulative Distribution Function(CDF)(累積分布函數):

以方程式ΦX=P(X≤x)表示,將常態分布轉為累積機率,即x以左區域積分面積。

可查詢Z table以得知累積機率,但有幾個值要知道:

當z=-∞,其累積機率為0%

當z=0,其累積機率為50%

當z=1.645,其累積機率為95%(1個尾5%)

當z=1.96,其累積機率為97.5%(1個尾2.5%)

當z=+∞,其累積機率為100%

由於標準常態分布曲線左右對稱,所以:ΦX=1-Φ-X

t分配(t-distribution)

提出者是W. S. Gosset (1876-1937),由於他經常用筆名「student」發表文章,用t表示樣本平均數經標準化後的新隨機變數,因此稱為t分配,也被稱為學生t分配(student’s t)

在常態分配中的母群體中抽樣後的平均所形成的分配

機率密度函數: ft=Γ(k+12)πkΓ(k2)(1+t2k)-k+12其中-∞<t<∞, k∈Z+(自由度)

*Gamma函數:Γ(x)=0∞tx-1e-tdt, x>0

Γ(n+1) = nΓ(n)

Γ(1/2) = π

χ²分配(卡方分配)

由E. C. Abbe (1840-1905)於1863年首先給出的,後來由F. R. Helmert (1843-1917)和K. Pearson (1857-1936)分別於1875年和1900年推導出來

n個獨立標準常態變數之平方和的分配,稱為具有n個自由度的χ²分配,記為χ²(n)。

假設母群體服從一般常態分配,則Z=X-μσ ~ N(0,1)。令Y=Z2,則Y服從自由度為1的χ²分配,即Y ~ χ²(1)。一般來說,對於n個獨立標準常態變數Y1、Y2……Yn,則隨機變數χ=i=1nYi2的分配為具有n個自由度的χ²分配,記為χ~χ²(n)。

表示法:

在N(0,1)中,取樣n個X1,…,Xni=1nXi2~χ2n

在N(μ,σ)中,取樣n個X1,…,Xni=1n(Xi-μσ)2~χ2ni=1n(Xi-Xσ)2~χ2n-1=(n-1)SD2σ2~χ2n-1 (這邊因為用的是樣本的平均數,所以自由度要減1)

機率密度函數: fχ²=1Γ(k2)2k/2(χ²)k2-1e-χ2/2其中χ²>0, k表自由度

如果k代1,則其就相當於常態分配,此時χ²就相當於常態分配的X的平方(類似於函數的轉換,會有修正相),而因為有了平方,所以就像是常態分配的圖左邊翻到右邊疊加,又因為有平方,所以有點拉長。(看補充一)

另外,一開始自由度很低的時候是一個遞減函數,但到後面會有類似鐘型的分佈,這可以用中央極限定理去想:中央極限定理是指不管什麼分佈,取樣本出來作平均,然後其平均的分佈會隨著取樣的個數愈多愈接近常態分佈;然後來看看卡方分配,其分配是n個標準常態變數的平方和的分配,就相當於k代1的卡方分配(先做平方)中取n個相加的分配,和中央極限定理的取平均的分配只差了一個除以n的常數項,因此卡方分配就有點像是中央極限定理的分配,然後把圖拉長,因此當k增加後,就會有鐘型的分佈。

F分配(F-distribution)

是為紀念著名統計學R. A. Fisher (1891-1962)以其姓氏的第一個字母而命名的。

它是兩個χ²分配的比。設U ~ χ²(n1),V ~ χ²(n2),且U和V相互獨立,則F=U/n1V/n2 服從自由度n1和n2的F分配,記為F ~ F(n1,n2)。

F分配的圖形與χ²分配類似,其形狀取決於兩個自由度

機率密度函數: fn,mF=Γ(n+m2)nn2mm2Γ(n2)Γ(m2)Fn2-1(m+nF)(n+m)2 其中n, m 表兩個自由度

F分配和t分配有很大的關聯性,其中有tα2X=Fα(1,X)的關係,其實和卡方分配與常態分配之間的關聯很像,如果F分配的其中一個自由度代1,F分配就相當於t分配,其中F就相當於t的平方,由圖形來看的話,因為有平方,所以就像是把t左邊翻到右邊重疊,然後拉長(由公式來看的話會差一個常數項),而因為有兩邊重疊的原因,所以機率會差兩倍,就以以上tα2X=Fα(1,X)的關係。(詳細過程請看補充一)

所以F分配也可以看成t分配的推廣,只是不能完全取代,因為t可以分單雙尾,而且如果分很多組時,t分配可以以次數(就是挑很多次兩組出來比較)來得到更詳細的資訊。另外,也是F分配和t分配有這關系的原因,常常看到後面的做t檢定時也可以做F檢定。

指數分配

是一種連續的機率分布

指數分布可以用來表示獨立隨機事件發生的時間間隔,比如旅客進入機場的時間間隔、打進客服中心電話的時間間隔等

機率密度函數(x≥0): fx=λe-λx其中λ > 0是分布的一個參數,常被稱為率參數(rate parameter)。即每單位時間發生該事件的次數。指數分布的區間是[0,∞)。 如果一個隨機變量X 呈指數分布,則可以寫作:X ~ Exp(λ)。

其累積分佈函數為(x≥0): fx=1-e-λx

公式: EX=1λ VarX=1λ2

機率密度函數推導:(其實就當做X時間前都沒發生,然後在X時發生)λ為率參數,可看成發生的機率,假設經過X時間,則一般來說會發生λX次,將其分為n段(n→∞),則每段發生的機率看成λXn,則X時前都沒發生,然後在X時發生的機率為PX=(1-λXn)nλ=λe-λX(其中(1-λXn)n→e-λX)

二項分配

指只有兩種可能結果的試驗,我們通常把這兩種結果分別叫做成功及失敗。成功的機率稱做p,失敗的機率稱做q=(1-p)

當我們做了n次試驗,則有X次成功的機率p(X)為Cxnpx(1-p)n-x,記為 pX=Cxnpx(1-p)n-x,而我們記錄做n次試驗、成功機率為p的二項分配為Binomial(n,p)或Bin(n,p)或B(n,p)

二項分配當n愈大(至少20)會愈近似於常態分配,當p不接近0或1時更好。

二項分配的公式(證明請看補充二): EX=np VarX=σ2=EX-μ2=np(1-p)

卜瓦松分配(Poisson distribution)

是一個離散的機率分配。

常用來計算在某時段或某空間事件發生的機率。

和指數分配是彼此相關的,如果卜瓦松分配適合表示某一個區間內事件發生次數的機率,指數分配就可以描述二次事件發生的時間間隔的機率。

機率密度函數(表示為X~P(λ)): fx=λxe-λx!, x=0,1,2…λ=某段區間或時間內的事件發生次數或期望值

公式: EX=VarX=λ 期望值和變異數一樣

機率密度函數推導:一段時間T中可能發生λ次,我們將T分成n段(n→∞),一段為Tn,發生機率為λn,然後看成二項分布 PX=CXnλnX(1-λn)n-X=n!x!n-X!λnX(1-λn)n-X =n!nXn-x!λXX!(1-λn)n(1-λn)-X=λxe-λX!(因n!nXn-x!→1, (1-λn)n→e-λ,(1-λn)-X→1)

如果二項分布中的試驗次數n很大、機率p很小且乘積λ=np比較適中,則事件出現的次數的機率可以用卜瓦松分布來逼近。

補充一:常態分配與卡方分配;t分配與F分配之間的關係

先看F分配與t分配之間的關系

將F分配fn,mF=Γ(n+m2)nn2mm2Γ(n2)Γ(m2)Fn2-1(m+nF)(n+m)2中的n代1

⇒f1,mF=Γ(1+m2)mm2πΓ(m2)F-12(m+F)(1+m)2

⇒f1,mF=Γ(1+m2)πΓ(m2)(1m)12(1m)-(1+m)2F-12(m+F)-(1+m)2

⇒f1,mF=Γ(1+m2)πmΓ(m2)(1+Fm)-(1+m)2F-12

和t分配比較:ft=Γ(k+12)πkΓ(k2)(1+t2k)-k+12

其就是把F改成t2,然後差了一個修正項F-12或相當於t-1

修正項的說明:(設f1(F)是F分佈的方程式,f2(t)是t分佈的方程式)

用面積來看,由tα2X=Fα(1,X),反正就是面積會差兩倍的關係

可得f1(F)dF=2f2(t)dt

⇒f1(F)dt2=2f2(t)dt (將F=t2代換)

⇒f1(F)2tdt=2f2(t)dt

⇒f1(F)tdt=f2(t)dt

所以f1Ft=f2(t) ⇒ f1F=f2t1t=f2tF-12

因此F分配就是t分配的公式把t2改成F,然後補上F-12

F-12就相當於修正項,其實是因積分運算來的

接著看常態分配與卡方分配之間的關系

先看常態分佈的方程式:fx=12πσ2e-12(x-μσ)2

然後因卡方分配的數據會先經標準化,所以把常態分佈中的μ代0,σ代1

⇒ fx=12πe-x22

(因為用的是μ所以自由度代1,如果是用取樣的平均了話,自由度就不一樣了)

接著來看卡方分配的方程式:fχ²=1Γ(k2)2k/2(χ²)k2-1e-χ2/2

將k代1⇒ fχ²=12πe-χ2/2(χ²)-12

其就是把χ²改成x2,然後差了一個修正項(χ²)-12或相當於x-1

而要加修正項的原因就和上面F分配和t分配之間的原因相似,都是由積分來的

從圖來看的話,卡方分配自由度代1就相當於常態分配的左邊翻到右邊重合,然後再拉長(加修正項,因為進行xx2的轉換)

補充二:二項分配公式推導

EX=np

EX=i=1niCinpi(1-p)n-i=i=1nnpCi-1n-1pi-1(1-p)n-i

=npi=1nCi-1n-1pi-1(1-p)n-i=np

VarX=σ2=EX-μ2=np(1-p)

先求EXX-1=i=1ni(i-1)Cinpi(1-p)n-i

=i=2nn(n-1)p2Ci-2n-2pi-2(1-p)n-i

=nn-1p2i=2nCi-2n-2pi-21-pn-i

=nn-1p2

而EX2=EXX-1+EX=nn-1p2+np

VarX=EX2-EX2

=n2p2-np2+np-np2=np(1-p)