生物統計學習筆記從概念、推導到實務判讀

CHAPTER 02 · TOPIC 01

隨機變數與機率密度函數

機率模型用來描述隨機現象可能出現哪些結果,以及各種結果有多大的機會發生。為了用數學處理這些結果,我們會利用隨機變數把試驗結果轉換成數值。

本頁內容
  1. 什麼是隨機變數?
  2. 為什麼需要隨機變數?
  3. 以擲硬幣為例
  4. 統計量也可能是隨機變數
  5. 離散型與連續型隨機變數
  6. 機率質量函數:離散型
  7. 機率密度函數:連續型
  8. 機率密度和機率有什麼不同?
  9. 為什麼密度可以大於 1?
  10. 累積分布函數
  11. 常見機率分配

機率模型用來描述隨機現象可能出現哪些結果,以及各種結果有多大的機會發生。為了用數學處理這些結果,我們會利用隨機變數把試驗結果轉換成數值。

什麼是隨機變數?#

隨機變數(random variable)是把隨機試驗的每一個可能結果對應成數值的函數。由於試驗結果在發生前尚未確定,因此隨機變數最後會取得哪一個數值,也具有不確定性。

為什麼需要隨機變數?#

現實中的隨機結果可能是事件、狀態或文字描述,不一定能直接進行計算。隨機變數會先選定我們關心的特徵,再用符號表示,並建立一套把每個可能結果對應成數值的規則。完成這個轉換後,才能為這些數值建立機率分配,進一步計算平均數、變異數及其他統計量。

  1. 觀察一個具有不確定性的現象。
  2. 選擇其中真正關心的特徵。
  3. 以 X 等符號表示這個特徵。
  4. 定義每一種可能結果如何對應成數值。
  5. 根據這些數值與機率,進一步建立分配並進行計算。

以擲硬幣為例#

假設連續擲兩次硬幣,可能結果為正正、正反、反正與反反。若定義 X 為正面出現的次數,這四種結果就會分別對應到 2、1、1 與 0。

X{0,1,2}X\in\{0,1,2\}
符號代表意義
X正面出現次數這個隨機變數
0、1、2X 可能取得的數值,也稱為可能值或實現值

統計量也可能是隨機變數#

樣本平均數以及 t、χ²、F 等統計量,都是由樣本資料計算而來。在抽樣之前,樣本尚未確定,這些統計量也會隨抽到的樣本而改變,因此可以視為隨機變數。

離散型與連續型隨機變數#

依照可能值能否逐一列出,隨機變數可以分成離散型與連續型。這個差異也決定我們要用哪一種函數描述機率。

類型特性例子描述方式
離散型可能值可以逐一列出成功次數、病例數、住院次數機率質量函數(PMF)
連續型在範圍內可以取任意精細的數值身高、體重、血壓、存活時間機率密度函數(PDF)

機率質量函數:離散型#

離散型隨機變數使用機率質量函數(probability mass function, PMF)。它直接表示 X 取得某個特定值 x 的機率。

特定值的機率p(x)=P(X=x)p(x)=P(X=x)
所有可能值的機率總和xp(x)=1\sum_x p(x)=1
符號代表意義
X離散型隨機變數
xX 的某一個可能值
p(x)X 取得 x 的機率
P(X=x)事件『X 等於 x』發生的機率
Σ把 X 所有可能值的機率加總

機率密度函數:連續型#

連續型隨機變數使用機率密度函數(probability density function, PDF)。曲線在某一點的高度表示機率密度,不等於該點本身的機率;區間內的機率才是密度曲線下的面積。

機率密度和機率有什麼不同?#

可以把機率密度看成一個函數,用來描述隨機變數的可能值在各個位置附近有多集中。函數在某個位置的高度是密度;把一段範圍內的密度累積起來,也就是計算曲線下的面積,得到的才是這個區間的機率。

為什麼密度可以大於 1?#

機率一定介於 0 與 1 之間,但機率密度的高度可以大於 1。只要密度曲線下的總面積等於 1,它仍然是合法的機率密度函數。

例如 X 均勻分布在 0 到 0.5 之間。因為整段寬度只有 0.5,密度高度可以是 2;此時總面積仍然是 0.5×2=1。

均勻分布的機率密度示意圖:密度高度為 2、區間寬度為 0.5,曲線下的矩形面積為 1
密度高度為 2 並不代表機率大於 1;真正的機率是曲線下的面積,此處為 2 × 0.5 = 1。來源:本站製作
密度函數f(x)=2,0x0.5f(x)=2,\quad 0\le x\le 0.5
整段範圍的機率P(0X0.5)=00.52dx=1P(0\le X\le 0.5)=\int_0^{0.5}2\,dx=1
其中一小段的機率P(0X0.1)=00.12dx=0.2P(0\le X\le 0.1)=\int_0^{0.1}2\,dx=0.2
符號代表意義
f(x)=2這段範圍的機率密度高度為 2;它不是單一點的機率
0.5、0.1所計算區間的寬度
把指定區間內的密度累積成曲線下面積
1、0.2積分後得到的區間機率
單一點的機率P(X=x)=0P(X=x)=0
區間內的機率P(aXb)=abf(x)dxP(a\le X\le b)=\int_a^b f(x)\,dx
整條密度曲線下的面積f(x)dx=1\int_{-\infty}^{\infty}f(x)\,dx=1
符號代表意義
f(x)X 在 x 附近的機率密度;函數值本身不是單點機率
a、b要計算機率的區間下限與上限
積分;計算密度曲線在指定區間下的面積
−∞、∞涵蓋 X 所有可能值的完整範圍

累積分布函數#

累積分布函數(cumulative distribution function, CDF)可以同時用於離散型與連續型隨機變數,表示機率累積到 x 為止共有多少。

共同定義F(x)=P(Xx)F(x)=P(X\le x)
連續型的表示方式F(x)=xf(u)duF(x)=\int_{-\infty}^{x}f(u)\,du
符號代表意義
F(x)X 不超過 x 的累積機率
f(u)連續型隨機變數的機率密度函數
u積分中使用的暫時變數,避免與積分上限 x 混淆

常見機率分配#

隨機變數類型常見分配
離散型二項分配(binomial)、卜瓦松分配(Poisson)、超幾何分配(hypergeometric)
連續型常態分配(normal)、均勻分配(uniform)、指數分配(exponential)