生物統計學習筆記從概念、推導到實務判讀

CHAPTER 09

存活資料分析

Survival Analysis

章節目錄
  1. 存活曲線估計
  2. 二組數據的存活曲線相比
  3. 結語

Survival Data

存活曲線估計

我們設的實際的存活曲線為St=存活超過t的人數族群內的所有人數

而我們取樣而得到的存活曲線記為St=取樣中存活超過t的人數取樣的人數

然而取樣時,並不是所有人都會從頭到尾參與,有的人可能中途就離開了,因此就有針對這種狀況的算法,舉例如下

淡色的圈圈是中途離去的,深色是死亡的,然後我們就做成以下的表

既然有人離去,則我們就沒辦法直接用剩下的存活數去除總人數,那我們就分段討論存活比例,然後就用乘的(一個時間存活的比例就等於前面的時間的存活比例乘上中間差的那一段時間的存活比例),於是就得到以下公式

分段討論的公式:

其中一段時間的存活比例(第i段,n為人數,d為死亡人數):ni-dini

則時長為tj的存活比例為:Stj=(ni-dini)

公式:

標準差:sdStj=Stjdini(ni-di)

則100(1-α)的信賴區間為St-zαsdSt<S(t)<St+zαsdSt

另外還有比較好的方法是取ln[-lnSt]再算,而得到以下:

標準差:sdln⁡[-lnStj]=1[lnStj]2dini(ni-di)

100(1-α)的信賴區間:

Stexp⁡(-zαsdln⁡[-lnStj])<St<Stexp⁡(+zαsdln⁡[-lnStj])

則上面的表就可以變成以下的表

數學上定義的hazard function:

ht=lim∆t→0個人在t和t+∆t之間的死亡率∆t

hazard function和survival function的關係為ht=f(t)S(t)

公式說明:其中f(t)的累積分布函數Ft=1-S(t),Ft表直到t時死亡率,則f(t)表t時的死亡率(和全體比),因此要在除S(t)使死亡率是和當下的人數比

二組數據的存活曲線相比

虛無假設H0:兩組的存活曲線相同,則兩組每個時段的死亡人數要和其當時的人數成正比

例子:成人骨髓移植中Autologous transplant和Allogenic transplant的存活曲線是否相同,以下是時間和死亡人數的數據

以下是兩組分別算的生存曲線

接下來代入虛無假設,假設死亡人數和當時人數成正比,因此就先算出兩組當時總共的死亡人數,再按比例分配得到其中一組期望的死亡人數,然後再由這組死亡人數減期望死亡人數表error,之後我們用看的是所有error相加UL的分布,雖然我不知道為什麼,但是它最好是會變成常態分布的樣子,而相關的處理和標準差公式如下:

eautologous, i=nautologous, idtotalntotal

UL=dautologous, i-eautologous, i

sdUL2=nautologous, jnallogenic, jdtotal, j(ntotal, j-dtotal, j)ntotal, j2(ntotal, j-1)

z=ULsdUL

而本例的結果如下

z=6.5752.808=2.342,其p值<0.02

另外也可以用Yates Correction,也就是扣1/2,得z=6.575-0.52.808=2.163

結語

本文的內容主要包含了老師之前上課過的內容、還有原文書內的內容還有一些自己的推導,算是自己對生統內容的一些看法。除了前面一些關於統計學的概論、有名的分布、虛無假設等基礎知識,而後面的各種統計方法在我看來其實都有一個固定的流程,就是在群體是常態分布(有母數)或不是常態分布(無母數)的狀況下做一個虛無假設,然後我們在這個虛無假設下將我們抽樣的數據進行處理(在數學上應該算是在進行隨機變數的運算),處理後得到的數字就會符合某個分布(t分布、F分布、卡方分布等),然後就可以得到我們要的p值,就可以下一些結論,所以我在統計方法的介紹時大致就先講什麼時候用這個方法、虛無假設,然後就是處理的過程(其實就可以看成是隨機變數的運算),最後就是如何求p值(包含平均、標準差等)。而關於我的一些推導,大致就是推導說為什麼平均、標準差會是這樣算,而推導過程中一個很重要的就是線性組合,它其實就是隨機變數運算中的一種,是資料合併時會用到的。最後,關於有些公式我沒有給證明,那是因為我才疏學淺,還想不到,或是我上網或翻書也沒有翻到,所以就沒附上了,請多多見諒。

全文完