2017年12月22日 星期五

流行病學的挑戰與危機 (The challenge and crisis of Epidemiology)

    以下是與一位內地有名的流行病學學者的微信對話!

    作為一位流行病與衛生統計專業的人士, 自從研究生畢業後, 我都在尋找著這專業的最新發展及"突破口", 因為仍想在這個專業有些發展...
    但隨著日子過去, 慢慢發覺不斷地在該專業內兜圈子 (當然, 在理論及應用上, 基礎功是扎實了些~~~), 因為這專業, 除了衛生統計為應用統計的一個方向, 在應用統計仍有發展下, 相信衛生統計仍有很多的發展. 如: 大數據, 貝葉斯分析, 地理統計...
    相反, 流行病學嘛, 在這10多年, 似乎真的沒有很大的發展! (不知是否已到了瓶頸), 我在想:

1.流行病學在上世紀約50年代由以傳染病流行病學為主的範式, 轉到慢性非傳染病流行病學為主的範式. 在範式上已有很大的改變. 現在仍未見到下個範式的苗頭!
2.當代流行病學是方法學, 在方法上已相當成熟, 較難再創新一種方法...

3.現在流行病學的研究, 很多都是大型的, 涉及多人的, 甚至是跨國的; 很難進行創作!

4.作為方法學, 應用到其他專業上, 為其他專業帶來很多的發展, 如應用到分子生物學, 就變成分子流行病學; 應用到營養學上, 就變成營養流行病學. 但反過來, 自己的發展已不多.

5.在澳門, 流行病學的學者不多... 以我知, 現時只有1位... 就是對話的那位...

    冀望有一天, 澳門的流行病學學者增多; 我在流行病學上有所突破...

2017年12月8日 星期五

批評前應先要有認識---讀一篇禁毒評論後的感想

     我的博士論文, 題目就不說~ 內容是研究一些"隱蔽小群體"的數量, 以及他們的導到"隱蔽"的原因. 所以對這方面有一定的瞭解.
     首先是"隱蔽小群體"是什麼? 舉例子來說, 這類的群體有濫藥人士, 感染愛滋病病例, 性濫交者等, 他們的特點都是不會在公眾前承認自己是這類群體的一份子; 但想信在一個正常的社會, 這類人士應不會太多.
    為什麼要研究他們的數量? 因為他們都是高危的群體! 所謂"高危", 不單對治安, 更重要是健康及傳染病的風險; 如性傳播疾病及肝炎等... 但是, 研究他們的數量是很困難的! 因為他們很難接觸到, 以及不知他們的總體有多少人! 然而, 估計他們的數量郤又很重要, 因為可作針對性的處理, 乃至相關預防或幫助政策的制定和預算.
   
    說到如何估計他們的數量, 即方法學上, 常用的有倍數法, 捕獲-再捕獲法(Capture-re-Capture)等. 當然, 不同的方法, 在估算的結果可能有很大的差距, 據我所知, 捕獲-再捕獲法是較好的...
    雖然說, 估計數量很難去驗證是否恰當?(因始終很難對這群特殊個體的總人數作全面調查), 但至少, 有一個數據為依據!

    日前看到某報章的一篇評論, 說本澳的濫藥人士最新估算的數量下降, 但與鄰埠的數字相距甚遠, 便說成是"玩弄文字遊戲", 給人報喜不報懮的感覺... 誠言,
1.既然不知這群"隱蔽小群體"的總數; 且不同的方法, 估算的數字可能有較大的差異; 又為什麼盡信鄰埠的"估算"?
2.批評者又知道這隱蔽小群體的總數嗎? 為何批評本澳的估算?
3.批評者又怎知濫藥隱蔽化? 莫非他是其中一員, 且可代表發聲?

    在批評前應知多瞭解! 不要為批評而批評!

2017年11月25日 星期六

同是流病人的博客 (A blog of Epidemiologist from Taiwan)

    數天前, 在網絡上查找些流行病學的內容時, 無意間發現一位博客的內容. 仔細研究後, 他寫的關於流行病學的內容很好. 我相信他應是台灣的市民, 而且是從事流行病學相關的學者吧~
    雖然有關的內容不多, 但都論述得很詳細和清晰, 幫助我釐清了以前教書時的一些疑惑! 例如: 不同"潛伏期"的誤解, 病因推論的詳細歷史...
    會繼續仔細研究的...
    亦希望該博客能繼續寫作流行病學的內容! 努力~👍👍👍
參考網址: http://statisticbyjerry.blogspot.com/

2017年11月14日 星期二

Logistic Regression與關聯分析的妙用(The magical using of Logistic Regression and Association rule)

    今早閱到了一篇好的文章, 論述了二元分類回歸與關聯分析兩者的理論及數理關係. 誠言, 由於我不是搞數理統計, 對於其數理推導部我僅知其然, 而不知其所以然”. 但作為用家的我, 就很留意兩者的實際用途

首先, 說說~

Logistic Regression是統計學中尤其常用的回歸分析, 主要是尋找二元因變項(Y)與自變項的關係.
關聯規則(Association Rule)雖然都是統計學的一個內容, 但是大數據分析的一種方法. 主要是尋找變項之間的相關性

文章提到


兩者互補其優勢及不足, 又是一個我研究的方向

參考文獻: 唐曉, 劉啟貴, 隋全恒. 關聯規則和Logistic模型的相關性研究[J]. 中國衛生統計, 2017.10, 34(5), 805-807.

2017年11月12日 星期日

在商業上未來五年較渴求的工作(Desiring for the job of besiness in next 5 years~)

    數年前, 一位在澳洲的朋友回澳門, 相聚時問道她在澳洲讀什麼科目? 她告知是"分析師(Analyst)", 應是商業分析為主的; 除商業的學科外, 也要學習統計及編程(主要學習SAS及R). 現她在當地已有相關工作, 也落地生根了...
    當時給我感到頗新鮮的, 也留意著"分析師"及她的發展. 不可否認, 隨著大數據湧現, 機器學習算法的優化及電腦硬件的突破性發展, 人工智能(AI)打敗人類圍棋等, 不久的將來會"數據創做財富".
    今早在圖書館閱讀一本期刊, 就以相的的內容為主題故事, 並做出了未來5年, 商業市場上最需求的專才(見下圖). 我的解讀是:

資料科學家(Data scientist)及資料工程師(Data Engineer)

是將來5年需求最多, 但也最不滿足市場的需求.

    看來, 我也應該要轉行了!? 也拭目以待呢...

2017年10月30日 星期一

計數資料的檢驗 (Testing of categorical data)

    承接上一個內容, 以前我在讀研的時候老師只是說: 當分組資料和變量都是計數資料(categorical data)時, 如2x2表或RxC表, 就是用卡方檢驗, 直至讀博時都是這樣~ 但最近了解到, 這樣的情況還可用G test來解決, 而且據知它的理論與算法比卡方檢驗還更好!?(因為G test的算法比較簡單, 所以校正就較方便快捷; 理論上就較具優勢!~) 當然, 算G.test, 以我知暫時仍是R統計軟件才有.

    如上次的例子,
                有效    無效
靜脈注射   25       7
肌肉注射   22       10
口  服  藥   15        17

    在R進行卡方檢驗, 結果是


        Pearson's Chi-squared test
data:  dat
X-squared = 7.1954, df = 2, p-value = 0.02739

    而在R進行G test, 須先下載它的程式 (幸好已有人寫好, 並放在網上!), 只要把程式貼到R軟件並運行即可... 其結果是:
G-Test for Contingency Tables
Data:
         有效 無效
靜脈注射   25    7
肌肉注射   22   10
口服藥     15   17
The test statistic is  7.19124 .
There are  2  degrees of freedom.
The p-value is  0.02744362 .


參考內容:
1. http://www.stat.wisc.edu/~st571-1/gtest.R
2. http://www.biostathandbook.com/gtestind.html