顯示具有 衛生統計學-理論 標籤的文章。 顯示所有文章
顯示具有 衛生統計學-理論 標籤的文章。 顯示所有文章

2026年9月7日 星期一

自學貝葉斯統計(Bayes Statistics)

近期內地有名北大核心期刊的中華流行病學雜誌, 一期共刊出了4篇貝葉斯統計的文章。

我知貝葉斯統計很多年了, 亦被吸引了; 因自己的數學根底差, 而且它涉及較複雜的公式, 所以學得不好! 尤其是先驗分佈中的共軛分佈, 更是不理解。

當然, 還是會使用的, 尤其是JASP統計軟件的出現, 讓它的使用簡易了很多; 另外, R統計軟件近年的統計包, 也令貝葉斯統計的實現簡單了許多...

期望日後能系統計學好它, 用好它...

2020年8月22日 星期六

統計學上的辛普森悖論(Simpson's Paradox of Statistics)

昨晚留意到YouTube的一段視頻,是關於一個 "民意調查"中,數據的錯誤計算。
視頻中的女士說,因為數據計算中未進行加權,導到 "支持"與 "反對"的差異很少,甚至可能將結果反轉...
是的! 計算是未有加權。但更精確地說,是因為犯了統計學上的 "辛普森悖論"! 才出現差異少,甚至結果可能 "反轉"。
辛普森悖論是很常見的,亦是很多人易犯的錯誤,更小心的是易被人"誤導"了~

(利申:我對內容提及的政治問題沒有什何偏向及意見,純是統計學上的見解呵!)
計算方法:

總結果

                    支持:(21367*20%)+(1705*50%)+(1012*37%)
                                -------------------------------------------------- ~22.8%
                                           21367+1705+1012

                    反對:(21367*63%)+(1705*31%)+(1012*41%)
                                -------------------------------------------------- ~59.8%
                                           21367+1705+1012

單支持者結果

                    支持:(21367*20%)+(1705*50%)
                                ---------------------------------- ~22.2%
                                           21367+1705

                    反對:(21367*63%)+(1705*31%)
                                ---------------------------------- ~60.6%
                                           21367+1705
參考資料:

2018年9月2日 星期日

科研的屍體解剖(Autopsy of science)

碩導老師在微信分享了一篇文章,是他為某書寫的導論,對其中一段說話很有感觸!
因有些朋友找我,就是为他/她的科研做“屍体解剖”!其實我很想說: 我只能盡力,“死馬當活馬醫”。但能不能,结果如何?只是天意!

2018年6月9日 星期六

大數據與R統計分享 (Sharing Big Data and R statistical Language)

    自從我研究統計, 尤是"衛生統計學"後(2005年開始吧!) 統計學近10多年有著很大的改變... 其中之一就是出現了"大數據"的概念.
    我記得研究生時, 教我統計學的老師, 仍是說: 抽樣... 由樣本統計量推向參數... 然而, 大數據因為大得可怕, 動輒就是數個GB, TB 甚至是PB的儲存量, 數據資料也來自廣大人群, 又何需要抽樣... 當然, 它的代表性及數據背後的意義與價值, 又是另一回事吧!
    所以一值都想學習大數據的處理與分析.
    自己也一直有些擔憂: 自己的沒有強的數學背景, 對統計或數學的理解不容易; 沒有很好的電腦編程基礎呵...

    近日從網絡上看到一本"被"掃瞄的相關書籍: 大數據分析: R基礎與應用. 便下載回來學習.
    該書不厚, 約有150多頁,內有些R語言編程及圖表說明, 所以我讀的較快 (約花了1個月吧!)
    它主要分開4部分:
1.大數據的基礎知識;
2.R統計語言的基礎知識與使用技巧;
3.一些較高級的統計內容與數據挖掘(Data Mining);
4.大數據分析的基本分析方法...
    總的來說, 前3部分還是寫的不錯, 言駭意簡. 但第4部分就寫得不好, 因為很多數學推導的內容, 而R實踐部分就"簡略"了很多; 讓我有感"接不下去"的感覺(或許是我這方面的知識膚淺呢!).
所以它適合有統計學基礎的讀者呵...

    好! 繼續努力~

2017年11月14日 星期二

Logistic Regression與關聯分析的妙用(The magical using of Logistic Regression and Association rule)

    今早閱到了一篇好的文章, 論述了二元分類回歸與關聯分析兩者的理論及數理關係. 誠言, 由於我不是搞”數理統計”的, 對於其數理推導部我僅”知其然, 而不知其所以然”. 但作為用家的我, 就很留意兩者的實際用途…

首先, 說說~

Logistic Regression是統計學中尤其常用的回歸分析, 主要是尋找二元因變項(Y)與自變項的關係.
關聯規則(Association Rule)雖然都是統計學的一個內容, 但是大數據分析的一種方法. 主要是尋找變項之間的相關性…

文章提到…


兩者互補其優勢及不足, 又是一個我研究的方向…

參考文獻: 唐曉, 劉啟貴, 隋全恒. 關聯規則和Logistic模型的相關性研究[J]. 中國衛生統計, 2017.10, 34(5), 805-807.

2017年10月30日 星期一

計數資料的檢驗 (Testing of categorical data)

    承接上一個內容, 以前我在讀研的時候老師只是說: 當分組資料和變量都是計數資料(categorical data)時, 如2x2表或RxC表, 就是用卡方檢驗, 直至讀博時都是這樣~ 但最近了解到, 這樣的情況還可用G test來解決, 而且據知它的理論與算法比卡方檢驗還更好!?(因為G test的算法比較簡單, 所以校正就較方便快捷; 理論上就較具優勢!~) 當然, 算G.test, 以我知暫時仍是R統計軟件才有.

    如上次的例子,
                有效    無效
靜脈注射   25       7
肌肉注射   22       10
口  服  藥   15        17

    在R進行卡方檢驗, 結果是


        Pearson's Chi-squared test
data:  dat
X-squared = 7.1954, df = 2, p-value = 0.02739

    而在R進行G test, 須先下載它的程式 (幸好已有人寫好, 並放在網上!), 只要把程式貼到R軟件並運行即可... 其結果是:
G-Test for Contingency Tables
Data:
         有效 無效
靜脈注射   25    7
肌肉注射   22   10
口服藥     15   17
The test statistic is  7.19124 .
There are  2  degrees of freedom.
The p-value is  0.02744362 .


參考內容:
1. http://www.stat.wisc.edu/~st571-1/gtest.R
2. http://www.biostathandbook.com/gtestind.html

2017年10月21日 星期六

卡方檢驗後的兩兩比較分析 (Post Hoc analysis after Chi-square test is significant)

    昨晚一位好朋友微信問在RxC(即多行x多列)的表格進行卡方檢驗後, 知道差異有統計學意義, 應如何進行事後的兩兩比較分析呢~

    我知她僅能使用SPSS統計軟件, 就告知她: 在SPSS進行卡方檢驗事後的兩兩比較分析, 一般只能拆表, 而且要修正每個檢驗的p值(即Bonferroni校正呵...)

    她又問到如何可以不用這樣"痛苦"? 我告訴她可以用R統計軟件吧... 但無奈她不懂R...
如有一數據集, 內容如下:
                 有效    無效
靜脈注射   25       7
肌肉注射   22       10
口  服 藥   15        17
    在SPSS的處理如youtube的視頻那樣, 哇... 真的"痛苦"! 在R軟件呢?
#第1部份:處理數據
dat<-matrix(c(25,22,15,7,10,17),nrow=3,ncol=2)
rownames(dat)<-c("靜脈注射","肌肉注射","口服藥")
colnames(dat)<-c("有效","無效")

#第2部份:矩陣-組間兩兩比較, 注意用Bonferroni法校正p,即0.05/3=0.017
chi<-chisq.test(dat)#總結果x2=7.1954,p=0.02739
chi1<-chisq.test(dat[c(1,2),])#靜脈注射與肌肉注射比較,結果x2=0.3204,p=0.5714
chi2<-chisq.test(dat[c(1,3),])#靜脈注射與口服藥比較,結果x2=5.4,p=0.02014
chi3<-chisq.test(dat[c(2,3),])#肌肉注射與口服藥比較,結果x2=2.3063,p=0.1288

#第3部份:快捷方法
#install.packages("fifer")先安裝這統計套件
library("fifer")#載入套件
chi.result<-chisq.post.hoc(dat,test="chisq.test",control=c("bonferroni"))
##結果
##             comparison        raw.p  adj.p
##1 靜脈注射 vs. 肌肉注射 0.5714 1.0000
##2 靜脈注射 vs. 口服藥     0.0201 0.0604
##3 肌肉注射 vs. 口服藥     0.1288 0.3865


    其實第2部份與第3部份任選1個即可... 而且紅色字內容只是註釋, 實際操作時沒有必要寫!
    結果與視頻的有不同, 是因R的chisp.test預設了作"連續校正的"(correct=TRUE). 如果改為correct=FALSE, 結果就完全一樣啦...

2017年5月3日 星期三

這本"量表編製"的書不好讀... (It is hard to read this book...)

    早約2個月前, 在中央圖書館見到一本關於"量表編製"的書籍.
    心想: 雖然自己學習流行病及生物統計學多年, 使用較多的問卷(量表), 但也沒有好好的研究過量表; 而且在研究生時期, 也沒有學過量表研製的課程. 3來是以往一些朋友問我關於量表的事, 只知期表面而不知其內涵... 實是有愧. 如今可以借到, 應是時候好好地"補習"一下.
    經過兩個月的閱讀, 這本書是有點失望的! 因為:
1.翻譯得不好, 譯句有很多語法的錯誤, 所以很難理解作者的原意;
2.其次是作者論述的深度不足, 較多的理論膚淺呢!
3.亦沒有很好的實踐指導...
    讀完後, 我試問問自己, 得到些什麼? 誠言, 較少!

2017年1月21日 星期六

向吳教授請教模糊統計學~(Asking some questions of Fuzzy statistics with Prof. Wu))



尊敬的吳教授:
    你好! 我是澳門的一名市民, 於中國內地研習流行病學與衛生統計學. 偶爾在澳門的圖書館, 看到你的"模糊統計導論: 方法與應用(第一版)", 感到很特別, 帶來了認識的新視野. 當然, 對於本科研習醫學的我, 在理解數理的推導是有一定的困難, 但同時, 因有傳統統計學基礎的我, 又在某些方面較容易理解… 我有以下問題想向吳教授請教的:
1.     有沒有1份較正規的糢糊問卷, 讓我對糢糊問卷的設計有較全面的認識呢?
2.     在你的一個研究項目中(網路教育問卷調查新技術與線上模糊統計分析建構), 提到你正開發一款類似  minitab 的模糊統計分析軟件, 我能獲得及使用嗎? (並且我了解過, R統計軟件也有分析模糊分析的軟件包, 但除使用說明不詳細外, 相信亦較難使用呢~)
3.     在網絡上知上述的書籍已出了第二版, 它與第一版相比較, 有那些內容的增刪呢? (因第一版的內容, 有稍多的重覆及累贅; 也看過內地出版的, 除與第一版有類同外, 排版亦有錯誤呢…)
首先感謝你的書籍, 亦期望你的回覆呢~
讀者
... ...

兩日後我收到教授的回覆了:
Dear ... ...:
I am glad to know that you are interesting in the fuzzy statistics.
1. see the new edition book (second edition)
2. I am looking for a good company for the business publication for soft-ware.
3. please check the new edition.

最後我發現是沒有收獲的, 並且有一個想法: R統計語言在十多廿年的時間, 發展到現在的"強大", 是因免費而能讓眾人士能參與其中! 想賺錢還是想讓模糊統計推廣~ 就在乎它的規劃啦... ...

2017年1月6日 星期五

研究著---模糊統計學 (Studying Fuzzy statistics)

    其實知道有"模糊數學"已有多年, 具體原因已忘記了! 只知道每次進出關口時, 經過的手指模及樣貌辨識機器, 雖然人樣有變, 但仍可辨認出來是誰, 基本的原理就是透過"模糊數學"方法.

    約半年前, 在偶爾的機會下, 到何東圖書館走走時, 無意間發現了台灣吳柏林先生撰寫的"模糊統計導論: 方法與應用(第一版)", 隨手翻開時感到很有新意, 但又感到頗有難度, 原因是我出身於醫學, 對於太多的數學公式或理論, 有點... ... 吃不消呢~

    其實作為"統計人", 除了數理統計理論及應用應要掌握外, 也應要了解一些統計的發展方向:
1.大數據
2.貝葉斯分析+馬可科夫鏈
3.模糊理論
4.結構線性模型
5.層次分析
6.試題理論分析
7.地理統計... ...

    再講, 糢糊理論不算是太難, 其精華可說是"隸屬函數"及"隸屬度"的問題, 想了解的朋友, 可以閱讀這份網絡文章 (寫的很好!).
    若想詳細了解的話, 可閱讀在網絡上的書籍, 它是模糊統計導論: 方法與應用(第一版)書本的內地版 (即簡體字版); 在內容上稍作了補充---主要是有關模糊理論的第1,2章. 但誠言, 內容都是與模糊統計導論: 方法與應用(第一版)基本相同, 而且較繁瑣累贅! 所以有機會的讀者, 讀繁體版就好了~

    最後, 在實踐模糊統計上, 現在只有R軟件的"SAFD"擴充統計包! 若有機會再分享... ...

SAFD — An R Package for Statistical Analysis of Fuzzy Data


參考資料:
模糊数据统计学 http://vdisk.weibo.com/s/zvzbUucCQQIgd
http://web.math.sinica.edu.tw/math_media/d181/18102.pdf

2016年10月11日 星期二

偏態分布的數據, 進行組間比較及兩兩比較的方法 (The Statistical method of comparing many-groups and two groups of Skewed data)


    以SPSS軟件內附的數據庫 "1991 U.S. General Social Survey.sav"為例.
 
    若分組的計量資料是偏態分佈, 作組間比較時, 應要使用: 非參數檢驗中, 多獨立組數據的比較.

    如我們想分析不同地區的年齡是否有統計學上的差異, 假設該數據庫有兩變項: "地區", "年齡"; 而且年齡變項是偏態分佈的數據...

     通常結果會包含:
統計量是: Chi-square, 其實它是依Kruskal Wallis Test計算所得.


若是組間有統計學差異(如上圖p=0.004), 只說明組間中位數是不同的, 一般宜進行兩兩比較!

非參數變項的兩兩比較, 宜選用首幅圖的2 Independent Samples方法. 結果應如下:

解釋結果時要小心, 因是數組之間的比較, 所以p值要修正, p=0.05/比較組數;

如: 現在有3組間比較, p=0.05/3=0.017
現在結果的p=0.08>0.017, 拒絕H1, 兩組間無差異... 反之亦然...