統計方法
描述與檢定
- Table 1 與標準化平均差進階
Table 1 在 RCT 與在觀察性研究裡問的不是同一個問題、SMD 為什麼不隨樣本數膨脹、|SMD| < 0.1 這個慣例哪來的,以及連續變項該報平均還是中位數、遺漏值該擺在哪裡。
- t 檢定與變異數分析基礎
t 檢定的常態性假設到底假設了什麼、為什麼 Welch 該當預設、配對與獨立差在哪、ANOVA 之後的多重比較,以及為什麼「先做常態性檢定再決定」是個壞習慣。
- 卡方檢定與 Fisher's exact test基礎
卡方在比觀察與期望的什麼、期望次數 5 這條線哪裡來、Fisher's exact test 到底解決了什麼、Yates 校正為什麼有爭議,以及配對資料為什麼一定要換成 McNemar。
- 無母數檢定:Wilcoxon 與 Kruskal-Wallis基礎
Wilcoxon rank-sum 檢定的虛無假設是隨機優勢(stochastic ordering),不是中位數相等——所以「兩組中位數一樣、p 值卻顯著」不是矛盾。還有為什麼只報 p 值不夠、Hodges-Lehmann 位移估計怎麼讀、無母數與取對數估的是不同的量、相同值對精確 p 值的影響,以及 Kruskal-Wallis 之後的兩兩比較。
- 分布圖:為什麼不要用長條圖加誤差線基礎
mean 加一根誤差線的長條圖把樣本數、分布形狀、離群值全部藏起來,而那根誤差線可能是 SD、SE 或 95% CI 中的任何一種,長度差好幾倍。盒鬚圖、小提琴圖與 raincloud 各補上什麼,以及期刊為什麼開始要求畫出每一個資料點。
迴歸
- 線性迴歸基礎
「其他變項固定時」這句話實際上固定了什麼、R² 高為什麼不等於模型有用、連續變項的線性是假設不是事實,以及換一個參考組會改變哪些數字、不會改變哪些。
- 邏輯迴歸與勝算比進階
OR 到底是什麼比值、結果不罕見的時候它為什麼一定會誇大、校正後的 OR 與粗 OR 差在哪裡(不只是干擾)、完全分離長什麼樣子怎麼修,以及 EPV 至少 10 這個規矩的來歷與它被質疑的地方。
- Poisson 與負二項迴歸進階
計數資料為什麼不能用線性迴歸、Poisson 的等分散假設幾乎總是不成立、過度分散怎麼偵測、負二項與 quasi-Poisson 各修了什麼,以及 offset 這一步——次數與發生率的差別是醫學研究最常搞錯的地方。
- 迴歸模型診斷進階
四張殘差圖各自在抓什麼、為什麼全部通過還是可能漏掉問題、VIF 的重要性被高估在哪裡、影響點怎麼量,以及逐步迴歸為什麼是醫學論文最常見的統計錯誤之一——用模擬把它做給你看。
- 限制性立方樣條與劑量反應曲線進階
線性假設要怎麼放掉:knot 放在哪裡、零膨脹的臨床變項為什麼會把預設 knot 撞在一起、參考點怎麼選、為什麼信賴區間帶在參考點會掐成一個點,以及「整體關聯的 p」與「非線性的 p」為什麼一定要分開報。
- 交互作用與次族群分析進階
含交互作用的模型裡四個係數各代表什麼、為什麼 exp(交互作用項) 是「比值的比值」、怎麼從一個模型算回各層別的估計,以及次族群 forest plot 上最容易犯的那個錯:把顯著性的差異讀成差異的顯著性。
- 群集與重複測量資料進階
同一個人量四次、同一家醫院收一百個病人——這些列彼此不獨立。把它們當成獨立列會怎樣:組間效果的標準誤太小、組內效果的標準誤太大,方向相反。混合模型、GEE 與 cluster-robust 標準誤各自回答的是不同的問題。
- 邊際估計與 G-computation進階
模型給的是條件 OR,但 NNT、風險差這些能在族群層次解讀的量要另外算。這一頁教標準化(G-computation)怎麼做、為什麼條件 OR 與邊際 OR 本來就不相等(non-collapsibility),以及信賴區間為什麼要用 bootstrap。
- 校正後的相對風險:log-binomial 與 modified Poisson進階
結果不罕見時 OR 會誇大效果,但想直接估校正後的 RR,log-binomial 常常跑不動。這一頁按照真實會發生的順序走一次:收斂、失敗、給起始值、換 modified Poisson,並說明穩健標準誤在這裡修的到底是什麼。
- 條件式邏輯迴歸進階
配對之後為什麼不能用一般邏輯迴歸、strata() 到底在條件掉什麼、把配對變項放回模型會發生什麼事(答案是靜默地什麼都不發生),以及 1:1 配對時它與 McNemar 檢定的四個數值關係。
- 連續變項要不要切成分組進階
切成四分位會損失多少檢定力、為什麼有時候切完反而更顯著(那不是好消息)、「最佳切點」搜出來的效果量為什麼一定偏大、P for trend 把 1/2/3/4 當數值時假設了什麼,以及有些變項根本切不出四分位。
- ANCOVA、變化量與只看追蹤值進階
同一份前後測資料的三種分析方式,為什麼隨機化試驗慣用 ANCOVA(線索在基線係數上)、效率的差距隨前後測相關係數怎麼變,以及迴歸到平均長什麼樣子、為什麼只在對照組看得乾淨。
- 順序型邏輯迴歸與 shift plot進階
結果是分級而不是有無時(mRS、NYHA、CTCAE、疼痛分數),二分法會丟掉一半的訊息。common odds ratio 是什麼、proportional odds 是一個假設而不是結果、怎麼檢查它、以及格子人數太少時估計會怎麼壞掉。
存活分析
- Censoring 與存活資料的結構基礎
為什麼「還沒發生事件」不是遺漏值、右/左/區間設限各自長什麼樣、風險集合怎麼隨時間縮小、非資訊性設限這個假設撐著整套方法,以及 immortal time bias 是怎麼把一個未偵測到效果的治療變成救命神藥。
- Kaplan-Meier 曲線與 log-rank 檢定進階
為什麼存活分析不能直接算平均存活時間、KM 曲線的每一階在算什麼、log-rank 回答與不回答哪些問題,以及那條中位數線該怎麼讀。
- Cox 比例風險模型進階
HR 到底是什麼比值(不是存活時間比、也不是勝算比)、baseline hazard 不用指定為什麼還算得出係數、多變項校正實際上在做什麼、ties 怎麼處理,以及信賴區間跨過 1 的時候該怎麼寫。
- 比例風險假設與 Schoenfeld residuals進階
比例風險假設實際上在假設什麼、cox.zph 的那張表怎麼讀、Schoenfeld 殘差圖與 log-log plot 各自看什麼,以及假設被違反之後分層 Cox、時間分段、時間相依係數三條路各自付出什麼代價。
- 競爭風險:CIF 與 Fine-Gray專家
為什麼 1 − KM 在有競爭事件時一定高估、累積發生函數(CIF)算的是什麼、cause-specific hazard 與 subdistribution hazard 回答的是兩個不同的問題,以及在 MGUS 資料裡年齡的兩個 HR 為什麼會指向相反方向。
- 時間相依共變項專家
暴露會變動時,Cox 模型要吃的是 (start, stop] 長表而不是一人一列;tmerge() 怎麼把它建起來、重複事件的 Andersen-Gill 模型為什麼一定要換成穩健變異數、重複測量的檢驗值該用基線值還是當下值、landmark 分析什麼時候是更好的選擇,以及為什麼一個時間相依的 HR 不能拿來做預測。
- 限制平均存活時間(RMST)進階
RMST 是 Kaplan-Meier 曲線在 0 到 τ 之間的面積——「在前 τ 這段期間,平均活了多久」。這一頁講那塊面積怎麼看、τ 為什麼必須事先指定、換一個 τ 結論會變多少、差值與比值為什麼要一起報,以及怎麼把它講成一句對病人說得出口的話。
- 左截切與延遲進入進階
有人不是從第 0 天開始被觀察的。左截切與左設限差在哪、Surv(entry, exit, event) 這個兩端時間的寫法、不寫會把存活率往哪個方向偏多少,以及為什麼偏誤全部落在延遲進入的那一群人身上。
- 加權 log-rank、max-combo 與 milestone 存活率專家
曲線交叉或延遲效果時,log-rank 把每個事件時間等權加總,前後兩段的訊號會互相抵消。這一頁講 Fleming-Harrington 的權重長什麼形狀、免疫治療為什麼需要偏重晚期的權重、max-combo 把「我挑過三個」算進去要付多少代價,以及 milestone 存活率差的兩種信賴區間為什麼差那麼多。真實資料裡看不到「換個檢定就翻盤」,這件事本身也寫在頁面上。
診斷準確度
- 2×2 表、敏感度與特異度基礎
四個格子與四個邊際各自回答什麼問題、為什麼敏感度與特異度是檢驗的性質而不是族群的性質、SpPIN / SnNOUT 這組助記在什麼時候會騙人,以及診斷研究最常見的偏誤——只有檢驗陽性的人去做 gold standard 時,敏感度與特異度會同時往相反方向跑。
- 預測值與盛行率進階
PPV 與 NPV 是病人真正在問的問題,但它們不是檢驗的性質——同一個檢驗在不同盛行率下的 PPV 可以差兩個數量級。這一頁把 Bayes 的算式攤開、用人數講一次、示範為什麼罕見病篩檢的陽性多半是偽陽性,並且處理一個課本很少講的但書:敏感度與特異度的「不隨盛行率變」是關於算式的,不是關於世界的。
- 概似比與 Fagan nomogram進階
LR 把一個檢驗結果變成「檢驗前勝算要乘上多少」,因此它不隨盛行率改變,卻又能直接算出這位病人的檢驗後機率。這一頁講 LR+ 與 LR− 怎麼來、Fagan nomogram 怎麼看、為什麼多階層 LR 比二分好用——以及在這份資料上,最低兩段的 LR 分不開,這份資料不足以分辨它們是否不同。
- ROC 曲線與 AUC進階
ROC 是所有切點的軌跡,AUC 有一個乾淨的機率解釋(隨機取一位有病與一位沒病者,前者分數較高的機率)——這一頁把那個解釋用配對數數驗證一次。也講 AUC 看不見的兩件事:它完全不衡量校準,而且它照定義就不受盛行率影響,所以在極不平衡的資料上它不會惡化,會惡化的是 precision-recall。
- 切點選擇與兩條 ROC 的比較專家
Youden index 挑出來的「最佳切點」隱含一個幾乎不成立的假設——一個百分點的敏感度與一個百分點的特異度等價,而這等於把隱含的門檻機率釘在挑切點那個世代的盛行率上;而且它是在同一份資料上挑的,因此樂觀。這一頁用 bootstrap 把樂觀量出來、把代價比拉高看切點怎麼崩掉,接著用配對 DeLong 檢定比較兩個標記,並示範一個常見的誤解:配對不一定比較有力;最後把比較限縮到高特異度那一段(部分 AUC),在同一批病人身上得到與整條曲線不同的結論。
預測模型
- 變數選擇進階
預測模型挑變數的目標與病因學研究完全不同——不看因果、只看有沒有幫助預測。這一頁把三種常見策略跑在同一份乳癌世代上,這份資料分不出它們的外部表現差別(三個點估計只差在小數點第三位,本頁未估計不確定性),真正的差別在別的地方:同一個演算法在同一群人的重抽樣上,會給你幾十個不同的「最終模型」。最後一節談怎麼讀機器學習預測模型的論文——variable importance 與 SHAP 各自說了什麼、沒說什麼,以及為什麼驗收標準一格都沒有改變。
- 收縮與懲罰迴歸專家
樣本不夠時,最大概似估出來的係數會太極端——模型把這一批人身上的雜訊當成訊號學了進去。這一頁把同一個模型在七種開發樣本量下各配兩百次,量出過度配適有多大,並示範 Van Houwelingen 的一致收縮因子幾乎可以事先算出「校準斜率會掉到多少」。也講 ridge、lasso、elastic net 的差別,以及為什麼懲罰過的係數不能再當效應量讀。
- EPV 與 Riley 樣本數專家
「每個變項至少十個事件」是 1990 年代模擬得到的粗略經驗法則,現在已經被 Riley 等人的樣本數計算取代。這一頁在同一份乳癌世代上把兩種規則各算一次,再把模型真的在那兩個樣本量下各配三百次——EPV 十的樣本量交出來的校準斜率遠低於 1,絕對預測誤差是 Riley 版本的近兩倍。樣本數不足的後果是過度配適,不是檢定力不足。
- 內部驗證與樂觀偏誤進階
在配模型的同一批資料上量出來的表現一定偏好,這個差距叫樂觀偏誤。這一頁從一份大世代裡切出兩百人當開發資料,把四種內部驗證方法都跑一遍,再拿剩下的兩千多人當真值對答案。最後示範這個家族最貴的一個錯誤:先在全部資料上選變數、再交叉驗證後面的配適。
- 外部驗證進階
內部驗證只能處理樂觀偏誤,處理不了「換一群人」。這一頁把同一個乳癌模型放進三種驗證設計——隨機切一半、依手術年份切、以及真正的外部世代——前兩種的校準斜率都落在 1 附近,只有真正的外部世代把它拉到 0.69。也講驗證研究自己的樣本數:事件數少於一百時,校準斜率的信賴區間寬到沒有辦法下結論。
- 校準進階
校準問的是「模型說 30% 的那群人,是不是真的有三成出事」。它比鑑別力更難修、更常被略過,而且只要臨床決策綁在一個絕對機率門檻上,它就比鑑別力更重要。這一頁用一個真實的外部驗證把校準的四個層次逐一量出來,畫出彈性校準曲線,再把三個層次的重新校準各做一次——並且在另一半病人身上檢查它們是不是真的有效。
- 決策曲線分析專家
決策曲線問的不是模型準不準,而是「照這個模型做決定,比全部治療或都不治療好嗎」。它把偽陽性與偽陰性的相對代價編碼進一個門檻機率,再算出淨效益。這一頁在真實的外部驗證上做出那個常被提起卻很少被示範的對照——鑑別力較高的模型,在臨床上會用到的門檻附近,淨效益反而較低。
- 隨時間變動的區辨力專家
Harrell's C 把所有時點的區辨力壓成一個數字,而臨床決策發生在特定時點——你要跟病人講的是「五年」的風險。這一頁把同一個乳癌 Cox 模型的區辨力攤成一條隨時間變動的曲線:怎麼在時點 t 把存活資料切成 case 與 control、設限的人為什麼需要反機率設限加權、AUC(t) 為什麼系統性高於 Harrell's C,以及這條曲線平坦時該怎麼讀——平坦本身就是結論,因為你事前不知道它平不平。
- nomogram(列線圖)進階
nomogram 是華人臨床論文的招牌圖,也是最常被誤讀成「一種模型」的東西。它不是模型,它是把已經配好的模型的線性預測值換算成分數、再畫成一把尺——沒有多出任何資訊。這一頁用同一位病人的兩種算法、整個開發世代的仿射恆等式,證明它真的只是一把尺,然後把該問的問題交還給內部驗證、外部驗證與校準。
- Brier score、NRI 與 IDI進階
這三個分數都是拿來回答「新模型比舊模型好嗎」。Brier score 把鑑別力與校準混在一個數字裡,單看沒有尺度,而且有設限的存活資料直接算會算錯。NRI 把改善程度壓成一個加總的比例,代價是它的正負號取決於你挑哪一組切點。這一頁在同一對模型、同一批病人上把三個分數與決策曲線一起算出來,讓它們自己互相打架。
因果推論
- 干擾、DAG 與該校正什麼進階
干擾因子的三個條件、把因果假設畫成 DAG 之後「該放什麼進模型」變成一個可以檢查的問題、以及為什麼校正對撞因子會憑空製造出關聯——包括那個發生在暴露之前、看起來完全無害的變項。
- 傾向分數配對進階
傾向分數把十幾個共變項壓成一個數字之後,配對到底在做什麼、caliper 擋掉的是哪些人、為什麼平衡要看 SMD 不看 p 值、配對後你估的已經不是原本那個母體,以及配對之後的變異數該怎麼算。
- 逆機率加權專家
加權如何用同一個傾向分數造出一個假想的母體、ATE/ATT/ATO 各自回答哪一個臨床問題、極端權重從哪裡來以及截尾與穩定化各自付出什麼代價,還有為什麼加權保留了所有人卻對模型設定更敏感。
- 工具變數專家
當關鍵的干擾因子根本沒被測量時唯一還有機會的方法、它的三個假設裡有兩個永遠無法用資料驗證、弱工具變數的偏誤會把你拉回原本那個有偏誤的估計,以及孟德爾隨機化為什麼是醫學上最常見的工具變數。
- 自我對照設計專家
讓每個人當自己的對照,一次消掉所有不隨時間變的個人特徵——包括你沒測量、也不知道存在的那些。SCCS 與 case-crossover 的差別、三個假設各自在什麼時候破掉,以及為什麼「事件會不會影響後續暴露」是這個設計最致命的問題。
- 目標試驗模擬專家
先把「如果可以做,我會做哪一個隨機試驗」的七個要素寫下來,再逐項對照觀察性資料能不能做到——這個紀律專門對付 immortal time bias、prevalent user bias 與沒有主動對照這三個最常見的設計錯誤,它們光靠統計校正都修不好;至於未測量的干擾,它修不了。
- E-value 與未測量干擾的敏感度分析進階
E-value 回答一個很窄的問題:一個沒被測量到的干擾因子,要同時跟暴露與結果關聯到多強,才足以把觀察到的關聯完全解釋掉。這一頁講它的公式與等高線幾何、為什麼點估計與信賴區間要各報一個、HR 與 OR 為什麼一定要先換成 RR,以及一個大的 E-value 為什麼不等於「沒有未測量干擾」。
- 邊際結構模型與時間相依 IPTW專家
病人會中途開始用藥、停藥、換藥,而決定他換不換的那個指標,本身又是前一次治療造成的。這種變項放進迴歸會同時造成過度校正與碰撞子偏誤,不放進去則干擾沒處理——兩個都錯。加權是第三條路:這一頁用一份真值已知的模擬,把三條路的估計並排放,並示範穩定化權重怎麼配、變異數為什麼不能直接讀、IPCW 怎麼跟 IPTW 相乘。
- 因果中介分析進階
把中介變項丟進迴歸不等於做了中介分析。這一頁講自然直接效果(NDE)與自然間接效果(NIE)怎麼定義、為什麼相加剛好等於總效果、Baron-Kenny 逐步法在哪兩個地方不夠用、proportion mediated 的分母為什麼常常撐不住,以及隨機化排除掉了哪一個干擾、又完全沒有處理哪一個。
- 中斷時間序列與差異中的差異(ITS 與 DiD)進階
某個政策在某個月上路,之後指標變了——那有多少該記在政策頭上?這一頁用同一份資料把兩種答法並排:ITS 把介入前的趨勢延伸出去當反事實,DiD 向一條政策打不到的對照序列借反事實。也講階躍與斜率的分別、季節性沒先扣掉會誤判成什麼樣、平行趨勢的事前檢查為什麼只能否定不能證明,以及一批真值已知為零的負對照怎麼把殘餘偏誤量出來。
綜合分析
- 效果量與變異數進階
統合分析真正合併的東西是「效果量與它的變異數」這一對數字。哪些效果量可以合併、為什麼比值型一定要在 log 尺度上做、變異數怎麼來又怎麼變成權重、零格該怎麼處理,以及換一個效果量為什麼會讓同一批研究看起來異質性完全不同。
- 固定效應與隨機效應進階
兩個模型的差別不是保守程度而是假設:一個問「這批研究的共同效應是多少」,另一個問「效應分布的平均在哪」。權重怎麼被改寫、τ² 有哪幾種估法、DerSimonian-Laird 在研究數少時錯在哪,以及 Knapp-Hartung 校正修的到底是什麼。
- 異質性:I²、τ² 與預測區間專家
I² 為什麼會在真實效果差異完全沒變的情況下從五成跳到九成九、Q 檢定不顯著到底能不能當作同質的證據、預測區間為什麼比信賴區間更貼近讀者真正想問的事,以及用 meta-regression 解釋異質性時那個「研究層級的關聯不能推到個人身上」的陷阱。
- Forest plot 與 funnel plot進階
森林圖的每一個視覺元素各自編碼了什麼、I² 高到底代表什麼(以及不代表什麼)、漏斗圖的不對稱除了發表偏誤還有哪些解釋、三種不對稱檢定分別適用在哪種資料上,以及 contour-enhanced funnel 與 trim-and-fill 能告訴你什麼、不能告訴你什麼。
- 網絡統合分析:間接比較與治療排名進階
網絡統合分析怎麼把一個從來沒有人做過的頭對頭比較估出來、league table 裡哪一格其實沒有任何試驗撐著、netmeta 預設印出的那個不一致檢定為什麼跟你配的模型不是同一個,以及排名為什麼一定要跟效果量並排看。
- 累積統合分析與資訊量進階
把研究依年份排序、每加入一篇就重算一次合併值,這件事同時做了兩件事:它讓人看見「答案其實哪一年就已經在那裡了」,也讓同一個問題在時間軸上被檢定了幾十次。本頁用 Lau 等人那份靜脈 streptokinase 的正典資料,量出合併估計在哪一步停止改變、其後又收了多少人,示範顯著性怎麼出現又消失又回來,並說明 required information size 那條線為什麼是四個假設而不是一個事實。
- 敏感度與影響分析進階
leave-one-out、逐研究的影響診斷量(Cook's D、DFBETAS、hat)與 Baujat plot 各自回答什麼;為什麼「有一篇研究影響很大」要求的是解釋而不是刪除;以及為什麼正式門檻一篇都沒標記的同一份資料上,仍然有一篇試驗把合併估計推動了將近一成。
- 診斷準確度的統合分析進階
一篇診斷研究交出來的不是一個數字而是一對,而且兩者被同一個切點綁在一起。這一頁用 AUDIT-C 酒精篩檢的實測資料把常見的口號拆開:分開合併之後合併點幾乎沒有移動,真正壞掉的是聯合陳述——兩個獨立區間交叉出來的矩形面積更大、覆蓋率反而更低,而且形狀正好包含了資料說不可能的那個角落。另外談信賴橢圓與預測橢圓的差別,以及 SROC 曲線從哪裡開始是外插。
橫向議題
- 缺失值與多重插補進階
完整個案分析不是中性的預設,它是一個有假設的選擇——本章用一份天然有缺失的資料證明被排除的人與留下的人確實不同,並把多重插補拆開來寫,讓你看到它其實是「迴歸加雜訊」加上兩行算術。
- 樣本數與檢定力進階
樣本數計算的每個輸入各自把答案推向哪裡、為什麼罕見結果需要大到不合理的樣本,以及一個用大量模擬證明的事:事後檢定力與 p 值是完全確定的關係,算它等於把 p 值換個尺度再講一次。
- 選擇偏誤進階
選擇偏誤不是「樣本不夠有代表性」這麼含糊的一句話,而是一條可以寫下來的規則:誰進到分析裡。本頁用同一個世代跑四種不同的失訪規則(外加一列全員基準),證明其中兩種完全不傷估計值、一種只傷相對風險不傷勝算比、一種把兩者都毀掉——以及為什麼校正共變項救不回來。
- 測量誤差與錯分進階
「非差別性錯分會讓估計值偏向虛無」是被教得最廣、也最常被過度延伸的一條規則。本頁用模擬證明它在二分暴露上成立、在三分類暴露上可以反過來,並把連續變項的迴歸稀釋、結果的錯分、以及干擾因子測不準造成的殘餘干擾一起攤開。
- 多重比較與次族群分析進階
多重比較不是「p 值要打折」這種技術細節,而是一個關於承諾的問題:0.05 保證的是單一次檢定的錯誤率,看二十個就不再保證任何事。本頁用模擬把型一錯誤的膨脹、三種調整法的實際表現,以及一張切得夠細的次族群森林圖為什麼幾乎一定會給你一個「陽性」的分組,全部量出來。
- 非劣性與等效性進階
「未達統計顯著」不能反過來讀成「兩者相當」。要主張相當,得先在看到資料之前寫下一個你願意讓步的最大幅度——margin——再看信賴區間的上界落在它的哪一側。本頁把同一份 RCT 資料放在四道不同的 margin 前面,讓判定從「劣於」一路翻到「非劣」,並指出翻轉點就坐在信賴區間的上界上。
- 敏感度分析進階
「請補做敏感度分析」是審稿意見裡出現頻率最高的一句,而它要求的東西比多數人以為的具體。本頁用同一份資料跑十六個各自都站得住的分析設定,讓估計值的散布變成看得到的東西,並用打散暴露的置換模擬量出「看到結果之後才挑一個報」要付多少代價。
一致性與再現性
- 一致性與 kappa進階
兩個人各判一次、然後報一個 kappa,常常是醫學生的第一個研究。這一頁講 kappa 為什麼要把「亂猜也會猜對」的那一份先扣掉、weighted kappa 在序位量表上算什麼而在名目類別上為什麼反而把數字壓低、三位以上判讀者要改用 Fleiss kappa、以及一致率一模一樣而 kappa 差三倍以上的那個著名悖論。
- 組內相關係數與信度進階
ICC 不是一個係數,是六個。同一份資料上六種合法型式可以差到兩倍半,所以論文只寫「ICC = 0.85」是一個沒辦法解讀的數字。這一頁先解掉它與集群資料那一頁的命名衝突(同一條變異拆解、不同的問題),再拆開模型/型別/單位三個軸各自在分母裡動了什麼,最後說明為什麼一個接近 1 的 ICC 完全不保證量得準。
- Bland-Altman 分析與一致性界限進階
兩個測量方法「高度相關」是一句幾乎不含資訊的話。這一頁用 Bland 與 Altman 自己那份血壓資料,先讓相關係數把你說服,再用同一批人的差值圖把界限有多寬攤開來;接著講重複測量該怎麼算(垮掉的是精確度,不是界限)、比例性偏誤怎麼檢查,以及一個 mmHg 尺度的界限該怎麼翻譯成臨床決策。